{"as_of":"2026-08-19T20:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4d14f6be97b368e12c354be6b509c99d0c9d3f75efb9adbab6a6b58d7b3f940a","coverage":[{"denominator":71,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":71,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:52:56.483685Z","state":"measured"},{"denominator":71,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":71,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.11804/citation-record","integrity":"/paper/2505.11804/integrity","json":"/paper/2505.11804/citation-record.json","paper":"/paper/2505.11804"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:56.229719Z","title":"Deep ensembles work, but are they necessary? Advances in Neural Information Processing Systems, 35: 0 33646--33660, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-18T02:15:47.530924Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.229719Z"},"links":{"citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:7ab740adb91d44666f7a2fbcd994c0b531e9240b8701b597e640b0d1b286deca","observation_id":"18507cf6-fa64-42c8-a597-7579c6eb2054","resolution":{"observed_at":"2026-08-15T20:52:56.229719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-15T20:52:56.234433Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-18T02:15:47.530924Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.234433Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:9c820c5d1d9c00b7f7bfaf5cdb3e48532f8505ef052e7bfd7296a3af4933806b","observation_id":"cedbbd0d-2ac8-4b79-84b4-cfd16e41c138","resolution":{"observed_at":"2026-08-15T20:52:56.234433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:57.234688Z","title":"Bayesian filtering unifies adaptive and non-adaptive neural network optimization methods","venue":null,"work_id":"9e7f9372-adf6-44a9-a480-966acd813eab","year":2020},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-18T02:15:47.530924Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.239078Z"},"links":{"citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:ea698eb9fd0d174fa5103d6e3b168c14451f7f30749d0bdd3d86b9ef90fe9275","observation_id":"32883431-9e4a-4109-8670-305fe033f781","resolution":{"observed_at":"2026-08-15T20:52:57.238707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2008.05912","last_updated":"2021-04-27T14:33:30Z","snapshot_observed_at":"2026-08-17T14:52:26.664810Z","submitted_at":"2020-08-13T13:46:58Z","title":"A statistical theory of cold posteriors in deep neural networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2008.05912","snapshot_observed_at":"2026-08-15T20:52:56.242887Z","title":"A statistical theory of cold posteriors in deep neural networks","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-18T02:15:47.530924Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.242887Z"},"links":{"cited_paper":"/paper/2008.05912","citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:198777df3366a2662fee22d33fe48156f270deae79deaf95542eb36210322f0a","observation_id":"98763080-81ab-4a34-9f7e-ed17ac2864b2","resolution":{"observed_at":"2026-08-15T20:52:56.242887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-15T20:52:56.247081Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-18T02:15:47.530924Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.247081Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:0532e9d9a55ca253d4c7095f0710ef4e2a88fb6847100d19182bdbd7d8efda37","observation_id":"3665f6b7-1bdd-461a-aa8e-a208f0dd2ce1","resolution":{"observed_at":"2026-08-15T20:52:56.247081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:56.251212Z","title":"Weight uncertainty in neural network","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-18T02:15:47.530924Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.251212Z"},"links":{"citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:2fcbf334b3204e463b2bd9070ade813c35bc5afb34a0476ad3a32fe389320340","observation_id":"4e551cba-c77d-4954-a260-a34f4b1a7644","resolution":{"observed_at":"2026-08-15T20:52:56.251212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1604.07316","last_updated":"2016-04-25T16:03:56Z","snapshot_observed_at":"2026-07-06T04:53:59.754200Z","submitted_at":"2016-04-25T16:03:56Z","title":"End to End Learning for Self-Driving Cars","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1604.07316","snapshot_observed_at":"2026-08-15T20:52:56.255381Z","title":"End to end learning for self-driving cars","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-18T02:15:47.530924Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.255381Z"},"links":{"cited_paper":"/paper/1604.07316","citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:0d8f178f467894e4e7f50e494690e2249152ec2e90cc3c6e607d50c95cc840c7","observation_id":"8409f062-12a1-4cc5-8278-7773e2b6b34d","resolution":{"observed_at":"2026-08-15T20:52:56.255381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:56.259545Z","title":"Emerging properties in self-supervised vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-18T02:15:47.530924Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.259545Z"},"links":{"citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:9056ac141ed0cc8a7c1f4930bfbb4630418ff4316b41b126219f15127e8d4c68","observation_id":"8feb991c-09b1-48d0-b355-4af6de7efb2a","resolution":{"observed_at":"2026-08-15T20:52:56.259545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17767","last_updated":"2024-11-26T07:14:30Z","snapshot_observed_at":"2026-08-13T12:54:03.808817Z","submitted_at":"2024-11-26T07:14:30Z","title":"Exploring Aleatoric Uncertainty in Object Detection via Vision Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17767","snapshot_observed_at":"2026-08-15T20:52:56.262993Z","title":"Exploring aleatoric uncertainty in object detection via vision foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-18T02:15:47.530924Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.262993Z"},"links":{"cited_paper":"/paper/2411.17767","citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:b04ebf2aa554122aada1445b5121167c1d63577b38aebd93abc5e8edd9b01860","observation_id":"78f2582b-d383-4c68-959b-63e97d64830b","resolution":{"observed_at":"2026-08-15T20:52:56.262993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:57.208600Z","title":"Repulsive deep ensembles are bayesian","venue":null,"work_id":"018427d2-0410-4f51-92f2-f9872ba5bf3d","year":2021},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-18T02:15:47.530924Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.266743Z"},"links":{"citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:8201b40d8a8349a6a09234ef3715aeb8d783224e588aeca54cecf551c31134bd","observation_id":"e01ef100-8d25-426e-ae77-e926fad91b7c","resolution":{"observed_at":"2026-08-15T20:52:57.212823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:57.196969Z","title":"Laplace redux-effortless bayesian deep learning","venue":null,"work_id":"b170bd6e-3b02-4060-a50d-841c2ebfb9c1","year":2021},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-18T02:15:47.530924Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.269986Z"},"links":{"citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:882803e4e2392e6f20095354c8dac47de09047a38e1f890362f6b9e9312c5e7d","observation_id":"45319218-ed43-48cb-96f7-c68c341533fc","resolution":{"observed_at":"2026-08-15T20:52:57.201140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:57.185199Z","title":"Bayesian deep learning via subnetwork inference","venue":null,"work_id":"664b3660-24df-4bf2-90e6-55797824f04b","year":2021},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-18T02:15:47.530924Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.273286Z"},"links":{"citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:4dd8e12b1936ad2cdae8c103b6b2d13d4700004e7e9f93d526b1d1070d4909d5","observation_id":"411fca6d-3fe0-4435-ab31-eca4fc948e88","resolution":{"observed_at":"2026-08-15T20:52:57.189262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:56.276687Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-18T02:15:47.530924Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.276687Z"},"links":{"citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:6b017294813559e32491da5c2781d061694ca5e240de37851d75f2f4b12ec7b6","observation_id":"fccc8526-d3e9-481a-beb7-2668b5773282","resolution":{"observed_at":"2026-08-15T20:52:56.276687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-15T20:52:56.279994Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-18T02:15:47.530924Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.279994Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:ffa2d8c9fbe9e4486023802da8b13305808665f0781042cb3111c55a394bd8d1","observation_id":"629dfc1f-76f0-48e6-9b42-db05de895cda","resolution":{"observed_at":"2026-08-15T20:52:56.279994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:56.283511Z","title":"Dermatologist-level classification of skin cancer with deep neural networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-18T02:15:47.530924Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.283511Z"},"links":{"citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:5b1ea074e92843a428176e42b537909ea4b038dc93c1b21755be6b0fdbbf7d08","observation_id":"3f709518-3900-4897-b9ed-7eca76a2634a","resolution":{"observed_at":"2026-08-15T20:52:56.283511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:56.286925Z","title":"Are foundation models for computer vision good conformal predictors? arXiv preprint arXiv:2412.06082, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-18T02:15:47.530924Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.286925Z"},"links":{"citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:d0e8d05a9e13c53895b51f6bff7b7a269280143bf0b0f55737817da690e265e8","observation_id":"c1927d40-b4e1-422e-98f9-9b129b8f645c","resolution":{"observed_at":"2026-08-15T20:52:56.286925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:57.160492Z","title":"Exploring the limits of out-of-distribution detection","venue":null,"work_id":"1b7bca2e-1776-429c-8951-2512e4905f3f","year":2021},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-18T02:15:47.530924Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.290336Z"},"links":{"citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:276658ed68d10fc3785c842e65f57a776b16d2e13221f5c0ecd04fc567d84120","observation_id":"557ddf94-84ee-4f41-bfe9-806916e29bf8","resolution":{"observed_at":"2026-08-15T20:52:57.164607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:56.294819Z","title":"Dropout as a bayesian approximation: Representing model uncertainty in deep learning","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-18T02:15:47.530924Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.294819Z"},"links":{"citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:6f44dfc33b4658662f5c3ba00e934589bf558a8e9c9f713123636f8ee6b016f7","observation_id":"30f8e77d-a566-4c11-b11a-079543059270","resolution":{"observed_at":"2026-08-15T20:52:56.294819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.15010","last_updated":"2023-04-28T17:59:25Z","snapshot_observed_at":"2026-08-12T23:40:42.885633Z","submitted_at":"2023-04-28T17:59:25Z","title":"LLaMA-Adapter V2: Parameter-Efficient Visual Instruction Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.15010","snapshot_observed_at":"2026-08-15T20:52:56.298080Z","title":"Llama-adapter v2: Parameter-efficient visual instruction model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-18T02:15:47.530924Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.298080Z"},"links":{"cited_paper":"/paper/2304.15010","citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:c5717be2cdba873221d287806261007b0fe3b10a595a60ceb0f7f6bd8c375d4f","observation_id":"28045dd5-60ff-452b-acb1-53e65f699353","resolution":{"observed_at":"2026-08-15T20:52:56.298080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:56.301730Z","title":"Recent advances in open set recognition: A survey","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-18T02:15:47.530924Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.301730Z"},"links":{"citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:8bd2aae88be6bcf3e98d4e5bd3d403508521e292991427e2fcc3e3b4a8023a98","observation_id":"06e425f4-f97c-49b2-be17-3320dc783e0f","resolution":{"observed_at":"2026-08-15T20:52:56.301730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:56.305156Z","title":"Practical variational inference for neural networks","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-18T02:15:47.530924Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.305156Z"},"links":{"citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:8d8a2d236313a0434d4ca13bba0778faf2f8eaa456190c20a1adfdaf0f29263b","observation_id":"77463db9-9529-4332-87e1-6327208cc06f","resolution":{"observed_at":"2026-08-15T20:52:56.305156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02917","last_updated":"2024-05-05T12:51:38Z","snapshot_observed_at":"2026-08-16T13:55:18.261813Z","submitted_at":"2024-05-05T12:51:38Z","title":"Overconfidence is Key: Verbalized Uncertainty Evaluation in Large Language and Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.02917","snapshot_observed_at":"2026-08-15T20:52:56.308626Z","title":"Overconfidence is key: Verbalized uncertainty evaluation in large language and vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-18T02:15:47.530924Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.308626Z"},"links":{"cited_paper":"/paper/2405.02917","citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:fc4419b36504791b67a59637c259ea501ce224b0b109d45270edcc81807e2198","observation_id":"ecebaa37-a3f8-4971-bca7-bd7d50311e38","resolution":{"observed_at":"2026-08-15T20:52:56.308626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:56.312300Z","title":"On calibration of modern neural networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-18T02:15:47.530924Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.312300Z"},"links":{"citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:ed4dc672f1c5ea8b0ea9425c93cecc35d5991dc6b778cecc81a1dbf1c96224c4","observation_id":"8c260fc0-5ba0-4c6b-b2cb-722b80e325ff","resolution":{"observed_at":"2026-08-15T20:52:56.312300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1903.12261","last_updated":"2019-03-28T20:56:37Z","snapshot_observed_at":"2026-08-15T10:34:34.836991Z","submitted_at":"2019-03-28T20:56:37Z","title":"Benchmarking Neural Network Robustness to Common Corruptions and Perturbations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1903.12261","snapshot_observed_at":"2026-08-15T20:52:56.315627Z","title":"Benchmarking neural network robustness to common corruptions and perturbations","venue":null,"work_id":null,"year":1903},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-18T02:15:47.530924Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.315627Z"},"links":{"cited_paper":"/paper/1903.12261","citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:33f72e209b604c4696c606e0442dd8a33d2a475b108c4d2776bdd300e142cec1","observation_id":"827259ee-4198-4a68-a763-cf95f3ac30a3","resolution":{"observed_at":"2026-08-15T20:52:56.315627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.04606","last_updated":"2019-01-28T20:34:44Z","snapshot_observed_at":"2026-08-14T17:45:07.132382Z","submitted_at":"2018-12-11T18:49:50Z","title":"Deep Anomaly Detection with Outlier Exposure","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.04606","snapshot_observed_at":"2026-08-15T20:52:56.319261Z","title":"Deep anomaly detection with outlier exposure","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-18T02:15:47.530924Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.319261Z"},"links":{"cited_paper":"/paper/1812.04606","citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:20387d6edd3a3fa497168c2bc186677c39aa983fee42cfb5db19eaa90e411a7e","observation_id":"64b2fd75-84f9-47b9-92a8-4e014ec93b1b","resolution":{"observed_at":"2026-08-15T20:52:56.319261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:57.122455Z","title":"Pixmix: Dreamlike pictures comprehensively improve safety measures","venue":null,"work_id":"fbf4ada2-386e-42db-844a-128ff5d28eaf","year":2022},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-18T02:15:47.530924Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.323015Z"},"links":{"citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:2ed4eff2252c818cf45101fa1788e83df264c3bb626cc9a0a74f20ea7d35eede","observation_id":"4541490e-54f2-4f67-8179-68b7b8483ade","resolution":{"observed_at":"2026-08-15T20:52:57.126248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:57.111093Z","title":"Meta-learning in neural networks: A survey","venue":null,"work_id":"578ac6b6-7b44-4cec-b198-74274527564a","year":2021},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-18T02:15:47.530924Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.326160Z"},"links":{"citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:a8e3d1ad975a19c5a15bb03ad6060bf0275a544f44ab90b202ff91b98bca1f44","observation_id":"43d52c2e-947e-40d5-9223-314aa240c5a1","resolution":{"observed_at":"2026-08-15T20:52:57.115187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:56.329122Z","title":"Improving predictions of bayesian neural nets via local linearization","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-18T02:15:47.530924Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.329122Z"},"links":{"citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:6439f70968ca8923b7cd2b0549a282f2a8b0e9fb1532bd39535e0d70dbf4b193","observation_id":"4bf11f3f-0d07-4702-a06a-c4ad82f518fa","resolution":{"observed_at":"2026-08-15T20:52:56.329122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:57.093307Z","title":"What are bayesian neural network posteriors really like? In International Conference on Machine Learning, pp.\\ 4629--4640","venue":null,"work_id":"dc8f368b-1647-4a6f-985a-ae4afb489b14","year":2021},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-18T02:15:47.530924Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.331972Z"},"links":{"citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:7c970da549a95c07d508c0018ccbdb498cc9f532fc137833e1b71d235edd3321","observation_id":"8a5e09ed-3158-4d02-a245-f9c6f88aea79","resolution":{"observed_at":"2026-08-15T20:52:57.097682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.05221","last_updated":"2022-11-21T16:38:35Z","snapshot_observed_at":"2026-08-14T05:42:29.067319Z","submitted_at":"2022-07-11T22:59:39Z","title":"Language Models (Mostly) Know What They Know","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.05221","snapshot_observed_at":"2026-08-15T20:52:56.334837Z","title":"Language models (mostly) know what they know","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-18T02:15:47.530924Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.334837Z"},"links":{"cited_paper":"/paper/2207.05221","citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:03b95b69d1405e18031d4109a0ea037dacaaaea963a77bf588e3d8c3338170ac","observation_id":"fa6ed01a-38c0-4f5d-ac60-22e4ae6cdb59","resolution":{"observed_at":"2026-08-15T20:52:56.334837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:56.338012Z","title":"What uncertainties do we need in bayesian deep learning for computer vision? Advances in neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-18T02:15:47.530924Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.338012Z"},"links":{"citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:ded6c7c002ebbda5e2f26378b1b6001052ce475ff2b88080d1aebeae907e8ae7","observation_id":"bb66e643-7335-42c1-858d-508216ba2e2a","resolution":{"observed_at":"2026-08-15T20:52:56.338012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14418","last_updated":"2024-02-24T12:30:40Z","snapshot_observed_at":"2026-08-16T14:16:18.299665Z","submitted_at":"2024-02-22T10:04:17Z","title":"Uncertainty-Aware Evaluation for Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14418","snapshot_observed_at":"2026-08-15T20:52:56.340889Z","title":"Uncertainty-aware evaluation for vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-18T02:15:47.530924Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.340889Z"},"links":{"cited_paper":"/paper/2402.14418","citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:bbb17c37fbb1ef54fb34fa31150e7a26238424a56d798345302c020bfd6f5596","observation_id":"27ccbf3d-b64b-45e7-8e09-36b109e3f375","resolution":{"observed_at":"2026-08-15T20:52:56.340889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.09664","last_updated":"2023-04-15T12:55:45Z","snapshot_observed_at":"2026-07-06T14:53:27.667483Z","submitted_at":"2023-02-19T20:10:07Z","title":"Semantic Uncertainty: Linguistic Invariances for Uncertainty Estimation in Natural Language Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.09664","snapshot_observed_at":"2026-08-15T20:52:56.344271Z","title":"Semantic uncertainty: Linguistic invariances for uncertainty estimation in natural language generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-18T02:15:47.530924Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.344271Z"},"links":{"cited_paper":"/paper/2302.09664","citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:c7e61e7fbec1d63aed4a0726639130dee7bbb1279eb629ed093d97f7aa891054","observation_id":"bb82df96-3222-459a-ae41-c04f3efc172d","resolution":{"observed_at":"2026-08-15T20:52:56.344271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:56.348245Z","title":"Simple and scalable predictive uncertainty estimation using deep ensembles","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-18T02:15:47.530924Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.348245Z"},"links":{"citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:f36728a7298df44e74b4bad42e50c733f995e5a8c63dffc55c389eebc34e16d9","observation_id":"f9def78b-8058-4a24-be03-6944b1341ae0","resolution":{"observed_at":"2026-08-15T20:52:56.348245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:56.351808Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-18T02:15:47.530924Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.351808Z"},"links":{"citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:3ac1cbe9dad776ecaa9e97ba5bdc8208bbdc2d60b58b40366fc337c3b02ffc6b","observation_id":"212c24e0-c073-47df-b911-5f2d0b704a02","resolution":{"observed_at":"2026-08-15T20:52:56.351808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:56.355263Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-18T02:15:47.530924Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.355263Z"},"links":{"citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:e92d02871aff9400828a62a66a7682e9e3cf498a6c9b0f9bcd2659b53c7940f9","observation_id":"bdb8dda3-812d-4f94-bfab-37669e51ff9a","resolution":{"observed_at":"2026-08-15T20:52:56.355263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:56.359327Z","title":"Simple and principled uncertainty estimation with deterministic deep learning via distance awareness","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-18T02:15:47.530924Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.359327Z"},"links":{"citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:62bb634f1e6ec82445d3c1eed7722780685f1662e6a49c802aeb88b773012191","observation_id":"bde9a2b3-1512-4ca5-82ea-414dd6f9a83e","resolution":{"observed_at":"2026-08-15T20:52:56.359327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:56.362797Z","title":"A practical bayesian framework for backpropagation networks","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-18T02:15:47.530924Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.362797Z"},"links":{"citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:c45f79b50e31b4809fd584f8b6a2b6b6681fd2b3f42ba01c81624f75f0655a09","observation_id":"2f348dbc-0965-4061-99a0-78d0c8f19c65","resolution":{"observed_at":"2026-08-15T20:52:56.362797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:57.042366Z","title":"A simple baseline for bayesian uncertainty in deep learning","venue":null,"work_id":"efdd2b8a-7761-4d2e-8951-83f20f8586bb","year":2019},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-18T02:15:47.530924Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.366297Z"},"links":{"citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:87878ffa3bd951d6df003857a99cd85100d3111e88133b4fcf00782777b8d11c","observation_id":"ec79956c-317c-4a5b-af4f-6de4a4be039d","resolution":{"observed_at":"2026-08-15T20:52:57.046294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:57.031186Z","title":"Bayesian exploration of pre-trained models for low-shot image classification","venue":null,"work_id":"6b6967ae-a663-493f-bd3b-53e6b22658e9","year":2024},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-18T02:15:47.530924Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.369691Z"},"links":{"citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:db3f68fe74825d5f5b0be5d62a8088c87665ab582b483969affa6184104de5f8","observation_id":"1df92c4e-f9fb-4b68-a7e8-92ae2bde67d8","resolution":{"observed_at":"2026-08-15T20:52:57.035027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:56.373167Z","title":"Revisiting the calibration of modern neural networks","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-18T02:15:47.530924Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.373167Z"},"links":{"citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:4e08aecffba9bbe04fcb915123167ab48025ad92939072cc0ebd8141639de930","observation_id":"9786d05d-77e2-4617-b395-eb999933a265","resolution":{"observed_at":"2026-08-15T20:52:56.373167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21794","last_updated":"2025-06-18T17:03:35Z","snapshot_observed_at":"2026-08-16T13:29:26.889475Z","submitted_at":"2024-07-31T17:59:58Z","title":"Generalized Out-of-Distribution Detection and Beyond in Vision Language Model Era: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21794","snapshot_observed_at":"2026-08-15T20:52:56.377150Z","title":"Generalized out-of-distribution detection and beyond in vision language model era: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-18T02:15:47.530924Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.377150Z"},"links":{"cited_paper":"/paper/2407.21794","citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:3f2a9b3557e738c8e5c7137cff4326d189d7d59924437cdd63ccac7467afd380","observation_id":"3fbeaae9-1b81-4403-89ab-ef0754462a7c","resolution":{"observed_at":"2026-08-15T20:52:56.377150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20331","last_updated":"2025-06-09T11:51:00Z","snapshot_observed_at":"2026-08-17T11:59:41.494113Z","submitted_at":"2024-03-29T17:59:53Z","title":"Unsolvable Problem Detection: Robust Understanding Evaluation for Large Multimodal Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20331","snapshot_observed_at":"2026-08-15T20:52:56.380700Z","title":"Unsolvable problem detection: Evaluating trustworthiness of vision language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-18T02:15:47.530924Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.380700Z"},"links":{"cited_paper":"/paper/2403.20331","citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:cb6a4f5026640bda2ef2659de29694ab873bc64f3b2be59089dd4a22bf108a5b","observation_id":"a759f1de-357d-4a06-9a52-dc7320867727","resolution":{"observed_at":"2026-08-15T20:52:56.380700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.10963","last_updated":"2021-01-14T21:11:06Z","snapshot_observed_at":"2026-08-19T09:01:42.968993Z","submitted_at":"2020-06-19T05:08:43Z","title":"Evaluating Prediction-Time Batch Normalization for Robustness under Covariate Shift","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.10963","snapshot_observed_at":"2026-08-15T20:52:56.384279Z","title":"Evaluating prediction-time batch normalization for robustness under covariate shift","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-18T02:15:47.530924Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.384279Z"},"links":{"cited_paper":"/paper/2006.10963","citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:66cef8cdf889e2b9b3be07a13f9df0d3f51643a70b9a0ee4ce0b567ab6588438","observation_id":"314fb2a4-52ea-41eb-8316-fe777bd7bbc2","resolution":{"observed_at":"2026-08-15T20:52:56.384279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.09136","last_updated":"2019-02-24T11:57:32Z","snapshot_observed_at":"2026-08-15T00:45:03.614274Z","submitted_at":"2018-10-22T08:32:02Z","title":"Do Deep Generative Models Know What They Don't Know?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.09136","snapshot_observed_at":"2026-08-15T20:52:56.388125Z","title":"Do deep generative models know what they don't know? arXiv preprint arXiv:1810.09136, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-18T02:15:47.530924Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.388125Z"},"links":{"cited_paper":"/paper/1810.09136","citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:c0bf809e10f77490f1db99f05dad21bedec0035fc301a0a26279518b006c176c","observation_id":"01d92e8a-6e00-4b10-8277-bfa395f44dd2","resolution":{"observed_at":"2026-08-15T20:52:56.388125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:57.015075Z","title":"Dropout as a structured shrinkage prior","venue":null,"work_id":"b615945a-a42d-42c2-a60f-6d7efbc1b70c","year":2019},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-18T02:15:47.530924Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.391807Z"},"links":{"citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:d045b8f6c2f1cb3f17f5eb17c4489913008f8a387eeb78bc27fae907aed24d50","observation_id":"97eb6c3d-b7df-4ff2-9e0e-3493f0283521","resolution":{"observed_at":"2026-08-15T20:52:57.018288Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.02994","last_updated":"2019-10-16T13:43:36Z","snapshot_observed_at":"2026-08-17T08:07:17.069241Z","submitted_at":"2019-06-07T10:03:16Z","title":"Detecting Out-of-Distribution Inputs to Deep Generative Models Using Typicality","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.02994","snapshot_observed_at":"2026-08-15T20:52:56.395152Z","title":"Detecting out-of-distribution inputs to deep generative models using typicality","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-18T02:15:47.530924Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.395152Z"},"links":{"cited_paper":"/paper/1906.02994","citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:fd600f9477bd1186f015473635233a78ffc78b7444b92a4b150fc616e99d638a","observation_id":"23661cca-18a7-4897-bd4e-4802c7fb251b","resolution":{"observed_at":"2026-08-15T20:52:56.395152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:56.399665Z","title":"Bayesian learning for neural networks, volume 118","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-18T02:15:47.530924Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.399665Z"},"links":{"citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:46b43b9eb88b46618b619b1403505850af8c17256aaec8e4cd66f4d9fc444b67","observation_id":"081cc503-bcec-4137-bf8d-95c2e4f061a2","resolution":{"observed_at":"2026-08-15T20:52:56.399665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:56.402972Z","title":"Kernel language entropy: Fine-grained uncertainty quantification for llms from semantic similarities","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-18T02:15:47.530924Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.402972Z"},"links":{"citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:edd7c2675b4da966c829ba6525606bd094155eade21eb449cbf315427a5f2cc8","observation_id":"e659dbbd-8eec-4a80-87c0-6a6881a294ce","resolution":{"observed_at":"2026-08-15T20:52:56.402972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:56.992007Z","title":"Measuring calibration in deep learning","venue":null,"work_id":"438e7d7d-0d48-4e9c-84bf-0c416b6e096e","year":2019},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-18T02:15:47.530924Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.406558Z"},"links":{"citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:d68412fa3c4ab5a0ebbd5a59db534203169ef5a7badd6c7bcf5e3f5e1c20947a","observation_id":"4affa65a-5400-4e84-882c-9b1003e73c00","resolution":{"observed_at":"2026-08-15T20:52:56.995360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:56.410158Z","title":"Can you trust your model's uncertainty? evaluating predictive uncertainty under dataset shift","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-18T02:15:47.530924Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.410158Z"},"links":{"citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:55fb30a9f50352bcac8f47d3136888162f6e630de389b5f0600d8b77fe369cdc","observation_id":"ca16067b-61ef-45b8-a696-0e60bc86b389","resolution":{"observed_at":"2026-08-15T20:52:56.410158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:56.974593Z","title":"Astroclip: a cross-modal foundation model for galaxies","venue":null,"work_id":"1f4a9d98-5e6c-40b9-b96b-7a7bf5ccde2e","year":2024},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-18T02:15:47.530924Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.413943Z"},"links":{"citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:cb04d6ba70f29f4e6cad924ac6c65bcefe0da5c81096db0b9c695ece9ccd8df7","observation_id":"5b9ade2a-1121-44ed-9b37-7dd7cfb528ac","resolution":{"observed_at":"2026-08-15T20:52:56.978470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:56.417338Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-18T02:15:47.530924Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.417338Z"},"links":{"citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:82889aac11adf30281398158dc70f3d4af32584c72c99c5d6a2fcf5c3e92de28","observation_id":"d5be2ac6-e76c-4631-b302-8022f659b847","resolution":{"observed_at":"2026-08-15T20:52:56.417338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:56.420703Z","title":"Do imagenet classifiers generalize to imagenet? In International Conference on Machine Learning, pp.\\ 5389--5400","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-18T02:15:47.530924Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.420703Z"},"links":{"citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:3b764bf59d89b8c881cdda95630bdf0115fae1806c2a8cc160e24d22f6806ffe","observation_id":"aa6886f8-0ad9-44c3-b141-8b923ab0ae03","resolution":{"observed_at":"2026-08-15T20:52:56.420703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.10084","last_updated":"2019-08-27T08:50:17Z","snapshot_observed_at":"2026-08-14T05:02:11.716316Z","submitted_at":"2019-08-27T08:50:17Z","title":"Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.10084","snapshot_observed_at":"2026-08-15T20:52:56.423706Z","title":"Sentence-bert: Sentence embeddings using siamese bert-networks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-18T02:15:47.530924Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.423706Z"},"links":{"cited_paper":"/paper/1908.10084","citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:91592865a605e988800dd1e675f460ae703cb9e876c59fd760a996e46ea11e55","observation_id":"13542eb1-a85b-4ccb-a6e5-f3caf72752d5","resolution":{"observed_at":"2026-08-15T20:52:56.423706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:56.950440Z","title":"Test-time adaptation with state-space models","venue":null,"work_id":"c57d91df-fdda-47db-a016-790fb46f2d51","year":2024},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-18T02:15:47.530924Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.426760Z"},"links":{"citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:762ca973cbbebbd0520114fb2a109b46bcee3beb39628de02c3c53d3d4c51204","observation_id":"07cefc81-b209-4592-b42e-868a25a6f874","resolution":{"observed_at":"2026-08-15T20:52:56.954202Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:56.938832Z","title":"Improving robustness against common corruptions by covariate shift adaptation","venue":null,"work_id":"ef183622-fb32-4f38-ba5a-0c84417c1e64","year":2020},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-18T02:15:47.530924Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.430245Z"},"links":{"citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:3ce0bd14aa2359da26f081c9f42a125c7edcab63b00975c95bb3439a73b5f7ae","observation_id":"5659a4ec-665d-483c-b1f5-f1b5b6e784a7","resolution":{"observed_at":"2026-08-15T20:52:56.942893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.13548","last_updated":"2025-05-10T07:10:46Z","snapshot_observed_at":"2026-08-14T16:46:25.561386Z","submitted_at":"2023-10-20T14:46:48Z","title":"Towards Understanding Sycophancy in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.13548","snapshot_observed_at":"2026-08-15T20:52:56.433794Z","title":"Towards understanding sycophancy in language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-18T02:15:47.530924Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.433794Z"},"links":{"cited_paper":"/paper/2310.13548","citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:092309bdc83be0fd01e97d6938c26d8b2c8c410f827b029fa1564f599c189cb2","observation_id":"95781dc6-27ca-4e6a-a241-61f45e149c6e","resolution":{"observed_at":"2026-08-15T20:52:56.433794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:56.437598Z","title":"Ptb-xl, a large publicly available electrocardiography dataset","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-18T02:15:47.530924Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.437598Z"},"links":{"citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:e75155199c9a0ed9b0eb3868ee9c627594f7242d29f34dcabd3b533abe288382","observation_id":"c41e84b3-2a9b-4c08-aed7-92108060877c","resolution":{"observed_at":"2026-08-15T20:52:56.437598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:56.920208Z","title":"Galaxymnist: Galaxy images labelled by morphology (shape)","venue":null,"work_id":"f3aa9eee-e5b0-4040-8adc-94673dc3ce90","year":2022},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-18T02:15:47.530924Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.441010Z"},"links":{"citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:2cba22e74c4fc48d672f1559e3debefb6d3e781fb0b8822bc8a79ddc84884f7d","observation_id":"0cc9b714-e464-45af-b52e-762c66bfb404","resolution":{"observed_at":"2026-08-15T20:52:56.924197Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:56.908505Z","title":"Galaxy zoo decals: Detailed visual morphology measurements from volunteers and deep learning for 314 000 galaxies","venue":null,"work_id":"7d01801b-ee28-4e65-9bb4-3d15433a4918","year":2022},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-18T02:15:47.530924Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.445056Z"},"links":{"citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:d29e4bf749958e10ba5344c3316430051e835d8a588fdd55e8c295b8015adf44","observation_id":"59e6728a-bac4-4de4-8a66-6466038538dd","resolution":{"observed_at":"2026-08-15T20:52:56.912789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.11927","last_updated":"2022-06-23T18:07:27Z","snapshot_observed_at":"2026-08-19T10:55:54.611522Z","submitted_at":"2022-06-23T18:07:27Z","title":"Towards Galaxy Foundation Models with Hybrid Contrastive Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.11927","snapshot_observed_at":"2026-08-15T20:52:56.449341Z","title":"Towards galaxy foundation models with hybrid contrastive learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-18T02:15:47.530924Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.449341Z"},"links":{"cited_paper":"/paper/2206.11927","citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:e59ac4ddd8ebfe5d49a07a06c0f3489c1925c00f19a8be65ae957b4df20325c7","observation_id":"2d8889da-12f8-4d8f-936e-dd389fceef4c","resolution":{"observed_at":"2026-08-15T20:52:56.449341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:56.453498Z","title":"Tent: Fully test-time adaptation by entropy minimization","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-18T02:15:47.530924Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.453498Z"},"links":{"citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:8d37aa2852659233cff577e127b78d7fc65d899c29898d35216618768050138b","observation_id":"36d6ab4a-e280-4dbb-b23b-a238ae332875","resolution":{"observed_at":"2026-08-15T20:52:56.453498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-15T20:52:56.457241Z","title":"Qwen2-vl: Enhancing vision-language model's perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-18T02:15:47.530924Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.457241Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:4c6e1d05d32313ca71cd82a8e281ee49b4079d384a0094efba94b37980c8d2e0","observation_id":"1cb1d169-314a-471b-8823-5b9e48ab69c2","resolution":{"observed_at":"2026-08-15T20:52:56.457241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19475","last_updated":"2025-09-03T09:19:05Z","snapshot_observed_at":"2026-08-14T19:09:04.015462Z","submitted_at":"2024-11-29T05:10:47Z","title":"GalaxAlign: Mimicking Citizen Scientists' Multimodal Guidance for Galaxy Morphology Analysis","version":2},"cited_work":{"arxiv_id":"2411.19475","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.19475","snapshot_observed_at":"2026-08-15T20:52:56.560101Z","title":"GalaxAlign: Mimicking Citizen Scientists' Multimodal Guidance for Galaxy Morphology Analysis","venue":"cs.CV","work_id":"f9d4ab6c-b279-449e-a8ad-cf76ffa2aad5","year":2024},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-18T02:15:47.530924Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.461066Z"},"links":{"cited_paper":"/paper/2411.19475","citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:23f11252258b8f6d3f7b9d417b7a6dc3c53698109e40a24cab26efa87dd255fb","observation_id":"b77bd107-3e42-46b4-85ee-2b089ce05bee","resolution":{"observed_at":"2026-08-15T20:52:56.564140Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:56.891255Z","title":"Robustness to corruption in pre-trained bayesian neural networks","venue":null,"work_id":"707bd255-3d2d-45bd-ad67-8584798d5402","year":2023},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-18T02:15:47.530924Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.465094Z"},"links":{"citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:e3f031da2665ecd87540e4fbc6be1316e6a061ebe65e62922a8632356a887c76","observation_id":"234bd614-b79b-4101-b440-a80ba3c63a72","resolution":{"observed_at":"2026-08-15T20:52:56.894486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:56.468707Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-18T02:15:47.530924Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.468707Z"},"links":{"citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:6f4ed2ca9a94cf895021b633a86c131fad28d6a6b1513aaec0d2a772dd714235","observation_id":"82781fd4-39de-4f64-80d9-efe7f6d85d33","resolution":{"observed_at":"2026-08-15T20:52:56.468707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.02405","last_updated":"2020-07-02T22:18:12Z","snapshot_observed_at":"2026-08-13T20:13:40.043420Z","submitted_at":"2020-02-06T17:38:48Z","title":"How Good is the Bayes Posterior in Deep Neural Networks Really?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.02405","snapshot_observed_at":"2026-08-15T20:52:56.472328Z","title":"How good is the bayes posterior in deep neural networks really? arXiv preprint arXiv:2002.02405, 2020","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-18T02:15:47.530924Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.472328Z"},"links":{"cited_paper":"/paper/2002.02405","citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:345553fa751384a58b1c0c4fb5dd842420f0c1852ead47cfadb3bf35064c9943","observation_id":"2a3995fa-a60b-49ea-9616-c3709ae2ab92","resolution":{"observed_at":"2026-08-15T20:52:56.472328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01755","last_updated":"2024-03-18T21:31:29Z","snapshot_observed_at":"2026-08-16T14:55:37.897385Z","submitted_at":"2023-10-03T02:37:57Z","title":"ImageNet-OOD: Deciphering Modern Out-of-Distribution Detection Algorithms","version":2},"cited_work":{"arxiv_id":"2310.01755","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.01755","snapshot_observed_at":"2026-08-15T20:52:56.530716Z","title":"ImageNet-OOD: Deciphering Modern Out-of-Distribution Detection Algorithms","venue":"cs.CV","work_id":"51eb6ea1-19a2-4b23-bfa4-887fac331b94","year":2023},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-18T02:15:47.530924Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.475848Z"},"links":{"cited_paper":"/paper/2310.01755","citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:5bdc88f606d1a5566f278ff2eee6174d492108ea505d8f4521950fd768f8947c","observation_id":"9d86e994-b039-438f-8674-11e93204d740","resolution":{"observed_at":"2026-08-15T20:52:56.536581Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.11919","last_updated":"2024-11-28T13:35:56Z","snapshot_observed_at":"2026-08-19T18:40:51.414039Z","submitted_at":"2024-11-18T04:06:04Z","title":"VL-Uncertainty: Detecting Hallucination in Large Vision-Language Model via Uncertainty Estimation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.11919","snapshot_observed_at":"2026-08-15T20:52:56.479782Z","title":"Vl-uncertainty: Detecting hallucination in large vision-language model via uncertainty estimation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-18T02:15:47.530924Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.479782Z"},"links":{"cited_paper":"/paper/2411.11919","citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:8d5737f3b56e3c4e7c2fda04a4d979c62e04bdb326afb2ab07f68b696a39ef55","observation_id":"c37699cb-f054-4069-b4f9-0acb61fa0027","resolution":{"observed_at":"2026-08-15T20:52:56.479782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:56.483685Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-18T02:15:47.530924Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.483685Z"},"links":{"citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:0ff4c9b395c087f00794e583a58ec2b7546240698ccb52b78243b40565b09b57","observation_id":"0c8755d8-47b2-43bf-a95e-f425bc9a2c25","resolution":{"observed_at":"2026-08-15T20:52:56.483685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T02:15:47.530924Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?"},"reference_resolution":{"displayed":71,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":51,"verified_exact":2,"verified_fuzzy":18},"total_outbound_references":71},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 71 of 71 outbound references and 0 inbound Pith citation observations for arXiv:2505.11804."}