{"as_of":"2026-08-10T07:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:18fe46774a41223c99e5a445a6336d1750cb12fb9a55615fbc6cd76e08b87821","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:01:25.978139Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.20236/citation-record","integrity":"/paper/2505.20236/integrity","json":"/paper/2505.20236/citation-record.json","paper":"/paper/2505.20236"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.07073","last_updated":"2024-10-10T17:59:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-09T17:16:22Z","title":"Pixtral 12B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07073","snapshot_observed_at":"2026-08-07T14:01:22.013740Z","title":"Jiang, Kartik Khandelwal, Timothée Lacroix, Guillaume Lample, Diego Las Casas, Thibaut Lavril, and 23 others","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20236","last_updated":"2025-05-26T17:16:36Z","snapshot_observed_at":"2026-08-09T09:47:04.301294Z","submitted_at":"2025-05-26T17:16:36Z","title":"Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:22.013740Z"},"links":{"cited_paper":"/paper/2410.07073","citing_paper":"/paper/2505.20236"},"observation_digest":"sha256:57f3338d6519dff8bc1ca6c5f78f41eaac23f3a84dc91c21c56090f61752939a","observation_id":"577c4f42-b60b-44d0-bc42-e6663dffb170","resolution":{"observed_at":"2026-08-07T14:01:22.013740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T14:01:22.100408Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20236","last_updated":"2025-05-26T17:16:36Z","snapshot_observed_at":"2026-08-09T09:47:04.301294Z","submitted_at":"2025-05-26T17:16:36Z","title":"Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:22.100408Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.20236"},"observation_digest":"sha256:f86c6f4ac30fd9c70d44fd4524f9ef87314b6a43cd932a738a91bd8e81221e80","observation_id":"d8bd690b-7249-45e7-9db2-74af12102b38","resolution":{"observed_at":"2026-08-07T14:01:22.100408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:01:27.828028Z","title":null,"venue":null,"work_id":"282a123f-4038-4e86-a37c-dc6be012b44e","year":2025},"citing_paper":{"arxiv_id":"2505.20236","last_updated":"2025-05-26T17:16:36Z","snapshot_observed_at":"2026-08-09T09:47:04.301294Z","submitted_at":"2025-05-26T17:16:36Z","title":"Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:22.201998Z"},"links":{"citing_paper":"/paper/2505.20236"},"observation_digest":"sha256:f8de6aea671d25d04c4716aa0c96fb19ba8fd959d7bbbb484deacc3446061719","observation_id":"368f3ad0-0e61-4f1a-be60-79e97a696b23","resolution":{"observed_at":"2026-08-07T14:01:27.934825Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17196","last_updated":"2024-12-11T15:45:21Z","snapshot_observed_at":"2026-07-06T19:37:56.214143Z","submitted_at":"2024-10-22T17:15:20Z","title":"VoiceBench: Benchmarking LLM-Based Voice Assistants","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17196","snapshot_observed_at":"2026-08-07T14:01:22.298371Z","title":"Tan, and Haizhou Li","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20236","last_updated":"2025-05-26T17:16:36Z","snapshot_observed_at":"2026-08-09T09:47:04.301294Z","submitted_at":"2025-05-26T17:16:36Z","title":"Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:22.298371Z"},"links":{"cited_paper":"/paper/2410.17196","citing_paper":"/paper/2505.20236"},"observation_digest":"sha256:6412f69e07795c417b343c5780b2d4195dec167c94514ecc86dc962027553aea","observation_id":"46b8f820-b59d-47cc-9e92-8bb0df96f279","resolution":{"observed_at":"2026-08-07T14:01:22.298371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:01:27.539227Z","title":null,"venue":null,"work_id":"67dde542-d888-41ca-96c0-c0e2e7b31c16","year":2025},"citing_paper":{"arxiv_id":"2505.20236","last_updated":"2025-05-26T17:16:36Z","snapshot_observed_at":"2026-08-09T09:47:04.301294Z","submitted_at":"2025-05-26T17:16:36Z","title":"Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:22.367415Z"},"links":{"citing_paper":"/paper/2505.20236"},"observation_digest":"sha256:35048a46046ac62fe73550722a58c7d5940575381f312b11880033948ea31f1a","observation_id":"0a8a4407-06e2-42a4-a39d-1c84d66a1c4a","resolution":{"observed_at":"2026-08-07T14:01:27.635100Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16656","last_updated":"2025-06-06T07:27:18Z","snapshot_observed_at":"2026-08-07T15:59:55.050120Z","submitted_at":"2025-04-23T12:24:10Z","title":"Skywork R1V2: Multimodal Hybrid Reinforcement Learning for Reasoning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16656","snapshot_observed_at":"2026-08-07T14:01:22.483974Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20236","last_updated":"2025-05-26T17:16:36Z","snapshot_observed_at":"2026-08-09T09:47:04.301294Z","submitted_at":"2025-05-26T17:16:36Z","title":"Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:22.483974Z"},"links":{"cited_paper":"/paper/2504.16656","citing_paper":"/paper/2505.20236"},"observation_digest":"sha256:3ebb496e242fffd521aa541f10b96a7ff9281528e3a33ea5b21e2aeb80d6a9c1","observation_id":"c52f5b08-33f5-4921-a7eb-fdd7fb77eefd","resolution":{"observed_at":"2026-08-07T14:01:22.483974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:01:22.586032Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20236","last_updated":"2025-05-26T17:16:36Z","snapshot_observed_at":"2026-08-09T09:47:04.301294Z","submitted_at":"2025-05-26T17:16:36Z","title":"Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:22.586032Z"},"links":{"citing_paper":"/paper/2505.20236"},"observation_digest":"sha256:1acba3b60823dbfe9c28899cca05fd54aa726920a929d1c3abf888dc43ba596a","observation_id":"0584dd42-db82-4da3-bdb9-921479950611","resolution":{"observed_at":"2026-08-07T14:01:22.586032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:01:22.692185Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20236","last_updated":"2025-05-26T17:16:36Z","snapshot_observed_at":"2026-08-09T09:47:04.301294Z","submitted_at":"2025-05-26T17:16:36Z","title":"Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:22.692185Z"},"links":{"citing_paper":"/paper/2505.20236"},"observation_digest":"sha256:c2f283bcd97aba14265a6ccac425e99a51ddcb8ac8d58f6423676ac0609b14b8","observation_id":"520fad86-b4f8-4cbc-82cd-e83f17e10919","resolution":{"observed_at":"2026-08-07T14:01:22.692185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01266","last_updated":"2024-08-18T23:48:44Z","snapshot_observed_at":"2026-07-06T17:54:03.923842Z","submitted_at":"2024-04-01T17:43:27Z","title":"IsoBench: Benchmarking Multimodal Foundation Models on Isomorphic Representations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01266","snapshot_observed_at":"2026-08-07T14:01:22.788224Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20236","last_updated":"2025-05-26T17:16:36Z","snapshot_observed_at":"2026-08-09T09:47:04.301294Z","submitted_at":"2025-05-26T17:16:36Z","title":"Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:22.788224Z"},"links":{"cited_paper":"/paper/2404.01266","citing_paper":"/paper/2505.20236"},"observation_digest":"sha256:ee7b03218ab324bdbc83fbafbff41f687b9a3bfcf7b0d862e8785d3b0d4c6d7c","observation_id":"839f82ac-2372-4ace-ae8b-7ca6f029ae5a","resolution":{"observed_at":"2026-08-07T14:01:22.788224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T14:01:22.912852Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20236","last_updated":"2025-05-26T17:16:36Z","snapshot_observed_at":"2026-08-09T09:47:04.301294Z","submitted_at":"2025-05-26T17:16:36Z","title":"Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:22.912852Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.20236"},"observation_digest":"sha256:5a5810373f03fda7a618539156e17d88be5968a39d510c81e5c4302a045073ca","observation_id":"a0186ef2-f6bd-45a8-b24c-b4e3f6cb4faa","resolution":{"observed_at":"2026-08-07T14:01:22.912852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:01:23.025879Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20236","last_updated":"2025-05-26T17:16:36Z","snapshot_observed_at":"2026-08-09T09:47:04.301294Z","submitted_at":"2025-05-26T17:16:36Z","title":"Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:23.025879Z"},"links":{"citing_paper":"/paper/2505.20236"},"observation_digest":"sha256:832d84850658e044f83e904a243eda648761e8ba0b399954c743e9d23fa2ee2f","observation_id":"fbe1f2cb-9467-4b61-be0e-41a1325d5fe6","resolution":{"observed_at":"2026-08-07T14:01:23.025879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:01:23.143535Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20236","last_updated":"2025-05-26T17:16:36Z","snapshot_observed_at":"2026-08-09T09:47:04.301294Z","submitted_at":"2025-05-26T17:16:36Z","title":"Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:23.143535Z"},"links":{"citing_paper":"/paper/2505.20236"},"observation_digest":"sha256:bcac3879040a20ffe3075232a7d6efbce92ca99b1c0152864fd62dba5c028e3b","observation_id":"783aeaef-3f43-4248-90a0-ca1006418410","resolution":{"observed_at":"2026-08-07T14:01:23.143535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13826","last_updated":"2025-01-23T16:51:47Z","snapshot_observed_at":"2026-07-06T20:25:03.950783Z","submitted_at":"2025-01-23T16:51:47Z","title":"Video-MMMU: Evaluating Knowledge Acquisition from Multi-Discipline Professional Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13826","snapshot_observed_at":"2026-08-07T14:01:23.214406Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20236","last_updated":"2025-05-26T17:16:36Z","snapshot_observed_at":"2026-08-09T09:47:04.301294Z","submitted_at":"2025-05-26T17:16:36Z","title":"Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:23.214406Z"},"links":{"cited_paper":"/paper/2501.13826","citing_paper":"/paper/2505.20236"},"observation_digest":"sha256:67693ed57e5d433bdacee948ab2b25cf669041d401812ad84b363901789a1bce","observation_id":"2bf9ee16-4a31-4cbb-a89b-bbbe64aa3707","resolution":{"observed_at":"2026-08-07T14:01:23.214406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-08-09T09:48:45.884814Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-08-07T14:01:23.280081Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20236","last_updated":"2025-05-26T17:16:36Z","snapshot_observed_at":"2026-08-09T09:47:04.301294Z","submitted_at":"2025-05-26T17:16:36Z","title":"Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:23.280081Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2505.20236"},"observation_digest":"sha256:0eb61c6e856581f1c4699a2497f989f12552d9513bcfe638607f91c1c3959f3f","observation_id":"f7a87000-bebd-4d58-9554-fd88f6ea092e","resolution":{"observed_at":"2026-08-07T14:01:23.280081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.09664","last_updated":"2023-04-15T12:55:45Z","snapshot_observed_at":"2026-07-06T14:53:27.667483Z","submitted_at":"2023-02-19T20:10:07Z","title":"Semantic Uncertainty: Linguistic Invariances for Uncertainty Estimation in Natural Language Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.09664","snapshot_observed_at":"2026-08-07T14:01:23.379055Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20236","last_updated":"2025-05-26T17:16:36Z","snapshot_observed_at":"2026-08-09T09:47:04.301294Z","submitted_at":"2025-05-26T17:16:36Z","title":"Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:23.379055Z"},"links":{"cited_paper":"/paper/2302.09664","citing_paper":"/paper/2505.20236"},"observation_digest":"sha256:eccf875eb8a5c91ceaf0d6d479c9e7c14e1e11711d47b58efaf61870d068ed1a","observation_id":"660bbce5-be51-4d44-8c54-537bd684d169","resolution":{"observed_at":"2026-08-07T14:01:23.379055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T14:01:23.443069Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20236","last_updated":"2025-05-26T17:16:36Z","snapshot_observed_at":"2026-08-09T09:47:04.301294Z","submitted_at":"2025-05-26T17:16:36Z","title":"Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:23.443069Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2505.20236"},"observation_digest":"sha256:d61c980a29b19457922bdbadbf233fed037a5577cd32d5e813d55916081a6ed2","observation_id":"d4e6d02b-185a-47c8-b668-a2626a337952","resolution":{"observed_at":"2026-08-07T14:01:23.443069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:01:23.511582Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20236","last_updated":"2025-05-26T17:16:36Z","snapshot_observed_at":"2026-08-09T09:47:04.301294Z","submitted_at":"2025-05-26T17:16:36Z","title":"Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:23.511582Z"},"links":{"citing_paper":"/paper/2505.20236"},"observation_digest":"sha256:1eb783ab746f4765f513eb6fc152aafa844e3473859efa3394643b81bb6677cc","observation_id":"8db16a5d-58ee-48fd-b298-057a8c3876c4","resolution":{"observed_at":"2026-08-07T14:01:23.511582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17647","last_updated":"2024-06-10T23:39:24Z","snapshot_observed_at":"2026-07-06T16:54:22.039181Z","submitted_at":"2023-11-29T14:08:53Z","title":"Text as Images: Can Multimodal Large Language Models Follow Printed Instructions in Pixels?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17647","snapshot_observed_at":"2026-08-07T14:01:23.643676Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20236","last_updated":"2025-05-26T17:16:36Z","snapshot_observed_at":"2026-08-09T09:47:04.301294Z","submitted_at":"2025-05-26T17:16:36Z","title":"Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:23.643676Z"},"links":{"cited_paper":"/paper/2311.17647","citing_paper":"/paper/2505.20236"},"observation_digest":"sha256:5c6a2954c8831a3c6f6c4e28bd99dc2b0ce64a9a30a0e306c917b09dfc6088cf","observation_id":"12de5b99-01a3-4278-83ce-e0e4dd4be166","resolution":{"observed_at":"2026-08-07T14:01:23.643676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.14334","last_updated":"2022-06-13T05:04:53Z","snapshot_observed_at":"2026-08-09T23:45:38.167954Z","submitted_at":"2022-05-28T05:02:31Z","title":"Teaching Models to Express Their Uncertainty in Words","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.14334","snapshot_observed_at":"2026-08-07T14:01:23.760219Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20236","last_updated":"2025-05-26T17:16:36Z","snapshot_observed_at":"2026-08-09T09:47:04.301294Z","submitted_at":"2025-05-26T17:16:36Z","title":"Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:23.760219Z"},"links":{"cited_paper":"/paper/2205.14334","citing_paper":"/paper/2505.20236"},"observation_digest":"sha256:b87f6c345cff8f42ffa9375b6b460e115f3571dc3a691c4c7a5460f17609edf5","observation_id":"5fa8cfb7-796a-42b6-932c-c9a508807abb","resolution":{"observed_at":"2026-08-07T14:01:23.760219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:01:23.883414Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20236","last_updated":"2025-05-26T17:16:36Z","snapshot_observed_at":"2026-08-09T09:47:04.301294Z","submitted_at":"2025-05-26T17:16:36Z","title":"Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:23.883414Z"},"links":{"citing_paper":"/paper/2505.20236"},"observation_digest":"sha256:5b603a4218de6c70c432cd89f1f9098765860787a4edcb3e7bad9dabf6263847","observation_id":"31ac3cbe-04e4-4174-ae7b-6b35555b57ab","resolution":{"observed_at":"2026-08-07T14:01:23.883414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:01:23.976050Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20236","last_updated":"2025-05-26T17:16:36Z","snapshot_observed_at":"2026-08-09T09:47:04.301294Z","submitted_at":"2025-05-26T17:16:36Z","title":"Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:23.976050Z"},"links":{"citing_paper":"/paper/2505.20236"},"observation_digest":"sha256:6261408e54c085029d7ae8ae7a7c5bf785eb1962db509dc2960c8ec6e6f53f29","observation_id":"9b1faf96-b556-46f0-a79c-9c9a84189980","resolution":{"observed_at":"2026-08-07T14:01:23.976050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04263","last_updated":"2025-02-06T17:58:59Z","snapshot_observed_at":"2026-08-08T22:55:49.019671Z","submitted_at":"2025-02-06T17:58:59Z","title":"Cross the Gap: Exposing the Intra-modal Misalignment in CLIP via Modality Inversion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04263","snapshot_observed_at":"2026-08-07T14:01:24.087885Z","title":"Bagdanov","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20236","last_updated":"2025-05-26T17:16:36Z","snapshot_observed_at":"2026-08-09T09:47:04.301294Z","submitted_at":"2025-05-26T17:16:36Z","title":"Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:24.087885Z"},"links":{"cited_paper":"/paper/2502.04263","citing_paper":"/paper/2505.20236"},"observation_digest":"sha256:1ee46520a91abbb0970b8978d4aefdc082378eaf8ab2dbefc31b6127a43f92bd","observation_id":"421bfe05-7e31-41b5-ad92-4b487724c3f8","resolution":{"observed_at":"2026-08-07T14:01:24.087885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20003","last_updated":"2024-05-30T12:42:05Z","snapshot_observed_at":"2026-07-06T18:22:40.048076Z","submitted_at":"2024-05-30T12:42:05Z","title":"Kernel Language Entropy: Fine-grained Uncertainty Quantification for LLMs from Semantic Similarities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20003","snapshot_observed_at":"2026-08-07T14:01:24.159098Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20236","last_updated":"2025-05-26T17:16:36Z","snapshot_observed_at":"2026-08-09T09:47:04.301294Z","submitted_at":"2025-05-26T17:16:36Z","title":"Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:24.159098Z"},"links":{"cited_paper":"/paper/2405.20003","citing_paper":"/paper/2505.20236"},"observation_digest":"sha256:8cf2b2ce8ebef7ec05791dab3bcbbd5f7de04afe36abef2c6eabf695d458a007","observation_id":"bda0b752-27ba-482c-a26b-fef51d8d9cea","resolution":{"observed_at":"2026-08-07T14:01:24.159098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06807","last_updated":"2025-02-18T22:21:40Z","snapshot_observed_at":"2026-08-09T14:06:29.234036Z","submitted_at":"2025-02-03T23:00:15Z","title":"Competitive Programming with Large Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06807","snapshot_observed_at":"2026-08-07T14:01:24.248102Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20236","last_updated":"2025-05-26T17:16:36Z","snapshot_observed_at":"2026-08-09T09:47:04.301294Z","submitted_at":"2025-05-26T17:16:36Z","title":"Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:24.248102Z"},"links":{"cited_paper":"/paper/2502.06807","citing_paper":"/paper/2505.20236"},"observation_digest":"sha256:b44fc2fb480034fe7126dbfec70ca3e05103001ce175d593700c4cac1a9849e7","observation_id":"784c145e-d28b-486f-8ede-99c514aad554","resolution":{"observed_at":"2026-08-07T14:01:24.248102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T14:01:24.321343Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20236","last_updated":"2025-05-26T17:16:36Z","snapshot_observed_at":"2026-08-09T09:47:04.301294Z","submitted_at":"2025-05-26T17:16:36Z","title":"Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:24.321343Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2505.20236"},"observation_digest":"sha256:4f411f30eb10d58d4db4fcba35ce6899ea83b610549ba651b39d3201568711dc","observation_id":"1369b012-4f31-40f6-beb0-002c58439b0d","resolution":{"observed_at":"2026-08-07T14:01:24.321343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-07T14:01:24.419906Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20236","last_updated":"2025-05-26T17:16:36Z","snapshot_observed_at":"2026-08-09T09:47:04.301294Z","submitted_at":"2025-05-26T17:16:36Z","title":"Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:24.419906Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2505.20236"},"observation_digest":"sha256:df9732ec61fc79d777cc9126e11259edde027b31635a8b36ff318db7925e9645","observation_id":"299fdc9e-7526-4e0d-aac4-2a71948a3229","resolution":{"observed_at":"2026-08-07T14:01:24.419906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:01:24.515708Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20236","last_updated":"2025-05-26T17:16:36Z","snapshot_observed_at":"2026-08-09T09:47:04.301294Z","submitted_at":"2025-05-26T17:16:36Z","title":"Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:24.515708Z"},"links":{"citing_paper":"/paper/2505.20236"},"observation_digest":"sha256:a778a2654beefdbbd55c6d18719beaf73ad34cff0bc09ed26a539573f76448a7","observation_id":"73f42e94-ba71-46a6-9b1d-6bc050c3a39c","resolution":{"observed_at":"2026-08-07T14:01:24.515708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02287","last_updated":"2024-05-03T17:59:55Z","snapshot_observed_at":"2026-08-09T00:03:31.388956Z","submitted_at":"2024-05-03T17:59:55Z","title":"Vibe-Eval: A hard evaluation suite for measuring progress of multimodal language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.02287","snapshot_observed_at":"2026-08-07T14:01:24.600283Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20236","last_updated":"2025-05-26T17:16:36Z","snapshot_observed_at":"2026-08-09T09:47:04.301294Z","submitted_at":"2025-05-26T17:16:36Z","title":"Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:24.600283Z"},"links":{"cited_paper":"/paper/2405.02287","citing_paper":"/paper/2505.20236"},"observation_digest":"sha256:21c381ad122caeb7d36310f575196329d04b2afb6afbbc2e06117ca8979d88d2","observation_id":"f0e75ab4-d008-43ec-b0e7-367f2f3232d2","resolution":{"observed_at":"2026-08-07T14:01:24.600283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05599","last_updated":"2025-06-09T11:44:18Z","snapshot_observed_at":"2026-08-09T12:50:50.767642Z","submitted_at":"2025-04-08T01:19:20Z","title":"Skywork R1V: Pioneering Multimodal Reasoning with Chain-of-Thought","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05599","snapshot_observed_at":"2026-08-07T14:01:24.672118Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20236","last_updated":"2025-05-26T17:16:36Z","snapshot_observed_at":"2026-08-09T09:47:04.301294Z","submitted_at":"2025-05-26T17:16:36Z","title":"Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:24.672118Z"},"links":{"cited_paper":"/paper/2504.05599","citing_paper":"/paper/2505.20236"},"observation_digest":"sha256:e460fe681f549431763f1f945d6b27dd4d9cd173cd8175a54c98acf4a8b6dbe8","observation_id":"29f1d055-0c40-4292-bd67-dbf5c2773828","resolution":{"observed_at":"2026-08-07T14:01:24.672118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:01:24.745046Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20236","last_updated":"2025-05-26T17:16:36Z","snapshot_observed_at":"2026-08-09T09:47:04.301294Z","submitted_at":"2025-05-26T17:16:36Z","title":"Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:24.745046Z"},"links":{"citing_paper":"/paper/2505.20236"},"observation_digest":"sha256:6573a22313ca1bcac5ae252a0db52dc282930196bc5636749f9afb7600f3b7b3","observation_id":"4c7c4b9e-7866-42ff-b8c3-bd4ba4b8fde3","resolution":{"observed_at":"2026-08-07T14:01:24.745046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:01:24.847837Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20236","last_updated":"2025-05-26T17:16:36Z","snapshot_observed_at":"2026-08-09T09:47:04.301294Z","submitted_at":"2025-05-26T17:16:36Z","title":"Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:24.847837Z"},"links":{"citing_paper":"/paper/2505.20236"},"observation_digest":"sha256:55c94973fb22704231fc3b41968e6792ae413544e98993ecc41fac30a5e11407","observation_id":"96363283-fa5d-4d18-81af-988b2ada11e7","resolution":{"observed_at":"2026-08-07T14:01:24.847837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:01:24.911865Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20236","last_updated":"2025-05-26T17:16:36Z","snapshot_observed_at":"2026-08-09T09:47:04.301294Z","submitted_at":"2025-05-26T17:16:36Z","title":"Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:24.911865Z"},"links":{"citing_paper":"/paper/2505.20236"},"observation_digest":"sha256:b70e6fc23d8b5b04d017fd5b0cf7c35bc4eabc22694c5da9a5e13b0e33afcd45","observation_id":"f9d64c17-4280-444f-b441-c7b5b070541e","resolution":{"observed_at":"2026-08-07T14:01:24.911865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:01:27.222836Z","title":null,"venue":null,"work_id":"b7703fd4-c580-4a06-aee8-be58529496ec","year":2024},"citing_paper":{"arxiv_id":"2505.20236","last_updated":"2025-05-26T17:16:36Z","snapshot_observed_at":"2026-08-09T09:47:04.301294Z","submitted_at":"2025-05-26T17:16:36Z","title":"Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:24.995849Z"},"links":{"citing_paper":"/paper/2505.20236"},"observation_digest":"sha256:c2fa916dcb6fca730f0a9a3b015515255fa6669e18f2b8c31a7991474615d25d","observation_id":"a72a6b96-0e25-4210-bb07-e86db1b9b0f8","resolution":{"observed_at":"2026-08-07T14:01:27.346906Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06492","last_updated":"2025-03-09T07:25:32Z","snapshot_observed_at":"2026-08-07T17:19:21.009730Z","submitted_at":"2025-03-09T07:25:32Z","title":"VisualSimpleQA: A Benchmark for Decoupled Evaluation of Large Vision-Language Models in Fact-Seeking Question Answering","version":1},"cited_work":{"arxiv_id":"2503.06492","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.06492","snapshot_observed_at":"2026-08-07T14:01:26.424935Z","title":"VisualSimpleQA: A Benchmark for Decoupled Evaluation of Large Vision-Language Models in Fact-Seeking Question Answering","venue":"cs.CL","work_id":"4d21c30a-e59f-4626-96b3-7cff3c93037e","year":2025},"citing_paper":{"arxiv_id":"2505.20236","last_updated":"2025-05-26T17:16:36Z","snapshot_observed_at":"2026-08-09T09:47:04.301294Z","submitted_at":"2025-05-26T17:16:36Z","title":"Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:25.047482Z"},"links":{"cited_paper":"/paper/2503.06492","citing_paper":"/paper/2505.20236"},"observation_digest":"sha256:b8fa53eb57c0250d89df5ee7bb706ff2fa53f7dd05f2b77526372159b9d2c737","observation_id":"65e97d08-87bc-493e-a73f-9e4b9d3f9984","resolution":{"observed_at":"2026-08-07T14:01:26.473041Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13063","last_updated":"2024-03-17T04:38:48Z","snapshot_observed_at":"2026-07-06T15:45:39.649725Z","submitted_at":"2023-06-22T17:31:44Z","title":"Can LLMs Express Their Uncertainty? An Empirical Evaluation of Confidence Elicitation in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13063","snapshot_observed_at":"2026-08-07T14:01:25.160503Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20236","last_updated":"2025-05-26T17:16:36Z","snapshot_observed_at":"2026-08-09T09:47:04.301294Z","submitted_at":"2025-05-26T17:16:36Z","title":"Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:25.160503Z"},"links":{"cited_paper":"/paper/2306.13063","citing_paper":"/paper/2505.20236"},"observation_digest":"sha256:bf5896208487e89fcf02cfce4c47ce469e06d8136b83889d86e99c0a8c8ed962","observation_id":"49fca5c3-60ad-4a8b-8911-1f4f555b816d","resolution":{"observed_at":"2026-08-07T14:01:25.160503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:01:25.253135Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20236","last_updated":"2025-05-26T17:16:36Z","snapshot_observed_at":"2026-08-09T09:47:04.301294Z","submitted_at":"2025-05-26T17:16:36Z","title":"Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:25.253135Z"},"links":{"citing_paper":"/paper/2505.20236"},"observation_digest":"sha256:d111a5383343c4529ab373d136a2491f16f3b52260ede9117a976abde31ec229","observation_id":"0023d82c-4754-4593-bf77-e98fe5ffe04f","resolution":{"observed_at":"2026-08-07T14:01:25.253135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14737","last_updated":"2026-05-05T09:22:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T11:10:36Z","title":"On Verbalized Confidence Scores for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14737","snapshot_observed_at":"2026-08-07T14:01:25.362381Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20236","last_updated":"2025-05-26T17:16:36Z","snapshot_observed_at":"2026-08-09T09:47:04.301294Z","submitted_at":"2025-05-26T17:16:36Z","title":"Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:25.362381Z"},"links":{"cited_paper":"/paper/2412.14737","citing_paper":"/paper/2505.20236"},"observation_digest":"sha256:aeab32ce9a2b30f989b79015f1b0650cbabddcebeb50a8b0ba910a379d43a795","observation_id":"32e8d7ba-05ad-43b1-b1ed-a0a1ee967a4e","resolution":{"observed_at":"2026-08-07T14:01:25.362381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02813","last_updated":"2025-05-22T08:22:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-04T15:31:26Z","title":"MMMU-Pro: A More Robust Multi-discipline Multimodal Understanding Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02813","snapshot_observed_at":"2026-08-07T14:01:25.453877Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20236","last_updated":"2025-05-26T17:16:36Z","snapshot_observed_at":"2026-08-09T09:47:04.301294Z","submitted_at":"2025-05-26T17:16:36Z","title":"Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:25.453877Z"},"links":{"cited_paper":"/paper/2409.02813","citing_paper":"/paper/2505.20236"},"observation_digest":"sha256:0f7b6d5db7f4765e1974ae3fc7cbe161ca5fa11a944d0df249931b387e900952","observation_id":"e2430b32-9e4a-421e-8186-4e9ec2ca701e","resolution":{"observed_at":"2026-08-07T14:01:25.453877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:01:25.547974Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20236","last_updated":"2025-05-26T17:16:36Z","snapshot_observed_at":"2026-08-09T09:47:04.301294Z","submitted_at":"2025-05-26T17:16:36Z","title":"Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:25.547974Z"},"links":{"citing_paper":"/paper/2505.20236"},"observation_digest":"sha256:237b93cde120b58075be08758dbf71caa7c8171237a822e95e8fcfc9e4c8d215","observation_id":"e87c8039-d94f-47b3-bd9c-671458260439","resolution":{"observed_at":"2026-08-07T14:01:25.547974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14848","last_updated":"2025-04-21T04:01:22Z","snapshot_observed_at":"2026-08-07T16:00:41.922151Z","submitted_at":"2025-04-21T04:01:22Z","title":"Object-Level Verbalized Confidence Calibration in Vision-Language Models via Semantic Perturbation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14848","snapshot_observed_at":"2026-08-07T14:01:25.677292Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20236","last_updated":"2025-05-26T17:16:36Z","snapshot_observed_at":"2026-08-09T09:47:04.301294Z","submitted_at":"2025-05-26T17:16:36Z","title":"Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:25.677292Z"},"links":{"cited_paper":"/paper/2504.14848","citing_paper":"/paper/2505.20236"},"observation_digest":"sha256:d5706b67f9584d565449172a1d92afb59309c5424a3e0cc91cbec78d60ca822c","observation_id":"c62b61a3-1ded-4373-b33f-4ac3ef07d44f","resolution":{"observed_at":"2026-08-07T14:01:25.677292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-08-07T14:01:25.765160Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20236","last_updated":"2025-05-26T17:16:36Z","snapshot_observed_at":"2026-08-09T09:47:04.301294Z","submitted_at":"2025-05-26T17:16:36Z","title":"Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:25.765160Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2505.20236"},"observation_digest":"sha256:909995d33c4eb4eb93582c48c9543321565fffc95a838dce46469fb09e7ba10c","observation_id":"38df3b57-ede7-4009-858b-2ca0244844da","resolution":{"observed_at":"2026-08-07T14:01:25.765160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T14:01:25.854052Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20236","last_updated":"2025-05-26T17:16:36Z","snapshot_observed_at":"2026-08-09T09:47:04.301294Z","submitted_at":"2025-05-26T17:16:36Z","title":"Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:25.854052Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2505.20236"},"observation_digest":"sha256:c135df2707031bf4ef07b28169fd35db1202f79495658b3b4fbb41f7d60cf38f","observation_id":"bbe0ee83-2b7a-4ec4-b01a-5d9eb00677f7","resolution":{"observed_at":"2026-08-07T14:01:25.854052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:01:25.922314Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20236","last_updated":"2025-05-26T17:16:36Z","snapshot_observed_at":"2026-08-09T09:47:04.301294Z","submitted_at":"2025-05-26T17:16:36Z","title":"Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:25.922314Z"},"links":{"citing_paper":"/paper/2505.20236"},"observation_digest":"sha256:d6ff0c90c9b12f2e815492f49e00224906da319bc2e7ab661257508e2c890249","observation_id":"634c2005-6315-4346-a502-bac238a50906","resolution":{"observed_at":"2026-08-07T14:01:25.922314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:01:25.978139Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20236","last_updated":"2025-05-26T17:16:36Z","snapshot_observed_at":"2026-08-09T09:47:04.301294Z","submitted_at":"2025-05-26T17:16:36Z","title":"Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:25.978139Z"},"links":{"citing_paper":"/paper/2505.20236"},"observation_digest":"sha256:ef11a7cee63c4de49412f713dfc31b3f28bb1ea6bb6c36abbd4d968ed5364656","observation_id":"deb1b7ee-7405-4a9c-bcc0-52673db637c7","resolution":{"observed_at":"2026-08-07T14:01:25.978139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.20236","last_updated":"2025-05-26T17:16:36Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T09:47:04.301294Z","submitted_at":"2025-05-26T17:16:36Z","title":"Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":43,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 0 inbound Pith citation observations for arXiv:2505.20236."}