{"as_of":"2026-08-10T07:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:68b856b9ebc3f8d3ba77dcabc8bed2215170dc7c611e2f6603fd76b36742fae4","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-25T05:58:35.466105Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T15:04:54.866011Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.22903","last_updated":"2026-05-21T17:35:04Z","snapshot_observed_at":"2026-08-07T15:24:22.420892Z","submitted_at":"2026-05-21T17:35:04Z","title":"Seeing without Looking: Do Vision-Language Benchmarks Really Test Vision?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.22903","snapshot_observed_at":"2026-08-01T15:04:54.866011Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18577","last_updated":"2026-07-20T23:19:28Z","snapshot_observed_at":"2026-08-05T06:25:50.581335Z","submitted_at":"2026-07-20T23:19:28Z","title":"Attention Without Grounding: Causal Evaluation of Visual Explanations in Medical VLMs","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T15:04:54.866011Z"},"links":{"cited_paper":"/paper/2605.22903","citing_paper":"/paper/2607.18577"},"observation_digest":"sha256:7ebc78f18fc0e6fa1da7fc30aa441850969943f812cff33f1bf28e862de35d1d","observation_id":"0cfc13e8-9803-4225-9a17-91e9ffaaf842","resolution":{"observed_at":"2026-08-01T15:04:54.866011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.22903","last_updated":"2026-05-21T17:35:04Z","snapshot_observed_at":"2026-08-07T15:24:22.420892Z","submitted_at":"2026-05-21T17:35:04Z","title":"Seeing without Looking: Do Vision-Language Benchmarks Really Test Vision?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.22903","snapshot_observed_at":"2026-07-30T12:08:02.370883Z","title":"Leng, S.; Zhang, H.; Chen, G.; Li, X.; Lu, S.; Miao, C.; and Bing, L","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27069","last_updated":"2026-07-30T03:38:02Z","snapshot_observed_at":"2026-08-09T12:12:12.772273Z","submitted_at":"2026-07-29T15:55:31Z","title":"Visual Credit Audit for Multimodal Spatial Reasoning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-30T12:08:02.370883Z"},"links":{"cited_paper":"/paper/2605.22903","citing_paper":"/paper/2607.27069"},"observation_digest":"sha256:87142295c3dd906f88594711ff723f6deb239d3964caa9adc3bb83dbb150daa4","observation_id":"eb984bca-97a2-4abf-9791-12f2555fddcd","resolution":{"observed_at":"2026-07-30T12:08:02.370883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.22903","last_updated":"2026-05-21T17:35:04Z","snapshot_observed_at":"2026-08-07T15:24:22.420892Z","submitted_at":"2026-05-21T17:35:04Z","title":"Seeing without Looking: Do Vision-Language Benchmarks Really Test Vision?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.22903","snapshot_observed_at":"2026-08-01T10:15:14.125422Z","title":"Leng, S.; Zhang, H.; Chen, G.; Li, X.; Lu, S.; Miao, C.; and Bing, L","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27069","last_updated":"2026-07-30T03:38:02Z","snapshot_observed_at":"2026-08-09T12:12:12.772273Z","submitted_at":"2026-07-29T15:55:31Z","title":"Visual Credit Audit for Multimodal Spatial Reasoning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T10:15:14.125422Z"},"links":{"cited_paper":"/paper/2605.22903","citing_paper":"/paper/2607.27069"},"observation_digest":"sha256:f6903c5a223a6f31f649a766af63bac87aa42bcaaf1d9ec233d71afb1c37fbac","observation_id":"7f2c230e-7d58-4dee-82b8-89759e04746b","resolution":{"observed_at":"2026-08-01T10:15:14.125422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.22903/citation-record","integrity":"/paper/2605.22903/integrity","json":"/paper/2605.22903/citation-record.json","paper":"/paper/2605.22903"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Qwen3-vl technical report","venue":null,"work_id":"c12c78c6-1f59-439c-bb79-fe4458dbbacd","year":2025},"citing_paper":{"arxiv_id":"2605.22903","last_updated":"2026-05-21T17:35:04Z","snapshot_observed_at":"2026-08-07T15:24:22.420892Z","submitted_at":"2026-05-21T17:35:04Z","title":"Seeing without Looking: Do Vision-Language Benchmarks Really Test Vision?","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-25T05:58:35.466105Z"},"links":{"citing_paper":"/paper/2605.22903"},"observation_digest":"sha256:5267996d1627bd94fe9098c8587479287290eed9f8c12a8bb47411040632288a","observation_id":"bbe1f486-96d7-424c-91f0-7054527bb109","resolution":{"observed_at":"2026-05-25T06:00:24.414805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Halc: Object hallucination reduc- tion via adaptive focal-contrast decoding","venue":null,"work_id":"64179c06-3644-4ed4-a098-f8178732461d","year":2024},"citing_paper":{"arxiv_id":"2605.22903","last_updated":"2026-05-21T17:35:04Z","snapshot_observed_at":"2026-08-07T15:24:22.420892Z","submitted_at":"2026-05-21T17:35:04Z","title":"Seeing without Looking: Do Vision-Language Benchmarks Really Test Vision?","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-25T05:58:35.466105Z"},"links":{"citing_paper":"/paper/2605.22903"},"observation_digest":"sha256:4162090c5aff34771798889e039b61f1403d18114290881b0bf61ec00903f6cd","observation_id":"0abe4d4c-c03b-4302-85cd-2b32521e79bb","resolution":{"observed_at":"2026-05-25T06:00:24.417944Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Smith, Hannaneh Hajishirzi, Ross Girshick, Ali Farhadi, and Aniruddha Kembhavi","venue":null,"work_id":"69d019f9-1d46-4b35-ac84-c74bef0c2046","year":2024},"citing_paper":{"arxiv_id":"2605.22903","last_updated":"2026-05-21T17:35:04Z","snapshot_observed_at":"2026-08-07T15:24:22.420892Z","submitted_at":"2026-05-21T17:35:04Z","title":"Seeing without Looking: Do Vision-Language Benchmarks Really Test Vision?","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-25T05:58:35.466105Z"},"links":{"citing_paper":"/paper/2605.22903"},"observation_digest":"sha256:a4f5354f3e3a9803549b5d7c507aadc145ef7d47a749a23c565d114b5b430774","observation_id":"552c21fc-48ec-4058-9730-eab872861c57","resolution":{"observed_at":"2026-05-25T06:00:24.404362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On statistical efficiency in learning.IEEE Transactions on In- formation Theory, 67(4):2488–2506","venue":null,"work_id":"24b3d87b-2fa5-4598-917b-3bdbfc684290","year":2020},"citing_paper":{"arxiv_id":"2605.22903","last_updated":"2026-05-21T17:35:04Z","snapshot_observed_at":"2026-08-07T15:24:22.420892Z","submitted_at":"2026-05-21T17:35:04Z","title":"Seeing without Looking: Do Vision-Language Benchmarks Really Test Vision?","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-25T05:58:35.466105Z"},"links":{"citing_paper":"/paper/2605.22903"},"observation_digest":"sha256:6aa61d79f4ef23d9bb823fa4266bc61160be37fa1979fc54766caa51638abe12","observation_id":"82c008e2-0908-4703-a7c5-a2ea5468e827","resolution":{"observed_at":"2026-05-25T06:00:24.408744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Enhancing vision-language model relia- bility with uncertainty-guided dropout decoding.Advances in Neural Information Processing Systems, 38:149193– 149218","venue":null,"work_id":"78c55aaa-e1c3-4db0-ad23-8e2723917fe5","year":2025},"citing_paper":{"arxiv_id":"2605.22903","last_updated":"2026-05-21T17:35:04Z","snapshot_observed_at":"2026-08-07T15:24:22.420892Z","submitted_at":"2026-05-21T17:35:04Z","title":"Seeing without Looking: Do Vision-Language Benchmarks Really Test Vision?","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-25T05:58:35.466105Z"},"links":{"citing_paper":"/paper/2605.22903"},"observation_digest":"sha256:7876af14f5b8f65e8ecb3896e6d87396c49578f39d9aef9ac55dc8368f2eb738","observation_id":"507598b1-d0f3-448f-af5a-2f5b33506d7a","resolution":{"observed_at":"2026-05-25T06:00:24.430218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mme: A comprehensive evaluation benchmark for multimodal large language models","venue":null,"work_id":"78f4acd5-c071-4f2c-b91a-b0c5bef61a64","year":2025},"citing_paper":{"arxiv_id":"2605.22903","last_updated":"2026-05-21T17:35:04Z","snapshot_observed_at":"2026-08-07T15:24:22.420892Z","submitted_at":"2026-05-21T17:35:04Z","title":"Seeing without Looking: Do Vision-Language Benchmarks Really Test Vision?","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-25T05:58:35.466105Z"},"links":{"citing_paper":"/paper/2605.22903"},"observation_digest":"sha256:52e5693903fffbfda12d307fac9f07dee75c8b82b146e42723c321365ddd4ab1","observation_id":"2667e7d8-a612-4032-a7b8-f24cdd80279c","resolution":{"observed_at":"2026-05-25T06:00:24.433280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Does ob- ject grounding really reduce hallucination of large vision- language models?","venue":null,"work_id":"334b3ac7-a766-4b49-a359-a8fc38170b59","year":2024},"citing_paper":{"arxiv_id":"2605.22903","last_updated":"2026-05-21T17:35:04Z","snapshot_observed_at":"2026-08-07T15:24:22.420892Z","submitted_at":"2026-05-21T17:35:04Z","title":"Seeing without Looking: Do Vision-Language Benchmarks Really Test Vision?","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-25T05:58:35.466105Z"},"links":{"citing_paper":"/paper/2605.22903"},"observation_digest":"sha256:e38bc6e17f9ddc4b7af6a2fc04eadca8105ca2b264f39a714b4273a34f5eb932","observation_id":"44229f4b-d8e8-4844-84ad-7a99734b9ae4","resolution":{"observed_at":"2026-05-25T06:00:24.436022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hal- lusionbench: An advanced diagnostic suite for entangled language hallucination and visual illusion in large vision- language models","venue":null,"work_id":"c1b6e8a9-31ba-4f37-b4c9-7ef8adad8a45","year":2024},"citing_paper":{"arxiv_id":"2605.22903","last_updated":"2026-05-21T17:35:04Z","snapshot_observed_at":"2026-08-07T15:24:22.420892Z","submitted_at":"2026-05-21T17:35:04Z","title":"Seeing without Looking: Do Vision-Language Benchmarks Really Test Vision?","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-25T05:58:35.466105Z"},"links":{"citing_paper":"/paper/2605.22903"},"observation_digest":"sha256:6a68302d2f63ede57b7b252c3d4630ed6da0df814e50a4be4f230b486f3a20b7","observation_id":"947ae1ed-30ae-483b-b353-83d142c2bb61","resolution":{"observed_at":"2026-05-25T06:00:24.455640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Do vision-language models really understand visual lan- guage?","venue":null,"work_id":"21684dc2-8447-45c8-ba48-4aea0a4dcedb","year":2025},"citing_paper":{"arxiv_id":"2605.22903","last_updated":"2026-05-21T17:35:04Z","snapshot_observed_at":"2026-08-07T15:24:22.420892Z","submitted_at":"2026-05-21T17:35:04Z","title":"Seeing without Looking: Do Vision-Language Benchmarks Really Test Vision?","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-25T05:58:35.466105Z"},"links":{"citing_paper":"/paper/2605.22903"},"observation_digest":"sha256:213d789526acdd3f8c4aa21808e439d66f0fb78a01a671e76ef32605e6e77a5a","observation_id":"61bd3256-36dc-4fbd-9ac0-82fbdcb23f19","resolution":{"observed_at":"2026-05-25T06:00:24.366989Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A survey on evaluation of multimodal large language models","venue":null,"work_id":"067c5c55-5a2e-4790-8a1d-707eaddfde0f","year":2024},"citing_paper":{"arxiv_id":"2605.22903","last_updated":"2026-05-21T17:35:04Z","snapshot_observed_at":"2026-08-07T15:24:22.420892Z","submitted_at":"2026-05-21T17:35:04Z","title":"Seeing without Looking: Do Vision-Language Benchmarks Really Test Vision?","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-25T05:58:35.466105Z"},"links":{"citing_paper":"/paper/2605.22903"},"observation_digest":"sha256:e01342be7bf616fdbeec2cc04a75822f10ed011545616bca12632bb30b2f0f70","observation_id":"4681251b-5cfc-4e35-ad9a-11c63022dfb1","resolution":{"observed_at":"2026-05-25T06:00:24.360769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.17132","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Robustifying vision-language models via dynamic token reweighting","venue":null,"work_id":"b7682afd-4f70-419d-8ee6-cb7f1bfdd592","year":2025},"citing_paper":{"arxiv_id":"2605.22903","last_updated":"2026-05-21T17:35:04Z","snapshot_observed_at":"2026-08-07T15:24:22.420892Z","submitted_at":"2026-05-21T17:35:04Z","title":"Seeing without Looking: Do Vision-Language Benchmarks Really Test Vision?","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-25T05:58:35.466105Z"},"links":{"citing_paper":"/paper/2605.22903"},"observation_digest":"sha256:fed7528cf6ddfe3c6bf0ac2844989d915fb49ad362d3fbebf7e5daf36f2e2ad7","observation_id":"cfba36bb-ffba-4f15-8cf3-b8625cdd2523","resolution":{"observed_at":"2026-05-25T06:00:23.370424Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A comprehensive analysis for visual object hallucination in large vision-language mod- els","venue":null,"work_id":"9d67f901-c93e-423e-b8c8-15dfddbcae0d","year":2025},"citing_paper":{"arxiv_id":"2605.22903","last_updated":"2026-05-21T17:35:04Z","snapshot_observed_at":"2026-08-07T15:24:22.420892Z","submitted_at":"2026-05-21T17:35:04Z","title":"Seeing without Looking: Do Vision-Language Benchmarks Really Test Vision?","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-25T05:58:35.466105Z"},"links":{"citing_paper":"/paper/2605.22903"},"observation_digest":"sha256:428b70c98e22861f25c024ca78964f67f7729bfecdd0d1b3bed0e780001f5d39","observation_id":"cffb5a42-1fe7-4f34-a153-2fab6f2df224","resolution":{"observed_at":"2026-05-25T06:00:24.351708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Do you see me : A mul- tidimensional benchmark for evaluating visual perception in multimodal llms","venue":null,"work_id":"79cbf8de-83f8-47f3-985d-d524e0971572","year":2025},"citing_paper":{"arxiv_id":"2605.22903","last_updated":"2026-05-21T17:35:04Z","snapshot_observed_at":"2026-08-07T15:24:22.420892Z","submitted_at":"2026-05-21T17:35:04Z","title":"Seeing without Looking: Do Vision-Language Benchmarks Really Test Vision?","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-25T05:58:35.466105Z"},"links":{"citing_paper":"/paper/2605.22903"},"observation_digest":"sha256:1cb6fa739f1c4746b9ec157c02ad38966a28c78d4d92835c33b4e4ee7b41c7af","observation_id":"4c60f163-65b7-4e8e-bc91-9aaae62c3554","resolution":{"observed_at":"2026-05-25T06:00:24.354421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"741a86b7-3a96-4037-9270-f9fb806b3a4f","year":null},"citing_paper":{"arxiv_id":"2605.22903","last_updated":"2026-05-21T17:35:04Z","snapshot_observed_at":"2026-08-07T15:24:22.420892Z","submitted_at":"2026-05-21T17:35:04Z","title":"Seeing without Looking: Do Vision-Language Benchmarks Really Test Vision?","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-25T05:58:35.466105Z"},"links":{"citing_paper":"/paper/2605.22903"},"observation_digest":"sha256:69a7ffa5aa958a85f43fa2eb2e327136aebff3f4727d29e2bb81a80e35352662","observation_id":"66a0dbf9-2dc0-4d41-9339-4c7251f2b2f7","resolution":{"observed_at":"2026-05-25T06:00:24.370018Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Halp: Detecting hallucinations in vision- language models without generating a single token","venue":null,"work_id":"7d183b1f-0b2f-414c-a591-8916ca4ac0d2","year":2026},"citing_paper":{"arxiv_id":"2605.22903","last_updated":"2026-05-21T17:35:04Z","snapshot_observed_at":"2026-08-07T15:24:22.420892Z","submitted_at":"2026-05-21T17:35:04Z","title":"Seeing without Looking: Do Vision-Language Benchmarks Really Test Vision?","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-25T05:58:35.466105Z"},"links":{"citing_paper":"/paper/2605.22903"},"observation_digest":"sha256:5168b3b5d60f329a17c4f97c5b4cd2280dd528bc5a79b974f859e2c839e8c56f","observation_id":"2e54ad26-7c3b-4709-a535-267b303a00a7","resolution":{"observed_at":"2026-05-25T06:00:24.372796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"VLind-bench: Measuring language priors in large vision- language models","venue":null,"work_id":"119acc57-5bd1-4668-abcd-c0f2d43dbcd2","year":2025},"citing_paper":{"arxiv_id":"2605.22903","last_updated":"2026-05-21T17:35:04Z","snapshot_observed_at":"2026-08-07T15:24:22.420892Z","submitted_at":"2026-05-21T17:35:04Z","title":"Seeing without Looking: Do Vision-Language Benchmarks Really Test Vision?","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-25T05:58:35.466105Z"},"links":{"citing_paper":"/paper/2605.22903"},"observation_digest":"sha256:39688a61041e5b9b6c1b6df87c4c28bc599556e4bfb1613573c9097011bd40c5","observation_id":"c5d31bb2-1eea-4429-b775-cb854953af8c","resolution":{"observed_at":"2026-05-25T06:00:24.396618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Evaluating object hallucination in large vision-language models","venue":null,"work_id":"f45be88f-3feb-42b2-9a3a-45d43753b5af","year":2023},"citing_paper":{"arxiv_id":"2605.22903","last_updated":"2026-05-21T17:35:04Z","snapshot_observed_at":"2026-08-07T15:24:22.420892Z","submitted_at":"2026-05-21T17:35:04Z","title":"Seeing without Looking: Do Vision-Language Benchmarks Really Test Vision?","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-25T05:58:35.466105Z"},"links":{"citing_paper":"/paper/2605.22903"},"observation_digest":"sha256:18822892e965bc5bf57c07455466cde637a180e9530def2dccdcc3774f62da93","observation_id":"61a0e2ee-6037-406d-91cf-cec25196026f","resolution":{"observed_at":"2026-05-25T06:00:24.441466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Text or pixels? evaluating efficiency and understanding of LLMs with vi- sual text inputs","venue":null,"work_id":"9322a78e-d316-4616-9edd-daea23f0bfff","year":2025},"citing_paper":{"arxiv_id":"2605.22903","last_updated":"2026-05-21T17:35:04Z","snapshot_observed_at":"2026-08-07T15:24:22.420892Z","submitted_at":"2026-05-21T17:35:04Z","title":"Seeing without Looking: Do Vision-Language Benchmarks Really Test Vision?","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-25T05:58:35.466105Z"},"links":{"citing_paper":"/paper/2605.22903"},"observation_digest":"sha256:a6760634c05661ffb802925f691c7ebfa5653b3033fa625db1b12bd757b32bd0","observation_id":"d9b41419-e78a-47a7-973a-0a00a3ca8605","resolution":{"observed_at":"2026-05-25T06:00:24.450173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On the predictive power of representation dispersion in lan- guage models","venue":null,"work_id":"9cc395df-d20c-40db-9e8f-b31fcab83b35","year":2026},"citing_paper":{"arxiv_id":"2605.22903","last_updated":"2026-05-21T17:35:04Z","snapshot_observed_at":"2026-08-07T15:24:22.420892Z","submitted_at":"2026-05-21T17:35:04Z","title":"Seeing without Looking: Do Vision-Language Benchmarks Really Test Vision?","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-25T05:58:35.466105Z"},"links":{"citing_paper":"/paper/2605.22903"},"observation_digest":"sha256:889ea92f2e5ed5f8ce61ae5bea54df2ec0bcad639ffe9e624e390e7fee066252","observation_id":"9a45dd42-6685-4f8a-971f-8f440030f551","resolution":{"observed_at":"2026-05-25T06:00:24.438835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual instruction tuning","venue":null,"work_id":"6070cff4-29c6-44fc-8bcf-b9298f1b373c","year":2023},"citing_paper":{"arxiv_id":"2605.22903","last_updated":"2026-05-21T17:35:04Z","snapshot_observed_at":"2026-08-07T15:24:22.420892Z","submitted_at":"2026-05-21T17:35:04Z","title":"Seeing without Looking: Do Vision-Language Benchmarks Really Test Vision?","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-25T05:58:35.466105Z"},"links":{"citing_paper":"/paper/2605.22903"},"observation_digest":"sha256:f3f321796e6e0a3fa51f0cb206a2749ba5363c633352c5b1e55fc75bb80fbdca","observation_id":"27a0c21f-cfe2-4c96-a0ca-7d1894b3c780","resolution":{"observed_at":"2026-05-25T06:00:24.452744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":"29c3ad04-81f0-4edf-a5a9-39b084e9fac3","year":2024},"citing_paper":{"arxiv_id":"2605.22903","last_updated":"2026-05-21T17:35:04Z","snapshot_observed_at":"2026-08-07T15:24:22.420892Z","submitted_at":"2026-05-21T17:35:04Z","title":"Seeing without Looking: Do Vision-Language Benchmarks Really Test Vision?","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-25T05:58:35.466105Z"},"links":{"citing_paper":"/paper/2605.22903"},"observation_digest":"sha256:7509edd3b458c6ca54e0ede196602e0c22d3d7806e68bd6f5f8045e53a24e8bc","observation_id":"45fec4a6-30ed-4fec-bacb-23411fda4561","resolution":{"observed_at":"2026-05-25T06:00:24.399786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Grounding dino: Marry- ing dino with grounded pre-training for open-set object de- tection","venue":null,"work_id":"c21fd254-3916-4026-8e2a-1b742e160f39","year":2024},"citing_paper":{"arxiv_id":"2605.22903","last_updated":"2026-05-21T17:35:04Z","snapshot_observed_at":"2026-08-07T15:24:22.420892Z","submitted_at":"2026-05-21T17:35:04Z","title":"Seeing without Looking: Do Vision-Language Benchmarks Really Test Vision?","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-25T05:58:35.466105Z"},"links":{"citing_paper":"/paper/2605.22903"},"observation_digest":"sha256:9da0ad6ea909c7882b03cb809dd6174bbf5bb36725e322e06b8c8b2262aad35d","observation_id":"d5a0d606-df2b-4ff0-8f2f-633a89bf4bf0","resolution":{"observed_at":"2026-05-25T06:00:24.444251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"H-pope: Hierarchical polling-based probing evaluation of hallucinations in large vision-language models","venue":null,"work_id":"231bd363-f0a8-4dee-9852-c5b3d645598d","year":2024},"citing_paper":{"arxiv_id":"2605.22903","last_updated":"2026-05-21T17:35:04Z","snapshot_observed_at":"2026-08-07T15:24:22.420892Z","submitted_at":"2026-05-21T17:35:04Z","title":"Seeing without Looking: Do Vision-Language Benchmarks Really Test Vision?","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-25T05:58:35.466105Z"},"links":{"citing_paper":"/paper/2605.22903"},"observation_digest":"sha256:59a5bd00e158b77a262ec4134b7c3c43e8f0ad4a3d0f4e55a993fd7c462771e0","observation_id":"ef4fa151-afe6-440d-b380-f383da9658f4","resolution":{"observed_at":"2026-05-25T06:00:24.378422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"cb125499-6d74-4154-b859-4ab9bafc5196","year":2021},"citing_paper":{"arxiv_id":"2605.22903","last_updated":"2026-05-21T17:35:04Z","snapshot_observed_at":"2026-08-07T15:24:22.420892Z","submitted_at":"2026-05-21T17:35:04Z","title":"Seeing without Looking: Do Vision-Language Benchmarks Really Test Vision?","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-25T05:58:35.466105Z"},"links":{"citing_paper":"/paper/2605.22903"},"observation_digest":"sha256:eb1ec1e3f8198ff3bfb7f38fec72c702e9ff6db0c1a96c4b7371f43bca415c76","observation_id":"7e12274c-f23f-4824-8eb8-f4eb33aa2341","resolution":{"observed_at":"2026-05-25T06:00:24.381260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sam 2: Segment anything in images and videos","venue":null,"work_id":"a5a67741-6318-480a-ae45-839f7dbaae95","year":null},"citing_paper":{"arxiv_id":"2605.22903","last_updated":"2026-05-21T17:35:04Z","snapshot_observed_at":"2026-08-07T15:24:22.420892Z","submitted_at":"2026-05-21T17:35:04Z","title":"Seeing without Looking: Do Vision-Language Benchmarks Really Test Vision?","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-25T05:58:35.466105Z"},"links":{"citing_paper":"/paper/2605.22903"},"observation_digest":"sha256:2bf45c05872f2e403865a8c12ef5e23242416a03198dd5185afb2f881bf5668c","observation_id":"260af8aa-7554-4818-8223-def6d7ceeac8","resolution":{"observed_at":"2026-05-25T06:00:24.384382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Object hallucination in image cap- tioning","venue":null,"work_id":"c71b4997-852d-437d-b2d5-aa5390d779cf","year":2019},"citing_paper":{"arxiv_id":"2605.22903","last_updated":"2026-05-21T17:35:04Z","snapshot_observed_at":"2026-08-07T15:24:22.420892Z","submitted_at":"2026-05-21T17:35:04Z","title":"Seeing without Looking: Do Vision-Language Benchmarks Really Test Vision?","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-25T05:58:35.466105Z"},"links":{"citing_paper":"/paper/2605.22903"},"observation_digest":"sha256:443fa8ab366b4c4a28b8bf61e9b3ea415ee80e4381b8c687d655b12c78fe5623","observation_id":"d93c712f-4fe3-4800-b463-ff00bc216cc2","resolution":{"observed_at":"2026-05-25T06:00:24.387523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The effective rank: A mea- sure of effective dimensionality","venue":null,"work_id":"d9746b2b-b397-4321-b3a0-e66680866ad7","year":2007},"citing_paper":{"arxiv_id":"2605.22903","last_updated":"2026-05-21T17:35:04Z","snapshot_observed_at":"2026-08-07T15:24:22.420892Z","submitted_at":"2026-05-21T17:35:04Z","title":"Seeing without Looking: Do Vision-Language Benchmarks Really Test Vision?","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-25T05:58:35.466105Z"},"links":{"citing_paper":"/paper/2605.22903"},"observation_digest":"sha256:2abd655fbcd39f399a748f32a2644d6587079bf2acc3170c1aa4f7841a680ad8","observation_id":"0daaaf25-dd19-4fb2-a546-397cc0b490e5","resolution":{"observed_at":"2026-05-25T06:00:24.390543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.23135","last_updated":"2025-07-30T22:30:48Z","snapshot_observed_at":"2026-08-06T11:07:51.867557Z","submitted_at":"2025-07-30T22:30:48Z","title":"ISO-Bench: Benchmarking Multimodal Causal Reasoning in Visual-Language Models through Procedural Plans","version":1},"cited_work":{"arxiv_id":"2507.23135","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.23135","snapshot_observed_at":"2026-07-02T07:16:44.552295Z","title":"Iso- bench: Benchmarking multimodal causal reasoning in visual-language models through procedural plans","venue":null,"work_id":"8ec98dcf-a363-4cd1-92d9-c14bfc195ade","year":2025},"citing_paper":{"arxiv_id":"2605.22903","last_updated":"2026-05-21T17:35:04Z","snapshot_observed_at":"2026-08-07T15:24:22.420892Z","submitted_at":"2026-05-21T17:35:04Z","title":"Seeing without Looking: Do Vision-Language Benchmarks Really Test Vision?","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-25T05:58:35.466105Z"},"links":{"cited_paper":"/paper/2507.23135","citing_paper":"/paper/2605.22903"},"observation_digest":"sha256:b4108e66cbe6b21d3a9fa3c9d97662ef8d3a76cef287953d858284c8a09a54ed","observation_id":"bb71e7c2-0b06-4a11-9331-f8655048e47c","resolution":{"observed_at":"2026-05-25T06:00:23.374343Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A-okvqa: A benchmark for visual question answering using world knowl- edge","venue":null,"work_id":"ef2847a9-9977-4037-9866-f788a8225d33","year":2022},"citing_paper":{"arxiv_id":"2605.22903","last_updated":"2026-05-21T17:35:04Z","snapshot_observed_at":"2026-08-07T15:24:22.420892Z","submitted_at":"2026-05-21T17:35:04Z","title":"Seeing without Looking: Do Vision-Language Benchmarks Really Test Vision?","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-25T05:58:35.466105Z"},"links":{"citing_paper":"/paper/2605.22903"},"observation_digest":"sha256:229ec24521e8cfde242b961fda96ca0fa7f9706d99ab6d1c1d9c5f673daac7d4","observation_id":"02ef412c-421d-4547-8520-da619b63df75","resolution":{"observed_at":"2026-05-25T06:00:24.363858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"From behavioral performance to internal competence: Interpreting vision-language models with vlm- lens","venue":null,"work_id":"7a8ef7b4-122a-440a-8a3b-2fad53dce161","year":2025},"citing_paper":{"arxiv_id":"2605.22903","last_updated":"2026-05-21T17:35:04Z","snapshot_observed_at":"2026-08-07T15:24:22.420892Z","submitted_at":"2026-05-21T17:35:04Z","title":"Seeing without Looking: Do Vision-Language Benchmarks Really Test Vision?","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-25T05:58:35.466105Z"},"links":{"citing_paper":"/paper/2605.22903"},"observation_digest":"sha256:990cd85a1f9d3a4ca6b74e934383255f0c8125d1210dee62062ce85a0851e739","observation_id":"120be32e-0543-4118-9022-460690a2f274","resolution":{"observed_at":"2026-05-25T06:00:24.357415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Openai gpt-5 system card","venue":null,"work_id":"ec406e6c-7273-485c-87c7-525b151ff27f","year":2025},"citing_paper":{"arxiv_id":"2605.22903","last_updated":"2026-05-21T17:35:04Z","snapshot_observed_at":"2026-08-07T15:24:22.420892Z","submitted_at":"2026-05-21T17:35:04Z","title":"Seeing without Looking: Do Vision-Language Benchmarks Really Test Vision?","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-25T05:58:35.466105Z"},"links":{"citing_paper":"/paper/2605.22903"},"observation_digest":"sha256:f785d0c26dd33b93688d3df4dfb099a0c419d6270d3e6a6adfa3773b400ea040","observation_id":"b0323300-e024-4c4f-87bf-9b40bbf91ebc","resolution":{"observed_at":"2026-05-25T06:00:24.375826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"From head to tail: Towards balanced representation in large vision-language models through adaptive data calibration","venue":null,"work_id":"c020c1b5-6541-4d1c-ba00-b33cf7ee0c7a","year":2025},"citing_paper":{"arxiv_id":"2605.22903","last_updated":"2026-05-21T17:35:04Z","snapshot_observed_at":"2026-08-07T15:24:22.420892Z","submitted_at":"2026-05-21T17:35:04Z","title":"Seeing without Looking: Do Vision-Language Benchmarks Really Test Vision?","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-25T05:58:35.466105Z"},"links":{"citing_paper":"/paper/2605.22903"},"observation_digest":"sha256:9001253229e3df46d274b4a4f2b8e06c68ec121d47d8af4d2ac44560aaf34183","observation_id":"b7f055d5-0f5d-48f1-b2d3-c4e6dc8bd7a1","resolution":{"observed_at":"2026-05-25T06:00:24.341090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"46e007f8-f363-402b-a564-e8d112f17a7e","year":2025},"citing_paper":{"arxiv_id":"2605.22903","last_updated":"2026-05-21T17:35:04Z","snapshot_observed_at":"2026-08-07T15:24:22.420892Z","submitted_at":"2026-05-21T17:35:04Z","title":"Seeing without Looking: Do Vision-Language Benchmarks Really Test Vision?","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-25T05:58:35.466105Z"},"links":{"citing_paper":"/paper/2605.22903"},"observation_digest":"sha256:aa5e112688197b3e4cbb8a1285ec8260a2cd2d0ed3efae763810365df808d4b1","observation_id":"0ad782f6-701b-4e5e-8fdb-606186261e0d","resolution":{"observed_at":"2026-05-25T06:00:24.343505Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"3241143f-0fbe-491b-93d7-7aafb15c7bdd","year":2025},"citing_paper":{"arxiv_id":"2605.22903","last_updated":"2026-05-21T17:35:04Z","snapshot_observed_at":"2026-08-07T15:24:22.420892Z","submitted_at":"2026-05-21T17:35:04Z","title":"Seeing without Looking: Do Vision-Language Benchmarks Really Test Vision?","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-25T05:58:35.466105Z"},"links":{"citing_paper":"/paper/2605.22903"},"observation_digest":"sha256:29671d8ccf771a3900eecdf14d3d5a51ba19ac2b64ab0a48c0b77f2922c1b041","observation_id":"d8014817-b633-43a5-8298-515acb0150f5","resolution":{"observed_at":"2026-05-25T06:00:24.346183Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Eyes wide shut? exploring the visual shortcomings of multimodal llms","venue":null,"work_id":"51cf4c98-9557-4b9e-85ae-7f88ac77ebd7","year":2024},"citing_paper":{"arxiv_id":"2605.22903","last_updated":"2026-05-21T17:35:04Z","snapshot_observed_at":"2026-08-07T15:24:22.420892Z","submitted_at":"2026-05-21T17:35:04Z","title":"Seeing without Looking: Do Vision-Language Benchmarks Really Test Vision?","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-25T05:58:35.466105Z"},"links":{"citing_paper":"/paper/2605.22903"},"observation_digest":"sha256:61194c94236a66c8b176a81b70471eaf4fe244c5b86cb209f18eab9f6ba4b930","observation_id":"b23ff460-f89e-400d-9b19-7971c18df27d","resolution":{"observed_at":"2026-05-25T06:00:24.348881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":"f7e1b745-f9a8-4f72-8e23-2b086e6bb954","year":2023},"citing_paper":{"arxiv_id":"2605.22903","last_updated":"2026-05-21T17:35:04Z","snapshot_observed_at":"2026-08-07T15:24:22.420892Z","submitted_at":"2026-05-21T17:35:04Z","title":"Seeing without Looking: Do Vision-Language Benchmarks Really Test Vision?","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-25T05:58:35.466105Z"},"links":{"citing_paper":"/paper/2605.22903"},"observation_digest":"sha256:0cc0a76fa5698060166987cefb3b1126ab0a95a2d37876b19df5392fcfe04af6","observation_id":"146fb5d1-6a65-41a6-915a-ab71d202d2a0","resolution":{"observed_at":"2026-05-25T06:00:24.393477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Amber: An llm-free multi- dimensional benchmark for mllms hallucination evaluation","venue":null,"work_id":"2bec9993-aaf6-4d13-bb2c-65964323d9d3","year":null},"citing_paper":{"arxiv_id":"2605.22903","last_updated":"2026-05-21T17:35:04Z","snapshot_observed_at":"2026-08-07T15:24:22.420892Z","submitted_at":"2026-05-21T17:35:04Z","title":"Seeing without Looking: Do Vision-Language Benchmarks Really Test Vision?","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-25T05:58:35.466105Z"},"links":{"citing_paper":"/paper/2605.22903"},"observation_digest":"sha256:39cca6636e56bf19cd65e2e5fe7b7089adc028da86992431d0b7050d55414248","observation_id":"7c74344a-82d7-4d5a-afdc-65411650281d","resolution":{"observed_at":"2026-05-25T06:00:24.458707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"no images","venue":null,"work_id":"b4fbe79c-3d19-4021-9d10-c0310d0aab6e","year":2025},"citing_paper":{"arxiv_id":"2605.22903","last_updated":"2026-05-21T17:35:04Z","snapshot_observed_at":"2026-08-07T15:24:22.420892Z","submitted_at":"2026-05-21T17:35:04Z","title":"Seeing without Looking: Do Vision-Language Benchmarks Really Test Vision?","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-25T05:58:35.466105Z"},"links":{"citing_paper":"/paper/2605.22903"},"observation_digest":"sha256:f69341f780f07d67ba1123631dc40d8cdef8eac1d5a19e4f66e004751fc1fe00","observation_id":"fcd32957-bc16-4b8f-9ce6-1d80b3451caa","resolution":{"observed_at":"2026-05-25T06:00:24.447119Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.22903","last_updated":"2026-05-21T17:35:04Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T15:24:22.420892Z","submitted_at":"2026-05-21T17:35:04Z","title":"Seeing without Looking: Do Vision-Language Benchmarks Really Test Vision?"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":3,"verified_exact":2,"verified_fuzzy":32},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 3 inbound Pith citation observations for arXiv:2605.22903."}