{"as_of":"2026-08-10T02:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:33c708430a705c00a60b3f1d431bd963617837ec943f614399d4b8bd8fbeba59","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":31,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T04:09:13.161806Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2407.06581","last_updated":"2025-03-27T16:16:09Z","snapshot_observed_at":"2026-08-10T02:34:18.448092Z","submitted_at":"2024-07-09T06:20:17Z","title":"Vision language models are blind: Failing to translate detailed visual features into words","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06581","snapshot_observed_at":"2026-08-09T04:09:13.161806Z","title":"Vision language models are blind, July 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04389","last_updated":"2025-02-05T23:40:26Z","snapshot_observed_at":"2026-08-10T02:34:55.805120Z","submitted_at":"2025-02-05T23:40:26Z","title":"Overcoming Vision Language Model Challenges in Diagram Understanding: A Proof-of-Concept with XML-Driven Large Language Models Solutions","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-09T04:09:13.161806Z"},"links":{"cited_paper":"/paper/2407.06581","citing_paper":"/paper/2502.04389"},"observation_digest":"sha256:85e12ca2dd7d7bd9e990e9b80f7e2b553136b08ccb4091c75f3b52ae90f23688","observation_id":"85364f4f-4887-461d-a6f9-59f4f65d3781","resolution":{"observed_at":"2026-08-09T04:09:13.161806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06581","last_updated":"2025-03-27T16:16:09Z","snapshot_observed_at":"2026-08-10T02:34:18.448092Z","submitted_at":"2024-07-09T06:20:17Z","title":"Vision language models are blind: Failing to translate detailed visual features into words","version":6},"cited_work":{"arxiv_id":"2407.06581","doi":"10.48550/arxiv.2407.06581","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.06581","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vision language models are blind","venue":"arXiv (Cornell University)","work_id":"21fe7700-6786-4b12-a1dd-88d16b4403c2","year":2024},"citing_paper":{"arxiv_id":"2503.16549","last_updated":"2026-04-18T11:44:37Z","snapshot_observed_at":"2026-08-08T08:24:44.422314Z","submitted_at":"2025-03-19T11:46:19Z","title":"MathFlow: Enhancing the Perceptual Flow of MLLMs for Visual Mathematical Problems","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-22T22:55:34.238427Z"},"links":{"cited_paper":"/paper/2407.06581","citing_paper":"/paper/2503.16549"},"observation_digest":"sha256:be86f43ea25a77f7c175dd02532d33e23d2725fbd7614685ea930e745bb8d5aa","observation_id":"2d172e97-d16d-4b23-96e8-07f47b5f7817","resolution":{"observed_at":"2026-05-22T22:57:13.399915Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06581","last_updated":"2025-03-27T16:16:09Z","snapshot_observed_at":"2026-08-10T02:34:18.448092Z","submitted_at":"2024-07-09T06:20:17Z","title":"Vision language models are blind: Failing to translate detailed visual features into words","version":6},"cited_work":{"arxiv_id":"2407.06581","doi":"10.48550/arxiv.2407.06581","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.06581","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vision language models are blind","venue":"arXiv (Cornell University)","work_id":"21fe7700-6786-4b12-a1dd-88d16b4403c2","year":2024},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":109,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"cited_paper":"/paper/2407.06581","citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:ad3a3e9199f77115636ef69116a5a5e58a686e82b1908affa9b7048b1b0189e3","observation_id":"90ab0e07-92d8-469e-a697-85fb8720ac3f","resolution":{"observed_at":"2026-05-11T05:26:06.234599Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06581","last_updated":"2025-03-27T16:16:09Z","snapshot_observed_at":"2026-08-10T02:34:18.448092Z","submitted_at":"2024-07-09T06:20:17Z","title":"Vision language models are blind: Failing to translate detailed visual features into words","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06581","snapshot_observed_at":"2026-08-07T13:19:31.991717Z","title":"Vision language models are blind,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22112","last_updated":"2025-05-28T08:40:55Z","snapshot_observed_at":"2026-08-10T01:18:27.514402Z","submitted_at":"2025-05-28T08:40:55Z","title":"Visual Large Language Models Exhibit Human-Level Cognitive Flexibility in the Wisconsin Card Sorting Test","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:19:31.991717Z"},"links":{"cited_paper":"/paper/2407.06581","citing_paper":"/paper/2505.22112"},"observation_digest":"sha256:d5aa4c0f5652272a6472ae5b8425c001d5a6d30df47b43660919e366128bc10b","observation_id":"fea50c66-695f-4e0d-8199-6795462b794a","resolution":{"observed_at":"2026-08-07T13:19:31.991717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06581","last_updated":"2025-03-27T16:16:09Z","snapshot_observed_at":"2026-08-10T02:34:18.448092Z","submitted_at":"2024-07-09T06:20:17Z","title":"Vision language models are blind: Failing to translate detailed visual features into words","version":6},"cited_work":{"arxiv_id":"2407.06581","doi":"10.48550/arxiv.2407.06581","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.06581","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vision language models are blind","venue":"arXiv (Cornell University)","work_id":"21fe7700-6786-4b12-a1dd-88d16b4403c2","year":2024},"citing_paper":{"arxiv_id":"2505.23678","last_updated":"2026-05-15T17:27:46Z","snapshot_observed_at":"2026-08-02T04:30:21.704758Z","submitted_at":"2025-05-29T17:20:26Z","title":"Grounded Reinforcement Learning for Visual Reasoning","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-22T01:05:18.801388Z"},"links":{"cited_paper":"/paper/2407.06581","citing_paper":"/paper/2505.23678"},"observation_digest":"sha256:6bf26d07a93546042e3cf140b44c82f19ab3e70f8b5e936b76dab9c1ed1b092e","observation_id":"25b7d359-8125-4274-9e8c-390a39552d4b","resolution":{"observed_at":"2026-05-22T01:05:52.218019Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06581","last_updated":"2025-03-27T16:16:09Z","snapshot_observed_at":"2026-08-10T02:34:18.448092Z","submitted_at":"2024-07-09T06:20:17Z","title":"Vision language models are blind: Failing to translate detailed visual features into words","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06581","snapshot_observed_at":"2026-08-07T11:04:14.204341Z","title":"Rahmanzadehgervi, L","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-10T00:26:12.133363Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T11:04:14.204341Z"},"links":{"cited_paper":"/paper/2407.06581","citing_paper":"/paper/2506.03569"},"observation_digest":"sha256:c892cd4ad56aa855a97c1b10db6c072df3a0ac2254b0ef80a0c2df5682b46ae6","observation_id":"4a7c6114-3b17-4b08-a388-ef2a0bdc0a10","resolution":{"observed_at":"2026-08-07T11:04:14.204341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06581","last_updated":"2025-03-27T16:16:09Z","snapshot_observed_at":"2026-08-10T02:34:18.448092Z","submitted_at":"2024-07-09T06:20:17Z","title":"Vision language models are blind: Failing to translate detailed visual features into words","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06581","snapshot_observed_at":"2026-08-06T22:22:37.423858Z","title":"Preprint, arXiv:2407.06581","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.21876","last_updated":"2025-06-27T03:24:29Z","snapshot_observed_at":"2026-08-09T21:07:26.169953Z","submitted_at":"2025-06-27T03:24:29Z","title":"Do Vision-Language Models Have Internal World Models? Towards an Atomic Evaluation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:37.423858Z"},"links":{"cited_paper":"/paper/2407.06581","citing_paper":"/paper/2506.21876"},"observation_digest":"sha256:c2ab7aa3b194dc47467afbace64e26469b8303f43140b11ee5a3fde2b173924d","observation_id":"e34fa55c-165e-4d18-b51e-fd7d9700d18d","resolution":{"observed_at":"2026-08-06T22:22:37.423858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06581","last_updated":"2025-03-27T16:16:09Z","snapshot_observed_at":"2026-08-10T02:34:18.448092Z","submitted_at":"2024-07-09T06:20:17Z","title":"Vision language models are blind: Failing to translate detailed visual features into words","version":6},"cited_work":{"arxiv_id":"2407.06581","doi":"10.48550/arxiv.2407.06581","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.06581","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vision language models are blind","venue":"arXiv (Cornell University)","work_id":"21fe7700-6786-4b12-a1dd-88d16b4403c2","year":2024},"citing_paper":{"arxiv_id":"2507.01955","last_updated":"2026-05-01T00:57:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-02T17:59:07Z","title":"How Well Does GPT-4o Understand Vision? Evaluating Multimodal Foundation Models on Standard Computer Vision Tasks","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-19T05:55:09.188048Z"},"links":{"cited_paper":"/paper/2407.06581","citing_paper":"/paper/2507.01955"},"observation_digest":"sha256:1a3380a64d045d327828ee8437ab94f1b1c38c42477973ad51bc37f09bffbf98","observation_id":"8bd60bd1-6dd6-41cf-8065-10bf0bc2c12c","resolution":{"observed_at":"2026-05-19T05:57:07.991005Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06581","last_updated":"2025-03-27T16:16:09Z","snapshot_observed_at":"2026-08-10T02:34:18.448092Z","submitted_at":"2024-07-09T06:20:17Z","title":"Vision language models are blind: Failing to translate detailed visual features into words","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06581","snapshot_observed_at":"2026-08-06T17:25:34.429111Z","title":"Vision language models are blind,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10972","last_updated":"2025-07-15T04:31:52Z","snapshot_observed_at":"2026-08-10T02:34:51.528833Z","submitted_at":"2025-07-15T04:31:52Z","title":"Teach Me Sign: Stepwise Prompting LLM for Sign Language Production","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:34.429111Z"},"links":{"cited_paper":"/paper/2407.06581","citing_paper":"/paper/2507.10972"},"observation_digest":"sha256:946ff0cb0f14b96180663c45d7b6ca9c802323333a8d1ef6801fb04b9e0954dd","observation_id":"54beb4b6-eab4-4c6a-a62f-4932d1ec6ffa","resolution":{"observed_at":"2026-08-06T17:25:34.429111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06581","last_updated":"2025-03-27T16:16:09Z","snapshot_observed_at":"2026-08-10T02:34:18.448092Z","submitted_at":"2024-07-09T06:20:17Z","title":"Vision language models are blind: Failing to translate detailed visual features into words","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06581","snapshot_observed_at":"2026-08-05T11:56:10.881826Z","title":"Vision language models are blind, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.02175","last_updated":"2025-09-04T16:38:44Z","snapshot_observed_at":"2026-08-05T11:56:06.572610Z","submitted_at":"2025-09-02T10:32:58Z","title":"Understanding Space Is Rocket Science -- Only Top Reasoning Models Can Solve Spatial Understanding Tasks","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-05T11:56:10.881826Z"},"links":{"cited_paper":"/paper/2407.06581","citing_paper":"/paper/2509.02175"},"observation_digest":"sha256:00c6771ac3699f28999a5dd41b3f8415554990e43bcd63a34ae6835bc4b6e283","observation_id":"f940b53a-8cb9-47ba-ba9b-7bc8d974cbef","resolution":{"observed_at":"2026-08-05T11:56:10.881826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06581","last_updated":"2025-03-27T16:16:09Z","snapshot_observed_at":"2026-08-10T02:34:18.448092Z","submitted_at":"2024-07-09T06:20:17Z","title":"Vision language models are blind: Failing to translate detailed visual features into words","version":6},"cited_work":{"arxiv_id":"2407.06581","doi":"10.48550/arxiv.2407.06581","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.06581","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vision language models are blind","venue":"arXiv (Cornell University)","work_id":"21fe7700-6786-4b12-a1dd-88d16b4403c2","year":2024},"citing_paper":{"arxiv_id":"2511.16518","last_updated":"2026-04-28T11:37:12Z","snapshot_observed_at":"2026-07-06T22:36:30.947164Z","submitted_at":"2025-11-20T16:34:55Z","title":"MiMo-Embodied: X-Embodied Foundation Model Technical Report","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-17T20:40:54.096289Z"},"links":{"cited_paper":"/paper/2407.06581","citing_paper":"/paper/2511.16518"},"observation_digest":"sha256:169b4c399387b194feb2948b0f03535ef8609e2b7686cacb911d1df5ecfe4acd","observation_id":"50c24374-7d38-43d7-8e26-b3ad50485149","resolution":{"observed_at":"2026-05-17T20:42:05.704948Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06581","last_updated":"2025-03-27T16:16:09Z","snapshot_observed_at":"2026-08-10T02:34:18.448092Z","submitted_at":"2024-07-09T06:20:17Z","title":"Vision language models are blind: Failing to translate detailed visual features into words","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06581","snapshot_observed_at":"2026-07-15T13:27:51.848177Z","title":"R., and Nguyen, A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.07109","last_updated":"2026-05-30T07:36:55Z","snapshot_observed_at":"2026-08-06T06:50:59.197329Z","submitted_at":"2026-03-07T08:40:09Z","title":"Vision Language Models Cannot Reason About Physical Transformation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-15T13:27:51.848177Z"},"links":{"cited_paper":"/paper/2407.06581","citing_paper":"/paper/2603.07109"},"observation_digest":"sha256:37c7c7ea7b363d58aa80f2b4c3d5f90f6c4ba61b00c40e7e680c316dc1dd9548","observation_id":"fb0aee7d-01c0-4023-a49a-babad6dda0c5","resolution":{"observed_at":"2026-07-15T13:27:51.848177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06581","last_updated":"2025-03-27T16:16:09Z","snapshot_observed_at":"2026-08-10T02:34:18.448092Z","submitted_at":"2024-07-09T06:20:17Z","title":"Vision language models are blind: Failing to translate detailed visual features into words","version":6},"cited_work":{"arxiv_id":"2407.06581","doi":"10.48550/arxiv.2407.06581","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.06581","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vision language models are blind","venue":"arXiv (Cornell University)","work_id":"21fe7700-6786-4b12-a1dd-88d16b4403c2","year":2024},"citing_paper":{"arxiv_id":"2604.12357","last_updated":"2026-04-14T06:47:47Z","snapshot_observed_at":"2026-07-06T23:00:32.607699Z","submitted_at":"2026-04-14T06:47:47Z","title":"ReflectCAP: Detailed Image Captioning with Reflective Memory","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T16:11:10.598413Z"},"links":{"cited_paper":"/paper/2407.06581","citing_paper":"/paper/2604.12357"},"observation_digest":"sha256:ea1712e4c0f8127077a2c2ed1cfd3ae997de3c5610b7b3ca13fd8a375ff093c7","observation_id":"5f717ea5-af40-4dee-a8c1-6ba866d69223","resolution":{"observed_at":"2026-05-11T09:11:02.305599Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06581","last_updated":"2025-03-27T16:16:09Z","snapshot_observed_at":"2026-08-10T02:34:18.448092Z","submitted_at":"2024-07-09T06:20:17Z","title":"Vision language models are blind: Failing to translate detailed visual features into words","version":6},"cited_work":{"arxiv_id":"2407.06581","doi":"10.48550/arxiv.2407.06581","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.06581","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vision language models are blind","venue":"arXiv (Cornell University)","work_id":"21fe7700-6786-4b12-a1dd-88d16b4403c2","year":2024},"citing_paper":{"arxiv_id":"2604.18512","last_updated":"2026-04-20T17:06:20Z","snapshot_observed_at":"2026-08-04T23:53:40.564219Z","submitted_at":"2026-04-20T17:06:20Z","title":"S2H-DPO: Hardness-Aware Preference Optimization for Vision-Language Models","version":1},"reference_index":118,"source":"arxiv_source","source_observed_at":"2026-05-10T05:38:01.208136Z"},"links":{"cited_paper":"/paper/2407.06581","citing_paper":"/paper/2604.18512"},"observation_digest":"sha256:04415089775cdead4db31a1aad43afad9ac786d448dbc946e78accd53eadd6e1","observation_id":"507e832f-3a9e-4d07-b76f-eac62eab3c70","resolution":{"observed_at":"2026-05-10T05:41:02.274527Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06581","last_updated":"2025-03-27T16:16:09Z","snapshot_observed_at":"2026-08-10T02:34:18.448092Z","submitted_at":"2024-07-09T06:20:17Z","title":"Vision language models are blind: Failing to translate detailed visual features into words","version":6},"cited_work":{"arxiv_id":"2407.06581","doi":"10.48550/arxiv.2407.06581","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.06581","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vision language models are blind","venue":"arXiv (Cornell University)","work_id":"21fe7700-6786-4b12-a1dd-88d16b4403c2","year":2024},"citing_paper":{"arxiv_id":"2604.21921","last_updated":"2026-04-23T17:58:38Z","snapshot_observed_at":"2026-07-06T23:08:23.939574Z","submitted_at":"2026-04-23T17:58:38Z","title":"Context Unrolling in Omni Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-09T22:02:57.841111Z"},"links":{"cited_paper":"/paper/2407.06581","citing_paper":"/paper/2604.21921"},"observation_digest":"sha256:2d82ccb20326bd939125531389484d1762afe4248a5fdddcd3e8baab77818a5c","observation_id":"53b4db02-75ec-40cf-9ebc-67c356f64060","resolution":{"observed_at":"2026-05-11T14:21:04.871090Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06581","last_updated":"2025-03-27T16:16:09Z","snapshot_observed_at":"2026-08-10T02:34:18.448092Z","submitted_at":"2024-07-09T06:20:17Z","title":"Vision language models are blind: Failing to translate detailed visual features into words","version":6},"cited_work":{"arxiv_id":"2407.06581","doi":"10.48550/arxiv.2407.06581","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.06581","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vision language models are blind","venue":"arXiv (Cornell University)","work_id":"21fe7700-6786-4b12-a1dd-88d16b4403c2","year":2024},"citing_paper":{"arxiv_id":"2605.08816","last_updated":"2026-05-09T09:10:00Z","snapshot_observed_at":"2026-07-31T05:32:25.461400Z","submitted_at":"2026-05-09T09:10:00Z","title":"Mirror, Mirror on the Wall: Can VLM Agents Tell Who They Are at All?","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-12T03:35:39.884350Z"},"links":{"cited_paper":"/paper/2407.06581","citing_paper":"/paper/2605.08816"},"observation_digest":"sha256:1ff0fa4c343ce5bde4fc5f56badd5aded0199f34d3166d481fa1808bacc8143c","observation_id":"74437cb0-9d1c-4e63-bed6-ff4a7af29f26","resolution":{"observed_at":"2026-05-12T03:36:18.598684Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06581","last_updated":"2025-03-27T16:16:09Z","snapshot_observed_at":"2026-08-10T02:34:18.448092Z","submitted_at":"2024-07-09T06:20:17Z","title":"Vision language models are blind: Failing to translate detailed visual features into words","version":6},"cited_work":{"arxiv_id":"2407.06581","doi":"10.48550/arxiv.2407.06581","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.06581","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vision language models are blind","venue":"arXiv (Cornell University)","work_id":"21fe7700-6786-4b12-a1dd-88d16b4403c2","year":2024},"citing_paper":{"arxiv_id":"2605.20448","last_updated":"2026-06-18T10:11:04Z","snapshot_observed_at":"2026-07-31T21:41:31.719093Z","submitted_at":"2026-05-19T20:01:19Z","title":"Do Vision-Language Models Understand 3D Scenes or Just Catalogue Objects?","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-21T06:55:04.657347Z"},"links":{"cited_paper":"/paper/2407.06581","citing_paper":"/paper/2605.20448"},"observation_digest":"sha256:3abb3c85e25ca135d283c2e8aa8dab4b0e346c1b9cca695c3923bee38ed5d57d","observation_id":"fdb723b4-7ba4-4341-8e5a-1cc979e0f73d","resolution":{"observed_at":"2026-05-21T06:59:45.707454Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06581","last_updated":"2025-03-27T16:16:09Z","snapshot_observed_at":"2026-08-10T02:34:18.448092Z","submitted_at":"2024-07-09T06:20:17Z","title":"Vision language models are blind: Failing to translate detailed visual features into words","version":6},"cited_work":{"arxiv_id":"2407.06581","doi":"10.48550/arxiv.2407.06581","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.06581","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vision language models are blind","venue":"arXiv (Cornell University)","work_id":"21fe7700-6786-4b12-a1dd-88d16b4403c2","year":2024},"citing_paper":{"arxiv_id":"2605.20448","last_updated":"2026-06-18T10:11:04Z","snapshot_observed_at":"2026-07-31T21:41:31.719093Z","submitted_at":"2026-05-19T20:01:19Z","title":"Do Vision-Language Models Understand 3D Scenes or Just Catalogue Objects?","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-30T17:52:26.785086Z"},"links":{"cited_paper":"/paper/2407.06581","citing_paper":"/paper/2605.20448"},"observation_digest":"sha256:b8f36f38b25c649eed23bd5ba593bd5bc3a4c5c124b429f778fa4098f06678e0","observation_id":"a0e4a19a-dfff-4ede-84aa-bc715d538aab","resolution":{"observed_at":"2026-06-30T17:54:57.786081Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06581","last_updated":"2025-03-27T16:16:09Z","snapshot_observed_at":"2026-08-10T02:34:18.448092Z","submitted_at":"2024-07-09T06:20:17Z","title":"Vision language models are blind: Failing to translate detailed visual features into words","version":6},"cited_work":{"arxiv_id":"2407.06581","doi":"10.48550/arxiv.2407.06581","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.06581","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vision language models are blind","venue":"arXiv (Cornell University)","work_id":"21fe7700-6786-4b12-a1dd-88d16b4403c2","year":2024},"citing_paper":{"arxiv_id":"2605.25427","last_updated":"2026-05-25T04:58:23Z","snapshot_observed_at":"2026-07-06T23:35:21.734804Z","submitted_at":"2026-05-25T04:58:23Z","title":"Binding Visual Features Point by Point","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-29T22:56:44.793896Z"},"links":{"cited_paper":"/paper/2407.06581","citing_paper":"/paper/2605.25427"},"observation_digest":"sha256:5fc7d10d33551fec1c24b2499acdc6eb176124293bd6921ad3754ccaaf5bdf8f","observation_id":"e5f8806d-6710-47e2-a050-161487d2d9e5","resolution":{"observed_at":"2026-06-29T23:44:03.285291Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06581","last_updated":"2025-03-27T16:16:09Z","snapshot_observed_at":"2026-08-10T02:34:18.448092Z","submitted_at":"2024-07-09T06:20:17Z","title":"Vision language models are blind: Failing to translate detailed visual features into words","version":6},"cited_work":{"arxiv_id":"2407.06581","doi":"10.48550/arxiv.2407.06581","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.06581","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vision language models are blind","venue":"arXiv (Cornell University)","work_id":"21fe7700-6786-4b12-a1dd-88d16b4403c2","year":2024},"citing_paper":{"arxiv_id":"2605.31148","last_updated":"2026-05-29T10:59:26Z","snapshot_observed_at":"2026-07-06T23:40:22.583302Z","submitted_at":"2026-05-29T10:59:26Z","title":"SpatialAct: Probing Spatial Reasoning-to-Action Capabilities of VLM Agents in 3D Scenes","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-28T22:47:46.542267Z"},"links":{"cited_paper":"/paper/2407.06581","citing_paper":"/paper/2605.31148"},"observation_digest":"sha256:2a2445761724711a0f835c9f618dd0f610dd859bda3c5dd54b8e7b07c6ae4a3a","observation_id":"d137ed69-6c52-4aad-b193-8cee47b04f23","resolution":{"observed_at":"2026-06-28T22:52:45.666857Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06581","last_updated":"2025-03-27T16:16:09Z","snapshot_observed_at":"2026-08-10T02:34:18.448092Z","submitted_at":"2024-07-09T06:20:17Z","title":"Vision language models are blind: Failing to translate detailed visual features into words","version":6},"cited_work":{"arxiv_id":"2407.06581","doi":"10.48550/arxiv.2407.06581","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.06581","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vision language models are blind","venue":"arXiv (Cornell University)","work_id":"21fe7700-6786-4b12-a1dd-88d16b4403c2","year":2024},"citing_paper":{"arxiv_id":"2606.00564","last_updated":"2026-05-30T06:34:37Z","snapshot_observed_at":"2026-08-10T02:33:45.391037Z","submitted_at":"2026-05-30T06:34:37Z","title":"Decomposed On-Policy Distillation for Vision-Language Reasoning: Steering Gradients for Visual Grounding","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-06-28T19:26:37.281563Z"},"links":{"cited_paper":"/paper/2407.06581","citing_paper":"/paper/2606.00564"},"observation_digest":"sha256:90e209f1ee1eeb87cd9b75b57733feb6b5b425d47ded9d542ff1f5e6a823875c","observation_id":"e26043c4-e69a-4fba-bf18-736ff1b56518","resolution":{"observed_at":"2026-06-28T19:32:35.051325Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06581","last_updated":"2025-03-27T16:16:09Z","snapshot_observed_at":"2026-08-10T02:34:18.448092Z","submitted_at":"2024-07-09T06:20:17Z","title":"Vision language models are blind: Failing to translate detailed visual features into words","version":6},"cited_work":{"arxiv_id":"2407.06581","doi":"10.48550/arxiv.2407.06581","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.06581","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vision language models are blind","venue":"arXiv (Cornell University)","work_id":"21fe7700-6786-4b12-a1dd-88d16b4403c2","year":2024},"citing_paper":{"arxiv_id":"2606.07639","last_updated":"2026-06-01T09:07:15Z","snapshot_observed_at":"2026-07-06T23:47:15.041928Z","submitted_at":"2026-06-01T09:07:15Z","title":"MOSS-Video-Preview: Toward Real-Time Video Understanding via Cross-Attention","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-28T15:22:31.310003Z"},"links":{"cited_paper":"/paper/2407.06581","citing_paper":"/paper/2606.07639"},"observation_digest":"sha256:cba80f181d1109e5ba8c70c417a01c085b3befefaab7c29fd9478db86d57cdb2","observation_id":"8068ad65-ea6a-480c-9149-ba38d04dddc3","resolution":{"observed_at":"2026-07-01T22:26:17.978721Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06581","last_updated":"2025-03-27T16:16:09Z","snapshot_observed_at":"2026-08-10T02:34:18.448092Z","submitted_at":"2024-07-09T06:20:17Z","title":"Vision language models are blind: Failing to translate detailed visual features into words","version":6},"cited_work":{"arxiv_id":"2407.06581","doi":"10.48550/arxiv.2407.06581","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.06581","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vision language models are blind","venue":"arXiv (Cornell University)","work_id":"21fe7700-6786-4b12-a1dd-88d16b4403c2","year":2024},"citing_paper":{"arxiv_id":"2606.07861","last_updated":"2026-06-05T21:49:34Z","snapshot_observed_at":"2026-08-02T02:56:55.871904Z","submitted_at":"2026-06-05T21:49:34Z","title":"The Last Visible Pixel: Probing Fine-Scale Perception in Vision-Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-27T21:58:53.702009Z"},"links":{"cited_paper":"/paper/2407.06581","citing_paper":"/paper/2606.07861"},"observation_digest":"sha256:e7a523d9ad213a9efda7b58f569b7d3fe73c5825e45f4a848a59ccf0c2da965d","observation_id":"a38d71dd-185c-4860-8360-5c4924cca342","resolution":{"observed_at":"2026-07-02T17:37:14.439678Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06581","last_updated":"2025-03-27T16:16:09Z","snapshot_observed_at":"2026-08-10T02:34:18.448092Z","submitted_at":"2024-07-09T06:20:17Z","title":"Vision language models are blind: Failing to translate detailed visual features into words","version":6},"cited_work":{"arxiv_id":"2407.06581","doi":"10.48550/arxiv.2407.06581","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.06581","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vision language models are blind","venue":"arXiv (Cornell University)","work_id":"21fe7700-6786-4b12-a1dd-88d16b4403c2","year":2024},"citing_paper":{"arxiv_id":"2606.18216","last_updated":"2026-06-16T17:46:02Z","snapshot_observed_at":"2026-08-09T07:41:33.424534Z","submitted_at":"2026-06-16T17:46:02Z","title":"Zone of Proximal Policy Optimization: Teacher in Prompts, Not Gradients","version":1},"reference_index":142,"source":"pdf_text","source_observed_at":"2026-06-27T01:08:52.981296Z"},"links":{"cited_paper":"/paper/2407.06581","citing_paper":"/paper/2606.18216"},"observation_digest":"sha256:09dc695ba4c80e67fed35d7b10396e67d80aa6431b120bffc1996c1447b537a9","observation_id":"58793a2d-0661-4d17-a12c-6c5c5216f1e3","resolution":{"observed_at":"2026-07-03T20:48:56.076380Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06581","last_updated":"2025-03-27T16:16:09Z","snapshot_observed_at":"2026-08-10T02:34:18.448092Z","submitted_at":"2024-07-09T06:20:17Z","title":"Vision language models are blind: Failing to translate detailed visual features into words","version":6},"cited_work":{"arxiv_id":"2407.06581","doi":"10.48550/arxiv.2407.06581","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.06581","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vision language models are blind","venue":"arXiv (Cornell University)","work_id":"21fe7700-6786-4b12-a1dd-88d16b4403c2","year":2024},"citing_paper":{"arxiv_id":"2606.20770","last_updated":"2026-06-18T15:11:48Z","snapshot_observed_at":"2026-07-06T23:55:53.019607Z","submitted_at":"2026-06-18T15:11:48Z","title":"Beyond 'One Language, One Script': Quantifying Orthographic Bias in Multilingual VLMs with PuMVR","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-26T17:32:39.976049Z"},"links":{"cited_paper":"/paper/2407.06581","citing_paper":"/paper/2606.20770"},"observation_digest":"sha256:6c1d8c2d2327c0d6ffa2bfb3edf0fca184aee7a74a0b3eb19a76aa99400d09fd","observation_id":"287748e6-e590-4333-866d-e815b816a8c8","resolution":{"observed_at":"2026-07-04T03:49:31.073799Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06581","last_updated":"2025-03-27T16:16:09Z","snapshot_observed_at":"2026-08-10T02:34:18.448092Z","submitted_at":"2024-07-09T06:20:17Z","title":"Vision language models are blind: Failing to translate detailed visual features into words","version":6},"cited_work":{"arxiv_id":"2407.06581","doi":"10.48550/arxiv.2407.06581","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.06581","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vision language models are blind","venue":"arXiv (Cornell University)","work_id":"21fe7700-6786-4b12-a1dd-88d16b4403c2","year":2024},"citing_paper":{"arxiv_id":"2606.25066","last_updated":"2026-06-23T18:19:16Z","snapshot_observed_at":"2026-08-07T15:13:57.213362Z","submitted_at":"2026-06-23T18:19:16Z","title":"Do vision-language models search like humans? Reasoning tokens as a reaction-time analog in classic visual-search paradigms","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-25T22:58:41.991573Z"},"links":{"cited_paper":"/paper/2407.06581","citing_paper":"/paper/2606.25066"},"observation_digest":"sha256:0f5fb014b840ea8d9e3dd3c250e49ba1ed5a7b2b29e1cfa3d92251dd4c5ea492","observation_id":"1626bef0-46b0-43d5-9dcb-86301cac682a","resolution":{"observed_at":"2026-07-04T18:10:02.337868Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06581","last_updated":"2025-03-27T16:16:09Z","snapshot_observed_at":"2026-08-10T02:34:18.448092Z","submitted_at":"2024-07-09T06:20:17Z","title":"Vision language models are blind: Failing to translate detailed visual features into words","version":6},"cited_work":{"arxiv_id":"2407.06581","doi":"10.48550/arxiv.2407.06581","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.06581","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vision language models are blind","venue":"arXiv (Cornell University)","work_id":"21fe7700-6786-4b12-a1dd-88d16b4403c2","year":2024},"citing_paper":{"arxiv_id":"2606.26529","last_updated":"2026-08-02T07:15:01Z","snapshot_observed_at":"2026-08-06T23:24:45.715072Z","submitted_at":"2026-06-25T02:09:08Z","title":"The inattentional gap in task conditioned AI models that omit otherwise reportable safety critical signals","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-26T05:24:11.228672Z"},"links":{"cited_paper":"/paper/2407.06581","citing_paper":"/paper/2606.26529"},"observation_digest":"sha256:b05dfcb5284ea146fb0d1a2e22a7985f01e3ba7c28f1a419423c1aa833f45a8e","observation_id":"fe5085fe-7473-43f1-869e-7b787f611cb6","resolution":{"observed_at":"2026-07-04T13:19:50.238996Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06581","last_updated":"2025-03-27T16:16:09Z","snapshot_observed_at":"2026-08-10T02:34:18.448092Z","submitted_at":"2024-07-09T06:20:17Z","title":"Vision language models are blind: Failing to translate detailed visual features into words","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06581","snapshot_observed_at":"2026-07-12T11:58:52.700648Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.26529","last_updated":"2026-08-02T07:15:01Z","snapshot_observed_at":"2026-08-06T23:24:45.715072Z","submitted_at":"2026-06-25T02:09:08Z","title":"The inattentional gap in task conditioned AI models that omit otherwise reportable safety critical signals","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-12T11:58:52.700648Z"},"links":{"cited_paper":"/paper/2407.06581","citing_paper":"/paper/2606.26529"},"observation_digest":"sha256:3eba495acf1cfa474bf6d9f6b7b060be66948d8f113b0ac6156054037411b9e6","observation_id":"6dd3fd32-7674-4264-9f5e-f80b07eefd3f","resolution":{"observed_at":"2026-07-12T11:58:52.700648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06581","last_updated":"2025-03-27T16:16:09Z","snapshot_observed_at":"2026-08-10T02:34:18.448092Z","submitted_at":"2024-07-09T06:20:17Z","title":"Vision language models are blind: Failing to translate detailed visual features into words","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06581","snapshot_observed_at":"2026-08-04T04:42:46.146973Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.26529","last_updated":"2026-08-02T07:15:01Z","snapshot_observed_at":"2026-08-06T23:24:45.715072Z","submitted_at":"2026-06-25T02:09:08Z","title":"The inattentional gap in task conditioned AI models that omit otherwise reportable safety critical signals","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T04:42:46.146973Z"},"links":{"cited_paper":"/paper/2407.06581","citing_paper":"/paper/2606.26529"},"observation_digest":"sha256:444e73e43f8d51f74649adbd58e6b23b107022132bd8be1318c4106d83b3d6d1","observation_id":"90a92488-f13b-4b92-a37b-504dac08ccda","resolution":{"observed_at":"2026-08-04T04:42:46.146973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06581","last_updated":"2025-03-27T16:16:09Z","snapshot_observed_at":"2026-08-10T02:34:18.448092Z","submitted_at":"2024-07-09T06:20:17Z","title":"Vision language models are blind: Failing to translate detailed visual features into words","version":6},"cited_work":{"arxiv_id":"2407.06581","doi":"10.48550/arxiv.2407.06581","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.06581","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vision language models are blind","venue":"arXiv (Cornell University)","work_id":"21fe7700-6786-4b12-a1dd-88d16b4403c2","year":2024},"citing_paper":{"arxiv_id":"2607.00434","last_updated":"2026-07-01T04:45:41Z","snapshot_observed_at":"2026-08-08T21:41:10.025868Z","submitted_at":"2026-07-01T04:45:41Z","title":"Information-Regularized Attention for Visual-Centric Reasoning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-02T15:12:43.475802Z"},"links":{"cited_paper":"/paper/2407.06581","citing_paper":"/paper/2607.00434"},"observation_digest":"sha256:f179c68be65c1d79a910a608a47db53175b84b69b0cbf1ede47a653ebbd60def","observation_id":"b9c3781e-bf2f-49f8-8d26-6fbf92dacf31","resolution":{"observed_at":"2026-07-02T15:17:07.256397Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06581","last_updated":"2025-03-27T16:16:09Z","snapshot_observed_at":"2026-08-10T02:34:18.448092Z","submitted_at":"2024-07-09T06:20:17Z","title":"Vision language models are blind: Failing to translate detailed visual features into words","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06581","snapshot_observed_at":"2026-08-01T21:12:06.631736Z","title":"Vision language models are blind.arXiv preprint arXiv:2407.06581, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16165","last_updated":"2026-07-17T17:46:23Z","snapshot_observed_at":"2026-08-05T12:06:47.948888Z","submitted_at":"2026-07-17T17:46:23Z","title":"An Exam for Active Observers","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-01T21:12:06.631736Z"},"links":{"cited_paper":"/paper/2407.06581","citing_paper":"/paper/2607.16165"},"observation_digest":"sha256:4e22cbfd0feb16aeb0cd6de1870e78acacc32cbbf7ee0b6838c48553bf2b53fa","observation_id":"64fac733-b34b-4efc-8a60-fa541118694f","resolution":{"observed_at":"2026-08-01T21:12:06.631736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2407.06581/citation-record","integrity":"/paper/2407.06581/integrity","json":"/paper/2407.06581/citation-record.json","paper":"/paper/2407.06581"},"outbound":[],"paper":{"arxiv_id":"2407.06581","last_updated":"2025-03-27T16:16:09Z","latest_version":6,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-10T02:34:18.448092Z","submitted_at":"2024-07-09T06:20:17Z","title":"Vision language models are blind: Failing to translate detailed visual features into words"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 31 inbound Pith citation observations for arXiv:2407.06581."}