{"as_of":"2026-08-14T14:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5b4dd89f551c0ee31a6c63f29bd020569283074099c80cadcfb362cd57f11d6d","coverage":[{"denominator":90,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":90,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-15T20:18:15.439163Z","state":"measured"},{"denominator":182,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":182,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":92,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":92,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T11:18:55.736796Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":2,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-10T14:07:02.234322Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T20:19:27.255515Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2404.14219"},"observation_digest":"sha256:28a4754b8076591b67420c6c7eded7b670130c5a248bfea18fe40f67e4dd5ba7","observation_id":"449cc6a2-7af6-44e2-8b8c-60d35ee072a1","resolution":{"observed_at":"2026-05-15T20:18:15.850579Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2406.09411","last_updated":"2024-07-02T01:56:14Z","snapshot_observed_at":"2026-08-13T19:11:36.872460Z","submitted_at":"2024-06-13T17:59:52Z","title":"MuirBench: A Comprehensive Benchmark for Robust Multi-image Understanding","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-17T01:09:30.360275Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2406.09411"},"observation_digest":"sha256:19553f8a117bef3a585134a0d5d02504860fccf7d751f3aee3b082d0e77a654a","observation_id":"db3428af-e77a-4f8a-995c-184368d595ba","resolution":{"observed_at":"2026-05-17T01:09:30.442631Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2406.09414","last_updated":"2024-10-20T11:24:09Z","snapshot_observed_at":"2026-07-06T18:30:32.982860Z","submitted_at":"2024-06-13T17:59:56Z","title":"Depth Anything V2","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-13T14:56:33.945280Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2406.09414"},"observation_digest":"sha256:d6b89c9b3542ae88bed7075f2d9a24a8cb2d5c5f4720b8c6d717291a0bed0784","observation_id":"f2da540d-4c8c-4aa0-8482-62bf96050759","resolution":{"observed_at":"2026-05-15T20:18:15.850579Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2406.16860","last_updated":"2024-12-04T17:57:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-24T17:59:42Z","title":"Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-17T00:05:03.547664Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2406.16860"},"observation_digest":"sha256:44e653e4a1d971c834a83d083c69fb53f397bc90fa18dfa8e3fb034cc11facd1","observation_id":"35fbd366-aacc-42ef-8c5b-3de03abd4298","resolution":{"observed_at":"2026-05-17T00:05:03.712019Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-08-13T00:09:23.835117Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-11T06:01:53.730356Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2407.07895"},"observation_digest":"sha256:c055a4f14ac23e1f566cc0c7dde2d7f4ecc8c5cfa134c99122113549815d00c2","observation_id":"2490bbe3-8e77-4a4e-ae5a-95e5937f0c81","resolution":{"observed_at":"2026-05-15T20:18:15.850579Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:b5aacef204692917f1c5bacb8999cb610c3f84e3c617f66c6c5757c89f8b47c8","observation_id":"d256730f-a2e3-4983-90d8-0043a8ba6f24","resolution":{"observed_at":"2026-05-15T20:18:15.850579Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2408.13257","last_updated":"2025-02-05T08:44:02Z","snapshot_observed_at":"2026-08-13T00:35:03.634903Z","submitted_at":"2024-08-23T17:59:51Z","title":"MME-RealWorld: Could Your Multimodal LLM Challenge High-Resolution Real-World Scenarios that are Difficult for Humans?","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-16T07:59:32.638758Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2408.13257"},"observation_digest":"sha256:740ea0d1f78b8112b1dca65ba255fdaed5f8839c8fe06b10607603f478ca5ed8","observation_id":"a910a12c-9f03-4125-b335-711b47e51e93","resolution":{"observed_at":"2026-05-16T07:59:32.699685Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2409.02813","last_updated":"2025-05-22T08:22:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-04T15:31:26Z","title":"MMMU-Pro: A More Robust Multi-discipline Multimodal Understanding Benchmark","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-14T00:51:48.163349Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2409.02813"},"observation_digest":"sha256:135a6230c5b5e5d6d56e7e703bc3916e5d4302e2bf8afd938a26e0c78fa306b0","observation_id":"02f44911-d49a-470d-b4a6-7515bb7319a4","resolution":{"observed_at":"2026-05-15T20:18:15.850579Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-12T20:12:25.253133Z","title":"Blink: Multimodal large language models can see but not perceive","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.09968","last_updated":"2024-11-15T05:51:29Z","snapshot_observed_at":"2026-08-13T01:32:02.986809Z","submitted_at":"2024-11-15T05:51:29Z","title":"Seeing Clearly by Layer Two: Enhancing Attention Heads to Alleviate Hallucination in LVLMs","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T20:12:25.253133Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2411.09968"},"observation_digest":"sha256:e1d5ad4aefbd0bfda9a89ae1456951ea54e5b2d9f137c75f3df5714423bad915","observation_id":"28a73a8d-5055-4bab-a60d-3fca6d663680","resolution":{"observed_at":"2026-08-12T20:12:25.253133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-12T14:31:36.795142Z","title":"Blink: Multimodal large language JOURNAL OF LATEX CLASS FILES, NOVEMBER 2024 21 models can see but not perceive,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15296","last_updated":"2024-12-08T04:24:31Z","snapshot_observed_at":"2026-08-14T10:19:04.189589Z","submitted_at":"2024-11-22T18:59:54Z","title":"MME-Survey: A Comprehensive Survey on Evaluation of Multimodal LLMs","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T14:31:36.795142Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2411.15296"},"observation_digest":"sha256:35012604063fb3fccdc9e17508bd6d37323d07e1390d6bfdaf48cf6c545939dc","observation_id":"deb76522-dca0-477e-99ba-391bc10795e0","resolution":{"observed_at":"2026-08-12T14:31:36.795142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-12T11:54:48.212530Z","title":"Blink: Multimodal large lan- guage models can see but not perceive","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17673","last_updated":"2024-11-26T18:32:06Z","snapshot_observed_at":"2026-08-13T00:46:04.345420Z","submitted_at":"2024-11-26T18:32:06Z","title":"SketchAgent: Language-Driven Sequential Sketch Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T11:54:48.212530Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2411.17673"},"observation_digest":"sha256:5c85a859246b403904c508dacc5d97a587b2f0e81e1b33624697bdc3a81ff42e","observation_id":"d144e7b3-8901-49ed-b6ce-5bb0da669ad6","resolution":{"observed_at":"2026-08-12T11:54:48.212530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-12T10:24:06.565408Z","title":"Blink: Multimodal large lan- guage models can see but not perceive","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-13T01:49:12.898890Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.565408Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:22be0bd8cf37196d7a22a563670e3fe99f0744abe74e1e85383025b06c323e2a","observation_id":"e878cf0e-87c1-4f84-935a-a03c82514ac9","resolution":{"observed_at":"2026-08-12T10:24:06.565408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-11T22:21:55.601768Z","title":"Blink: Multimodal large language models can see but not perceive","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.03548","last_updated":"2024-12-08T05:18:30Z","snapshot_observed_at":"2026-08-12T19:01:21.687339Z","submitted_at":"2024-12-04T18:45:35Z","title":"Perception Tokens Enhance Visual Reasoning in Multimodal Language Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T22:21:55.601768Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2412.03548"},"observation_digest":"sha256:518580551286c5d3a504c25c40b0813052527a4aeff682941a6ed965365743d3","observation_id":"87569496-d69f-4c50-87a4-35694e820fe0","resolution":{"observed_at":"2026-08-11T22:21:55.601768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-11T21:36:09.059138Z","title":"Blink: Multi- modal large language models can see but not per- ceive","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04531","last_updated":"2024-12-05T17:08:19Z","snapshot_observed_at":"2026-08-12T03:42:51.666665Z","submitted_at":"2024-12-05T17:08:19Z","title":"MageBench: Bridging Large Multimodal Models to Agents","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T21:36:09.059138Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2412.04531"},"observation_digest":"sha256:531b2e16abfd1a38601c0cb506965ae95bd7fcec070410f6ba8d18835bacc22e","observation_id":"7921fe95-972e-483f-b52d-a833ce1a2b35","resolution":{"observed_at":"2026-08-11T21:36:09.059138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:f882b9864460fac82ffd41834aad9917145bc71d4423e809d8ac9982d409f196","observation_id":"b97e81f7-0bde-406c-b183-6b7e09787a8c","resolution":{"observed_at":"2026-05-15T20:18:15.850579Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-11T18:24:49.515784Z","title":"Smith, Wei-Chiu Ma, and Ranjay Krishna","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08014","last_updated":"2025-03-11T07:15:54Z","snapshot_observed_at":"2026-08-14T06:20:16.916301Z","submitted_at":"2024-12-11T01:41:19Z","title":"MAGIC: Mastering Physical Adversarial Generation in Context through Collaborative LLM Agents","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T18:24:49.515784Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2412.08014"},"observation_digest":"sha256:51f13fe4a5f11970565a441f523a8aef893df493be420eda838cfc1b55950f5c","observation_id":"372766fd-7225-41f3-82ff-0c4daa529ec4","resolution":{"observed_at":"2026-08-11T18:24:49.515784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-11T18:03:22.525123Z","title":"Blink: Multimodal large language models can see but not perceive","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08307","last_updated":"2025-04-08T08:30:30Z","snapshot_observed_at":"2026-08-11T23:49:33.490892Z","submitted_at":"2024-12-11T11:39:42Z","title":"Investigating the Scaling Effect of Instruction Templates for Training Multimodal Language Model","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T18:03:22.525123Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2412.08307"},"observation_digest":"sha256:555d00f86e06d932cbaf23671a4cb71b92b71788571cd9bd96e84c7c5150fbae","observation_id":"71b020b1-6cf7-446e-9f1e-99d3d252a245","resolution":{"observed_at":"2026-08-11T18:03:22.525123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-11T15:52:20.559022Z","title":"Blink: Multimodal large language models can see but not perceive","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10594","last_updated":"2024-12-13T22:38:09Z","snapshot_observed_at":"2026-08-12T13:31:14.069708Z","submitted_at":"2024-12-13T22:38:09Z","title":"Towards Unified Benchmark and Models for Multi-Modal Perceptual Metrics","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T15:52:20.559022Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2412.10594"},"observation_digest":"sha256:8afb4fae3b3e9c9e144da9081f5cfa4dc9362084a8ef8ea0f2ac77426c2604fa","observation_id":"248a84da-d421-42b5-b827-57a691d103b1","resolution":{"observed_at":"2026-08-11T15:52:20.559022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-11T15:32:59.729389Z","title":"Blink: Multimodal large language models can see but not perceive","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10908","last_updated":"2025-07-22T16:46:37Z","snapshot_observed_at":"2026-08-14T02:46:43.802308Z","submitted_at":"2024-12-14T17:35:27Z","title":"Do large language vision models understand 3D shapes?","version":5},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T15:32:59.729389Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2412.10908"},"observation_digest":"sha256:2ea61690b4c3639408fcf877d35f3c9dbd0ff6af0326819b8d2600f93b4d05ef","observation_id":"b98382ba-30bc-42b8-915d-d86fbd198ffc","resolution":{"observed_at":"2026-08-11T15:32:59.729389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-11T13:52:57.065731Z","title":"Smith, Wei-Chiu Ma, and Ranjay Krishna","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12735","last_updated":"2024-12-17T09:57:21Z","snapshot_observed_at":"2026-08-12T09:37:12.451097Z","submitted_at":"2024-12-17T09:57:21Z","title":"GIRAFFE: Design Choices for Extending the Context Length of Visual Language Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T13:52:57.065731Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2412.12735"},"observation_digest":"sha256:27e952f349f72b86ef8119cb3cf7bf08874ef7b1da29f39b66966cd4487e94f8","observation_id":"f743acbe-c706-4107-a2f2-b81bf92ef702","resolution":{"observed_at":"2026-08-11T13:52:57.065731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2412.14164","last_updated":"2024-12-18T18:58:50Z","snapshot_observed_at":"2026-08-08T15:05:21.947334Z","submitted_at":"2024-12-18T18:58:50Z","title":"MetaMorph: Multimodal Understanding and Generation via Instruction Tuning","version":1},"reference_index":258,"source":"arxiv_source","source_observed_at":"2026-05-17T07:51:12.953777Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2412.14164"},"observation_digest":"sha256:68d8c80e4fa78658c8dd06220e591e2492b81ae3c374c23cbe57873ec0ecac93","observation_id":"d9b79575-df07-451c-ab2a-4b28228f0063","resolution":{"observed_at":"2026-05-17T07:51:13.207957Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-11T05:08:17.696188Z","title":"Blink: Multimodal large language models can see but not perceive","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.18072","last_updated":"2024-12-24T00:59:16Z","snapshot_observed_at":"2026-08-14T11:19:19.943453Z","submitted_at":"2024-12-24T00:59:16Z","title":"MMFactory: A Universal Solution Search Engine for Vision-Language Tasks","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T05:08:17.696188Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2412.18072"},"observation_digest":"sha256:f395189950d24df4448efcce273f98865a53001e00a7009c1a9a3a1ca37e2a4f","observation_id":"2ca317ef-07e8-4b03-8e4d-b73c4f167674","resolution":{"observed_at":"2026-08-11T05:08:17.696188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-10T21:17:02.983278Z","title":"Blink: Multimodal large language models can see but not perceive","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.05452","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-14T07:11:49.232521Z","submitted_at":"2025-01-09T18:59:58Z","title":"ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T21:17:02.983278Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2501.05452"},"observation_digest":"sha256:54634f117b3c1cfdae7eaa2b3c45172049b8df1876f3c5531f4dace3eec8b005","observation_id":"fd405925-dcba-4488-a58c-c3c3c3f77105","resolution":{"observed_at":"2026-08-10T21:17:02.983278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-10T15:17:54.034110Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.14210","last_updated":"2025-01-24T03:28:37Z","snapshot_observed_at":"2026-08-14T00:00:08.074749Z","submitted_at":"2025-01-24T03:28:37Z","title":"PuzzleGPT: Emulating Human Puzzle-Solving Ability for Time and Location Prediction","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-10T15:17:54.034110Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2501.14210"},"observation_digest":"sha256:8b9ffd3a2aaecb6061b270408986007287874611ab86524a20dde09995ff4dbe","observation_id":"b4ec5e97-8b24-4e94-838b-2075b0fcb267","resolution":{"observed_at":"2026-08-10T15:17:54.034110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-07T18:23:49.886875Z","title":"Blink: Multimodal large language models can see but not perceive","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-08T01:24:46.892879Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:49.886875Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:2ca2462ad3272ae7f03977438dd984ccf34dad5a63edfad80789f26edf4ea734","observation_id":"7d442750-fa52-491e-a38f-d1a8e0582475","resolution":{"observed_at":"2026-08-07T18:23:49.886875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-08-09T11:59:10.408717Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-11T22:22:27.455361Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2503.01743"},"observation_digest":"sha256:16db5a3a87de0c15ba189f270e8576c0ea317068cd1e5f9949deecde1dff6027","observation_id":"cb91d072-e5e7-429c-b9d4-f256aecc44af","resolution":{"observed_at":"2026-05-15T20:18:15.850579Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-22T22:18:55.976503Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2503.19786"},"observation_digest":"sha256:5dc836ca74e1d40b6763575a6edc0c4234f9e73053ecabf1f448eef1f5854b7d","observation_id":"2637342f-824d-4ee1-8cec-4d9dbe651456","resolution":{"observed_at":"2026-05-22T22:22:12.223017Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:7094bb60dd070ccfa518a631c6047a71bdbd31f4b273e12b99b8834ac5981eb7","observation_id":"2a242639-a304-471e-8c5f-5b5ad78f44e1","resolution":{"observed_at":"2026-05-15T20:18:15.850579Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2505.23678","last_updated":"2026-05-15T17:27:46Z","snapshot_observed_at":"2026-08-02T04:30:21.704758Z","submitted_at":"2025-05-29T17:20:26Z","title":"Grounded Reinforcement Learning for Visual Reasoning","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-22T01:05:18.801388Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2505.23678"},"observation_digest":"sha256:b88beacca7e4110e6461ae691b4cb2606847816548d4d66a74231c123aebf739","observation_id":"3024c293-8945-492a-9bb2-c065a21ddb9c","resolution":{"observed_at":"2026-05-22T01:05:52.174278Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-07T10:41:23.368760Z","title":"Blink: Multimodal large language models can see but not perceive","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-13T17:30:39.507118Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:23.368760Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:eee67edbde50edea59fd002390a00f1eaa21d6cf297ed9db098ab9a82cf34ecd","observation_id":"0ecb08d9-d824-4b1f-abdb-58bfcb12287a","resolution":{"observed_at":"2026-08-07T10:41:23.368760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-07T06:01:40.901934Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06232","last_updated":"2025-07-08T07:40:27Z","snapshot_observed_at":"2026-08-13T08:55:50.092242Z","submitted_at":"2025-06-06T16:53:12Z","title":"Challenging Vision-Language Models with Surgical Data: A New Dataset and Broad Benchmarking Study","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T06:01:40.901934Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2506.06232"},"observation_digest":"sha256:44b81b587c84619ce90b4a2e671e0ada0cc6861361c40b2801e94ce822d785e2","observation_id":"2d189f2b-a1f3-4e59-a6ec-335fb4838dc6","resolution":{"observed_at":"2026-08-07T06:01:40.901934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-07T05:34:56.197159Z","title":"Blink: Multimodal large language models can see but not perceive.arXiv preprint arXiv:2404.12390, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-14T14:07:15.571101Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.197159Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:00727277bbbb25c1e9eb03f3f6a927545586659424290825f005160d8f4ec08b","observation_id":"395a5a37-0c82-48f3-a1a5-3d79e44675ee","resolution":{"observed_at":"2026-08-07T05:34:56.197159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-07T05:25:31.888488Z","title":"Smith, Wei-Chiu Ma, and Ranjay Krishna","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08008","last_updated":"2025-06-09T17:59:54Z","snapshot_observed_at":"2026-08-09T03:57:04.486723Z","submitted_at":"2025-06-09T17:59:54Z","title":"Hidden in plain sight: VLMs overlook their visual representations","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T05:25:31.888488Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2506.08008"},"observation_digest":"sha256:2962ea3cbfd57c983be173483acad2c8400340faf19c879707a1f69d1f3afe52","observation_id":"fb1d3bfd-f903-4eff-8b91-cd78b2677d51","resolution":{"observed_at":"2026-08-07T05:25:31.888488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-07T11:04:33.576525Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11080","last_updated":"2025-06-04T08:42:14Z","snapshot_observed_at":"2026-08-14T01:13:13.516591Z","submitted_at":"2025-06-04T08:42:14Z","title":"MANBench: Is Your Multimodal Model Smarter than Human?","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T11:04:33.576525Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2506.11080"},"observation_digest":"sha256:780a33d5763520f7922ce99fb5470a606b584fea6d0dbaec4084f9ccfe44704c","observation_id":"6840f7bc-b91c-4ab6-8362-746e39cd4238","resolution":{"observed_at":"2026-08-07T11:04:33.576525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-06T23:57:22.659375Z","title":"arXiv preprint arXiv:2404.12390 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15681","last_updated":"2026-06-25T14:33:27Z","snapshot_observed_at":"2026-08-08T08:54:57.204006Z","submitted_at":"2025-06-18T17:59:49Z","title":"GenRecal: Generation after Recalibration from Large to Small Vision-Language Models","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T23:57:22.659375Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2506.15681"},"observation_digest":"sha256:0eb0582126500580612d53324aba1d0f5e1142de20304276d8cd70cabf1020d5","observation_id":"0c53e5fd-1426-421a-b279-e7f525546c99","resolution":{"observed_at":"2026-08-06T23:57:22.659375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-08-03T18:50:30.558321Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-11T04:48:26.355351Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2507.01006"},"observation_digest":"sha256:65b1a92aa4c97a40f4ac5ca7ef133842b9668122bb1647c7d1e423d46c29307a","observation_id":"7095c77d-5117-459b-ac10-881acf5f2746","resolution":{"observed_at":"2026-05-15T20:18:15.850579Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2507.01955","last_updated":"2026-05-01T00:57:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-02T17:59:07Z","title":"How Well Does GPT-4o Understand Vision? Evaluating Multimodal Foundation Models on Standard Computer Vision Tasks","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-19T05:55:09.188048Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2507.01955"},"observation_digest":"sha256:c6f81a011341ef351d58ca1e3502e25b0640b9dbb4d3fb3e7b707c9c31630392","observation_id":"84230edf-4209-4308-9141-436bcd19977b","resolution":{"observed_at":"2026-05-19T05:57:08.011869Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-06T20:38:28.730737Z","title":"Smith, Wei-Chiu Ma, and Ranjay Krishna","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-14T07:01:53.180437Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:28.730737Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:5611081eb9584bcb249aab28eed80a8ec397c3596f76192ab2c968fd1fca1ed3","observation_id":"e1a4f98a-1838-4266-8391-2cfa32afdb38","resolution":{"observed_at":"2026-08-06T20:38:28.730737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-06T18:52:35.095890Z","title":"Blink: Multimodal large language models can see but not perceive,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-10T20:06:39.029785Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:35.095890Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:aa321d80a803faf0797d15b78ea6000ae4c1df0afa09189e0dedad1ca52db793","observation_id":"ab5b5abd-9b09-4f0f-bccc-629838e11b29","resolution":{"observed_at":"2026-08-06T18:52:35.095890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-06T18:24:51.096889Z","title":"Blink: Multimodal large language models can see but not perceive","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-13T02:51:37.326192Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:51.096889Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:6f2e844488117d45db618f4dadff1b0af4f9b8763f4c195a4138354d0886c62d","observation_id":"4e757f10-5bb8-4a03-bdcd-822a6fc97c6c","resolution":{"observed_at":"2026-08-06T18:24:51.096889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-08-13T04:48:56.237545Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-10T11:58:58.660564Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2508.18265"},"observation_digest":"sha256:ac4185a4fc8f52fca90715a8db5a5dd0c0efb18017ea866552be7795074e7bd6","observation_id":"d517cdae-32fd-4521-a495-ce6109d7355a","resolution":{"observed_at":"2026-05-15T20:18:15.850579Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T13:24:39.631783Z","title":"Smith, Wei-Chiu Ma, and Ranjay Krishna","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-14T04:31:24.300394Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.631783Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:14e25b3ba274b6072c87d2fc98d6f5f44f30c7e37a404386fdc55019b0ae0b48","observation_id":"b3588781-8ee6-4566-963c-9e74225587a6","resolution":{"observed_at":"2026-08-05T13:24:39.631783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T12:27:04.924950Z","title":"Blink: Multimodal large language models can see but not perceive","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01656","last_updated":"2025-09-01T17:57:49Z","snapshot_observed_at":"2026-08-11T14:52:56.759096Z","submitted_at":"2025-09-01T17:57:49Z","title":"Reinforced Visual Perception with Tools","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-05T12:27:04.924950Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2509.01656"},"observation_digest":"sha256:6e4e05a898e9b5fd75dd040b4a6b4dde9e29103ec66cc8979a177149f6633455","observation_id":"e48ae2b1-7886-4639-8cb2-d9c322917be1","resolution":{"observed_at":"2026-08-05T12:27:04.924950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T11:56:08.613463Z","title":"Smith, Wei-Chiu Ma, and Ranjay Krishna","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.02175","last_updated":"2025-09-04T16:38:44Z","snapshot_observed_at":"2026-08-13T23:46:54.580924Z","submitted_at":"2025-09-02T10:32:58Z","title":"Understanding Space Is Rocket Science -- Only Top Reasoning Models Can Solve Spatial Understanding Tasks","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T11:56:08.613463Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2509.02175"},"observation_digest":"sha256:123c62d2b05fec1b659e11e19056439c3958305d3ed2c4b76ae1327aa5e556bb","observation_id":"3e8d8889-933c-49ba-96c7-2b7824e177ec","resolution":{"observed_at":"2026-08-05T11:56:08.613463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-03T23:08:49.532620Z","title":"Smith, Wei-Chiu Ma, and Ranjay Krishna","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.07403","last_updated":"2026-07-02T19:21:24Z","snapshot_observed_at":"2026-08-10T04:10:31.001930Z","submitted_at":"2025-11-10T18:52:47Z","title":"SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T23:08:49.532620Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2511.07403"},"observation_digest":"sha256:a9fb65e9d44275c6a69dc65be0ea468a3487bece07e54735e070ec309666bb0b","observation_id":"80da89b1-98fb-43e9-8400-1d37f0472ea6","resolution":{"observed_at":"2026-08-03T23:08:49.532620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2511.10946","last_updated":"2026-04-15T01:06:55Z","snapshot_observed_at":"2026-08-03T12:49:21.604140Z","submitted_at":"2025-11-14T04:16:09Z","title":"Abstract 3D Perception for Spatial Intelligence in Vision-Language Models","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-17T22:43:16.761970Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2511.10946"},"observation_digest":"sha256:182590c4e37899d49ceeedc4f249afbf6772b9436d1f9114072aaa86008bde26","observation_id":"f0d3fd3c-a303-42f7-b729-f26b80345f4b","resolution":{"observed_at":"2026-05-17T22:45:24.419680Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-03T18:42:11.109093Z","title":"Blink: Multimodal large language models 9 can see but not perceive.arXiv preprint arXiv:2404.12390,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.04069","last_updated":"2026-06-01T16:57:23Z","snapshot_observed_at":"2026-08-13T06:34:38.598792Z","submitted_at":"2025-12-03T18:50:04Z","title":"SpaceTools: Tool-Augmented Spatial Reasoning via Double Interactive RL","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T18:42:11.109093Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2512.04069"},"observation_digest":"sha256:b84d62c3f0720100c7f85a16a6ab67d77444871a6d4f6d49e9430dfcb510aa91","observation_id":"c8e4af68-f378-4907-8e8f-4673229054ca","resolution":{"observed_at":"2026-08-03T18:42:11.109093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2601.09536","last_updated":"2026-04-18T07:44:28Z","snapshot_observed_at":"2026-08-13T14:16:29.426570Z","submitted_at":"2026-01-14T14:57:33Z","title":"Omni-R1: Towards the Unified Generative Paradigm for Multimodal Reasoning","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-16T14:37:05.402850Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2601.09536"},"observation_digest":"sha256:d1ea3332002bcc9d78d83d20c1e40c82f149d3a0986619e17eb076c21d850d3e","observation_id":"ef67d5fd-d15f-4fda-b4b0-c5ab2d75330a","resolution":{"observed_at":"2026-05-16T14:37:59.940145Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2602.02276","last_updated":"2026-02-02T16:17:38Z","snapshot_observed_at":"2026-08-12T00:25:39.214406Z","submitted_at":"2026-02-02T16:17:38Z","title":"Kimi K2.5: Visual Agentic Intelligence","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T16:09:05.225767Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2602.02276"},"observation_digest":"sha256:ad61899620a6300a977b366cc69dbcfb8bc9e4ea9113c159eccc5fe6199d3339","observation_id":"ac112fd3-56c9-4fba-b4f9-128456022928","resolution":{"observed_at":"2026-05-15T20:18:15.850579Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2604.00799","last_updated":"2026-04-02T21:20:30Z","snapshot_observed_at":"2026-08-11T12:52:26.203109Z","submitted_at":"2026-04-01T12:06:54Z","title":"Multimodal Language Models Cannot Spot Spatial Inconsistencies","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-13T23:12:27.333405Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2604.00799"},"observation_digest":"sha256:3aa6b553301ebc5d826badf28d0004f6b6a5bbbbca4aaa3a031fdabac44276e8","observation_id":"fcab69be-4460-4126-8fe5-a1838387d2b4","resolution":{"observed_at":"2026-05-15T20:18:15.850579Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2604.20012","last_updated":"2026-04-21T21:40:58Z","snapshot_observed_at":"2026-08-11T14:01:31.338986Z","submitted_at":"2026-04-21T21:40:58Z","title":"EmbodiedMidtrain: Bridging the Gap between Vision-Language Models and Vision-Language-Action Models via Mid-training","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T02:16:08.687340Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2604.20012"},"observation_digest":"sha256:6b012d9eaa789d858eb7c83d75d5ee08e3d0ddd121377214c0352164fe61309a","observation_id":"cb7da1c8-5250-4d3a-88a7-3395600d6638","resolution":{"observed_at":"2026-05-15T20:18:15.850579Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2604.24583","last_updated":"2026-04-27T15:08:02Z","snapshot_observed_at":"2026-08-13T10:31:28.296076Z","submitted_at":"2026-04-27T15:08:02Z","title":"Improving Vision-language Models with Perception-centric Process Reward Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-08T04:33:36.634359Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2604.24583"},"observation_digest":"sha256:53b98fbb2f411c0ea9ac7b0e5b2b1d272d66e1e09d7679460674a14b2d0a7da3","observation_id":"5c7952db-71b9-4556-b907-5c59a7f6b83a","resolution":{"observed_at":"2026-05-15T20:18:15.850579Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-08-11T18:06:38.357826Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:3fa458f69aeb02f01294eff56f065fb607663ac8f4462aa0a22929d5e4a2479f","observation_id":"ed1cadea-6207-4b5c-8aa3-40ecee404002","resolution":{"observed_at":"2026-05-15T20:18:15.850579Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2605.04075","last_updated":"2026-04-14T08:17:53Z","snapshot_observed_at":"2026-08-11T14:39:28.647334Z","submitted_at":"2026-04-14T08:17:53Z","title":"RetentiveKV: State-Space Memory for Uncertainty-Aware Multimodal KV Cache Eviction","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-10T15:29:17.567557Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2605.04075"},"observation_digest":"sha256:d9a300c4296e3ccfd510b4e5c4152854378d6371aaac5a4375117257dd57afe0","observation_id":"ac8a1ce3-7d20-450c-90f2-fe7fab2e5efc","resolution":{"observed_at":"2026-05-15T20:18:15.850579Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2605.09883","last_updated":"2026-05-29T22:33:55Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:16:48Z","title":"The Cartesian Shortcut: Re-evaluate Vision Reasoning in Polar Coordinate Space","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-12T04:30:54.053958Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2605.09883"},"observation_digest":"sha256:64c191c888838cca302acdd97ead3f047096abf2ca4d56b6cc016cadb093993b","observation_id":"d57cdf37-8b01-47fa-bdff-def804182c4c","resolution":{"observed_at":"2026-05-15T20:18:15.850579Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2605.09883","last_updated":"2026-05-29T22:33:55Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:16:48Z","title":"The Cartesian Shortcut: Re-evaluate Vision Reasoning in Polar Coordinate Space","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-30T22:58:04.574536Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2605.09883"},"observation_digest":"sha256:5c89ec49ca7cf54c0ed89e58e176117a6e0390cb2d3aa8ac2738224763cc2389","observation_id":"5a4ce0a0-ebc7-45a1-9d80-6b86ae9c5d7e","resolution":{"observed_at":"2026-07-01T13:35:46.604914Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2605.11405","last_updated":"2026-05-13T01:55:26Z","snapshot_observed_at":"2026-08-13T09:02:50.796022Z","submitted_at":"2026-05-12T01:51:03Z","title":"20/20 Vision Language Models: A Prescription for Better VLMs through Data Curation Alone","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-13T02:52:43.674969Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2605.11405"},"observation_digest":"sha256:159b1852f02c47926e6a58b8a60e03a891c73a980325c28d53ea0348274d96e0","observation_id":"653ca010-be3a-4fd0-8c2c-ccb7b67d391b","resolution":{"observed_at":"2026-05-15T20:18:15.850579Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2605.11405","last_updated":"2026-05-13T01:55:26Z","snapshot_observed_at":"2026-08-13T09:02:50.796022Z","submitted_at":"2026-05-12T01:51:03Z","title":"20/20 Vision Language Models: A Prescription for Better VLMs through Data Curation Alone","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-14T21:28:37.680681Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2605.11405"},"observation_digest":"sha256:4128f0ee8718ebef6bcc3bd7736eba8991cd77b39a0a5a3dd18ce87c914f068a","observation_id":"5de67ce0-c44b-4ec6-8abc-43c140d464b1","resolution":{"observed_at":"2026-05-15T20:18:15.850579Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2605.16403","last_updated":"2026-05-13T05:00:19Z","snapshot_observed_at":"2026-07-06T23:27:34.514541Z","submitted_at":"2026-05-13T05:00:19Z","title":"When Vision Speaks for Sound","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-20T22:12:52.160596Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2605.16403"},"observation_digest":"sha256:c0e52bb8f56b3633a3e1499ac1e45fda3122c1d2427e9e7c905ef8f79db359e5","observation_id":"0680746e-0946-49b5-982f-d46c5df6dcb0","resolution":{"observed_at":"2026-05-20T22:13:46.799961Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2605.18445","last_updated":"2026-05-19T10:08:18Z","snapshot_observed_at":"2026-08-14T03:23:19.917744Z","submitted_at":"2026-05-18T14:14:49Z","title":"What's Holding Back Latent Visual Reasoning?","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-20T11:59:14.134917Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2605.18445"},"observation_digest":"sha256:4c528703905fef469530760f1c576dc7a30bea2a73ba79dcd79ab4c9e428da14","observation_id":"32f15706-6d81-4527-a732-c653269f5fe0","resolution":{"observed_at":"2026-05-20T12:03:15.479718Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-07-06T23:29:33.702647Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-20T11:32:24.007847Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:5f32c5f8aa5e60ef50047f11a535c2935f7d4941e35dd298a3a7f8cf172a4642","observation_id":"45972e6c-4f3a-49ce-ad25-59e5e90a968d","resolution":{"observed_at":"2026-05-20T11:33:14.185570Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-07-06T23:29:33.702647Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:f94841be218df01458368c6ec73531a3a07271a7a33ad7beb1d47f7af893a583","observation_id":"41f4ffe9-b6b8-4ff8-819f-eb9b5000c5c0","resolution":{"observed_at":"2026-06-30T18:35:00.371150Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2605.18746","last_updated":"2026-05-25T08:34:52Z","snapshot_observed_at":"2026-08-13T04:10:30.913352Z","submitted_at":"2026-05-18T17:59:02Z","title":"ESI-Bench: Towards Embodied Spatial Intelligence that Closes the Perception-Action Loop","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-20T10:52:22.778489Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2605.18746"},"observation_digest":"sha256:31630120c5198071e6efc8af1e917bf21a6cffa7eba3de2f2c8d4486d3915ae9","observation_id":"7ab9d2bd-131f-4b57-bd9f-16c354b70c5e","resolution":{"observed_at":"2026-05-20T10:53:13.208797Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2605.18746","last_updated":"2026-05-25T08:34:52Z","snapshot_observed_at":"2026-08-13T04:10:30.913352Z","submitted_at":"2026-05-18T17:59:02Z","title":"ESI-Bench: Towards Embodied Spatial Intelligence that Closes the Perception-Action Loop","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-30T18:25:17.831116Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2605.18746"},"observation_digest":"sha256:1410fcca74c78b4c370b04c9912e787ce2ae6b7fb77ce969a9951d887ec72793","observation_id":"c2a322ea-d23f-496d-8dcc-18c43c501de5","resolution":{"observed_at":"2026-07-01T15:05:47.176193Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2605.20278","last_updated":"2026-05-24T12:22:09Z","snapshot_observed_at":"2026-07-06T23:30:53.900592Z","submitted_at":"2026-05-19T04:39:28Z","title":"ClaimDiff-RL: Fine-Grained Caption Reinforcement Learning through Visual Claim Comparison","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-21T08:36:27.676888Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2605.20278"},"observation_digest":"sha256:a21d86668ed138baa301010cdeecb1464b5d0e628a78456800fa7e4e4e1f232a","observation_id":"7ad6f110-2913-4142-bc38-ab555372727b","resolution":{"observed_at":"2026-05-21T08:39:53.709641Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2605.20278","last_updated":"2026-05-24T12:22:09Z","snapshot_observed_at":"2026-07-06T23:30:53.900592Z","submitted_at":"2026-05-19T04:39:28Z","title":"ClaimDiff-RL: Fine-Grained Caption Reinforcement Learning through Visual Claim Comparison","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T17:57:47.409741Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2605.20278"},"observation_digest":"sha256:b71beac1f7c34b7e45fd8fab91106c78aab95eb0a9cc56d21b5d8898d9cc4692","observation_id":"b280e90a-091a-4308-a785-3ce2c8c263d9","resolution":{"observed_at":"2026-06-30T18:04:58.341972Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2605.30639","last_updated":"2026-05-28T22:42:38Z","snapshot_observed_at":"2026-08-08T09:52:15.660075Z","submitted_at":"2026-05-28T22:42:38Z","title":"PInVerify: An Offline Embodied Benchmark for Active Instance Verification","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-29T07:30:59.306097Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2605.30639"},"observation_digest":"sha256:77d779a83fe0872ca3ed901370e73bed428d9bc7705b02d1779293e5e2613d56","observation_id":"870f1a3d-4d80-4c90-9713-611b8411423a","resolution":{"observed_at":"2026-06-29T07:33:13.552711Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2606.07872","last_updated":"2026-06-05T22:06:07Z","snapshot_observed_at":"2026-08-06T16:20:57.348779Z","submitted_at":"2026-06-05T22:06:07Z","title":"VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-06-27T21:56:25.350827Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2606.07872"},"observation_digest":"sha256:a4cb980d55319c9c8dbecc83b9ac9ae336caf96a645f8bf80ba2c9ba8a9b7eed","observation_id":"508d172c-b047-4f6a-9dad-28b2652407c4","resolution":{"observed_at":"2026-07-02T17:37:14.727108Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-07-14T18:07:09.018997Z","title":"Smith, Wei-Chiu Ma, and Ranjay Krishna","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.11324","last_updated":"2026-07-11T14:44:40Z","snapshot_observed_at":"2026-07-16T23:17:53.174457Z","submitted_at":"2026-06-09T18:07:50Z","title":"Embodied-R1.5: Evolving Physical Intelligence via Embodied Foundation Models","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-07-14T18:07:09.018997Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2606.11324"},"observation_digest":"sha256:aa36025c0ae7a602fffe722dd5d09d60b8f7d564ca3e5ae46292a2fa027eaf4b","observation_id":"b148aae3-f0e4-4bae-aa81-fc50c8314a12","resolution":{"observed_at":"2026-07-14T18:07:09.018997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2606.12025","last_updated":"2026-06-11T09:50:37Z","snapshot_observed_at":"2026-08-06T10:53:11.933985Z","submitted_at":"2026-06-10T12:48:27Z","title":"Human-Enhanced Loop Modeling (HELM): Agent-Based Finite Element Modeling of Concrete Bridge Barriers","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-11T11:50:26.030339Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2606.12025"},"observation_digest":"sha256:08554a0da65a791ed89a1359df54fd8657cf69418685d655ce86dd5188df1e99","observation_id":"6351c0a6-442f-44bf-bf28-b82b86efef77","resolution":{"observed_at":"2026-06-27T09:50:49.101338Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2606.17539","last_updated":"2026-06-16T05:32:39Z","snapshot_observed_at":"2026-07-06T23:53:07.149182Z","submitted_at":"2026-06-16T05:32:39Z","title":"Reinforcing Dual-Path Reasoning in Spatial Vision Language Models","version":1},"reference_index":126,"source":"arxiv_source","source_observed_at":"2026-06-27T01:42:30.005911Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2606.17539"},"observation_digest":"sha256:a2add0705e67c59b9044a5b282d3e8a70e68045cd603852bef8c28b14f685557","observation_id":"10e1f930-285b-421e-babd-a0e88f519f27","resolution":{"observed_at":"2026-07-03T20:08:55.668706Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2606.18974","last_updated":"2026-06-25T02:14:41Z","snapshot_observed_at":"2026-08-14T06:39:30.894450Z","submitted_at":"2026-06-17T11:59:15Z","title":"Visual-OPSD: Cross-Modal On-Policy Self-Distillation for Efficient Unified Multimodal Reasoning","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-06-26T21:47:51.437284Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2606.18974"},"observation_digest":"sha256:a62097319e1bd0a50ac9214ea86e5ded996cc096444093fd4714df502eb4f4f0","observation_id":"fdc46151-68b7-4d87-a1d1-123208f6c79c","resolution":{"observed_at":"2026-07-03T23:49:02.264842Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2606.20515","last_updated":"2026-06-28T15:54:03Z","snapshot_observed_at":"2026-08-12T14:48:25.277245Z","submitted_at":"2026-06-18T17:34:55Z","title":"S-Agent: Spatial Tool-Use Elicits Reasoning for Spatial Intelligence","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-26T17:56:07.864580Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2606.20515"},"observation_digest":"sha256:ca25e279dd9e9460a083d20698c73a07b3b598b31823e2f9278ed8b18f346ddc","observation_id":"13ac3131-27ae-4e06-b3cf-71889a166f29","resolution":{"observed_at":"2026-07-04T03:29:31.569062Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2606.20515","last_updated":"2026-06-28T15:54:03Z","snapshot_observed_at":"2026-08-12T14:48:25.277245Z","submitted_at":"2026-06-18T17:34:55Z","title":"S-Agent: Spatial Tool-Use Elicits Reasoning for Spatial Intelligence","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-30T10:22:08.535453Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2606.20515"},"observation_digest":"sha256:a21144aa9136f3208e81a475e23a793dce36410cede07022943d48ae3986bfa9","observation_id":"d41550c2-7965-45d5-9bed-ea092705becc","resolution":{"observed_at":"2026-06-30T11:54:39.058350Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2606.20764","last_updated":"2026-06-18T11:56:04Z","snapshot_observed_at":"2026-08-09T09:07:57.705396Z","submitted_at":"2026-06-18T11:56:04Z","title":"One Image is All You Need: Agentic One-Shot Image Generation via Text-Based World Models for Long-Tail Spatial Perception","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-26T18:22:41.189820Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2606.20764"},"observation_digest":"sha256:9633163afc3e4c501d381e8300ec996379485136449d2a1f3ccd10f73c94c836","observation_id":"a7bf10db-3965-469f-9212-8b0376aa8f1e","resolution":{"observed_at":"2026-07-04T03:09:30.076334Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2606.22043","last_updated":"2026-06-20T13:48:19Z","snapshot_observed_at":"2026-08-10T08:54:14.180931Z","submitted_at":"2026-06-20T13:48:19Z","title":"When Does a Video-Language Model Stop Watching? Reward Strength Controls the Formation and Reversal of Visual Shortcuts in Multimodal RLVR","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-26T11:43:17.464276Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2606.22043"},"observation_digest":"sha256:caf28eaca6a1f460850f9b89d5675d4a3e35ddcd9dbde8b1d5dc6e1833e20f29","observation_id":"9b6bcb5c-80c8-492c-b2eb-08e16619da25","resolution":{"observed_at":"2026-07-04T08:29:41.287801Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2606.24253","last_updated":"2026-06-26T09:37:54Z","snapshot_observed_at":"2026-08-12T17:36:15.119929Z","submitted_at":"2026-06-23T07:42:22Z","title":"TuringViT: Making SOTA Vision Transformers Accessible to All","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-06-29T05:32:26.746776Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2606.24253"},"observation_digest":"sha256:634dbde6d513870d1f1155d2f35d5bbbfcce95505f1868f843ef931bcfeb96b3","observation_id":"65ca5b1c-22f4-4574-a1e6-af195f0604d6","resolution":{"observed_at":"2026-06-29T15:03:32.200965Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2606.25066","last_updated":"2026-06-23T18:19:16Z","snapshot_observed_at":"2026-08-14T08:49:36.411863Z","submitted_at":"2026-06-23T18:19:16Z","title":"Do vision-language models search like humans? Reasoning tokens as a reaction-time analog in classic visual-search paradigms","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-25T22:58:41.991573Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2606.25066"},"observation_digest":"sha256:054c1b302b8d42b3fbd08ca2375f44c4c0b8a2c79c93308d6b1d21c4b0b7c6d0","observation_id":"f0acdfa3-2518-438c-9d35-bf02dd304185","resolution":{"observed_at":"2026-07-04T18:10:02.344679Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2606.25445","last_updated":"2026-06-24T06:15:24Z","snapshot_observed_at":"2026-08-13T00:06:24.757720Z","submitted_at":"2026-06-24T06:15:24Z","title":"C3-Bench: A Context-Aware Change Captioning Benchmark","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-25T21:02:52.529391Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2606.25445"},"observation_digest":"sha256:4ff5bd8692158573ba96a848034cfa2337ff422731cb9001c46689849d41c2ae","observation_id":"f79a77b4-41dc-4519-8def-0f5e1e5622ac","resolution":{"observed_at":"2026-07-04T19:50:10.197607Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2606.26602","last_updated":"2026-06-25T05:02:38Z","snapshot_observed_at":"2026-08-05T11:23:05.305941Z","submitted_at":"2026-06-25T05:02:38Z","title":"DiCoBench: Benchmarking Multi-Image Fine-Grained Perception via Differential and Commonality Visual Cues","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-26T05:18:01.931929Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2606.26602"},"observation_digest":"sha256:fd343dcd93eccf708ae0fdd5004f858d65906a12e8cff18f9d3ccc45b7f5d8d1","observation_id":"5ae8d44e-6985-4875-b221-1261d8c47ec4","resolution":{"observed_at":"2026-07-04T13:19:50.970106Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2607.00576","last_updated":"2026-07-01T07:59:45Z","snapshot_observed_at":"2026-08-05T12:04:26.976147Z","submitted_at":"2026-07-01T07:59:45Z","title":"Safe Alone, Unsafe Together: Safeguarding Against Implicit Toxicity When Benign Images Combine","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-02T13:19:29.775959Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2607.00576"},"observation_digest":"sha256:2c90fe11053809670930a6c0974e1ceea7a17406ad03076d1565d021dd14920c","observation_id":"6265e2a3-e2ac-48c7-afb9-a4c84b86d857","resolution":{"observed_at":"2026-07-02T13:26:58.578997Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-07-12T06:13:16.894125Z","title":"ArXivabs/2404.12390(2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02907","last_updated":"2026-07-03T03:14:11Z","snapshot_observed_at":"2026-08-13T04:12:16.138751Z","submitted_at":"2026-07-03T03:14:11Z","title":"ProLaViT: Learning Progressive Latent Visual Thoughts in Structured Latent Space","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-12T06:13:16.894125Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2607.02907"},"observation_digest":"sha256:7246ee06832f46233af1331a9aecf5c26fe0adfe81dca2d8460b245e94699dd4","observation_id":"ae5cf0f9-eb9a-47b2-9552-76e22787a979","resolution":{"observed_at":"2026-07-12T06:13:16.894125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-07-14T07:59:56.441098Z","title":"arXiv preprint arXiv:2404.12390 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10966","last_updated":"2026-07-13T00:21:30Z","snapshot_observed_at":"2026-08-13T17:25:50.326845Z","submitted_at":"2026-07-13T00:21:30Z","title":"SVR-R1: Bootstrapping Multi-modal Reasoning with Self-verification in Reinforcement Learning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-07-14T07:59:56.441098Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2607.10966"},"observation_digest":"sha256:789b194dbd73f51a83994b469e7a59eb6730181b388c997924057f2021b2c2d3","observation_id":"21908eb4-c7c1-4ead-a2f4-43266c6052d7","resolution":{"observed_at":"2026-07-14T07:59:56.441098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-01T21:12:03.439176Z","title":"Blink: Multimodal large language models can see but not perceive","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16165","last_updated":"2026-07-17T17:46:23Z","snapshot_observed_at":"2026-08-10T11:09:11.819021Z","submitted_at":"2026-07-17T17:46:23Z","title":"An Exam for Active Observers","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T21:12:03.439176Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2607.16165"},"observation_digest":"sha256:b6f91c0b3e4d46038c995fe0b3c5c0bfe095f7c61847bede1af3c8418b0fb957","observation_id":"3e4cd782-5ba3-4906-b57b-b3866b366861","resolution":{"observed_at":"2026-08-01T21:12:03.439176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-02T06:33:14.400943Z","title":"Fu, X.; Hu, Y.; Li, B.; Feng, Y.; Wang, H.; Lin, X.; Roth, D.;Smith,N.A.;Ma,W.-C.;andKrishna,R.2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16305","last_updated":"2026-08-10T03:28:48Z","snapshot_observed_at":"2026-08-13T23:40:15.842636Z","submitted_at":"2026-07-14T08:03:00Z","title":"LookME: Lookup-Based Multimodal Embeddings for Layer Injection in Vision-Language Models","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-02T06:33:14.400943Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2607.16305"},"observation_digest":"sha256:d495c2c4e1ca4854eca724b1a49b50e7bfb48ba0ff76c9e6fc47ab26e255ae0d","observation_id":"968911c8-70be-4eee-8090-d09f98d0d120","resolution":{"observed_at":"2026-08-02T06:33:14.400943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-01T11:47:23.095760Z","title":"Smith, Wei-Chiu Ma, and Ranjay Krishna","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19790","last_updated":"2026-07-22T06:17:57Z","snapshot_observed_at":"2026-08-06T04:55:07.559078Z","submitted_at":"2026-07-22T06:17:57Z","title":"Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T11:47:23.095760Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2607.19790"},"observation_digest":"sha256:2914acb8421467791e5fc1c32a98acaf0cd17fb1ec2f4f3a25f71b22908c458d","observation_id":"fb24cba7-7b31-4c49-be5a-c6f5f1953e27","resolution":{"observed_at":"2026-08-01T11:47:23.095760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-07-30T12:20:51.527995Z","title":"arXiv preprint arXiv:2404.12390 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27145","last_updated":"2026-07-29T17:20:56Z","snapshot_observed_at":"2026-08-01T23:41:39.569943Z","submitted_at":"2026-07-29T17:20:56Z","title":"Explainable and Resource-Efficient Spatial Reasoning in Multimodal LLMs for Decision-Critical Applications","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-30T12:20:51.527995Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2607.27145"},"observation_digest":"sha256:50559e34838ff04c3b37fc0b1056c3453b80bac6425d8feda275ad3c281fc8c8","observation_id":"933e3f93-953b-4aa7-b85e-f48e1221ae1d","resolution":{"observed_at":"2026-07-30T12:20:51.527995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-07T13:35:55.939147Z","title":"and Chun, Wei-Chiu and Krishna, Ranjay , booktitle =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06171","last_updated":"2026-08-06T15:37:04Z","snapshot_observed_at":"2026-08-12T13:51:50.496907Z","submitted_at":"2026-08-06T15:37:04Z","title":"Routing Is Least Learnable Where It Is Most Valuable: Bounds on Representation Routing for Web Agents","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T13:35:55.939147Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2608.06171"},"observation_digest":"sha256:e018049f330cb622b388f6c3cfcd71255e5923e320133ae120c357f05e51e834","observation_id":"e91dee9a-f065-41c2-b5cc-1b61574b181e","resolution":{"observed_at":"2026-08-07T13:35:55.939147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-07T04:24:53.296769Z","title":"A.; Ma, W.-C.; and Krishna, R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06361","last_updated":"2026-08-06T17:57:06Z","snapshot_observed_at":"2026-08-14T11:11:04.815546Z","submitted_at":"2026-08-06T17:57:06Z","title":"The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:53.296769Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2608.06361"},"observation_digest":"sha256:85bb0cca6f997dd1803701849d1fe3c6e7246322afa79f2943f11cc9cad6bb1d","observation_id":"2f4fecf4-dedb-4797-aab3-cfc5ecd2ec38","resolution":{"observed_at":"2026-08-07T04:24:53.296769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-11T12:53:14.008737Z","title":"Smith, Wei-Chiu Ma, and Ranjay Krishna","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T23:46:12.268840Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.008737Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:1ad0f413e447f493fd1cbd823b97282cda090621573ecf173824610c87ed5b6a","observation_id":"195d31a5-11c3-492e-af18-b14ebf648ec6","resolution":{"observed_at":"2026-08-11T12:53:14.008737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-12T19:56:01.753162Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10665","last_updated":"2026-08-11T08:46:38Z","snapshot_observed_at":"2026-08-14T14:12:55.996529Z","submitted_at":"2026-08-11T08:46:38Z","title":"VERDICT: Training-Free Step-Wise Verification of Multimodal Reasoning via Disagreement-Aware Consensus","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T19:56:01.753162Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2608.10665"},"observation_digest":"sha256:2aa3ca22adb9cfdd3b3814869d7d7b861191dede511dcf76b2dc778e8baa2815","observation_id":"e048748a-49a0-49a5-85bb-66e7701d78db","resolution":{"observed_at":"2026-08-12T19:56:01.753162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-14T11:18:55.736796Z","title":"Smith, Wei-Chiu Ma, and Ranjay Krishna","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.13426","last_updated":"2026-08-13T16:16:04Z","snapshot_observed_at":"2026-08-14T14:25:51.943820Z","submitted_at":"2026-08-13T16:16:04Z","title":"Reduced Matrix Multiplication: Input-Adaptive Matrix-Product Reduction for LLM Inference","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-14T11:18:55.736796Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2608.13426"},"observation_digest":"sha256:68f4774895aaa75f3e13d1cd74c5b490e1fdef9e3594121263650e1761d033cd","observation_id":"0d26a170-55de-42b8-8dd4-d32d44090615","resolution":{"observed_at":"2026-08-14T11:18:55.736796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2404.12390/citation-record","integrity":"/paper/2404.12390/integrity","json":"/paper/2404.12390/citation-record.json","paper":"/paper/2404.12390"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f8bea833-ebe2-4366-aa34-0ae3433f6dc7","year":2024},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:c5b48efb3172a9d1098cc10366b5d23e10cc9c94fbdcadcb2c48a0db6647762a","observation_id":"fcf71cd7-bd5a-48a6-857f-95277b0fa783","resolution":{"observed_at":"2026-05-15T20:18:15.762219Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: AAAI (2019) 10","venue":null,"work_id":"365c08d1-df9d-4bc5-859b-42eb662a253d","year":2019},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:c80abcf9ae13393b0e94702d2877e723e43a0147104f2ba03adcd8c57f041277","observation_id":"93d55819-5eef-47df-922c-cecf99ea015b","resolution":{"observed_at":"2026-05-15T20:18:15.768026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in Neural Information Processing Systems35, 23716–23736 (2022) 2, 4, 22","venue":null,"work_id":"88ba30a1-83ea-4142-9669-25cd7d6dffa5","year":2022},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:a6c13b4f21ccd6d7e2c5fc742dc0c0573bc5d5d2a1e778388d1a5ee135713a43","observation_id":"dfe95755-cdf2-487f-b0d0-d6ae0c098bae","resolution":{"observed_at":"2026-05-15T20:18:15.771138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the IEEE international conference on computer vision","venue":null,"work_id":"a8727b08-59c4-43f9-b90a-a33fa63ffb0b","year":2015},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:f1ef45f7ea2ea9e5aece1504c7c91e93341fa937a7cbedff25f451c119385d7b","observation_id":"f55ea2a4-f1c8-482a-b894-d35b1898c965","resolution":{"observed_at":"2026-05-15T20:18:15.773873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01390","last_updated":"2023-08-07T17:53:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-02T19:10:23Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2308.01390","doi":"10.48550/arxiv.2308.01390","metadata_source":"pith","pith_arxiv_id":"2308.01390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","venue":"cs.CV","work_id":"87bfa84a-e663-4165-806f-93ef439d88d0","year":2023},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"cited_paper":"/paper/2308.01390","citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:e3d201b73aaa6c674d9d08ba37ee4e1ae6e75ca89e2f32df920f98bde209d18b","observation_id":"d50abe5a-8d1e-41da-a66e-4df0232e8cf2","resolution":{"observed_at":"2026-05-15T20:18:15.666166Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"1e890e19-0ed0-466f-bb57-5cabec60bb48","year":2023},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:6818b64e43b9e4e413516bb9bcc66f7c1f5f1c246569d4e78f4d93f725371a8e","observation_id":"b698a4e8-b64d-4f81-ae13-8a1661b32373","resolution":{"observed_at":"2026-05-15T20:18:15.776403Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":"2308.12966","doi":"10.48550/arxiv.2308.12966","metadata_source":"pith","pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","venue":"cs.CV","work_id":"cbc2bb21-b6bb-46c0-80bf-107e195ffe10","year":2023},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:2bc6ae6a04a364c07145294715f29b22a65092c5ce36509b4817ee2996f8f099","observation_id":"52168342-21d1-4b73-8c7e-b36acd46bc7c","resolution":{"observed_at":"2026-05-15T20:18:15.619179Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: CVPR (2017) 3, 7","venue":null,"work_id":"b239760f-8449-40da-99bd-1f1f30e1b116","year":2017},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:03818688a88faca82999b46a5cbc6fc13249961954abee2bf79d756558c79320","observation_id":"a4b4fa38-fef0-4f95-bd78-9c2c825e419d","resolution":{"observed_at":"2026-05-15T20:18:15.778804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f7aae500-d3ae-4426-a037-fcff8ce4388a","year":1978},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:e8d91b82724481f1e3854415725f35ed5aa7de0b646ba326db8c0906886fa951","observation_id":"5a7b5cd3-a7f7-4fac-84c2-11fe68dee4bc","resolution":{"observed_at":"2026-05-15T20:18:15.781036Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ACM Trans","venue":null,"work_id":"e7a57db0-1aa3-4857-8b5c-75f8556df462","year":2014},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:d8eba31051f49dd136c9a9adb39c96a53ce839d5e87996b3f12c887ba8da4fdb","observation_id":"7254d039-d974-4a4c-bc93-e12cd269cf20","resolution":{"observed_at":"2026-05-15T20:18:15.783620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.16410","last_updated":"2023-06-28T17:57:10Z","snapshot_observed_at":"2026-08-13T11:07:21.975159Z","submitted_at":"2023-06-28T17:57:10Z","title":"Towards Language Models That Can See: Computer Vision Through the LENS of Natural Language","version":1},"cited_work":{"arxiv_id":"2306.16410","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.16410","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2306.16410 (2023) 2","venue":null,"work_id":"a1816eeb-528f-424f-af43-2c4b3c993da8","year":2023},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"cited_paper":"/paper/2306.16410","citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:6af3596a25b8d33e10af62a8cb965f3d41ec2f7f71df893c6e5e7ab8c89fb999","observation_id":"b8bad57a-08cb-4d1f-a0c4-6a097a15bc29","resolution":{"observed_at":"2026-05-15T20:18:15.599633Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: 1993 (4th) International Conference on Computer Vision","venue":null,"work_id":"f274e751-4884-4ffa-af4d-59f7336e5307","year":1993},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:c0daefe54488e36d36944f60acef2abdf7e329b687aa27a132ccc18c71b158dc","observation_id":"b72a520a-b593-4a50-a263-629843d8af92","resolution":{"observed_at":"2026-05-15T20:18:15.786158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in neural information processing systems33, 1877–1901 (2020) 4, 9, 11, 21, 22","venue":null,"work_id":"6923a3aa-0597-4fd8-b652-5ec1288e2553","year":1901},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:13183caa77a42f4f805092457fce73c25522651b4bbe832f44c3fe7060bfe537","observation_id":"fed26eb1-3b7d-43be-a90e-39e4331dfbbb","resolution":{"observed_at":"2026-05-15T20:18:15.788689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ACM Trans","venue":null,"work_id":"10f72f1a-e4d3-44d2-8393-770848457da2","year":2023},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:bc478d423125c615164e6c72f52e873ccfe0252b4c0885c527d983ba7902570f","observation_id":"a9fe8895-9705-4417-a3fb-5a19979de761","resolution":{"observed_at":"2026-05-15T20:18:15.791003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: CVPR (2021) 4","venue":null,"work_id":"e346c008-0b3b-4a84-a441-0363518b0211","year":2021},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:98e152ff3f1ca9e19ab5630ec97a1cd484b8f3dc925e8068e03da2a9ea5061cf","observation_id":"2c66a042-f3bd-4b04-9676-7d13b331b5d2","resolution":{"observed_at":"2026-05-15T20:18:15.793107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"76a511be-02ff-4dc9-8fab-0ec9766c9c3e","year":2023},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:0790adda6847f861fc6f74f52ed8c511003254e0ddef706e0dcf95a34ad746d2","observation_id":"ac9a7f0f-0c40-48eb-83fd-5225b857aa86","resolution":{"observed_at":"2026-05-15T20:18:15.795278Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09478","last_updated":"2023-11-07T18:25:48Z","snapshot_observed_at":"2026-08-06T12:38:03.720232Z","submitted_at":"2023-10-14T03:22:07Z","title":"MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning","version":3},"cited_work":{"arxiv_id":"2310.09478","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.09478","snapshot_observed_at":"2026-07-08T22:35:40.586981Z","title":"MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning","venue":"cs.CV","work_id":"fb62cd1b-3991-40be-a987-3cfa5772b5b5","year":2023},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"cited_paper":"/paper/2310.09478","citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:9804ff03aadd18abb970dbad339dd8cac9dfa55e54ef167dc14ecca36c297eef","observation_id":"996ca3fc-1ad2-4bbe-8cf0-7c41edf64524","resolution":{"observed_at":"2026-05-16T07:13:09.112362Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12793","last_updated":"2023-11-28T08:52:50Z","snapshot_observed_at":"2026-08-14T06:42:43.375489Z","submitted_at":"2023-11-21T18:58:11Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","version":2},"cited_work":{"arxiv_id":"2311.12793","doi":"10.48550/arxiv.2311.12793","metadata_source":"pith","pith_arxiv_id":"2311.12793","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","venue":"cs.CV","work_id":"90e2b26a-3d27-4567-86b5-929b582a8034","year":2023},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"cited_paper":"/paper/2311.12793","citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:bb7535ca3528f35d585121fa2ccdf7527a8af498018ad350b376484ee649febb","observation_id":"146fed86-e719-4157-a572-2704ba86e6f1","resolution":{"observed_at":"2026-05-15T20:18:15.593758Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:08.932244+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:08.932244+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in neural information processing systems29 (2016) 3, 7, 8","venue":null,"work_id":"deb5a0f8-7f10-4d04-a3fc-d1e25f1dbd5b","year":2016},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:1dff1091e25b4a490fba74bed2d225f5035b69e1624551fba8b39a618104f986","observation_id":"46b2e885-baad-45ce-85c9-8704c2eed1ce","resolution":{"observed_at":"2026-05-15T20:18:15.798544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"aa0d91ea-d66f-44d2-a659-e0e17e6440a4","year":2023},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:af84139996693b2848bbb1298456928c29b49a44737f4e8e606ef3911efbe22a","observation_id":"8cb85d00-298c-49aa-a09e-3e103837ffbe","resolution":{"observed_at":"2026-05-15T20:18:15.800932Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"7a063330-49ea-428b-b285-d751e07ae81d","year":2022},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:d55a5e840bf0bdafe3448ced28a0ce56d7fb682664e392d619ff8cef7975fac7","observation_id":"21afd6bf-0673-4a84-9c75-5b750877a0df","resolution":{"observed_at":"2026-05-15T20:18:15.803360Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"https://github.com/open-compass/opencompass (2023) 11","venue":null,"work_id":"dfd9e3bd-325b-4224-a678-7e12f55ccb1d","year":2023},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:046db43d9e32f036a6c395f7d2a307e0d945040ad7111cc297cb16f72e35ba07","observation_id":"998556e5-a872-49a4-9278-fa654d61a263","resolution":{"observed_at":"2026-05-15T20:18:15.805845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"com/InternLM/xtuner (2023) 11, 12, 23, 24","venue":null,"work_id":"1e6d0921-aa78-459c-88b1-6671f43923d2","year":2023},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:8005ae138e47eb42c57a1f93fe49d506f4eb2c9fda9a33584a883bf5ec406672","observation_id":"0d8d7a4d-c62a-491b-9f6b-a5d314d42318","resolution":{"observed_at":"2026-05-15T20:18:15.808247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"4129bbb6-bee0-4853-a2f4-9c0336561739","year":2023},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:f7f6ab0ce5ddd37223ebb30a9178082acb47b0641d8314e693b1d288383002ee","observation_id":"267c7f17-6c3d-449f-9439-fc0dd8361675","resolution":{"observed_at":"2026-05-15T20:18:15.810690Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"2b2d8f95-377c-4917-96dc-4c3ae8cb19c0","year":1961},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:4b9fe026c9061ea0958919dee05fca6414c2f5bec2f87d22262e10a0af218c63","observation_id":"b890ceed-b7cc-4a19-999e-3d6fd1dc3926","resolution":{"observed_at":"2026-05-15T20:18:15.813663Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16420","last_updated":"2024-01-29T18:59:02Z","snapshot_observed_at":"2026-08-05T03:42:54.599829Z","submitted_at":"2024-01-29T18:59:02Z","title":"InternLM-XComposer2: Mastering Free-form Text-Image Composition and Comprehension in Vision-Language Large Model","version":1},"cited_work":{"arxiv_id":"2401.16420","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.16420","snapshot_observed_at":"2026-07-04T19:50:11.273770Z","title":"InternLM-XComposer2: Mastering Free-form Text-Image Composition and Comprehension in Vision-Language Large Model","venue":"cs.CV","work_id":"93411487-d575-4b44-9d9e-2374874a66bd","year":2024},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"cited_paper":"/paper/2401.16420","citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:230f5df7dfeb3924ebd8e2f806d97e3cea002af1a046cd243725c2c6288e26c3","observation_id":"d4b6a04b-d8b2-46a4-8867-e734fd207a15","resolution":{"observed_at":"2026-05-17T05:30:28.063870Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":"868760f5-cca5-442f-82f7-24cdb65fdf9f","year":2023},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:7051dd17410875840efd5d329fd6b29519e39101854021155415fbe1808f6677","observation_id":"c210f13f-37f6-4e5f-abb1-8a52e32644d6","resolution":{"observed_at":"2026-05-15T20:18:15.816068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":"2306.13394","doi":"10.48550/arxiv.2306.13394","metadata_source":"pith","pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-07-10T13:27:05.561984Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","venue":"cs.CV","work_id":"806d2e73-71b3-4d56-87e0-39d571cc15d6","year":2023},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:c65dcc24cc5c15b9fe0f980d141959d2f3c1c4164571ccf71c5878222def17e6","observation_id":"881999c7-fa79-45d0-b917-f348e6369c1d","resolution":{"observed_at":"2026-05-15T20:18:15.509047Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:17.033703+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:17.033703+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"7426fcc9-728c-4548-94b3-8066bfcdf3d0","year":2023},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:61dfbb7c9013c3588d5c2232a7fd808f5b560b09afb102c4716ca259e3221d39","observation_id":"5001d30e-24ca-480d-828c-8cacd8c79a23","resolution":{"observed_at":"2026-05-15T20:18:15.818380Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2023.findings-","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T12:43:25.257063Z","title":"In: Findings of the Association for Computational Linguistics: ACL 2023","venue":null,"work_id":"293634fd-0d50-4eda-81f1-e3f942865218","year":2023},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:de233f52c6f4775567ce3bac82712c723dc83717a5871a569a87728863d5d895","observation_id":"5d08287a-8053-4e97-8d0d-dfe69ce9caae","resolution":{"observed_at":"2026-05-15T20:18:15.490957Z","resolver_source":"doi_truncated","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2022","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T17:29:59.328028Z","title":"37 Wenyue Hua, Lizhou Fan, Lingyao Li, Kai Mei, Jianchao Ji, Yingqiang Ge, Libby Hemphill, and Yongfeng Zhang","venue":null,"work_id":"ed940a1a-3e19-4658-88d1-34194ac465ee","year":2022},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:d8bc1743accbe6bbe43d71bc01e2d7357649c9628acf7bf9f0c6f9595cce3f13","observation_id":"5a80d92d-f532-42ca-83d1-312f60f4cf4d","resolution":{"observed_at":"2026-05-15T20:18:15.485601Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-10T19:08:13.136461+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-10T19:08:13.136461+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14882","last_updated":"2024-04-13T17:13:55Z","snapshot_observed_at":"2026-08-14T06:09:40.861975Z","submitted_at":"2023-05-24T08:33:15Z","title":"Dynamic Clue Bottlenecks: Towards Interpretable-by-Design Visual Question Answering","version":2},"cited_work":{"arxiv_id":"2305.14882","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.14882","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2305.14882 (2023) 4","venue":null,"work_id":"83e3a525-ac09-49bc-8f47-42c8ea0dcf94","year":2023},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"cited_paper":"/paper/2305.14882","citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:d2fbf665a98733d7f27dfdced6a78b7685786a1c6dcd587362b239f8aad82f1d","observation_id":"95663a59-111c-4a1c-9e73-ba265c6dcc19","resolution":{"observed_at":"2026-05-15T20:18:15.582600Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Conference on Computer Vision and Pattern Recognition (CVPR) (2017) 4","venue":null,"work_id":"6f9bf990-253a-4f3b-b775-9b828754544c","year":2017},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:78a306ee81a328aa51eb34e69d8ff16031f6ff74be961cb5f0ce43ad73712d43","observation_id":"d7c261a0-478f-475b-b63f-e59ab1eb3003","resolution":{"observed_at":"2026-05-15T20:18:15.821099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"9f04fa08-58be-466f-9ec8-99275c852d40","year":2023},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:57246efd0a8117df9f986e13254ffdc0550c275a3cf2859f534e9a9154073c9d","observation_id":"2d3701d7-a80e-4cd3-a109-1f6dd3636a23","resolution":{"observed_at":"2026-05-15T20:18:15.823656Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":"d272981a-9d3b-42d4-90de-85a5c8596068","year":2019},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:361e1b46fe36edc4b8d4cb59442a7fee6aa3af7ac079452affc04d588e7e4051","observation_id":"9cdd2190-f815-4841-9bcf-ced8e62c9fe2","resolution":{"observed_at":"2026-05-15T20:18:15.825953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Alvey vision conference","venue":null,"work_id":"d3ca0b87-55e8-4b5c-9cc8-af5420d7acdf","year":1988},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:a140392f0a73e4863ceaf1e6ffebd37b008760319d3f2e10c3c6b90a60bbd0ed","observation_id":"0bfe30f8-de75-4de1-a072-3d0165bfd8df","resolution":{"observed_at":"2026-05-15T20:18:15.828507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cambridge university press (2003) 2","venue":null,"work_id":"ccc4ba33-ac29-4759-969e-4eb1aac8d5e2","year":2003},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:8f0340f9082ecd4f8fdc56b6198a3cd227aaff1b855e10f0ef0e63e0734065f2","observation_id":"a030bb59-3043-41cb-89f5-d0b525733949","resolution":{"observed_at":"2026-05-15T20:18:15.831015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09699","last_updated":"2023-08-17T21:43:24Z","snapshot_observed_at":"2026-08-13T17:05:26.904327Z","submitted_at":"2022-11-15T19:07:53Z","title":"PromptCap: Prompt-Guided Task-Aware Image Captioning","version":4},"cited_work":{"arxiv_id":"2211.09699","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2211.09699","snapshot_observed_at":"2026-07-01T00:35:10.154544Z","title":"A., and Luo, J","venue":null,"work_id":"0b312d17-4e70-4d0d-ae07-c4a07a338426","year":2022},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"cited_paper":"/paper/2211.09699","citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:7f7e46b6962732b04e562c78acd8f0d8cd3e8adc3822a3d0ebaa6fac5172511c","observation_id":"9a16ecd1-667b-4023-b391-602484d52b8b","resolution":{"observed_at":"2026-05-15T20:18:15.672292Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.11897","last_updated":"2023-08-17T21:45:52Z","snapshot_observed_at":"2026-08-13T12:19:54.379421Z","submitted_at":"2023-03-21T14:41:02Z","title":"TIFA: Accurate and Interpretable Text-to-Image Faithfulness Evaluation with Question Answering","version":3},"cited_work":{"arxiv_id":"2303.11897","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2303.11897","snapshot_observed_at":"2026-07-02T14:57:03.744199Z","title":"Alon Jacovi and Yoav Goldberg","venue":null,"work_id":"ade0051f-b36b-47a8-bacd-8151eb9d4b37","year":2023},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"cited_paper":"/paper/2303.11897","citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:6b764556b8ab7916f4e371872e3c98c01744553bfa05dcc40e3bd12c8a8b1604","observation_id":"532dd131-098b-434e-a28d-6f80c7074153","resolution":{"observed_at":"2026-05-15T20:18:15.689615Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.03052","last_updated":"2024-04-05T04:33:23Z","snapshot_observed_at":"2026-08-13T05:09:18.242345Z","submitted_at":"2023-12-05T18:58:37Z","title":"Visual Program Distillation: Distilling Tools and Programmatic Reasoning into Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2312.03052","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.03052","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual program distillation: Distilling tools and programmatic reasoning into vision-language models","venue":null,"work_id":"b36728bd-6d30-446f-b4b7-930142ea5a3e","year":2023},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"cited_paper":"/paper/2312.03052","citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:f03c9a4290cc92b6a9fdb2bc9276250547e0a0326281b1e8e19cb880beed1f95","observation_id":"3b0a7b7e-1c97-493d-b1ad-5a7ae2346f39","resolution":{"observed_at":"2026-05-15T20:18:15.496968Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"International journal of computer vision123, 32–73 (2017) 3, 4","venue":null,"work_id":"612bf119-3459-473a-9f68-d3d269c62f11","year":2017},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:6ab09083f21d975680c32e4bd925a9cdb2b81da11514255bc797eea3a7cb37bf","observation_id":"0b5a1051-327b-4ebf-8c93-0762dfdced0b","resolution":{"observed_at":"2026-05-15T20:18:15.833614Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":"2d767d7a-ed65-4cf8-b162-b1bc9df944fa","year":2021},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:f38467690e2d3da690bc1b0c38029f7d5af8c1d6316c04ea893945db3a81972f","observation_id":"7e6c7465-7eff-4c68-ae11-60ebfed00596","resolution":{"observed_at":"2026-05-15T20:18:15.836030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17092","last_updated":"2023-11-28T05:53:55Z","snapshot_observed_at":"2026-08-13T05:15:43.956937Z","submitted_at":"2023-11-28T05:53:55Z","title":"SEED-Bench-2: Benchmarking Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2311.17092","doi":"10.48550/arxiv.2311.17092","metadata_source":"pith","pith_arxiv_id":"2311.17092","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Seed-bench-2: Benchmarking multimodal large language models","venue":"cs.CV","work_id":"ba82c4a5-9f56-425b-b1dd-5a9fb940b10b","year":2023},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"cited_paper":"/paper/2311.17092","citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:353a4a590930a1a5d3fc4815f0b291679b52669ac006bd311c0dc9c1d7b84eb8","observation_id":"1d5c8533-1aa0-446e-9863-d49c8d67f1cb","resolution":{"observed_at":"2026-05-15T20:18:15.530071Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.308959+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.308959+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":"2307.16125","doi":"10.48550/arxiv.2307.16125","metadata_source":"pith","pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","venue":"cs.CL","work_id":"23881ff0-b851-474c-8712-90744cc07a3a","year":2023},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:d1f42ee08dfed8d878b19b948cb183b40ae8783ce3b15cc6101200d4c6e8fa9b","observation_id":"68ea6d96-69d5-4450-8375-3014c5517409","resolution":{"observed_at":"2026-05-15T20:18:15.545662Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-08-12T12:01:54.105712Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":"2301.12597","doi":"10.48550/arxiv.2301.12597","metadata_source":"pith","pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","venue":"cs.CV","work_id":"63d03f4d-15f4-4583-8286-913c19f02294","year":2023},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:1e1bf4f76e19aecb93d9b1fb68cc58593f942e73a9383461dcfd90e640bc2b58","observation_id":"c1412af2-b079-464d-bc52-db91f758aca3","resolution":{"observed_at":"2026-05-15T20:18:15.558098Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-12T21:49:47.354893+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T21:49:47.354893+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Computer Vision– ECCV 2014: 13th European Conference, Zurich, Switzerland, September 6-12, 2014, Proceedings, Part V 13","venue":null,"work_id":"01ab365b-4147-4ce5-8b62-48b14cd0a30a","year":2014},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:ce784393e19758701ba896ded5cda4a0f9d36a42fc1e615acb8599b8afce9661","observation_id":"a6cadab9-e8d2-42c2-9ed3-29cf7110eab7","resolution":{"observed_at":"2026-05-15T20:18:15.839038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Transactions of the Association for Computational Linguistics11, 635–651 (2023) 2, 9, 21","venue":null,"work_id":"9f43da65-261b-46f1-ac23-ac0190ac1b0e","year":2023},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:b21b9d14e20b72aaea765c0cc4f6562f6eab3b63569ebd0c1fe82d2225316af7","observation_id":"a2d66600-7c1c-4a2f-9eaf-5685180dfec8","resolution":{"observed_at":"2026-05-15T20:18:15.841877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"47456a68-eb6b-4971-bef0-dedbee0f86a6","year":2023},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:fc800ee092848a86e783958bffd888a59bcd832df8a93848ed634e05c37f5bb0","observation_id":"2da219b6-9c93-4953-8dcc-6bc7fbcd1f54","resolution":{"observed_at":"2026-05-15T20:18:15.844279Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"2b412bd3-113c-426f-a47f-ba12f07b8efe","year":2023},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:de3d7b5bcfd924902790441ec2d95c1fff584abf3d752a30ba9395fc1660a355","observation_id":"14f5665c-0157-4308-98c8-275c83c14c88","resolution":{"observed_at":"2026-05-15T20:18:15.846689Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"io/blog/2024-01-30-llava-next/ 2, 4, 8, 11, 12, 23, 24","venue":null,"work_id":"03433b27-f8d5-4394-be46-bca63d431c0e","year":2024},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:4aabbe513f640c55c0d648ee1303cf18259799c37a55d9d4cf08c6a2a0877828","observation_id":"509e345e-cd95-4443-b391-bee8bc86f682","resolution":{"observed_at":"2026-05-15T20:18:15.849407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in neural information processing systems36 (2024) 2, 11","venue":null,"work_id":"7caf1a9c-c55c-417d-8745-7898faf2b91c","year":2024},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:ef95fa253667e84f5134763b6e6ee3aa4b229fbcfbcba9487d5f0eaa59923d19","observation_id":"1dd3f07d-6473-444b-97a2-667afbffde6c","resolution":{"observed_at":"2026-05-15T20:18:15.693679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f977c217-c651-4f75-8c9f-744023d4d871","year":2023},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:6c851691354b1ad01024c07f2a025f36b4d626cc0f2f14346926f9f7d0eff779","observation_id":"cf854146-2f12-47d1-acae-ff5f845c4577","resolution":{"observed_at":"2026-05-15T20:18:15.697244Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07895","last_updated":"2024-08-26T02:37:14Z","snapshot_observed_at":"2026-08-13T22:21:37.032118Z","submitted_at":"2023-05-13T11:28:37Z","title":"OCRBench: On the Hidden Mystery of OCR in Large Multimodal Models","version":7},"cited_work":{"arxiv_id":"2305.07895","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.07895","snapshot_observed_at":"2026-07-01T22:26:17.944984Z","title":"OCRBench: On the Hidden Mystery of OCR in Large Multimodal Models","venue":"cs.CV","work_id":"521163e9-4c77-4c73-8b7f-9a6aa75b6d3b","year":2023},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"cited_paper":"/paper/2305.07895","citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:591b1a2a1d2fb23a81db82a48b61205106fcbce81a49f376d2633a0ab7889922","observation_id":"84113f97-4b89-46be-8fbb-382d41d8eb83","resolution":{"observed_at":"2026-05-17T09:55:36.035986Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"1cc95002-a477-47dd-9768-8047668e47f3","year":2024},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:851a4818ffe9543e6d131a5ceb486a5120501941060b8e1a9ea940a406e4380e","observation_id":"434afe2a-894c-47b0-ab3b-eaacd2eeb993","resolution":{"observed_at":"2026-05-15T20:18:15.700983Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the seventh IEEE international conference on computer vision","venue":null,"work_id":"7b5c632b-5f89-4bf9-bc5a-586b882f101b","year":1999},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:5947f6606dad97079c3f1c3995dbf01c442c922ef24c806c09ec1f56ecff1040","observation_id":"a66033a4-545f-455c-9f27-947c3b512e4d","resolution":{"observed_at":"2026-05-15T20:18:15.704616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17172","last_updated":"2023-12-28T17:57:06Z","snapshot_observed_at":"2026-08-13T04:52:43.165678Z","submitted_at":"2023-12-28T17:57:06Z","title":"Unified-IO 2: Scaling Autoregressive Multimodal Models with Vision, Language, Audio, and Action","version":1},"cited_work":{"arxiv_id":"2312.17172","doi":"10.48550/arxiv.2312.17172","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.17172","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Unified-io 2: Scaling autoregressive multimodal models with vision, language, audio, and action","venue":"arXiv (Cornell University)","work_id":"dee0bd36-ce7b-427c-9af3-0ea894c01777","year":2023},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"cited_paper":"/paper/2312.17172","citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:f588d6ae07afd1ceca96db9b6b430c2dc0426ac825baa8fd1a8179aa37ab5f72","observation_id":"7673fcf4-7502-4ced-8300-5b3a687e1033","resolution":{"observed_at":"2026-05-15T20:18:15.684545Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":"2310.02255","doi":"10.1109/cvpr52734.2025.01245","metadata_source":"pith","pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","venue":"cs.CV","work_id":"e22c3789-9e71-4242-b6ea-3e60e06e2b66","year":2023},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:4c177b94636452dd348c4c99d2f2edb67349d50f086b66af4bd363a37f19cad0","observation_id":"827638ea-6485-465e-b8cb-f6601dc6fd4e","resolution":{"observed_at":"2026-05-15T20:18:15.678753Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"MIT press (2010) 2","venue":null,"work_id":"897892df-d7ef-4a57-9365-86c87f2ae046","year":2010},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:c8561988ce45d52ba40f4f3c8b200c03affe52685c2462eee4941028ecfb3e6e","observation_id":"cc83e521-21b9-41d8-9c3e-aa999faf7126","resolution":{"observed_at":"2026-05-15T20:18:15.709099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Science 194(4262), 283–287 (1976) 2","venue":null,"work_id":"a5c91a1e-2598-42b1-b30c-51f91d9c8db8","year":1976},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:39c158d6166246e18aa1eaa9ba68b0ad42a7f34240eef1c85b85b405c0af17f9","observation_id":"0eeac0e1-ac71-45ef-9a00-80fac5c18bb4","resolution":{"observed_at":"2026-05-15T20:18:15.713373Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.10543","last_updated":"2019-08-28T04:16:52Z","snapshot_observed_at":"2026-08-14T11:29:55.067191Z","submitted_at":"2019-08-28T04:16:52Z","title":"SPair-71k: A Large-scale Benchmark for Semantic Correspondence","version":1},"cited_work":{"arxiv_id":"1908.10543","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1908.10543","snapshot_observed_at":"2026-07-04T13:49:51.655649Z","title":"Spair-71k: A large-scale benchmark for semantic correspon- dence","venue":null,"work_id":"5204ff4e-af27-47db-8f90-6af4daf72cf3","year":1908},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"cited_paper":"/paper/1908.10543","citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:22a1c886b33c490e3ce0cb6309deb6766c6052dbf9da539f170f7b9283d5d32c","observation_id":"f49f3f48-d0ac-4389-8315-31b5ccd71c56","resolution":{"observed_at":"2026-05-15T20:18:15.503362Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cambridge tiass., HIT479(480), 104 (1969) 2","venue":null,"work_id":"34131340-9fe8-473b-af19-67432ce2e1dc","year":1969},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:9e33f4127a4090bd5102de6af3598c5104f0de9de693749f1ca504ed869cde82","observation_id":"bfb6c897-1a2e-4c19-be5e-fd2aee2e9fd9","resolution":{"observed_at":"2026-05-15T20:18:15.717033Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"52df6c29-4fb9-4b6a-90dc-05d788dc69fd","year":2023},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:efd1c5df9efcd1f1ebe35cf01b45e1d4092f01d8316ab07fa50ad708a34e0df2","observation_id":"1ed26a87-e17c-4207-8559-e3d004ac42b5","resolution":{"observed_at":"2026-05-15T20:18:15.720719Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":"2307.01952","doi":"10.48500/arxiv.2307.01952","metadata_source":"pith","pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","venue":"cs.CV","work_id":"8034c587-fba6-4941-87ba-c98f2ac962cb","year":2023},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:ec40438fa1d83ae099b4b2e2ed4a9b70145d0e6fb6c708bb9d723e94d16f0165","observation_id":"f91b33e7-a376-4ba9-ac0e-49845d32d7ce","resolution":{"observed_at":"2026-05-15T20:18:15.522936Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: International conference on machine learning","venue":null,"work_id":"a79fd2ed-bea4-4ae4-9910-a78357dee109","year":2021},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:48df6ead8acc9d7e4a661a5c60cc7ee87dd4da562a48f975645e186d904189cd","observation_id":"7ff96374-5266-4210-a5a0-706d7dcf6277","resolution":{"observed_at":"2026-05-15T20:18:15.724244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02114","last_updated":"2021-11-03T10:16:39Z","snapshot_observed_at":"2026-08-02T08:12:49.547570Z","submitted_at":"2021-11-03T10:16:39Z","title":"LAION-400M: Open Dataset of CLIP-Filtered 400 Million Image-Text Pairs","version":1},"cited_work":{"arxiv_id":"2111.02114","doi":"10.48550/arxiv.2111.02114","metadata_source":"pith","pith_arxiv_id":"2111.02114","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LAION-400M: Open Dataset of CLIP-Filtered 400 Million Image-Text Pairs","venue":"cs.CV","work_id":"fbf16034-512e-4dd9-a0bd-7ddd23f532a6","year":2021},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"cited_paper":"/paper/2111.02114","citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:a1fcffa8733861718efb15c4e9f25e82ca74d28458adbeaf70c8e153dead7f0a","observation_id":"410795db-2cbf-4622-a1a2-34c8ce65d5ff","resolution":{"observed_at":"2026-05-15T20:18:15.537757Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:25:40.426779+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:25:40.426779+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: European Conference on Computer Vision","venue":null,"work_id":"f69a68f5-6b6a-4aa4-ab9a-7b8b0dfcdc0c","year":2022},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:6f03037d299e46bf5b5876cd6467775e3fe62c9cd1bc5d7174ecca3d31d93b01","observation_id":"33c1b918-6657-4f1a-8e24-48fcad2e8f2f","resolution":{"observed_at":"2026-05-15T20:18:15.728266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06712","last_updated":"2023-08-18T05:49:47Z","snapshot_observed_at":"2026-08-14T02:59:07.830877Z","submitted_at":"2023-04-13T17:58:08Z","title":"What does CLIP know about a red circle? Visual prompt engineering for VLMs","version":2},"cited_work":{"arxiv_id":"2304.06712","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.06712","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2304.06712 (2023) 3","venue":null,"work_id":"7cecc1dc-5be8-4d35-b542-1c3c3d23c8c9","year":2023},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"cited_paper":"/paper/2304.06712","citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:b9c76064a9a297fa6ec71b1ecd05c695299207f7001afea3d2e0636942b0cdc3","observation_id":"dcb66970-d321-4245-98b2-a09e0c80b1e4","resolution":{"observed_at":"2026-05-15T20:18:15.551709Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"CVPR (2021) 14","venue":null,"work_id":"d2680677-af7f-4d15-9cdb-f20309eaa6cb","year":2021},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:3844196bc7396785c41fb23aa6c5de9a19f150dad2432b84ece0ab68ec0fd6c3","observation_id":"5eb3dfad-7ab7-465a-ac49-c3ca3ec61d1f","resolution":{"observed_at":"2026-05-15T20:18:15.731452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":"2303.15389","doi":"10.48550/arxiv.2303.15389","metadata_source":"pith","pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","venue":"cs.CV","work_id":"0c16c250-fd0f-446a-bbb0-ea8dd0ba5ccd","year":2023},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:b7a7434aab00c441fc346132549a2c531a08aba0520e7fa6425d7ee2a6360ad1","observation_id":"b8d17ed1-6576-4d50-ad15-e05a10d25bd1","resolution":{"observed_at":"2026-05-15T20:18:15.564212Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03881","last_updated":"2023-12-06T17:58:25Z","snapshot_observed_at":"2026-08-13T11:23:13.667372Z","submitted_at":"2023-06-06T17:33:19Z","title":"Emergent Correspondence from Image Diffusion","version":2},"cited_work":{"arxiv_id":"2306.03881","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.03881","snapshot_observed_at":"2026-06-29T17:53:46.724253Z","title":"arXiv preprint arXiv:2306.03881 (2023) 14","venue":null,"work_id":"3ddf23f7-c2db-45ab-be94-4b6db6976b52","year":2023},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"cited_paper":"/paper/2306.03881","citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:7394ae49c7b30cbd45b31dcfa64c9d2978307a4de7a559cfce8aa4dddc7aa128","observation_id":"b4aef595-17b8-4569-bcd5-562b37ff4ffe","resolution":{"observed_at":"2026-05-15T20:18:15.570881Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":"2312.11805","doi":"10.1038/nrn2888","metadata_source":"pith","pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini: A Family of Highly Capable Multimodal Models","venue":"cs.CL","work_id":"83f7c85b-3f11-450f-ac0c-64d9745220b2","year":2023},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:d0460d599b34a0afa89379f57f82c2184797102737dab5727ffc49972b5e11ae","observation_id":"c17df47c-94db-4fdc-82ff-2839578afde7","resolution":{"observed_at":"2026-05-15T20:18:15.576419Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"https://github.com/InternLM/InternLM (2023) 12, 23, 24","venue":null,"work_id":"ad603e12-9f0c-46ac-9e00-9f92346a05f3","year":2023},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:2282ced85729cc04c5fcab65466f9649c61c8207bba2bf8f2a1e6925d5349ff6","observation_id":"a7075c6b-8591-482f-83b5-e0ec6c073911","resolution":{"observed_at":"2026-05-15T20:18:15.734581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c5355fd7-0da5-4a4e-a341-7eeeb8f307b1","year":2023},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:b348c8033032fcfaf1cfba7feda5882a397d4d429450c9b4eff28e75b51c60c6","observation_id":"f4cae9cd-991d-4d5b-901a-c596728f644a","resolution":{"observed_at":"2026-05-15T20:18:15.737730Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"IEEE Transactions on pattern analysis and machine intelligence24(9), 1226–1238 (2002) 2 20 Fu et al","venue":null,"work_id":"be6d062a-8987-4464-8f95-c71f4ad16137","year":2002},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:b209d716ea42bab0a3099073e28a9c537249f303f53700fc72eaa981fc9aca00","observation_id":"2a3aae24-6ba9-4f12-96a2-661cbac603c4","resolution":{"observed_at":"2026-05-15T20:18:15.740549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":"2307.09288","doi":"10.24963/ijcai.2025/706","metadata_source":"pith","pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","venue":"cs.CL","work_id":"68a5177f-d644-44c1-bd4f-4e5278c22f5d","year":2023},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:8786b38cfac9a2cdc22240103785a6bc1df9df0d9620522e6d5b07f46ab7592e","observation_id":"c06fee5a-2d65-4152-a868-6783f875cfff","resolution":{"observed_at":"2026-05-15T20:18:15.588230Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Pro- ceedings of IEEE Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":"e6b5056c-9225-4a93-b0c0-6b05a159494c","year":1993},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:1da68fd45f6185c4b434459e3156c105f03f8d4cfb6868bac0db7275a9e1ae41","observation_id":"56a1c8a3-f519-442d-a6bb-eb1cd0f04b5a","resolution":{"observed_at":"2026-05-15T20:18:15.743471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"9d3dc186-bbc1-44be-be77-7ca660b78fc6","year":2023},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:37b21bfa0bcce574b588e1019b7f40e78f067f509796de2aba67b2ed8d1591e8","observation_id":"96aa267c-ca6c-47f5-8249-15ff9908c10e","resolution":{"observed_at":"2026-05-15T20:18:15.745998Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":"2203.11171","doi":"10.1101/2025.04.03.646459","metadata_source":"pith","pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","venue":"cs.CL","work_id":"8c6d5a6b-b5cc-4105-9c84-9c34bb9375bb","year":2022},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:0b1efcfbdbda6d89763f37fe8c7ac1484c8edf86871b8726a604793728ae779b","observation_id":"21050174-c0c5-400c-b14a-73891c3f4531","resolution":{"observed_at":"2026-05-15T20:18:15.606264Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-05-21T18:52:42.88633+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T18:52:42.88633+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09295","last_updated":"2023-03-16T13:15:03Z","snapshot_observed_at":"2026-08-13T12:23:24.844169Z","submitted_at":"2023-03-16T13:15:03Z","title":"DIRE for Diffusion-Generated Image Detection","version":1},"cited_work":{"arxiv_id":"2303.09295","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.09295","snapshot_observed_at":"2026-07-08T12:04:50.450995Z","title":"Dire for diffusion-generated image detection","venue":"cs.CV","work_id":"a594f9df-0c1b-4e90-a50f-2720024eebda","year":2023},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"cited_paper":"/paper/2303.09295","citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:b5fbba504d8bf8a9153ab67441965b4319bdc184a9c4ff33dbd5347818bc7509","observation_id":"8a04abfe-161d-49f3-96c3-2728f4fad943","resolution":{"observed_at":"2026-05-15T20:18:15.612995Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"70d6766c-fcbb-458e-b6a1-0094ba7c485c","year":2022},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:eb1af0b4d64021f97c87d84aa2b94e3a32c3270d64fbb82ceaad5a4ce41214b8","observation_id":"fc6a34db-744a-4677-a780-d0a488b920e3","resolution":{"observed_at":"2026-05-15T20:18:15.748558Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16375","last_updated":"2025-01-20T00:29:19Z","snapshot_observed_at":"2026-08-13T00:22:32.993708Z","submitted_at":"2024-04-25T07:29:17Z","title":"List Items One by One: A New Data Source and Learning Paradigm for Multimodal LLMs","version":2},"cited_work":{"arxiv_id":"2404.16375","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.16375","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"List items one by one: A new data source and learning paradigm for multimodal llms","venue":null,"work_id":"c46195f3-aa14-4c81-b51f-eee76883e98b","year":2024},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"cited_paper":"/paper/2404.16375","citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:b76dab30a06b619a4160bbae49c21c2e1517b76b6c723faf48ec93a9b2a2204c","observation_id":"3be8907e-eadd-4f79-ab9f-c308f9a3827c","resolution":{"observed_at":"2026-05-15T20:18:15.625753Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11441","last_updated":"2023-11-06T07:39:49Z","snapshot_observed_at":"2026-08-12T21:25:32.312122Z","submitted_at":"2023-10-17T17:51:31Z","title":"Set-of-Mark Prompting Unleashes Extraordinary Visual Grounding in GPT-4V","version":2},"cited_work":{"arxiv_id":"2310.11441","doi":"10.48550/arxiv.2310.11441","metadata_source":"pith","pith_arxiv_id":"2310.11441","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Set-of-Mark Prompting Unleashes Extraordinary Visual Grounding in GPT-4V","venue":"cs.CV","work_id":"ddc8878e-ed0c-4a66-952a-254dce1c622a","year":2023},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"cited_paper":"/paper/2310.11441","citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:1eb3026fa5fa6a2b90fc9300ab260cb5428a2adab5cb89b1757e92f7391b7e23","observation_id":"f3fee5fc-46c8-4076-b40f-91e0f1a6489a","resolution":{"observed_at":"2026-05-15T20:18:15.632677Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: CVPR (2024) 14","venue":null,"work_id":"c4472695-5f93-4e93-803a-0dc09bbd2a73","year":2024},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:1e32c15a04d42369de47652366af68bc4935b2cdd80b59c264252639683e3a62","observation_id":"7fced311-c5dd-45cc-9e03-b3a3fb4f3f82","resolution":{"observed_at":"2026-05-15T20:18:15.751646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the AAAI Conference on Artificial Intelligence","venue":null,"work_id":"75c0eb7b-f54f-4f8f-8e62-88191b053510","year":2022},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:a6bdd924cbe27e3ad2cda97958658544b473caa5549f4ab266e08e415296d48f","observation_id":"e8d55ce6-fd0d-41eb-80e4-30352dbd407a","resolution":{"observed_at":"2026-05-15T20:18:15.754381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17421","last_updated":"2023-10-11T05:07:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:34:51Z","title":"The Dawn of LMMs: Preliminary Explorations with GPT-4V(ision)","version":2},"cited_work":{"arxiv_id":"2309.17421","doi":"10.48550/arxiv.2309.17421","metadata_source":"pith","pith_arxiv_id":"2309.17421","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The Dawn of LMMs: Preliminary Explorations with GPT-4V(ision)","venue":"cs.CV","work_id":"344e9dbe-1d9b-4992-a4f1-9bc649978f46","year":2023},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"cited_paper":"/paper/2309.17421","citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:08b15d024bcbda81508ed744abc643bcd14a50d72325f759dcf3395ea8c6db55","observation_id":"84fa579c-1abd-48d2-b560-b96da5f3a348","resolution":{"observed_at":"2026-05-15T23:26:07.065720Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-08-08T03:31:37.699253Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":"2308.02490","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-07-10T09:37:00.827227Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","venue":"cs.AI","work_id":"7f3bac41-a0a5-4a7a-bfd2-526b616db745","year":2023},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:1004e257b6a4401fd1966269fdaa66537ea9af92749a4b8310d212923028e9ad","observation_id":"8daddfca-2328-4e99-867c-dfe394bb0e23","resolution":{"observed_at":"2026-05-15T20:18:15.655809Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16502","last_updated":"2024-06-13T15:02:39Z","snapshot_observed_at":"2026-08-13T09:07:54.479155Z","submitted_at":"2023-11-27T17:33:21Z","title":"MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI","version":4},"cited_work":{"arxiv_id":"2311.16502","doi":"10.48550/arxiv.2311.16502","metadata_source":"pith","pith_arxiv_id":"2311.16502","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI","venue":"cs.CL","work_id":"da087b16-ea05-4064-980e-ce1d6e281d49","year":2023},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"cited_paper":"/paper/2311.16502","citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:4a1822d2b2b97d2eba3e9d64bd1967c073e7faa7fc15c6e6221d939f5daddd19","observation_id":"566ba0cc-e3c3-4f53-9bf6-6bb74f6bc283","resolution":{"observed_at":"2026-05-15T20:18:15.661112Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-10T17:38:12.261029+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-10T17:38:12.261029+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in Neural Information Processing Systems35, 27469–27483 (2022) 3, 9","venue":null,"work_id":"e2210a94-fba8-4f88-a92f-17e6580261d2","year":2022},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:c707dc3c77298d363d948c516b2a66f444ee22c3921f7bf869a9495f63ecd2c6","observation_id":"d8059fec-5cab-4dab-b8b9-1830dc7cbd2b","resolution":{"observed_at":"2026-05-15T20:18:15.757131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: The IEEE Conference on Computer Vision and Pattern Recognition (CVPR) (June 2019) 4","venue":null,"work_id":"98323bd4-ba2e-40fd-9f20-2fb087c6dd18","year":2019},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:a440050914ecbf784d8aa5211138ec5cd37e3eb65ed7466e86c319a6b862f78b","observation_id":"fa975452-116c-4d8e-860a-9083bc9de309","resolution":{"observed_at":"2026-05-15T20:18:15.759785Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"You are an AI assistant who will help me to match an answer with several options of a single-choice question","venue":null,"work_id":"b187d5e2-1df8-482c-bf51-59ef60bdcc48","year":2024},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:e7dc1aa2665df6d3132b546268a7837663c173c9f6762728ce7f07a00aced3c9","observation_id":"f777c19d-b5ac-4ae3-8fec-a230e670e8f9","resolution":{"observed_at":"2026-05-15T20:18:15.765110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","latest_version":4,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive"},"reference_resolution":{"displayed":90,"state_counts":{"malformed_identifier":1,"metadata_mismatch":29,"parse_uncertain":0,"unresolved":18,"verified_exact":4,"verified_fuzzy":38},"total_outbound_references":90},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 90 of 90 outbound references and 92 inbound Pith citation observations for arXiv:2404.12390."}