{"as_of":"2026-08-10T04:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9c3c5fd2479cc03260ca35ed349bfbd3d4b8ecbc1ac35831caa87a7552223656","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T17:09:38.969249Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-13T00:15:58.111384Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-09T18:59:31.056898Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.10548","snapshot_observed_at":"2026-07-13T00:15:58.111384Z","title":"emnlp-main.793/","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.23913","last_updated":"2026-04-09T03:33:08Z","snapshot_observed_at":"2026-08-09T18:59:48.880611Z","submitted_at":"2026-04-09T03:33:08Z","title":"Can LoRA Fusion Support Cross-Domain Tasks in Cloud-Edge Collaboration?","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-13T00:15:58.111384Z"},"links":{"cited_paper":"/paper/2512.10548","citing_paper":"/paper/2605.23913"},"observation_digest":"sha256:87c125eb1bbf50e0682bd3e361d2dff48fe5326a5a036fe70046f093c6487f5e","observation_id":"fa65d30c-7fb7-470b-95d6-9e823029c87d","resolution":{"observed_at":"2026-07-13T00:15:58.111384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2512.10548/citation-record","integrity":"/paper/2512.10548/integrity","json":"/paper/2512.10548/citation-record.json","paper":"/paper/2512.10548"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-03T17:09:31.969501Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-09T18:59:31.056898Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:31.969501Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:47ffe880153bed79703e2226ff99f51ad189388fd01943b9283359bb01bd67d0","observation_id":"5f32fe38-422a-4bc1-9057-a9cef7fd7d38","resolution":{"observed_at":"2026-08-03T17:09:31.969501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:32.124176Z","title":"Flamingo: a visual language model for few-shot learning.Advances in neural information processing systems, 35:23716–23736,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-09T18:59:31.056898Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:32.124176Z"},"links":{"citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:e3244d8e84b3d3a8f7562895c3b913b6ea16c8dc2d5a590d2161998de134c044","observation_id":"e5e7e21f-8336-429d-9e68-3334dfe51165","resolution":{"observed_at":"2026-08-03T17:09:32.124176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:32.253101Z","title":"Qwen-vl: A versatile vision-language model for un- derstanding, localization, text reading, and beyond, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-09T18:59:31.056898Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:32.253101Z"},"links":{"citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:33b7637022d0c36ac08f5a4d02e6a993f4aa200c2a03b693a1e9cce43c1bab13","observation_id":"06fd9171-731a-4be9-b22d-45c42578b975","resolution":{"observed_at":"2026-08-03T17:09:32.253101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-03T17:09:32.364961Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-09T18:59:31.056898Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:32.364961Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:56add1daf80dde3f8b6d9fe3d075377357e7dcd5793161270d935245bae3aac4","observation_id":"98031748-f8f0-4cb4-8c1a-d4615879ced4","resolution":{"observed_at":"2026-08-03T17:09:32.364961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:32.516659Z","title":"Hallucination of multimodal large language models: A survey, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-09T18:59:31.056898Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:32.516659Z"},"links":{"citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:aaf31ca12fdb13027b48c0d5e96e41e5035b58999b694fe8afbaeb09f9cc12f1","observation_id":"0f600248-06ad-45f3-8739-0fa3a07e4d5a","resolution":{"observed_at":"2026-08-03T17:09:32.516659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:32.630525Z","title":"Geopqa: Bridging the visual perception gap in mllms for geometric reasoning,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-09T18:59:31.056898Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:32.630525Z"},"links":{"citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:baaa1d904c45c0b90162a7d6e31c255a1b79fa40e361ff6f7d13a355018408b9","observation_id":"cc41d65e-3770-4a33-987a-68cb1b75de11","resolution":{"observed_at":"2026-08-03T17:09:32.630525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:32.756479Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference acceleration for large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-09T18:59:31.056898Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:32.756479Z"},"links":{"citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:6c8df599157a843543f5c1dc0184de60fcf28576368e05bc8a4f60d147cfe3a6","observation_id":"f19e051c-5c62-4334-8c69-0282bd17e0c3","resolution":{"observed_at":"2026-08-03T17:09:32.756479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:32.914509Z","title":"Nacl: A general and effective kv cache eviction framework for llms at inference time, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-09T18:59:31.056898Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:32.914509Z"},"links":{"citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:cfd816f73e859db8ba8cd9847f51e08405c61fcc575676586376bba71787bea4","observation_id":"d6d70d8b-6a42-4d6c-aacb-1020432feb1f","resolution":{"observed_at":"2026-08-03T17:09:32.914509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:33.033914Z","title":"Inner thinking transformer: Lever- aging dynamic depth scaling to foster adaptive internal think- ing, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-09T18:59:31.056898Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:33.033914Z"},"links":{"citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:0431ebc74eb506df9f801c7e243baadf78076c3c18c0a49ca4fffa316a3d0bcc","observation_id":"415163b8-b131-49aa-b806-ec6dac56b0f9","resolution":{"observed_at":"2026-08-03T17:09:33.033914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:33.154299Z","title":"Internvl: Scaling up vision foundation mod- els and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-09T18:59:31.056898Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:33.154299Z"},"links":{"citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:f6ec942c1414fe9bab1f72dd70126d53b6f6a234920f8819eb4d820e14059a40","observation_id":"132056ad-50ea-4d42-9024-82dddab03ac2","resolution":{"observed_at":"2026-08-03T17:09:33.154299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:33.283044Z","title":"Spatial- rgpt: Grounded spatial reasoning in vision language models,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-09T18:59:31.056898Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:33.283044Z"},"links":{"citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:96782f3aa08d66326c5a99e566711a9b1f8550f30afa95e2e18ed8305daebdba","observation_id":"76eac7fa-b439-4f1e-adf3-e55ada39e82a","resolution":{"observed_at":"2026-08-03T17:09:33.283044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:33.398979Z","title":"Atlas: Mapping attention’s location and size to probe five modes of serial and parallel search.Attention, Perception, & Psychophysics, 86(6):1938–1962, 2024","venue":null,"work_id":null,"year":1938},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-09T18:59:31.056898Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:33.398979Z"},"links":{"citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:8c8730d7cdfc3f982b1131c37aadef3f76fd214273fa313c429b0a5a7b7702d4","observation_id":"a29e3834-45fb-4375-8824-f45b17b54b14","resolution":{"observed_at":"2026-08-03T17:09:33.398979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:33.555242Z","title":"Image super-resolution using deep convolutional net- works.IEEE transactions on pattern analysis and machine intelligence, 38(2):295–307, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-09T18:59:31.056898Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:33.555242Z"},"links":{"citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:effeacd76d50b6e9e76ee8e9cbfad78cada2016e211748b5bd574b84567a77e6","observation_id":"ed9dac77-1ad7-410a-848f-e63800e634cc","resolution":{"observed_at":"2026-08-03T17:09:33.555242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:33.660599Z","title":"Acceler- ating the super-resolution convolutional neural network","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-09T18:59:31.056898Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:33.660599Z"},"links":{"citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:6b6c9da9c774e2749557155b0afe1aa9a809b4c57bbd18dbdee38dfcdfb1accd","observation_id":"225a961d-d473-4f67-acc4-d3a208aaeed5","resolution":{"observed_at":"2026-08-03T17:09:33.660599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:33.746918Z","title":"Multi-modal hal- lucination control by visual information grounding, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-09T18:59:31.056898Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:33.746918Z"},"links":{"citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:bc32b7cd8e2664e3a3848e813485acc57a20e4dc73a2bc89b5caead71ea0a1b5","observation_id":"6ac304ad-c02f-4cbc-a3a3-d9701695e2d6","resolution":{"observed_at":"2026-08-03T17:09:33.746918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09351","last_updated":"2025-06-11T03:05:24Z","snapshot_observed_at":"2026-08-09T05:26:14.069417Z","submitted_at":"2025-06-11T03:05:24Z","title":"DIVE into MoE: Diversity-Enhanced Reconstruction of Large Language Models from Dense into Mixture-of-Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09351","snapshot_observed_at":"2026-08-03T17:09:33.923627Z","title":"Dive into moe: Diversity-enhanced reconstruction of large language mod- els from dense into mixture-of-experts.arXiv preprint arXiv:2506.09351, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-09T18:59:31.056898Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:33.923627Z"},"links":{"cited_paper":"/paper/2506.09351","citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:e3fd0ae7d4c7d64a5fcdb96674bf2b01e2e4d7b09878543b1e2cf0345de5f653","observation_id":"c15a0393-fed7-4933-8ab4-c68253dc1815","resolution":{"observed_at":"2026-08-03T17:09:33.923627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:34.073705Z","title":"Mme: A comprehensive evaluation benchmark for multimodal large language models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-09T18:59:31.056898Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:34.073705Z"},"links":{"citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:0c22a0cb7f47a09f8f1aa41be1aae7c017e471834ba50a88857fe826df219ca7","observation_id":"d04eaf8d-4385-4bde-aa91-7c5edb3840bc","resolution":{"observed_at":"2026-08-03T17:09:34.073705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:34.244703Z","title":"Tracking the will to attend: Cortical activity indexes self-generated, voluntary shifts of attention.Attention, Perception, & Psy- chophysics, 78(7):2176–2184, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-09T18:59:31.056898Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:34.244703Z"},"links":{"citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:813b736776aaf85827279b11fea1c6dc54d61cd1af373ee2d5d2c9f02f5f5b0a","observation_id":"8ea7cf24-597e-4089-aa6b-7b1d31388ee5","resolution":{"observed_at":"2026-08-03T17:09:34.244703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:34.426101Z","title":"Beamlora: Beam-constraint low-rank adap- tation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-09T18:59:31.056898Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:34.426101Z"},"links":{"citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:ef933a6fd966a7feb0260bb5c0ebf86aa4e579d2894f3d87aedecc27a7b84f75","observation_id":"26d508e5-4d87-448e-927d-efc006131837","resolution":{"observed_at":"2026-08-03T17:09:34.426101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:34.507754Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-09T18:59:31.056898Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:34.507754Z"},"links":{"citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:860df5f4ac7f047ad5f71dea2fd7c0a00f6d5f3070127ee9929f436d17ca3164","observation_id":"f18c14b3-1ee4-4bcc-88c7-13c64e9d650d","resolution":{"observed_at":"2026-08-03T17:09:34.507754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:34.700795Z","title":"Scaling up visual and vision-language representa- tion learning with noisy text supervision","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-09T18:59:31.056898Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:34.700795Z"},"links":{"citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:39abd8fbedb6c288c898bbff4f1bdf89f709fc60d1c0bbe2cb8693c65d3e7681","observation_id":"cd0fdf4e-338d-489c-9b9b-911e6d7c33d1","resolution":{"observed_at":"2026-08-03T17:09:34.700795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:34.887592Z","title":"Hallucination augmented contrastive learning for multimodal large language model, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-09T18:59:31.056898Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:34.887592Z"},"links":{"citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:62174009526dd629f135afbd41813ebbe698a8cde71ecd81b636f7bbe84fc8fc","observation_id":"57913d8a-3348-4335-b498-5364c074a75c","resolution":{"observed_at":"2026-08-03T17:09:34.887592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:35.029874Z","title":"Cortical mechanisms for shifting and hold- ing visuospatial attention.Cerebral cortex, 18(1):114–125,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-09T18:59:31.056898Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:35.029874Z"},"links":{"citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:8c865a64977263691e5ae044c9b3f0b23979e12918b7a31df847b7f5e0d4488d","observation_id":"3d7c207d-cb2d-42d1-a6d0-27320cf6055e","resolution":{"observed_at":"2026-08-03T17:09:35.029874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:35.187960Z","title":"Accurate image super-resolution using very deep convolutional net- works","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-09T18:59:31.056898Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:35.187960Z"},"links":{"citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:00d6133d5a7f97f3a5d63365e11d2a31763136612007250573f00ddd1d9f34cc","observation_id":"8df33330-5259-4fed-bac0-3ba32b12bcdc","resolution":{"observed_at":"2026-08-03T17:09:35.187960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:35.331706Z","title":"Visual genome: Connecting language and vision using crowdsourced dense image annotations.International journal of computer vision, 123(1):32–73, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-09T18:59:31.056898Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:35.331706Z"},"links":{"citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:ee271a2b80f3caf5ff5c90a9f427ae0d87b4a1d2106c1e22705f502867387366","observation_id":"bb761497-fc53-491e-ac5c-fced096a0003","resolution":{"observed_at":"2026-08-03T17:09:35.331706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-03T17:09:35.462066Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-09T18:59:31.056898Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:35.462066Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:c7ce63f32051ec2cbd60ceb699f772d19ded9a33f6f2a8c396ae3779654c9c99","observation_id":"6c64248e-1ef1-4283-96f7-4f6d05e4eb20","resolution":{"observed_at":"2026-08-03T17:09:35.462066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:35.645936Z","title":"Dyfo: A training-free dynamic focus visual search for enhancing lmms in fine-grained visual understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-09T18:59:31.056898Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:35.645936Z"},"links":{"citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:deb3f5b950bf8ffdc9abf6fa95aa7a57f4360212c9d8d2c0f3af54ade1c57782","observation_id":"ba5dbffd-f91d-4d93-9d2c-da234d9df531","resolution":{"observed_at":"2026-08-03T17:09:35.645936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:35.790140Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-09T18:59:31.056898Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:35.790140Z"},"links":{"citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:b223a65b8c8b83ae32c39f050f7515ae644dbfb8ad1c281c0e61fbd9916bdb08","observation_id":"8ae0dc74-3ea3-484f-a6f7-c87df8108fa0","resolution":{"observed_at":"2026-08-03T17:09:35.790140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-08-03T17:09:35.981648Z","title":"Evaluating object hallucina- tion in large vision-language models.arXiv preprint arXiv:2305.10355, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-09T18:59:31.056898Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:35.981648Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:3536daf38ed67e8693317d94a20871461d570370fbc1d0330e47337962b5e4f8","observation_id":"c4cd6922-8f0c-40f3-9f69-f5992716d92e","resolution":{"observed_at":"2026-08-03T17:09:35.981648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:36.135377Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-09T18:59:31.056898Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:36.135377Z"},"links":{"citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:464de5f556a734cbd032170eb973e8a6702841d651dfb028d02167ea89c09b4b","observation_id":"b88d4203-8a5c-47a8-b28a-b9da0dce8b4d","resolution":{"observed_at":"2026-08-03T17:09:36.135377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:36.260287Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-09T18:59:31.056898Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:36.260287Z"},"links":{"citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:34973fcc99a53df4fc4933e42bd46c342a1f231e31bb1eb083ca8155b3905587","observation_id":"263bf065-c9b1-4704-87cc-d0fdd74c2cdb","resolution":{"observed_at":"2026-08-03T17:09:36.260287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:36.441445Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-09T18:59:31.056898Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:36.441445Z"},"links":{"citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:a0315f9a808e9c77022e28f8e04e85b2fe972ec523de30e7e1c5c9090166b797","observation_id":"bf27882a-4faf-48c9-91f4-f0d0a73e5fb0","resolution":{"observed_at":"2026-08-03T17:09:36.441445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:36.559709Z","title":"Llava-next: Im- proved reasoning, ocr, and world knowledge, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-09T18:59:31.056898Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:36.559709Z"},"links":{"citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:92f92f7fabae2269c98123a3ab087b8567aedb1b0c37e7698c26e5c5521c4ca1","observation_id":"c24e4044-c131-42e5-8cf8-0d76a396a91b","resolution":{"observed_at":"2026-08-03T17:09:36.559709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:36.675881Z","title":"Mmbench: Is your multi-modal model an all-around player? InEuropean conference on computer vi- sion, pages 216–233","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-09T18:59:31.056898Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:36.675881Z"},"links":{"citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:9a8cd4df1e08ec9db547c8632f0235650523d36e70d0425b39b465cc951277e0","observation_id":"faba4aad-1c8f-4096-bcf6-b7274439f3bd","resolution":{"observed_at":"2026-08-03T17:09:36.675881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:36.738767Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering.Advances in Neural Information Processing Systems, 35:2507–2521,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-09T18:59:31.056898Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:36.738767Z"},"links":{"citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:a645badde787275ab6ae8b3ea83c283d60e6c6ad469d839578c6a977ce75ebeb","observation_id":"114edba4-7afe-4b80-883b-69254ee70302","resolution":{"observed_at":"2026-08-03T17:09:36.738767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:36.859880Z","title":"Neuronal mechanisms of visual atten- tion.Annual review of vision science, 1(1):373–391, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-09T18:59:31.056898Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:36.859880Z"},"links":{"citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:eb2b70a77a84094078a47008dc0f923f88344e8ec309fcd81bd01981830545e9","observation_id":"1b184aa7-8a20-44d6-a001-f40884234dbb","resolution":{"observed_at":"2026-08-03T17:09:36.859880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:36.974350Z","title":"Ocr-vqa: Visual question answering by reading text in images","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-09T18:59:31.056898Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:36.974350Z"},"links":{"citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:f173873bc4033fb48227e12886a30ed61435c82f89e5551c4cf31d43f965667e","observation_id":"98f33d94-5808-4029-8137-268054a72f27","resolution":{"observed_at":"2026-08-03T17:09:36.974350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:37.107535Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-09T18:59:31.056898Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:37.107535Z"},"links":{"citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:5a630a01b183845f3395c067241e8f24f5f6fec95d7f40495f2222f3549c146b","observation_id":"ce4b50ba-1971-473a-9dc8-5acc4e0474ef","resolution":{"observed_at":"2026-08-03T17:09:37.107535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:37.236417Z","title":"Deepspeed: System optimizations enable train- ing deep learning models with over 100 billion parameters","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-09T18:59:31.056898Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:37.236417Z"},"links":{"citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:bd4961db0dafaec1e266e602934a2b2650247f4b8e781d023ea588a732baf25a","observation_id":"ec8c6013-d94d-44a2-aadc-f06a26411e2b","resolution":{"observed_at":"2026-08-03T17:09:37.236417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:37.399420Z","title":"Towards vqa models that can read","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-09T18:59:31.056898Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:37.399420Z"},"links":{"citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:70e75c2ce69bca00c15ab8fea20da8cde37bf7dac6392d8cd2804d19ca475061","observation_id":"ac8345c7-e171-4208-a687-284a42c9e5ae","resolution":{"observed_at":"2026-08-03T17:09:37.399420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-03T17:09:37.581401Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of con- text.arXiv preprint arXiv:2403.05530, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-09T18:59:31.056898Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:37.581401Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:dfc40f82e1c7f9986891fdc789bc46a1c919f3979466fd3a493152b04be1fdd8","observation_id":"d6c710be-23b8-4ffa-9a21-abb42453bfef","resolution":{"observed_at":"2026-08-03T17:09:37.581401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:37.702564Z","title":"Eyes wide shut? exploring the visual shortcomings of multimodal llms, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-09T18:59:31.056898Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:37.702564Z"},"links":{"citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:5f458952584c487f01d69926570c77c91f740706ed8184cf9de5822baea8d0e6","observation_id":"11c66680-208d-422b-8114-03d3941c5080","resolution":{"observed_at":"2026-08-03T17:09:37.702564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23317","last_updated":"2024-10-29T20:04:34Z","snapshot_observed_at":"2026-08-02T02:59:04.120462Z","submitted_at":"2024-10-29T20:04:34Z","title":"VL-Cache: Sparsity and Modality-Aware KV Cache Compression for Vision-Language Model Inference Acceleration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.23317","snapshot_observed_at":"2026-08-03T17:09:37.841750Z","title":"Vl-cache: Sparsity and modality-aware kv cache com- pression for vision-language model inference acceleration","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-09T18:59:31.056898Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:37.841750Z"},"links":{"cited_paper":"/paper/2410.23317","citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:f05374ba71d5b7bf3684a6e524f8671ca3a95b05bad3eefe5332768db2240e1e","observation_id":"5640b0b4-4a97-406b-bbbe-6fce424be439","resolution":{"observed_at":"2026-08-03T17:09:37.841750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:38.025746Z","title":"Transformers: State-of-the-art natural language processing","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-09T18:59:31.056898Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:38.025746Z"},"links":{"citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:0cb90b82e2121941e3646539357a1aa9ee24cf87cc1686217e04b1f4b3fcb1aa","observation_id":"2ec4e44d-88e9-4bb4-b788-08e4eeea8147","resolution":{"observed_at":"2026-08-03T17:09:38.025746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","snapshot_observed_at":"2026-08-09T12:08:37.537636Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14135","snapshot_observed_at":"2026-08-03T17:09:38.165356Z","title":"V*: Guided visual search as a core mechanism in multimodal llms, 2023.URL https://arxiv","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-09T18:59:31.056898Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:38.165356Z"},"links":{"cited_paper":"/paper/2312.14135","citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:315b19e9ad55abd7fc83bc67769ac8eedee5071477b389fd287c7e74aee9f970","observation_id":"978dc477-32ba-4afb-8e4c-f600cbfa318b","resolution":{"observed_at":"2026-08-03T17:09:38.165356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:38.306215Z","title":"Grounded chain-of-thought for multimodal large language models,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-09T18:59:31.056898Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:38.306215Z"},"links":{"citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:61e4675cd7161adb8fc1ded54657354612975ee9e8538b44e7b979d8fdf6a4b3","observation_id":"8c8e008f-e00e-404c-a8af-c2ad5d00a78a","resolution":{"observed_at":"2026-08-03T17:09:38.306215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17247","last_updated":"2025-02-27T11:16:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-22T17:59:53Z","title":"PyramidDrop: Accelerating Your Large Vision-Language Models via Pyramid Visual Redundancy Reduction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17247","snapshot_observed_at":"2026-08-03T17:09:38.421930Z","title":"Pyramiddrop: Accelerating your large vision-language models via pyramid visual redundancy re- duction.arXiv preprint arXiv:2410.17247, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-09T18:59:31.056898Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:38.421930Z"},"links":{"cited_paper":"/paper/2410.17247","citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:a5e627e9079eb3c8cd6ba577527e41fbb34b2db9f4ddb4c37d8b641ab99f108b","observation_id":"6635180d-9c07-4ea3-8288-e28d31e73a4d","resolution":{"observed_at":"2026-08-03T17:09:38.421930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:38.563170Z","title":"Fit and prune: Fast and training-free visual token pruning for multi- modal large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-09T18:59:31.056898Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:38.563170Z"},"links":{"citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:5fae309a16efe9d290c4eef5f76351b971de8b38d5167564a000dbb971f8ad13","observation_id":"8331d809-d8a9-4c1d-87c5-82b7ec5e5952","resolution":{"observed_at":"2026-08-03T17:09:38.563170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17425","last_updated":"2025-02-24T18:56:12Z","snapshot_observed_at":"2026-08-07T17:52:18.653123Z","submitted_at":"2025-02-24T18:56:12Z","title":"Introducing Visual Perception Token into Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.17425","snapshot_observed_at":"2026-08-03T17:09:38.749150Z","title":"Introducing vi- sual perception token into multimodal large language model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-09T18:59:31.056898Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:38.749150Z"},"links":{"cited_paper":"/paper/2502.17425","citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:7e89eea6bea96b1f4ed2f353ea4fd8355e3e5416b38d035cd063578834d2206e","observation_id":"5a86ab97-3722-41b1-92e4-34065fbedba8","resolution":{"observed_at":"2026-08-03T17:09:38.749150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-08-08T03:31:37.699253Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-08-03T17:09:38.835314Z","title":"Mm-vet: Evaluating large multimodal models for integrated capabilities.arXiv preprint arXiv:2308.02490, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-09T18:59:31.056898Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:38.835314Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:a98eb47646340f49ed2416376c6ce4217f66d521d21c7320fa9a2309f9f970a1","observation_id":"1c6baefc-31dc-4d52-91ae-aa6d452ffafe","resolution":{"observed_at":"2026-08-03T17:09:38.835314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17422","last_updated":"2025-02-24T18:54:40Z","snapshot_observed_at":"2026-08-07T17:52:20.236795Z","submitted_at":"2025-02-24T18:54:40Z","title":"MLLMs Know Where to Look: Training-free Perception of Small Visual Details with Multimodal LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.17422","snapshot_observed_at":"2026-08-03T17:09:38.897509Z","title":"Mllms know where to look: Training-free per- ception of small visual details with multimodal llms.arXiv preprint arXiv:2502.17422, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-09T18:59:31.056898Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:38.897509Z"},"links":{"cited_paper":"/paper/2502.17422","citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:5e2f15d9d0a255b4b8152f8c827951bbccdcf2c265d4298ecafc9fc5bd54313b","observation_id":"52371a29-5dbb-4375-95d8-72bfd611be92","resolution":{"observed_at":"2026-08-03T17:09:38.897509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:38.969249Z","title":"Open eyes, then reason: Fine-grained visual mathematical understanding in mllms, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-09T18:59:31.056898Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:38.969249Z"},"links":{"citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:5aabdcdf7ebf28be4556e90898819fe22feb04ef0a90a7e0c9aefc05110b8925","observation_id":"d0cae116-48b6-49e8-9be2-be8c25934b68","resolution":{"observed_at":"2026-08-03T17:09:38.969249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T18:59:31.056898Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":52,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 1 inbound Pith citation observation for arXiv:2512.10548."}