{"as_of":"2026-08-09T19:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:02e03b4d95075521bd88acb359b9e7e5577b063036850f040e4285b1facaa61e","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":45,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:57:37.543242Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T19:30:06.763408Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.09403","last_updated":"2024-11-11T00:54:32Z","snapshot_observed_at":"2026-08-05T09:57:39.370124Z","submitted_at":"2024-06-13T17:59:31Z","title":"Visual Sketchpad: Sketching as a Visual Chain of Thought for Multimodal Language Models","version":3},"cited_work":{"arxiv_id":"2406.09403","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.09403","snapshot_observed_at":"2026-07-04T19:30:06.763408Z","title":"Visual sketchpad: Sketching as a visual chain of thought for multimodal language models","venue":null,"work_id":"6df227a2-7a70-47c8-ae06-b2d6eee27a57","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2406.09403","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:526e6d7597c2e88843aa48dff6cf2e34c975271e3a52c02391943b368c872ced","observation_id":"8900b923-fec1-4134-bf1e-df2e0167bfa0","resolution":{"observed_at":"2026-05-23T20:13:24.850060Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09403","last_updated":"2024-11-11T00:54:32Z","snapshot_observed_at":"2026-08-05T09:57:39.370124Z","submitted_at":"2024-06-13T17:59:31Z","title":"Visual Sketchpad: Sketching as a Visual Chain of Thought for Multimodal Language Models","version":3},"cited_work":{"arxiv_id":"2406.09403","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.09403","snapshot_observed_at":"2026-07-04T19:30:06.763408Z","title":"Visual sketchpad: Sketching as a visual chain of thought for multimodal language models","venue":null,"work_id":"6df227a2-7a70-47c8-ae06-b2d6eee27a57","year":2024},"citing_paper":{"arxiv_id":"2501.07542","last_updated":"2025-01-13T18:23:57Z","snapshot_observed_at":"2026-08-02T11:23:33.987927Z","submitted_at":"2025-01-13T18:23:57Z","title":"Imagine while Reasoning in Space: Multimodal Visualization-of-Thought","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-16T23:09:34.805552Z"},"links":{"cited_paper":"/paper/2406.09403","citing_paper":"/paper/2501.07542"},"observation_digest":"sha256:60cf0efaf9ed69d48a809e480a8e137d9b94c91b9f8aa2503adfbb26279d7d19","observation_id":"3328d2d4-ff2d-417f-b578-9da61e9388d4","resolution":{"observed_at":"2026-05-16T23:09:34.893504Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09403","last_updated":"2024-11-11T00:54:32Z","snapshot_observed_at":"2026-08-05T09:57:39.370124Z","submitted_at":"2024-06-13T17:59:31Z","title":"Visual Sketchpad: Sketching as a Visual Chain of Thought for Multimodal Language Models","version":3},"cited_work":{"arxiv_id":"2406.09403","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.09403","snapshot_observed_at":"2026-07-04T19:30:06.763408Z","title":"Visual sketchpad: Sketching as a visual chain of thought for multimodal language models","venue":null,"work_id":"6df227a2-7a70-47c8-ae06-b2d6eee27a57","year":2024},"citing_paper":{"arxiv_id":"2503.12605","last_updated":"2025-03-23T13:47:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-16T18:39:13Z","title":"Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-15T17:18:52.996467Z"},"links":{"cited_paper":"/paper/2406.09403","citing_paper":"/paper/2503.12605"},"observation_digest":"sha256:de5ca04c1f9bac20c4933c6ba76ea132eb5a359436a816fedb96e55d6094f26e","observation_id":"8306d360-a10e-4e24-b800-20a7536ac8ee","resolution":{"observed_at":"2026-05-15T17:18:53.725866Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09403","last_updated":"2024-11-11T00:54:32Z","snapshot_observed_at":"2026-08-05T09:57:39.370124Z","submitted_at":"2024-06-13T17:59:31Z","title":"Visual Sketchpad: Sketching as a Visual Chain of Thought for Multimodal Language Models","version":3},"cited_work":{"arxiv_id":"2406.09403","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.09403","snapshot_observed_at":"2026-07-04T19:30:06.763408Z","title":"Visual sketchpad: Sketching as a visual chain of thought for multimodal language models","venue":null,"work_id":"6df227a2-7a70-47c8-ae06-b2d6eee27a57","year":2024},"citing_paper":{"arxiv_id":"2503.17352","last_updated":"2025-11-11T08:13:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-21T17:52:43Z","title":"OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-19T06:59:03.112252Z"},"links":{"cited_paper":"/paper/2406.09403","citing_paper":"/paper/2503.17352"},"observation_digest":"sha256:967b2ab9fce4209b98dc6e7e375a01ce4f3dbb064f4a5aab2f0b180c78bd2edc","observation_id":"fb008005-3db0-4d4a-9fcb-a8ab1f0688f3","resolution":{"observed_at":"2026-05-19T06:59:03.413368Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09403","last_updated":"2024-11-11T00:54:32Z","snapshot_observed_at":"2026-08-05T09:57:39.370124Z","submitted_at":"2024-06-13T17:59:31Z","title":"Visual Sketchpad: Sketching as a Visual Chain of Thought for Multimodal Language Models","version":3},"cited_work":{"arxiv_id":"2406.09403","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.09403","snapshot_observed_at":"2026-07-04T19:30:06.763408Z","title":"Visual sketchpad: Sketching as a visual chain of thought for multimodal language models","venue":null,"work_id":"6df227a2-7a70-47c8-ae06-b2d6eee27a57","year":2024},"citing_paper":{"arxiv_id":"2503.22020","last_updated":"2025-03-27T22:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T22:23:04Z","title":"CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:44.903048Z"},"links":{"cited_paper":"/paper/2406.09403","citing_paper":"/paper/2503.22020"},"observation_digest":"sha256:b580a559c2a033b757f92cb3ebd0979e64880773f6f38c8a80ded9bdddfe7159","observation_id":"09fb45ae-c0ba-4d5d-98ed-9ffe2f8c4293","resolution":{"observed_at":"2026-05-16T05:21:45.253558Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09403","last_updated":"2024-11-11T00:54:32Z","snapshot_observed_at":"2026-08-05T09:57:39.370124Z","submitted_at":"2024-06-13T17:59:31Z","title":"Visual Sketchpad: Sketching as a Visual Chain of Thought for Multimodal Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09403","snapshot_observed_at":"2026-08-07T14:57:37.543242Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16832","last_updated":"2025-05-27T23:23:45Z","snapshot_observed_at":"2026-08-09T03:53:33.096523Z","submitted_at":"2025-05-22T16:02:18Z","title":"From EduVisBench to EduVisAgent: A Benchmark and Multi-Agent Framework for Reasoning-Driven Pedagogical Visualization","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:37.543242Z"},"links":{"cited_paper":"/paper/2406.09403","citing_paper":"/paper/2505.16832"},"observation_digest":"sha256:d678cf79b5ec25374dd70dc4a360795e1cd0f5f2deeb20a8654497fa5b5b80f9","observation_id":"799ab86b-46fc-4aa7-a343-b09fb88d3a34","resolution":{"observed_at":"2026-08-07T14:57:37.543242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09403","last_updated":"2024-11-11T00:54:32Z","snapshot_observed_at":"2026-08-05T09:57:39.370124Z","submitted_at":"2024-06-13T17:59:31Z","title":"Visual Sketchpad: Sketching as a Visual Chain of Thought for Multimodal Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09403","snapshot_observed_at":"2026-08-07T14:23:17.684374Z","title":"Visual sketchpad: Sketching as a visual chain of thought for multimodal language models.arXiv preprint arXiv:2406.09403,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-09T07:26:19.156205Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.684374Z"},"links":{"cited_paper":"/paper/2406.09403","citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:b5edc2672cd1877125d58b9ec7e54f42187f272f6472bff12ba199694f05e930","observation_id":"449c37bd-508f-4e8b-aefc-cdf5f7300e83","resolution":{"observed_at":"2026-08-07T14:23:17.684374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09403","last_updated":"2024-11-11T00:54:32Z","snapshot_observed_at":"2026-08-05T09:57:39.370124Z","submitted_at":"2024-06-13T17:59:31Z","title":"Visual Sketchpad: Sketching as a Visual Chain of Thought for Multimodal Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09403","snapshot_observed_at":"2026-08-07T14:12:03.958914Z","title":"Visual sketchpad: Sketching as a visual chain of thought for multimodal language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19702","last_updated":"2025-05-26T08:54:14Z","snapshot_observed_at":"2026-08-08T16:19:49.539801Z","submitted_at":"2025-05-26T08:54:14Z","title":"Point-RFT: Improving Multimodal Reasoning with Visually Grounded Reinforcement Finetuning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:03.958914Z"},"links":{"cited_paper":"/paper/2406.09403","citing_paper":"/paper/2505.19702"},"observation_digest":"sha256:7caf9ecbef853b15240b6bbf9afd62e4bc9ff1d13e642f8324e426df6d78a3ab","observation_id":"9ccf031d-5efd-4d4f-909b-35505b08caed","resolution":{"observed_at":"2026-08-07T14:12:03.958914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09403","last_updated":"2024-11-11T00:54:32Z","snapshot_observed_at":"2026-08-05T09:57:39.370124Z","submitted_at":"2024-06-13T17:59:31Z","title":"Visual Sketchpad: Sketching as a Visual Chain of Thought for Multimodal Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09403","snapshot_observed_at":"2026-08-07T13:59:36.478765Z","title":"Visual sketchpad: Sketching as a visual chain of thought for multimodal language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-09T06:01:05.298875Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:36.478765Z"},"links":{"cited_paper":"/paper/2406.09403","citing_paper":"/paper/2505.20289"},"observation_digest":"sha256:d09b60702ec4cb670f4c92a91c1355ac826360e46e48c1bd63d50c9ea1d702f8","observation_id":"2fa008a5-8011-47d7-abef-8f08ead072a1","resolution":{"observed_at":"2026-08-07T13:59:36.478765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09403","last_updated":"2024-11-11T00:54:32Z","snapshot_observed_at":"2026-08-05T09:57:39.370124Z","submitted_at":"2024-06-13T17:59:31Z","title":"Visual Sketchpad: Sketching as a Visual Chain of Thought for Multimodal Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09403","snapshot_observed_at":"2026-08-07T13:35:57.574309Z","title":"Visual sketchpad: Sketching as a visual chain of thought for multimodal language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21327","last_updated":"2025-05-27T15:23:23Z","snapshot_observed_at":"2026-08-08T22:42:35.699276Z","submitted_at":"2025-05-27T15:23:23Z","title":"MME-Reasoning: A Comprehensive Benchmark for Logical Reasoning in MLLMs","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T13:35:57.574309Z"},"links":{"cited_paper":"/paper/2406.09403","citing_paper":"/paper/2505.21327"},"observation_digest":"sha256:50b9640ae1a230a3c179cb3e2211d6849b227f485facc66a94f1ffc89240e834","observation_id":"6bc41505-3b21-460d-935c-54c92fd5fe5f","resolution":{"observed_at":"2026-08-07T13:35:57.574309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09403","last_updated":"2024-11-11T00:54:32Z","snapshot_observed_at":"2026-08-05T09:57:39.370124Z","submitted_at":"2024-06-13T17:59:31Z","title":"Visual Sketchpad: Sketching as a Visual Chain of Thought for Multimodal Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09403","snapshot_observed_at":"2026-08-07T13:12:53.817955Z","title":"Visual sketchpad: Sketching as a visual chain of thought for multimodal language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:53.817955Z"},"links":{"cited_paper":"/paper/2406.09403","citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:c0c67902ecd3a46f745020e239ba8b993f2a6251f1943d8e470a680dcc90e225","observation_id":"a7706e48-a2e3-4ff6-bf07-642cdc4169d1","resolution":{"observed_at":"2026-08-07T13:12:53.817955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09403","last_updated":"2024-11-11T00:54:32Z","snapshot_observed_at":"2026-08-05T09:57:39.370124Z","submitted_at":"2024-06-13T17:59:31Z","title":"Visual Sketchpad: Sketching as a Visual Chain of Thought for Multimodal Language Models","version":3},"cited_work":{"arxiv_id":"2406.09403","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.09403","snapshot_observed_at":"2026-07-04T19:30:06.763408Z","title":"Visual sketchpad: Sketching as a visual chain of thought for multimodal language models","venue":null,"work_id":"6df227a2-7a70-47c8-ae06-b2d6eee27a57","year":2024},"citing_paper":{"arxiv_id":"2505.23678","last_updated":"2026-05-15T17:27:46Z","snapshot_observed_at":"2026-08-02T04:30:21.704758Z","submitted_at":"2025-05-29T17:20:26Z","title":"Grounded Reinforcement Learning for Visual Reasoning","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-22T01:05:18.801388Z"},"links":{"cited_paper":"/paper/2406.09403","citing_paper":"/paper/2505.23678"},"observation_digest":"sha256:0b8c337d0d1250829d7f24a658f8547934aff7a3b5777d3ab3986f83df8e049c","observation_id":"8c8afe21-35f2-4125-833e-060f72d877c9","resolution":{"observed_at":"2026-05-22T01:05:51.959972Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09403","last_updated":"2024-11-11T00:54:32Z","snapshot_observed_at":"2026-08-05T09:57:39.370124Z","submitted_at":"2024-06-13T17:59:31Z","title":"Visual Sketchpad: Sketching as a Visual Chain of Thought for Multimodal Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09403","snapshot_observed_at":"2026-08-07T10:28:49.091946Z","title":"Visual sketchpad: Sketching as a visual chain of thought for multimodal language models.arXiv preprint arXiv:2406.09403, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05331","last_updated":"2025-06-05T17:59:02Z","snapshot_observed_at":"2026-08-09T02:08:19.234840Z","submitted_at":"2025-06-05T17:59:02Z","title":"MINT-CoT: Enabling Interleaved Visual Tokens in Mathematical Chain-of-Thought Reasoning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:49.091946Z"},"links":{"cited_paper":"/paper/2406.09403","citing_paper":"/paper/2506.05331"},"observation_digest":"sha256:d8152855f03a394eac8e5f3908a0ee2b3d7b560cb611d13dd36678c18569876b","observation_id":"ec006fd1-3b49-4d64-9d77-f134610fc033","resolution":{"observed_at":"2026-08-07T10:28:49.091946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09403","last_updated":"2024-11-11T00:54:32Z","snapshot_observed_at":"2026-08-05T09:57:39.370124Z","submitted_at":"2024-06-13T17:59:31Z","title":"Visual Sketchpad: Sketching as a Visual Chain of Thought for Multimodal Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09403","snapshot_observed_at":"2026-08-07T06:08:23.824053Z","title":"Visual sketchpad: Sketching as a visual chain of thought for multimodal language models.arXiv preprint arXiv:2406.09403, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06034","last_updated":"2025-06-06T12:33:12Z","snapshot_observed_at":"2026-08-09T18:24:38.296461Z","submitted_at":"2025-06-06T12:33:12Z","title":"MATP-BENCH: Can MLLM Be a Good Automated Theorem Prover for Multimodal Problems?","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T06:08:23.824053Z"},"links":{"cited_paper":"/paper/2406.09403","citing_paper":"/paper/2506.06034"},"observation_digest":"sha256:b1770580d5db874d8552ffbe66c460eb61f0c2d24e4eede7770298dbb358834a","observation_id":"77bd8e6a-ba53-422d-8865-9b17c424115f","resolution":{"observed_at":"2026-08-07T06:08:23.824053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09403","last_updated":"2024-11-11T00:54:32Z","snapshot_observed_at":"2026-08-05T09:57:39.370124Z","submitted_at":"2024-06-13T17:59:31Z","title":"Visual Sketchpad: Sketching as a Visual Chain of Thought for Multimodal Language Models","version":3},"cited_work":{"arxiv_id":"2406.09403","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.09403","snapshot_observed_at":"2026-07-04T19:30:06.763408Z","title":"Visual sketchpad: Sketching as a visual chain of thought for multimodal language models","venue":null,"work_id":"6df227a2-7a70-47c8-ae06-b2d6eee27a57","year":2024},"citing_paper":{"arxiv_id":"2506.06211","last_updated":"2026-04-21T03:40:06Z","snapshot_observed_at":"2026-08-03T01:28:16.465454Z","submitted_at":"2025-06-06T16:17:09Z","title":"PuzzleWorld: A Benchmark for Multimodal, Open-Ended Reasoning in Puzzlehunts","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-19T10:43:02.601014Z"},"links":{"cited_paper":"/paper/2406.09403","citing_paper":"/paper/2506.06211"},"observation_digest":"sha256:d042490a64e5991ae06e8d2264a55f69d97fb94dfae3e0d0b9951705bcaa1e09","observation_id":"e642d910-ee4e-4303-a84f-58f9b6d030a5","resolution":{"observed_at":"2026-05-19T10:47:15.175790Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09403","last_updated":"2024-11-11T00:54:32Z","snapshot_observed_at":"2026-08-05T09:57:39.370124Z","submitted_at":"2024-06-13T17:59:31Z","title":"Visual Sketchpad: Sketching as a Visual Chain of Thought for Multimodal Language Models","version":3},"cited_work":{"arxiv_id":"2406.09403","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.09403","snapshot_observed_at":"2026-07-04T19:30:06.763408Z","title":"Visual sketchpad: Sketching as a visual chain of thought for multimodal language models","venue":null,"work_id":"6df227a2-7a70-47c8-ae06-b2d6eee27a57","year":2024},"citing_paper":{"arxiv_id":"2507.01955","last_updated":"2026-05-01T00:57:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-02T17:59:07Z","title":"How Well Does GPT-4o Understand Vision? Evaluating Multimodal Foundation Models on Standard Computer Vision Tasks","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-19T05:55:09.188048Z"},"links":{"cited_paper":"/paper/2406.09403","citing_paper":"/paper/2507.01955"},"observation_digest":"sha256:301a00f2a5b93684ef822b2a817271f4d9ba5b235c0d2bdb08e931ce2ff5b1f4","observation_id":"7ead8605-e0da-4ea8-a98c-dd2ddaf30320","resolution":{"observed_at":"2026-05-19T05:57:08.017947Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09403","last_updated":"2024-11-11T00:54:32Z","snapshot_observed_at":"2026-08-05T09:57:39.370124Z","submitted_at":"2024-06-13T17:59:31Z","title":"Visual Sketchpad: Sketching as a Visual Chain of Thought for Multimodal Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09403","snapshot_observed_at":"2026-08-06T15:12:01.846583Z","title":"ArXivabs/2406.09403 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16518","last_updated":"2026-06-24T02:00:50Z","snapshot_observed_at":"2026-08-08T12:45:29.488887Z","submitted_at":"2025-07-22T12:27:08Z","title":"SyncLoop: A Multimodal Dual-Loop Framework for Self-Improving Mathematical Reasoning","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T15:12:01.846583Z"},"links":{"cited_paper":"/paper/2406.09403","citing_paper":"/paper/2507.16518"},"observation_digest":"sha256:1206ff7988a7e95f373c7613ebe200bbf7801312c8647df3a3e297ffc43f52b8","observation_id":"b50ced97-7fe9-4bc9-afba-f046b0b71628","resolution":{"observed_at":"2026-08-06T15:12:01.846583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09403","last_updated":"2024-11-11T00:54:32Z","snapshot_observed_at":"2026-08-05T09:57:39.370124Z","submitted_at":"2024-06-13T17:59:31Z","title":"Visual Sketchpad: Sketching as a Visual Chain of Thought for Multimodal Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09403","snapshot_observed_at":"2026-08-06T14:33:33.739981Z","title":"An, Mengliang Zhang, Liangchen Liu, Kazuma Kobayashi, Tatsuya Harada, R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:33.739981Z"},"links":{"cited_paper":"/paper/2406.09403","citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:dda08379b3d0ba3b04d3dfff43f2ce2d729a5d503bcaa9105c14bc9f2e05c548","observation_id":"474ce44a-9320-46cf-baa5-8e0de07e3743","resolution":{"observed_at":"2026-08-06T14:33:33.739981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09403","last_updated":"2024-11-11T00:54:32Z","snapshot_observed_at":"2026-08-05T09:57:39.370124Z","submitted_at":"2024-06-13T17:59:31Z","title":"Visual Sketchpad: Sketching as a Visual Chain of Thought for Multimodal Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09403","snapshot_observed_at":"2026-08-05T16:17:37.650215Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.18772","last_updated":"2025-08-26T07:55:46Z","snapshot_observed_at":"2026-08-07T08:24:33.804357Z","submitted_at":"2025-08-26T07:55:46Z","title":"Beyond the Textual: Generating Coherent Visual Options for MCQs","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-05T16:17:37.650215Z"},"links":{"cited_paper":"/paper/2406.09403","citing_paper":"/paper/2508.18772"},"observation_digest":"sha256:8379e1f9977a19e49434c79ea54a01d4f2e8782b49c091b3e738db3a1cdea53b","observation_id":"66db5aa3-1ada-4b95-aeaa-f8a72ae5e371","resolution":{"observed_at":"2026-08-05T16:17:37.650215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09403","last_updated":"2024-11-11T00:54:32Z","snapshot_observed_at":"2026-08-05T09:57:39.370124Z","submitted_at":"2024-06-13T17:59:31Z","title":"Visual Sketchpad: Sketching as a Visual Chain of Thought for Multimodal Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09403","snapshot_observed_at":"2026-08-05T12:27:04.939778Z","title":"Visual sketchpad: Sketching as a visual chain of thought for multimodal language models, 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01656","last_updated":"2025-09-01T17:57:49Z","snapshot_observed_at":"2026-08-09T16:17:17.533156Z","submitted_at":"2025-09-01T17:57:49Z","title":"Reinforced Visual Perception with Tools","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-05T12:27:04.939778Z"},"links":{"cited_paper":"/paper/2406.09403","citing_paper":"/paper/2509.01656"},"observation_digest":"sha256:9765e2e8b59b8a1234fc64babb03da430ae3c29f3955f859de992bf3714fba8e","observation_id":"024b8bf7-c1c0-4df1-b37b-ff80ff9e48b8","resolution":{"observed_at":"2026-08-05T12:27:04.939778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09403","last_updated":"2024-11-11T00:54:32Z","snapshot_observed_at":"2026-08-05T09:57:39.370124Z","submitted_at":"2024-06-13T17:59:31Z","title":"Visual Sketchpad: Sketching as a Visual Chain of Thought for Multimodal Language Models","version":3},"cited_work":{"arxiv_id":"2406.09403","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.09403","snapshot_observed_at":"2026-07-04T19:30:06.763408Z","title":"Visual sketchpad: Sketching as a visual chain of thought for multimodal language models","venue":null,"work_id":"6df227a2-7a70-47c8-ae06-b2d6eee27a57","year":2024},"citing_paper":{"arxiv_id":"2509.24251","last_updated":"2025-10-05T04:01:18Z","snapshot_observed_at":"2026-07-06T22:31:00.843452Z","submitted_at":"2025-09-29T03:52:01Z","title":"Latent Visual Reasoning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-15T18:41:30.307521Z"},"links":{"cited_paper":"/paper/2406.09403","citing_paper":"/paper/2509.24251"},"observation_digest":"sha256:df6707cc4c285cc1b8abdbd76705ffc7b58bc1a02f91aba7f61c9a58f0a2acca","observation_id":"02c0cb71-5d05-4c7b-8462-0db2ef9e84f6","resolution":{"observed_at":"2026-05-15T18:41:30.394788Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09403","last_updated":"2024-11-11T00:54:32Z","snapshot_observed_at":"2026-08-05T09:57:39.370124Z","submitted_at":"2024-06-13T17:59:31Z","title":"Visual Sketchpad: Sketching as a Visual Chain of Thought for Multimodal Language Models","version":3},"cited_work":{"arxiv_id":"2406.09403","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.09403","snapshot_observed_at":"2026-07-04T19:30:06.763408Z","title":"Visual sketchpad: Sketching as a visual chain of thought for multimodal language models","venue":null,"work_id":"6df227a2-7a70-47c8-ae06-b2d6eee27a57","year":2024},"citing_paper":{"arxiv_id":"2512.10941","last_updated":"2026-04-30T17:59:42Z","snapshot_observed_at":"2026-07-06T22:38:45.907386Z","submitted_at":"2025-12-11T18:59:08Z","title":"Mull-Tokens: Modality-Agnostic Latent Thinking","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-16T22:57:04.802871Z"},"links":{"cited_paper":"/paper/2406.09403","citing_paper":"/paper/2512.10941"},"observation_digest":"sha256:fd82a98dda2a8f091576b0e8fb7d5951076261796a4fafc5a5f655b483647f37","observation_id":"2626c9e7-bb7c-47fd-aba1-09bb216835f0","resolution":{"observed_at":"2026-05-16T22:58:38.632101Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09403","last_updated":"2024-11-11T00:54:32Z","snapshot_observed_at":"2026-08-05T09:57:39.370124Z","submitted_at":"2024-06-13T17:59:31Z","title":"Visual Sketchpad: Sketching as a Visual Chain of Thought for Multimodal Language Models","version":3},"cited_work":{"arxiv_id":"2406.09403","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.09403","snapshot_observed_at":"2026-07-04T19:30:06.763408Z","title":"Visual sketchpad: Sketching as a visual chain of thought for multimodal language models","venue":null,"work_id":"6df227a2-7a70-47c8-ae06-b2d6eee27a57","year":2024},"citing_paper":{"arxiv_id":"2512.12623","last_updated":"2026-04-09T15:39:45Z","snapshot_observed_at":"2026-07-06T22:38:59.725645Z","submitted_at":"2025-12-14T10:07:45Z","title":"Reasoning Within the Mind: Dynamic Multimodal Interleaving in Latent Space","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-16T23:02:28.588225Z"},"links":{"cited_paper":"/paper/2406.09403","citing_paper":"/paper/2512.12623"},"observation_digest":"sha256:15687863c1f55fff07db62755f960810da9f07c6023b8a4e6546ce727fd149f9","observation_id":"5318a328-3d3a-444a-8a0a-cdeebb3c6250","resolution":{"observed_at":"2026-05-16T23:03:38.855828Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09403","last_updated":"2024-11-11T00:54:32Z","snapshot_observed_at":"2026-08-05T09:57:39.370124Z","submitted_at":"2024-06-13T17:59:31Z","title":"Visual Sketchpad: Sketching as a Visual Chain of Thought for Multimodal Language Models","version":3},"cited_work":{"arxiv_id":"2406.09403","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.09403","snapshot_observed_at":"2026-07-04T19:30:06.763408Z","title":"Visual sketchpad: Sketching as a visual chain of thought for multimodal language models","venue":null,"work_id":"6df227a2-7a70-47c8-ae06-b2d6eee27a57","year":2024},"citing_paper":{"arxiv_id":"2604.09167","last_updated":"2026-04-10T09:51:42Z","snapshot_observed_at":"2026-08-08T08:04:53.159613Z","submitted_at":"2026-04-10T09:51:42Z","title":"MAG-3D: Multi-Agent Grounded Reasoning for 3D Understanding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T17:25:31.097385Z"},"links":{"cited_paper":"/paper/2406.09403","citing_paper":"/paper/2604.09167"},"observation_digest":"sha256:505ecb747314a52f47dbefd410a3ac185e6e4c7ca7e6da865838a7983afd6660","observation_id":"3a0f45fb-4e90-421f-8deb-b9013e7a7411","resolution":{"observed_at":"2026-05-11T06:51:20.446939Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09403","last_updated":"2024-11-11T00:54:32Z","snapshot_observed_at":"2026-08-05T09:57:39.370124Z","submitted_at":"2024-06-13T17:59:31Z","title":"Visual Sketchpad: Sketching as a Visual Chain of Thought for Multimodal Language Models","version":3},"cited_work":{"arxiv_id":"2406.09403","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.09403","snapshot_observed_at":"2026-07-04T19:30:06.763408Z","title":"Visual sketchpad: Sketching as a visual chain of thought for multimodal language models","venue":null,"work_id":"6df227a2-7a70-47c8-ae06-b2d6eee27a57","year":2024},"citing_paper":{"arxiv_id":"2604.17800","last_updated":"2026-04-20T04:46:20Z","snapshot_observed_at":"2026-07-06T23:04:50.935335Z","submitted_at":"2026-04-20T04:46:20Z","title":"ReFineVLA: Multimodal Reasoning-Aware Generalist Robotic Policies via Teacher-Guided Fine-Tuning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T05:06:38.517652Z"},"links":{"cited_paper":"/paper/2406.09403","citing_paper":"/paper/2604.17800"},"observation_digest":"sha256:963f84fc7ff5e30a360c00f59ff9b4d265c9e72b8ecf0025b57972504dc2a41b","observation_id":"c21318ac-c93c-4cd6-9883-fe74d5dd2cdb","resolution":{"observed_at":"2026-05-10T09:48:48.407273Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09403","last_updated":"2024-11-11T00:54:32Z","snapshot_observed_at":"2026-08-05T09:57:39.370124Z","submitted_at":"2024-06-13T17:59:31Z","title":"Visual Sketchpad: Sketching as a Visual Chain of Thought for Multimodal Language Models","version":3},"cited_work":{"arxiv_id":"2406.09403","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.09403","snapshot_observed_at":"2026-07-04T19:30:06.763408Z","title":"Visual sketchpad: Sketching as a visual chain of thought for multimodal language models","venue":null,"work_id":"6df227a2-7a70-47c8-ae06-b2d6eee27a57","year":2024},"citing_paper":{"arxiv_id":"2604.19945","last_updated":"2026-04-21T19:48:19Z","snapshot_observed_at":"2026-08-02T17:45:19.558396Z","submitted_at":"2026-04-21T19:48:19Z","title":"Visual Reasoning through Tool-supervised Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T03:05:21.688216Z"},"links":{"cited_paper":"/paper/2406.09403","citing_paper":"/paper/2604.19945"},"observation_digest":"sha256:d9657c7a8a14815db70add31263245d1788f25e93a1ba7f4b2bdbbeda2757c74","observation_id":"7a20732f-bf09-41ac-806d-f3f8473ebc08","resolution":{"observed_at":"2026-05-11T12:46:02.948682Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09403","last_updated":"2024-11-11T00:54:32Z","snapshot_observed_at":"2026-08-05T09:57:39.370124Z","submitted_at":"2024-06-13T17:59:31Z","title":"Visual Sketchpad: Sketching as a Visual Chain of Thought for Multimodal Language Models","version":3},"cited_work":{"arxiv_id":"2406.09403","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.09403","snapshot_observed_at":"2026-07-04T19:30:06.763408Z","title":"Visual sketchpad: Sketching as a visual chain of thought for multimodal language models","venue":null,"work_id":"6df227a2-7a70-47c8-ae06-b2d6eee27a57","year":2024},"citing_paper":{"arxiv_id":"2605.03950","last_updated":"2026-05-05T16:36:58Z","snapshot_observed_at":"2026-07-06T23:16:49.553583Z","submitted_at":"2026-05-05T16:36:58Z","title":"UnAC: Adaptive Visual Prompting with Abstraction and Stepwise Checking for Complex Multimodal Reasoning","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-05-07T17:35:28.050906Z"},"links":{"cited_paper":"/paper/2406.09403","citing_paper":"/paper/2605.03950"},"observation_digest":"sha256:d54e90990f5dc1b0dd835ae1eae52c912450b575492a26d54ecaec0e19d69e81","observation_id":"51e95d26-ad37-4a67-9494-451d57092c35","resolution":{"observed_at":"2026-05-11T23:16:37.451329Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09403","last_updated":"2024-11-11T00:54:32Z","snapshot_observed_at":"2026-08-05T09:57:39.370124Z","submitted_at":"2024-06-13T17:59:31Z","title":"Visual Sketchpad: Sketching as a Visual Chain of Thought for Multimodal Language Models","version":3},"cited_work":{"arxiv_id":"2406.09403","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.09403","snapshot_observed_at":"2026-07-04T19:30:06.763408Z","title":"Visual sketchpad: Sketching as a visual chain of thought for multimodal language models","venue":null,"work_id":"6df227a2-7a70-47c8-ae06-b2d6eee27a57","year":2024},"citing_paper":{"arxiv_id":"2605.09860","last_updated":"2026-05-20T01:53:04Z","snapshot_observed_at":"2026-08-02T15:20:05.413930Z","submitted_at":"2026-05-11T01:43:13Z","title":"When to Re-Commit: Temporal Abstraction Discovery for Long-Horizon Vision-Language Reasoning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-12T04:58:21.232058Z"},"links":{"cited_paper":"/paper/2406.09403","citing_paper":"/paper/2605.09860"},"observation_digest":"sha256:dfc3e9c53f631a69ea37bb40d24e24c444235cf383d7be5ed6b4700059a5af62","observation_id":"e3be280d-8b2c-4293-bc23-66db75dd0d7a","resolution":{"observed_at":"2026-05-12T05:46:28.416568Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09403","last_updated":"2024-11-11T00:54:32Z","snapshot_observed_at":"2026-08-05T09:57:39.370124Z","submitted_at":"2024-06-13T17:59:31Z","title":"Visual Sketchpad: Sketching as a Visual Chain of Thought for Multimodal Language Models","version":3},"cited_work":{"arxiv_id":"2406.09403","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.09403","snapshot_observed_at":"2026-07-04T19:30:06.763408Z","title":"Visual sketchpad: Sketching as a visual chain of thought for multimodal language models","venue":null,"work_id":"6df227a2-7a70-47c8-ae06-b2d6eee27a57","year":2024},"citing_paper":{"arxiv_id":"2605.09860","last_updated":"2026-05-20T01:53:04Z","snapshot_observed_at":"2026-08-02T15:20:05.413930Z","submitted_at":"2026-05-11T01:43:13Z","title":"When to Re-Commit: Temporal Abstraction Discovery for Long-Horizon Vision-Language Reasoning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-20T23:23:14.695568Z"},"links":{"cited_paper":"/paper/2406.09403","citing_paper":"/paper/2605.09860"},"observation_digest":"sha256:65b3001e4dc048ae0f5b0594e645df42a6834fdf81d2b26e1f127f5119dcaa76","observation_id":"bf9db31a-edea-4c24-8899-54588db98cf3","resolution":{"observed_at":"2026-05-20T23:23:50.847474Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09403","last_updated":"2024-11-11T00:54:32Z","snapshot_observed_at":"2026-08-05T09:57:39.370124Z","submitted_at":"2024-06-13T17:59:31Z","title":"Visual Sketchpad: Sketching as a Visual Chain of Thought for Multimodal Language Models","version":3},"cited_work":{"arxiv_id":"2406.09403","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.09403","snapshot_observed_at":"2026-07-04T19:30:06.763408Z","title":"Visual sketchpad: Sketching as a visual chain of thought for multimodal language models","venue":null,"work_id":"6df227a2-7a70-47c8-ae06-b2d6eee27a57","year":2024},"citing_paper":{"arxiv_id":"2605.09860","last_updated":"2026-05-20T01:53:04Z","snapshot_observed_at":"2026-08-02T15:20:05.413930Z","submitted_at":"2026-05-11T01:43:13Z","title":"When to Re-Commit: Temporal Abstraction Discovery for Long-Horizon Vision-Language Reasoning","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-21T08:33:24.285225Z"},"links":{"cited_paper":"/paper/2406.09403","citing_paper":"/paper/2605.09860"},"observation_digest":"sha256:16945d34d2381302c709b0f9ef3ea5cab9b785d12763cf7b3c4665afdcf3d468","observation_id":"81725268-a564-4a47-90d1-ff28399f9dd8","resolution":{"observed_at":"2026-05-21T08:34:05.257689Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09403","last_updated":"2024-11-11T00:54:32Z","snapshot_observed_at":"2026-08-05T09:57:39.370124Z","submitted_at":"2024-06-13T17:59:31Z","title":"Visual Sketchpad: Sketching as a Visual Chain of Thought for Multimodal Language Models","version":3},"cited_work":{"arxiv_id":"2406.09403","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.09403","snapshot_observed_at":"2026-07-04T19:30:06.763408Z","title":"Visual sketchpad: Sketching as a visual chain of thought for multimodal language models","venue":null,"work_id":"6df227a2-7a70-47c8-ae06-b2d6eee27a57","year":2024},"citing_paper":{"arxiv_id":"2605.15181","last_updated":"2026-05-14T17:58:19Z","snapshot_observed_at":"2026-07-06T23:26:32.979566Z","submitted_at":"2026-05-14T17:58:19Z","title":"From Plans to Pixels: Learning to Plan and Orchestrate for Open-Ended Image Editing","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-15T03:20:26.350336Z"},"links":{"cited_paper":"/paper/2406.09403","citing_paper":"/paper/2605.15181"},"observation_digest":"sha256:9cb144a3acb9d82ef7495cfe71ea57f23ffd8fa7ccb67d5dc57cd5794f18042a","observation_id":"e4ab9060-1d9c-474a-b4d9-70a023ddc4b1","resolution":{"observed_at":"2026-05-15T03:24:56.099669Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09403","last_updated":"2024-11-11T00:54:32Z","snapshot_observed_at":"2026-08-05T09:57:39.370124Z","submitted_at":"2024-06-13T17:59:31Z","title":"Visual Sketchpad: Sketching as a Visual Chain of Thought for Multimodal Language Models","version":3},"cited_work":{"arxiv_id":"2406.09403","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.09403","snapshot_observed_at":"2026-07-04T19:30:06.763408Z","title":"Visual sketchpad: Sketching as a visual chain of thought for multimodal language models","venue":null,"work_id":"6df227a2-7a70-47c8-ae06-b2d6eee27a57","year":2024},"citing_paper":{"arxiv_id":"2605.20743","last_updated":"2026-05-20T05:46:14Z","snapshot_observed_at":"2026-08-08T11:59:06.555688Z","submitted_at":"2026-05-20T05:46:14Z","title":"Draw2Think: Harnessing Geometry Reasoning through Constraint Engine Interaction","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-21T06:05:45.046156Z"},"links":{"cited_paper":"/paper/2406.09403","citing_paper":"/paper/2605.20743"},"observation_digest":"sha256:aea26fe23f38f8c874575ad6391f97b884c648a6ee6f108cda0336a022e70ff6","observation_id":"1efc79e9-3578-42f3-bcba-246678e0a8fc","resolution":{"observed_at":"2026-05-21T06:09:41.507860Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09403","last_updated":"2024-11-11T00:54:32Z","snapshot_observed_at":"2026-08-05T09:57:39.370124Z","submitted_at":"2024-06-13T17:59:31Z","title":"Visual Sketchpad: Sketching as a Visual Chain of Thought for Multimodal Language Models","version":3},"cited_work":{"arxiv_id":"2406.09403","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.09403","snapshot_observed_at":"2026-07-04T19:30:06.763408Z","title":"Visual sketchpad: Sketching as a visual chain of thought for multimodal language models","venue":null,"work_id":"6df227a2-7a70-47c8-ae06-b2d6eee27a57","year":2024},"citing_paper":{"arxiv_id":"2605.27959","last_updated":"2026-05-28T03:13:45Z","snapshot_observed_at":"2026-07-06T23:37:36.244456Z","submitted_at":"2026-05-27T04:52:42Z","title":"ROVER: Routing Object-Centric Visual Evidence for Grounded Multi-Image Reasoning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-29T13:41:44.049230Z"},"links":{"cited_paper":"/paper/2406.09403","citing_paper":"/paper/2605.27959"},"observation_digest":"sha256:9f1c88b1b7c4d02f503fb7e93d52d8820691cc2f3976498b38a5834f3014e83e","observation_id":"7fe46e34-862a-45e3-bb02-7d6a0ca2ebb3","resolution":{"observed_at":"2026-06-29T13:43:28.584621Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09403","last_updated":"2024-11-11T00:54:32Z","snapshot_observed_at":"2026-08-05T09:57:39.370124Z","submitted_at":"2024-06-13T17:59:31Z","title":"Visual Sketchpad: Sketching as a Visual Chain of Thought for Multimodal Language Models","version":3},"cited_work":{"arxiv_id":"2406.09403","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.09403","snapshot_observed_at":"2026-07-04T19:30:06.763408Z","title":"Visual sketchpad: Sketching as a visual chain of thought for multimodal language models","venue":null,"work_id":"6df227a2-7a70-47c8-ae06-b2d6eee27a57","year":2024},"citing_paper":{"arxiv_id":"2605.28741","last_updated":"2026-05-27T17:01:39Z","snapshot_observed_at":"2026-07-06T23:38:19.096349Z","submitted_at":"2026-05-27T17:01:39Z","title":"Self-Prophetic Decoding to Unlock Visual Search in LVLMs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-29T12:53:40.783281Z"},"links":{"cited_paper":"/paper/2406.09403","citing_paper":"/paper/2605.28741"},"observation_digest":"sha256:64c804e89a7588275ecb87e1dc996a62bf82cf0a95fb2dac4a8fde4cfdfc7716","observation_id":"28089a4d-6922-42b1-ac12-c63d3975a84a","resolution":{"observed_at":"2026-06-29T13:03:26.933236Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09403","last_updated":"2024-11-11T00:54:32Z","snapshot_observed_at":"2026-08-05T09:57:39.370124Z","submitted_at":"2024-06-13T17:59:31Z","title":"Visual Sketchpad: Sketching as a Visual Chain of Thought for Multimodal Language Models","version":3},"cited_work":{"arxiv_id":"2406.09403","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.09403","snapshot_observed_at":"2026-07-04T19:30:06.763408Z","title":"Visual sketchpad: Sketching as a visual chain of thought for multimodal language models","venue":null,"work_id":"6df227a2-7a70-47c8-ae06-b2d6eee27a57","year":2024},"citing_paper":{"arxiv_id":"2606.00384","last_updated":"2026-06-07T19:48:24Z","snapshot_observed_at":"2026-08-08T23:35:17.895270Z","submitted_at":"2026-05-29T21:57:37Z","title":"VESTA: Visual Exploration with Statistical Tool Agents","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-28T21:58:11.339217Z"},"links":{"cited_paper":"/paper/2406.09403","citing_paper":"/paper/2606.00384"},"observation_digest":"sha256:051600de60c9836391dfe402c05804517a4d5d5171ff168d7d5c83229e4d52bc","observation_id":"31404f1e-d046-4a1d-8bd2-2854a8fc1228","resolution":{"observed_at":"2026-07-01T19:56:10.561642Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09403","last_updated":"2024-11-11T00:54:32Z","snapshot_observed_at":"2026-08-05T09:57:39.370124Z","submitted_at":"2024-06-13T17:59:31Z","title":"Visual Sketchpad: Sketching as a Visual Chain of Thought for Multimodal Language Models","version":3},"cited_work":{"arxiv_id":"2406.09403","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.09403","snapshot_observed_at":"2026-07-04T19:30:06.763408Z","title":"Visual sketchpad: Sketching as a visual chain of thought for multimodal language models","venue":null,"work_id":"6df227a2-7a70-47c8-ae06-b2d6eee27a57","year":2024},"citing_paper":{"arxiv_id":"2606.00579","last_updated":"2026-05-30T07:04:27Z","snapshot_observed_at":"2026-08-06T06:13:01.994998Z","submitted_at":"2026-05-30T07:04:27Z","title":"Sandboxed Coding Agents are Competitive Omni-modal Task Solvers","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-28T18:59:51.362554Z"},"links":{"cited_paper":"/paper/2406.09403","citing_paper":"/paper/2606.00579"},"observation_digest":"sha256:aa3540dd63f021644b541d0bac60261090eb319a7e382af7138601226361763f","observation_id":"dada992f-503d-4648-9141-34cf93fcf1b3","resolution":{"observed_at":"2026-06-28T19:02:34.200334Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09403","last_updated":"2024-11-11T00:54:32Z","snapshot_observed_at":"2026-08-05T09:57:39.370124Z","submitted_at":"2024-06-13T17:59:31Z","title":"Visual Sketchpad: Sketching as a Visual Chain of Thought for Multimodal Language Models","version":3},"cited_work":{"arxiv_id":"2406.09403","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.09403","snapshot_observed_at":"2026-07-04T19:30:06.763408Z","title":"Visual sketchpad: Sketching as a visual chain of thought for multimodal language models","venue":null,"work_id":"6df227a2-7a70-47c8-ae06-b2d6eee27a57","year":2024},"citing_paper":{"arxiv_id":"2606.03988","last_updated":"2026-06-03T04:16:22Z","snapshot_observed_at":"2026-07-06T23:44:09.692359Z","submitted_at":"2026-06-02T17:59:17Z","title":"Imaginative Perception Tokens Enhance Spatial Reasoning in Multimodal Language Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-28T09:56:05.047862Z"},"links":{"cited_paper":"/paper/2406.09403","citing_paper":"/paper/2606.03988"},"observation_digest":"sha256:151538fa7c715320803ccd7f76f2616f0422248856f11dcb76c4483e3ac185a0","observation_id":"8b94058f-7248-4cf1-b435-94e361fc733c","resolution":{"observed_at":"2026-07-02T03:36:29.328950Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09403","last_updated":"2024-11-11T00:54:32Z","snapshot_observed_at":"2026-08-05T09:57:39.370124Z","submitted_at":"2024-06-13T17:59:31Z","title":"Visual Sketchpad: Sketching as a Visual Chain of Thought for Multimodal Language Models","version":3},"cited_work":{"arxiv_id":"2406.09403","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.09403","snapshot_observed_at":"2026-07-04T19:30:06.763408Z","title":"Visual sketchpad: Sketching as a visual chain of thought for multimodal language models","venue":null,"work_id":"6df227a2-7a70-47c8-ae06-b2d6eee27a57","year":2024},"citing_paper":{"arxiv_id":"2606.05769","last_updated":"2026-06-04T06:53:19Z","snapshot_observed_at":"2026-08-03T03:37:13.228116Z","submitted_at":"2026-06-04T06:53:19Z","title":"Imagine Before You Predict: Interleaved Latent Visual Reasoning for Video Event Prediction","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-06-28T02:46:50.373450Z"},"links":{"cited_paper":"/paper/2406.09403","citing_paper":"/paper/2606.05769"},"observation_digest":"sha256:1145966f89a4fdd6a4ec328e0f3876a1bec6e93c2141fba5b45694db7740d2ec","observation_id":"4685a236-406a-498e-bc56-925646062584","resolution":{"observed_at":"2026-07-02T11:56:55.368872Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09403","last_updated":"2024-11-11T00:54:32Z","snapshot_observed_at":"2026-08-05T09:57:39.370124Z","submitted_at":"2024-06-13T17:59:31Z","title":"Visual Sketchpad: Sketching as a Visual Chain of Thought for Multimodal Language Models","version":3},"cited_work":{"arxiv_id":"2406.09403","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.09403","snapshot_observed_at":"2026-07-04T19:30:06.763408Z","title":"Visual sketchpad: Sketching as a visual chain of thought for multimodal language models","venue":null,"work_id":"6df227a2-7a70-47c8-ae06-b2d6eee27a57","year":2024},"citing_paper":{"arxiv_id":"2606.11470","last_updated":"2026-06-09T21:59:37Z","snapshot_observed_at":"2026-07-06T23:50:35.052764Z","submitted_at":"2026-06-09T21:59:37Z","title":"The Periodic Table of LLM Reasoning: A Structured Survey of Reasoning Paradigms, Methods, and Failure Modes","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-06-27T12:59:51.091008Z"},"links":{"cited_paper":"/paper/2406.09403","citing_paper":"/paper/2606.11470"},"observation_digest":"sha256:62dac8c3860dd321bb1b1650d0239015fbe5ec2095be5b2ea3ac4d3983b94ba8","observation_id":"7fe04b53-5aa9-47a0-8d4c-e05707d8f480","resolution":{"observed_at":"2026-07-03T05:57:41.515808Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09403","last_updated":"2024-11-11T00:54:32Z","snapshot_observed_at":"2026-08-05T09:57:39.370124Z","submitted_at":"2024-06-13T17:59:31Z","title":"Visual Sketchpad: Sketching as a Visual Chain of Thought for Multimodal Language Models","version":3},"cited_work":{"arxiv_id":"2406.09403","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.09403","snapshot_observed_at":"2026-07-04T19:30:06.763408Z","title":"Visual sketchpad: Sketching as a visual chain of thought for multimodal language models","venue":null,"work_id":"6df227a2-7a70-47c8-ae06-b2d6eee27a57","year":2024},"citing_paper":{"arxiv_id":"2606.17888","last_updated":"2026-06-16T13:09:32Z","snapshot_observed_at":"2026-08-08T01:57:17.698279Z","submitted_at":"2026-06-16T13:09:32Z","title":"MathVis-Fine: Aligning Visual Supervision with Necessity via Progressive Dependency-Guided Training for Multimodal Mathematical Reasoning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-06-27T01:23:40.564561Z"},"links":{"cited_paper":"/paper/2406.09403","citing_paper":"/paper/2606.17888"},"observation_digest":"sha256:dfa025ddaf579d9e8d7cdc0a547a903a1bb8ebfda0ee19bdf652c83d2f408a2e","observation_id":"4826be67-3467-438d-aac2-49412dd2fa53","resolution":{"observed_at":"2026-07-03T20:18:57.586402Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09403","last_updated":"2024-11-11T00:54:32Z","snapshot_observed_at":"2026-08-05T09:57:39.370124Z","submitted_at":"2024-06-13T17:59:31Z","title":"Visual Sketchpad: Sketching as a Visual Chain of Thought for Multimodal Language Models","version":3},"cited_work":{"arxiv_id":"2406.09403","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.09403","snapshot_observed_at":"2026-07-04T19:30:06.763408Z","title":"Visual sketchpad: Sketching as a visual chain of thought for multimodal language models","venue":null,"work_id":"6df227a2-7a70-47c8-ae06-b2d6eee27a57","year":2024},"citing_paper":{"arxiv_id":"2606.18974","last_updated":"2026-06-25T02:14:41Z","snapshot_observed_at":"2026-08-02T20:17:43.258482Z","submitted_at":"2026-06-17T11:59:15Z","title":"Visual-OPSD: Cross-Modal On-Policy Self-Distillation for Efficient Unified Multimodal Reasoning","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-06-26T21:47:51.437284Z"},"links":{"cited_paper":"/paper/2406.09403","citing_paper":"/paper/2606.18974"},"observation_digest":"sha256:a80c9a4b6589aead2fcb3469decaab567e124df792eb8aa7b077e354238209cc","observation_id":"726b1bbe-1a68-46bd-9c87-4d3bb4e28aa4","resolution":{"observed_at":"2026-07-03T23:49:02.253830Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09403","last_updated":"2024-11-11T00:54:32Z","snapshot_observed_at":"2026-08-05T09:57:39.370124Z","submitted_at":"2024-06-13T17:59:31Z","title":"Visual Sketchpad: Sketching as a Visual Chain of Thought for Multimodal Language Models","version":3},"cited_work":{"arxiv_id":"2406.09403","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.09403","snapshot_observed_at":"2026-07-04T19:30:06.763408Z","title":"Visual sketchpad: Sketching as a visual chain of thought for multimodal language models","venue":null,"work_id":"6df227a2-7a70-47c8-ae06-b2d6eee27a57","year":2024},"citing_paper":{"arxiv_id":"2606.24233","last_updated":"2026-06-23T07:22:22Z","snapshot_observed_at":"2026-08-06T19:51:08.157500Z","submitted_at":"2026-06-23T07:22:22Z","title":"Latent Visual States for Efficient Multimodal Reasoning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-26T00:38:11.619574Z"},"links":{"cited_paper":"/paper/2406.09403","citing_paper":"/paper/2606.24233"},"observation_digest":"sha256:2bb0af95058a2a7751c421406f9c9ebadd0f83f5a5a14b5935486bab9ac5e14a","observation_id":"2297cd65-98aa-4276-93c3-fbcc8832c40c","resolution":{"observed_at":"2026-07-04T16:29:57.267994Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09403","last_updated":"2024-11-11T00:54:32Z","snapshot_observed_at":"2026-08-05T09:57:39.370124Z","submitted_at":"2024-06-13T17:59:31Z","title":"Visual Sketchpad: Sketching as a Visual Chain of Thought for Multimodal Language Models","version":3},"cited_work":{"arxiv_id":"2406.09403","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.09403","snapshot_observed_at":"2026-07-04T19:30:06.763408Z","title":"Visual sketchpad: Sketching as a visual chain of thought for multimodal language models","venue":null,"work_id":"6df227a2-7a70-47c8-ae06-b2d6eee27a57","year":2024},"citing_paper":{"arxiv_id":"2606.25319","last_updated":"2026-06-24T02:32:38Z","snapshot_observed_at":"2026-08-04T23:24:39.482468Z","submitted_at":"2026-06-24T02:32:38Z","title":"V-Zero: Answer-Label-Free On-Policy Distillation with Contrastive Evidence Gating for Fine-Grained Visual Reasoning","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-06-25T21:23:10.051805Z"},"links":{"cited_paper":"/paper/2406.09403","citing_paper":"/paper/2606.25319"},"observation_digest":"sha256:73fdbeefcddafa5010600eb53097bbf50ac86b58ab6122ff1ae9075428ddf42e","observation_id":"2f75a577-3ce0-4721-b756-35f7ad4e3911","resolution":{"observed_at":"2026-07-04T19:30:06.765443Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09403","last_updated":"2024-11-11T00:54:32Z","snapshot_observed_at":"2026-08-05T09:57:39.370124Z","submitted_at":"2024-06-13T17:59:31Z","title":"Visual Sketchpad: Sketching as a Visual Chain of Thought for Multimodal Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09403","snapshot_observed_at":"2026-07-14T07:59:56.441098Z","title":"arXiv preprint arXiv:2406.09403 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10966","last_updated":"2026-07-13T00:21:30Z","snapshot_observed_at":"2026-08-04T00:19:49.524589Z","submitted_at":"2026-07-13T00:21:30Z","title":"SVR-R1: Bootstrapping Multi-modal Reasoning with Self-verification in Reinforcement Learning","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-07-14T07:59:56.441098Z"},"links":{"cited_paper":"/paper/2406.09403","citing_paper":"/paper/2607.10966"},"observation_digest":"sha256:fba571c6d22600e910fb54647503f6a59e382f691e42ca66081e674d78ee5598","observation_id":"b548de94-82a2-40a3-a429-b8a17399cc04","resolution":{"observed_at":"2026-07-14T07:59:56.441098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09403","last_updated":"2024-11-11T00:54:32Z","snapshot_observed_at":"2026-08-05T09:57:39.370124Z","submitted_at":"2024-06-13T17:59:31Z","title":"Visual Sketchpad: Sketching as a Visual Chain of Thought for Multimodal Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09403","snapshot_observed_at":"2026-07-30T21:38:08.556986Z","title":"Smith, and Ranjay Krishna","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26769","last_updated":"2026-07-29T11:10:34Z","snapshot_observed_at":"2026-08-03T03:36:32.779474Z","submitted_at":"2026-07-29T11:10:34Z","title":"See2Think: Do Multimodal Models Really Use Intermediate Visual States?","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-30T21:38:08.556986Z"},"links":{"cited_paper":"/paper/2406.09403","citing_paper":"/paper/2607.26769"},"observation_digest":"sha256:99336cb770bafb5572ba17ad61ced204d0d39d0f0782e54d7227065ed7bce650","observation_id":"dae03d3e-953e-4dc4-ae66-d125d35e78e8","resolution":{"observed_at":"2026-07-30T21:38:08.556986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2406.09403/citation-record","integrity":"/paper/2406.09403/integrity","json":"/paper/2406.09403/citation-record.json","paper":"/paper/2406.09403"},"outbound":[],"paper":{"arxiv_id":"2406.09403","last_updated":"2024-11-11T00:54:32Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-05T09:57:39.370124Z","submitted_at":"2024-06-13T17:59:31Z","title":"Visual Sketchpad: Sketching as a Visual Chain of Thought for Multimodal Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 45 inbound Pith citation observations for arXiv:2406.09403."}