{"as_of":"2026-08-10T08:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b7db15e8a26e5a62dc83b4d35a1f7dc3553d0bfec80d2d45e7304d8034b912f3","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":17,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":17,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":17,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":17,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:10:11.266165Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T23:49:02.294828Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2305.02317","last_updated":"2024-01-23T02:29:35Z","snapshot_observed_at":"2026-07-06T15:22:55.122322Z","submitted_at":"2023-05-03T17:58:29Z","title":"Visual Chain of Thought: Bridging Logical Gaps with Multimodal Infillings","version":3},"cited_work":{"arxiv_id":"2305.02317","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.02317","snapshot_observed_at":"2026-07-03T23:49:02.294828Z","title":"Visual chain of thought: bridging logical gaps with multimodal infillings","venue":null,"work_id":"64fb27c2-faa6-417b-84d7-68c8866ca1e4","year":2023},"citing_paper":{"arxiv_id":"2306.13549","last_updated":"2024-11-29T15:51:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T15:21:52Z","title":"A Survey on Multimodal Large Language Models","version":4},"reference_index":187,"source":"pdf_text","source_observed_at":"2026-05-16T02:56:41.658658Z"},"links":{"cited_paper":"/paper/2305.02317","citing_paper":"/paper/2306.13549"},"observation_digest":"sha256:1ee73a956f4888a87622ccc5012a2ba08341367923535515e733a5b85689f77f","observation_id":"8d2a8bfd-bce7-4e65-abcb-f1cb399801d9","resolution":{"observed_at":"2026-05-16T02:56:42.155815Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02317","last_updated":"2024-01-23T02:29:35Z","snapshot_observed_at":"2026-07-06T15:22:55.122322Z","submitted_at":"2023-05-03T17:58:29Z","title":"Visual Chain of Thought: Bridging Logical Gaps with Multimodal Infillings","version":3},"cited_work":{"arxiv_id":"2305.02317","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.02317","snapshot_observed_at":"2026-07-03T23:49:02.294828Z","title":"Visual chain of thought: bridging logical gaps with multimodal infillings","venue":null,"work_id":"64fb27c2-faa6-417b-84d7-68c8866ca1e4","year":2023},"citing_paper":{"arxiv_id":"2503.12605","last_updated":"2025-03-23T13:47:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-16T18:39:13Z","title":"Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-15T17:18:52.996467Z"},"links":{"cited_paper":"/paper/2305.02317","citing_paper":"/paper/2503.12605"},"observation_digest":"sha256:965659b43fbd59184f254caad6b4c0cc31147b7f5849b8a945a13f78982b211f","observation_id":"6a9d2b29-e7e5-4a5f-aade-acd9df9586fa","resolution":{"observed_at":"2026-05-15T17:18:53.689340Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02317","last_updated":"2024-01-23T02:29:35Z","snapshot_observed_at":"2026-07-06T15:22:55.122322Z","submitted_at":"2023-05-03T17:58:29Z","title":"Visual Chain of Thought: Bridging Logical Gaps with Multimodal Infillings","version":3},"cited_work":{"arxiv_id":"2305.02317","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.02317","snapshot_observed_at":"2026-07-03T23:49:02.294828Z","title":"Visual chain of thought: bridging logical gaps with multimodal infillings","venue":null,"work_id":"64fb27c2-faa6-417b-84d7-68c8866ca1e4","year":2023},"citing_paper":{"arxiv_id":"2503.22020","last_updated":"2025-03-27T22:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T22:23:04Z","title":"CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:44.903048Z"},"links":{"cited_paper":"/paper/2305.02317","citing_paper":"/paper/2503.22020"},"observation_digest":"sha256:aca3d43a9ccec24f0c7fad1fee7f1b518778f9b49b9105a0bb1364a4277f3782","observation_id":"01fe981e-0f3a-4d7e-97af-0a6f31164355","resolution":{"observed_at":"2026-05-16T05:21:44.988534Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02317","last_updated":"2024-01-23T02:29:35Z","snapshot_observed_at":"2026-07-06T15:22:55.122322Z","submitted_at":"2023-05-03T17:58:29Z","title":"Visual Chain of Thought: Bridging Logical Gaps with Multimodal Infillings","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.02317","snapshot_observed_at":"2026-08-07T15:10:11.266165Z","title":"Visual chain of thought: bridging logical gaps with multimodal infillings.arXiv preprint arXiv:2305.02317, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16192","last_updated":"2025-05-30T06:35:34Z","snapshot_observed_at":"2026-08-09T04:10:43.674761Z","submitted_at":"2025-05-22T03:50:13Z","title":"VLM-R$^3$: Region Recognition, Reasoning, and Refinement for Enhanced Multimodal Chain-of-Thought","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:11.266165Z"},"links":{"cited_paper":"/paper/2305.02317","citing_paper":"/paper/2505.16192"},"observation_digest":"sha256:2b575d57039c3d9835b8161f269a6e6909d21c7b56617779b072caca248dbd34","observation_id":"824d62e9-3f98-438e-9cc0-bbd5e9de4f34","resolution":{"observed_at":"2026-08-07T15:10:11.266165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02317","last_updated":"2024-01-23T02:29:35Z","snapshot_observed_at":"2026-07-06T15:22:55.122322Z","submitted_at":"2023-05-03T17:58:29Z","title":"Visual Chain of Thought: Bridging Logical Gaps with Multimodal Infillings","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.02317","snapshot_observed_at":"2026-08-07T14:23:17.734824Z","title":"URL https://openreview.net/forum?id=1ikK0kHjvj","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-10T05:22:15.938376Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.734824Z"},"links":{"cited_paper":"/paper/2305.02317","citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:e33eebfb8f8c86144002a733e2019095ab17ece35a104f384c6d40f99aadf3e8","observation_id":"2747b5cd-31f1-4a9a-a7d0-9b27b197983b","resolution":{"observed_at":"2026-08-07T14:23:17.734824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02317","last_updated":"2024-01-23T02:29:35Z","snapshot_observed_at":"2026-07-06T15:22:55.122322Z","submitted_at":"2023-05-03T17:58:29Z","title":"Visual Chain of Thought: Bridging Logical Gaps with Multimodal Infillings","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.02317","snapshot_observed_at":"2026-08-07T14:12:05.316112Z","title":"Visual chain of thought: bridging logical gaps with multimodal infillings","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19702","last_updated":"2025-05-26T08:54:14Z","snapshot_observed_at":"2026-08-08T16:19:49.539801Z","submitted_at":"2025-05-26T08:54:14Z","title":"Point-RFT: Improving Multimodal Reasoning with Visually Grounded Reinforcement Finetuning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:05.316112Z"},"links":{"cited_paper":"/paper/2305.02317","citing_paper":"/paper/2505.19702"},"observation_digest":"sha256:75357891bb6e82790429b40834a4c6b374d9de1a9bf0c75d5c7a1f398065974c","observation_id":"251461e2-d61c-43f5-9dff-f1df33622f8f","resolution":{"observed_at":"2026-08-07T14:12:05.316112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02317","last_updated":"2024-01-23T02:29:35Z","snapshot_observed_at":"2026-07-06T15:22:55.122322Z","submitted_at":"2023-05-03T17:58:29Z","title":"Visual Chain of Thought: Bridging Logical Gaps with Multimodal Infillings","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.02317","snapshot_observed_at":"2026-08-07T12:42:25.021502Z","title":"Visual chain of thought: bridging logical gaps with multimodal infill- ings","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-08T00:05:10.710300Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:25.021502Z"},"links":{"cited_paper":"/paper/2305.02317","citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:47105b1dc66ab6f90bbf29d8e403ff4e4202d280ffd3906605269b3b9e22d85c","observation_id":"991f54e3-8231-4670-bdee-c8beff1d6ab8","resolution":{"observed_at":"2026-08-07T12:42:25.021502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02317","last_updated":"2024-01-23T02:29:35Z","snapshot_observed_at":"2026-07-06T15:22:55.122322Z","submitted_at":"2023-05-03T17:58:29Z","title":"Visual Chain of Thought: Bridging Logical Gaps with Multimodal Infillings","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.02317","snapshot_observed_at":"2026-08-07T04:40:10.790536Z","title":"Visual chain of thought: bridging logical gaps with multimodal infillings","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-08T03:17:29.512287Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:10.790536Z"},"links":{"cited_paper":"/paper/2305.02317","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:29cc4787f01f2758f4cd9f338057195ab8c60a3fa37f9ecd1a21e2513a436818","observation_id":"d6973e5d-3d08-4214-bbe4-a5764c3ead37","resolution":{"observed_at":"2026-08-07T04:40:10.790536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02317","last_updated":"2024-01-23T02:29:35Z","snapshot_observed_at":"2026-07-06T15:22:55.122322Z","submitted_at":"2023-05-03T17:58:29Z","title":"Visual Chain of Thought: Bridging Logical Gaps with Multimodal Infillings","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.02317","snapshot_observed_at":"2026-08-07T11:19:02.751761Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14805","last_updated":"2025-08-12T17:07:53Z","snapshot_observed_at":"2026-08-08T00:05:33.094743Z","submitted_at":"2025-06-03T13:44:14Z","title":"Argus Inspection: Do Multimodal Large Language Models Possess the Eye of Panoptes?","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T11:19:02.751761Z"},"links":{"cited_paper":"/paper/2305.02317","citing_paper":"/paper/2506.14805"},"observation_digest":"sha256:20c611d56abfb3d3fa6506f9cfc269d01dcb56ab429d0fdb3d0746415335c96e","observation_id":"9515bdd8-7253-490f-8bd9-b5d53f00a0c8","resolution":{"observed_at":"2026-08-07T11:19:02.751761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02317","last_updated":"2024-01-23T02:29:35Z","snapshot_observed_at":"2026-07-06T15:22:55.122322Z","submitted_at":"2023-05-03T17:58:29Z","title":"Visual Chain of Thought: Bridging Logical Gaps with Multimodal Infillings","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.02317","snapshot_observed_at":"2026-08-06T18:51:05.057773Z","title":"Visual chain of thought: Bridging logical gaps with multimodal infillings, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07297","last_updated":"2025-07-09T21:44:12Z","snapshot_observed_at":"2026-08-09T23:46:09.743302Z","submitted_at":"2025-07-09T21:44:12Z","title":"MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T18:51:05.057773Z"},"links":{"cited_paper":"/paper/2305.02317","citing_paper":"/paper/2507.07297"},"observation_digest":"sha256:5ff11605e01efd66d0dfc2367b82bb1389accf748dbd6c5ae13a5500599c2554","observation_id":"e1e41564-69ac-402c-b641-dd779435f174","resolution":{"observed_at":"2026-08-06T18:51:05.057773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02317","last_updated":"2024-01-23T02:29:35Z","snapshot_observed_at":"2026-07-06T15:22:55.122322Z","submitted_at":"2023-05-03T17:58:29Z","title":"Visual Chain of Thought: Bridging Logical Gaps with Multimodal Infillings","version":3},"cited_work":{"arxiv_id":"2305.02317","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.02317","snapshot_observed_at":"2026-07-03T23:49:02.294828Z","title":"Visual chain of thought: bridging logical gaps with multimodal infillings","venue":null,"work_id":"64fb27c2-faa6-417b-84d7-68c8866ca1e4","year":2023},"citing_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-15T18:56:23.817544Z"},"links":{"cited_paper":"/paper/2305.02317","citing_paper":"/paper/2508.05748"},"observation_digest":"sha256:7e1b765c97d678b140d2ee202e04060e2bb7ff44afbb20a40a89f008122ae42f","observation_id":"1d9134d9-2d67-4ef6-8865-6454a3103638","resolution":{"observed_at":"2026-05-15T18:56:23.987203Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02317","last_updated":"2024-01-23T02:29:35Z","snapshot_observed_at":"2026-07-06T15:22:55.122322Z","submitted_at":"2023-05-03T17:58:29Z","title":"Visual Chain of Thought: Bridging Logical Gaps with Multimodal Infillings","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.02317","snapshot_observed_at":"2026-08-05T05:34:40.348235Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.05226","last_updated":"2025-09-05T16:40:13Z","snapshot_observed_at":"2026-08-09T08:01:23.924366Z","submitted_at":"2025-09-05T16:40:13Z","title":"Less is More Tokens: Efficient Math Reasoning via Difficulty-Aware Chain-of-Thought Distillation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T05:34:40.348235Z"},"links":{"cited_paper":"/paper/2305.02317","citing_paper":"/paper/2509.05226"},"observation_digest":"sha256:6c675e7c6e371754c108bdb1832453bc49ca798b5b77d6a5569e94798109af1e","observation_id":"ad075480-7c56-48d2-b986-c70603077360","resolution":{"observed_at":"2026-08-05T05:34:40.348235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02317","last_updated":"2024-01-23T02:29:35Z","snapshot_observed_at":"2026-07-06T15:22:55.122322Z","submitted_at":"2023-05-03T17:58:29Z","title":"Visual Chain of Thought: Bridging Logical Gaps with Multimodal Infillings","version":3},"cited_work":{"arxiv_id":"2305.02317","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.02317","snapshot_observed_at":"2026-07-03T23:49:02.294828Z","title":"Visual chain of thought: bridging logical gaps with multimodal infillings","venue":null,"work_id":"64fb27c2-faa6-417b-84d7-68c8866ca1e4","year":2023},"citing_paper":{"arxiv_id":"2509.23322","last_updated":"2026-04-09T10:37:26Z","snapshot_observed_at":"2026-08-02T12:34:37.611019Z","submitted_at":"2025-09-27T14:13:41Z","title":"Mitigating Visual Context Degradation in Large Multimodal Models: A Training-Free Decoupled Agentic Framework","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-18T12:31:25.257879Z"},"links":{"cited_paper":"/paper/2305.02317","citing_paper":"/paper/2509.23322"},"observation_digest":"sha256:b7e99a04073c130ac10f9d9187f7b7f6ff6b8e824163cab69e4dc41e50202098","observation_id":"bcaae467-e363-4982-b444-879b2eaf533f","resolution":{"observed_at":"2026-05-18T12:32:36.347236Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02317","last_updated":"2024-01-23T02:29:35Z","snapshot_observed_at":"2026-07-06T15:22:55.122322Z","submitted_at":"2023-05-03T17:58:29Z","title":"Visual Chain of Thought: Bridging Logical Gaps with Multimodal Infillings","version":3},"cited_work":{"arxiv_id":"2305.02317","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.02317","snapshot_observed_at":"2026-07-03T23:49:02.294828Z","title":"Visual chain of thought: bridging logical gaps with multimodal infillings","venue":null,"work_id":"64fb27c2-faa6-417b-84d7-68c8866ca1e4","year":2023},"citing_paper":{"arxiv_id":"2604.17800","last_updated":"2026-04-20T04:46:20Z","snapshot_observed_at":"2026-07-06T23:04:50.935335Z","submitted_at":"2026-04-20T04:46:20Z","title":"ReFineVLA: Multimodal Reasoning-Aware Generalist Robotic Policies via Teacher-Guided Fine-Tuning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T05:06:38.517652Z"},"links":{"cited_paper":"/paper/2305.02317","citing_paper":"/paper/2604.17800"},"observation_digest":"sha256:e00a4bb84846e0aaaaca881b38659f7d746dccc9d0b9725d588d9996f6c868a1","observation_id":"c9501840-9dc0-4a57-8174-2ed738536823","resolution":{"observed_at":"2026-05-10T09:48:48.348511Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02317","last_updated":"2024-01-23T02:29:35Z","snapshot_observed_at":"2026-07-06T15:22:55.122322Z","submitted_at":"2023-05-03T17:58:29Z","title":"Visual Chain of Thought: Bridging Logical Gaps with Multimodal Infillings","version":3},"cited_work":{"arxiv_id":"2305.02317","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.02317","snapshot_observed_at":"2026-07-03T23:49:02.294828Z","title":"Visual chain of thought: bridging logical gaps with multimodal infillings","venue":null,"work_id":"64fb27c2-faa6-417b-84d7-68c8866ca1e4","year":2023},"citing_paper":{"arxiv_id":"2604.20696","last_updated":"2026-04-22T15:41:33Z","snapshot_observed_at":"2026-08-02T21:16:36.054502Z","submitted_at":"2026-04-22T15:41:33Z","title":"R-CoV: Region-Aware Chain-of-Verification for Alleviating Object Hallucinations in LVLMs","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-10T01:28:14.039910Z"},"links":{"cited_paper":"/paper/2305.02317","citing_paper":"/paper/2604.20696"},"observation_digest":"sha256:246a6edd33f7cb74a18601789f87fdb653cc454ba7b060c0294c5db93fdc6816","observation_id":"ab011063-c40e-4571-a5aa-9352f7f6effe","resolution":{"observed_at":"2026-05-11T13:36:04.240674Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02317","last_updated":"2024-01-23T02:29:35Z","snapshot_observed_at":"2026-07-06T15:22:55.122322Z","submitted_at":"2023-05-03T17:58:29Z","title":"Visual Chain of Thought: Bridging Logical Gaps with Multimodal Infillings","version":3},"cited_work":{"arxiv_id":"2305.02317","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.02317","snapshot_observed_at":"2026-07-03T23:49:02.294828Z","title":"Visual chain of thought: bridging logical gaps with multimodal infillings","venue":null,"work_id":"64fb27c2-faa6-417b-84d7-68c8866ca1e4","year":2023},"citing_paper":{"arxiv_id":"2606.18974","last_updated":"2026-06-25T02:14:41Z","snapshot_observed_at":"2026-08-02T20:17:43.258482Z","submitted_at":"2026-06-17T11:59:15Z","title":"Visual-OPSD: Cross-Modal On-Policy Self-Distillation for Efficient Unified Multimodal Reasoning","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-06-26T21:47:51.437284Z"},"links":{"cited_paper":"/paper/2305.02317","citing_paper":"/paper/2606.18974"},"observation_digest":"sha256:5f0ef6cab40f3ee16607e205b5b78cf94dc4c7f5d1f202a2d577ed9e4ba2f600","observation_id":"595f3cef-e4df-4b0c-95c9-73f5a1ade0d6","resolution":{"observed_at":"2026-07-03T23:49:02.296271Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02317","last_updated":"2024-01-23T02:29:35Z","snapshot_observed_at":"2026-07-06T15:22:55.122322Z","submitted_at":"2023-05-03T17:58:29Z","title":"Visual Chain of Thought: Bridging Logical Gaps with Multimodal Infillings","version":3},"cited_work":{"arxiv_id":"2305.02317","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.02317","snapshot_observed_at":"2026-07-03T23:49:02.294828Z","title":"Visual chain of thought: bridging logical gaps with multimodal infillings","venue":null,"work_id":"64fb27c2-faa6-417b-84d7-68c8866ca1e4","year":2023},"citing_paper":{"arxiv_id":"2607.00361","last_updated":"2026-07-01T02:59:59Z","snapshot_observed_at":"2026-08-08T14:29:25.977458Z","submitted_at":"2026-07-01T02:59:59Z","title":"ReShift: Aha-Moment-Driven Reasoning-Level Backdoor Attacks on Vision-Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-02T11:48:35.972372Z"},"links":{"cited_paper":"/paper/2305.02317","citing_paper":"/paper/2607.00361"},"observation_digest":"sha256:3f3a240782f9eb6d659ebe082df8796b4eb52a583e89803d59dcd730b790bdba","observation_id":"1e0eeb18-b51d-4fbc-9a48-fd58cc5f6a4c","resolution":{"observed_at":"2026-07-02T11:56:54.961436Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2305.02317/citation-record","integrity":"/paper/2305.02317/integrity","json":"/paper/2305.02317/citation-record.json","paper":"/paper/2305.02317"},"outbound":[],"paper":{"arxiv_id":"2305.02317","last_updated":"2024-01-23T02:29:35Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T15:22:55.122322Z","submitted_at":"2023-05-03T17:58:29Z","title":"Visual Chain of Thought: Bridging Logical Gaps with Multimodal Infillings"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 17 inbound Pith citation observations for arXiv:2305.02317."}