{"as_of":"2026-08-09T02:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2d01cf773fa1129db81104896ed9b90a482814db8e28ae97ce7976e777264ce7","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-12T18:12:27.396607Z","state":"measured"},{"denominator":149,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":149,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":171,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T19:45:19.527155Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":98,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-13T22:50:24.053411Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2303.04671"},"observation_digest":"sha256:6519c83f1e6816bc6fdebc111691b20dbc27a7a8c18f851187870e7a4b30b9f5","observation_id":"7c9d7d79-955e-4dd1-b16d-b5ff256b9116","resolution":{"observed_at":"2026-05-13T22:50:24.184228Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2303.11381","last_updated":"2023-03-20T18:31:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-20T18:31:47Z","title":"MM-REACT: Prompting ChatGPT for Multimodal Reasoning and Action","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-14T01:17:58.678036Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2303.11381"},"observation_digest":"sha256:0b686ff21b5e746a408ec753b729fc0c89150097274c81da7fdb1fafb8d9468e","observation_id":"d2d319d5-695f-4e9c-8371-74f8fd7000c0","resolution":{"observed_at":"2026-05-14T01:17:58.849157Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2303.16199","last_updated":"2024-09-18T23:54:36Z","snapshot_observed_at":"2026-08-06T06:36:02.994951Z","submitted_at":"2023-03-28T17:59:12Z","title":"LLaMA-Adapter: Efficient Fine-tuning of Language Models with Zero-init Attention","version":3},"reference_index":147,"source":"arxiv_source","source_observed_at":"2026-05-14T23:07:42.245641Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2303.16199"},"observation_digest":"sha256:aa11e8857c574fa08c2160753c4019e591df95098e2a9eae0a4fe52f300a7a8a","observation_id":"1d345092-eea8-491e-9045-de78406b0d1c","resolution":{"observed_at":"2026-05-14T23:07:42.533156Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2303.17760","last_updated":"2023-11-02T17:34:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-31T01:09:00Z","title":"CAMEL: Communicative Agents for \"Mind\" Exploration of Large Language Model Society","version":2},"reference_index":133,"source":"pdf_text","source_observed_at":"2026-05-14T01:40:53.351795Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2303.17760"},"observation_digest":"sha256:099fde52303f4354cad00ea2791aba92212211cafc0fc05322495e32b00be3b4","observation_id":"19f22747-9d6b-4414-8ef6-69cae187b6a5","resolution":{"observed_at":"2026-05-14T01:40:53.989447Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-11T08:22:03.403362Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2304.08485"},"observation_digest":"sha256:a6c0ec279fd6c7c943f247ac834e4738addd865c1eef751eebaebc546aeac727","observation_id":"5256cbde-1982-4314-bc75-36f929a43ee9","resolution":{"observed_at":"2026-05-12T18:12:27.664923Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2306.13549","last_updated":"2024-11-29T15:51:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T15:21:52Z","title":"A Survey on Multimodal Large Language Models","version":4},"reference_index":188,"source":"pdf_text","source_observed_at":"2026-05-16T02:56:41.658658Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2306.13549"},"observation_digest":"sha256:3ac0b2ada7394b4a424e9ceb139f3b7903c47cf5ada8092469d9c017a5d62a1d","observation_id":"f8f02aaa-3ebb-4513-9d7e-91c6c0f7cc9a","resolution":{"observed_at":"2026-05-16T02:56:42.161866Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2307.06435","last_updated":"2024-10-17T01:10:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-12T20:01:52Z","title":"A Comprehensive Overview of Large Language Models","version":10},"reference_index":287,"source":"pdf_text","source_observed_at":"2026-05-19T20:28:38.900026Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2307.06435"},"observation_digest":"sha256:3be45d9a01bcbb0141767a534244669914920de0fc905f0cd07699797e4540fd","observation_id":"083c4f53-0000-4c38-a929-18411a8a6b66","resolution":{"observed_at":"2026-05-19T20:28:39.267291Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2308.05374","last_updated":"2024-03-21T00:21:14Z","snapshot_observed_at":"2026-08-02T17:09:20.540788Z","submitted_at":"2023-08-10T06:43:44Z","title":"Trustworthy LLMs: a Survey and Guideline for Evaluating Large Language Models' Alignment","version":2},"reference_index":139,"source":"pdf_text","source_observed_at":"2026-05-17T22:30:44.520703Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2308.05374"},"observation_digest":"sha256:2638986aa3ea6f9a9cac6ee250ab2343632109aa5f60f07f8a07e64be74fe2b8","observation_id":"a9abddba-d78d-4bfb-850b-d7883baf9c53","resolution":{"observed_at":"2026-05-17T22:30:44.981950Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2309.17421","last_updated":"2023-10-11T05:07:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:34:51Z","title":"The Dawn of LMMs: Preliminary Explorations with GPT-4V(ision)","version":2},"reference_index":151,"source":"pdf_text","source_observed_at":"2026-05-15T23:26:06.183574Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2309.17421"},"observation_digest":"sha256:4305f820fb5285805b13657bf8c336810c763da6b88f1c44966cbc7d78e34366","observation_id":"dc656a40-a271-46ae-9382-b2922349e537","resolution":{"observed_at":"2026-05-15T23:26:06.516043Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2407.08101","last_updated":"2026-04-14T18:39:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-11T00:10:45Z","title":"What to Say and When to Say it: Live Fitness Coaching as a Testbed for Situated Interaction","version":5},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-23T22:51:08.753650Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2407.08101"},"observation_digest":"sha256:0c3669079230998aaa60d3cf731a900d97ac064ade4e07e68ddcd1bbbb08ee58","observation_id":"8e663a4c-89fb-439e-b5ba-085ab1d1deba","resolution":{"observed_at":"2026-05-23T22:53:33.167426Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-07T19:45:19.527155Z","title":"Multimodal chain-of-thought reasoning in language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.14881","last_updated":"2025-02-14T08:42:43Z","snapshot_observed_at":"2026-08-07T22:02:21.919237Z","submitted_at":"2025-02-14T08:42:43Z","title":"A Survey of Safety on Large Vision-Language Models: Attacks, Defenses and Evaluations","version":1},"reference_index":114,"source":"pdf_text","source_observed_at":"2026-08-07T19:45:19.527155Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2502.14881"},"observation_digest":"sha256:c886b79f9e6d73ea14d1b609ffc92876ba61d6493836a538c1786f2073384d45","observation_id":"e63318ef-a83a-4e88-a6de-7f73570066bb","resolution":{"observed_at":"2026-08-07T19:45:19.527155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2503.12605","last_updated":"2025-03-23T13:47:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-16T18:39:13Z","title":"Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-15T17:18:52.996467Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2503.12605"},"observation_digest":"sha256:8bf6398de7c2020030e0e1f7244ef7f17756553f1e209d75126fa0c0c5b75d29","observation_id":"c8340945-5d4a-419d-8176-910feb651aff","resolution":{"observed_at":"2026-05-15T17:18:53.639892Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2503.17352","last_updated":"2025-11-11T08:13:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-21T17:52:43Z","title":"OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles","version":3},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-05-19T06:59:03.112252Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2503.17352"},"observation_digest":"sha256:71a293d88832123663b61be124749f637853db043922df9dd34ff8eedaa8d1c0","observation_id":"f9b98dac-ae3d-4953-9575-283b2a442322","resolution":{"observed_at":"2026-05-19T06:59:03.343413Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2503.21776","last_updated":"2025-10-22T16:42:24Z","snapshot_observed_at":"2026-08-05T07:15:29.998948Z","submitted_at":"2025-03-27T17:59:51Z","title":"Video-R1: Reinforcing Video Reasoning in MLLMs","version":4},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-12T09:43:00.208065Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2503.21776"},"observation_digest":"sha256:d1842bfc5dedeaf023314e3017546d852f35f52237451a19ace4209f1e5f087a","observation_id":"4969705c-1c80-4067-9738-0eda3b0caf0a","resolution":{"observed_at":"2026-05-12T18:12:27.664923Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2505.15879","last_updated":"2026-05-09T18:01:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:54:49Z","title":"GRIT: Teaching MLLMs to Think with Images","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-22T13:29:47.529564Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2505.15879"},"observation_digest":"sha256:b923174e65402aadb90239bf6db2ea4d8be4525a32b98ff9b9dd633645b28618","observation_id":"1637b3ad-0836-4ee4-a4e2-097fff7616fc","resolution":{"observed_at":"2026-05-22T13:31:36.128814Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-07T15:10:14.103607Z","title":"Mul- timodal chain-of-thought reasoning in language models.arXiv preprint arXiv:2302.00923, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16192","last_updated":"2025-05-30T06:35:34Z","snapshot_observed_at":"2026-08-08T00:05:10.110934Z","submitted_at":"2025-05-22T03:50:13Z","title":"VLM-R$^3$: Region Recognition, Reasoning, and Refinement for Enhanced Multimodal Chain-of-Thought","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:14.103607Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2505.16192"},"observation_digest":"sha256:3ffc4288b07dff0f79f0cac22034cdd1012fda7da79520be42e1fa07cff15bdf","observation_id":"44fa5f25-11c6-4fad-a0ca-ef63fd42e4b0","resolution":{"observed_at":"2026-08-07T15:10:14.103607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-07T15:01:34.320692Z","title":"Multimodal chain-of-thought reasoning in language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16673","last_updated":"2025-05-22T13:39:32Z","snapshot_observed_at":"2026-08-07T14:55:04.641472Z","submitted_at":"2025-05-22T13:39:32Z","title":"R1-ShareVL: Incentivizing Reasoning Capability of Multimodal Large Language Models via Share-GRPO","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T15:01:34.320692Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2505.16673"},"observation_digest":"sha256:291b898b8d4369a5edf5db4525fbe5c6111310ba74627ee0aeebe25932118171","observation_id":"b3ebe649-9063-43bb-8bc2-49d5d0425bc8","resolution":{"observed_at":"2026-08-07T15:01:34.320692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-07T14:52:05.094450Z","title":"Multimodal chain-of-thought reasoning in language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-08T12:19:36.067436Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:05.094450Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:8425fd6fb1bed54c9f638fa956192cb6bb8e9c0ef6027b632e0c55fc0f8d9b1c","observation_id":"47117c81-1b56-4a5b-aae9-9bfb30599547","resolution":{"observed_at":"2026-08-07T14:52:05.094450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-07T14:34:40.407245Z","title":"Multimodal chain-of-thought reasoning in language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18603","last_updated":"2026-05-26T15:30:09Z","snapshot_observed_at":"2026-08-07T14:26:48.340884Z","submitted_at":"2025-05-24T08:53:05Z","title":"Doc-CoB: Enhancing Document Understanding with Visual Chain-of-Boxes Reasoning","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-07T14:34:40.407245Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2505.18603"},"observation_digest":"sha256:e1f782388390edea353e463cd3f344d07d14127a74430962163a0b782c248b84","observation_id":"4015f0cd-d7cb-4dbd-a4eb-bc2c63181f95","resolution":{"observed_at":"2026-08-07T14:34:40.407245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-07T14:03:05.767363Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20124","last_updated":"2025-05-27T12:10:27Z","snapshot_observed_at":"2026-08-08T09:10:32.146078Z","submitted_at":"2025-05-26T15:24:06Z","title":"TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-07T14:03:05.767363Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2505.20124"},"observation_digest":"sha256:6ed8dce72e9c4b87828c842fd9c22d837ca417fe08e94473b3d31473cc229606","observation_id":"b0fcf885-c808-484a-984b-460da8e0881b","resolution":{"observed_at":"2026-08-07T14:03:05.767363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-07T14:02:56.990545Z","title":"Multimodal chain-of-thought reasoning in language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20223","last_updated":"2025-05-26T17:06:00Z","snapshot_observed_at":"2026-08-08T00:05:56.709460Z","submitted_at":"2025-05-26T17:06:00Z","title":"Chain-of-Thought for Autonomous Driving: A Comprehensive Survey and Future Prospects","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:56.990545Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2505.20223"},"observation_digest":"sha256:c78b8734a428b031f5417166cac4937a42b2b024a6eb772a039c86db4bbbf9c4","observation_id":"c8763ff9-10b6-4436-a687-abc1eb4f5234","resolution":{"observed_at":"2026-08-07T14:02:56.990545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2505.20816","last_updated":"2026-04-21T01:11:43Z","snapshot_observed_at":"2026-07-06T21:31:11.245854Z","submitted_at":"2025-05-27T07:23:38Z","title":"Rethinking Information Synthesis in Multimodal Question Answering A Multi-Agent Perspective","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-19T13:52:44.096262Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2505.20816"},"observation_digest":"sha256:70b0f4e5ac6ebdd8a6034a9356ae9b5805f23e0c1afac0b4c5955d50bb34b975","observation_id":"07e52310-e195-4dca-9353-8f18fd9fbb80","resolution":{"observed_at":"2026-05-19T13:53:05.648683Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-07T13:36:02.479679Z","title":"Multimodal chain-of-thought reasoning in language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21327","last_updated":"2025-05-27T15:23:23Z","snapshot_observed_at":"2026-08-08T22:42:35.699276Z","submitted_at":"2025-05-27T15:23:23Z","title":"MME-Reasoning: A Comprehensive Benchmark for Logical Reasoning in MLLMs","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-07T13:36:02.479679Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2505.21327"},"observation_digest":"sha256:dc336ec50864a37f8cc973bbd5bc53a25fad80df292e1cea4059080da5ad543f","observation_id":"7da7d4b6-a65a-4f5f-bb94-304753048f66","resolution":{"observed_at":"2026-08-07T13:36:02.479679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-07T13:22:26.520134Z","title":"Multimodal chain-of-thought reasoning in language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-07T13:13:59.147933Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:26.520134Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:70c841d6f63ed3016b0660bdc09a9f526ad2c4b5394f80d212fb8c7700f9d47b","observation_id":"ba02ac77-4754-4ff3-8aeb-e459fef570f7","resolution":{"observed_at":"2026-08-07T13:22:26.520134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-07T13:09:53.466958Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22525","last_updated":"2025-05-28T16:12:45Z","snapshot_observed_at":"2026-08-07T13:02:39.708613Z","submitted_at":"2025-05-28T16:12:45Z","title":"Thinking with Generated Images","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:53.466958Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2505.22525"},"observation_digest":"sha256:bf6df53a4967c1f6346d1dd2379d98a1501b7e6d206951abb76cde3aab1c56a1","observation_id":"b00aa88c-d384-4217-a29a-941e95e67d16","resolution":{"observed_at":"2026-08-07T13:09:53.466958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-07T12:54:27.034519Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23272","last_updated":"2025-05-30T14:14:00Z","snapshot_observed_at":"2026-08-07T12:46:34.936963Z","submitted_at":"2025-05-29T09:20:12Z","title":"Are MLMs Trapped in the Visual Room?","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:27.034519Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2505.23272"},"observation_digest":"sha256:863e52016996b6a67cb11e5bd0b984fc71d8eba03db325b03da8a63d0623248c","observation_id":"9279b93b-17e7-469f-a099-4376b71c4232","resolution":{"observed_at":"2026-08-07T12:54:27.034519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2505.23678","last_updated":"2026-05-15T17:27:46Z","snapshot_observed_at":"2026-08-02T04:30:21.704758Z","submitted_at":"2025-05-29T17:20:26Z","title":"Grounded Reinforcement Learning for Visual Reasoning","version":3},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-05-22T01:05:18.801388Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2505.23678"},"observation_digest":"sha256:ab85627a38004e833902f546779ed1a18325cad8d1d608882d25fc09d9bd0044","observation_id":"a3f638c1-0a06-4065-af59-2a2ccfebf95b","resolution":{"observed_at":"2026-05-22T01:05:52.179893Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-07T12:42:28.172520Z","title":"Multimodal chain-of- thought reasoning in language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-08T00:05:10.710300Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":112,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:28.172520Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:951a7eeabd1f4647feb57ffd1d1630c1d23130601773d9e6b9fce3d877384842","observation_id":"7ad3e96f-f3ab-4080-9149-e5242db7cdc5","resolution":{"observed_at":"2026-08-07T12:42:28.172520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-07T12:02:10.670667Z","title":"Karypis, and Alexander J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00806","last_updated":"2025-06-01T03:15:29Z","snapshot_observed_at":"2026-08-08T08:30:56.026575Z","submitted_at":"2025-06-01T03:15:29Z","title":"Fast or Slow? Integrating Fast Intuition and Deliberate Thinking for Enhancing Visual Question Answering","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T12:02:10.670667Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2506.00806"},"observation_digest":"sha256:5542352e4c51fb46af8f755ab529214736f206b301a20644df5a3f1bc73df68a","observation_id":"8a1b897e-7d41-43f7-8b74-ee6c45709c95","resolution":{"observed_at":"2026-08-07T12:02:10.670667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-07T11:55:14.744601Z","title":"Multimodal chain-of-thought reasoning in language models.arXiv preprint arXiv:2302.00923, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:14.744601Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:5783ee79078485c8716d16fe3a14a7201524900d67e4d30a598c1180428419a9","observation_id":"5e94eb29-f3b2-481f-9344-cd4227812f63","resolution":{"observed_at":"2026-08-07T11:55:14.744601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-07T11:05:19.790349Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-07T21:26:08.023036Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.790349Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:1b71d961b2b7895092294212aff69035b3731c4e0c25baa7a3c5df6735407a71","observation_id":"48a225fb-5b1d-4cf3-8168-4a210622fcce","resolution":{"observed_at":"2026-08-07T11:05:19.790349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2506.04565","last_updated":"2026-05-08T15:50:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-05T02:34:43Z","title":"From Standalone LLMs to Integrated Intelligence: A Survey of Compound Al Systems","version":2},"reference_index":227,"source":"pdf_text","source_observed_at":"2026-05-19T11:49:36.574471Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2506.04565"},"observation_digest":"sha256:f61f6130de6720ca1a2a6277a0e2f121ad591b893193a2aab75519c378d0103d","observation_id":"5ebbdf54-4206-4f77-9901-8ee38e4e3326","resolution":{"observed_at":"2026-05-19T11:52:16.454085Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-07T10:28:54.760061Z","title":"Mul- timodal chain-of-thought reasoning in language models.arXiv preprint arXiv:2302.00923, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05331","last_updated":"2025-06-05T17:59:02Z","snapshot_observed_at":"2026-08-09T02:08:19.234840Z","submitted_at":"2025-06-05T17:59:02Z","title":"MINT-CoT: Enabling Interleaved Visual Tokens in Mathematical Chain-of-Thought Reasoning","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:54.760061Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2506.05331"},"observation_digest":"sha256:17336236a9fcec7bfb70f6dbee0c1c375a497d574f71f80509871df0f6a284d4","observation_id":"36d4ec69-ae2b-41ae-99ab-a8253b6602a5","resolution":{"observed_at":"2026-08-07T10:28:54.760061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-07T05:37:02.608167Z","title":"Zhang, A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07501","last_updated":"2025-06-09T07:26:47Z","snapshot_observed_at":"2026-08-08T15:49:09.305772Z","submitted_at":"2025-06-09T07:26:47Z","title":"Graph-of-Causal Evolution: Challenging Chain-of-Model for Reasoning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:02.608167Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2506.07501"},"observation_digest":"sha256:43707066b8c604aa1d5ba3bdda039d7097feec096046bf2d863612d519184466","observation_id":"6c408dae-9419-45a2-9711-7791ca903d3b","resolution":{"observed_at":"2026-08-07T05:37:02.608167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-07T05:27:05.050109Z","title":"Mul- timodal chain-of-thought reasoning in language models.arXiv preprint arXiv:2302.00923, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.050109Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:f66f0e21895b984f311b2fee0d5217131ccfa5f1581420348e0afecc608ad0a5","observation_id":"373b2e0a-d748-48a8-967e-69b399de2ec1","resolution":{"observed_at":"2026-08-07T05:27:05.050109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-07T05:09:23.620651Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08691","last_updated":"2025-06-10T11:02:36Z","snapshot_observed_at":"2026-08-08T00:05:08.877544Z","submitted_at":"2025-06-10T11:02:36Z","title":"VReST: Enhancing Reasoning in Large Vision-Language Models through Tree Search and Self-Reward Mechanism","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T05:09:23.620651Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2506.08691"},"observation_digest":"sha256:e40510e4c857fb6efbf1e4c92483f5cdfdce5509d46602844f1295ae4635a0cd","observation_id":"133a0312-fd14-48e7-a0bb-71019c467bc8","resolution":{"observed_at":"2026-08-07T05:09:23.620651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-07T05:05:52.403000Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-07T04:59:07.065080Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:52.403000Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:0f6e8cb9d593c57cf6db0d1ceaf6e143bce438a51ab9cb8c526fbc2983394252","observation_id":"13dd506a-9ce8-4054-af5f-43844a6ab1c3","resolution":{"observed_at":"2026-08-07T05:05:52.403000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-07T15:26:52.535108Z","title":"Multimodal chain-of-thought reasoning in language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11040","last_updated":"2025-05-21T04:45:11Z","snapshot_observed_at":"2026-08-07T22:34:12.973486Z","submitted_at":"2025-05-21T04:45:11Z","title":"Large Language models for Time Series Analysis: Techniques, Applications, and Challenges","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:52.535108Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2506.11040"},"observation_digest":"sha256:00770a9a451352e7bff5fa941912319e27ddaf900b16f3d3a99395b249289365","observation_id":"3662b8f8-acfc-4c21-810b-20756e58c665","resolution":{"observed_at":"2026-08-07T15:26:52.535108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-07T00:57:13.795355Z","title":"doi: 10.18653/v1/2024.acl-long.773","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12430","last_updated":"2025-07-11T02:01:54Z","snapshot_observed_at":"2026-08-07T08:27:10.239745Z","submitted_at":"2025-06-14T10:03:17Z","title":"Pushing the Limits of Safety: A Technical Report on the ATLAS Challenge 2025","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T00:57:13.795355Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2506.12430"},"observation_digest":"sha256:c0bc2b1a7edd941fb0df2193cbad27a2fcd08d0f2db75fb2f476e12c8e5d4d73","observation_id":"52a76e6f-afc4-4d0e-84de-11b6b2635d1d","resolution":{"observed_at":"2026-08-07T00:57:13.795355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-07T00:40:37.239483Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13045","last_updated":"2025-08-24T10:01:04Z","snapshot_observed_at":"2026-08-08T06:33:39.031465Z","submitted_at":"2025-06-16T02:27:25Z","title":"Continual Learning for Generative AI: From LLMs to MLLMs and Beyond","version":4},"reference_index":253,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:37.239483Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2506.13045"},"observation_digest":"sha256:98cfb8146fd733314e2704ee1efb71433e63fbc591a9b4a6d1a086d663a5401c","observation_id":"2dca750e-d06e-4844-9e73-de662e458a8d","resolution":{"observed_at":"2026-08-07T00:40:37.239483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-07T00:39:52.632806Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13192","last_updated":"2025-06-16T07:59:51Z","snapshot_observed_at":"2026-08-08T06:58:18.253592Z","submitted_at":"2025-06-16T07:59:51Z","title":"Breaking Thought Patterns: A Multi-Dimensional Reasoning Framework for LLMs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:52.632806Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2506.13192"},"observation_digest":"sha256:d56f26054090b32732162eca9c34ba683e69af8b019bc617f36c0b8e2add0722","observation_id":"e541fac0-dd6d-4160-996c-78d7825e2d88","resolution":{"observed_at":"2026-08-07T00:39:52.632806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-07T11:19:05.501316Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14805","last_updated":"2025-08-12T17:07:53Z","snapshot_observed_at":"2026-08-08T00:05:33.094743Z","submitted_at":"2025-06-03T13:44:14Z","title":"Argus Inspection: Do Multimodal Large Language Models Possess the Eye of Panoptes?","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T11:19:05.501316Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2506.14805"},"observation_digest":"sha256:2c4f08eae897bd39761bbe164f3962a5a4c23dc5888a3b72ffef40c337f639cb","observation_id":"674066e8-842b-4f03-b0c8-b0e1c546067d","resolution":{"observed_at":"2026-08-07T11:19:05.501316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-07T04:09:01.775920Z","title":"Mul- timodal chain-of-thought reasoning in language models.arXiv preprint arXiv:2302.00923, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14827","last_updated":"2025-06-13T13:39:53Z","snapshot_observed_at":"2026-08-08T00:05:12.029484Z","submitted_at":"2025-06-13T13:39:53Z","title":"DAVID-XR1: Detecting AI-Generated Videos with Explainable Reasoning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T04:09:01.775920Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2506.14827"},"observation_digest":"sha256:ed153da7624b5f68e45e8de06b70451f0d2924c8e7316da3ce28f33191a4951f","observation_id":"3dcc9428-0220-4ea6-a573-9c642f348207","resolution":{"observed_at":"2026-08-07T04:09:01.775920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2506.16796","last_updated":"2026-04-13T02:17:17Z","snapshot_observed_at":"2026-07-30T08:45:44.946546Z","submitted_at":"2025-06-20T07:21:21Z","title":"RealSR-R1: Reinforcement Learning for Real-World Image Super-Resolution with Vision-Language Chain-of-Thought","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-19T08:32:20.566798Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2506.16796"},"observation_digest":"sha256:af5fef8110409028022d865c58b67491122fd371adbb193627a15afa3790f4ce","observation_id":"cef7b16d-aaeb-4dea-a7b8-18deed2c501b","resolution":{"observed_at":"2026-05-19T08:33:02.089330Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-06T23:27:19.364377Z","title":"Mul- timodal chain-of-thought reasoning in language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-07T09:17:13.426784Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.364377Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:c1f2d2b5504a8f9381b7a5fac18d29d782cccd62479713364ebf25e43198fb77","observation_id":"df92342c-82be-4b17-ab21-c721e7ac7c18","resolution":{"observed_at":"2026-08-06T23:27:19.364377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-06T23:12:13.597717Z","title":"(2024, May 20).Multimodal chain-of-thought rea- soning in language models.arXiv:2302.00923v5 [cs.CL]","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19599","last_updated":"2025-06-24T13:09:53Z","snapshot_observed_at":"2026-08-06T23:04:21.804814Z","submitted_at":"2025-06-24T13:09:53Z","title":"ECCoT: A Framework for Enhancing Effective Cognition via Chain of Thought in Large Language Model","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:13.597717Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2506.19599"},"observation_digest":"sha256:50b08ce7f396c32bab161f63256c561c172aef1781b31922d68cb5a389c2b772","observation_id":"dfcbac5d-2cfb-4fe5-93cb-f41d8aa0b5e6","resolution":{"observed_at":"2026-08-06T23:12:13.597717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-06T23:11:47.453315Z","title":"arXiv preprint arXiv:2302.00923 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19610","last_updated":"2025-06-27T08:04:32Z","snapshot_observed_at":"2026-08-09T00:48:04.792100Z","submitted_at":"2025-06-24T13:23:25Z","title":"V2T-CoT: From Vision to Text Chain-of-Thought for Medical Reasoning and Diagnosis","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:47.453315Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2506.19610"},"observation_digest":"sha256:1d098ed906dc3246dc9a59a30dd7b3f46480be858a441324fd0c25a6a61ed92b","observation_id":"90270684-ff5a-4647-bdab-e290706fab79","resolution":{"observed_at":"2026-08-06T23:11:47.453315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-06T22:22:37.620896Z","title":"Multimodal chain-of-thought reasoning in language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21863","last_updated":"2025-06-27T02:31:37Z","snapshot_observed_at":"2026-08-07T01:10:13.747886Z","submitted_at":"2025-06-27T02:31:37Z","title":"Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:37.620896Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2506.21863"},"observation_digest":"sha256:b11433ec19392c599c361dc602f958c9f04c3b227e1b964b84c191d727b1ec2b","observation_id":"3b8029ff-bebd-4799-878e-2bc272449bc2","resolution":{"observed_at":"2026-08-06T22:22:37.620896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-06T20:25:20.890778Z","title":"Multimodal chain-of-thought reasoning in language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02804","last_updated":"2026-06-28T12:40:31Z","snapshot_observed_at":"2026-08-08T16:13:23.244408Z","submitted_at":"2025-07-03T17:07:20Z","title":"Multimodal Mathematical Reasoning with Diverse Solving Perspective","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:20.890778Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2507.02804"},"observation_digest":"sha256:450e231ff210f036598ffd320dd649993c971dd6d155b5b4af154781ec514918","observation_id":"91da92d8-23a0-41e2-947d-7e120d2fdbd1","resolution":{"observed_at":"2026-08-06T20:25:20.890778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-06T21:19:35.695869Z","title":"arXiv preprint arXiv:2302.00923 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02984","last_updated":"2025-07-28T05:53:50Z","snapshot_observed_at":"2026-08-07T08:32:24.456726Z","submitted_at":"2025-07-01T08:24:51Z","title":"From Answers to Rationales: Self-Aligning Multimodal Reasoning with Answer-Oriented Chain-of-Thought","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:35.695869Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2507.02984"},"observation_digest":"sha256:0b1def0d117931fee39a4fc03c5672c419ec52c009a1aad7980a30315eb51155","observation_id":"d64192ec-5a48-479b-98c3-4c1ae57b6b90","resolution":{"observed_at":"2026-08-06T21:19:35.695869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-06T18:19:58.893076Z","title":"Zhang, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08664","last_updated":"2025-07-11T15:03:17Z","snapshot_observed_at":"2026-08-07T13:51:35.756452Z","submitted_at":"2025-07-11T15:03:17Z","title":"Introspection of Thought Helps AI Agents","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:58.893076Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2507.08664"},"observation_digest":"sha256:ff394bdc62c0cc30897649a519ebb4a7df13955e4655c9ba3ba539879410ad78","observation_id":"8c8a3027-fe41-4a9e-93a3-893590608b0a","resolution":{"observed_at":"2026-08-06T18:19:58.893076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-06T16:42:42.893099Z","title":"Zhang, A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12761","last_updated":"2025-07-17T03:33:46Z","snapshot_observed_at":"2026-08-07T20:51:13.041685Z","submitted_at":"2025-07-17T03:33:46Z","title":"Think-Before-Draw: Decomposing Emotion Semantics & Fine-Grained Controllable Expressive Talking Head Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T16:42:42.893099Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2507.12761"},"observation_digest":"sha256:2b4f8f54936ee17bf1cf456f93035c8e7c10e2c5a0f595537041a026155baa1e","observation_id":"e766ee2a-fc74-468b-beb6-2c0f3d296603","resolution":{"observed_at":"2026-08-06T16:42:42.893099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-06T13:23:35.914280Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20766","last_updated":"2025-08-07T09:53:15Z","snapshot_observed_at":"2026-08-07T01:11:37.463830Z","submitted_at":"2025-07-28T12:21:19Z","title":"Learning Only with Images: Visual Reinforcement Learning with Reasoning, Rendering, and Visual Feedback","version":4},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-06T13:23:35.914280Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2507.20766"},"observation_digest":"sha256:8fc2e788c143c9847e1077243dbd09030506200cfabcd44c78ee057925f9c9b8","observation_id":"d653de49-8eae-4efb-a3c9-30ff8af79890","resolution":{"observed_at":"2026-08-06T13:23:35.914280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-06T12:39:42.154856Z","title":"Prompt, generate, then cache: Cascade of foundation models makes strong few-shot learners","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21589","last_updated":"2025-07-29T08:43:16Z","snapshot_observed_at":"2026-08-07T04:25:49.997139Z","submitted_at":"2025-07-29T08:43:16Z","title":"Exploring the Link Between Bayesian Inference and Embodied Intelligence: Toward Open Physical-World Embodied AI Systems","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T12:39:42.154856Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2507.21589"},"observation_digest":"sha256:a76c5d900a31ad4792b21e6257f387a2aae9363ccf20b34a06527b04d2e38882","observation_id":"353e4f03-3de5-4d82-bf48-55b87652f79b","resolution":{"observed_at":"2026-08-06T12:39:42.154856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2508.09547","last_updated":"2026-04-29T01:36:59Z","snapshot_observed_at":"2026-07-06T22:12:12.166886Z","submitted_at":"2025-08-13T07:05:17Z","title":"GoViG: Goal-Conditioned Visual Navigation Instruction Generation via Multimodal Reasoning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-18T23:02:14.913189Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2508.09547"},"observation_digest":"sha256:76761178b1fe6688cda9f85874ed703985aba6b60d2c93d1459c33cc03bc4163","observation_id":"d760e15b-049d-4cd4-8727-49c584108094","resolution":{"observed_at":"2026-05-18T23:02:52.657037Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T16:51:04.957340Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.17718","last_updated":"2025-08-25T06:51:15Z","snapshot_observed_at":"2026-08-08T15:40:25.468882Z","submitted_at":"2025-08-25T06:51:15Z","title":"Instant Preference Alignment for Text-to-Image Diffusion Models","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-05T16:51:04.957340Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2508.17718"},"observation_digest":"sha256:ed9fbda9727689da6b2fe1a72a9af39c360a85400088db97afc3d8b8e83bd22a","observation_id":"7c7ae754-a36f-4a23-8fd3-bcf7d831a020","resolution":{"observed_at":"2026-08-05T16:51:04.957340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T16:17:37.994242Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.18772","last_updated":"2025-08-26T07:55:46Z","snapshot_observed_at":"2026-08-07T08:24:33.804357Z","submitted_at":"2025-08-26T07:55:46Z","title":"Beyond the Textual: Generating Coherent Visual Options for MCQs","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-05T16:17:37.994242Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2508.18772"},"observation_digest":"sha256:cd1c0e96c693c46a562c02ccef2bd1b82a5cecf0608368af1857469cfd1db84d","observation_id":"49e17bd7-3278-408f-ac68-8555d4081583","resolution":{"observed_at":"2026-08-05T16:17:37.994242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2508.21720","last_updated":"2026-06-17T04:32:48Z","snapshot_observed_at":"2026-08-05T14:02:48.680783Z","submitted_at":"2025-08-29T15:36:06Z","title":"PosterForest: Hierarchical Multi-Agent Collaboration for Scientific Poster Generation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-18T20:22:03.697564Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2508.21720"},"observation_digest":"sha256:1e2630002b2030cd0535e62ef7c321d4e5866831624e85235323bcc57e828351","observation_id":"f12eb1c8-495a-418e-b7ac-a83a24d06c18","resolution":{"observed_at":"2026-05-18T20:22:50.786017Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T14:02:50.738468Z","title":"arXiv preprint arXiv:2302.00923","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.21720","last_updated":"2026-06-17T04:32:48Z","snapshot_observed_at":"2026-08-05T14:02:48.680783Z","submitted_at":"2025-08-29T15:36:06Z","title":"PosterForest: Hierarchical Multi-Agent Collaboration for Scientific Poster Generation","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T14:02:50.738468Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2508.21720"},"observation_digest":"sha256:fad752bd12341962a36cc71ac63f44a119be4bafaca05289a487a4811b42d325","observation_id":"bed337f0-7045-4cf1-812a-7404b80d7d3a","resolution":{"observed_at":"2026-08-05T14:02:50.738468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":221,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:fb50e18e728b4722bfd33fb3d98e89047bcfd3553ad84bc24420133f91de01b3","observation_id":"b3b56c74-004b-42ff-9712-d07230ee392a","resolution":{"observed_at":"2026-05-18T19:21:48.502694Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2509.04123","last_updated":"2026-04-11T07:57:17Z","snapshot_observed_at":"2026-07-06T22:23:59.676849Z","submitted_at":"2025-09-04T11:37:06Z","title":"TaleDiffusion: Multi-Character Story Generation with Dialogue Rendering","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-18T19:02:01.962726Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2509.04123"},"observation_digest":"sha256:ff0dec7fef63f40c21f550e1c042ac0fbd6a31ac7958812e3fe0ded3496bc3d1","observation_id":"404ae37e-9036-44d2-bbbf-d0cd38a23689","resolution":{"observed_at":"2026-05-18T19:02:48.699721Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T12:06:04.601125Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.04502","last_updated":"2025-09-02T04:49:51Z","snapshot_observed_at":"2026-08-05T12:05:59.668745Z","submitted_at":"2025-09-02T04:49:51Z","title":"VaccineRAG: Boosting Multimodal Large Language Models' Immunity to Harmful RAG Samples","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-05T12:06:04.601125Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2509.04502"},"observation_digest":"sha256:4448cf6d064ef57f4815fc89c3e0c521d1d49a9ad5e39f7e833d30935b504cb4","observation_id":"08d127c0-8ffe-468d-a1e3-8b43d1295ee4","resolution":{"observed_at":"2026-08-05T12:06:04.601125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T05:34:40.404905Z","title":"Zhang, A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.05226","last_updated":"2025-09-05T16:40:13Z","snapshot_observed_at":"2026-08-06T03:16:59.543245Z","submitted_at":"2025-09-05T16:40:13Z","title":"Less is More Tokens: Efficient Math Reasoning via Difficulty-Aware Chain-of-Thought Distillation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-05T05:34:40.404905Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2509.05226"},"observation_digest":"sha256:78ecd191d77b2329a25ef9123d25c27a29da652824122fbd6ec1979a0a19dbd6","observation_id":"b5d984ed-8311-487e-89d2-a0f09c327f24","resolution":{"observed_at":"2026-08-05T05:34:40.404905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-04T22:33:30.357545Z","title":"Multimodal chain-of-thought reasoning in language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.07287","last_updated":"2025-09-08T23:44:00Z","snapshot_observed_at":"2026-08-06T22:54:10.353309Z","submitted_at":"2025-09-08T23:44:00Z","title":"Paladin: Defending LLM-enabled Phishing Emails with a New Trigger-Tag Paradigm","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-04T22:33:30.357545Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2509.07287"},"observation_digest":"sha256:d9809571d248406d904edc9e67eeee41dfa6d76702dcbdb3aa954953d1b08b0f","observation_id":"fd290b6e-04a7-40ac-837a-f2d139744a8c","resolution":{"observed_at":"2026-08-04T22:33:30.357545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-04T19:27:21.029581Z","title":"Mul- timodal chain-of-thought reasoning in language models.arXiv preprint arXiv:2302.00923, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09286","last_updated":"2025-09-11T09:22:16Z","snapshot_observed_at":"2026-08-08T05:44:51.958215Z","submitted_at":"2025-09-11T09:22:16Z","title":"Visual Programmability: A Guide for Code-as-Thought in Chart Understanding","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-04T19:27:21.029581Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2509.09286"},"observation_digest":"sha256:285fe90a21d0e807a2aa4d79e7237cc16e23fcfb94a56692231ddb5041dab933","observation_id":"b99f0ba0-d221-4aeb-8735-b58887b3660c","resolution":{"observed_at":"2026-08-04T19:27:21.029581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2509.10026","last_updated":"2026-04-14T03:34:18Z","snapshot_observed_at":"2026-07-06T22:29:06.119014Z","submitted_at":"2025-09-12T07:45:44Z","title":"LaV-CoT: Language-Aware Visual CoT with Multi-Aspect Reward Optimization for Real-World Multilingual VQA","version":4},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-18T17:53:08.136677Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2509.10026"},"observation_digest":"sha256:b5bc547d86f629ec8429b89d124c6222c3684d2c06d2a896b848ef28ff54f21c","observation_id":"10edc72e-370e-48c3-a010-ed41b3df0c99","resolution":{"observed_at":"2026-05-18T17:56:42.215334Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2509.23322","last_updated":"2026-04-09T10:37:26Z","snapshot_observed_at":"2026-08-02T12:34:37.611019Z","submitted_at":"2025-09-27T14:13:41Z","title":"Mitigating Visual Context Degradation in Large Multimodal Models: A Training-Free Decoupled Agentic Framework","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-05-18T12:31:25.257879Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2509.23322"},"observation_digest":"sha256:200718ffcc4d2b40beffdb41c0aae9cbcdbc5e3392528a30635ab7c28fff0943","observation_id":"f569ab2b-1434-4ef7-a2e8-4cb778f39a6e","resolution":{"observed_at":"2026-05-18T12:32:36.326769Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2509.24251","last_updated":"2025-10-05T04:01:18Z","snapshot_observed_at":"2026-07-06T22:31:00.843452Z","submitted_at":"2025-09-29T03:52:01Z","title":"Latent Visual Reasoning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-15T18:41:30.307521Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2509.24251"},"observation_digest":"sha256:eb9ae68e3f1cbea8f791a1b114b8be16b2f2eb6ce70d55b67c1c1ce92f9ddc64","observation_id":"acacc8a5-596d-4c7b-9904-daf4fc61de55","resolution":{"observed_at":"2026-05-15T18:41:30.484640Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2509.25699","last_updated":"2026-07-21T17:19:46Z","snapshot_observed_at":"2026-08-04T13:42:58.327870Z","submitted_at":"2025-09-30T02:57:44Z","title":"AIM-CoT: Active Information-driven Multimodal Chain-of-Thought for Vision-Language Reasoning","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-18T13:30:10.620448Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2509.25699"},"observation_digest":"sha256:390222cbfdbde122b85f216c8dbf25e8ec250a9d56ec98a235bf050cab70ea1b","observation_id":"a02e3b88-324c-4d34-a2a8-06494d1fc7f0","resolution":{"observed_at":"2026-05-18T13:31:24.813779Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-04T13:43:00.973423Z","title":"Multimodal chain-of-thought reasoning in language models.arXiv preprint arXiv:2302.00923,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.25699","last_updated":"2026-07-21T17:19:46Z","snapshot_observed_at":"2026-08-04T13:42:58.327870Z","submitted_at":"2025-09-30T02:57:44Z","title":"AIM-CoT: Active Information-driven Multimodal Chain-of-Thought for Vision-Language Reasoning","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T13:43:00.973423Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2509.25699"},"observation_digest":"sha256:c3a9e7e37b858e9aa930cf24a15b0061f519aacac729888774d1aed26eb1c169","observation_id":"966e5e11-9439-4d79-9afa-1a7c4ef1f8f2","resolution":{"observed_at":"2026-08-04T13:43:00.973423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-04T11:26:06.881567Z","title":"Multimodal Chain -of- Thought Reasoning in Language Models , May 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.04704","last_updated":"2026-05-28T12:47:58Z","snapshot_observed_at":"2026-08-04T11:25:51.992516Z","submitted_at":"2025-10-06T11:17:56Z","title":"AtomWorld: A Benchmark for Evaluating Spatial Reasoning in Large Language Models on Crystalline Materials","version":4},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-04T11:26:06.881567Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2510.04704"},"observation_digest":"sha256:b05e488190ba11b155b82b0a5cdabbede5eba14051f79ac7cb06f53315e06758","observation_id":"a1146530-2b00-4072-87af-e1c387abf8e9","resolution":{"observed_at":"2026-08-04T11:26:06.881567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2510.08945","last_updated":"2026-05-21T22:37:46Z","snapshot_observed_at":"2026-07-06T22:32:17.816175Z","submitted_at":"2025-10-10T02:51:47Z","title":"FATHOMS-RAG: A Framework for the Assessment of Thinking and Observation in Multimodal Systems that use Retrieval Augmented Generation","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-25T08:13:05.328746Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2510.08945"},"observation_digest":"sha256:9e7acdb16de0991ae8e22f27b21ca6df92230e1b175a003c8ce3484647ce0955","observation_id":"fbb8b3e7-44e2-463f-b63b-96bff2c815aa","resolution":{"observed_at":"2026-05-25T08:15:33.896676Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-04T07:54:08.862155Z","title":"Multimodal chain-of-thought reasoning in language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.23509","last_updated":"2026-07-18T06:00:54Z","snapshot_observed_at":"2026-08-04T07:54:06.302346Z","submitted_at":"2025-10-27T16:47:15Z","title":"Logic-Guided Socially-aware Robot Navigation World Model","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T07:54:08.862155Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2510.23509"},"observation_digest":"sha256:bf7c217e568290acd905f527af9dcc82be73f545190bf98dfed0d2487e92b193","observation_id":"7fa3ef87-aebe-42b7-9771-3b3e10d9fd4d","resolution":{"observed_at":"2026-08-04T07:54:08.862155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2511.04570","last_updated":"2026-04-07T09:55:11Z","snapshot_observed_at":"2026-07-30T01:17:08.732833Z","submitted_at":"2025-11-06T17:25:23Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-18T00:54:24.641649Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2511.04570"},"observation_digest":"sha256:37c09785db909251df1247ddf03fae855310a8a8fb77c5740a7a71ebc0f16397","observation_id":"95dbf2cf-d48c-4ec7-bdbc-ebde4de5fcc8","resolution":{"observed_at":"2026-05-18T00:55:35.066474Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-03T19:04:29.050993Z","title":"Multimodal chain-of-thought rea- soning in language models.arXiv preprint arXiv:2302.00923,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.02456","last_updated":"2026-06-29T04:23:52Z","snapshot_observed_at":"2026-08-07T22:33:32.154553Z","submitted_at":"2025-12-02T06:30:10Z","title":"See, Think, Learn: A Self-Taught Multimodal Reasoner","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T19:04:29.050993Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2512.02456"},"observation_digest":"sha256:5b17f1e104698754260a09940967d2c63a342a01008b8bc6763649bd7183576a","observation_id":"896da98d-637d-49c1-963f-0bdd2193e065","resolution":{"observed_at":"2026-08-03T19:04:29.050993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2512.03043","last_updated":"2026-04-28T12:07:36Z","snapshot_observed_at":"2026-08-02T09:59:18.546374Z","submitted_at":"2025-12-02T18:59:52Z","title":"OneThinker: All-in-one Reasoning Model for Image and Video","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-17T02:09:39.820651Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2512.03043"},"observation_digest":"sha256:ac05b38af42140e2fd9876e6331ae076a2c5b6013f6047e406284622e7a442b0","observation_id":"f9d79ef7-388b-474a-8279-1dbab18537fe","resolution":{"observed_at":"2026-05-17T02:11:26.653988Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-05T23:09:55.506505Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-17T03:09:31.161760Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:bbb464d61ef448100514bc72b9a359e3fbc928e11d76abd98e8e8fa976f77feb","observation_id":"28a8e559-bec1-457c-8adf-692dc8754528","resolution":{"observed_at":"2026-05-17T03:11:29.850303Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-03T18:51:49.421484Z","title":"Multimodal chain-of- thought reasoning in language models.arXiv preprint arXiv:2302.00923, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-05T23:09:55.506505Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:49.421484Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:a76e81a4975925bd9f09447afa02c6fd4f1566ffeb632af963f4821e06ffac87","observation_id":"ad87133e-003b-4ec7-921c-3fec66bddc16","resolution":{"observed_at":"2026-08-03T18:51:49.421484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2512.12623","last_updated":"2026-04-09T15:39:45Z","snapshot_observed_at":"2026-07-06T22:38:59.725645Z","submitted_at":"2025-12-14T10:07:45Z","title":"Reasoning Within the Mind: Dynamic Multimodal Interleaving in Latent Space","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-16T23:02:28.588225Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2512.12623"},"observation_digest":"sha256:b4122de6cce06b3dc4b8e7392d045ac41c8862384dfcb790295d53921fd48aac","observation_id":"52cad193-c475-4773-909f-2c9223e7d384","resolution":{"observed_at":"2026-05-16T23:03:38.874678Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2602.11731","last_updated":"2026-04-29T01:08:35Z","snapshot_observed_at":"2026-08-07T03:47:17.716581Z","submitted_at":"2026-02-12T08:54:02Z","title":"Thinking with Drafting: Optical Decompression via Logical Reconstruction","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-16T03:28:32.264246Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2602.11731"},"observation_digest":"sha256:35cac71060d9997fd836d274b30f48a79ffef5d49454804f786e7e7088caa4cc","observation_id":"875f1f99-90de-4a37-a7fe-5b2f3508d4f9","resolution":{"observed_at":"2026-05-16T03:30:32.904559Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-02T19:58:29.065846Z","title":"Multimodal chain-of- thought reasoning in language models.arXiv preprint arXiv:2302.00923, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.00461","last_updated":"2026-06-10T06:57:00Z","snapshot_observed_at":"2026-08-05T02:58:46.928689Z","submitted_at":"2026-02-28T04:42:34Z","title":"ReMoT: Reinforcement Learning with Motion Contrast Triplets","version":3},"reference_index":124,"source":"pdf_text","source_observed_at":"2026-08-02T19:58:29.065846Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2603.00461"},"observation_digest":"sha256:7ebd38b7cdfa2c773300e01b1f2e001c5ccfa25f0407c128001fbbce3741d859","observation_id":"cf8729e9-749d-462b-b1be-58fc8eed83dd","resolution":{"observed_at":"2026-08-02T19:58:29.065846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-02T17:26:40.248532Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.25629","last_updated":"2026-07-26T21:57:04Z","snapshot_observed_at":"2026-08-05T15:21:17.681677Z","submitted_at":"2026-03-26T16:41:59Z","title":"LanteRn: Latent Visual Structured Reasoning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T17:26:40.248532Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2603.25629"},"observation_digest":"sha256:601c304722a85dacfa5f7d85d3cc02e83f089ff41e1167d757d0367f76123cd7","observation_id":"dcc206f7-9f28-4832-923d-3791a8b20e3d","resolution":{"observed_at":"2026-08-02T17:26:40.248532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2604.00013","last_updated":"2026-04-12T03:30:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-10T12:48:41Z","title":"C2F-Thinker: Coarse-to-Fine Reasoning with Hint-Guided Reinforcement Learning for Multimodal Sentiment Analysis","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-15T13:51:40.334057Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2604.00013"},"observation_digest":"sha256:a33341cfee2a659b11da7dc47f08952fdaec932994c5db96f02719c842902657","observation_id":"444c27a7-b7a1-4af7-bbf6-1f567d200795","resolution":{"observed_at":"2026-05-15T13:55:53.312853Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2604.04017","last_updated":"2026-04-05T08:29:52Z","snapshot_observed_at":"2026-07-06T22:53:06.517678Z","submitted_at":"2026-04-05T08:29:52Z","title":"GeoBrowse: A Geolocation Benchmark for Agentic Tool Use with Expert-Annotated Reasoning Traces","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-13T17:31:08.575993Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2604.04017"},"observation_digest":"sha256:8e03a3689d3126fe421e8aaa1861b8fc3e252d5a18dffdc2a0c2890645da9087","observation_id":"8f0119c2-76f2-4f07-8b49-f3d5c788ac6d","resolution":{"observed_at":"2026-05-13T17:33:02.326459Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2604.05497","last_updated":"2026-04-07T06:41:05Z","snapshot_observed_at":"2026-07-06T22:54:12.531121Z","submitted_at":"2026-04-07T06:41:05Z","title":"Thinking Diffusion: Penalize and Guide Visual-Grounded Reasoning in Diffusion Multimodal Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-10T19:06:45.417233Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2604.05497"},"observation_digest":"sha256:66295ba77e2fd32fea0fe260642ba706d290a9e5fea86014e154b0fe004d4888","observation_id":"0113667c-c002-43ba-bb8e-7fee2dcf4db3","resolution":{"observed_at":"2026-05-12T18:12:27.664923Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2604.06777","last_updated":"2026-04-08T07:48:07Z","snapshot_observed_at":"2026-08-06T14:41:06.876472Z","submitted_at":"2026-04-08T07:48:07Z","title":"Walk the Talk: Bridging the Reasoning-Action Gap for Thinking with Images via Multimodal Agentic Policy Optimization","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-10T18:20:02.559108Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2604.06777"},"observation_digest":"sha256:2d82a4a03a33cc3ae591815dbe37754c8476770187af370d6be666803b18c968","observation_id":"d3cff9b5-13fd-4e3f-a775-4f383422ced1","resolution":{"observed_at":"2026-05-12T18:12:27.664923Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2604.07518","last_updated":"2026-04-08T18:52:27Z","snapshot_observed_at":"2026-07-06T22:55:46.307881Z","submitted_at":"2026-04-08T18:52:27Z","title":"Decompose, Look, and Reason: Reinforced Latent Reasoning for VLMs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T17:12:33.231488Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2604.07518"},"observation_digest":"sha256:fcd72bceda998300efe2e8a55c03b968d92bbad77c56989bbd7319fc1713586b","observation_id":"008179b4-bddc-4f19-8315-2888e22e7dcb","resolution":{"observed_at":"2026-05-12T18:12:27.664923Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2604.09757","last_updated":"2026-07-19T04:58:08Z","snapshot_observed_at":"2026-08-05T07:49:47.069678Z","submitted_at":"2026-04-10T16:03:03Z","title":"MedLVR: Latent Visual Reasoning for Reliable Medical Visual Question Answering","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T18:03:14.408704Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2604.09757"},"observation_digest":"sha256:e4b569e4f2b91303452cb4183b14a3e8f0eff2fedb66838733e79dc4a0b920b8","observation_id":"e53bfd75-6068-4707-8f14-54508e3e4c6d","resolution":{"observed_at":"2026-05-12T18:12:27.664923Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-02T16:33:55.007487Z","title":"Multimodal chain-of-thought reasoning in language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.09757","last_updated":"2026-07-19T04:58:08Z","snapshot_observed_at":"2026-08-05T07:49:47.069678Z","submitted_at":"2026-04-10T16:03:03Z","title":"MedLVR: Latent Visual Reasoning for Reliable Medical Visual Question Answering","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T16:33:55.007487Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2604.09757"},"observation_digest":"sha256:9c00ae7a09390d69310ad953c0d64eb674a402cbd44ff04148c53a6541a08843","observation_id":"f911754d-c845-4c89-95e1-b2499f7c68c8","resolution":{"observed_at":"2026-08-02T16:33:55.007487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2604.10219","last_updated":"2026-05-28T16:20:33Z","snapshot_observed_at":"2026-08-01T16:49:58.717615Z","submitted_at":"2026-04-11T13:59:05Z","title":"Cognitive Pivot Points and Visual Anchoring: Unveiling and Rectifying Hallucinations in Multimodal Reasoning Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T16:03:15.222571Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2604.10219"},"observation_digest":"sha256:d539c9b5dfa6cdf9da474e907467a5fe6ec0d0dfca15448def8ec4765ec2c17c","observation_id":"448c12b8-1bcb-426a-9ce3-913217c88572","resolution":{"observed_at":"2026-05-12T18:12:27.664923Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-07-12T22:48:45.647588Z","title":"Multimodal chain-of-thought reasoning in language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.10219","last_updated":"2026-05-28T16:20:33Z","snapshot_observed_at":"2026-08-01T16:49:58.717615Z","submitted_at":"2026-04-11T13:59:05Z","title":"Cognitive Pivot Points and Visual Anchoring: Unveiling and Rectifying Hallucinations in Multimodal Reasoning Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-12T22:48:45.647588Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2604.10219"},"observation_digest":"sha256:a6ad8386c83d77b035a3f9e29e3b874678513cf2f75b1b1a5f9a44fe33a702c6","observation_id":"6f5664c5-b3a7-497f-b10c-d2c473c6d21e","resolution":{"observed_at":"2026-07-12T22:48:45.647588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2604.10506","last_updated":"2026-04-12T07:48:44Z","snapshot_observed_at":"2026-07-06T22:59:05.519456Z","submitted_at":"2026-04-12T07:48:44Z","title":"A Progressive Training Strategy for Vision-Language Models to Counteract Spatio-Temporal Hallucinations in Embodied Reasoning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T15:53:52.775348Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2604.10506"},"observation_digest":"sha256:b0c0d6784b52d51e60d8be363909182303fe91bb8b3dadd965d761bc9c41fd83","observation_id":"51135fcb-62cc-4db5-ac2e-48761b49e915","resolution":{"observed_at":"2026-05-12T18:12:27.664923Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2604.10517","last_updated":"2026-04-12T08:14:49Z","snapshot_observed_at":"2026-07-06T22:59:09.778842Z","submitted_at":"2026-04-12T08:14:49Z","title":"From Perception to Planning: Evolving Ego-Centric Task-Oriented Spatiotemporal Reasoning via Curriculum Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T16:35:36.083682Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2604.10517"},"observation_digest":"sha256:438a7da970173579cfb3ab61e84b743f502868d76ee6ef82c3b227f6615ab6fe","observation_id":"5c0298ad-2e73-42c0-9622-f8d8f9f2c175","resolution":{"observed_at":"2026-05-12T18:12:27.664923Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2604.15301","last_updated":"2026-04-17T07:02:15Z","snapshot_observed_at":"2026-08-02T19:53:21.062944Z","submitted_at":"2026-04-16T17:57:24Z","title":"Think in Latent Thoughts: A New Paradigm for Gloss-Free Sign Language Translation","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-05-10T11:44:13.158397Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2604.15301"},"observation_digest":"sha256:cbdecf5246f0ac8ff37bc0009d2b637a80967b54442a82653772c5c41945a2a3","observation_id":"ea6e9f77-d437-4e91-8bd0-85051ddd1c56","resolution":{"observed_at":"2026-05-12T18:12:27.664923Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2604.15705","last_updated":"2026-04-17T05:24:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-17T05:24:04Z","title":"Towards Robust Endogenous Reasoning: Unifying Drift Adaptation in Non-Stationary Tuning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-10T08:28:07.531338Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2604.15705"},"observation_digest":"sha256:df85198a966faa406cc38554c3196d2293d1dd47e6d0832c51d90f64ce3afad2","observation_id":"11e719fb-f938-4b88-8698-ce05a887291d","resolution":{"observed_at":"2026-05-12T18:12:27.664923Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2604.20328","last_updated":"2026-06-26T07:09:02Z","snapshot_observed_at":"2026-08-02T11:12:35.059224Z","submitted_at":"2026-04-22T08:22:23Z","title":"HyLaR: Hybrid Latent Reasoning with Decoupled Policy Optimization","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-10T01:17:33.668451Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2604.20328"},"observation_digest":"sha256:44a442d34086ac1f4165027cc120cdd0cceaed25b6ed432c27ec002cdce39947","observation_id":"632feb4d-d129-48f4-8894-9904f46c762c","resolution":{"observed_at":"2026-05-12T18:12:27.664923Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2604.20328","last_updated":"2026-06-26T07:09:02Z","snapshot_observed_at":"2026-08-02T11:12:35.059224Z","submitted_at":"2026-04-22T08:22:23Z","title":"HyLaR: Hybrid Latent Reasoning with Decoupled Policy Optimization","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-05T04:29:52.480873Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2604.20328"},"observation_digest":"sha256:0ee38e3f06ba917958a2cf777a9b1614df2378c8ac2559d20992e1a1e20ac902","observation_id":"08694fb4-b97b-4ec9-8c88-7477b0e84e8f","resolution":{"observed_at":"2026-07-05T04:30:40.726775Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2604.20755","last_updated":"2026-04-22T16:44:33Z","snapshot_observed_at":"2026-08-01T03:59:28.787636Z","submitted_at":"2026-04-22T16:44:33Z","title":"V-tableR1: Process-Supervised Multimodal Table Reasoning with Critic-Guided Policy Optimization","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-09T23:48:32.613988Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2604.20755"},"observation_digest":"sha256:a2c43d35347346f50fb1c3d0fb5ba3f7a7bfaba70a13f71f60bc0e7ac1487649","observation_id":"57a14436-1756-4103-b0de-8b5e7cd5e0a8","resolution":{"observed_at":"2026-05-12T18:12:27.664923Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2604.20878","last_updated":"2026-04-11T09:38:45Z","snapshot_observed_at":"2026-07-06T23:07:31.559812Z","submitted_at":"2026-04-11T09:38:45Z","title":"AITP: Traffic Accident Responsibility Allocation via Multimodal Large Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-10T16:10:32.154619Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2604.20878"},"observation_digest":"sha256:9af2add2250be330b2726c67afa40587b3465339f2d1b3cea306d7eface5786b","observation_id":"6a9a443f-a542-4e16-a1c1-70402f1e6416","resolution":{"observed_at":"2026-05-12T18:12:27.664923Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2604.21079","last_updated":"2026-04-22T20:44:24Z","snapshot_observed_at":"2026-07-06T23:07:41.856444Z","submitted_at":"2026-04-22T20:44:24Z","title":"Foveated Reasoning: Stateful, Action-based Visual Focusing for Vision-Language Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-10T00:16:34.362000Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2604.21079"},"observation_digest":"sha256:fb9f2707dfffd41e7fa8ab0cfe93a6759b77cc4661f23b8e1b62a0981991fa79","observation_id":"34e1e90d-c6a2-4288-a084-d4d338a30b6b","resolution":{"observed_at":"2026-05-12T18:12:27.664923Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2302.00923/citation-record","integrity":"/paper/2302.00923/integrity","json":"/paper/2302.00923/citation-record.json","paper":"/paper/2302.00923"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bottom-up and top-down attention for image captioning and visual question answering","venue":null,"work_id":"37f0c9e5-2cd0-4ce1-9bd1-ed73296c8f48","year":2018},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:7ea0e0c18cb0a641bce735a620a752130c828c171ede6eb83b17d83d00487c70","observation_id":"7ad35ea1-2a60-458b-b4ef-201ffec9a45b","resolution":{"observed_at":"2026-05-12T18:12:27.663644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2018.00636","doi":"10.1109/cvpr.2018.00636","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Anas Awadalla, Irena Gao, Josh Gardner, Jack Hessel, Yusuf Hanafy, Wanrong Zhu, Kalyani Marathe, Yonatan Bitton, Samir Gadre, Shiori Sagawa, et al","venue":null,"work_id":"a4282939-a23d-4958-819e-2b9e560e7236","year":2018},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:4e25a32b8424ef9394e78d56533a505e6652a57d27387ba202b5f5ea4b98c858","observation_id":"f8ba0729-c688-4567-a7bc-d91945d5185d","resolution":{"observed_at":"2026-05-12T18:12:27.452441Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b2f1c95c-096f-4f84-9bca-89f670ad3c12","year":2020},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:6914c72e76b4c2b8a9ec7b0047dcff3b5e3ce263fcaa15660a2892a3535e6960","observation_id":"e4e8e4e3-9895-415e-b56d-399c80cac386","resolution":{"observed_at":"2026-05-12T18:12:27.578573Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"End-to-end object detection with transformers","venue":null,"work_id":"57cfd5d0-061a-4a1c-a98f-d421937f34a6","year":2020},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:85f6269f8b9361fb0a31708eeb53ad90e84e891bee1d76aa7c4df541e45af9d2","observation_id":"bf3623b3-4212-4668-aad6-c56d7d99d596","resolution":{"observed_at":"2026-05-12T18:12:27.583463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"002ecb5e-c3d3-418a-9b3d-4b800ed2e6bd","year":2020},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:44e54a5a06ee4cdb9ebde66d0309a3b6b24c1f6c04dff0af736bf95239426b4a","observation_id":"821d6c3a-3805-4fef-8cd1-693e7d52fd03","resolution":{"observed_at":"2026-05-12T18:12:27.587969Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.12588","last_updated":"2023-10-23T01:27:38Z","snapshot_observed_at":"2026-08-02T13:06:11.850456Z","submitted_at":"2022-11-22T21:06:00Z","title":"Program of Thoughts Prompting: Disentangling Computation from Reasoning for Numerical Reasoning Tasks","version":4},"cited_work":{"arxiv_id":"2211.12588","doi":"10.48550/arxiv.2211.12588","metadata_source":"pith","pith_arxiv_id":"2211.12588","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Program of Thoughts Prompting: Disentangling Computation from Reasoning for Numerical Reasoning Tasks","venue":"cs.CL","work_id":"618aa44c-a6c6-425c-abce-8aa8aa842921","year":2022},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"cited_paper":"/paper/2211.12588","citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:f2eaad303e432f9adafccf3f5a055cdd03a50c187c579733f2dabc3ccf6fc9ee","observation_id":"1527499e-f4fe-4435-9f89-748255a9274c","resolution":{"observed_at":"2026-05-12T18:12:27.499329Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.05226","last_updated":"2023-01-12T18:59:50Z","snapshot_observed_at":"2026-08-08T00:04:35.148181Z","submitted_at":"2023-01-12T18:59:50Z","title":"See, Think, Confirm: Interactive Prompting Between Vision and Language Models for Knowledge-based Visual Reasoning","version":1},"cited_work":{"arxiv_id":"2301.05226","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.05226","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"See, think, confirm: Interactive prompting between vision and language models for knowledge-based visual reasoning","venue":null,"work_id":"ea2e7413-2359-4efb-b9e8-5b449f6eb566","year":2023},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"cited_paper":"/paper/2301.05226","citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:d63f4624dea2a77682456af6116c90cf8b2c8e315364b52de39c2cdd82a7f03d","observation_id":"f804bb78-8fa3-4b9b-918e-eff6e51e1459","resolution":{"observed_at":"2026-05-12T18:12:27.534776Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02311","last_updated":"2022-10-05T06:02:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-05T16:11:45Z","title":"PaLM: Scaling Language Modeling with Pathways","version":5},"cited_work":{"arxiv_id":"2204.02311","doi":"10.48550/arxiv.2204.02311","metadata_source":"pith","pith_arxiv_id":"2204.02311","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaLM: Scaling Language Modeling with Pathways","venue":"cs.CL","work_id":"a94f3ef7-2c49-4445-93fe-6ec16aafd966","year":2022},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"cited_paper":"/paper/2204.02311","citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:61963fce3d0c464b548a1e4e34b08d3177dae9b8ff7d29d4ebb616894e3983c1","observation_id":"9af814b1-823f-48f3-8120-6ede79c5558f","resolution":{"observed_at":"2026-05-12T18:12:27.549367Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-21T12:25:21.411055+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T12:25:21.411055+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.11416","last_updated":"2022-12-06T21:39:48Z","snapshot_observed_at":"2026-07-06T14:08:18.855958Z","submitted_at":"2022-10-20T16:58:32Z","title":"Scaling Instruction-Finetuned Language Models","version":5},"cited_work":{"arxiv_id":"2210.11416","doi":"10.48550/arxiv.2210.11416","metadata_source":"pith","pith_arxiv_id":"2210.11416","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Instruction-Finetuned Language Models","venue":"cs.LG","work_id":"8405abb1-7558-4fdf-af24-f4c52fa77a06","year":2022},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"cited_paper":"/paper/2210.11416","citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:729d3dbe3dbb04befe3f02ac8954a3ee53653590616aeb46549b8a2dce4fc558","observation_id":"2c0d5a16-c27b-4b8b-9306-1d1badee10fd","resolution":{"observed_at":"2026-05-12T18:12:27.494483Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":"9f1d35ab-285a-4596-b6d6-0e3ba9598a41","year":2021},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:a4ac3b4c9f29d068fcd5fbe8b3a1e40d2a34d0d182a120486f2faa131e1bd9d9","observation_id":"63675545-d366-4a2b-b33f-9d263b3ea93c","resolution":{"observed_at":"2026-05-12T18:12:27.592340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"7de93f0f-8430-446a-bc5e-982e0fa266c6","year":2021},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:fac333f7e43020b2f28d1394fe2d5f9928a0b5f009a91f54a083eac608c41453","observation_id":"f721fb64-450b-433f-a967-8dbdcee5b4d6","resolution":{"observed_at":"2026-05-12T18:12:27.596429Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.00720","last_updated":"2023-01-30T09:15:49Z","snapshot_observed_at":"2026-08-07T05:39:17.046417Z","submitted_at":"2022-10-03T05:33:27Z","title":"Complexity-Based Prompting for Multi-Step Reasoning","version":2},"cited_work":{"arxiv_id":"2210.00720","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.00720","snapshot_observed_at":"2026-07-05T10:20:57.247384Z","title":"Complexity-based prompting for multi-step reasoning","venue":"cs.CL","work_id":"346e5048-02d1-410f-b165-2e5ffdafc2a5","year":2022},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"cited_paper":"/paper/2210.00720","citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:773f9542212c10a26a169dcbc15b73584d9ed800118d2e6c2ebd32fe58745438","observation_id":"57f5e2e1-7ed5-46d9-bc64-78f66b55bdae","resolution":{"observed_at":"2026-05-12T18:12:27.528925Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"51e010b9-f4ab-4c90-93cb-7e858efdf274","year":2019},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:03dbc0c0cb31725936ede92376cf27eddd2f3a97f174ef136fbc49d36f3520ac","observation_id":"7c749774-e285-4b05-a420-07d68890ab93","resolution":{"observed_at":"2026-05-12T18:12:27.600330Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2019.00680","doi":"10.1109/cvpr.2019.00680","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Yaru Hao, Haoyu Song, Li Dong, Shaohan Huang, Zewen Chi, Wenhui Wang, Shuming Ma, and Furu Wei","venue":null,"work_id":"27e8a78a-7373-49eb-8bad-f76570432e3b","year":2019},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:1c4b68815384bd0b09c332f61837942136a9effbd18fd5dbf66edf814300383c","observation_id":"bf5eb678-d7db-4c56-892c-3a45cce3149c","resolution":{"observed_at":"2026-05-12T18:12:27.437051Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deep residual learning for image recognition","venue":null,"work_id":"a9f655e5-44c6-4592-be26-8516ccae64a8","year":2016},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:4e75549e223015915797239801fce552c6fcaaa7fdfe7672da0a7f032a95858f","observation_id":"b9404238-ea89-4c8a-a7a9-fc0f89a477d4","resolution":{"observed_at":"2026-05-12T18:12:27.604691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1109/cvpr.2016.90","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:16:59.350888Z","title":"Deep residual learning for image recognition","venue":"2016 IEEE Conference on Computer Vision and Pattern Recognition (CVPR)","work_id":"b353bda2-591d-479a-9c8b-22dfcba12431","year":2016},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:69f5efbf652622d0a49c18fe1893827b559aa287e5e4774da80cf8c98daa5f14","observation_id":"f6b26b5f-fd45-4736-93ee-998c0b7fd531","resolution":{"observed_at":"2026-05-12T18:12:27.471413Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-03T17:08:01.374485+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T17:08:01.374485+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10403","last_updated":"2023-05-26T17:59:33Z","snapshot_observed_at":"2026-08-06T19:23:30.079167Z","submitted_at":"2022-12-20T16:29:03Z","title":"Towards Reasoning in Large Language Models: A Survey","version":2},"cited_work":{"arxiv_id":"2212.10403","doi":null,"metadata_source":"pith","pith_arxiv_id":"2212.10403","snapshot_observed_at":"2026-07-02T19:27:18.690866Z","title":"Towards Reasoning in Large Language Models: A Survey","venue":"cs.CL","work_id":"d920638f-5831-406f-9ceb-41c99337b692","year":2022},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"cited_paper":"/paper/2212.10403","citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:78b9b893393b6d285a7a2c65129168f23fd0ebf110ba3501ab5884d184f5aadf","observation_id":"be82e526-8f40-47a9-b560-0438bdaef110","resolution":{"observed_at":"2026-05-18T13:22:30.236738Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"UNIFIEDQA: Crossing format boundaries with a single QA system","venue":null,"work_id":"10157b4f-9aea-4ee4-8ea2-a07a818e32e8","year":2020},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:ce08d76b2571c57a4cfb271ebed1926530e6ae5474928104d6c0a4ea55c119c3","observation_id":"81b9afc3-05d3-4bed-ad07-0dffd1416a68","resolution":{"observed_at":"2026-05-12T18:12:27.608549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2020.findings-emnlp.171","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In Findings of the Association for Com- putational Linguistics: EMNLP 2020 , Trevor Cohn, Yulan He, and Yang Liu (Eds.)","venue":null,"work_id":"50e0e9a5-ff26-4eaf-8c82-4d5305b3f419","year":2020},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:731aecb88509a166de7cc89a88455647486b38dc88702f49e43d1a49f34dc882","observation_id":"10537ba7-d59b-4eaa-b875-d2f3a9c9f277","resolution":{"observed_at":"2026-05-12T18:12:27.446265Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bilinear attention networks","venue":null,"work_id":"9ff258ed-1bb1-49d7-998e-d0c8249e3b32","year":2018},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:1ef25c2de84dbd41c9444123268fdb294e094440e8b18749d6cfa6add51cb5c3","observation_id":"b2e7e6eb-0e9c-45d5-a9cb-79dd1201040f","resolution":{"observed_at":"2026-05-12T18:12:27.612252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vilt: Vision-and-language transformer without convolution or region supervision","venue":null,"work_id":"8d665133-648e-4875-9b39-a6836771066f","year":2021},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:93dbe664390b64c7f8fcdfb18008fc89c7833f2f084a1873887c376fe9991766","observation_id":"af4c2ac4-1ded-41fb-b907-1ea5fa78eee4","resolution":{"observed_at":"2026-05-12T18:12:27.616303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.11916","last_updated":"2023-01-29T05:14:17Z","snapshot_observed_at":"2026-08-07T04:02:08.445660Z","submitted_at":"2022-05-24T09:22:26Z","title":"Large Language Models are Zero-Shot Reasoners","version":4},"cited_work":{"arxiv_id":"2205.11916","doi":"10.48550/arxiv.2205.11916","metadata_source":"pith","pith_arxiv_id":"2205.11916","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Language Models are Zero-Shot Reasoners","venue":"cs.CL","work_id":"d9b7eb1a-7165-46ff-9f06-d2f0b9d6f95d","year":2022},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"cited_paper":"/paper/2205.11916","citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:99094573e9d79fefc45ee5637bba9f812bda9ce81b5e9ab3ab4d1f6736a98309","observation_id":"469e3a72-906e-4e29-aeb6-58ae000298d2","resolution":{"observed_at":"2026-05-12T19:04:13.904485Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2022.acl-long.438","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"On vision features in multimodal machine translation","venue":"Proceedings of the 60th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)","work_id":"51bc5112-3603-4009-a01d-a8828f99c486","year":2022},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:2a537894e5d26187f588cfc3a63931fd605af468b52f3f5d2ff8b8a355e9530e","observation_id":"9e995384-b5ff-45ab-971a-788f8649b6b8","resolution":{"observed_at":"2026-05-12T18:12:27.466782Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.02336","last_updated":"2023-05-24T04:08:08Z","snapshot_observed_at":"2026-07-06T13:17:41.206878Z","submitted_at":"2022-06-06T03:38:36Z","title":"Making Large Language Models Better Reasoners with Step-Aware Verifier","version":3},"cited_work":{"arxiv_id":"2206.02336","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2206.02336","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Yifei Li, Zeqi Lin, Shizhuo Zhang, Qiang Fu, Bei Chen, Jian-Guang Lou, and Weizhu Chen","venue":null,"work_id":"43823128-e3c9-4d2e-8e37-8e23c025e9d0","year":2022},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"cited_paper":"/paper/2206.02336","citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:79b9011088adc14bdc69b26aaf19f130d1555cf59e70c721a32723279111a476","observation_id":"0fb9d7f0-8e94-4370-a83c-3715e78ae4a6","resolution":{"observed_at":"2026-05-12T18:12:27.511336Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14610","last_updated":"2023-03-02T07:41:55Z","snapshot_observed_at":"2026-08-08T00:29:35.147198Z","submitted_at":"2022-09-29T08:01:04Z","title":"Dynamic Prompt Learning via Policy Gradient for Semi-structured Mathematical Reasoning","version":3},"cited_work":{"arxiv_id":"2209.14610","doi":null,"metadata_source":"pith","pith_arxiv_id":"2209.14610","snapshot_observed_at":"2026-07-05T17:41:17.457873Z","title":"arXiv preprint arXiv:2209.14610 , year =","venue":"cs.LG","work_id":"b02aa44e-3fa1-4e2f-a1d4-adc73c214fdc","year":2022},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"cited_paper":"/paper/2209.14610","citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:61b6fb73cb460f245d0b987b2c365fc453939fd0580b2609f2d1feebb7aff1e9","observation_id":"78cad326-9ff8-4673-99e7-855a21908352","resolution":{"observed_at":"2026-05-12T18:12:27.523797Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08410","last_updated":"2023-06-01T12:17:01Z","snapshot_observed_at":"2026-07-06T14:31:38.001143Z","submitted_at":"2022-12-16T11:24:42Z","title":"Teaching Small Language Models to Reason","version":3},"cited_work":{"arxiv_id":"2212.08410","doi":"10.48550/arxiv.2212.08410","metadata_source":"arxiv_reference","pith_arxiv_id":"2212.08410","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"C., Mallinson, J., Adamek, J., Malmi, E., and Severyn, A","venue":"arXiv (Cornell University)","work_id":"cde44144-7045-4c56-a99a-f8c35fd5de98","year":2023},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"cited_paper":"/paper/2212.08410","citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:5e20172e02fd4d3acb7ab07f3600c7618d93866276fb17e533237956951bbdff","observation_id":"656bbdf0-841d-4e84-98e4-efd34d95cc44","resolution":{"observed_at":"2026-05-12T18:12:27.517396Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gpt-4v(ision) system card","venue":null,"work_id":"0f608e16-b3d1-4329-b24f-66532f223033","year":2024},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:b0854db1baa1a60dab93a62a45e90ca9b0099aa9ab1cd46b4c24930d76c7bd13","observation_id":"a19888a4-dac2-4fbd-baa1-90ca8d1c3b4f","resolution":{"observed_at":"2026-05-12T18:12:27.619807Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"7f40a9a0-ba36-49bf-9a11-69cc4ba67a8f","year":2021},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:cb1b01a6f4d1b17757b74acb092100fb2bab417bc9be2a2aac0a599213c66295","observation_id":"4ef36915-1e9e-4c8a-afe9-9b6ffccbdbb3","resolution":{"observed_at":"2026-05-12T18:12:27.623055Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.11446","last_updated":"2022-01-21T18:39:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-12-08T19:41:47Z","title":"Scaling Language Models: Methods, Analysis & Insights from Training Gopher","version":2},"cited_work":{"arxiv_id":"2112.11446","doi":"10.48550/arxiv.2112.11446","metadata_source":"pith","pith_arxiv_id":"2112.11446","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Language Models: Methods, Analysis & Insights from Training Gopher","venue":"cs.CL","work_id":"47ce8be9-e500-407d-af41-ac2d132215eb","year":2021},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"cited_paper":"/paper/2112.11446","citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:8411e8e1467b7b70085a453807cec04f1081a5d0e956cb2ed511f46ab4f29c60","observation_id":"ee7709c8-bc65-4e82-a76c-a6167080d958","resolution":{"observed_at":"2026-05-12T18:12:27.539613Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":"2403.05530","doi":"10.48550/arxiv.2403.05530","metadata_source":"pith","pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","venue":"cs.CL","work_id":"80e3e977-f1bb-4c83-8d0c-1ab0a0c5c3f1","year":2024},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:289f53858436ce81a61edf0fc2bfe02eac731d289eedea5b893f204316988f39","observation_id":"cda73128-84cc-44a0-a79f-d665ea0a59e4","resolution":{"observed_at":"2026-05-12T18:12:27.544680Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-02T03:08:14.426583+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T03:08:14.426583+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning to retrieve prompts for in-context learning","venue":null,"work_id":"f37dfbd6-b61c-4258-ade6-8e4ce4b1edce","year":2022},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:fb2943a55f701d080f3bf4035a7ceb469396c3f6d7fa95881f34cf4235c0b941","observation_id":"e0393ae7-7a86-4e00-8d6f-cbad4c222670","resolution":{"observed_at":"2026-05-12T18:12:27.626501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2022.naacl-main.191","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"URL https://aclanthology.org/2022.naacl-main.191","venue":"Proceedings of the 2022 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies","work_id":"296fa0b3-6893-4f3b-91ed-fdc7880ae1ab","year":2022},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:6ea9782d8b12facdb5e352114ebd6986b1d33df7b5fa5faede73564d7fa2789f","observation_id":"b00368f9-1202-4afe-97c0-d849b4eff5f2","resolution":{"observed_at":"2026-05-12T18:12:27.457467Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Alpaca: A strong, replicable instruction-following model.Stanford Center for Research on Foundation Models","venue":null,"work_id":"afd33db5-1cd1-4978-bece-1569f236446d","year":2023},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:d5ebdaa0ac3cdbb9cf7563e16abe81b09a7bc018fe8111512570933bdd22a92f","observation_id":"aeff0bf7-c854-42ec-9812-2e265e51ffe8","resolution":{"observed_at":"2026-05-12T18:12:27.630240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.08239","last_updated":"2022-02-10T16:30:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-01-20T15:44:37Z","title":"LaMDA: Language Models for Dialog Applications","version":3},"cited_work":{"arxiv_id":"2201.08239","doi":"10.48550/arxiv.2201.08239","metadata_source":"pith","pith_arxiv_id":"2201.08239","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LaMDA: Language Models for Dialog Applications","venue":"cs.CL","work_id":"1b66d0a5-f6ae-4332-8025-c662dc64b238","year":2022},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"cited_paper":"/paper/2201.08239","citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:0625f460049380c90e114f5d19b94672b3222a19d42853daa7166476f41fa111","observation_id":"273863e7-76eb-4d25-aac4-9bb6dbc8f215","resolution":{"observed_at":"2026-05-12T18:12:27.555158Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":"ac4ed9ac-e750-4fb9-b3f7-668b6d9bbd15","year":2017},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:3a4f18c53025081d2ea4e35fac559fe7696030aa1bd57ec8912a870546ed4231","observation_id":"71bcf958-0f7f-439a-b194-fcb8e5285cb6","resolution":{"observed_at":"2026-05-12T18:12:27.633657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":"2203.11171","doi":"10.1101/2025.04.03.646459","metadata_source":"pith","pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","venue":"cs.CL","work_id":"8c6d5a6b-b5cc-4105-9c84-9c34bb9375bb","year":2022},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:148f270f94a3a1cc7f42f9230b4ad92fb01b6f8ff1d1a38d5748f5aa7ae1e462","observation_id":"af839bf3-d430-4853-9a5c-36811a6a1d97","resolution":{"observed_at":"2026-05-12T18:12:27.560610Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-21T18:52:42.88633+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T18:52:42.88633+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2021.acl-long.480","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"doi: 10.18653/v1/2021.acl-long.480","venue":null,"work_id":"21704fd4-0d57-4bd2-a10a-56c555c64a9a","year":2021},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:a7c002dd67b2713dd9223b61b7dd59785515444e7b4594ed8a3cfbf2e676801d","observation_id":"cae2e0b5-7529-438c-9b59-aaaf43daedd2","resolution":{"observed_at":"2026-05-12T18:12:27.441860Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deep modular co-attention networks for visual question answering","venue":null,"work_id":"2dabfe30-af03-49b5-97b4-7aaabb9917d7","year":2019},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:57f1439a22b5916f33874c011d8bfb644c2ac97d349680ff144e6775075f43dd","observation_id":"d7d72da8-8c0d-471a-9b48-539049a53ba9","resolution":{"observed_at":"2026-05-12T18:12:27.637169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2019.00644","doi":"10.1109/cvpr.2019.00644","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":null,"work_id":"78752402-24b7-46fa-bf8c-57dc84aa463f","year":2019},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:a39e175c20261fd91ab4519ff4faee9a072d6d801b000e80584b97ee179750d3","observation_id":"396c4dd5-6a7c-4251-84da-6fe672dfbd37","resolution":{"observed_at":"2026-05-12T18:12:27.463247Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.16199","last_updated":"2024-09-18T23:54:36Z","snapshot_observed_at":"2026-08-06T06:36:02.994951Z","submitted_at":"2023-03-28T17:59:12Z","title":"LLaMA-Adapter: Efficient Fine-tuning of Language Models with Zero-init Attention","version":3},"cited_work":{"arxiv_id":"2303.16199","doi":"10.48550/arxiv.2303.16199","metadata_source":"pith","pith_arxiv_id":"2303.16199","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaMA-Adapter: Efficient Fine-tuning of Language Models with Zero-init Attention","venue":"cs.CV","work_id":"5c44e6f5-82ca-4461-9fc1-d630f3bfa3e1","year":2023},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"cited_paper":"/paper/2303.16199","citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:756b6b98c549d43c3a1b3d094577d2f52190bc52564b0cdf4a8d5e482a68f730","observation_id":"80262818-848b-4c79-82ef-eaeef4822ba2","resolution":{"observed_at":"2026-05-12T18:12:27.485002Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2023.323417","doi":"10.1109/tpami.2023.3234170","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Universal multimodal representation for language understanding.IEEE Transactions on Pattern Analysis and Machine Intelligence, pp","venue":"IEEE Transactions on Pattern Analysis and Machine Intelligence","work_id":"b7e9dc40-5ec6-42e2-88b9-5c88560e31ff","year":2023},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:e52fcd29155351bc4f31f1c79a8bed8e969eec564b87d7cb42f01c8950cef102","observation_id":"1a39ba30-2706-4a79-bdf0-a3b42487b1f1","resolution":{"observed_at":"2026-05-12T18:12:27.478103Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.10625","last_updated":"2023-04-16T22:08:08Z","snapshot_observed_at":"2026-08-06T09:00:42.886249Z","submitted_at":"2022-05-21T15:34:53Z","title":"Least-to-Most Prompting Enables Complex Reasoning in Large Language Models","version":3},"cited_work":{"arxiv_id":"2205.10625","doi":"10.48550/arxiv.2205.10625","metadata_source":"pith","pith_arxiv_id":"2205.10625","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Least-to-Most Prompting Enables Complex Reasoning in Large Language Models","venue":"cs.AI","work_id":"7e58c111-4666-4996-b5ad-1c8efd433083","year":2022},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"cited_paper":"/paper/2205.10625","citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:965ffedc1d20671658aefe4bf4270b1e8947914f52cd49b827c5dcc663d1dc47","observation_id":"21b84276-9bbd-43bf-a97c-fbbef837aa08","resolution":{"observed_at":"2026-05-12T18:12:27.489391Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Here, we present additional examples to illustrate this phenomenon, as depicted in Figure","venue":null,"work_id":"0817c5c1-42f9-4d18-86c9-d287a4242621","year":2024},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:0aade6b85c421dae6326156cf7793b00aa864bff5d360774a4dd4a35b951ff88","observation_id":"90430afc-f885-4437-9d04-036b3cfa34bb","resolution":{"observed_at":"2026-05-12T18:12:27.641184Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"844e209d-c684-4ca2-a336-59421b9c0ea5","year":2024},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:d3308c6a4cac5b521e6bdd9c7403c169be7a92baa96cb7bc08aaac313692eca9","observation_id":"ca4ea2f9-54b9-4cff-a55e-aaccb5841a74","resolution":{"observed_at":"2026-05-12T18:12:27.644559Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"•ScienceQA is a large-scale multimodal science question dataset with annotated lectures and explanations","venue":null,"work_id":"527e2729-7626-4bdc-bfdb-3a66f5b40f81","year":2024},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:4ff2cf290baf5476c58eb3411a9104f640af2c4b256105262d291c93913c6791","observation_id":"7ee6d94f-c59a-42ad-aa4d-28f4b8023501","resolution":{"observed_at":"2026-05-12T18:12:27.648925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The vision features are obtained by the frozen ViT-large encoder (Dosovitskiy et al., 2021b)","venue":null,"work_id":"caccd600-8372-49d6-b4c6-f50d962230b7","year":2023},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:e2b0f535bfbff7ba46546b592fa9f8494aa9d11e023fe91b217af5010d8266e7","observation_id":"2b33669f-bd67-4d6d-9e45-37dc5d96a707","resolution":{"observed_at":"2026-05-12T18:12:27.652669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"14278dde-1563-4b52-be37-bcfe301509c9","year":2023},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:1c56b783fb1680beed199de454d61d2b9803a27b9a29683613ec615d4939575d","observation_id":"44f98b01-008f-43c5-8e58-15f468486cd6","resolution":{"observed_at":"2026-05-12T18:12:27.655991Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Then, we use the generated pseudo-rationales as the target rationales for training instead of relying on the human annotation of reasoning chains","venue":null,"work_id":"564688ae-d065-464e-b2a1-56c4004c7b63","year":2024},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:f91098a8e3ad31b1eb5adf12b87fa191430461dc5f4aa10b687078732d5fa44c","observation_id":"469e8305-0116-4b5b-9414-e3f70d359b4c","resolution":{"observed_at":"2026-05-12T18:12:27.659950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"80% 14%6% CommonsenseLogicalOthers Figure 11: Categorization analysis","venue":null,"work_id":"24491a1c-8683-480e-8d40-016fdd05cd9c","year":2024},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:8c77453a6f7bb0def5fcd961bdb3811a53d09b1a0ccbd8ebf897a518395a2518","observation_id":"80dbcc96-326f-47e6-8a24-73ef138993b1","resolution":{"observed_at":"2026-05-12T18:12:27.570799Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","latest_version":5,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":0,"metadata_mismatch":6,"parse_uncertain":0,"unresolved":7,"verified_exact":19,"verified_fuzzy":17},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 100 inbound Pith citation observations for arXiv:2302.00923."}