{"as_of":"2026-08-13T17:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5d9797e2026a04a064a924b841967bdf3f4aaf35ac6e847c0dd2dcd40ee41d8e","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T13:38:14.155401Z","state":"measured"},{"denominator":59,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":59,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T21:18:59.500206Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-16T15:15:46.368932Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.12932","snapshot_observed_at":"2026-08-10T21:18:59.500206Z","title":"Comt: A novel benchmark for chain of multi-modal thought on large vision- language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-13T08:24:02.836306Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:59.500206Z"},"links":{"cited_paper":"/paper/2412.12932","citing_paper":"/paper/2501.05444"},"observation_digest":"sha256:c9ab0faa30187ca8b9d3e63f0b2828564826fffcfb23f8baf9a8431a2b443acc","observation_id":"ee5f873c-6dee-4731-8241-a898d9499189","resolution":{"observed_at":"2026-08-10T21:18:59.500206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":"2412.12932","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.12932","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"CoMT: A novel benchmark for chain of multi-modal thought on large vision- language models","venue":null,"work_id":"c1b3ad58-0579-4ca6-9622-993e0f2ccffb","year":2024},"citing_paper":{"arxiv_id":"2503.07536","last_updated":"2025-03-11T03:32:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-10T17:04:14Z","title":"LMM-R1: Empowering 3B LMMs with Strong Reasoning Abilities Through Two-Stage Rule-Based RL","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-16T15:15:46.255296Z"},"links":{"cited_paper":"/paper/2412.12932","citing_paper":"/paper/2503.07536"},"observation_digest":"sha256:466b50047e37d7b029b064271e7642e3fed39b67ea52e8b4fc554de8189b2342","observation_id":"257a7895-bdaa-4beb-a86b-a8c099750e61","resolution":{"observed_at":"2026-05-16T15:15:46.371485Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":"2412.12932","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.12932","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"CoMT: A novel benchmark for chain of multi-modal thought on large vision- language models","venue":null,"work_id":"c1b3ad58-0579-4ca6-9622-993e0f2ccffb","year":2024},"citing_paper":{"arxiv_id":"2503.09567","last_updated":"2025-07-18T15:57:54Z","snapshot_observed_at":"2026-08-08T22:33:20.124926Z","submitted_at":"2025-03-12T17:35:03Z","title":"Towards Reasoning Era: A Survey of Long Chain-of-Thought for Reasoning Large Language Models","version":5},"reference_index":128,"source":"pdf_text","source_observed_at":"2026-05-12T08:40:40.910461Z"},"links":{"cited_paper":"/paper/2412.12932","citing_paper":"/paper/2503.09567"},"observation_digest":"sha256:dd452c0cd0c7e16debb8e9d5a98ef9e473a046bbcd10dd72eaa60a5cddf996c8","observation_id":"c92d0997-0214-4ac9-a7fc-d42ffd2e7a7c","resolution":{"observed_at":"2026-05-12T08:40:42.000176Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":"2412.12932","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.12932","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"CoMT: A novel benchmark for chain of multi-modal thought on large vision- language models","venue":null,"work_id":"c1b3ad58-0579-4ca6-9622-993e0f2ccffb","year":2024},"citing_paper":{"arxiv_id":"2503.12605","last_updated":"2025-03-23T13:47:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-16T18:39:13Z","title":"Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey","version":2},"reference_index":174,"source":"pdf_text","source_observed_at":"2026-05-15T17:18:52.996467Z"},"links":{"cited_paper":"/paper/2412.12932","citing_paper":"/paper/2503.12605"},"observation_digest":"sha256:6592e584c850e9a2e569f2ec2f3b57500028b67e34b6425fb7a270b4f885b4bf","observation_id":"da70c93b-f4ae-4780-8e09-a7717b5f7a75","resolution":{"observed_at":"2026-05-15T17:18:53.293580Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.12932/citation-record","integrity":"/paper/2412.12932/integrity","json":"/paper/2412.12932/citation-record.json","paper":"/paper/2412.12932"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:38:13.965366Z","title":", \" * write output.state after.block = add.period write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:13.965366Z"},"links":{"citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:d02d2a6555cd0a676ed566540742adbe4ad42271fa93d16143e8c4733cc81217","observation_id":"8034891e-c37d-4063-98cf-2afe3b79d316","resolution":{"observed_at":"2026-08-11T13:38:13.965366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:38:13.969608Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:13.969608Z"},"links":{"citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:44f93d182cd34f9e67a6299689120f7aa4b8d8791b687ab866140f7c24016335","observation_id":"fbd2b36c-273f-44ff-aa61-02a06070f876","resolution":{"observed_at":"2026-08-11T13:38:13.969608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-11T13:38:13.973903Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:13.973903Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:4b8761ab4757388a622560f7a21fae166762e2ad3ce57b63fa391f74710abccf","observation_id":"57a2ac40-063c-4295-8be9-01a130c220f7","resolution":{"observed_at":"2026-08-11T13:38:13.973903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:38:14.665749Z","title":null,"venue":null,"work_id":"7665fd35-f85f-4004-ba66-bff4cc178bfc","year":2022},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:13.978345Z"},"links":{"citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:13a30cd003478b9d714b90b3d399478ec03e076becce84e46c5d2f4db8abb2b1","observation_id":"dcd8b321-e3f2-449b-8783-839897f77078","resolution":{"observed_at":"2026-08-11T13:38:14.669899Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:38:14.655078Z","title":null,"venue":null,"work_id":"a507ca2b-065f-447a-9301-f05123fd0ed2","year":2024},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:13.981961Z"},"links":{"citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:e194ba7197f2bfd2591b5894a4c35e3f2c74cc952ca82f7cf94ec4616376f3b1","observation_id":"8abbe37d-f615-4282-abd2-c305ace76b5f","resolution":{"observed_at":"2026-08-11T13:38:14.658652Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16473","last_updated":"2024-05-26T07:56:30Z","snapshot_observed_at":"2026-08-12T23:57:52.483265Z","submitted_at":"2024-05-26T07:56:30Z","title":"M$^3$CoT: A Novel Benchmark for Multi-Domain Multi-step Multi-modal Chain-of-Thought","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16473","snapshot_observed_at":"2026-08-11T13:38:13.986574Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:13.986574Z"},"links":{"cited_paper":"/paper/2405.16473","citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:84dd00cacf7a48ca01a2a81c5df8a3dbd79923386f6735dfedd1bbb3a5c23931","observation_id":"90671c1b-3e88-46b1-8aa8-74d8d62ec4d3","resolution":{"observed_at":"2026-08-11T13:38:13.986574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:38:13.990476Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:13.990476Z"},"links":{"citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:6627c50d8ba78b9db7e21cf27bbb0fd9c9b556c3532e6bb9c700159761d66960","observation_id":"dfd098ce-faa8-454d-bc96-4272b74bfba3","resolution":{"observed_at":"2026-08-11T13:38:13.990476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06500","last_updated":"2023-06-15T08:00:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-11T00:38:10Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06500","snapshot_observed_at":"2026-08-11T13:38:13.994300Z","title":"H.; Zhao, J.; Wang, W.; Li, B.; Fung, P.; and Hoi, S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:13.994300Z"},"links":{"cited_paper":"/paper/2305.06500","citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:c83d22f654f5ece113a8c29370283a1e46dc8407b36e149c250424662d1c23c6","observation_id":"383e9cdc-f93f-4999-8613-e7e20e7c666c","resolution":{"observed_at":"2026-08-11T13:38:13.994300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:38:14.637845Z","title":null,"venue":null,"work_id":"3fc93fd7-6d0d-468c-b327-b2a7ac5f3006","year":2023},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:13.998232Z"},"links":{"citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:0a689dd20bd9c663441ff492ce8390117c578dd02d52a9808df14a5836617456","observation_id":"68a5ee27-1ea6-4fdb-87c3-c7093dfd2bf8","resolution":{"observed_at":"2026-08-11T13:38:14.641535Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:38:14.627080Z","title":null,"venue":null,"work_id":"204d2b3d-36df-4e69-a045-fbb7a0d1529b","year":2024},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:14.001637Z"},"links":{"citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:38ade46cf27910927c8f226f69c6a3c32a86e4f6f9239e726dd79b5743938152","observation_id":"69a46e92-6351-43c6-bd9d-ef0b65308156","resolution":{"observed_at":"2026-08-11T13:38:14.630603Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:38:14.616961Z","title":null,"venue":null,"work_id":"1f5b07ab-9a74-4c20-8900-abf454c3cbda","year":2024},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:14.005393Z"},"links":{"citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:1f712e65f42de185e7af79e7e39d6d81549b810bc85834063b26ccebbc09b818","observation_id":"273f5760-434e-4911-b0ce-05243ef18e73","resolution":{"observed_at":"2026-08-11T13:38:14.620403Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:38:14.606969Z","title":null,"venue":null,"work_id":"7aa1e966-30c7-4ca9-9e6b-734b9f35a93d","year":2024},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:14.009044Z"},"links":{"citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:f90d90958e786fb7ff87d1c6b0fb35db28b9da763d820fcc13d049610c9a0779","observation_id":"40d85930-82fa-496e-a1e3-df2c1e391c52","resolution":{"observed_at":"2026-08-11T13:38:14.610455Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:38:14.594757Z","title":"P.; Poff, S.; Corredor, M.; Zettlemoyer, L.; Fazel-Zarandi, M.; and Celikyilmaz, A","venue":null,"work_id":"4339b09c-c8f1-4954-8ed0-ba421868713a","year":2023},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:14.012557Z"},"links":{"citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:83ccb4976e7741b7f045c15cf51a7b40061009bfc4a116c2e5f44bdb36afa924","observation_id":"c21bbc0c-d03a-441e-8f59-77fc46303491","resolution":{"observed_at":"2026-08-11T13:38:14.599885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:38:14.583948Z","title":null,"venue":null,"work_id":"6a85f0b7-2be2-425f-963e-690dd44b5101","year":2024},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:14.015834Z"},"links":{"citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:df35b8fc040a95ed24ad5599646960f1a009d6349f812fb350ea299957f99e35","observation_id":"4f74b3fe-4c7a-4170-b8ba-e743f1333127","resolution":{"observed_at":"2026-08-11T13:38:14.587672Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:38:14.019407Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:14.019407Z"},"links":{"citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:753a86d94effd1a6c9650dc5768a2fb01e344ca83cb07827f905a1c21f604323","observation_id":"ed6278f1-1757-48ac-ada2-5f1a4a9b2a37","resolution":{"observed_at":"2026-08-11T13:38:14.019407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.16492","last_updated":"2022-11-29T18:57:06Z","snapshot_observed_at":"2026-08-13T13:32:14.054655Z","submitted_at":"2022-11-29T18:57:06Z","title":"Abstract Visual Reasoning with Tangram Shapes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.16492","snapshot_observed_at":"2026-08-11T13:38:14.022709Z","title":"K.; Hawkins, R","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:14.022709Z"},"links":{"cited_paper":"/paper/2211.16492","citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:c8e79b46a3838cc77ce0297ca9de61ea210b042262672c34e173062f5d292146","observation_id":"19065e72-0b5d-4304-be0a-d6fc575e3cf3","resolution":{"observed_at":"2026-08-11T13:38:14.022709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:38:14.567723Z","title":"Y.; Fried, D.; and Salakhutdinov, R","venue":null,"work_id":"8bb4c4b1-20ae-415d-939f-95cbe06477ae","year":2023},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:14.026376Z"},"links":{"citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:7137eb93c5b0c000952b973c58242b07c2c15a333f4fbfc62799f684bdb5e264","observation_id":"1be8d884-cf09-49e4-a3bc-98a9b2254814","resolution":{"observed_at":"2026-08-11T13:38:14.571413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:38:14.555403Z","title":"S.; Reid, M.; Matsuo, Y.; and Iwasawa, Y","venue":null,"work_id":"ca814002-bd41-4cf1-a981-59739e150367","year":2022},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:14.029751Z"},"links":{"citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:8ec5198535fa6b9596f2d8da2c8ac6ba4fdfd9d67cf86a1826ccd36a0ad24b41","observation_id":"c617cfbf-052b-43b6-a360-efd0e7859984","resolution":{"observed_at":"2026-08-11T13:38:14.559972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:38:14.545015Z","title":"R.; and Koch, G","venue":null,"work_id":"dfe78f3e-d1d8-433a-8f2e-c3a9164b8a38","year":1977},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:14.032918Z"},"links":{"citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:929ee6e35f3f0bbce5dc54197bc9fbea2ceb2af2328b1872923b2b281846e1f2","observation_id":"babae6f3-b5e2-4c33-8fee-c83d9131dda4","resolution":{"observed_at":"2026-08-11T13:38:14.548776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02246","last_updated":"2024-05-03T17:00:00Z","snapshot_observed_at":"2026-08-13T00:15:14.556734Z","submitted_at":"2024-05-03T17:00:00Z","title":"What matters when building vision-language models?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.02246","snapshot_observed_at":"2026-08-11T13:38:14.036134Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:14.036134Z"},"links":{"cited_paper":"/paper/2405.02246","citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:5379b8f9b4d50f74322d87db05dbb11dc67084d2f38c4919da1c6d9d01b3aabd","observation_id":"2019cda5-9f63-43af-b405-3caa3415cba3","resolution":{"observed_at":"2026-08-11T13:38:14.036134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02030","last_updated":"2024-06-05T03:28:01Z","snapshot_observed_at":"2026-08-12T23:50:50.280401Z","submitted_at":"2024-06-04T07:13:23Z","title":"Multimodal Reasoning with Multimodal Knowledge Graph","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02030","snapshot_observed_at":"2026-08-11T13:38:14.039890Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:14.039890Z"},"links":{"cited_paper":"/paper/2406.02030","citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:82ae29e1da8d48ab4a5aeb962c88834892d1a33980a683df83d8ce8a8298b8b4","observation_id":"d9be3fae-36ec-4b96-906a-d84ef5d741da","resolution":{"observed_at":"2026-08-11T13:38:14.039890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:38:14.533632Z","title":"D.; Strik, W","venue":null,"work_id":"4fdc12ce-a319-47ba-83c7-52f4963b2d08","year":2010},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:14.043346Z"},"links":{"citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:e7a392f7f1158f3e8451164736d05d314e42aaf284448384d5894940430753a2","observation_id":"6564c27f-cbaa-4ede-97b2-007aef125d7c","resolution":{"observed_at":"2026-08-11T13:38:14.537450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.04320","last_updated":"2023-05-16T05:59:25Z","snapshot_observed_at":"2026-08-13T11:47:42.751123Z","submitted_at":"2023-05-07T16:07:11Z","title":"Unified Demonstration Retriever for In-Context Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.04320","snapshot_observed_at":"2026-08-11T13:38:14.046278Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:14.046278Z"},"links":{"cited_paper":"/paper/2305.04320","citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:68aee6c272a82992589cf9682e527cfe58dff98e45520ae59293774bba3f2f8c","observation_id":"4544a36e-345b-454c-810b-ad01f34d769f","resolution":{"observed_at":"2026-08-11T13:38:14.046278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07536","last_updated":"2024-08-24T09:59:31Z","snapshot_observed_at":"2026-08-13T05:26:52.027159Z","submitted_at":"2023-11-13T18:22:32Z","title":"A Comprehensive Evaluation of GPT-4V on Knowledge-Intensive Visual Question Answering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07536","snapshot_observed_at":"2026-08-11T13:38:14.049627Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:14.049627Z"},"links":{"cited_paper":"/paper/2311.07536","citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:5591f141be148140a67ce12b0ab916ddb6565da76bc592549d3d594f216e811a","observation_id":"810e78d5-86a4-4ec6-8860-1ba54137ca5b","resolution":{"observed_at":"2026-08-11T13:38:14.049627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20271","last_updated":"2025-02-22T14:02:39Z","snapshot_observed_at":"2026-08-13T00:41:56.015469Z","submitted_at":"2024-03-29T16:26:20Z","title":"Draw-and-Understand: Leveraging Visual Prompts to Enable MLLMs to Comprehend What You Want","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20271","snapshot_observed_at":"2026-08-11T13:38:14.053159Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:14.053159Z"},"links":{"cited_paper":"/paper/2403.20271","citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:971514194322c2830e6b7aba09b0d09bf8911fa90ae2ee9af280c84a73c1d9ed","observation_id":"4f169db1-9c86-4ed5-9749-71ed3d63aa53","resolution":{"observed_at":"2026-08-11T13:38:14.053159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.01714","last_updated":"2024-03-03T06:12:44Z","snapshot_observed_at":"2026-08-13T05:10:37.427763Z","submitted_at":"2023-12-04T08:07:21Z","title":"Retrieval-augmented Multi-modal Chain-of-Thoughts Reasoning for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.01714","snapshot_observed_at":"2026-08-11T13:38:14.056640Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:14.056640Z"},"links":{"cited_paper":"/paper/2312.01714","citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:b368ccf8d72ff9852abe51d48c7fc73b2e69cb4b63e6fcf917b620cf58ab8283","observation_id":"a6208ccc-ec4d-430c-a07c-063dfc4d6b4c","resolution":{"observed_at":"2026-08-11T13:38:14.056640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:38:14.522569Z","title":null,"venue":null,"work_id":"487288a6-8537-4bc8-942b-0b822c2bc073","year":2024},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:14.060266Z"},"links":{"citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:d9f97458d8d6d0e03d199b35cd71345e8d8159607fda17e9473de5ab0e36a87e","observation_id":"ec511551-9895-48b9-bd86-8286a527f007","resolution":{"observed_at":"2026-08-11T13:38:14.525994Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:38:14.512044Z","title":null,"venue":null,"work_id":"9e079a89-3d2f-4977-8a0f-646665825d8c","year":2024},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:14.063317Z"},"links":{"citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:e014f953e3c67973065730796d3b8f4589eac4624b4de32ea6705d901d97242c","observation_id":"8a417068-b26c-4d4f-925d-5dbbcd1b084b","resolution":{"observed_at":"2026-08-11T13:38:14.515788Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-11T01:38:59.827005Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05525","snapshot_observed_at":"2026-08-11T13:38:14.066249Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:14.066249Z"},"links":{"cited_paper":"/paper/2403.05525","citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:27fae9e39a1b8ec21c62f743b2595a58d0059e17c2015a6585961f71cfd4ad93","observation_id":"2339f6bd-5f08-4f8e-85f2-f7fdbddac1a9","resolution":{"observed_at":"2026-08-11T13:38:14.066249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:38:14.501464Z","title":null,"venue":null,"work_id":"7c734057-daa7-4737-903a-555e3a9d5d76","year":2022},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:14.069654Z"},"links":{"citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:022630c28332a8c9f52f0ae07e736f3dd94d0479b9b2211f5b63731adb977d6d","observation_id":"b2655f6e-31a8-403b-9d7c-e5ca4003f63c","resolution":{"observed_at":"2026-08-11T13:38:14.504841Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09241","last_updated":"2023-11-09T11:14:51Z","snapshot_observed_at":"2026-08-13T05:29:15.597161Z","submitted_at":"2023-11-09T11:14:51Z","title":"Chain of Images for Intuitively Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09241","snapshot_observed_at":"2026-08-11T13:38:14.072618Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:14.072618Z"},"links":{"cited_paper":"/paper/2311.09241","citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:2cfa46e7a4f37061a0fba1c3f77d7f28ea8b8c12225ec333f0319754346f639a","observation_id":"85dd9dc4-7908-409d-9116-467825017e59","resolution":{"observed_at":"2026-08-11T13:38:14.072618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12863","last_updated":"2024-01-23T15:56:11Z","snapshot_observed_at":"2026-08-13T04:36:49.980359Z","submitted_at":"2024-01-23T15:56:11Z","title":"KAM-CoT: Knowledge Augmented Multimodal Chain-of-Thoughts Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12863","snapshot_observed_at":"2026-08-11T13:38:14.076036Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:14.076036Z"},"links":{"cited_paper":"/paper/2401.12863","citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:60ef8c0f37b3b0856d076b2281f79a1c2fcfba2366d044803885878e57f991ce","observation_id":"c7ca2f4b-34ea-4c76-aab7-aa5be1ba3c1c","resolution":{"observed_at":"2026-08-11T13:38:14.076036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20482","last_updated":"2024-10-27T15:37:51Z","snapshot_observed_at":"2026-08-12T22:14:21.779675Z","submitted_at":"2024-10-27T15:37:51Z","title":"What Factors Affect Multi-Modal In-Context Learning? An In-Depth Exploration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.20482","snapshot_observed_at":"2026-08-11T13:38:14.079635Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:14.079635Z"},"links":{"cited_paper":"/paper/2410.20482","citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:062028d51f58354ce894b858681198b8173aac00031b4fe5c8af7685e934132c","observation_id":"8807733c-7086-4704-831a-69d459326c88","resolution":{"observed_at":"2026-08-11T13:38:14.079635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12819","last_updated":"2025-08-25T02:35:43Z","snapshot_observed_at":"2026-08-13T00:02:56.561615Z","submitted_at":"2024-05-21T14:24:01Z","title":"Large Language Models Meet NLP: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12819","snapshot_observed_at":"2026-08-11T13:38:14.083304Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:14.083304Z"},"links":{"cited_paper":"/paper/2405.12819","citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:6c87537313a10488b53ef4e813961dde690ea1711110ba77ee4564353b348ee5","observation_id":"e9324f2e-2037-44bc-8182-f6520df2b1f9","resolution":{"observed_at":"2026-08-11T13:38:14.083304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:38:14.490973Z","title":null,"venue":null,"work_id":"dd332c22-d1e0-4b17-afc4-61034585ec04","year":2023},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:14.087614Z"},"links":{"citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:ee920f08cf8c182c7045b468f6de608c4215232313baf1a33dc8515d200619c6","observation_id":"f5421ae8-7934-4145-b23e-4498daa03afa","resolution":{"observed_at":"2026-08-11T13:38:14.494644Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:38:14.090582Z","title":"W.; Hallacy, C.; Ramesh, A.; Goh, G.; Agarwal, S.; Sastry, G.; Askell, A.; Mishkin, P.; Clark, J.; et al","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:14.090582Z"},"links":{"citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:4c5d35ca6168fced7431cb3f4a9db717744ebbdd5188de34f07de72602233998","observation_id":"713119a3-79da-4952-b398-a914aba96b10","resolution":{"observed_at":"2026-08-11T13:38:14.090582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:38:14.473875Z","title":null,"venue":null,"work_id":"b17d5192-c6ed-4643-bee6-519f8a905ef4","year":2022},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:14.093782Z"},"links":{"citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:2c25b92f403b46018b8c0f80f4396e4627a55ca68f1509ba8d0215505091bf86","observation_id":"6d6b0eeb-931f-4be8-8f6f-59d562627b0d","resolution":{"observed_at":"2026-08-11T13:38:14.477738Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:38:14.463244Z","title":"A.; Yasarla, R.; and Patel, V","venue":null,"work_id":"465d52cb-ed82-4e43-988b-787da1b949ba","year":2020},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:14.096997Z"},"links":{"citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:622beab472bf862fa20e370cc112a87851a46e479707add96987c2b9c260c285","observation_id":"78611544-0b79-41f8-9451-2bac1a3eb059","resolution":{"observed_at":"2026-08-11T13:38:14.466729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20834","last_updated":"2024-05-31T14:23:49Z","snapshot_observed_at":"2026-08-12T23:53:18.678917Z","submitted_at":"2024-05-31T14:23:49Z","title":"Retrieval Meets Reasoning: Even High-school Textbook Knowledge Benefits Multimodal Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20834","snapshot_observed_at":"2026-08-11T13:38:14.100180Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:14.100180Z"},"links":{"cited_paper":"/paper/2405.20834","citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:41ed68839a8705a8a50f4a40b430f812a86ff5f9942ba6a207ce79871699b59e","observation_id":"d45efeeb-9d63-49fd-8ff4-4b6bf220565a","resolution":{"observed_at":"2026-08-11T13:38:14.100180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-11T13:38:14.103515Z","title":"M.; Hauth, A.; et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:14.103515Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:2b4e0527ab660783f6e4d312ec2b9870f0d166effe06511fa21086f4675ee1bb","observation_id":"7911f6a6-a7a4-4fd5-97e7-50dfb40033fd","resolution":{"observed_at":"2026-08-11T13:38:14.103515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:38:14.451675Z","title":null,"venue":null,"work_id":"298a3a87-b3cf-4b9b-928a-52cad4832aa7","year":2024},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:14.106809Z"},"links":{"citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:c800c7402f85a97bfa405c62c4d56e0abac7833f4d1706920bd7d04dbeca92b5","observation_id":"ef7790aa-6b17-464f-84fc-46772035abfb","resolution":{"observed_at":"2026-08-11T13:38:14.455530Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10442","last_updated":"2025-04-07T09:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-15T18:59:27Z","title":"Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10442","snapshot_observed_at":"2026-08-11T13:38:14.110031Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:14.110031Z"},"links":{"cited_paper":"/paper/2411.10442","citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:48f77946b0eaf81b100a2f216529fb90e331c9de65e517b1435907e7632e3217","observation_id":"164d0c2f-6277-4f85-9c05-44ffea2f4a6f","resolution":{"observed_at":"2026-08-11T13:38:14.110031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:38:14.441336Z","title":null,"venue":null,"work_id":"74b82798-2fb4-4f20-ab27-1e6d3a800b65","year":2024},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:14.113646Z"},"links":{"citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:0fe47a5d2cdbf7b1709add6cdf89d184223f2a047f60617d54766764952e10ad","observation_id":"4cc2f2db-edce-425b-9e87-24c260e23e27","resolution":{"observed_at":"2026-08-11T13:38:14.444870Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:38:14.430699Z","title":null,"venue":null,"work_id":"c8109707-8033-4750-a8c4-3c089c257c26","year":2024},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:14.116780Z"},"links":{"citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:4e67f98ae685853d29eebfcb45fe1a9aa365c4dd0bb9119c480a2773c82d5f05","observation_id":"3211c793-d67a-4f78-a89c-563cd12de61e","resolution":{"observed_at":"2026-08-11T13:38:14.434445Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03622","last_updated":"2024-10-23T07:20:26Z","snapshot_observed_at":"2026-08-13T00:37:32.109106Z","submitted_at":"2024-04-04T17:45:08Z","title":"Mind's Eye of LLMs: Visualization-of-Thought Elicits Spatial Reasoning in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03622","snapshot_observed_at":"2026-08-11T13:38:14.120001Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:14.120001Z"},"links":{"cited_paper":"/paper/2404.03622","citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:a746bc682b96c3328afdee9e631a660cc46fcff7d949f2f74b1a93fb101ba56b","observation_id":"142c6a96-f632-490f-b4e5-d58b7d8eaf93","resolution":{"observed_at":"2026-08-11T13:38:14.120001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09193","last_updated":"2023-11-15T18:39:21Z","snapshot_observed_at":"2026-08-13T05:24:32.790687Z","submitted_at":"2023-11-15T18:39:21Z","title":"The Role of Chain-of-Thought in Complex Vision-Language Reasoning Task","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09193","snapshot_observed_at":"2026-08-11T13:38:14.123422Z","title":"C.; and Nie, Y","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:14.123422Z"},"links":{"cited_paper":"/paper/2311.09193","citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:896c2bb046fd58dcf75b5e016925847bae6e4c553099fb9a01ebfdbe77585f7d","observation_id":"2a6769f1-860c-4fbf-a0f5-be13c7bc6c1d","resolution":{"observed_at":"2026-08-11T13:38:14.123422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18357","last_updated":"2024-06-11T07:41:03Z","snapshot_observed_at":"2026-08-12T23:55:56.552507Z","submitted_at":"2024-05-28T16:55:33Z","title":"Faithful Logical Reasoning via Symbolic Chain-of-Thought","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18357","snapshot_observed_at":"2026-08-11T13:38:14.126778Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:14.126778Z"},"links":{"cited_paper":"/paper/2405.18357","citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:3fff81f3d72173058cfb190befebcb570386df90771e12935cb8b528c3448c10","observation_id":"47751f60-6b9c-463a-ae0d-459d1c858fb6","resolution":{"observed_at":"2026-08-11T13:38:14.126778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16502","last_updated":"2024-06-13T15:02:39Z","snapshot_observed_at":"2026-08-13T09:07:54.479155Z","submitted_at":"2023-11-27T17:33:21Z","title":"MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16502","snapshot_observed_at":"2026-08-11T13:38:14.130433Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:14.130433Z"},"links":{"cited_paper":"/paper/2311.16502","citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:cd66a60b6d9c2a0797d575f330abf6470e254e9352ef16444bac57ea7d27e355","observation_id":"1ff5d7f2-ed6e-45dc-bfe8-47372802bdc2","resolution":{"observed_at":"2026-08-11T13:38:14.130433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:38:14.420708Z","title":null,"venue":null,"work_id":"55f06646-885f-4b9e-84f3-c33b1e52d86d","year":2019},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:14.134018Z"},"links":{"citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:4d68fb9b3d5e1a7d039e2fa53648f387b9444e950ce23e1334f694b768543c99","observation_id":"6cb29fa8-a492-4297-887d-5ef4b222f7be","resolution":{"observed_at":"2026-08-11T13:38:14.424158Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12226","last_updated":"2025-09-08T07:04:17Z","snapshot_observed_at":"2026-08-13T04:15:20.480186Z","submitted_at":"2024-02-19T15:33:10Z","title":"AnyGPT: Unified Multimodal LLM with Discrete Sequence Modeling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12226","snapshot_observed_at":"2026-08-11T13:38:14.137261Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:14.137261Z"},"links":{"cited_paper":"/paper/2402.12226","citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:c69cff1ecd16c48799810fd920ada9584a5d390a9019fdba4fe827212abbe8f4","observation_id":"85b6cef6-180c-469e-a7e4-e54085e4c354","resolution":{"observed_at":"2026-08-11T13:38:14.137261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02582","last_updated":"2024-01-05T00:26:07Z","snapshot_observed_at":"2026-08-13T04:48:43.403607Z","submitted_at":"2024-01-05T00:26:07Z","title":"CoCoT: Contrastive Chain-of-Thought Prompting for Large Multimodal Models with Multiple Image Inputs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02582","snapshot_observed_at":"2026-08-11T13:38:14.141106Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:14.141106Z"},"links":{"cited_paper":"/paper/2401.02582","citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:a220966e5478101d159b4376396e2a7bf8310d44763c70e52cba349354478b5a","observation_id":"5a18b25a-5a27-454c-825a-af4e52c2f3e2","resolution":{"observed_at":"2026-08-11T13:38:14.141106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:38:14.145181Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:14.145181Z"},"links":{"citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:e72d84b5a61b3b3a9e02e011f6b88b47426f4afc8308f435cdfa1ba9e69a66d8","observation_id":"1cd17fb7-3032-4d16-945a-305b1cbdbe31","resolution":{"observed_at":"2026-08-11T13:38:14.145181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-08-11T00:52:12.225793Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-11T13:38:14.148756Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:14.148756Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:e3affeaa298397e6f2d3885416e99f9e50cd848a50bd1a5d09bb744adb18a945","observation_id":"29b5c9b8-f9f7-4945-8f4d-5cbf1548a5f1","resolution":{"observed_at":"2026-08-11T13:38:14.148756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:38:14.402450Z","title":null,"venue":null,"work_id":"86bc2f94-50b2-4ee2-8643-7baef2c9e5cf","year":2024},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:14.152223Z"},"links":{"citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:b40e6bcca6892ec1164fb13c29552441827137b3e83b0a94b4a1131a9a49756a","observation_id":"0c7497cd-38ae-4c5e-934b-60964a4b1b1b","resolution":{"observed_at":"2026-08-11T13:38:14.407242Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-11T13:38:14.155401Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:14.155401Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:9e344be51c4e0f217c411f968ddde8071ed979c5c7dcb72aef1c45631d7193d3","observation_id":"bd71a01f-2ac2-4f74-8caf-d03740639725","resolution":{"observed_at":"2026-08-11T13:38:14.155401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":49,"verified_exact":0,"verified_fuzzy":6},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 4 inbound Pith citation observations for arXiv:2412.12932."}