{"as_of":"2026-08-09T23:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d875eec75aaf49ef6fff8e147b22ea8521bdff5ba6928ec1c441d43f0c3a40d0","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":23,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:02:24.955656Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-18T13:31:24.804270Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2405.16473","last_updated":"2024-05-26T07:56:30Z","snapshot_observed_at":"2026-08-09T14:34:23.303061Z","submitted_at":"2024-05-26T07:56:30Z","title":"M$^3$CoT: A Novel Benchmark for Multi-Domain Multi-step Multi-modal Chain-of-Thought","version":1},"cited_work":{"arxiv_id":"2405.16473","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.16473","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"M3cot: A novel bench- mark for multi-domain multi-step multi-modal chain-of-thought.arXiv preprint arXiv:2405.16473","venue":null,"work_id":"4d99c33a-262f-4545-baae-925205f5b2bc","year":2024},"citing_paper":{"arxiv_id":"2411.10442","last_updated":"2025-04-07T09:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-15T18:59:27Z","title":"Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-16T09:16:17.150383Z"},"links":{"cited_paper":"/paper/2405.16473","citing_paper":"/paper/2411.10442"},"observation_digest":"sha256:1d30d92b16764a8a05970a6456ce667d0c6c2b9dd762b486acd9cb2da1487e44","observation_id":"fa2db9a7-bd56-4ed2-8723-7abfc7ee438b","resolution":{"observed_at":"2026-05-16T09:16:17.430760Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16473","last_updated":"2024-05-26T07:56:30Z","snapshot_observed_at":"2026-08-09T14:34:23.303061Z","submitted_at":"2024-05-26T07:56:30Z","title":"M$^3$CoT: A Novel Benchmark for Multi-Domain Multi-step Multi-modal Chain-of-Thought","version":1},"cited_work":{"arxiv_id":"2405.16473","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.16473","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"M3cot: A novel bench- mark for multi-domain multi-step multi-modal chain-of-thought.arXiv preprint arXiv:2405.16473","venue":null,"work_id":"4d99c33a-262f-4545-baae-925205f5b2bc","year":2024},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"cited_paper":"/paper/2405.16473","citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:4a20fcb663a4a0337c9b2873a47a12f656d87419f731e5120ef755dc09b5a71d","observation_id":"3b253375-e068-4098-b7f3-71a665c88a01","resolution":{"observed_at":"2026-05-10T13:41:08.233339Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16473","last_updated":"2024-05-26T07:56:30Z","snapshot_observed_at":"2026-08-09T14:34:23.303061Z","submitted_at":"2024-05-26T07:56:30Z","title":"M$^3$CoT: A Novel Benchmark for Multi-Domain Multi-step Multi-modal Chain-of-Thought","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16473","snapshot_observed_at":"2026-08-07T15:02:24.955656Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16579","last_updated":"2025-05-22T12:14:23Z","snapshot_observed_at":"2026-08-09T20:20:59.205626Z","submitted_at":"2025-05-22T12:14:23Z","title":"Bridging the Dynamic Perception Gap: Training-Free Draft Chain-of-Thought for Dynamic Multimodal Spatial Reasoning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T15:02:24.955656Z"},"links":{"cited_paper":"/paper/2405.16473","citing_paper":"/paper/2505.16579"},"observation_digest":"sha256:0515458c96b05b789fff32bcbe41877e0fe07132046ce2e01bcdd87025b4258a","observation_id":"a768fc52-f4a4-45e4-8ead-41ade8a9bbb9","resolution":{"observed_at":"2026-08-07T15:02:24.955656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16473","last_updated":"2024-05-26T07:56:30Z","snapshot_observed_at":"2026-08-09T14:34:23.303061Z","submitted_at":"2024-05-26T07:56:30Z","title":"M$^3$CoT: A Novel Benchmark for Multi-Domain Multi-step Multi-modal Chain-of-Thought","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16473","snapshot_observed_at":"2026-08-07T14:02:52.740516Z","title":"M 3 cot: A novel benchmark for multi-domain multi-step multi-modal chain-of- thought,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20223","last_updated":"2025-05-26T17:06:00Z","snapshot_observed_at":"2026-08-09T21:06:33.120007Z","submitted_at":"2025-05-26T17:06:00Z","title":"Chain-of-Thought for Autonomous Driving: A Comprehensive Survey and Future Prospects","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:52.740516Z"},"links":{"cited_paper":"/paper/2405.16473","citing_paper":"/paper/2505.20223"},"observation_digest":"sha256:760adbe580bd426771d1641aade6f5b927596599b138ee4ebcdd5b88db642f00","observation_id":"63d556ef-4e20-4813-b7d4-3824b8e545b1","resolution":{"observed_at":"2026-08-07T14:02:52.740516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16473","last_updated":"2024-05-26T07:56:30Z","snapshot_observed_at":"2026-08-09T14:34:23.303061Z","submitted_at":"2024-05-26T07:56:30Z","title":"M$^3$CoT: A Novel Benchmark for Multi-Domain Multi-step Multi-modal Chain-of-Thought","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16473","snapshot_observed_at":"2026-08-07T13:19:32.456049Z","title":"M ˆ3cot: A novel benchmark for multi-domain multi-step multi-modal chain-of- thought,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22112","last_updated":"2025-05-28T08:40:55Z","snapshot_observed_at":"2026-08-09T17:19:50.309489Z","submitted_at":"2025-05-28T08:40:55Z","title":"Visual Large Language Models Exhibit Human-Level Cognitive Flexibility in the Wisconsin Card Sorting Test","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T13:19:32.456049Z"},"links":{"cited_paper":"/paper/2405.16473","citing_paper":"/paper/2505.22112"},"observation_digest":"sha256:9e57eb898471336e08498e8825256ae7d45605ba3232ebb8e9ed2a409cafcbfb","observation_id":"5ef36ba9-0092-47a9-846d-f92be3f14d16","resolution":{"observed_at":"2026-08-07T13:19:32.456049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16473","last_updated":"2024-05-26T07:56:30Z","snapshot_observed_at":"2026-08-09T14:34:23.303061Z","submitted_at":"2024-05-26T07:56:30Z","title":"M$^3$CoT: A Novel Benchmark for Multi-Domain Multi-step Multi-modal Chain-of-Thought","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16473","snapshot_observed_at":"2026-08-07T13:12:53.142788Z","title":"M3cot: A novel benchmark for multi-domain multi-step multi-modal chain-of-thought","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:53.142788Z"},"links":{"cited_paper":"/paper/2405.16473","citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:97abb85be47bc51db821c6647a887b15e5501a4fcf2c5f28a2e09292f95ff2e8","observation_id":"d6e6e4a9-3d92-4866-95c0-a526d30c03aa","resolution":{"observed_at":"2026-08-07T13:12:53.142788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16473","last_updated":"2024-05-26T07:56:30Z","snapshot_observed_at":"2026-08-09T14:34:23.303061Z","submitted_at":"2024-05-26T07:56:30Z","title":"M$^3$CoT: A Novel Benchmark for Multi-Domain Multi-step Multi-modal Chain-of-Thought","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16473","snapshot_observed_at":"2026-08-07T11:55:12.014182Z","title":"M3cot: A novel benchmark for multi-domain multi-step multi-modal chain-of-thought.arXiv preprint arXiv:2405.16473, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:12.014182Z"},"links":{"cited_paper":"/paper/2405.16473","citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:d78b074d26954c069cfff9c612cc96675b4966650de5f9e78e820a0d835b8173","observation_id":"c9ff8af9-fef5-462a-8545-4a856cbd90e8","resolution":{"observed_at":"2026-08-07T11:55:12.014182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16473","last_updated":"2024-05-26T07:56:30Z","snapshot_observed_at":"2026-08-09T14:34:23.303061Z","submitted_at":"2024-05-26T07:56:30Z","title":"M$^3$CoT: A Novel Benchmark for Multi-Domain Multi-step Multi-modal Chain-of-Thought","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16473","snapshot_observed_at":"2026-08-07T11:05:19.193447Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-09T12:57:20.961064Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.193447Z"},"links":{"cited_paper":"/paper/2405.16473","citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:ee8a074fccec1fcd54e8dbb22686e14d0a8895d32ba222f8bfc284b43add0a92","observation_id":"2760d9a4-0362-4c1d-a434-7a40e9ef31e0","resolution":{"observed_at":"2026-08-07T11:05:19.193447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16473","last_updated":"2024-05-26T07:56:30Z","snapshot_observed_at":"2026-08-09T14:34:23.303061Z","submitted_at":"2024-05-26T07:56:30Z","title":"M$^3$CoT: A Novel Benchmark for Multi-Domain Multi-step Multi-modal Chain-of-Thought","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16473","snapshot_observed_at":"2026-08-07T05:25:30.344139Z","title":"M 3cot: A novel benchmark for multi-domain multi-step multi-modal chain-of-thought, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-08T00:05:54.804087Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.344139Z"},"links":{"cited_paper":"/paper/2405.16473","citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:f620878f5960d9cd11587103a2321e2af4e300822ba78578a35fa0b9b9683e68","observation_id":"5cfa213e-4e85-4600-8e5a-d68347522cd7","resolution":{"observed_at":"2026-08-07T05:25:30.344139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16473","last_updated":"2024-05-26T07:56:30Z","snapshot_observed_at":"2026-08-09T14:34:23.303061Z","submitted_at":"2024-05-26T07:56:30Z","title":"M$^3$CoT: A Novel Benchmark for Multi-Domain Multi-step Multi-modal Chain-of-Thought","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16473","snapshot_observed_at":"2026-08-07T05:09:18.196208Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08691","last_updated":"2025-06-10T11:02:36Z","snapshot_observed_at":"2026-08-08T00:05:08.877544Z","submitted_at":"2025-06-10T11:02:36Z","title":"VReST: Enhancing Reasoning in Large Vision-Language Models through Tree Search and Self-Reward Mechanism","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T05:09:18.196208Z"},"links":{"cited_paper":"/paper/2405.16473","citing_paper":"/paper/2506.08691"},"observation_digest":"sha256:54305a562e7bf8db99d55b1d9c21bd884f07e3366f2537dddce5510f166bf517","observation_id":"23ace000-230b-4d70-a2f6-a22c80d74a04","resolution":{"observed_at":"2026-08-07T05:09:18.196208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16473","last_updated":"2024-05-26T07:56:30Z","snapshot_observed_at":"2026-08-09T14:34:23.303061Z","submitted_at":"2024-05-26T07:56:30Z","title":"M$^3$CoT: A Novel Benchmark for Multi-Domain Multi-step Multi-modal Chain-of-Thought","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16473","snapshot_observed_at":"2026-08-07T04:07:31.820419Z","title":"M ˆ3 cot: A novel benchmark for multi-domain multi-step multi-modal chain-of-thought","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-08T02:11:07.665188Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:31.820419Z"},"links":{"cited_paper":"/paper/2405.16473","citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:86796a9c09eea9abdd99c5fdd0be6f983dad32c7f93f2d7c663e20b62bd3a2a7","observation_id":"de2f71a6-6d3e-42c6-bc3f-951120f45647","resolution":{"observed_at":"2026-08-07T04:07:31.820419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16473","last_updated":"2024-05-26T07:56:30Z","snapshot_observed_at":"2026-08-09T14:34:23.303061Z","submitted_at":"2024-05-26T07:56:30Z","title":"M$^3$CoT: A Novel Benchmark for Multi-Domain Multi-step Multi-modal Chain-of-Thought","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16473","snapshot_observed_at":"2026-08-06T12:18:32.202517Z","title":"M 3 cot: A novel benchmark for multi- domain multi-step multi-modal chain-of-thought","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-09T07:14:16.143343Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:32.202517Z"},"links":{"cited_paper":"/paper/2405.16473","citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:b02f24d44ce58219726efc3055c83a029f84577fab44dc1514fc6683de2540d6","observation_id":"c5d95906-1dc0-47af-9f83-a6d76b8c75b1","resolution":{"observed_at":"2026-08-06T12:18:32.202517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16473","last_updated":"2024-05-26T07:56:30Z","snapshot_observed_at":"2026-08-09T14:34:23.303061Z","submitted_at":"2024-05-26T07:56:30Z","title":"M$^3$CoT: A Novel Benchmark for Multi-Domain Multi-step Multi-modal Chain-of-Thought","version":1},"cited_work":{"arxiv_id":"2405.16473","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.16473","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"M3cot: A novel bench- mark for multi-domain multi-step multi-modal chain-of-thought.arXiv preprint arXiv:2405.16473","venue":null,"work_id":"4d99c33a-262f-4545-baae-925205f5b2bc","year":2024},"citing_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-15T18:56:23.817544Z"},"links":{"cited_paper":"/paper/2405.16473","citing_paper":"/paper/2508.05748"},"observation_digest":"sha256:f467d03afd8b0a7fa441b0c8a14faac07edd1b2d0867b9c4d4ead4140234db33","observation_id":"499edf28-5844-4674-ab3d-bcb80ccd7474","resolution":{"observed_at":"2026-05-15T18:56:23.872966Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16473","last_updated":"2024-05-26T07:56:30Z","snapshot_observed_at":"2026-08-09T14:34:23.303061Z","submitted_at":"2024-05-26T07:56:30Z","title":"M$^3$CoT: A Novel Benchmark for Multi-Domain Multi-step Multi-modal Chain-of-Thought","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16473","snapshot_observed_at":"2026-08-05T19:03:06.028911Z","title":"M3 cot: A novel benchmark for multi-domain multi-step multi-modal chain-of-thought","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.13692","last_updated":"2025-08-19T09:52:04Z","snapshot_observed_at":"2026-08-09T03:24:13.317916Z","submitted_at":"2025-08-19T09:52:04Z","title":"HumanPCR: Probing MLLM Capabilities in Diverse Human-Centric Scenes","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T19:03:06.028911Z"},"links":{"cited_paper":"/paper/2405.16473","citing_paper":"/paper/2508.13692"},"observation_digest":"sha256:d6268ed2c504ff05464e472755d79d906a021ef54a9e770bdc2618d45cfce430","observation_id":"0fb856ae-46bb-4b18-8f01-dd3c23c85fdf","resolution":{"observed_at":"2026-08-05T19:03:06.028911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16473","last_updated":"2024-05-26T07:56:30Z","snapshot_observed_at":"2026-08-09T14:34:23.303061Z","submitted_at":"2024-05-26T07:56:30Z","title":"M$^3$CoT: A Novel Benchmark for Multi-Domain Multi-step Multi-modal Chain-of-Thought","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16473","snapshot_observed_at":"2026-08-04T18:17:16.302417Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.10059","last_updated":"2025-09-12T08:46:49Z","snapshot_observed_at":"2026-08-07T01:10:15.108476Z","submitted_at":"2025-09-12T08:46:49Z","title":"Multimodal Mathematical Reasoning Embedded in Aerial Vehicle Imagery: Benchmarking, Analysis, and Exploration","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-04T18:17:16.302417Z"},"links":{"cited_paper":"/paper/2405.16473","citing_paper":"/paper/2509.10059"},"observation_digest":"sha256:ffd8905c3f73dfc9a9809613991ba8e93fa13eeab30a76428193b284107911dc","observation_id":"93e0c80a-7cef-40ce-a675-08f108ee77f4","resolution":{"observed_at":"2026-08-04T18:17:16.302417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16473","last_updated":"2024-05-26T07:56:30Z","snapshot_observed_at":"2026-08-09T14:34:23.303061Z","submitted_at":"2024-05-26T07:56:30Z","title":"M$^3$CoT: A Novel Benchmark for Multi-Domain Multi-step Multi-modal Chain-of-Thought","version":1},"cited_work":{"arxiv_id":"2405.16473","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.16473","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"M3cot: A novel bench- mark for multi-domain multi-step multi-modal chain-of-thought.arXiv preprint arXiv:2405.16473","venue":null,"work_id":"4d99c33a-262f-4545-baae-925205f5b2bc","year":2024},"citing_paper":{"arxiv_id":"2509.25699","last_updated":"2026-07-21T17:19:46Z","snapshot_observed_at":"2026-08-04T13:42:58.327870Z","submitted_at":"2025-09-30T02:57:44Z","title":"AIM-CoT: Active Information-driven Multimodal Chain-of-Thought for Vision-Language Reasoning","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-18T13:30:10.620448Z"},"links":{"cited_paper":"/paper/2405.16473","citing_paper":"/paper/2509.25699"},"observation_digest":"sha256:32d32a378e2050eac85ee3238563bbeef43cf330cbf21f8061ef04483635da99","observation_id":"c59e1cb9-f502-49ef-a836-ce4960afb37d","resolution":{"observed_at":"2026-05-18T13:31:24.806625Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16473","last_updated":"2024-05-26T07:56:30Z","snapshot_observed_at":"2026-08-09T14:34:23.303061Z","submitted_at":"2024-05-26T07:56:30Z","title":"M$^3$CoT: A Novel Benchmark for Multi-Domain Multi-step Multi-modal Chain-of-Thought","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16473","snapshot_observed_at":"2026-08-04T13:42:59.320438Z","title":"M3cot: A novel bench- mark for multi-domain multi-step multi-modal chain-of-thought.arXiv preprint arXiv:2405.16473,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.25699","last_updated":"2026-07-21T17:19:46Z","snapshot_observed_at":"2026-08-04T13:42:58.327870Z","submitted_at":"2025-09-30T02:57:44Z","title":"AIM-CoT: Active Information-driven Multimodal Chain-of-Thought for Vision-Language Reasoning","version":4},"reference_index":2013,"source":"pdf_text","source_observed_at":"2026-08-04T13:42:59.320438Z"},"links":{"cited_paper":"/paper/2405.16473","citing_paper":"/paper/2509.25699"},"observation_digest":"sha256:fb0aa733cbc28b09c07ef9771468d15b7c53e0690f2d12415dcde3a416636a44","observation_id":"c33ecb02-7b77-4bc5-b8eb-9a0400c2620f","resolution":{"observed_at":"2026-08-04T13:42:59.320438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16473","last_updated":"2024-05-26T07:56:30Z","snapshot_observed_at":"2026-08-09T14:34:23.303061Z","submitted_at":"2024-05-26T07:56:30Z","title":"M$^3$CoT: A Novel Benchmark for Multi-Domain Multi-step Multi-modal Chain-of-Thought","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16473","snapshot_observed_at":"2026-08-03T18:25:01.437413Z","title":"1, 3, 5, 12","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.05530","last_updated":"2026-06-02T03:33:30Z","snapshot_observed_at":"2026-08-08T15:56:39.313246Z","submitted_at":"2025-12-05T08:41:44Z","title":"MIND: Multi-rationale INtegrated Discriminative Reasoning Framework for Multi-modal Large Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T18:25:01.437413Z"},"links":{"cited_paper":"/paper/2405.16473","citing_paper":"/paper/2512.05530"},"observation_digest":"sha256:e5b992faa2456a027336e15b92dd619baa60a30de6f7289df04545920b5f285f","observation_id":"bcdf53d7-3650-4256-8c03-e7f7d95c5f10","resolution":{"observed_at":"2026-08-03T18:25:01.437413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16473","last_updated":"2024-05-26T07:56:30Z","snapshot_observed_at":"2026-08-09T14:34:23.303061Z","submitted_at":"2024-05-26T07:56:30Z","title":"M$^3$CoT: A Novel Benchmark for Multi-Domain Multi-step Multi-modal Chain-of-Thought","version":1},"cited_work":{"arxiv_id":"2405.16473","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.16473","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"M3cot: A novel bench- mark for multi-domain multi-step multi-modal chain-of-thought.arXiv preprint arXiv:2405.16473","venue":null,"work_id":"4d99c33a-262f-4545-baae-925205f5b2bc","year":2024},"citing_paper":{"arxiv_id":"2604.05497","last_updated":"2026-04-07T06:41:05Z","snapshot_observed_at":"2026-07-06T22:54:12.531121Z","submitted_at":"2026-04-07T06:41:05Z","title":"Thinking Diffusion: Penalize and Guide Visual-Grounded Reasoning in Diffusion Multimodal Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T19:06:45.417233Z"},"links":{"cited_paper":"/paper/2405.16473","citing_paper":"/paper/2604.05497"},"observation_digest":"sha256:ad9842ec0ccaf18bb200df8e107ab3f7030b3351fdf5abbd54a3a66b0d865745","observation_id":"3098d1d8-c620-4482-bc2d-d54d5d21c7de","resolution":{"observed_at":"2026-05-10T23:30:50.458940Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16473","last_updated":"2024-05-26T07:56:30Z","snapshot_observed_at":"2026-08-09T14:34:23.303061Z","submitted_at":"2024-05-26T07:56:30Z","title":"M$^3$CoT: A Novel Benchmark for Multi-Domain Multi-step Multi-modal Chain-of-Thought","version":1},"cited_work":{"arxiv_id":"2405.16473","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.16473","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"M3cot: A novel bench- mark for multi-domain multi-step multi-modal chain-of-thought.arXiv preprint arXiv:2405.16473","venue":null,"work_id":"4d99c33a-262f-4545-baae-925205f5b2bc","year":2024},"citing_paper":{"arxiv_id":"2604.14646","last_updated":"2026-04-17T11:31:53Z","snapshot_observed_at":"2026-08-02T15:11:58.102043Z","submitted_at":"2026-04-16T05:52:18Z","title":"Targeted Exploration via Unified Entropy Control for Reinforcement Learning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T10:48:27.733823Z"},"links":{"cited_paper":"/paper/2405.16473","citing_paper":"/paper/2604.14646"},"observation_digest":"sha256:ad4c9f6a2e77f72d7fa04d3eb09788981111fd4498e5e962987e003a8e608f36","observation_id":"ce225f1b-afe4-473d-8aa3-b0b5418455d2","resolution":{"observed_at":"2026-05-10T10:49:56.104547Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16473","last_updated":"2024-05-26T07:56:30Z","snapshot_observed_at":"2026-08-09T14:34:23.303061Z","submitted_at":"2024-05-26T07:56:30Z","title":"M$^3$CoT: A Novel Benchmark for Multi-Domain Multi-step Multi-modal Chain-of-Thought","version":1},"cited_work":{"arxiv_id":"2405.16473","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.16473","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"M3cot: A novel bench- mark for multi-domain multi-step multi-modal chain-of-thought.arXiv preprint arXiv:2405.16473","venue":null,"work_id":"4d99c33a-262f-4545-baae-925205f5b2bc","year":2024},"citing_paper":{"arxiv_id":"2604.15705","last_updated":"2026-04-17T05:24:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-17T05:24:04Z","title":"Towards Robust Endogenous Reasoning: Unifying Drift Adaptation in Non-Stationary Tuning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-10T08:28:07.531338Z"},"links":{"cited_paper":"/paper/2405.16473","citing_paper":"/paper/2604.15705"},"observation_digest":"sha256:7d061c3ce751a0649dab77eff64704fb19edd42cac4253fe434930d1765f7579","observation_id":"d1e68568-458f-4b72-a105-3d1bd065df69","resolution":{"observed_at":"2026-05-10T09:03:26.437698Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16473","last_updated":"2024-05-26T07:56:30Z","snapshot_observed_at":"2026-08-09T14:34:23.303061Z","submitted_at":"2024-05-26T07:56:30Z","title":"M$^3$CoT: A Novel Benchmark for Multi-Domain Multi-step Multi-modal Chain-of-Thought","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16473","snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"arXiv preprint arXiv:2405.16473 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":255,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"cited_paper":"/paper/2405.16473","citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:112ce34c78f20e1b34ca08d65d2ef8e18263f475d6f4b5b8e4dc8fe2afb2a786","observation_id":"73f1b7c1-46c2-4eed-bd86-6c79507e911a","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16473","last_updated":"2024-05-26T07:56:30Z","snapshot_observed_at":"2026-08-09T14:34:23.303061Z","submitted_at":"2024-05-26T07:56:30Z","title":"M$^3$CoT: A Novel Benchmark for Multi-Domain Multi-step Multi-modal Chain-of-Thought","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16473","snapshot_observed_at":"2026-08-01T16:48:35.633314Z","title":"M 3 CoT: A novel benchmark for multi-domain multi-step multi-modal chain-of-thought.arXiv preprint arXiv:2405.16473,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17884","last_updated":"2026-07-20T12:35:05Z","snapshot_observed_at":"2026-08-07T08:03:33.617792Z","submitted_at":"2026-07-20T12:35:05Z","title":"ST-Veto: Spatio-Temporal Token Veto for Diffusion MLLMs via Taylor Prediction and Visual Grounding","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-01T16:48:35.633314Z"},"links":{"cited_paper":"/paper/2405.16473","citing_paper":"/paper/2607.17884"},"observation_digest":"sha256:8c51613dd958c1b0fc8fde0443f31f84c6aebd998361d9108f19dc7c27668a5b","observation_id":"ddfb857f-9aa0-4d81-9deb-23b1d1ad7ce0","resolution":{"observed_at":"2026-08-01T16:48:35.633314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2405.16473/citation-record","integrity":"/paper/2405.16473/integrity","json":"/paper/2405.16473/citation-record.json","paper":"/paper/2405.16473"},"outbound":[],"paper":{"arxiv_id":"2405.16473","last_updated":"2024-05-26T07:56:30Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T14:34:23.303061Z","submitted_at":"2024-05-26T07:56:30Z","title":"M$^3$CoT: A Novel Benchmark for Multi-Domain Multi-step Multi-modal Chain-of-Thought"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 23 inbound Pith citation observations for arXiv:2405.16473."}