{"as_of":"2026-08-20T04:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1be71d9756d925e690dd42cc05cab7e7697f7f2d6414b97dada9cee36b506af7","coverage":[{"denominator":92,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":92,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-23T20:10:59.264484Z","state":"measured"},{"denominator":105,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":105,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":13,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":13,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T23:54:23.129325Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-05-23T04:32:32.712337Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04509","snapshot_observed_at":"2026-08-11T23:54:23.129325Z","title":"Errorradar: Bench- marking complex mathematical reasoning of multi- modal large language models via error detection,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.02104","last_updated":"2024-12-03T02:54:31Z","snapshot_observed_at":"2026-08-16T12:56:12.864592Z","submitted_at":"2024-12-03T02:54:31Z","title":"Explainable and Interpretable Multimodal Large Language Models: A Comprehensive Survey","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T23:54:23.129325Z"},"links":{"cited_paper":"/paper/2410.04509","citing_paper":"/paper/2412.02104"},"observation_digest":"sha256:1a93a124b2c12607a0188525f9e95c21f7ca26b92959e16d0cfd2d3b7892623e","observation_id":"b878d1b5-5129-4ce4-8ac1-7417cb9acef9","resolution":{"observed_at":"2026-08-11T23:54:23.129325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04509","snapshot_observed_at":"2026-08-11T10:18:50.093213Z","title":"arXiv preprint arXiv:2410.04509","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.16838","last_updated":"2024-12-22T03:08:36Z","snapshot_observed_at":"2026-08-15T23:55:24.712078Z","submitted_at":"2024-12-22T03:08:36Z","title":"Ask-Before-Detection: Identifying and Mitigating Conformity Bias in LLM-Powered Error Detector for Math Word Problem Solutions","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T10:18:50.093213Z"},"links":{"cited_paper":"/paper/2410.04509","citing_paper":"/paper/2412.16838"},"observation_digest":"sha256:3430b3ff0084856c3c3764c8b939075da3f5214730e57849d43e3bc063f5ad2c","observation_id":"caee159e-ef80-446f-ae9d-b3b0e6de9ef3","resolution":{"observed_at":"2026-08-11T10:18:50.093213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04509","snapshot_observed_at":"2026-08-10T22:37:33.961647Z","title":"In Proceedings of the IEEE/CVF interna- tional conference on computer vision, 7209–7219","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01245","last_updated":"2025-01-02T13:12:12Z","snapshot_observed_at":"2026-08-20T01:41:50.115714Z","submitted_at":"2025-01-02T13:12:12Z","title":"SeFAR: Semi-supervised Fine-grained Action Recognition with Temporal Perturbation and Learning Stabilization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T22:37:33.961647Z"},"links":{"cited_paper":"/paper/2410.04509","citing_paper":"/paper/2501.01245"},"observation_digest":"sha256:b03fda075c86abf6c0bb57f3d1993e2df266c22008299d83719faf817184320f","observation_id":"9c605137-5d0b-461f-a0c0-26dfbf061253","resolution":{"observed_at":"2026-08-10T22:37:33.961647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04509","snapshot_observed_at":"2026-08-10T21:58:03.596038Z","title":"GT” represents ground truth, while “ReasonE,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2501.03124","last_updated":"2025-06-28T12:31:45Z","snapshot_observed_at":"2026-08-20T01:42:56.063261Z","submitted_at":"2025-01-06T16:31:45Z","title":"PRMBench: A Fine-grained and Challenging Benchmark for Process-Level Reward Models","version":5},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-10T21:58:03.596038Z"},"links":{"cited_paper":"/paper/2410.04509","citing_paper":"/paper/2501.03124"},"observation_digest":"sha256:92bdfcdb36036a15f700c08200b4625d235ccda8fb039c68faebfd3a66b90c18","observation_id":"d9f32bcb-afaf-402e-a709-a0de4b010f27","resolution":{"observed_at":"2026-08-10T21:58:03.596038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"cited_work":{"arxiv_id":"2410.04509","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.04509","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","venue":"cs.CL","work_id":"f8fbe6d1-f696-4bb2-be1b-8f1e271bec25","year":2024},"citing_paper":{"arxiv_id":"2502.02871","last_updated":"2026-04-20T02:18:01Z","snapshot_observed_at":"2026-08-17T11:21:07.508926Z","submitted_at":"2025-02-05T04:05:27Z","title":"Position: Multimodal Large Language Models Can Significantly Advance Scientific Reasoning","version":2},"reference_index":224,"source":"arxiv_source","source_observed_at":"2026-05-23T04:30:38.804702Z"},"links":{"cited_paper":"/paper/2410.04509","citing_paper":"/paper/2502.02871"},"observation_digest":"sha256:9822f333e3f5eac01e6f2c8db02f44833e5e9d29eb9ea6a30ac0e300ab99fc2d","observation_id":"0eabe05b-56f9-4448-8a95-946e31910d21","resolution":{"observed_at":"2026-05-23T04:32:32.716530Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04509","snapshot_observed_at":"2026-08-07T18:23:50.439693Z","title":"Errorradar: Benchmarking complex mathematical reason- ing of multimodal large language models via error detection.arXiv preprint arXiv:2410.04509, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-17T15:53:34.369922Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:50.439693Z"},"links":{"cited_paper":"/paper/2410.04509","citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:b71dfbd36e3ccc9275478f346105ea1d0190ccc8ee392f1195a7a5ab464830bf","observation_id":"54fc93e1-c672-4bc6-bd01-f06f3c2cd15f","resolution":{"observed_at":"2026-08-07T18:23:50.439693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04509","snapshot_observed_at":"2026-08-07T15:42:37.844699Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13965","last_updated":"2025-05-20T06:05:56Z","snapshot_observed_at":"2026-08-14T19:51:03.387786Z","submitted_at":"2025-05-20T06:05:56Z","title":"CAFES: A Collaborative Multi-Agent Framework for Multi-Granular Multimodal Essay Scoring","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:37.844699Z"},"links":{"cited_paper":"/paper/2410.04509","citing_paper":"/paper/2505.13965"},"observation_digest":"sha256:c85b5fb06fcee263d60083c02da8721a8b5fe906a0b6f34fc6154ba46c20c4c7","observation_id":"485367d5-0e3b-41e8-af3e-5c3530cf70f2","resolution":{"observed_at":"2026-08-07T15:42:37.844699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04509","snapshot_observed_at":"2026-08-07T15:39:20.619522Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14406","last_updated":"2025-09-09T05:59:48Z","snapshot_observed_at":"2026-08-16T10:26:23.700233Z","submitted_at":"2025-05-20T14:20:30Z","title":"Pierce the Mists, Greet the Sky: Decipher Knowledge Overshadowing via Knowledge Circuit Analysis","version":4},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T15:39:20.619522Z"},"links":{"cited_paper":"/paper/2410.04509","citing_paper":"/paper/2505.14406"},"observation_digest":"sha256:21a15c16bf962a1efbaa37f0ae44233cf55b12bc0464601dbfc78c388db728e1","observation_id":"f56b0be1-a536-4fe1-a031-b6364e5d2db8","resolution":{"observed_at":"2026-08-07T15:39:20.619522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04509","snapshot_observed_at":"2026-08-07T13:43:23.892898Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21191","last_updated":"2025-05-27T13:40:28Z","snapshot_observed_at":"2026-08-14T10:12:10.764232Z","submitted_at":"2025-05-27T13:40:28Z","title":"Unveiling Instruction-Specific Neurons & Experts: An Analytical Framework for LLM's Instruction-Following Capabilities","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T13:43:23.892898Z"},"links":{"cited_paper":"/paper/2410.04509","citing_paper":"/paper/2505.21191"},"observation_digest":"sha256:fb0eb702069646734e10d3c6912ae5bb050c9bb47dac0c69652d104666a487f3","observation_id":"b15cb36b-4ccc-4a3c-bd5c-af9a360c38a5","resolution":{"observed_at":"2026-08-07T13:43:23.892898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04509","snapshot_observed_at":"2026-08-07T10:39:59.415150Z","title":"Yu, Xuming Hu, and Qingsong Wen","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04688","last_updated":"2025-06-05T07:11:36Z","snapshot_observed_at":"2026-08-16T16:20:47.052704Z","submitted_at":"2025-06-05T07:11:36Z","title":"MMRefine: Unveiling the Obstacles to Robust Refinement in Multimodal Large Language Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T10:39:59.415150Z"},"links":{"cited_paper":"/paper/2410.04509","citing_paper":"/paper/2506.04688"},"observation_digest":"sha256:8e55c6200d1852ec30a242f0b2681b3676e9d4aad9ebbeda952a7916d358a440","observation_id":"8ffce526-ce49-4519-9858-9056ea838602","resolution":{"observed_at":"2026-08-07T10:39:59.415150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04509","snapshot_observed_at":"2026-08-06T22:03:30.637102Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22954","last_updated":"2025-06-28T17:18:23Z","snapshot_observed_at":"2026-08-14T21:16:48.464326Z","submitted_at":"2025-06-28T17:18:23Z","title":"Evaluating and Improving Large Language Models for Competitive Program Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T22:03:30.637102Z"},"links":{"cited_paper":"/paper/2410.04509","citing_paper":"/paper/2506.22954"},"observation_digest":"sha256:6b498abaaa574ba95406649cc20cf64878937442eec560de8219b8437ee0685e","observation_id":"592386d8-cadf-4471-b632-729753b65e9d","resolution":{"observed_at":"2026-08-06T22:03:30.637102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04509","snapshot_observed_at":"2026-08-06T01:00:28.516071Z","title":"S.; Hu, X.; and Wen, Q","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.04017","last_updated":"2025-08-06T02:13:46Z","snapshot_observed_at":"2026-08-18T03:59:13.888334Z","submitted_at":"2025-08-06T02:13:46Z","title":"Can Large Multimodal Models Actively Recognize Faulty Inputs? A Systematic Evaluation Framework of Their Input Scrutiny Ability","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T01:00:28.516071Z"},"links":{"cited_paper":"/paper/2410.04509","citing_paper":"/paper/2508.04017"},"observation_digest":"sha256:d8f56ccef0eb8294e57843f056e238f5879fe8859192ce4b010f0248c8038f42","observation_id":"6a1fae2a-88ec-4283-b890-89b596714d48","resolution":{"observed_at":"2026-08-06T01:00:28.516071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04509","snapshot_observed_at":"2026-08-06T00:59:53.846243Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.04088","last_updated":"2025-08-07T03:52:48Z","snapshot_observed_at":"2026-08-08T12:10:28.774282Z","submitted_at":"2025-08-06T05:10:29Z","title":"GM-PRM: A Generative Multimodal Process Reward Model for Multimodal Mathematical Reasoning","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T00:59:53.846243Z"},"links":{"cited_paper":"/paper/2410.04509","citing_paper":"/paper/2508.04088"},"observation_digest":"sha256:ade5d494ee8d658621ef76c97bfb0725c814bd456ea9d2f4beedd623920642f9","observation_id":"5d475765-52f1-4439-a241-eff51990eeac","resolution":{"observed_at":"2026-08-06T00:59:53.846243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2410.04509/citation-record","integrity":"/paper/2410.04509/integrity","json":"/paper/2410.04509/citation-record.json","paper":"/paper/2410.04509"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Complexity in declarative process models: Metrics and multi-modal assessment of cognitive load","venue":null,"work_id":"1ee02293-2053-435d-8aee-889440561a7e","year":2023},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:2b7b566932a518e13bff4d2d952b2e7d1423e0bd9daeb3b0a0d684b3363d19ec","observation_id":"391c2e3d-8ab0-4bb8-a7e8-0f1680031792","resolution":{"observed_at":"2026-05-23T20:13:25.675921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-17T03:25:04.404839Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":"2404.14219","doi":"10.48550/arxiv.2404.14219","metadata_source":"pith","pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","venue":"cs.CL","work_id":"feef9556-a016-493c-abd2-0c97a23a7ebf","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:ab8ade7bcea82e8285e198bb11c49281f21be1edb2baf358b5509fb045c05a3f","observation_id":"055423cd-2fb1-4a5f-a3ed-bdbab039e4d1","resolution":{"observed_at":"2026-05-23T20:13:24.713023Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling laws for generative mixed-modal language models","venue":null,"work_id":"3de8cfa1-6169-4a38-bd8e-2964eaa14519","year":2023},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:d066cc41657afd4ee0fe62b1668bc0c3e624cd394ff8ee1aae832eae85c36f71","observation_id":"081df14e-80ae-4bb1-ab08-30c62b6666a9","resolution":{"observed_at":"2026-05-23T20:13:25.680024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00157","last_updated":"2024-09-16T19:20:59Z","snapshot_observed_at":"2026-08-16T14:22:43.713388Z","submitted_at":"2024-01-31T20:26:32Z","title":"Large Language Models for Mathematical Reasoning: Progresses and Challenges","version":4},"cited_work":{"arxiv_id":"2402.00157","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.00157","snapshot_observed_at":"2026-07-04T11:39:46.423009Z","title":"Large language models for mathematical reasoning: Progresses and challenges","venue":null,"work_id":"d8278850-469f-40f1-8af5-cf634483852f","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2402.00157","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:79f107a5828aa7406978617d1bb9b579659c5d86ef0ad9c160f0a78ca468a93a","observation_id":"13237bbd-396e-47ce-8b20-4238944258aa","resolution":{"observed_at":"2026-05-23T20:13:24.615341Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Claude 3, 2024 a","venue":null,"work_id":"5d5c93d1-bc4b-49c7-8a95-2af693520c72","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:fc052f79e2713bf8df17cb73379e07913756550e340e1dae7ac81131a627da25","observation_id":"ccb84f09-1457-4698-b7fa-8999f8a525ca","resolution":{"observed_at":"2026-05-23T20:13:25.683997Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Claude 3.5, 2024 b","venue":null,"work_id":"d756d008-f7a3-462c-aac6-524cba9d7504","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:b9866a34691476a457881cad804f63e30000e875cc89fef98d91e9e8742856df","observation_id":"5e6cf1ad-5f67-473c-bd17-555a775c03ce","resolution":{"observed_at":"2026-05-23T20:13:25.804632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":"2308.12966","doi":"10.48550/arxiv.2308.12966","metadata_source":"pith","pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","venue":"cs.CV","work_id":"cbc2bb21-b6bb-46c0-80bf-107e195ffe10","year":2023},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:06163b42573ab5bade6fca2939de8d42e15f59f5b7d3eb602d4ec0629faf99ef","observation_id":"df8fda6c-3f85-440e-8684-a2f46e46d525","resolution":{"observed_at":"2026-05-23T20:13:25.026755Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03917","last_updated":"2023-06-06T18:00:01Z","snapshot_observed_at":"2026-08-16T15:26:04.610600Z","submitted_at":"2023-06-06T18:00:01Z","title":"Turning large language models into cognitive models","version":1},"cited_work":{"arxiv_id":"2306.03917","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.03917","snapshot_observed_at":"2026-07-03T20:58:57.612100Z","title":"Turning large language models into cognitive models","venue":null,"work_id":"8158d1c7-7bf2-4fad-bf95-c9c2ac68f07b","year":2023},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2306.03917","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:1bccc1855a0c1a231ffc8eefb5c844d6aef43d58b5421ed90861575b20ec8aed","observation_id":"8d8b027e-93cc-4830-a1cc-f388a5eda008","resolution":{"observed_at":"2026-05-23T20:13:25.022104Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Theoremqa: A theorem-driven question answering dataset","venue":null,"work_id":"6c737b23-3d39-4fd2-a682-b8081300522a","year":2023},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:e1642ab43f4831c1797856e206e0e863aff754ac7f78b54a10947edab95c14cd","observation_id":"4ca4f385-91cd-4b24-95d3-a76458269871","resolution":{"observed_at":"2026-05-23T20:13:25.808080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14238","last_updated":"2024-01-15T15:23:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-21T18:59:31Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","version":3},"cited_work":{"arxiv_id":"2312.14238","doi":"10.48550/arxiv.2312.14238","metadata_source":"pith","pith_arxiv_id":"2312.14238","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","venue":"cs.CV","work_id":"d9e035c7-9e23-4cc2-ad3e-be080fbbf2d9","year":2023},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2312.14238","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:88e0877d0264e116adb098ea17a984ea754bab360e182586754827e028c0a8e7","observation_id":"3be8ded9-a037-42a7-97eb-24e30023ecc7","resolution":{"observed_at":"2026-05-23T20:13:24.993510Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":"2110.14168","doi":"10.1002/j.1545-","metadata_source":"pith","pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Training Verifiers to Solve Math Word Problems","venue":"cs.LG","work_id":"acab1aa8-b4d6-40e0-a3ee-25341701dca2","year":2021},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:d3c507285764da4c4b13af5eca4bdb947f647910f6fd9adf30ee3dc3553f2138","observation_id":"ce162e8b-2af0-4b96-8ef1-f74d6e85f1d2","resolution":{"observed_at":"2026-05-23T20:13:24.981889Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A survey on multimodal large language models for autonomous driving","venue":null,"work_id":"5aa45d1f-8937-4bb3-aad3-f1aefbdd3222","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:81932ad355a31b1198243b991d9d42368d0a1edd35c49acd13ffb7c9b5162c60","observation_id":"9dc97bf6-0f72-4722-8dcd-ec1e2a400ba1","resolution":{"observed_at":"2026-05-23T20:13:25.793952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advancing mathematics by guiding human intuition with ai","venue":null,"work_id":"e345c1fe-48eb-4d3d-b3d7-8a8c00d7dbfa","year":2021},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:46e51b3c72f4a65d1cc446022382e0c25115b3edec6165728d00cd2f2f2aa7d2","observation_id":"16026aa9-6449-4604-a689-020543105388","resolution":{"observed_at":"2026-05-23T20:13:25.801048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.11737","last_updated":"2024-07-06T05:26:33Z","snapshot_observed_at":"2026-08-17T16:09:27.761643Z","submitted_at":"2022-09-23T17:34:33Z","title":"Visual representations in the human brain are aligned with large language models","version":2},"cited_work":{"arxiv_id":"2209.11737","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2209.11737","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual representations in the human brain are aligned with large language models","venue":null,"work_id":"142db49b-70fe-4519-ac35-4e0b61bfbcc3","year":2022},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2209.11737","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:3b5cffc466e3327769d5b4d2b68f7293124e8dc8fcef0499e0c20ce0c8dfca3a","observation_id":"21518bc5-3b88-484c-822b-15c1805cd1d6","resolution":{"observed_at":"2026-05-23T20:13:25.031867Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Muffin or chihuahua? challenging multimodal large language models with multipanel vqa","venue":null,"work_id":"3f293718-4c26-40d2-8901-96927a8e268d","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:653be0999ede2d418a502259ec37cb3a4c7fe7049178b59270658fbedb560149","observation_id":"52922b22-c1d3-45ca-bf92-467dfa39452a","resolution":{"observed_at":"2026-05-23T20:13:25.790354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05876","last_updated":"2024-10-23T14:48:20Z","snapshot_observed_at":"2026-08-18T06:57:31.580917Z","submitted_at":"2023-11-10T05:24:04Z","title":"Trends in Integration of Knowledge and Large Language Models: A Survey and Taxonomy of Methods, Benchmarks, and Applications","version":3},"cited_work":{"arxiv_id":"2311.05876","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.05876","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Trends in integration of knowledge and large language models: A survey and taxonomy of methods, benchmarks, and applications","venue":null,"work_id":"fe71bea2-99e2-46f5-ae9f-d2dbbac937d6","year":2023},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2311.05876","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:3fda5c6e456b3bae8c299004b5c50f8269b4def0ffe46028e12e7a6f2196c61a","observation_id":"c17fe3b3-ce1f-488e-ab6a-d6b5706b8563","resolution":{"observed_at":"2026-05-23T20:13:24.742490Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01266","last_updated":"2024-08-18T23:48:44Z","snapshot_observed_at":"2026-08-16T14:04:34.571745Z","submitted_at":"2024-04-01T17:43:27Z","title":"IsoBench: Benchmarking Multimodal Foundation Models on Isomorphic Representations","version":3},"cited_work":{"arxiv_id":"2404.01266","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.01266","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Isobench: Benchmarking multimodal foundation models on isomorphic representations","venue":null,"work_id":"4ee4a08a-ffd0-4312-b562-0bfb90e419c9","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2404.01266","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:dc2efa84c4829dc2e831bce7014355c3e74c11ffedbc7a9833dd33b3b4cc2556","observation_id":"e53d8485-5e44-4821-8c36-a047c854cde0","resolution":{"observed_at":"2026-05-23T20:13:24.891338Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12793","last_updated":"2024-07-30T03:58:11Z","snapshot_observed_at":"2026-08-14T09:56:00.692687Z","submitted_at":"2024-06-18T16:58:21Z","title":"ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools","version":2},"cited_work":{"arxiv_id":"2406.12793","doi":"10.48550/arxiv.2406.12793","metadata_source":"pith","pith_arxiv_id":"2406.12793","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools","venue":"cs.CL","work_id":"de9ce5af-0d8d-4b94-9793-64968d9bc06d","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2406.12793","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:eec274393fe57d500765e7178d567ca07a6ab19f70c22bc3163e2f1ce318aef5","observation_id":"33cedaae-dab5-4308-868d-eabed4c4ea68","resolution":{"observed_at":"2026-05-23T20:13:24.896437Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16831","last_updated":"2025-01-22T08:45:56Z","snapshot_observed_at":"2026-08-16T16:31:24.663447Z","submitted_at":"2024-03-25T14:57:18Z","title":"UrbanVLP: Multi-Granularity Vision-Language Pretraining for Urban Socioeconomic Indicator Prediction","version":3},"cited_work":{"arxiv_id":"2403.16831","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.16831","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Urbanvlp: A multi-granularity vision-language pre-trained foundation model for urban indicator prediction","venue":null,"work_id":"6feff56a-4407-41e0-b645-b5465d08efa4","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2403.16831","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:8037bd1e05463f701a3598f9f87f4543b8f17f5a0c809d317f56a530affede61","observation_id":"61b1e7d4-020b-45a2-a222-07c3f5485eaf","resolution":{"observed_at":"2026-05-23T20:13:24.871280Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02797","last_updated":"2025-01-16T02:31:20Z","snapshot_observed_at":"2026-08-16T14:29:37.108331Z","submitted_at":"2024-01-05T13:22:12Z","title":"PeFoMed: Parameter Efficient Fine-tuning of Multimodal Large Language Models for Medical Imaging","version":3},"cited_work":{"arxiv_id":"2401.02797","doi":"10.48550/arxiv.2401.02797","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.02797","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pefomed: Parameter efficient fine-tuning on multimodal large language models for medical visual question answering","venue":"arXiv (Cornell University)","work_id":"0855448c-e4c2-4773-9a60-85a34b3344a9","year":2025},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2401.02797","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:1db36e7d9fdcf54bc5b391993e71746409ccacbe96acfa2df7366eee43ea7c3d","observation_id":"868a8b7a-3584-45a6-9cac-c12faeedf4c6","resolution":{"observed_at":"2026-05-23T20:13:24.825358Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14011","last_updated":"2024-05-08T07:34:06Z","snapshot_observed_at":"2026-08-16T14:24:38.945790Z","submitted_at":"2024-01-25T08:22:10Z","title":"CMMU: A Benchmark for Chinese Multi-modal Multi-type Question Understanding and Reasoning","version":3},"cited_work":{"arxiv_id":"2401.14011","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.14011","snapshot_observed_at":"2026-06-29T08:03:13.744710Z","title":"Cmmu: A benchmark for chinese multi-modal multi-type question understanding and reasoning","venue":null,"work_id":"f45bcb08-502d-40a7-895c-7f252c90f29b","year":2021},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2401.14011","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:13588fa0f9133515c4d4fbf1cf24ff107b494dc2ddc9893e00a198dfe6d081db","observation_id":"afc6ffdf-2f90-4c99-9de8-680fd9e1e13c","resolution":{"observed_at":"2026-05-23T20:13:25.003350Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":"2103.03874","doi":"10.48550/arxiv.2103.03874","metadata_source":"pith","pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","venue":"cs.LG","work_id":"50652ac6-fb7c-4675-a2c2-159c241feb17","year":2021},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:24b419fd7cf22249d748b7b473187ce8e1c91648ee507595dcadc688a1fd9e4f","observation_id":"61c2cfe1-22c8-449d-b678-ebbc4c2dbc27","resolution":{"observed_at":"2026-05-23T20:13:24.728474Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-07-14T18:20:22.649941+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T18:20:22.649941+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09403","last_updated":"2024-11-11T00:54:32Z","snapshot_observed_at":"2026-08-16T13:43:12.869356Z","submitted_at":"2024-06-13T17:59:31Z","title":"Visual Sketchpad: Sketching as a Visual Chain of Thought for Multimodal Language Models","version":3},"cited_work":{"arxiv_id":"2406.09403","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.09403","snapshot_observed_at":"2026-07-04T19:30:06.763408Z","title":"Visual sketchpad: Sketching as a visual chain of thought for multimodal language models","venue":null,"work_id":"6df227a2-7a70-47c8-ae06-b2d6eee27a57","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2406.09403","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:bb4b5e21095964e27dc1885e6c9e90676658ad2827d0aa5a312873a6d650ed80","observation_id":"8900b923-fec1-4134-bf1e-df2e0167bfa0","resolution":{"observed_at":"2026-05-23T20:13:24.850060Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11193","last_updated":"2024-10-01T17:04:22Z","snapshot_observed_at":"2026-08-20T02:40:25.224185Z","submitted_at":"2024-06-17T03:59:44Z","title":"MMNeuron: Discovering Neuron-Level Domain-Specific Interpretation in Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":"2406.11193","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.11193","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mmneuron: Discovering neuron-level domain-specific interpretation in multimodal large language model","venue":null,"work_id":"f4e4a2bf-b895-4921-b285-f05ced042360","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2406.11193","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:002557e81021985976b98a46862242d50fe010a0124fe649f2f28177ed6acda8","observation_id":"ec757e1c-078f-417a-9525-dc588045b480","resolution":{"observed_at":"2026-05-23T20:13:24.854814Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14604","last_updated":"2024-04-26T02:34:29Z","snapshot_observed_at":"2026-08-16T13:58:43.531758Z","submitted_at":"2024-04-22T21:59:35Z","title":"Describe-then-Reason: Improving Multimodal Mathematical Reasoning through Visual Comprehension Training","version":3},"cited_work":{"arxiv_id":"2404.14604","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.14604","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Describe-then-reason: Improving multimodal mathematical reasoning through visual comprehension training","venue":null,"work_id":"29b530c1-80b0-4313-9e08-444e596aad3a","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2404.14604","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:b7108e09fdd48c0c59a61c2ead001242c16b87a3ed138b00ce04484b7176ade8","observation_id":"ccc2ac53-320e-476b-a810-444d8c4da6bf","resolution":{"observed_at":"2026-05-23T20:13:24.883048Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"New generation deep learning for video object detection: A survey","venue":null,"work_id":"5a620f91-2fa0-4f60-b779-4d2a3afbe039","year":2021},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:679a5ba219351be6b4b00494747809b9c0f5d6e67798a92dd8432facc6d644e0","observation_id":"1817a52e-bc03-4163-845e-e23b32334315","resolution":{"observed_at":"2026-05-23T20:13:25.797268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning instance-level representation for large-scale multi-modal pretraining in e-commerce","venue":null,"work_id":"8c12407e-598a-4ba7-9156-5e8a5529a103","year":2023},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:7239539e4ff5e251f300ca57bc0f3498265bda4298f172fa12dee51ebdec9232","observation_id":"1e079590-4b40-45db-8bf9-78b8a447502e","resolution":{"observed_at":"2026-05-23T20:13:25.823018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Large language models struggle to learn long-tail knowledge","venue":null,"work_id":"bad51c47-d5bd-4135-a9f7-bfae61b6c993","year":2023},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:ea1220a747d4dbc818d3de6b068697557eea5bcc68412e8c4dea58c0f0249633","observation_id":"fd89f66e-3a2a-42cd-9720-86d0ad964e32","resolution":{"observed_at":"2026-05-23T20:13:25.778712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":"2001.08361","doi":"10.1145/3616855.3635845","metadata_source":"pith","pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Laws for Neural Language Models","venue":"cs.LG","work_id":"b7dd8749-9c45-4977-ab9b-64478dce1ae8","year":2020},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:295bebd31deb727f53140f1dc6cfc9cf9fa20444d4d062c93c4f025db127b79a","observation_id":"10420b75-8e73-4209-bad3-e386591f6652","resolution":{"observed_at":"2026-05-23T20:13:24.699095Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cognitive load theory: An applied reintroduction for special and general educators","venue":null,"work_id":"146e0c8e-e393-4171-a091-31455b0bcdf9","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:b96ea18fdbd710c21d3b25ad66a1b9782530ab8e4c9d6f4892f55108e2d575b2","observation_id":"73b4a142-6d39-40c3-9099-df106ddfdfb6","resolution":{"observed_at":"2026-05-23T20:13:25.710619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T00:05:48.313381Z","title":"Large language models are zero-shot reasoners","venue":null,"work_id":"d4bd155e-4771-4421-89e1-851500eaaea7","year":2022},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:182e5947171df5a742c267201b224ef91bb59d9c72f3560dec55ab274cd887d4","observation_id":"d3ceb4ea-2a12-403f-92e2-70ad657c6bfc","resolution":{"observed_at":"2026-05-23T20:13:25.770497Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Solving quantitative reasoning problems with language models","venue":null,"work_id":"48f21f4d-a21b-4e9b-9bde-4aeb438dde54","year":2022},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:fc0d896798d7286f80771c6e512c92c3e09cdeee42cd5d205fcbdf342159c2a5","observation_id":"bc925469-d196-4f80-a92e-8f719e36071c","resolution":{"observed_at":"2026-05-23T20:13:25.766527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14601","last_updated":"2024-06-28T23:43:07Z","snapshot_observed_at":"2026-08-16T14:21:57.970276Z","submitted_at":"2024-02-02T23:54:51Z","title":"Bringing Generative AI to Adaptive Learning in Education","version":3},"cited_work":{"arxiv_id":"2402.14601","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.14601","snapshot_observed_at":"2026-07-02T03:26:29.643289Z","title":"Bringing generative ai to adaptive learning in education","venue":null,"work_id":"c7494bd8-0942-4588-bbfa-869595bfed8e","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2402.14601","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:2aa6c7f8a6fea09e2353bd5a7393aac4aa090d76a36d1abda8fbc5dbefaf6d84","observation_id":"ca615388-f73a-4a0b-9df3-4df1a512c422","resolution":{"observed_at":"2026-05-23T20:13:25.068959Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00755","last_updated":"2024-06-02T14:16:24Z","snapshot_observed_at":"2026-08-17T04:07:36.271566Z","submitted_at":"2024-06-02T14:16:24Z","title":"Evaluating Mathematical Reasoning of Large Language Models: A Focus on Error Identification and Correction","version":1},"cited_work":{"arxiv_id":"2406.00755","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.00755","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Evaluating mathematical reasoning of large language models: A focus on error identification and correction","venue":null,"work_id":"db385252-3b8b-4ef3-bb00-fbbdadd75a74","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2406.00755","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:aa61dba500beacb617c59a53e678663f9f2ae75abb153252b785a9e2246bd7a8","observation_id":"14d40029-233f-43c0-99e7-30d1188c3bdf","resolution":{"observed_at":"2026-05-23T20:13:24.840001Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12023","last_updated":"2024-06-28T02:35:51Z","snapshot_observed_at":"2026-08-19T19:07:32.939439Z","submitted_at":"2024-06-28T02:35:51Z","title":"CMMaTH: A Chinese Multi-modal Math Skill Evaluation Benchmark for Foundation Models","version":1},"cited_work":{"arxiv_id":"2407.12023","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.12023","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cmmath: A chinese multi-modal math skill evaluation benchmark for foundation models","venue":null,"work_id":"26b490ed-f728-417e-8ab7-491bcea182c9","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2407.12023","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:2128f1c45955e4fd471f8e26da768f6718fa199fcffdbb162e9e8152ebe259a7","observation_id":"e4a372f3-2979-437e-8640-101eb7831d61","resolution":{"observed_at":"2026-05-23T20:13:24.901744Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llava-next: Improved reasoning, ocr, and world knowledge, January 2024 a","venue":null,"work_id":"e35e61af-4d6f-449c-b8db-68e023455da6","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:d2f333e64bb6e8a953a091244bb7f7a4dc1ba45b83e0957dc5a38e8f4ec13ecc","observation_id":"981eb948-3025-48ee-83e2-0d6677026d28","resolution":{"observed_at":"2026-05-23T20:13:25.758496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12209","last_updated":"2024-05-20T17:52:29Z","snapshot_observed_at":"2026-08-19T03:39:46.295732Z","submitted_at":"2024-05-20T17:52:29Z","title":"MathBench: Evaluating the Theory and Application Proficiency of LLMs with a Hierarchical Mathematics Benchmark","version":1},"cited_work":{"arxiv_id":"2405.12209","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.12209","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mathbench: Evaluating the theory and application proficiency of llms with a hierarchical mathematics benchmark","venue":null,"work_id":"871a28f2-26b4-44f2-867a-a46d44601ff7","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2405.12209","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:8caa5f0b88cb3ded7aa4bddec27d9025b35b02a6ac8767b5aa4c21e934c959ff","observation_id":"a4fb8dfe-28f1-432b-9c51-6b8ead269c3b","resolution":{"observed_at":"2026-05-23T20:13:24.804839Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17644","last_updated":"2024-06-09T13:54:09Z","snapshot_observed_at":"2026-08-16T14:14:50.337466Z","submitted_at":"2024-02-27T16:15:03Z","title":"Are LLMs Capable of Data-based Statistical and Causal Reasoning? Benchmarking Advanced Quantitative Reasoning with Data","version":2},"cited_work":{"arxiv_id":"2402.17644","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.17644","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Are llms capable of data-based statistical and causal reasoning? benchmarking advanced quantitative reasoning with data","venue":null,"work_id":"6379dfdb-8b2c-4827-9ae8-7e2610b15d6b","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2402.17644","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:c058ab80ee267ac740e2129d4912c91bd01f3e2406410e4e357fc9f75fe4af46","observation_id":"213f5ab0-6c1f-454d-809c-372f739c275f","resolution":{"observed_at":"2026-05-23T20:13:25.074552Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-19T16:22:29.898436Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":"2403.05525","doi":"10.48550/arxiv.2403.05525","metadata_source":"pith","pith_arxiv_id":"2403.05525","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","venue":"cs.AI","work_id":"30da36a4-b9ad-4618-8955-c09232b61343","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2403.05525","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:475eaa05e6e743dcc86a797593aadad9565e713efcef0958536ecfe4bc95b713","observation_id":"bb2f1cd8-6e24-43f5-8ac0-7e500414bbac","resolution":{"observed_at":"2026-05-23T20:13:24.784013Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10535","last_updated":"2023-06-22T01:37:02Z","snapshot_observed_at":"2026-08-18T21:20:07.057510Z","submitted_at":"2022-12-20T18:46:16Z","title":"A Survey of Deep Learning for Mathematical Reasoning","version":2},"cited_work":{"arxiv_id":"2212.10535","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.10535","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A survey of deep learning for mathematical reasoning","venue":null,"work_id":"cce57d28-ad56-4c02-b935-44cc1fff91d8","year":2022},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2212.10535","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:7952815126bb273c9f6abcb8328f333cb8bfc8d7f4fb6ff3d37cb10ed589027f","observation_id":"4add98e9-d240-4094-9622-d47fb5d22cda","resolution":{"observed_at":"2026-05-23T20:13:24.737121Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":"2310.02255","doi":"10.1109/cvpr52734.2025.01245","metadata_source":"pith","pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","venue":"cs.CV","work_id":"e22c3789-9e71-4242-b6ea-3e60e06e2b66","year":2023},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:9953e25a8cdb9d1197607b5f0b8630e9051127cd03b82178d9255dbff7e72ef0","observation_id":"740ff5f3-23ef-4f57-877e-1a072ddbc86d","resolution":{"observed_at":"2026-05-23T20:13:24.722988Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chameleon: Plug-and-play compositional reasoning with large language models","venue":null,"work_id":"85f4c65a-ee81-40ab-8782-a0b430bd8d53","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:7d223642126d7ce6c28ac7c98f94138dff54a8b845eb19a70a83c32b3ba84fb5","observation_id":"5ae4255b-12a5-483b-a923-2ccbaea78250","resolution":{"observed_at":"2026-05-23T20:13:25.762166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.06196","last_updated":"2025-03-23T14:51:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-09T05:37:09Z","title":"Large Language Models: A Survey","version":3},"cited_work":{"arxiv_id":"2402.06196","doi":"10.48550/arxiv.2402.06196","metadata_source":"pith","pith_arxiv_id":"2402.06196","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Language Models: A Survey","venue":"cs.CL","work_id":"54e385fe-1786-48c3-8aa0-d727210eb50e","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2402.06196","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:4c16ecc858acd47a6ffdec6272900d3312fdd94fe3fd54c656c6eb0e1381b5aa","observation_id":"a4d2500f-7082-4485-a0e7-69bbf93779de","resolution":{"observed_at":"2026-05-23T20:13:24.844854Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling data-constrained language models","venue":null,"work_id":"db311da2-d4e4-42b2-b6b3-48d75e75329d","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:fef7a4f303e27fb41a72cbdc2d54f412294c54418a20544b2b1a534e41118293","observation_id":"1d180948-b687-4322-b825-7e8fb872c1e7","resolution":{"observed_at":"2026-05-23T20:13:25.750446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:279df73800dda0d987f487607623e09e17debc82d165b35737ab8c7db6c6b994","observation_id":"91aa87ec-9310-4dcc-a70c-71666846f229","resolution":{"observed_at":"2026-05-23T20:13:24.757361Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"GPT-4V(ision) system card, 2024 a","venue":null,"work_id":"6132b934-6018-412b-b1be-2e020ad5be2b","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:51093bf027f873b3c839151b88fdab2d9dee2b04f6af884417e0daf0ce33c650","observation_id":"bc700717-d009-44ea-9e7b-272d59800955","resolution":{"observed_at":"2026-05-23T20:13:25.743969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gpt-4o mini: advancing cost-efficient intelligence, 2024 b","venue":null,"work_id":"7b27c831-78fb-4afc-94ed-39c365b911bd","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:ba2f7c23c6f92b276a670122063d5115907b144e35c4b3eaa1260974d1273cc7","observation_id":"bfbc8825-449e-4ddc-9c43-9c4e997b51e8","resolution":{"observed_at":"2026-05-23T20:13:25.738654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cognitive load theory and instructional design: Recent developments","venue":null,"work_id":"337bcf90-d0a4-4347-882a-40f8e2dc57d4","year":2010},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:6e706694647928af7a90401151acf79f1ad72d9193d43f41588c4d7af3d87f89","observation_id":"5d29731a-20f6-4213-8362-89fdc2eb83b0","resolution":{"observed_at":"2026-05-23T20:13:25.786625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07023","last_updated":"2024-02-10T19:08:28Z","snapshot_observed_at":"2026-08-19T19:04:30.951955Z","submitted_at":"2024-02-10T19:08:28Z","title":"Gemini Goes to Med School: Exploring the Capabilities of Multimodal Large Language Models on Medical Challenge Problems & Hallucinations","version":1},"cited_work":{"arxiv_id":"2402.07023","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.07023","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gemini goes to med school: exploring the capabilities of multimodal large language models on medical challenge problems & hallucinations","venue":null,"work_id":"146ed706-5884-4ee7-b012-522574c22e20","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2402.07023","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:42623138b511d151c54841edd8f5ee38dff21ceddbea6cb519832d218318d441","observation_id":"a1e38f9c-de1a-42cd-9fb2-0d325458eb1a","resolution":{"observed_at":"2026-05-23T20:13:24.747536Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00147","last_updated":"2024-08-30T07:37:38Z","snapshot_observed_at":"2026-08-16T13:22:43.390351Z","submitted_at":"2024-08-30T07:37:38Z","title":"MultiMath: Bridging Visual and Mathematical Reasoning for Large Language Models","version":1},"cited_work":{"arxiv_id":"2409.00147","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.00147","snapshot_observed_at":"2026-07-03T21:28:58.438612Z","title":"Multimath: Bridging visual and mathematical reasoning for large language models","venue":null,"work_id":"c82f0a48-7a00-4aa4-94dd-e64c35c6d5f2","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2409.00147","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:a3b7528e67c86cb86e4f96a479a31a9509f4bcc0226af4da7bbb7f4a589cb323","observation_id":"0f08144f-7f53-4bce-967b-e99f9d347ae5","resolution":{"observed_at":"2026-05-23T20:13:24.789526Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01284","last_updated":"2024-07-01T13:39:08Z","snapshot_observed_at":"2026-08-12T06:11:26.786967Z","submitted_at":"2024-07-01T13:39:08Z","title":"We-Math: Does Your Large Multimodal Model Achieve Human-like Mathematical Reasoning?","version":1},"cited_work":{"arxiv_id":"2407.01284","doi":"10.48550/arxiv.2407.01284","metadata_source":"pith","pith_arxiv_id":"2407.01284","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"We-Math: Does Your Large Multimodal Model Achieve Human-like Mathematical Reasoning?","venue":"cs.AI","work_id":"36b1b11c-2612-4d1d-9a6e-7db18eca4a25","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2407.01284","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:abf570f3ddb3d0c80272a9a43bfea2e69500439eb591bf0c2a67a2a46916e70f","observation_id":"b92f1d45-4b97-46a8-b689-3c3579cf5d2b","resolution":{"observed_at":"2026-05-23T20:13:24.631903Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Elementary math learning through piaget's cognitive development stages","venue":null,"work_id":"320f05e6-a2fa-4969-b3a2-53399398013c","year":2023},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:0c092882398843944450f81b54ca9b7fd5f15b2d9626f3815eaa41c151bad6bb","observation_id":"6109d41c-3620-4bfd-bf38-7ec138d14b65","resolution":{"observed_at":"2026-05-23T20:13:25.730301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-08-14T18:15:53.516440Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":"2403.05530","doi":"10.48550/arxiv.2403.05530","metadata_source":"pith","pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","venue":"cs.CL","work_id":"80e3e977-f1bb-4c83-8d0c-1ab0a0c5c3f1","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:92a3ce6e350ab3e87b907ae03513c012fdf5fa13bea38c7baea483c70ec33aa7","observation_id":"c5183aab-f5a4-4d10-ac62-c2ca24b4d04e","resolution":{"observed_at":"2026-05-23T20:13:24.597040Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-02T03:08:14.426583+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T03:08:14.426583+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16789","last_updated":"2024-03-09T22:26:06Z","snapshot_observed_at":"2026-08-08T18:07:29.632928Z","submitted_at":"2023-10-25T17:21:23Z","title":"Detecting Pretraining Data from Large Language Models","version":3},"cited_work":{"arxiv_id":"2310.16789","doi":"10.48550/arxiv.2310.16789","metadata_source":"pith","pith_arxiv_id":"2310.16789","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Detecting Pretraining Data from Large Language Models","venue":"cs.CL","work_id":"1ff0530f-0b29-487b-ba43-d22a740293b1","year":2023},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2310.16789","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:6db9912a4754707c3c2b051b04d9799f686ff04832859114e836334ac25209a4","observation_id":"1cdd9210-316a-4bb2-a8c4-de08309256d0","resolution":{"observed_at":"2026-05-23T20:13:24.831510Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17294","last_updated":"2024-10-08T06:58:27Z","snapshot_observed_at":"2026-08-16T13:39:53.511689Z","submitted_at":"2024-06-25T05:43:21Z","title":"Math-LLaVA: Bootstrapping Mathematical Reasoning for Multimodal Large Language Models","version":3},"cited_work":{"arxiv_id":"2406.17294","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.17294","snapshot_observed_at":"2026-07-03T20:18:57.684839Z","title":"Math-llava: Bootstrapping mathematical reasoning for multimodal large language models","venue":null,"work_id":"0eaf9e93-7c20-4692-bd9a-2257336131c0","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2406.17294","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:191a75062cba21c9f9365c8549ea57966d77afebbe659c55980c59e6a07075e4","observation_id":"dd81da68-afc6-487a-b30d-16383dfef233","resolution":{"observed_at":"2026-05-23T20:13:24.675026Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07594","last_updated":"2025-01-08T02:33:37Z","snapshot_observed_at":"2026-08-16T14:44:25.026948Z","submitted_at":"2023-11-10T09:51:24Z","title":"How to Bridge the Gap between Modalities: Survey on Multimodal Large Language Model","version":3},"cited_work":{"arxiv_id":"2311.07594","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.07594","snapshot_observed_at":"2026-07-03T01:07:30.855621Z","title":"How to bridge the gap between modalities: A comprehensive survey on multimodal large language model","venue":null,"work_id":"fe13fa6b-5be3-4d29-9164-8b538d73ae53","year":2023},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2311.07594","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:65f5dc0610d8fc28523faf01ca8cd792f0fcf21164cf3a1afe3d539f1a1a5f04","observation_id":"89ecd939-1a04-4291-8044-b49b18e9cc38","resolution":{"observed_at":"2026-05-23T20:13:25.058416Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scieval: A multi-level large language model evaluation benchmark for scientific research","venue":null,"work_id":"9935bfbe-6df5-4564-953c-090a95182c28","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:bf3c27c8ff47e7d24cc30728c31f42fae4f49fc8bd8d88e8e9e759de86f89985","observation_id":"81b3a9e7-e85a-4bea-b552-7cf98bfc58c5","resolution":{"observed_at":"2026-05-23T20:13:25.722923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14525","last_updated":"2023-09-25T20:59:33Z","snapshot_observed_at":"2026-08-15T23:42:34.277075Z","submitted_at":"2023-09-25T20:59:33Z","title":"Aligning Large Multimodal Models with Factually Augmented RLHF","version":1},"cited_work":{"arxiv_id":"2309.14525","doi":"10.48550/arxiv.2309.14525","metadata_source":"pith","pith_arxiv_id":"2309.14525","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Aligning Large Multimodal Models with Factually Augmented RLHF","venue":"cs.CV","work_id":"85bf563b-4790-4f8d-92e3-0ed210813c10","year":2023},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2309.14525","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:e736e62505e60b62c201ccd30e30b63bf8b04b0926405ed723beaba98adb2e9f","observation_id":"6696d416-a815-4cb5-bea7-38f0a3071df7","resolution":{"observed_at":"2026-05-23T20:13:24.796726Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-07-18T08:21:08.282214+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-18T08:21:08.282214+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Memorization without overfitting: Analyzing the training dynamics of large language models","venue":null,"work_id":"3a5deb73-d2f8-4474-8536-eb5e14462f60","year":2022},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:e0ed6d97cc5d5f2bcd7d2c67f48d98d4dd360c9839f9a1268c9b8f6841555088","observation_id":"d0ae4849-dc13-4b84-8d16-27965b2d6f13","resolution":{"observed_at":"2026-05-23T20:13:25.734523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14804","last_updated":"2024-02-22T18:56:38Z","snapshot_observed_at":"2026-08-13T01:56:18.092262Z","submitted_at":"2024-02-22T18:56:38Z","title":"Measuring Multimodal Mathematical Reasoning with MATH-Vision Dataset","version":1},"cited_work":{"arxiv_id":"2402.14804","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.14804","snapshot_observed_at":"2026-07-03T20:48:56.151594Z","title":"Measuring Multimodal Mathematical Reasoning with MATH-Vision Dataset","venue":"cs.CV","work_id":"c59c0707-68e6-4ab4-9b9f-293004398dc7","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2402.14804","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:4d4f3af59b4a08722eb4f498794f7452838bb943eef80a97f58538076db4285e","observation_id":"d7ddc412-30ba-4a2d-acbc-506790c88a42","resolution":{"observed_at":"2026-05-23T20:13:24.769190Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18105","last_updated":"2024-04-01T18:47:45Z","snapshot_observed_at":"2026-08-18T16:51:53.899885Z","submitted_at":"2024-03-26T21:04:29Z","title":"Large Language Models for Education: A Survey and Outlook","version":2},"cited_work":{"arxiv_id":"2403.18105","doi":"10.48550/arxiv.2403.18105","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.18105","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large language models for education: A survey and outlook","venue":"arXiv (Cornell University)","work_id":"1a20cafc-6664-446c-a1e3-a3e36ef762e5","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2403.18105","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:b88b350a6978fb89799b683305dbd38be45cdf408c8ccdd08d048a7b0d3db3c6","observation_id":"6d1ba5fa-f238-4a5e-aa60-3ad5e5606653","resolution":{"observed_at":"2026-05-23T20:13:24.812679Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":"2311.03079","doi":"10.48550/arxiv.2311.03079","metadata_source":"pith","pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CogVLM: Visual Expert for Pretrained Language Models","venue":"cs.CV","work_id":"0d81fb99-dae6-46d2-8bed-c01dcbd7d7cf","year":2023},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:22b3be23375fcc76f955d72453e473ae3a5ac12a78174818ed49ad39b9b30e81","observation_id":"dedad807-91d7-4d41-ad1f-0185068474a2","resolution":{"observed_at":"2026-05-23T20:13:24.656773Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Large-scale multi-modal pre-trained models: A comprehensive survey","venue":null,"work_id":"b682f7d3-cbd4-4f7e-a4db-c978a56ae9a7","year":2023},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:d7fbbf2b833f0fbfa6acd9074b2968b387737cac37cacfd44b2f29d9b8df93c2","observation_id":"2841365e-1eb1-47e2-818b-53502139cdcc","resolution":{"observed_at":"2026-05-23T20:13:25.706479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.10635","last_updated":"2024-06-28T08:24:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-20T07:01:57Z","title":"SciBench: Evaluating College-Level Scientific Problem-Solving Abilities of Large Language Models","version":3},"cited_work":{"arxiv_id":"2307.10635","doi":"10.48550/arxiv.2307.10635","metadata_source":"pith","pith_arxiv_id":"2307.10635","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SciBench: Evaluating College-Level Scientific Problem-Solving Abilities of Large Language Models","venue":"cs.CL","work_id":"88ae39fd-4d53-4184-9d82-03e8ac44d797","year":2023},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2307.10635","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:39d9c52928f93d036d9c4032a1a9226a9fd634acc1953270d5ccee898dec2615","observation_id":"e1bbde25-40b2-4a34-b348-a6b4424acfbe","resolution":{"observed_at":"2026-05-23T20:13:24.665670Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-05-20T23:23:35.354385+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T23:23:35.354385+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06805","last_updated":"2024-01-18T07:31:47Z","snapshot_observed_at":"2026-08-16T17:40:08.900487Z","submitted_at":"2024-01-10T15:29:21Z","title":"Exploring the Reasoning Abilities of Multimodal Large Language Models (MLLMs): A Comprehensive Survey on Emerging Trends in Multimodal Reasoning","version":2},"cited_work":{"arxiv_id":"2401.06805","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.06805","snapshot_observed_at":"2026-07-04T09:59:44.777709Z","title":"Exploring the reasoning abilities of multimodal large language models (mllms): A comprehensive survey on emerging trends in multimodal reasoning","venue":null,"work_id":"f8488283-5738-4b2a-9d3e-86913e913cdb","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2401.06805","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:8d9e961255de3eb608c149681dc92b7a8f0fd7daba7d62dd1cab95365680fe75","observation_id":"0b2da07f-e806-4b7e-a552-f13f425ffe47","resolution":{"observed_at":"2026-05-23T20:13:24.651777Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Are deep neural networks adequate behavioral models of human visual perception? Annual Review of Vision Science, 9 0 (1): 0 501--524","venue":null,"work_id":"4a823728-664b-4b04-aa36-e24e1c7bc31e","year":2023},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:d32102f33471d4abce7f0ebb2fdc88e9c329bba0c452a918cf4d3ed362db4ca3","observation_id":"2e8d19e2-7d15-4fb1-98f4-a5faad70e5bf","resolution":{"observed_at":"2026-05-23T20:13:25.718670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08603","last_updated":"2024-12-30T15:08:23Z","snapshot_observed_at":"2026-08-19T05:51:42.599132Z","submitted_at":"2024-05-14T13:42:05Z","title":"A Comprehensive Survey of Large Language Models and Multimodal Large Language Models in Medicine","version":3},"cited_work":{"arxiv_id":"2405.08603","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.08603","snapshot_observed_at":"2026-07-03T09:47:59.509868Z","title":"A comprehensive survey of large language models and multimodal large language models in medicine","venue":null,"work_id":"a2f21b07-5d22-4c01-a2f1-62f35f5ebd50","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2405.08603","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:68379ec9897e2154ded1c779f1ea0a4ca8929b48e9eeefd926821f74427af7ac","observation_id":"b7bf2295-098e-429e-bd4b-71e3631f542d","resolution":{"observed_at":"2026-05-23T20:13:24.643282Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10701","last_updated":"2024-10-12T05:08:54Z","snapshot_observed_at":"2026-08-16T13:42:40.388169Z","submitted_at":"2024-06-15T17:56:09Z","title":"MIND: Multimodal Shopping Intention Distillation from Large Vision-language Models for E-commerce Purchase Understanding","version":3},"cited_work":{"arxiv_id":"2406.10701","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10701","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mind: Multimodal shopping intention distillation from large vision-language models for e-commerce purchase understanding","venue":null,"work_id":"02ad8569-b279-4188-b23b-b26e1592dfeb","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2406.10701","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:b0dc583e50ecb9d6639024e73a6f2a5d7056b603cf7c145c081f33fdb034ac1f","observation_id":"ad01e102-61e5-4ae0-be2e-9cc1545c302f","resolution":{"observed_at":"2026-05-23T20:13:24.637635Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.11819","last_updated":"2024-02-02T02:35:13Z","snapshot_observed_at":"2026-08-18T10:40:33.027173Z","submitted_at":"2024-01-22T10:30:11Z","title":"SuperCLUE-Math6: Graded Multi-Step Math Reasoning Benchmark for LLMs in Chinese","version":2},"cited_work":{"arxiv_id":"2401.11819","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.11819","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Superclue-math6: Graded multi-step math reasoning benchmark for llms in chinese","venue":null,"work_id":"b301703a-ea1d-46a7-baf4-e8e74db4b42b","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2401.11819","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:c0612e94fe16ac536563a526bd52c844076221776ccb43ed2a9c75e5cd778b21","observation_id":"752b09f9-3757-4f31-99a5-b587d6533ca1","resolution":{"observed_at":"2026-05-23T20:13:24.609009Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.05687","last_updated":"2021-09-13T03:39:52Z","snapshot_observed_at":"2026-08-16T17:57:09.326742Z","submitted_at":"2021-09-13T03:39:52Z","title":"Raise a Child in Large Language Model: Towards Effective and Generalizable Fine-tuning","version":1},"cited_work":{"arxiv_id":"2109.05687","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.05687","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Raise a child in large language model: Towards effective and generalizable fine-tuning","venue":null,"work_id":"53431710-3885-483e-959b-029da246e022","year":2021},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2109.05687","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:dc3ffdbebf30020d2ef3bd1e08e017e3b581a462d1aa659b1f05ba9d39b17209","observation_id":"6ed7585e-c8b0-45b2-b324-b47400a2c4e1","resolution":{"observed_at":"2026-05-23T20:13:24.590916Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02760","last_updated":"2024-03-12T11:29:07Z","snapshot_observed_at":"2026-08-19T09:08:37.097904Z","submitted_at":"2024-03-05T08:31:00Z","title":"Emerging Synergies Between Large Language Models and Machine Learning in Ecommerce Recommendations","version":2},"cited_work":{"arxiv_id":"2403.02760","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.02760","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Emerging synergies between large language models and machine learning in ecommerce recommendations","venue":null,"work_id":"62c34cef-2b8d-41c6-81d2-394fe0f382c4","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2403.02760","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:0d479d415cc58428830b96f4b460416ed518d38db21df5b526e1b6889ec65ecd","observation_id":"eeb102f7-ccbe-4efe-9ff6-0a01b33774c4","resolution":{"observed_at":"2026-05-23T20:13:25.049022Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11366","last_updated":"2024-08-21T06:35:21Z","snapshot_observed_at":"2026-08-19T21:24:35.790599Z","submitted_at":"2024-08-21T06:35:21Z","title":"GeoReasoner: Reasoning On Geospatially Grounded Context For Natural Language Understanding","version":1},"cited_work":{"arxiv_id":"2408.11366","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.11366","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Georeasoner: Reasoning on geospatially grounded context for natural language understanding","venue":null,"work_id":"05ac767d-7b78-4620-8b3c-60ddfc740d89","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2408.11366","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:17ee91df0876248272641f144bab5ba9a76d446743fb5adb99764d7d5fe03040","observation_id":"c1a9acb3-51a9-4a54-8acc-a199d0c57ce1","resolution":{"observed_at":"2026-05-23T20:13:24.693768Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Urbanclip: Learning text-enhanced urban region profiling with contrastive language-image pretraining from the web","venue":null,"work_id":"ea355d71-cfd9-4a3e-bf32-ba8db85ced0c","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:9017d004284695de139a0aeeef27a09a87a8b6889c30f406c6a9b5c49e5a2661","observation_id":"ae8143ff-b337-457f-ac72-5a7d537990fe","resolution":{"observed_at":"2026-05-23T20:13:25.689996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Exploring diverse in-context configurations for image captioning","venue":null,"work_id":"1cc58931-c1f1-4d86-a399-3e06414362a9","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:694ddbfe5bf4701226b41a6efef9e32d965be9af147f50cd70e9691da43fa5f1","observation_id":"0372a539-9a1d-41d3-9673-a0093cb903f5","resolution":{"observed_at":"2026-05-23T20:13:25.694605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":"2408.01800","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-07-10T11:37:03.161139Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","venue":"cs.CV","work_id":"0f06e436-0c76-4e3c-be5e-6168f6bc4336","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:07ae31233f2a6190bec8533b2f5b61f7facdadd6c311019c2bd47033d00ae852","observation_id":"17c4ad5f-dc70-4c37-ad5e-3797dcbb1393","resolution":{"observed_at":"2026-05-23T20:13:24.906671Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04652","last_updated":"2025-01-21T10:12:05Z","snapshot_observed_at":"2026-08-17T20:16:19.173618Z","submitted_at":"2024-03-07T16:52:49Z","title":"Yi: Open Foundation Models by 01.AI","version":3},"cited_work":{"arxiv_id":"2403.04652","doi":"10.48550/arxiv.2403.04652","metadata_source":"pith","pith_arxiv_id":"2403.04652","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Yi: Open Foundation Models by 01.AI","venue":"cs.CL","work_id":"8efee8a1-5e3c-4851-9c65-18e3d1d9e769","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2403.04652","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:be790e5371901ff62248d5615ee38fec2a052364fbb7ec53e82ae44e1379e7a4","observation_id":"2bab7c3f-75c0-4163-9282-e0ca44687f23","resolution":{"observed_at":"2026-05-23T20:13:24.686872Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Large language model as attributed training data generator: A tale of diversity and bias","venue":null,"work_id":"a57d0254-a3e8-4dd1-97cf-2b735e867921","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:4b04aad4fdaf400f3fded9d6bf919ae43fa5fcac98ef4ce74fe1d4d98774bb04","observation_id":"7dd62501-1f2d-42ad-929b-c34c289c1fb3","resolution":{"observed_at":"2026-05-23T20:13:25.699491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.13975","last_updated":"2024-12-20T12:52:00Z","snapshot_observed_at":"2026-08-17T12:59:24.069240Z","submitted_at":"2024-06-20T03:50:23Z","title":"MR-Ben: A Meta-Reasoning Benchmark for Evaluating System-2 Thinking in LLMs","version":3},"cited_work":{"arxiv_id":"2406.13975","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.13975","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mr-ben: A comprehensive meta-reasoning benchmark for large language models","venue":null,"work_id":"8a982295-072e-4d4e-a562-f3dc58a39633","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2406.13975","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:40162bc6af8b3e2fb37d450ad9f97c3678138f053c3468349864557e15a07727","observation_id":"fdf4f964-e45d-4c93-ad69-829831adaa9a","resolution":{"observed_at":"2026-05-23T20:13:24.818351Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14624","last_updated":"2024-08-18T08:10:16Z","snapshot_observed_at":"2026-08-13T03:52:04.619847Z","submitted_at":"2024-03-21T17:59:50Z","title":"MathVerse: Does Your Multi-modal LLM Truly See the Diagrams in Visual Math Problems?","version":2},"cited_work":{"arxiv_id":"2403.14624","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.14624","snapshot_observed_at":"2026-07-03T20:48:56.007587Z","title":"MathVerse: Does Your Multi-modal LLM Truly See the Diagrams in Visual Math Problems?","venue":"cs.CV","work_id":"5ac1378a-eb29-4156-b54f-ca50bf47e594","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2403.14624","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:7198d943c1028983fdd3a7fcab22c004b2043bfb9b17cda4241b51a60a704f19","observation_id":"1fd7739d-d3c1-447c-9fb2-ef9a29d4363c","resolution":{"observed_at":"2026-05-23T20:13:24.708257Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.18223","last_updated":"2026-03-18T05:34:39Z","snapshot_observed_at":"2026-08-14T10:40:26.323157Z","submitted_at":"2023-03-31T17:28:46Z","title":"A Survey of Large Language Models","version":19},"cited_work":{"arxiv_id":"2303.18223","doi":"10.18653/v1/d16-1080","metadata_source":"pith","pith_arxiv_id":"2303.18223","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A Survey of Large Language Models","venue":"cs.CL","work_id":"de1b42b5-4a0a-4b1f-8c78-1f7fe21be6c9","year":2023},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2303.18223","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:5b757313b0afb11e2debbf239d97c36f01ca6a4aed12094eb700b0e10a6abadd","observation_id":"60de8a06-b8b0-4a34-a59e-75de3c30507a","resolution":{"observed_at":"2026-05-23T20:13:24.620935Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.09429","last_updated":"2025-05-30T07:27:55Z","snapshot_observed_at":"2026-08-17T13:49:02.667356Z","submitted_at":"2024-08-18T10:07:02Z","title":"Reefknot: A Comprehensive Benchmark for Relation Hallucination Evaluation, Analysis and Mitigation in Multimodal Large Language Models","version":3},"cited_work":{"arxiv_id":"2408.09429","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.09429","snapshot_observed_at":"2026-06-30T06:14:19.277132Z","title":"Reefknot: A comprehensive benchmark for relation hallucination evaluation, analysis and mitigation in multimodal large language models","venue":null,"work_id":"c0edd888-0d87-4c8c-b6df-bf7783b979dd","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2408.09429","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:2b583aa42ea83ff682b1e87863c9f5ceaf07b593569a6eff9706e27d3c452fbc","observation_id":"26e69ea4-d823-4e60-88c0-5da7588b24d4","resolution":{"observed_at":"2026-05-23T20:13:24.681459Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14241","last_updated":"2024-04-22T14:53:27Z","snapshot_observed_at":"2026-08-17T07:18:57.305119Z","submitted_at":"2024-04-22T14:53:27Z","title":"UrbanCross: Enhancing Satellite Image-Text Retrieval with Cross-Domain Adaptation","version":1},"cited_work":{"arxiv_id":"2404.14241","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.14241","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Urbancross: Enhancing satellite image-text retrieval with cross-domain adaptation","venue":null,"work_id":"51e61a06-77b1-4c54-b35d-b001d87d01d7","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2404.14241","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:11bb7ef4ff8601e2f33d3e1caa0b7d9bb3f95f7598cf5c779b000918d8bc5fdb","observation_id":"d7ccc97d-03ac-4148-a9a0-67fb8b57f831","resolution":{"observed_at":"2026-05-23T20:13:24.703873Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2408.07543","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mathscape: Evaluating mllms in multimodal math scenarios through a hierarchical benchmark","venue":null,"work_id":"8f7aed8a-6052-4010-a3b9-bb13d1d7a863","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:6d122f0c6630a71d1fef5aa22dac3602aa3a007279eded639c93d16d6220f6f0","observation_id":"6a4c28c4-ad13-4c28-8dfe-f0bb8de28cef","resolution":{"observed_at":"2026-05-23T20:13:24.864286Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17161","last_updated":"2024-02-27T02:47:50Z","snapshot_observed_at":"2026-08-16T14:15:04.326213Z","submitted_at":"2024-02-27T02:47:50Z","title":"Large Language Model for Participatory Urban Planning","version":1},"cited_work":{"arxiv_id":"2402.17161","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.17161","snapshot_observed_at":"2026-07-10T20:57:34.643826Z","title":"Large language model for participatory urban planning","venue":"cs.AI","work_id":"f2f4782b-7239-4f8b-a03c-bd1ced17bce8","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2402.17161","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:20fe059cc1dd1171287cae115a9e66f0b56dc5ebe22b4e90e1481c1a6b426578","observation_id":"774c5a7e-bd97-4aff-a820-5a3e8933d4cc","resolution":{"observed_at":"2026-05-23T20:13:24.777188Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2308.07107","doi":"10.48550/arxiv.2308.07107","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large language models for information retrieval: A survey","venue":"arXiv (Cornell University)","work_id":"ff471f2d-dc3e-459c-81a9-9a40d29e96f8","year":2023},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:665d64363819ab5f4f5562e7f463dbeea9389ceae80f35b667960b977a2a0eac","observation_id":"6be2948c-6684-4b74-9e22-fbe581ffa754","resolution":{"observed_at":"2026-05-23T20:13:25.037969Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-01T13:38:15.875295+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T13:38:15.875295+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08640","last_updated":"2024-09-25T09:53:13Z","snapshot_observed_at":"2026-08-16T13:26:03.578605Z","submitted_at":"2024-08-16T10:11:05Z","title":"Math-PUMA: Progressive Upward Multimodal Alignment to Enhance Mathematical Reasoning","version":2},"cited_work":{"arxiv_id":"2408.08640","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.08640","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Math-puma: Progressive upward multimodal alignment to enhance mathematical reasoning","venue":null,"work_id":"1dcf5bb9-930d-4a6d-80a2-3202fe67e703","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2408.08640","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:077505758ac6581906dc61cdaac69034ba069f0dd07c08058125369068c3bf73","observation_id":"882d7d89-01da-45cb-8219-31bb3569df79","resolution":{"observed_at":"2026-05-23T20:13:25.043471Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deep learning for cross-domain data fusion in urban computing: Taxonomy, advances, and outlook","venue":null,"work_id":"62d5743f-eeac-4c01-88ef-fd5a14f843f4","year":2025},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:360ece1e987e2f3325a63635727c3ede36b02992138452218f562583d4c0635e","observation_id":"eb14ca03-8ff0-4d6f-988c-96131b7302d4","resolution":{"observed_at":"2026-05-23T20:13:25.817974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Object detection in 20 years: A survey","venue":null,"work_id":"3c5ed1b7-0c40-4dd2-993b-e865869f48ba","year":2023},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:c0dfdc386505ab15d8b010dd6c7eda3dbf57ceb69783e925b3a1ed5bbe4aac33","observation_id":"0ce46bd0-3a45-4866-b6a3-476d24ef4787","resolution":{"observed_at":"2026-05-23T20:13:25.829449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T00:05:48.311803Z","title":"write newline","venue":null,"work_id":"8e5fda61-e601-4df4-8204-015bee341570","year":null},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:11f9dc6bdfab6b8fab4a25199cc22fbdb4bacadf39052375473cf4b5b315df11","observation_id":"6892dd8d-ae52-453f-bd0a-45fa91b59f44","resolution":{"observed_at":"2026-05-23T20:13:25.774675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T23:55:44.012295Z","title":"@esa (Ref","venue":null,"work_id":"b058608d-98d0-4821-a4ae-403d2b7cd411","year":null},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:6e20f9d38c56eb043b4871f06f8e99edf715af191d22b01e2c632153ade9286e","observation_id":"2229d2cb-fbcf-4124-8669-856d25a312ec","resolution":{"observed_at":"2026-05-23T20:13:25.754450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T00:05:48.337191Z","title":null,"venue":null,"work_id":"ea79bfb8-d434-45e9-8607-416d3839ec5c","year":null},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:ba27f2e6d977c67dc9b18af1c9d8d3c886e709a17ec843f3fcbc4813b028730a","observation_id":"b4822c65-1ae0-4888-937b-1572a7a59bd0","resolution":{"observed_at":"2026-05-23T20:13:25.783042Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"d051d6aa-efca-49eb-a66d-8ea01bf21294","year":null},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:536a4a1b1eb0b3c02e0b0a7700e83906ae530f1fc3fd57a6f0908e08660b13fd","observation_id":"0393e8f1-3007-41c8-a9e9-5de496b1dab9","resolution":{"observed_at":"2026-05-23T20:13:25.814025Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection"},"reference_resolution":{"displayed":92,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":2,"verified_exact":58,"verified_fuzzy":32},"total_outbound_references":92},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 92 of 92 outbound references and 13 inbound Pith citation observations for arXiv:2410.04509."}