{"as_of":"2026-08-10T09:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:931c24c58a8e9b971717cb07a1fe0e33775617bd69c3a52e5afb15b80be014dd","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:41:41.103071Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T16:07:45.693853Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-16T15:04:22.765546Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-08T00:06:37.560828Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"cited_work":{"arxiv_id":"2506.23563","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.23563","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mmreason: An open-ended multi-modal multi-step reasoning benchmark for mllms to- ward agi","venue":null,"work_id":"13427a83-3dfb-41be-a24c-7a8f8e9790b5","year":2025},"citing_paper":{"arxiv_id":"2503.12937","last_updated":"2025-08-04T04:22:09Z","snapshot_observed_at":"2026-08-06T21:34:54.534751Z","submitted_at":"2025-03-17T08:51:44Z","title":"R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-16T15:04:22.690503Z"},"links":{"cited_paper":"/paper/2506.23563","citing_paper":"/paper/2503.12937"},"observation_digest":"sha256:e307c1ebf3a8ca5f1e77be441cffcf9b203e68aed0d05688af18aa4917e525c1","observation_id":"41cb0031-bb58-4119-abee-969cf25cdbb7","resolution":{"observed_at":"2026-05-16T15:04:22.768219Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-08T00:06:37.560828Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.23563","snapshot_observed_at":"2026-08-04T16:07:45.693853Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-04T16:07:24.699834Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":224,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:45.693853Z"},"links":{"cited_paper":"/paper/2506.23563","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:e577639ce030b532df5e240e8828950ea6d18e7ba7f19b5d971413ba8d6af612","observation_id":"54e58cba-4bf8-433d-a37c-d4188b30aaea","resolution":{"observed_at":"2026-08-04T16:07:45.693853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-08T00:06:37.560828Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"cited_work":{"arxiv_id":"2506.23563","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.23563","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mmreason: An open-ended multi-modal multi-step reasoning benchmark for mllms to- ward agi","venue":null,"work_id":"13427a83-3dfb-41be-a24c-7a8f8e9790b5","year":2025},"citing_paper":{"arxiv_id":"2604.20806","last_updated":"2026-04-22T17:37:40Z","snapshot_observed_at":"2026-08-02T21:32:46.195325Z","submitted_at":"2026-04-22T17:37:40Z","title":"OMIBench: Benchmarking Olympiad-Level Multi-Image Reasoning in Large Vision-Language Model","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-10T00:40:47.562861Z"},"links":{"cited_paper":"/paper/2506.23563","citing_paper":"/paper/2604.20806"},"observation_digest":"sha256:d67751917523026a8622ac67bc5dcca4daeab275eb5608f25b6010edb4d63301","observation_id":"8c7ca8d1-37a3-4a88-9c36-c51ee1825ca8","resolution":{"observed_at":"2026-05-11T13:46:03.540546Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.23563/citation-record","integrity":"/paper/2506.23563/integrity","json":"/paper/2506.23563/citation-record.json","paper":"/paper/2506.23563"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:36.964984Z","title":"Vqa: Visual question answering","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-08T00:06:37.560828Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:36.964984Z"},"links":{"citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:2f1063444abda17402bae9d89c50b16f453b1f76abe34bd6a02cc1a526edf588","observation_id":"be9ea60a-6bb1-447f-9f50-bc46dd5b167e","resolution":{"observed_at":"2026-08-06T21:41:36.964984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T21:41:37.018974Z","title":"Qwen2.5-vl technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-08T00:06:37.560828Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:37.018974Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:a3dda1f871dc7b2c97c96ab326b2f2f59a8087b79044930b5cfc30b75b5c0a8a","observation_id":"de0012f4-cfd3-446e-bb25-da7f0447338f","resolution":{"observed_at":"2026-08-06T21:41:37.018974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-06T21:41:37.060542Z","title":"Are we on the right way for evaluating large vision-language models? arXiv preprint arXiv:2403.20330,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-08T00:06:37.560828Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:37.060542Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:50de0188f39b25a789a8af4613afe85b3ea97b30725ff24fad5b11b471ef29ff","observation_id":"f03e35c7-15c6-4412-a186-6ba364de3669","resolution":{"observed_at":"2026-08-06T21:41:37.060542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:37.107652Z","title":"R1-v: Reinforcing super generalization ability in vision- language models with less than $3","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-08T00:06:37.560828Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:37.107652Z"},"links":{"citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:01f92ec5443392e213939bb718473b35e24eb52455fd37a96a3e1fb4337431dd","observation_id":"36ffbdb7-f622-4f64-8ec5-c54f06370650","resolution":{"observed_at":"2026-08-06T21:41:37.107652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:44.325142Z","title":"M 3cot: A novel benchmark for multi- domain multi-step multi-modal chain-of-thought","venue":null,"work_id":"9e0cd726-287a-41d5-bae3-8bbb4e56de2f","year":2024},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-08T00:06:37.560828Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:37.181858Z"},"links":{"citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:45f4283fe4ff9561470f269ff1457b6af9c7d8d681d71de43a17743b1dc76a40","observation_id":"7730835c-196e-46e4-8e49-79513dffde51","resolution":{"observed_at":"2026-08-06T21:41:44.435523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:37.266368Z","title":"Vlmevalkit: An open-source toolkit for evaluating large multi-modality models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-08T00:06:37.560828Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:37.266368Z"},"links":{"citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:d545bc51def2d0f2f346d903653d65b08ecefdc1888870a71e79b60af3023cda","observation_id":"2c7e9642-a714-4ae7-96d4-65bf223d4959","resolution":{"observed_at":"2026-08-06T21:41:37.266368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T21:41:37.363908Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-08T00:06:37.560828Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:37.363908Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:a6f35352c256a2175f5cc234412084a07140c4e71a7f7c0cc50a114aed0297fd","observation_id":"a59ed741-d1c7-4846-9d49-55986827a34e","resolution":{"observed_at":"2026-08-06T21:41:37.363908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:44.073141Z","title":"Mme: A compre- hensive evaluation benchmark for multimodal large language models, 2024","venue":null,"work_id":"61aa7056-b0cd-407b-8080-14b091023150","year":2024},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-08T00:06:37.560828Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:37.416896Z"},"links":{"citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:ef5f6d9b45161c7d744601e8def7899ce1d68068a44cc57db1279ff886bdbd51","observation_id":"9ebdc35f-8e27-473e-997c-4698bd2eadc0","resolution":{"observed_at":"2026-08-06T21:41:44.182233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:43.855427Z","title":"Hallusionbench: an advanced diagnos- tic suite for entangled language hallucination and visual il- lusion in large vision-language models","venue":null,"work_id":"ac57449d-ad3e-486b-bbc1-c672f3bcb4ca","year":2024},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-08T00:06:37.560828Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:37.474185Z"},"links":{"citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:581ecd9289f663866bd778591002ab085b4c5f42b0b921ac05f06478f6aa14fc","observation_id":"93ab7eea-85ef-4eb5-9497-ead8a6c49b62","resolution":{"observed_at":"2026-08-06T21:41:43.956530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T21:41:37.543852Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-08T00:06:37.560828Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:37.543852Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:f12c7738efed260a967e2c6a13ef244553ee79784be838ba862cc17fc8d35c74","observation_id":"a9715380-7d87-4d83-986f-97ae974160d1","resolution":{"observed_at":"2026-08-06T21:41:37.543852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14008","last_updated":"2024-06-06T13:19:44Z","snapshot_observed_at":"2026-08-03T03:39:09.398343Z","submitted_at":"2024-02-21T18:49:26Z","title":"OlympiadBench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14008","snapshot_observed_at":"2026-08-06T21:41:37.636240Z","title":"Olympiadbench: A chal- lenging benchmark for promoting agi with olympiad-level bilingual multimodal scientific problems","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-08T00:06:37.560828Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:37.636240Z"},"links":{"cited_paper":"/paper/2402.14008","citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:bf957206677f5583fd4db7a4642d8fc7af04c85ebe21ce1e4877d87e529c6a79","observation_id":"77e758fd-1c0b-4b84-ad84-7a408c596d97","resolution":{"observed_at":"2026-08-06T21:41:37.636240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06749","last_updated":"2026-02-28T21:10:52Z","snapshot_observed_at":"2026-08-07T18:44:26.813869Z","submitted_at":"2025-03-09T20:06:45Z","title":"Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06749","snapshot_observed_at":"2026-08-06T21:41:37.734988Z","title":"Vision-r1: Incentivizing reasoning capability in multimodal large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-08T00:06:37.560828Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:37.734988Z"},"links":{"cited_paper":"/paper/2503.06749","citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:cc4938f9580ac20cd8e87efd4785edf39ad951939ad10c6e1cde99d84d6ad029","observation_id":"fb28a5cd-421c-445f-9007-ff80bac185c9","resolution":{"observed_at":"2026-08-06T21:41:37.734988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:37.820286Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-08T00:06:37.560828Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:37.820286Z"},"links":{"citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:50149a49efb852be3d27369b1f326bb1fe43ca3d015256935e8e91c4b52b9b17","observation_id":"5b0541e0-2129-48eb-9b5d-c0aaf865050a","resolution":{"observed_at":"2026-08-06T21:41:37.820286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-06T21:41:37.882424Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-08T00:06:37.560828Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:37.882424Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:1aa556b3e09c79e659e6b85303cee04858d4526774540e689ecd4e9c3277a816","observation_id":"0a995200-d266-4af7-b4d1-4c749bb2f0a5","resolution":{"observed_at":"2026-08-06T21:41:37.882424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-06T21:41:37.947664Z","title":"Openai o1 system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-08T00:06:37.560828Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:37.947664Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:c2948c7492677ed793e26f5f2a723dc9e98223a618619ffdee95f1f83156ac10","observation_id":"a1e9aacb-9249-43fa-a880-9ded340d290c","resolution":{"observed_at":"2026-08-06T21:41:37.947664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09621","last_updated":"2025-02-13T18:59:46Z","snapshot_observed_at":"2026-08-09T00:23:29.329507Z","submitted_at":"2025-02-13T18:59:46Z","title":"MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09621","snapshot_observed_at":"2026-08-06T21:41:38.034436Z","title":"Mme-cot: Benchmarking chain-of-thought in large multimodal models for reasoning quality, robustness, and efficiency","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-08T00:06:37.560828Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:38.034436Z"},"links":{"cited_paper":"/paper/2502.09621","citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:94e46db3d63127c02ae6d286fa259e3ebb5f56ecf822ba4211d1e21a0a497e6f","observation_id":"6d2fc3ba-87a4-408e-b6d2-28629dc2b5da","resolution":{"observed_at":"2026-08-06T21:41:38.034436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-06T21:41:38.107966Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-08T00:06:37.560828Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:38.107966Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:d5df927fcf6eb3376ec9e19bb5c17e5680bf3106f944022bff01b125ddf64ecf","observation_id":"ce92bb88-2148-40fe-9df0-df9730d36ce9","resolution":{"observed_at":"2026-08-06T21:41:38.107966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-08-06T21:41:38.218393Z","title":"Evaluating object hallucina- tion in large vision-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-08T00:06:37.560828Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:38.218393Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:5bc2c11904402b6d87aaf1bb4bc16c509e5c91d5dbe979b9520661ca95b4ee44","observation_id":"e47b29ba-02f9-44ef-b388-744b0b1acbe1","resolution":{"observed_at":"2026-08-06T21:41:38.218393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17419","last_updated":"2025-06-25T02:24:46Z","snapshot_observed_at":"2026-08-10T09:42:17.185681Z","submitted_at":"2025-02-24T18:50:52Z","title":"From System 1 to System 2: A Survey of Reasoning Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.17419","snapshot_observed_at":"2026-08-06T21:41:38.323087Z","title":"From system 1 to system 2: A survey of reasoning large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-08T00:06:37.560828Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:38.323087Z"},"links":{"cited_paper":"/paper/2502.17419","citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:ca291f2191994389060e13eee4e04ded0a9aac2f9a4a10e92e59cb638563fbf3","observation_id":"29fc1abd-5a76-480e-a5ca-aa060e71d691","resolution":{"observed_at":"2026-08-06T21:41:38.323087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-06T21:41:38.393410Z","title":"Deepseek-v3 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-08T00:06:37.560828Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:38.393410Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:2e55d2fbb33aab9fd3fe2e230c0f9cb8cbd6ac124ac05728f528350d60c6e35d","observation_id":"fc37b8db-903b-4034-bbb2-e83c62082ef2","resolution":{"observed_at":"2026-08-06T21:41:38.393410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.03981","last_updated":"2025-05-06T21:08:27Z","snapshot_observed_at":"2026-08-07T15:49:23.234741Z","submitted_at":"2025-05-06T21:08:27Z","title":"X-Reasoner: Towards Generalizable Reasoning Across Modalities and Domains","version":1},"cited_work":{"arxiv_id":"2505.03981","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.03981","snapshot_observed_at":"2026-08-06T21:41:41.398168Z","title":"X-Reasoner: Towards Generalizable Reasoning Across Modalities and Domains","venue":"cs.AI","work_id":"ef433961-f4f8-4352-9989-4085b9609cb0","year":2025},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-08T00:06:37.560828Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:38.463963Z"},"links":{"cited_paper":"/paper/2505.03981","citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:fff4cd0d55200cc9a4b1702f1e06a214ab42b7529a345ca6097baed2b0c1a3ab","observation_id":"c142dbff-ded5-415c-9b20-b7d4a1992ca8","resolution":{"observed_at":"2026-08-06T21:41:41.520575Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:43.562591Z","title":"Mmbench: Is your multi-modal model an all-around player? In European conference on computer vi- sion, pages 216–233","venue":null,"work_id":"3fee2f29-8424-45c0-a6e2-5ac902392f50","year":2024},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-08T00:06:37.560828Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:38.513018Z"},"links":{"citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:cf3a5ddd971e69d93adc8389695c6b224ee2358a7a895c775a6ea3a6ec8d8c86","observation_id":"0000f601-0756-4c2f-8a0f-7a2471a0e18f","resolution":{"observed_at":"2026-08-06T21:41:43.690894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-06T21:41:38.579018Z","title":"Mathvista: Evaluating mathemat- ical reasoning of foundation models in visual contexts.arXiv preprint arXiv:2310.02255, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-08T00:06:37.560828Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:38.579018Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:eb128ddb9a57970b9bd58c0aa842ad9978e3e13b2242724e574153003f58e5b5","observation_id":"0e6e344c-68b5-455a-9592-b135010773f9","resolution":{"observed_at":"2026-08-06T21:41:38.579018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10244","last_updated":"2022-03-19T05:00:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-19T05:00:30Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.10244","snapshot_observed_at":"2026-08-06T21:41:38.631494Z","title":"Chartqa: A benchmark for question an- swering about charts with visual and logical reasoning.arXiv preprint arXiv:2203.10244, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-08T00:06:37.560828Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:38.631494Z"},"links":{"cited_paper":"/paper/2203.10244","citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:6e64ef442c033870cefca97e388163592b3e0b553923dbe93edac556a53b3099","observation_id":"cf81a703-ce5f-46bb-910c-e78427fd777b","resolution":{"observed_at":"2026-08-06T21:41:38.631494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:43.349794Z","title":"Visual cot: Advancing multi-modal language models with a com- prehensive dataset and benchmark for chain-of-thought rea- soning","venue":null,"work_id":"196ab40b-7f51-440a-a7fd-3f3c3ea4a492","year":2024},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-08T00:06:37.560828Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:38.777914Z"},"links":{"citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:6eccdb6f328e632b5627f01f5904419966e0a43481518119c4dab93b27c9c024","observation_id":"5144df1c-c94b-4336-8a75-5c547156bb85","resolution":{"observed_at":"2026-08-06T21:41:43.452752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-08-08T20:11:45.308315Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-08-06T21:41:38.843269Z","title":"Vlm-r1: A stable and generaliz- able r1-style large vision-language model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-08T00:06:37.560828Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:38.843269Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:e82197282ebae94d2abdcf8f7e622b272305536ce48c7719aaee050b17d4c004","observation_id":"0f2f5a40-523a-4187-a9dd-eff88897d922","resolution":{"observed_at":"2026-08-06T21:41:38.843269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:43.033421Z","title":"Claude 3.7 sonnet, 2025","venue":null,"work_id":"c02db5af-1015-4f54-a2be-8520601df759","year":2025},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-08T00:06:37.560828Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:38.930271Z"},"links":{"citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:aa553fe3817f735f8c592de2756998519a00acab7a569049e3c4fa4bae245507","observation_id":"8f337445-6d0b-4852-9546-0e8596ac8d34","resolution":{"observed_at":"2026-08-06T21:41:43.186623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-06T21:41:39.038546Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of con- text","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-08T00:06:37.560828Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:39.038546Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:99ca5a9120dd00d5ea43398c5b8af61104c24c40078201ed4435e87c9562079f","observation_id":"38f60056-f59a-4e94-941d-da25dc558f65","resolution":{"observed_at":"2026-08-06T21:41:39.038546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-06T21:41:39.192570Z","title":"Kimi k1.5: Scaling reinforcement learning with llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-08T00:06:37.560828Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:39.192570Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:66e4fcab31ae932a2e6157186187cb7150c00f3ef99f837ada1609afa5ed79c7","observation_id":"864c0936-66c9-4841-a69e-43aa9db98b84","resolution":{"observed_at":"2026-08-06T21:41:39.192570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:42.777262Z","title":"Qvq: To see the world with wisdom, 2024","venue":null,"work_id":"f9d429b3-34d0-4a9f-a943-87d4abec64ea","year":2024},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-08T00:06:37.560828Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:39.353962Z"},"links":{"citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:fbb8e11ead795e472ee05549dbbc1a72a60054537c93b1f450589c8429f645d5","observation_id":"33880566-25cf-42b6-8ffc-4764fa08ec7b","resolution":{"observed_at":"2026-08-06T21:41:42.896929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:42.555745Z","title":"Qwq: Reflect deeply on the boundaries of the unknown, 2024","venue":null,"work_id":"13912baa-0b2e-4ef7-9af4-251de6559685","year":2024},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-08T00:06:37.560828Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:39.503756Z"},"links":{"citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:0c46b019bc2e19ef830968744a3aff124d00184511216f67c44a22910d7a8994","observation_id":"b36a3b7a-3683-4148-9a7a-dd9fd47ab33c","resolution":{"observed_at":"2026-08-06T21:41:42.657113Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10442","last_updated":"2025-04-07T09:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-15T18:59:27Z","title":"Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10442","snapshot_observed_at":"2026-08-06T21:41:39.658744Z","title":"Enhancing the reason- ing ability of multimodal large language models via mixed preference optimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-08T00:06:37.560828Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:39.658744Z"},"links":{"cited_paper":"/paper/2411.10442","citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:624996032f9f4215f5ce666fa03bfbc947b5d743891e71c8c8ef2e2d89c6e0f7","observation_id":"944a66d3-3182-42f5-bbbd-ff2df9985f9f","resolution":{"observed_at":"2026-08-06T21:41:39.658744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:42.323313Z","title":"Open-r1-video","venue":null,"work_id":"980df2fb-278b-4528-9723-0f4f53c342c0","year":2025},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-08T00:06:37.560828Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:39.758478Z"},"links":{"citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:a17e1bd39c6f50820d0f570d7c4c82fcdc24b1f027b0e5b6296039b878624db5","observation_id":"dc1e6874-59e1-4d60-ac44-28e7c5356027","resolution":{"observed_at":"2026-08-06T21:41:42.440908Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.09130","last_updated":"2025-04-12T08:37:30Z","snapshot_observed_at":"2026-08-07T16:06:20.019986Z","submitted_at":"2025-04-12T08:37:30Z","title":"VisuoThink: Empowering LVLM Reasoning with Multimodal Tree Search","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.09130","snapshot_observed_at":"2026-08-06T21:41:39.855190Z","title":"Vi- suothink: Empowering lvlm reasoning with multimodal tree search","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-08T00:06:37.560828Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:39.855190Z"},"links":{"cited_paper":"/paper/2504.09130","citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:42e30ae9b3127f221b94945e19b5bc6a5baf7557f0af746e9b1cce155190f500","observation_id":"d176d38e-f478-4a60-859b-b22c4b999294","resolution":{"observed_at":"2026-08-06T21:41:39.855190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:42.154819Z","title":"Charxiv: Charting gaps in realistic chart understanding in multimodal llms","venue":null,"work_id":"e5f22810-bbd6-4f9f-aa2e-f3d49ebdde0d","year":2025},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-08T00:06:37.560828Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:39.912917Z"},"links":{"citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:b0e63b0c137ce40944916f61c6f75fd7f3ad5301b8b1ab906b094e0b2eaa07df","observation_id":"d763cf7c-4589-4b5c-be57-5cf424486580","resolution":{"observed_at":"2026-08-06T21:41:42.215107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:39.982779Z","title":"Boosting mul- timodal reasoning with mcts-automated structured thinking","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-08T00:06:37.560828Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:39.982779Z"},"links":{"citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:70c23b70e1d43f64da442060e72fb2b724557d1e1ef54be6d17c0dfcb24a3697","observation_id":"1e22d933-8446-44f4-b425-e1ea0b1ed865","resolution":{"observed_at":"2026-08-06T21:41:39.982779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10302","last_updated":"2024-12-13T17:37:48Z","snapshot_observed_at":"2026-08-07T03:01:29.031129Z","submitted_at":"2024-12-13T17:37:48Z","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10302","snapshot_observed_at":"2026-08-06T21:41:40.067346Z","title":"Deepseek-vl2: Mixture-of- experts vision-language models for advanced multimodal understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-08T00:06:37.560828Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:40.067346Z"},"links":{"cited_paper":"/paper/2412.10302","citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:bd335fc0059b96e89ddfd768d3b793c93a0f140f13f3767a900903de1ae38050","observation_id":"47746207-6c7c-4ee6-8b2c-07e227d36c45","resolution":{"observed_at":"2026-08-06T21:41:40.067346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14768","last_updated":"2025-02-20T17:49:26Z","snapshot_observed_at":"2026-08-04T12:32:53.090165Z","submitted_at":"2025-02-20T17:49:26Z","title":"Logic-RL: Unleashing LLM Reasoning with Rule-Based Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14768","snapshot_observed_at":"2026-08-06T21:41:40.126753Z","title":"Logic-rl: Unleashing llm reasoning with rule-based reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-08T00:06:37.560828Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:40.126753Z"},"links":{"cited_paper":"/paper/2502.14768","citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:9e5a90a5d787ab4e74153e8538d4686fe81cb1ddbb22fd68fa8a4dbc53b9bcbd","observation_id":"58b2ef09-753d-40cc-9c41-ae15c01fabd7","resolution":{"observed_at":"2026-08-06T21:41:40.126753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10440","last_updated":"2025-07-21T03:53:30Z","snapshot_observed_at":"2026-08-07T09:36:29.319006Z","submitted_at":"2024-11-15T18:58:31Z","title":"LLaVA-CoT: Let Vision Language Models Reason Step-by-Step","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10440","snapshot_observed_at":"2026-08-06T21:41:40.221780Z","title":"Llava-o1: Let vision language models reason step- by-step","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-08T00:06:37.560828Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:40.221780Z"},"links":{"cited_paper":"/paper/2411.10440","citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:f6d0dd265d6f77f4f66a3f7f5cb875b4a1231b77c88fa9685a7650655b8a2424","observation_id":"ea48561d-de45-475c-a596-68d921cd0686","resolution":{"observed_at":"2026-08-06T21:41:40.221780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18319","last_updated":"2024-12-31T07:41:30Z","snapshot_observed_at":"2026-08-10T00:19:13.518873Z","submitted_at":"2024-12-24T10:07:51Z","title":"Mulberry: Empowering MLLM with o1-like Reasoning and Reflection via Collective Monte Carlo Tree Search","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18319","snapshot_observed_at":"2026-08-06T21:41:40.304579Z","title":"Mulberry: Empowering mllm with o1-like reasoning and reflection via collective monte carlo tree search","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-08T00:06:37.560828Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:40.304579Z"},"links":{"cited_paper":"/paper/2412.18319","citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:8725e9385b46f4305f8dee8e92f6aacea53fb99848f0392dc79b5646d3abcf76","observation_id":"fec71ebb-790b-405a-aa09-33befdc3f34a","resolution":{"observed_at":"2026-08-06T21:41:40.304579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16673","last_updated":"2025-05-22T13:39:32Z","snapshot_observed_at":"2026-08-07T14:55:04.641472Z","submitted_at":"2025-05-22T13:39:32Z","title":"R1-ShareVL: Incentivizing Reasoning Capability of Multimodal Large Language Models via Share-GRPO","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16673","snapshot_observed_at":"2026-08-06T21:41:40.361835Z","title":"R1-sharevl: Incentivizing reasoning capability of multimodal large language models via share-grpo","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-08T00:06:37.560828Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:40.361835Z"},"links":{"cited_paper":"/paper/2505.16673","citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:8d872f3582d334ae2058f02f431869aeecc433c6afbe7a213ceeaf2bf92e5375","observation_id":"2aacdaa0-ba2e-4fb9-901f-e0efd17ce28d","resolution":{"observed_at":"2026-08-06T21:41:40.361835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-06T21:41:40.429654Z","title":"Minicpm-v: A gpt-4v level mllm on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-08T00:06:37.560828Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:40.429654Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:473b3b9967f8186568fd57cccc560afa15ef45960529da4e36eaf6f13f6fc86e","observation_id":"3559689b-0da9-42f6-94d4-496b6fe9deb6","resolution":{"observed_at":"2026-08-06T21:41:40.429654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16006","last_updated":"2024-04-24T17:37:05Z","snapshot_observed_at":"2026-07-06T18:05:03.284784Z","submitted_at":"2024-04-24T17:37:05Z","title":"MMT-Bench: A Comprehensive Multimodal Benchmark for Evaluating Large Vision-Language Models Towards Multitask AGI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16006","snapshot_observed_at":"2026-08-06T21:41:40.493129Z","title":"Mmt-bench: A comprehensive multimodal bench- mark for evaluating large vision-language models towards multitask agi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-08T00:06:37.560828Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:40.493129Z"},"links":{"cited_paper":"/paper/2404.16006","citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:94d437385508f8d95223c884e6b8d44ee83397ba3e37bf5ba9d2c0c31d3b6445","observation_id":"9ea9b439-fd49-40a5-9db9-5e1f2a8f0b91","resolution":{"observed_at":"2026-08-06T21:41:40.493129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-08-08T03:31:37.699253Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-08-06T21:41:40.565270Z","title":"Mm-vet: Evaluating large multimodal models for integrated capabilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-08T00:06:37.560828Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:40.565270Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:55bd25ac6be93074cc65665b48950e9da3be42d40af194e475f6b7700fc2c280","observation_id":"cf7dae34-fce7-45c6-bffe-2d2f5dfb778b","resolution":{"observed_at":"2026-08-06T21:41:40.565270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:41.983502Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for ex- pert agi","venue":null,"work_id":"bf7897e1-16ce-433b-890d-a4ef310badbf","year":2024},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-08T00:06:37.560828Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:40.624530Z"},"links":{"citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:9cf292141ed80dfdb20b431a50cb1efa5ab888bd368db1a211d36cb033795fe5","observation_id":"19eed217-3bfb-42ce-86d9-feddd144e924","resolution":{"observed_at":"2026-08-06T21:41:42.066729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02813","last_updated":"2025-05-22T08:22:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-04T15:31:26Z","title":"MMMU-Pro: A More Robust Multi-discipline Multimodal Understanding Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02813","snapshot_observed_at":"2026-08-06T21:41:40.702164Z","title":"Mmmu-pro: A more robust multi- discipline multimodal understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-08T00:06:37.560828Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:40.702164Z"},"links":{"cited_paper":"/paper/2409.02813","citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:9f12c31bee1f29e168282fadb96d01da05d02c79a7d7a8f2a0db90f20c1e1451","observation_id":"4d8d3328-49e0-4ce5-b281-1c03ffe00383","resolution":{"observed_at":"2026-08-06T21:41:40.702164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.20566","last_updated":"2024-09-30T17:59:34Z","snapshot_observed_at":"2026-08-08T19:12:53.528060Z","submitted_at":"2024-09-30T17:59:34Z","title":"MM1.5: Methods, Analysis & Insights from Multimodal LLM Fine-tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.20566","snapshot_observed_at":"2026-08-06T21:41:40.775733Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-08T00:06:37.560828Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:40.775733Z"},"links":{"cited_paper":"/paper/2409.20566","citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:c3d8815321438689fe0e0b23a79100066f7b64bac8f5636c69ca73d50753d324","observation_id":"fe7fe619-ec37-48b2-b76d-529d226dc326","resolution":{"observed_at":"2026-08-06T21:41:40.775733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12937","last_updated":"2025-08-04T04:22:09Z","snapshot_observed_at":"2026-08-06T21:34:54.534751Z","submitted_at":"2025-03-17T08:51:44Z","title":"R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12937","snapshot_observed_at":"2026-08-06T21:41:40.883389Z","title":"R1-vl: Learn- ing to reason with multimodal large language models via step-wise group relative policy optimization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-08T00:06:37.560828Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:40.883389Z"},"links":{"cited_paper":"/paper/2503.12937","citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:139389d1746f4cbb8edafc1ce40be66964c018d3bec071f4dde71eea894e2155","observation_id":"ee42f373-7c73-4b4d-b7db-39c4af95d126","resolution":{"observed_at":"2026-08-06T21:41:40.883389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:41.759836Z","title":"Mathverse: Does your multi-modal llm truly see the diagrams in visual math problems? In European Conference on Computer Vision, pages 169–186","venue":null,"work_id":"da0c68d8-0d9b-4d41-9923-1f44275e0b9a","year":2024},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-08T00:06:37.560828Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:40.941360Z"},"links":{"citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:89fe29116b5262e245d5db3e67c7beb9744126dff5647579155c276ba8fce3e6","observation_id":"1fcd04ec-7e36-4357-9dbc-10dbab8f295e","resolution":{"observed_at":"2026-08-06T21:41:41.899167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16198","last_updated":"2024-10-21T17:00:06Z","snapshot_observed_at":"2026-08-08T03:30:51.616377Z","submitted_at":"2024-10-21T17:00:06Z","title":"Improve Vision Language Model Chain-of-thought Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16198","snapshot_observed_at":"2026-08-06T21:41:41.040789Z","title":"Improve vision language model chain-of- thought reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-08T00:06:37.560828Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:41.040789Z"},"links":{"cited_paper":"/paper/2410.16198","citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:51cc9869caffaf21949d1c455e2d42863d5a1a08dd04750a2081a8d51a7a1d73","observation_id":"9ca8fd4c-e733-4ed2-ab5d-dc3e9595b0a2","resolution":{"observed_at":"2026-08-06T21:41:41.040789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00836","last_updated":"2025-02-24T06:55:22Z","snapshot_observed_at":"2026-07-06T19:43:46.557944Z","submitted_at":"2024-10-29T17:29:19Z","title":"DynaMath: A Dynamic Visual Benchmark for Evaluating Mathematical Reasoning Robustness of Vision Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00836","snapshot_observed_at":"2026-08-06T21:41:41.103071Z","title":"Dynamath: A dynamic visual bench- mark for evaluating mathematical reasoning robustness of vision language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","snapshot_observed_at":"2026-08-08T00:06:37.560828Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:41.103071Z"},"links":{"cited_paper":"/paper/2411.00836","citing_paper":"/paper/2506.23563"},"observation_digest":"sha256:e3639ea3e45ddf2cf9bd462917fea010c15e4f3ec9f93060aff371172d635f26","observation_id":"68b418f4-f233-4f31-b187-9a27584609bf","resolution":{"observed_at":"2026-08-06T21:41:41.103071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.23563","last_updated":"2025-06-30T07:14:38Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-08T00:06:37.560828Z","submitted_at":"2025-06-30T07:14:38Z","title":"MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":38,"verified_exact":1,"verified_fuzzy":12},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 3 inbound Pith citation observations for arXiv:2506.23563."}