{"as_of":"2026-08-09T16:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e4bdd286c67f6188ee5b4e8cc8db704c1aedb36acf0bd2daea3f755943bf8e0c","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":40,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:29:06.836442Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T13:09:50.233935Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-07T17:40:59.052312Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":"2501.05444","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-07-04T13:09:50.233935Z","title":"W., Li, L., Yang, Z., Wang, L., and Cheng, Y","venue":null,"work_id":"3684bdb2-838f-4727-be6b-797dcc466fdf","year":2025},"citing_paper":{"arxiv_id":"2502.02871","last_updated":"2026-04-20T02:18:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-05T04:05:27Z","title":"Position: Multimodal Large Language Models Can Significantly Advance Scientific Reasoning","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-05-23T04:30:38.804702Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2502.02871"},"observation_digest":"sha256:2f87b22951774839064118c7d3e036fb9168c391f0d93a91bd9cc81e9a5f7d61","observation_id":"59217165-9cd2-4838-ace1-1f645cccb2b2","resolution":{"observed_at":"2026-05-23T04:32:32.840359Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-07T17:40:59.052312Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":"2501.05444","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-07-04T13:09:50.233935Z","title":"W., Li, L., Yang, Z., Wang, L., and Cheng, Y","venue":null,"work_id":"3684bdb2-838f-4727-be6b-797dcc466fdf","year":2025},"citing_paper":{"arxiv_id":"2503.09567","last_updated":"2025-07-18T15:57:54Z","snapshot_observed_at":"2026-08-08T22:33:20.124926Z","submitted_at":"2025-03-12T17:35:03Z","title":"Towards Reasoning Era: A Survey of Long Chain-of-Thought for Reasoning Large Language Models","version":5},"reference_index":241,"source":"pdf_text","source_observed_at":"2026-05-12T08:40:40.910461Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2503.09567"},"observation_digest":"sha256:ce056eaca84cc081137ddd2edb8810088a86f6d22acfd5517582c8b48cddc4d8","observation_id":"bea1f8ac-2ae8-4271-97b5-1c28b2ddafb2","resolution":{"observed_at":"2026-05-12T08:40:41.471398Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-07T17:40:59.052312Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":"2501.05444","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-07-04T13:09:50.233935Z","title":"W., Li, L., Yang, Z., Wang, L., and Cheng, Y","venue":null,"work_id":"3684bdb2-838f-4727-be6b-797dcc466fdf","year":2025},"citing_paper":{"arxiv_id":"2503.12605","last_updated":"2025-03-23T13:47:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-16T18:39:13Z","title":"Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey","version":2},"reference_index":167,"source":"pdf_text","source_observed_at":"2026-05-15T17:18:52.996467Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2503.12605"},"observation_digest":"sha256:0fbe55f9aee2f8689f819241eb937dd53686c8ba07e2cd92988305567f852596","observation_id":"fc20a570-a8c1-499f-a529-97c46d9fcd85","resolution":{"observed_at":"2026-05-15T17:18:53.278400Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-07T17:40:59.052312Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":"2501.05444","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-07-04T13:09:50.233935Z","title":"W., Li, L., Yang, Z., Wang, L., and Cheng, Y","venue":null,"work_id":"3684bdb2-838f-4727-be6b-797dcc466fdf","year":2025},"citing_paper":{"arxiv_id":"2503.17352","last_updated":"2025-11-11T08:13:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-21T17:52:43Z","title":"OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-19T06:59:03.112252Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2503.17352"},"observation_digest":"sha256:e9a743fde384977ef63cc587cc70b5ff7210350e4e792da70361cfd0bbc0dfee","observation_id":"a431e228-57cb-4df6-a848-fcc25fc8e8f5","resolution":{"observed_at":"2026-05-19T06:59:03.400181Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-07T17:40:59.052312Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":"2501.05444","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-07-04T13:09:50.233935Z","title":"W., Li, L., Yang, Z., Wang, L., and Cheng, Y","venue":null,"work_id":"3684bdb2-838f-4727-be6b-797dcc466fdf","year":2025},"citing_paper":{"arxiv_id":"2504.14945","last_updated":"2025-06-22T00:18:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-21T08:09:13Z","title":"Learning to Reason under Off-Policy Guidance","version":5},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-15T23:17:02.701393Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2504.14945"},"observation_digest":"sha256:e541e03b6b65c792ae362bc96f8606dceb3bd71291d33588650ebcb722fb10fb","observation_id":"6de50937-63e5-4a52-8c9a-237f56fc1afa","resolution":{"observed_at":"2026-05-15T23:17:02.892270Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-07T17:40:59.052312Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-08-07T15:29:06.836442Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15000","last_updated":"2025-05-21T01:07:00Z","snapshot_observed_at":"2026-08-07T15:23:25.479987Z","submitted_at":"2025-05-21T01:07:00Z","title":"Towards Spoken Mathematical Reasoning: Benchmarking Speech-based Models over Multi-faceted Math Problems","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T15:29:06.836442Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2505.15000"},"observation_digest":"sha256:1e626f02991102728ce2c884870fcc77bc5157bb4bb3719df6956157c9e09f94","observation_id":"ca4d68d7-8604-484e-b562-19be0e03b0cf","resolution":{"observed_at":"2026-08-07T15:29:06.836442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-07T17:40:59.052312Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-08-07T15:26:59.566161Z","title":"arXiv preprint arXiv:2501.05444 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15146","last_updated":"2025-06-03T09:53:37Z","snapshot_observed_at":"2026-08-07T21:22:21.405277Z","submitted_at":"2025-05-21T06:02:55Z","title":"lmgame-Bench: How Good are LLMs at Playing Games?","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:59.566161Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2505.15146"},"observation_digest":"sha256:3af3537cef037cd3734f1e4b6d978ca937949fd4e8f6d098ceecfa2666045dd4","observation_id":"8cafd74e-8f58-4fde-a158-02ea21ec09c9","resolution":{"observed_at":"2026-08-07T15:26:59.566161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-07T17:40:59.052312Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-08-07T15:14:56.253584Z","title":"the fair use of a copyrighted work, including such use by ...... scholarship, or research, is not an infringement of copyright","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15929","last_updated":"2025-05-29T17:59:14Z","snapshot_observed_at":"2026-08-09T05:39:52.681912Z","submitted_at":"2025-05-21T18:33:50Z","title":"PhyX: Does Your Model Have the \"Wits\" for Physical Reasoning?","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T15:14:56.253584Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2505.15929"},"observation_digest":"sha256:644aec3a1ca8af6916641eb3b4b077ae847911b4a954ff607f0ec222f28ba56b","observation_id":"3269c397-9cf3-456c-a0c7-69b46502952b","resolution":{"observed_at":"2026-08-07T15:14:56.253584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-07T17:40:59.052312Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-08-07T14:51:16.478809Z","title":"Can mllms reason in multimodality? emma: An enhanced multimodal reasoning benchmark,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17399","last_updated":"2025-05-26T11:15:36Z","snapshot_observed_at":"2026-08-09T09:54:37.103525Z","submitted_at":"2025-05-23T02:16:11Z","title":"FullFront: Benchmarking MLLMs Across the Full Front-End Engineering Workflow","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:51:16.478809Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2505.17399"},"observation_digest":"sha256:c8778f1a12a94ffa54e60382d581b346af1a9f5d4785782e724971e316add9be","observation_id":"13c6dd49-fa38-4685-86aa-7bee9f02578a","resolution":{"observed_at":"2026-08-07T14:51:16.478809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-07T17:40:59.052312Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-08-07T14:31:14.468895Z","title":"Can mllms reason in multimodality? emma: An enhanced multimodal reasoning benchmark","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:14.468895Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:ace59aa4007a6c023b96d08e1e46ee01fb2c4f38ccb53e1ffb98a7b413302aac","observation_id":"e892892b-c10d-45a6-8065-9432d3feab2f","resolution":{"observed_at":"2026-08-07T14:31:14.468895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-07T17:40:59.052312Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-08-07T14:19:02.650097Z","title":"Can mllms reason in multimodality? emma: An enhanced multimodal reasoning benchmark","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19406","last_updated":"2025-05-26T01:42:38Z","snapshot_observed_at":"2026-08-07T20:32:06.174757Z","submitted_at":"2025-05-26T01:42:38Z","title":"Unveiling the Compositional Ability Gap in Vision-Language Reasoning Model","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:02.650097Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2505.19406"},"observation_digest":"sha256:90de551a06c20562bfdecfe1cdb6c07b7643691396d64565460b9c2d96d37a0f","observation_id":"82ab3d3d-13f9-4382-8cf0-d5cfdb58dcb1","resolution":{"observed_at":"2026-08-07T14:19:02.650097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-07T17:40:59.052312Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-08-07T14:12:03.859705Z","title":"Can mllms reason in multimodality? emma: An enhanced multimodal reasoning benchmark","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19702","last_updated":"2025-05-26T08:54:14Z","snapshot_observed_at":"2026-08-08T16:19:49.539801Z","submitted_at":"2025-05-26T08:54:14Z","title":"Point-RFT: Improving Multimodal Reasoning with Visually Grounded Reinforcement Finetuning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:03.859705Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2505.19702"},"observation_digest":"sha256:735748749ee1e92295a2b4b3a73e725e1d1c500b48a903e955b856d89e4619f0","observation_id":"0af8138d-b50b-4120-96ae-298ddf751c9a","resolution":{"observed_at":"2026-08-07T14:12:03.859705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-07T17:40:59.052312Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-08-07T13:35:57.253578Z","title":"Can mllms reason in multimodality? emma: An enhanced multimodal reasoning benchmark","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21327","last_updated":"2025-05-27T15:23:23Z","snapshot_observed_at":"2026-08-08T22:42:35.699276Z","submitted_at":"2025-05-27T15:23:23Z","title":"MME-Reasoning: A Comprehensive Benchmark for Logical Reasoning in MLLMs","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T13:35:57.253578Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2505.21327"},"observation_digest":"sha256:05e0bcab97ff7d838d98725a50bfb5b68f69af26825ec0f0ae876b6f5895f27c","observation_id":"060b87ff-030b-457b-bbd4-e859554de971","resolution":{"observed_at":"2026-08-07T13:35:57.253578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-07T17:40:59.052312Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-08-07T12:41:01.334554Z","title":"Can mllms reason in multimodality? emma: An enhanced multimodal reasoning benchmark.arXiv preprint arXiv:2501.05444, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-09T08:26:41.997073Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:41:01.334554Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2505.24120"},"observation_digest":"sha256:ec1f9846121257ab52c3d4fb50f76f7a344f17954925c758884564546abcc0db","observation_id":"df31dd7b-4de3-468f-8f15-7c3087c86cca","resolution":{"observed_at":"2026-08-07T12:41:01.334554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-07T17:40:59.052312Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-08-07T12:36:21.244871Z","title":"Can mllms reason in multimodality? emma: An enhanced multimodal reasoning benchmark.arXiv preprint arXiv:2501.05444, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:21.244871Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:83619df43fc214d75631dd66ec19d6f29146b395beb860bb53979130de509439","observation_id":"a5964cce-ce42-4bca-9940-f8b194a075a7","resolution":{"observed_at":"2026-08-07T12:36:21.244871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-07T17:40:59.052312Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-08-07T05:25:30.367946Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced Multi- Modal ReAsoning Benchmark, January 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-08T00:05:54.804087Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.367946Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:f93c4211c576c74d47bc658ba52ef750c949cfbdfc76d9fe8582488af555a176","observation_id":"58541b15-d921-4064-b89d-6dee79b1e6b8","resolution":{"observed_at":"2026-08-07T05:25:30.367946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-07T17:40:59.052312Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-08-07T05:19:16.540534Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08343","last_updated":"2025-06-18T14:43:36Z","snapshot_observed_at":"2026-08-07T08:58:45.702180Z","submitted_at":"2025-06-10T01:54:04Z","title":"Wait, We Don't Need to \"Wait\"! Removing Thinking Tokens Improves Reasoning Efficiency","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T05:19:16.540534Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2506.08343"},"observation_digest":"sha256:4f25a659c964b1dcf8b64ebb282a51ea26eeec183756221e00b56bab98cd92f5","observation_id":"c27708dd-cd6c-4f19-9f5c-898587f63c4b","resolution":{"observed_at":"2026-08-07T05:19:16.540534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-07T17:40:59.052312Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-08-07T04:40:08.211304Z","title":"Can mllms reason in multimodality? emma: An enhanced multimodal reasoning benchmark","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-08T03:17:29.512287Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:08.211304Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:6e6c4276fcfe0aeb8810f8f7d68f29da9b2f06064ed66e16955ff34e38a2732c","observation_id":"9024f7a6-09d5-44b8-a2c3-b8d1e33ac7af","resolution":{"observed_at":"2026-08-07T04:40:08.211304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-07T17:40:59.052312Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-08-06T21:58:34.684819Z","title":"Can MLLMs reason in multimodality? EMMA: an enhanced multimodal reasoning benchmark.arXiv preprint arXiv:2501.05444, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22992","last_updated":"2025-06-28T19:44:32Z","snapshot_observed_at":"2026-08-09T11:31:37.358797Z","submitted_at":"2025-06-28T19:44:32Z","title":"MARBLE: A Hard Benchmark for Multimodal Spatial Reasoning and Planning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T21:58:34.684819Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2506.22992"},"observation_digest":"sha256:62214fcd0001547a077553fc33f7fe890df9919fd0000e3df22e8dfc01012e06","observation_id":"55df135a-9ca6-4fe7-ad75-4bb19f440d8c","resolution":{"observed_at":"2026-08-06T21:58:34.684819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-07T17:40:59.052312Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-08-06T19:14:03.335779Z","title":"Can mllms reason in multimodality? emma: An enhanced multimodal reasoning benchmark","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06167","last_updated":"2025-07-10T15:41:04Z","snapshot_observed_at":"2026-08-07T10:37:03.707334Z","submitted_at":"2025-07-08T16:47:16Z","title":"Skywork-R1V3 Technical Report","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T19:14:03.335779Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2507.06167"},"observation_digest":"sha256:1a76a1def302b1b1520acf4acf13fc74a4a0ae3e8a2c4691920ec035bdb6727f","observation_id":"d1c9e39c-da3b-451e-b3c2-7c06538b096d","resolution":{"observed_at":"2026-08-06T19:14:03.335779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-07T17:40:59.052312Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-08-06T11:35:11.882839Z","title":"Can mllms reason in multimodality? emma: An enhanced multimodal reasoning benchmark","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.22607","last_updated":"2025-07-31T09:09:45Z","snapshot_observed_at":"2026-08-06T11:35:06.948357Z","submitted_at":"2025-07-30T12:23:21Z","title":"VL-Cogito: Progressive Curriculum Reinforcement Learning for Advanced Multimodal Reasoning","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T11:35:11.882839Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2507.22607"},"observation_digest":"sha256:9180fbd9f795e6c3689f3278eae7b12ee099deaedcf86fb22ecffeb1b4020153","observation_id":"b7ae7c65-1c24-4eef-8281-58c46bfdc0d1","resolution":{"observed_at":"2026-08-06T11:35:11.882839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-07T17:40:59.052312Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-08-05T16:32:42.934041Z","title":"Can mllms reason in multimodality? emma: An enhanced multimodal reasoning benchmark","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-09T12:43:01.932559Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:42.934041Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:ec33a5eb3cec8635a1d19bc3c79672dd5e8da58414b0626b59bf6c40f23abb14","observation_id":"9d5b0801-966a-45f1-9e27-1ecb18d0c745","resolution":{"observed_at":"2026-08-05T16:32:42.934041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-07T17:40:59.052312Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-08-05T15:23:52.822183Z","title":"arXiv preprint arXiv:2501.05444","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.19944","last_updated":"2025-08-31T10:33:09Z","snapshot_observed_at":"2026-08-08T17:26:42.658085Z","submitted_at":"2025-08-27T15:01:02Z","title":"KRETA: A Benchmark for Korean Reading and Reasoning in Text-Rich VQA Attuned to Diverse Visual Contexts","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T15:23:52.822183Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2508.19944"},"observation_digest":"sha256:0bca5bd490528a8eea68f1a8371b4b095e7db1b429899b8e724e220fdfc15884","observation_id":"f86f6a0d-31ae-4ba1-9bb2-869119a11ede","resolution":{"observed_at":"2026-08-05T15:23:52.822183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-07T17:40:59.052312Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-08-05T13:24:39.653975Z","title":"Can mllms reason in multimodality? emma: An enhanced multimodal reasoning benchmark","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-07T21:36:21.058533Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.653975Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:715ed983026c49736dc3461fffd684f47ec1952cefa8ea1c783b9c712646f1ea","observation_id":"aa570e30-2544-4fe1-8f67-24262a221426","resolution":{"observed_at":"2026-08-05T13:24:39.653975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-07T17:40:59.052312Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":"2501.05444","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-07-04T13:09:50.233935Z","title":"W., Li, L., Yang, Z., Wang, L., and Cheng, Y","venue":null,"work_id":"3684bdb2-838f-4727-be6b-797dcc466fdf","year":2025},"citing_paper":{"arxiv_id":"2509.18154","last_updated":"2025-09-16T19:41:48Z","snapshot_observed_at":"2026-08-09T11:10:24.301223Z","submitted_at":"2025-09-16T19:41:48Z","title":"MiniCPM-V 4.5: Cooking Efficient MLLMs via Architecture, Data, and Training Recipe","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-15T17:07:27.277040Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2509.18154"},"observation_digest":"sha256:4c10055005e14b54c1b89516aca2d5ec654241abecddf3bc1d3cace2bb44e559","observation_id":"c66eeefd-99ec-410e-8435-a40e3634a2e5","resolution":{"observed_at":"2026-05-15T17:07:27.398933Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-07T17:40:59.052312Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":"2501.05444","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-07-04T13:09:50.233935Z","title":"W., Li, L., Yang, Z., Wang, L., and Cheng, Y","venue":null,"work_id":"3684bdb2-838f-4727-be6b-797dcc466fdf","year":2025},"citing_paper":{"arxiv_id":"2511.23253","last_updated":"2026-05-17T14:28:57Z","snapshot_observed_at":"2026-08-02T03:33:31.761191Z","submitted_at":"2025-11-28T15:02:19Z","title":"AgroCoT: A Chain-of-Thought Benchmark for Evaluating Reasoning in Vision-Language Models for Agriculture","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-21T17:59:42.921867Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2511.23253"},"observation_digest":"sha256:a592cb095e1ac9ebd68043b0ce56924e076d9c137931911ba0434ff7b75f7ad9","observation_id":"b5e52865-c1e2-4a43-b5f1-2576227b5ab7","resolution":{"observed_at":"2026-05-21T18:00:26.874973Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-07T17:40:59.052312Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-08-03T05:23:33.121778Z","title":"W., Li, L., Yang, Z., Wang, L., and Cheng, Y","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.02465","last_updated":"2026-06-10T12:52:04Z","snapshot_observed_at":"2026-08-08T05:57:49.430723Z","submitted_at":"2026-02-02T18:49:06Z","title":"MentisOculi: Revealing the Limits of Reasoning with Mental Imagery","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T05:23:33.121778Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2602.02465"},"observation_digest":"sha256:9ac68bb2060b5bb898e3750e0dd51a25d8e1e3b230c3273ff08d55762717215e","observation_id":"aa028a27-b5f1-47b4-99c1-6f0219a0a6b1","resolution":{"observed_at":"2026-08-03T05:23:33.121778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-07T17:40:59.052312Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-08-02T20:36:04.457394Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.22971","last_updated":"2026-05-29T07:44:51Z","snapshot_observed_at":"2026-08-06T11:32:52.767125Z","submitted_at":"2026-02-26T13:08:56Z","title":"SPM-Bench: Benchmarking Large Language Models for Scanning Probe Microscopy","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T20:36:04.457394Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2602.22971"},"observation_digest":"sha256:c7ca2a30f7eb31ba0d0b8ae906c860d012dcd2af08620c4a600ea9e9c8075d73","observation_id":"b8dcbd05-29aa-456e-a0fa-05bb7fc6ef92","resolution":{"observed_at":"2026-08-02T20:36:04.457394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-07T17:40:59.052312Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":"2501.05444","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-07-04T13:09:50.233935Z","title":"W., Li, L., Yang, Z., Wang, L., and Cheng, Y","venue":null,"work_id":"3684bdb2-838f-4727-be6b-797dcc466fdf","year":2025},"citing_paper":{"arxiv_id":"2603.20633","last_updated":"2026-04-17T08:57:17Z","snapshot_observed_at":"2026-07-06T22:49:57.103822Z","submitted_at":"2026-03-21T04:03:45Z","title":"Seed1.8 Model Card: Towards Generalized Real-World Agency","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-15T07:44:02.827006Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2603.20633"},"observation_digest":"sha256:4a075f45d626efa1f80431692422c383afa2ee52371af48b53e2878b34d07516","observation_id":"314fcb5f-e6d6-4dd8-9e5f-f82c27d3b6bf","resolution":{"observed_at":"2026-05-15T07:45:14.287576Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-07T17:40:59.052312Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":"2501.05444","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-07-04T13:09:50.233935Z","title":"W., Li, L., Yang, Z., Wang, L., and Cheng, Y","venue":null,"work_id":"3684bdb2-838f-4727-be6b-797dcc466fdf","year":2025},"citing_paper":{"arxiv_id":"2604.20183","last_updated":"2026-06-02T10:46:47Z","snapshot_observed_at":"2026-08-02T22:19:27.963593Z","submitted_at":"2026-04-22T04:55:31Z","title":"Dual-Cluster Memory Agent: Resolving Multi-Paradigm Ambiguity in Optimization Problem Solving","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-05-10T00:37:55.147350Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2604.20183"},"observation_digest":"sha256:a887e8fb896d0edff5b42f6d82f55964bffbedb8f0e31e1254aeb99355db3942","observation_id":"fabe2c58-eaca-4c41-9005-42d8daed444e","resolution":{"observed_at":"2026-05-11T13:46:04.311521Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-07T17:40:59.052312Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":"2501.05444","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-07-04T13:09:50.233935Z","title":"W., Li, L., Yang, Z., Wang, L., and Cheng, Y","venue":null,"work_id":"3684bdb2-838f-4727-be6b-797dcc466fdf","year":2025},"citing_paper":{"arxiv_id":"2604.21510","last_updated":"2026-04-23T10:12:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T10:12:32Z","title":"OptiVerse: A Comprehensive Benchmark towards Optimization Problem Solving","version":1},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-05-09T22:04:19.654714Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2604.21510"},"observation_digest":"sha256:1bbd62a36d4b82c85dae4a3285ba5ed6f157ba1c800f671f128848269c5bd887","observation_id":"3325c29f-6bc7-4f06-b15b-841b61ccdeb9","resolution":{"observed_at":"2026-05-11T14:21:03.874703Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-07T17:40:59.052312Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":"2501.05444","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-07-04T13:09:50.233935Z","title":"W., Li, L., Yang, Z., Wang, L., and Cheng, Y","venue":null,"work_id":"3684bdb2-838f-4727-be6b-797dcc466fdf","year":2025},"citing_paper":{"arxiv_id":"2605.09614","last_updated":"2026-05-10T15:53:11Z","snapshot_observed_at":"2026-07-31T22:46:33.839024Z","submitted_at":"2026-05-10T15:53:11Z","title":"Reflection Anchors for Propagation-Aware Visual Retention in Long-Chain Multimodal Reasoning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-12T02:24:12.349405Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2605.09614"},"observation_digest":"sha256:1fb2b463e2898443c1de723dbda735dc1c0bc183a50d4d5bbb4a12432f6ef1fb","observation_id":"67764f88-0862-4b1c-9f4a-002e83632f6b","resolution":{"observed_at":"2026-05-12T07:41:27.517349Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-07T17:40:59.052312Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":"2501.05444","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-07-04T13:09:50.233935Z","title":"W., Li, L., Yang, Z., Wang, L., and Cheng, Y","venue":null,"work_id":"3684bdb2-838f-4727-be6b-797dcc466fdf","year":2025},"citing_paper":{"arxiv_id":"2605.14054","last_updated":"2026-06-02T19:43:46Z","snapshot_observed_at":"2026-07-06T23:25:29.856145Z","submitted_at":"2026-05-13T19:23:53Z","title":"Bad Seeing or Bad Thinking? Rewarding Perception for Multimodal Reasoning","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-05-15T05:14:28.256032Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2605.14054"},"observation_digest":"sha256:ce5d04496aa669e6b7ba67cb19db60a5b8a45e2dc9436d87f63c65294eb00162","observation_id":"edaac7b9-5988-4235-82c7-2e1c8513f50e","resolution":{"observed_at":"2026-05-15T05:15:02.884007Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-07T17:40:59.052312Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":"2501.05444","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-07-04T13:09:50.233935Z","title":"W., Li, L., Yang, Z., Wang, L., and Cheng, Y","venue":null,"work_id":"3684bdb2-838f-4727-be6b-797dcc466fdf","year":2025},"citing_paper":{"arxiv_id":"2605.15792","last_updated":"2026-05-15T09:48:46Z","snapshot_observed_at":"2026-08-08T03:23:41.035935Z","submitted_at":"2026-05-15T09:48:46Z","title":"Reversing the Flow: Generation-to-Understanding Synergy in Large Multimodal Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-20T18:44:54.835575Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2605.15792"},"observation_digest":"sha256:ee214289a975cd544f0a7b73dd06d0898056697ddd2f4335d2f969fa5a854189","observation_id":"eb529714-10e1-4e6b-88ff-28e8a71ad0a3","resolution":{"observed_at":"2026-05-20T18:48:53.490345Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-07T17:40:59.052312Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":"2501.05444","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-07-04T13:09:50.233935Z","title":"W., Li, L., Yang, Z., Wang, L., and Cheng, Y","venue":null,"work_id":"3684bdb2-838f-4727-be6b-797dcc466fdf","year":2025},"citing_paper":{"arxiv_id":"2605.25571","last_updated":"2026-05-25T08:26:34Z","snapshot_observed_at":"2026-07-06T23:35:31.372756Z","submitted_at":"2026-05-25T08:26:34Z","title":"AnE: Pushing the Reasoning Frontier of Multimodal LLMs via Anchor Evolution","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-29T22:56:39.504430Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2605.25571"},"observation_digest":"sha256:f4305da4d055ea86124a336ddc40efdb5a4f0d6b8fe24d0ee2bd8a998315a2ac","observation_id":"7e1c70c0-7481-4bd7-af97-e107c43eae73","resolution":{"observed_at":"2026-06-30T00:14:04.635099Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-07T17:40:59.052312Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":"2501.05444","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-07-04T13:09:50.233935Z","title":"W., Li, L., Yang, Z., Wang, L., and Cheng, Y","venue":null,"work_id":"3684bdb2-838f-4727-be6b-797dcc466fdf","year":2025},"citing_paper":{"arxiv_id":"2606.05966","last_updated":"2026-06-04T10:07:05Z","snapshot_observed_at":"2026-07-06T23:45:51.910263Z","submitted_at":"2026-06-04T10:07:05Z","title":"Causal Scaffolding for Physical Reasoning: A Benchmark for Causally-Informed Physical World Understanding in VLMs","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-27T23:15:38.962013Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2606.05966"},"observation_digest":"sha256:6e9d50d0d8ff27f37922fcd01b8d705c133a709edc2b646245ea52cd910325f0","observation_id":"41f675df-f331-4c6b-9d3f-3dd540b15384","resolution":{"observed_at":"2026-07-02T15:57:06.715624Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-07T17:40:59.052312Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":"2501.05444","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-07-04T13:09:50.233935Z","title":"W., Li, L., Yang, Z., Wang, L., and Cheng, Y","venue":null,"work_id":"3684bdb2-838f-4727-be6b-797dcc466fdf","year":2025},"citing_paper":{"arxiv_id":"2606.26535","last_updated":"2026-06-25T02:18:38Z","snapshot_observed_at":"2026-08-06T19:33:14.892044Z","submitted_at":"2026-06-25T02:18:38Z","title":"From Hallucination to Grounding: Diagnosing Visual Spatial Intelligence via CRISP","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-26T05:31:17.461916Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2606.26535"},"observation_digest":"sha256:ee1d2f264a687e44b3a37af84ce4b2e88ce59f61e27bb173152ef47ab36efe6a","observation_id":"01469653-fd64-47f6-bc32-e6f8c0ffde20","resolution":{"observed_at":"2026-07-04T13:09:50.235779Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-07T17:40:59.052312Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":"2501.05444","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-07-04T13:09:50.233935Z","title":"W., Li, L., Yang, Z., Wang, L., and Cheng, Y","venue":null,"work_id":"3684bdb2-838f-4727-be6b-797dcc466fdf","year":2025},"citing_paper":{"arxiv_id":"2607.00248","last_updated":"2026-06-30T22:57:43Z","snapshot_observed_at":"2026-08-03T15:00:12.134373Z","submitted_at":"2026-06-30T22:57:43Z","title":"Seed2.0 Model Card: Towards Intelligence Frontier for Real-World Complexity","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-02T18:57:46.841456Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2607.00248"},"observation_digest":"sha256:67441c74daf34546dd4d7b19abcd787db3059f8d83f689a8b689f099a0b4e818","observation_id":"dcc576b0-35a1-4d70-8ba8-bdb99db859d1","resolution":{"observed_at":"2026-07-02T19:07:17.410212Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-07T17:40:59.052312Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-07-12T06:13:16.894125Z","title":"arXiv preprint arXiv:2501.05444 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02907","last_updated":"2026-07-03T03:14:11Z","snapshot_observed_at":"2026-08-02T18:53:38.421944Z","submitted_at":"2026-07-03T03:14:11Z","title":"ProLaViT: Learning Progressive Latent Visual Thoughts in Structured Latent Space","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-12T06:13:16.894125Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2607.02907"},"observation_digest":"sha256:46b048295546618bade111a13ec49e1ef3ad2ea32b0d76b5e2ce88678f373987","observation_id":"1ad6a5de-5851-4a93-8ca7-e9b1d05f83b4","resolution":{"observed_at":"2026-07-12T06:13:16.894125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-07T17:40:59.052312Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-07-31T05:01:28.384980Z","title":"arXiv preprint arXiv:2501.05444 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24957","last_updated":"2026-07-27T18:04:54Z","snapshot_observed_at":"2026-08-01T22:57:25.487048Z","submitted_at":"2026-07-27T18:04:54Z","title":"PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-07-31T05:01:28.384980Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2607.24957"},"observation_digest":"sha256:bd36193cc53395b79f2f92fe329e9245eb093f3c83b3a2bdc8f23b1bd0029af7","observation_id":"e6992855-794e-4037-b7d3-00ab9c601dcb","resolution":{"observed_at":"2026-07-31T05:01:28.384980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2501.05444/citation-record","integrity":"/paper/2501.05444/integrity","json":"/paper/2501.05444/citation-record.json","paper":"/paper/2501.05444"},"outbound":[],"paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T17:40:59.052312Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 40 inbound Pith citation observations for arXiv:2501.05444."}