{"as_of":"2026-08-20T13:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9b0eca173a4e2478964ea74b433d6f723ad2171905683618b624a53a8e1ae08d","coverage":[{"denominator":298,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T23:21:12.332122Z","state":"measured"},{"denominator":135,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":135,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":35,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T17:09:17.693163Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-08T02:44:28.049569Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04921","snapshot_observed_at":"2026-08-07T15:38:54.543445Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14340","last_updated":"2025-05-20T13:27:17Z","snapshot_observed_at":"2026-08-19T20:16:07.372955Z","submitted_at":"2025-05-20T13:27:17Z","title":"Plane Geometry Problem Solving with Multi-modal Reasoning: A Survey","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T15:38:54.543445Z"},"links":{"cited_paper":"/paper/2505.04921","citing_paper":"/paper/2505.14340"},"observation_digest":"sha256:93d35a74f48031c5762be19a33fd95786ae2142e59138c5797c6866547afcc52","observation_id":"46b28112-0884-4205-b1a4-760b88ce13e1","resolution":{"observed_at":"2026-08-07T15:38:54.543445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04921","snapshot_observed_at":"2026-08-07T15:10:20.798959Z","title":"Perception, reason, think, and plan: A survey on large multimodal reasoning models.arXiv preprint arXiv:2505.04921, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17139","last_updated":"2025-05-30T07:31:07Z","snapshot_observed_at":"2026-08-14T02:24:36.002704Z","submitted_at":"2025-05-22T06:46:08Z","title":"EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:20.798959Z"},"links":{"cited_paper":"/paper/2505.04921","citing_paper":"/paper/2505.17139"},"observation_digest":"sha256:bdfde0d7eaf9c1796a8cac2f01a28a7691e82b25201d88b1491dc899d45fcbe4","observation_id":"fe3cb26d-1bf5-4cb4-8269-3a815cbc21c2","resolution":{"observed_at":"2026-08-07T15:10:20.798959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04921","snapshot_observed_at":"2026-08-07T14:25:36.210901Z","title":"Perception, reason, think, and plan: A survey on large multimodal reasoning models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19000","last_updated":"2025-05-25T06:41:28Z","snapshot_observed_at":"2026-08-07T14:19:46.017791Z","submitted_at":"2025-05-25T06:41:28Z","title":"VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:36.210901Z"},"links":{"cited_paper":"/paper/2505.04921","citing_paper":"/paper/2505.19000"},"observation_digest":"sha256:52f2179dd965e00e94d3c5b489b9a957731f2a8b865fa8e7a8ec6a3e9a005233","observation_id":"5564ec1e-1a3c-4ca7-9f33-586185119adb","resolution":{"observed_at":"2026-08-07T14:25:36.210901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04921","snapshot_observed_at":"2026-08-07T14:13:18.442382Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19684","last_updated":"2025-05-28T15:29:46Z","snapshot_observed_at":"2026-08-19T05:26:39.349750Z","submitted_at":"2025-05-26T08:45:06Z","title":"VisCRA: A Visual Chain Reasoning Attack for Jailbreaking Multimodal Large Language Models","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:18.442382Z"},"links":{"cited_paper":"/paper/2505.04921","citing_paper":"/paper/2505.19684"},"observation_digest":"sha256:f0162b465ff6678d720bbde3e55e2fac3508a38f1d659bfba224743e68b2986e","observation_id":"7e656524-aeba-4576-81d9-416574124109","resolution":{"observed_at":"2026-08-07T14:13:18.442382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04921","snapshot_observed_at":"2026-08-07T12:09:05.297228Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00479","last_updated":"2025-05-31T09:10:43Z","snapshot_observed_at":"2026-08-09T06:24:07.358275Z","submitted_at":"2025-05-31T09:10:43Z","title":"EffiVLM-BENCH: A Comprehensive Benchmark for Evaluating Training-Free Acceleration in Large Vision-Language Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T12:09:05.297228Z"},"links":{"cited_paper":"/paper/2505.04921","citing_paper":"/paper/2506.00479"},"observation_digest":"sha256:8de39bbc0c2e27c144ec9743e0b998caa531d84e03d083a4fe20a46872a30c79","observation_id":"ac921fad-726d-400e-9f44-58e6cc0506de","resolution":{"observed_at":"2026-08-07T12:09:05.297228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04921","snapshot_observed_at":"2026-08-07T10:32:35.405937Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05010","last_updated":"2025-06-05T13:20:50Z","snapshot_observed_at":"2026-08-09T10:45:52.243377Z","submitted_at":"2025-06-05T13:20:50Z","title":"ComfyUI-Copilot: An Intelligent Assistant for Automated Workflow Development","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T10:32:35.405937Z"},"links":{"cited_paper":"/paper/2505.04921","citing_paper":"/paper/2506.05010"},"observation_digest":"sha256:c81f5944c3cd64f9461eda219f043c764e29cf5f43ee5d40f21db7bfb48362e9","observation_id":"b9c93a89-4802-402b-93ce-6ad3eb38d705","resolution":{"observed_at":"2026-08-07T10:32:35.405937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04921","snapshot_observed_at":"2026-08-07T06:08:24.242469Z","title":"Perception, reason, think, and plan: A survey on large multimodal reasoning models.arXiv preprint arXiv:2505.04921, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06034","last_updated":"2025-06-06T12:33:12Z","snapshot_observed_at":"2026-08-17T15:04:03.680821Z","submitted_at":"2025-06-06T12:33:12Z","title":"MATP-BENCH: Can MLLM Be a Good Automated Theorem Prover for Multimodal Problems?","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T06:08:24.242469Z"},"links":{"cited_paper":"/paper/2505.04921","citing_paper":"/paper/2506.06034"},"observation_digest":"sha256:f2ecffd05b51db86b12efc2fc54ec463f4d906721374fca9d200fbe6212812c4","observation_id":"1330ca35-564b-4e96-b1b6-6053bf94d57a","resolution":{"observed_at":"2026-08-07T06:08:24.242469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04921","snapshot_observed_at":"2026-08-07T11:19:00.550341Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14805","last_updated":"2025-08-12T17:07:53Z","snapshot_observed_at":"2026-08-15T10:53:20.402399Z","submitted_at":"2025-06-03T13:44:14Z","title":"Argus Inspection: Do Multimodal Large Language Models Possess the Eye of Panoptes?","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T11:19:00.550341Z"},"links":{"cited_paper":"/paper/2505.04921","citing_paper":"/paper/2506.14805"},"observation_digest":"sha256:6f395dcf2dad54b859dbed6049347f2e08e4d55e3f29323ad72a86d372a28b45","observation_id":"aaf87cec-3555-4a75-a339-345378baf007","resolution":{"observed_at":"2026-08-07T11:19:00.550341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04921","snapshot_observed_at":"2026-08-06T21:54:44.397750Z","title":"Perception, reason, think, and plan: A survey on large multimodal reasoning models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23088","last_updated":"2025-06-29T04:59:39Z","snapshot_observed_at":"2026-08-15T20:17:44.939473Z","submitted_at":"2025-06-29T04:59:39Z","title":"Where, What, Why: Towards Explainable Driver Attention Prediction","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T21:54:44.397750Z"},"links":{"cited_paper":"/paper/2505.04921","citing_paper":"/paper/2506.23088"},"observation_digest":"sha256:5825136f141f05d6fb31989c891843ad42acd9d5f45ec6075cc69d57dac71955","observation_id":"8bb93239-230e-44fd-a208-d7405e69ce61","resolution":{"observed_at":"2026-08-06T21:54:44.397750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04921","snapshot_observed_at":"2026-08-06T20:15:52.633699Z","title":"Perception, reason, think, and plan: A survey on large multimodal reasoning models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-16T04:37:38.377850Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.633699Z"},"links":{"cited_paper":"/paper/2505.04921","citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:7cebfe93f85f9fce0f7f0cf0ca53b50b9091a818b825d33769e521594e65d294","observation_id":"814105ab-5d6c-4ee3-92ab-bf4575a160b2","resolution":{"observed_at":"2026-08-06T20:15:52.633699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04921","snapshot_observed_at":"2026-08-06T11:35:13.370466Z","title":"Perception, reason, think, and plan: A survey on large multimodal reasoning models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.22607","last_updated":"2025-07-31T09:09:45Z","snapshot_observed_at":"2026-08-13T02:58:31.453226Z","submitted_at":"2025-07-30T12:23:21Z","title":"VL-Cogito: Progressive Curriculum Reinforcement Learning for Advanced Multimodal Reasoning","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T11:35:13.370466Z"},"links":{"cited_paper":"/paper/2505.04921","citing_paper":"/paper/2507.22607"},"observation_digest":"sha256:acf3a8c81e1e56146b725f92a6136aef02db9a377a2d0799c82616318d846e9e","observation_id":"9d919eb4-5b50-4b83-a92f-34d7ca3bfdd8","resolution":{"observed_at":"2026-08-06T11:35:13.370466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04921","snapshot_observed_at":"2026-08-15T17:09:17.693163Z","title":"Perception, reason, think, and plan: A survey on large multimodal reasoning models.arXiv preprint arXiv:2505.04921,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-19T20:51:44.440472Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.693163Z"},"links":{"cited_paper":"/paper/2505.04921","citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:65cb1260a6fbaab8195f5d2656d7c938917f3714b2be6ecae54ccd4332dbed00","observation_id":"ba5105d8-c291-475e-bc8e-29ac4f2cd677","resolution":{"observed_at":"2026-08-15T17:09:17.693163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04921","snapshot_observed_at":"2026-08-05T16:31:57.845882Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.18421","last_updated":"2025-08-25T19:11:03Z","snapshot_observed_at":"2026-08-19T18:17:53.211273Z","submitted_at":"2025-08-25T19:11:03Z","title":"Why Relational Graphs Will Save the Next Generation of Vision Foundation Models?","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T16:31:57.845882Z"},"links":{"cited_paper":"/paper/2505.04921","citing_paper":"/paper/2508.18421"},"observation_digest":"sha256:a38b1cfad79ee4021f6487037deb8506b4101e9f49a2eb590e08d86644541e8e","observation_id":"bffba20d-c726-44ca-9288-01e43290b833","resolution":{"observed_at":"2026-08-05T16:31:57.845882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04921","snapshot_observed_at":"2026-08-05T16:20:59.685324Z","title":"Perception, reason, think, and plan: A survey on large multimodal reasoning models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.18725","last_updated":"2025-08-26T06:50:11Z","snapshot_observed_at":"2026-08-20T03:55:31.552070Z","submitted_at":"2025-08-26T06:50:11Z","title":"Toward Edge General Intelligence with Agentic AI and Agentification: Concepts, Technologies, and Future Directions","version":1},"reference_index":133,"source":"pdf_text","source_observed_at":"2026-08-05T16:20:59.685324Z"},"links":{"cited_paper":"/paper/2505.04921","citing_paper":"/paper/2508.18725"},"observation_digest":"sha256:e93fd131594a645072a74708b0be67dd1eb0bd2fb2332690a6c60c2774980ce0","observation_id":"e45b5ec3-a23d-49ae-98a7-e04075498a79","resolution":{"observed_at":"2026-08-05T16:20:59.685324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04921","snapshot_observed_at":"2026-08-05T10:39:01.493981Z","title":"Perception, reason, think, and plan: A survey on large multimodal reasoning models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:01.493981Z"},"links":{"cited_paper":"/paper/2505.04921","citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:4f50046ceaa0efc23f6d75a63655ef523948893cb812064bfebaaf5802a59d5f","observation_id":"194346aa-9f27-42e6-b08f-ae432e5de4b5","resolution":{"observed_at":"2026-08-05T10:39:01.493981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04921","snapshot_observed_at":"2026-08-04T19:34:25.492417Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09193","last_updated":"2025-09-11T07:09:30Z","snapshot_observed_at":"2026-08-07T07:37:18.552922Z","submitted_at":"2025-09-11T07:09:30Z","title":"AI Reasoning for Wireless Communications and Networking: A Survey and Perspectives","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T19:34:25.492417Z"},"links":{"cited_paper":"/paper/2505.04921","citing_paper":"/paper/2509.09193"},"observation_digest":"sha256:bdd5353bda78ddd6cae5f377dcd7c6b9a01979e70e385f9bd711279ccaa1332f","observation_id":"d65d6905-acca-4367-9f24-339f66b6618b","resolution":{"observed_at":"2026-08-04T19:34:25.492417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"cited_work":{"arxiv_id":"2505.04921","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.04921","snapshot_observed_at":"2026-07-08T02:44:28.049569Z","title":"Perception, reason, think, and plan: A survey on large multimodal reasoning models","venue":"cs.CV","work_id":"18ce98be-3cf0-4e03-b05f-ad32a6306ca2","year":2025},"citing_paper":{"arxiv_id":"2509.23322","last_updated":"2026-04-09T10:37:26Z","snapshot_observed_at":"2026-08-15T03:33:45.656722Z","submitted_at":"2025-09-27T14:13:41Z","title":"Mitigating Visual Context Degradation in Large Multimodal Models: A Training-Free Decoupled Agentic Framework","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-18T12:31:25.257879Z"},"links":{"cited_paper":"/paper/2505.04921","citing_paper":"/paper/2509.23322"},"observation_digest":"sha256:ac496414a102b265d429a7114a125599f30662c5fef74cc31c4d75f091b67cd2","observation_id":"616ab416-5f6c-42a8-bd47-e9155f0ad6a5","resolution":{"observed_at":"2026-05-18T12:32:36.361359Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"cited_work":{"arxiv_id":"2505.04921","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.04921","snapshot_observed_at":"2026-07-08T02:44:28.049569Z","title":"Perception, reason, think, and plan: A survey on large multimodal reasoning models","venue":"cs.CV","work_id":"18ce98be-3cf0-4e03-b05f-ad32a6306ca2","year":2025},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-17T03:09:31.161760Z"},"links":{"cited_paper":"/paper/2505.04921","citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:39341526b5e1566db4914c7f435de679d2504db0c42d98309ea9a0aab205fe4b","observation_id":"36a7b0d3-5897-4037-a822-8ca9115891bd","resolution":{"observed_at":"2026-05-17T03:11:30.087068Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04921","snapshot_observed_at":"2026-08-03T18:51:45.298957Z","title":"Perception, reason, think, and plan: A survey on large multimodal reasoning models.arXiv preprint arXiv:2505.04921, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-12T16:45:42.496889Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:45.298957Z"},"links":{"cited_paper":"/paper/2505.04921","citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:676cfa0ce5f987445d3ab2b5a685c7516db3d78d835bd3069993f2da624206f9","observation_id":"ec5d3588-2cf9-4939-b169-9d4cc35722ef","resolution":{"observed_at":"2026-08-03T18:51:45.298957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04921","snapshot_observed_at":"2026-08-02T20:30:56.951607Z","title":"Perception, reason, think, and plan: A survey on large multimodal reasoning models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.00171","last_updated":"2026-05-30T15:21:48Z","snapshot_observed_at":"2026-08-13T14:17:58.271358Z","submitted_at":"2026-02-26T15:41:26Z","title":"LookWise: Knowing When and Where to Look for Fine-Grained Visual Reasoning in Multimodal Large Language Models","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T20:30:56.951607Z"},"links":{"cited_paper":"/paper/2505.04921","citing_paper":"/paper/2603.00171"},"observation_digest":"sha256:568b9cd7bb503b7ff7c4e4bd62e8e379baed3d9a0836547afbe90d86ba3d785d","observation_id":"6cd204ca-3d25-4713-9dd6-08f368f410ad","resolution":{"observed_at":"2026-08-02T20:30:56.951607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"cited_work":{"arxiv_id":"2505.04921","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.04921","snapshot_observed_at":"2026-07-08T02:44:28.049569Z","title":"Perception, reason, think, and plan: A survey on large multimodal reasoning models","venue":"cs.CV","work_id":"18ce98be-3cf0-4e03-b05f-ad32a6306ca2","year":2025},"citing_paper":{"arxiv_id":"2604.08209","last_updated":"2026-04-09T13:09:40Z","snapshot_observed_at":"2026-08-15T05:04:48.579203Z","submitted_at":"2026-04-09T13:09:40Z","title":"OmniJigsaw: Enhancing Omni-Modal Reasoning via Modality-Orchestrated Reordering","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T17:45:51.528645Z"},"links":{"cited_paper":"/paper/2505.04921","citing_paper":"/paper/2604.08209"},"observation_digest":"sha256:dca79066acd92bc1e8d42b6d3bc67a5023b5dadf7c3d3deb0d2740fe153aeb8e","observation_id":"6d1c70cb-d8a9-40b9-b5b8-ec7df293a230","resolution":{"observed_at":"2026-05-11T06:11:01.552354Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"cited_work":{"arxiv_id":"2505.04921","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.04921","snapshot_observed_at":"2026-07-08T02:44:28.049569Z","title":"Perception, reason, think, and plan: A survey on large multimodal reasoning models","venue":"cs.CV","work_id":"18ce98be-3cf0-4e03-b05f-ad32a6306ca2","year":2025},"citing_paper":{"arxiv_id":"2604.11240","last_updated":"2026-08-07T07:55:15Z","snapshot_observed_at":"2026-08-15T19:42:32.677789Z","submitted_at":"2026-04-13T09:44:52Z","title":"Decoupled Similarity for Task-Aware Token Pruning in Large Vision-Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T15:15:04.261855Z"},"links":{"cited_paper":"/paper/2505.04921","citing_paper":"/paper/2604.11240"},"observation_digest":"sha256:74e7ef7f1fee26e85cb8520d83c6f93502b613bfceeed2eb1cae862412bd8e7b","observation_id":"438d5b62-a28e-4181-bc8a-a59a304a203a","resolution":{"observed_at":"2026-05-11T10:56:05.744774Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"cited_work":{"arxiv_id":"2505.04921","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.04921","snapshot_observed_at":"2026-07-08T02:44:28.049569Z","title":"Perception, reason, think, and plan: A survey on large multimodal reasoning models","venue":"cs.CV","work_id":"18ce98be-3cf0-4e03-b05f-ad32a6306ca2","year":2025},"citing_paper":{"arxiv_id":"2604.17914","last_updated":"2026-04-20T07:47:51Z","snapshot_observed_at":"2026-08-15T21:53:47.932569Z","submitted_at":"2026-04-20T07:47:51Z","title":"Beyond Binary Contrast: Modeling Continuous Skeleton Action Spaces with Transitional Anchors","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T04:32:04.547197Z"},"links":{"cited_paper":"/paper/2505.04921","citing_paper":"/paper/2604.17914"},"observation_digest":"sha256:7fbaf5fd6190cd8a54cf5f1a569f1a8e9de3dcbb7a655da4a8fa4b05e5e1557e","observation_id":"65ac6982-1253-44bc-8b74-f1915ca8ca32","resolution":{"observed_at":"2026-05-11T11:51:03.578653Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"cited_work":{"arxiv_id":"2505.04921","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.04921","snapshot_observed_at":"2026-07-08T02:44:28.049569Z","title":"Perception, reason, think, and plan: A survey on large multimodal reasoning models","venue":"cs.CV","work_id":"18ce98be-3cf0-4e03-b05f-ad32a6306ca2","year":2025},"citing_paper":{"arxiv_id":"2605.10106","last_updated":"2026-05-11T07:20:09Z","snapshot_observed_at":"2026-07-06T23:22:08.560919Z","submitted_at":"2026-05-11T07:20:09Z","title":"ViSRA: A Video-based Spatial Reasoning Agent for Multi-modal Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-12T04:00:23.681682Z"},"links":{"cited_paper":"/paper/2505.04921","citing_paper":"/paper/2605.10106"},"observation_digest":"sha256:a6e19d99fc393f7b58adbe7a948918c8d9c46e475ac3c925ce308eed1bf292b5","observation_id":"c0c8f5af-aa88-4182-a8e6-315ab58e9420","resolution":{"observed_at":"2026-05-12T06:46:36.421527Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"cited_work":{"arxiv_id":"2505.04921","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.04921","snapshot_observed_at":"2026-07-08T02:44:28.049569Z","title":"Perception, reason, think, and plan: A survey on large multimodal reasoning models","venue":"cs.CV","work_id":"18ce98be-3cf0-4e03-b05f-ad32a6306ca2","year":2025},"citing_paper":{"arxiv_id":"2605.23294","last_updated":"2026-05-22T07:10:57Z","snapshot_observed_at":"2026-08-14T05:24:03.235008Z","submitted_at":"2026-05-22T07:10:57Z","title":"NASiC: 3D NAND-based CAM-Selected Multibit CIM Architecture for Efficient On-Device Mixture-of-Experts LLM Inference","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-25T02:57:04.813106Z"},"links":{"cited_paper":"/paper/2505.04921","citing_paper":"/paper/2605.23294"},"observation_digest":"sha256:df8a0775cdbdff24e276d0d77a30af391aacde763f87b01e34aa31d3fe0b1267","observation_id":"5fc18d1e-fa3c-4bc0-9b50-8b7785c4f707","resolution":{"observed_at":"2026-05-25T03:00:16.019653Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"cited_work":{"arxiv_id":"2505.04921","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.04921","snapshot_observed_at":"2026-07-08T02:44:28.049569Z","title":"Perception, reason, think, and plan: A survey on large multimodal reasoning models","venue":"cs.CV","work_id":"18ce98be-3cf0-4e03-b05f-ad32a6306ca2","year":2025},"citing_paper":{"arxiv_id":"2605.24562","last_updated":"2026-05-23T12:56:44Z","snapshot_observed_at":"2026-08-15T00:39:58.953115Z","submitted_at":"2026-05-23T12:56:44Z","title":"PEDESTRIANQA: A Benchmark for Vision-Language Models on Pedestrian Intention and Trajectory Prediction","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-30T13:25:04.053283Z"},"links":{"cited_paper":"/paper/2505.04921","citing_paper":"/paper/2605.24562"},"observation_digest":"sha256:3cb7af958e159030e49d776a99de8a4632cd9b6110423f77561e038f4aebff73","observation_id":"f2fe28ed-01c0-4b75-87bb-6b6533eebe8f","resolution":{"observed_at":"2026-06-30T13:34:40.936877Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"cited_work":{"arxiv_id":"2505.04921","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.04921","snapshot_observed_at":"2026-07-08T02:44:28.049569Z","title":"Perception, reason, think, and plan: A survey on large multimodal reasoning models","venue":"cs.CV","work_id":"18ce98be-3cf0-4e03-b05f-ad32a6306ca2","year":2025},"citing_paper":{"arxiv_id":"2605.25571","last_updated":"2026-05-25T08:26:34Z","snapshot_observed_at":"2026-08-11T23:46:03.759864Z","submitted_at":"2026-05-25T08:26:34Z","title":"AnE: Pushing the Reasoning Frontier of Multimodal LLMs via Anchor Evolution","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T22:56:39.504430Z"},"links":{"cited_paper":"/paper/2505.04921","citing_paper":"/paper/2605.25571"},"observation_digest":"sha256:55f6bfb4c9b91453911b8edd6dc3bc3948c108431bc7ac0b7358ad346cbdec7b","observation_id":"86f6ae4c-1b6e-4e9b-82de-283950f3170c","resolution":{"observed_at":"2026-06-30T00:14:04.662917Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"cited_work":{"arxiv_id":"2505.04921","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.04921","snapshot_observed_at":"2026-07-08T02:44:28.049569Z","title":"Perception, reason, think, and plan: A survey on large multimodal reasoning models","venue":"cs.CV","work_id":"18ce98be-3cf0-4e03-b05f-ad32a6306ca2","year":2025},"citing_paper":{"arxiv_id":"2605.27960","last_updated":"2026-05-27T04:54:07Z","snapshot_observed_at":"2026-08-12T14:10:06.462426Z","submitted_at":"2026-05-27T04:54:07Z","title":"Mags-RL: Wearing Multimodal LLMs a Magnifying Glass via Agentic Reinforcement Learning For Complex Scene Reasoning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-29T13:38:01.819121Z"},"links":{"cited_paper":"/paper/2505.04921","citing_paper":"/paper/2605.27960"},"observation_digest":"sha256:13e52d81db5be8f436c3b79712ccfbc62c6de6821308eb6df07beed2de386ee0","observation_id":"50254a08-a76b-4ad7-94c6-df15f8d46f46","resolution":{"observed_at":"2026-06-29T13:43:29.018395Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"cited_work":{"arxiv_id":"2505.04921","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.04921","snapshot_observed_at":"2026-07-08T02:44:28.049569Z","title":"Perception, reason, think, and plan: A survey on large multimodal reasoning models","venue":"cs.CV","work_id":"18ce98be-3cf0-4e03-b05f-ad32a6306ca2","year":2025},"citing_paper":{"arxiv_id":"2606.07433","last_updated":"2026-06-05T16:29:13Z","snapshot_observed_at":"2026-08-01T21:05:06.439607Z","submitted_at":"2026-06-05T16:29:13Z","title":"Watch, Remember, Reason: Human-View Video Understanding with MLLMs","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-27T22:00:28.350003Z"},"links":{"cited_paper":"/paper/2505.04921","citing_paper":"/paper/2606.07433"},"observation_digest":"sha256:c8fe8ff66c1b8e2a57e7084f5841506ed19b888d636f7f26fa0b3e9f455e7e9a","observation_id":"3db0dc68-3a88-4d5a-b518-32cb56fcfb3b","resolution":{"observed_at":"2026-07-02T17:37:14.037520Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"cited_work":{"arxiv_id":"2505.04921","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.04921","snapshot_observed_at":"2026-07-08T02:44:28.049569Z","title":"Perception, reason, think, and plan: A survey on large multimodal reasoning models","venue":"cs.CV","work_id":"18ce98be-3cf0-4e03-b05f-ad32a6306ca2","year":2025},"citing_paper":{"arxiv_id":"2606.07643","last_updated":"2026-06-01T19:12:09Z","snapshot_observed_at":"2026-08-04T07:32:54.888878Z","submitted_at":"2026-06-01T19:12:09Z","title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-06-28T14:36:53.295540Z"},"links":{"cited_paper":"/paper/2505.04921","citing_paper":"/paper/2606.07643"},"observation_digest":"sha256:80bc1dfd4fbdd82e822d3840c2bc71f93722b0316b49bb58f28d954af0cdf4a0","observation_id":"f137f6d5-c43a-4677-9922-2d3efa2a795b","resolution":{"observed_at":"2026-07-01T23:06:21.347654Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"cited_work":{"arxiv_id":"2505.04921","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.04921","snapshot_observed_at":"2026-07-08T02:44:28.049569Z","title":"Perception, reason, think, and plan: A survey on large multimodal reasoning models","venue":"cs.CV","work_id":"18ce98be-3cf0-4e03-b05f-ad32a6306ca2","year":2025},"citing_paper":{"arxiv_id":"2606.27330","last_updated":"2026-06-25T17:44:48Z","snapshot_observed_at":"2026-08-03T00:40:31.745653Z","submitted_at":"2026-06-25T17:44:48Z","title":"Empowering GUI Agents via Autonomous Experience Exploration and Hindsight Experience Utilization for Task Planning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-06-26T03:51:51.827622Z"},"links":{"cited_paper":"/paper/2505.04921","citing_paper":"/paper/2606.27330"},"observation_digest":"sha256:bc0808c1fb1cf4c7809bf30ce16bb20d742df449ecb5eed91fd39b1b763b6327","observation_id":"815cbf74-c26e-40c7-9108-d33440545e1c","resolution":{"observed_at":"2026-07-04T14:29:53.387832Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"cited_work":{"arxiv_id":"2505.04921","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.04921","snapshot_observed_at":"2026-07-08T02:44:28.049569Z","title":"Perception, reason, think, and plan: A survey on large multimodal reasoning models","venue":"cs.CV","work_id":"18ce98be-3cf0-4e03-b05f-ad32a6306ca2","year":2025},"citing_paper":{"arxiv_id":"2607.06540","last_updated":"2026-07-07T17:43:36Z","snapshot_observed_at":"2026-08-14T20:31:36.453957Z","submitted_at":"2026-07-07T17:43:36Z","title":"Hierarchical Acoustic-Semantic Modeling: Modality Separation and Semantic Coherence for Full-Duplex SLMs","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-07-08T02:38:31.073805Z"},"links":{"cited_paper":"/paper/2505.04921","citing_paper":"/paper/2607.06540"},"observation_digest":"sha256:a5642169db4b256671bbf129404e0f626527819d382f83cbff77149f4ea4ac17","observation_id":"9729d942-8013-4e75-8fe9-66e95fc67465","resolution":{"observed_at":"2026-07-08T02:44:28.050948Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04921","snapshot_observed_at":"2026-07-14T09:13:07.507164Z","title":"arXiv preprint arXiv:2505.04921 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10796","last_updated":"2026-07-12T15:09:03Z","snapshot_observed_at":"2026-08-19T17:50:14.691642Z","submitted_at":"2026-07-12T15:09:03Z","title":"Mixture of Cognitive Experts in Large Vision-Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-14T09:13:07.507164Z"},"links":{"cited_paper":"/paper/2505.04921","citing_paper":"/paper/2607.10796"},"observation_digest":"sha256:5925c18f69b0e3706908ee7f8153d2df98aa7f09a7c8a8fad53ed35b2e2a6814","observation_id":"39982139-c36d-4678-a8ab-a2e0f5789ddd","resolution":{"observed_at":"2026-07-14T09:13:07.507164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04921","snapshot_observed_at":"2026-08-01T21:08:19.564996Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16193","last_updated":"2026-07-17T17:59:56Z","snapshot_observed_at":"2026-08-20T04:53:03.259682Z","submitted_at":"2026-07-17T17:59:56Z","title":"Knowing the Self, Understanding the World: A Dual-Cognition Benchmark for UAV Spatio-temporal Reasoning with MLLMs","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:19.564996Z"},"links":{"cited_paper":"/paper/2505.04921","citing_paper":"/paper/2607.16193"},"observation_digest":"sha256:146b7171fdf090d524cce75b656fbc02a815dc333cf1d8941e962ba6cfd3573d","observation_id":"d79251d8-84ac-45b3-bd19-4b1fb35c38a3","resolution":{"observed_at":"2026-08-01T21:08:19.564996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04921","snapshot_observed_at":"2026-08-02T13:42:25.191504Z","title":"Eagle: Specula- tive sampling requires rethinking feature uncertainty","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20467","last_updated":"2026-05-19T06:27:58Z","snapshot_observed_at":"2026-08-18T12:17:49.444133Z","submitted_at":"2026-05-19T06:27:58Z","title":"DC-Leap: Training-Free Acceleration of dLLMs via Draft-Guided Contiguous Leaping Decoding","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-02T13:42:25.191504Z"},"links":{"cited_paper":"/paper/2505.04921","citing_paper":"/paper/2607.20467"},"observation_digest":"sha256:f3c99516b5da548bc3bc3d3b3daec3a45db46842cd7d1b694a471801146ae454","observation_id":"6f897abd-8868-4151-b05f-2845cbbfeee4","resolution":{"observed_at":"2026-08-02T13:42:25.191504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.04921/citation-record","integrity":"/paper/2505.04921/integrity","json":"/paper/2505.04921/citation-record.json","paper":"/paper/2505.04921"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:21:11.811188Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:11.811188Z"},"links":{"citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:33896b93a7463d47cf2ad76dda7bfc06b4015d8246c7a7e7e1fd5256e548af5a","observation_id":"f0ad07dd-b816-42cd-a1b7-e83469af7953","resolution":{"observed_at":"2026-08-15T23:21:11.811188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.08675","last_updated":"2016-09-27T21:21:49Z","snapshot_observed_at":"2026-08-14T21:37:52.670253Z","submitted_at":"2016-09-27T21:21:49Z","title":"YouTube-8M: A Large-Scale Video Classification Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.08675","snapshot_observed_at":"2026-08-15T23:21:11.818647Z","title":"Youtube-8m: A large-scale video classification benchmark, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:11.818647Z"},"links":{"cited_paper":"/paper/1609.08675","citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:0f8f6a0929c86407fa92dc0dca1883ed90f5a3b78d96cc9bdf316aebb3d33dc4","observation_id":"91a1291b-d854-42a9-8163-7475fd2cac57","resolution":{"observed_at":"2026-08-15T23:21:11.818647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15816","last_updated":"2025-05-10T06:12:58Z","snapshot_observed_at":"2026-08-16T12:48:24.950452Z","submitted_at":"2025-03-20T03:03:46Z","title":"A Vision Centric Remote Sensing Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.15816","snapshot_observed_at":"2026-08-15T23:21:11.826609Z","title":"A vision centric remote sensing benchmark, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:11.826609Z"},"links":{"cited_paper":"/paper/2503.15816","citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:d1974d88ba33329a435be22ef04e3f23c5d2ee9c825a7a14dea59b625ce6e4b1","observation_id":"0753eab9-8266-4a2b-b1dd-2e43726b9634","resolution":{"observed_at":"2026-08-15T23:21:11.826609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.11325","last_updated":"2023-01-26T18:58:53Z","snapshot_observed_at":"2026-08-17T00:33:41.369960Z","submitted_at":"2023-01-26T18:58:53Z","title":"MusicLM: Generating Music From Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.11325","snapshot_observed_at":"2026-08-15T23:21:11.832194Z","title":"Denk, Zal \\' a n Borsos, Jesse H","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:11.832194Z"},"links":{"cited_paper":"/paper/2301.11325","citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:23bfbb10cb058f11061f7945de9b8de397ee891a5b57c8ad439ceedef3cc889c","observation_id":"de9d64bd-e2b2-49c6-99b7-3b8d982bd2d0","resolution":{"observed_at":"2026-08-15T23:21:11.832194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09344","snapshot_observed_at":"2026-08-15T23:21:11.838092Z","title":"Ming-omni: A unified multimodal model for perception and generation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:11.838092Z"},"links":{"cited_paper":"/paper/2506.09344","citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:1d003ad88163d15fac541cc337bf16427ed606030311844dfc3d99511b827f03","observation_id":"f5a44a29-2cb8-4c17-8dc1-78f83a0dfabf","resolution":{"observed_at":"2026-08-15T23:21:11.838092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:21:11.843577Z","title":"GQA: training generalized multi-query transformer models from multi-head checkpoints","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:11.843577Z"},"links":{"citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:5188f68baea5fecf44a6897130ca3010d10971cea80736b11a5f001a2919fb20","observation_id":"ffe5edc0-4eb4-41c1-b128-1c7e31112911","resolution":{"observed_at":"2026-08-15T23:21:11.843577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:21:11.849201Z","title":"SBVQA 2.0 : Robust end-to-end speech-based visual question answering for open-ended questions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:11.849201Z"},"links":{"citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:adedb49947fa7e3dfe0b0c474c61cfbca73e7e6fd132dba0cfcfede24832965e","observation_id":"ed9d90f8-c783-4f1d-aa89-6d2db0ec3bfd","resolution":{"observed_at":"2026-08-15T23:21:11.849201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-08-17T03:00:38.806206Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-15T23:21:11.854968Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:11.854968Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:44ccd928a90184a7bcd84ced588f4e5887beb437c59286981cfd46b26b7027f0","observation_id":"8abd5d5b-f358-4d7d-8924-dc5807925307","resolution":{"observed_at":"2026-08-15T23:21:11.854968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:21:11.860328Z","title":"Mathqa: Towards interpretable math word problem solving with operation-based formalisms","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:11.860328Z"},"links":{"citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:c1796d8ec5b34ae4c1178b9767925596c1104a8092d2d9ce91da68eda0dd91ec","observation_id":"05ac0287-a6b4-4f15-b568-451ae72353fe","resolution":{"observed_at":"2026-08-15T23:21:11.860328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:21:11.864991Z","title":"OpenLEAF : A novel benchmark for open-domain interleaved image-text generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:11.864991Z"},"links":{"citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:34d46660ff9d0fe2a05da6ed92cb2592da7c7a6f46bc15726f22fb330690f9c3","observation_id":"69092a75-45bc-478a-b916-2ec903181ed0","resolution":{"observed_at":"2026-08-15T23:21:11.864991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:21:11.869810Z","title":"Bottom-up and top-down attention for image captioning and visual question answering","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:11.869810Z"},"links":{"citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:37f5bf94ef9ef0662b67f96bbd1bdc95f97e1ee62d612fd19339902d7bcd7add","observation_id":"59038a36-2311-4332-ba1e-e79d8844ac9a","resolution":{"observed_at":"2026-08-15T23:21:11.869810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:21:11.874907Z","title":"Neural module networks","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:11.874907Z"},"links":{"citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:e5123236313f112b4baa6619b694c583e84bdd5e85eece9813d45236828693b9","observation_id":"2eedefe3-1a12-4dc9-8a70-22f215f4aada","resolution":{"observed_at":"2026-08-15T23:21:11.874907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:21:11.879763Z","title":"Introducing the model context protocol, April 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:11.879763Z"},"links":{"citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:d39097cd15f3ca23059fcfd6530f697a3f2db637be020e4b1d7e8fad2def2811","observation_id":"a817012d-de77-4ca1-b6f3-f9aba882d68a","resolution":{"observed_at":"2026-08-15T23:21:11.879763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:21:11.884218Z","title":"Lawrence Zitnick, and Devi Parikh","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:11.884218Z"},"links":{"citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:0313fa58d9baa0661aef71a7045f8000c432403f9bf17aa37c8952a68b7e40da","observation_id":"c716147e-05df-4381-9b11-b5436ed5fd19","resolution":{"observed_at":"2026-08-15T23:21:11.884218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:21:11.889316Z","title":"Sd-eval: A benchmark dataset for spoken dialogue understanding beyond words","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:11.889316Z"},"links":{"citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:d0d907ca35ac35a0c0c7d28f8bd3f627af9549fa0df80b645b6d9a982b3169c6","observation_id":"5b5d3223-0fb7-4f4c-a11b-4b1610fb0632","resolution":{"observed_at":"2026-08-15T23:21:11.889316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:21:11.894727Z","title":"Tyers, and Gregor Weber","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:11.894727Z"},"links":{"citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:29258f892c4f6aef851c168d3cf14fd9426e1fa056dfaf064ab8877db66cb32e","observation_id":"fc5452d0-9618-4e2c-a68b-8eece14e1ca4","resolution":{"observed_at":"2026-08-15T23:21:11.894727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:21:11.899715Z","title":"Genesis: A universal and generative physics engine for robotics and beyond, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:11.899715Z"},"links":{"citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:167f9999f5d42bba393e4fcccf9122787326377f7d1e7a557e3b2094a7af4465","observation_id":"95f4518d-20c2-415c-81e3-4ae46eb773da","resolution":{"observed_at":"2026-08-15T23:21:11.899715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-15T23:21:11.905247Z","title":"Qwen-vl: A versatile vision-language model for understanding, localization, text reading, and beyond, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:11.905247Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:9a547f51393d2a92a160687d354fd3d92a83c179ba1eb4a346bd2f3103006284","observation_id":"cc538788-283e-4e4d-a4d7-3921e53b85e3","resolution":{"observed_at":"2026-08-15T23:21:11.905247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14231","last_updated":"2025-05-20T11:40:43Z","snapshot_observed_at":"2026-08-19T19:20:03.422136Z","submitted_at":"2025-05-20T11:40:43Z","title":"UniVG-R1: Reasoning Guided Universal Visual Grounding with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14231","snapshot_observed_at":"2026-08-15T23:21:11.910364Z","title":"Univg-r1: Reasoning guided universal visual grounding with reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:11.910364Z"},"links":{"cited_paper":"/paper/2505.14231","citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:c456727e5807533787eded09a01e3a44d6fd4211dfedebd9ed9f14f1c7961900","observation_id":"da5cbcd8-03ad-48e7-b678-bd2f4775f3bb","resolution":{"observed_at":"2026-08-15T23:21:11.910364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.00650","last_updated":"2022-05-13T14:41:49Z","snapshot_observed_at":"2026-08-16T18:34:25.784233Z","submitted_at":"2021-04-01T17:48:27Z","title":"Frozen in Time: A Joint Video and Image Encoder for End-to-End Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.00650","snapshot_observed_at":"2026-08-15T23:21:11.915560Z","title":"Frozen in time: A joint video and image encoder for end-to-end retrieval, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:11.915560Z"},"links":{"cited_paper":"/paper/2104.00650","citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:db86f9ed8da23978e717e7f3cccddf788aae35b8ffb4b38c27a4a03e0b994fba","observation_id":"2197da46-132a-4116-ac63-ac48313c804b","resolution":{"observed_at":"2026-08-15T23:21:11.915560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03520","last_updated":"2024-10-03T17:24:40Z","snapshot_observed_at":"2026-08-16T12:54:37.000371Z","submitted_at":"2024-06-05T17:53:55Z","title":"VideoPhy: Evaluating Physical Commonsense for Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03520","snapshot_observed_at":"2026-08-15T23:21:11.921526Z","title":"Videophy: Evaluating physical commonsense for video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:11.921526Z"},"links":{"cited_paper":"/paper/2406.03520","citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:a5cce32c7410dc336e726a679d35aefa08e19fb40f02b462bd60e51bdda97807","observation_id":"91539f90-b20f-4bda-939a-01309eead3a5","resolution":{"observed_at":"2026-08-15T23:21:11.921526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:21:11.926461Z","title":"Beit: BERT pre-training of image transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:11.926461Z"},"links":{"citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:1b06c48bbbb399223d6ef3030571e5baf2c834b23ecca1dcd3e174a017ff712a","observation_id":"4d1d1cdc-4647-4914-a32c-e7eb81253f22","resolution":{"observed_at":"2026-08-15T23:21:11.926461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:21:11.932120Z","title":"Vlmo: Unified vision-language pre-training with mixture-of-modality-experts","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:11.932120Z"},"links":{"citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:75978797bd7649d7a0f9badc11d33a39dff7b150e13755d047edb7d803735d37","observation_id":"d77300af-b664-426e-b247-c168a4b15752","resolution":{"observed_at":"2026-08-15T23:21:11.932120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17343","last_updated":"2023-12-28T20:01:27Z","snapshot_observed_at":"2026-08-16T14:31:03.381893Z","submitted_at":"2023-12-28T20:01:27Z","title":"AQUALLM: Audio Question Answering Data Generation Using Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.17343","snapshot_observed_at":"2026-08-15T23:21:11.937028Z","title":"Aquallm: audio question answering data generation using large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:11.937028Z"},"links":{"cited_paper":"/paper/2312.17343","citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:961ec63fd407003b7882f98a51b3b13b9d37cb97f57d75cc098d52f3c1441b44","observation_id":"18dbab3f-4647-4ec4-b20c-2af90bfec365","resolution":{"observed_at":"2026-08-15T23:21:11.937028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:21:11.942359Z","title":"Semantic parsing on freebase from question-answer pairs","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:11.942359Z"},"links":{"citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:67dde766f45e5c86754700d79716646b3817ae0a32f989ce141a450b40507804","observation_id":"c994d44a-4fab-4b12-b5b0-9fba4236c8ff","resolution":{"observed_at":"2026-08-15T23:21:11.942359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:21:11.947035Z","title":"Why reasoning matters? a survey of advancements in multimodal reasoning (v1)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:11.947035Z"},"links":{"citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:e27c4da2a44fca00072d3ad17b221389aad01ab359627b5e1dce705085737486","observation_id":"40e552fa-81bc-447d-802c-813a4f8fa3f2","resolution":{"observed_at":"2026-08-15T23:21:11.947035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:21:11.952240Z","title":"Workarena++: Towards compositional planning and reasoning-based common knowledge work tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:11.952240Z"},"links":{"citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:9ef7970f6a372e3916ef88a12203a62afe222600ee409de9bcc7762017940a0f","observation_id":"1998264f-89a4-4022-aa1c-54cb5b69af54","resolution":{"observed_at":"2026-08-15T23:21:11.952240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.08264","last_updated":"2024-09-13T20:17:13Z","snapshot_observed_at":"2026-08-20T04:44:03.331291Z","submitted_at":"2024-09-12T17:56:43Z","title":"Windows Agent Arena: Evaluating Multi-Modal OS Agents at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.08264","snapshot_observed_at":"2026-08-15T23:21:11.957074Z","title":"Windows agent arena: Evaluating multi-modal OS agents at scale","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:11.957074Z"},"links":{"cited_paper":"/paper/2409.08264","citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:d99ad47af4316e67d0adc8773a4b060f36c8f4c052f4ffb156d606493485c8aa","observation_id":"c313bb05-9935-4fb3-8e46-8c72e953fb01","resolution":{"observed_at":"2026-08-15T23:21:11.957074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.03906","last_updated":"2025-04-04T20:01:00Z","snapshot_observed_at":"2026-08-16T12:43:51.177842Z","submitted_at":"2025-04-04T20:01:00Z","title":"CliME: Evaluating Multimodal Climate Discourse on Social Media and the Climate Alignment Quotient (CAQ)","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.03906","snapshot_observed_at":"2026-08-15T23:21:11.962158Z","title":"Clime: Evaluating multimodal climate discourse on social media and the climate alignment quotient (caq), 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:11.962158Z"},"links":{"cited_paper":"/paper/2504.03906","citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:69a7e8bd6d0eb8d85fefc423bdc6eb9af08e51e076e992f42a5e13c9741854c0","observation_id":"de9d40b0-7bec-41af-8995-87d8e10e5cee","resolution":{"observed_at":"2026-08-15T23:21:11.962158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:21:11.967316Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:11.967316Z"},"links":{"citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:1f317753c6f6f2db64e4cc86a75f524b42ad9cc87f18fac9aed1779682e801a3","observation_id":"a5bcfe1b-48ff-42f7-963d-9576cd04ca1b","resolution":{"observed_at":"2026-08-15T23:21:11.967316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:21:11.972426Z","title":"AISHELL-1: an open-source mandarin speech corpus and a speech recognition baseline","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:11.972426Z"},"links":{"citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:29c61a58982fda504e1672de4af0e1123adb804b5eb4658af8a136934258f3cf","observation_id":"5e149d3c-4e02-4e76-bd59-ccf9e2f6b061","resolution":{"observed_at":"2026-08-15T23:21:11.972426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13399","last_updated":"2025-03-17T17:33:10Z","snapshot_observed_at":"2026-08-18T20:58:02.828826Z","submitted_at":"2025-03-17T17:33:10Z","title":"MicroVQA: A Multimodal Reasoning Benchmark for Microscopy-Based Scientific Research","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13399","snapshot_observed_at":"2026-08-15T23:21:11.977588Z","title":"Galaz-Montoya, Yuhui Zhang, Yuchang Su, Disha Bhowmik, Zachary Coman, Sarina M","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:11.977588Z"},"links":{"cited_paper":"/paper/2503.13399","citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:bc9af99c982382f08d94fdc9e0a99118f919112153ab9ed3c02356dd31bd0dce","observation_id":"a08b21d3-4451-49e1-b3b9-f018d1a7b4fd","resolution":{"observed_at":"2026-08-15T23:21:11.977588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:21:11.983047Z","title":"Murel: Multimodal relational reasoning for visual question answering","venue":null,"work_id":null,"year":1989},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:11.983047Z"},"links":{"citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:b8ee6758f241587593b20adf1b5318ea38cdec82ca4c9969fa259d57a1391c53","observation_id":"9db43788-3578-4b3a-8e45-9b8e83fcb1f3","resolution":{"observed_at":"2026-08-15T23:21:11.983047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1612.03716","last_updated":"2018-03-28T10:15:59Z","snapshot_observed_at":"2026-08-14T21:25:58.670846Z","submitted_at":"2016-12-12T14:46:23Z","title":"COCO-Stuff: Thing and Stuff Classes in Context","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1612.03716","snapshot_observed_at":"2026-08-15T23:21:11.988107Z","title":"Coco-stuff: Thing and stuff classes in context","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:11.988107Z"},"links":{"cited_paper":"/paper/1612.03716","citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:c95f7e06ef860749d9f1572ccbecca14707411efc2b092a182db3fc26e8055a2","observation_id":"5e409cc1-cd3f-4673-b624-203c3e6f8f78","resolution":{"observed_at":"2026-08-15T23:21:11.988107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:21:11.993564Z","title":"Mm-iq: Benchmarking human-like abstraction and reasoning in multimodal models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:11.993564Z"},"links":{"citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:08a49aace49d29c6a2ec1d2b80a57c6bf2fd549bd557d0bd5efda802da84116b","observation_id":"d731f108-1802-49d9-be03-ddc3c4affbc3","resolution":{"observed_at":"2026-08-15T23:21:11.993564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17490","last_updated":"2025-05-29T02:43:50Z","snapshot_observed_at":"2026-08-18T09:21:02.901770Z","submitted_at":"2024-07-03T17:59:58Z","title":"AMEX: Android Multi-annotation Expo Dataset for Mobile GUI Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.17490","snapshot_observed_at":"2026-08-15T23:21:11.998414Z","title":"AMEX: android multi-annotation expo dataset for mobile GUI agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:11.998414Z"},"links":{"cited_paper":"/paper/2407.17490","citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:13b50ac8dc74545d677c8635516245ee2b18d6d63006f4f79cf4ae61c92d3803","observation_id":"759aab37-0d16-4737-bd57-2539dace4745","resolution":{"observed_at":"2026-08-15T23:21:11.998414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:21:12.003791Z","title":"Chateval: Towards better LLM -based evaluators through multi-agent debate","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:12.003791Z"},"links":{"citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:ab3dd96d4ca542ecdc4f3d1f703ef885a7a19664b4d8ce050e75c201a813ea54","observation_id":"5c5d6b69-2408-4cde-b9db-40bf07644f0e","resolution":{"observed_at":"2026-08-15T23:21:12.003791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09964","last_updated":"2025-03-13T02:10:29Z","snapshot_observed_at":"2026-08-16T12:50:32.630294Z","submitted_at":"2025-03-13T02:10:29Z","title":"ExtremeAIGC: Benchmarking LMM Vulnerability to AI-Generated Extremist Content","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09964","snapshot_observed_at":"2026-08-15T23:21:12.008443Z","title":"Extremeaigc: Benchmarking lmm vulnerability to ai-generated extremist content, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:12.008443Z"},"links":{"cited_paper":"/paper/2503.09964","citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:cc9afd46e95c5ff2df5ec4ced050c7089583885858f2a09149bf03a6d9051833","observation_id":"843df601-43d7-4e6c-85ee-a936f988832f","resolution":{"observed_at":"2026-08-15T23:21:12.008443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03672","last_updated":"2024-07-04T06:37:09Z","snapshot_observed_at":"2026-08-19T02:29:47.022843Z","submitted_at":"2024-07-04T06:37:09Z","title":"A Survey of Data Synthesis Approaches","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03672","snapshot_observed_at":"2026-08-15T23:21:12.013775Z","title":"A survey of data synthesis approaches","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:12.013775Z"},"links":{"cited_paper":"/paper/2407.03672","citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:d3b0c73c3bafada09166c754cba97247c5f282738ebe075d70ea2123929d3143","observation_id":"dc2f9211-1469-4310-9e56-6077451e8b22","resolution":{"observed_at":"2026-08-15T23:21:12.013775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:21:12.018928Z","title":"Conceptual 12m: Pushing web-scale image-text pre-training to recognize long-tail visual concepts","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:12.018928Z"},"links":{"citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:7ecc41f41e78c46958cc8257c864ed149efbecf9a0b92ac5945f26274df346fb","observation_id":"b3354fd1-0959-42c2-a3b6-2e3fb93ab611","resolution":{"observed_at":"2026-08-15T23:21:12.018928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:21:12.024063Z","title":"Mllm-as-a-judge: assessing multimodal llm-as-a-judge with vision-language benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:12.024063Z"},"links":{"citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:e09ee4cdb9233f933a948c27f0f93e0a5957e6fc1b31a3aae059b243e9d5277a","observation_id":"41bc3055-6c39-4f7e-98fa-81938b173764","resolution":{"observed_at":"2026-08-15T23:21:12.024063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10819","last_updated":"2025-03-24T11:46:14Z","snapshot_observed_at":"2026-08-17T04:18:10.326641Z","submitted_at":"2024-06-16T06:56:53Z","title":"GUI-World: A Video Benchmark and Dataset for Multimodal GUI-oriented Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10819","snapshot_observed_at":"2026-08-15T23:21:12.028976Z","title":"GUI-WORLD: A dataset for gui-oriented multimodal llm-based agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:12.028976Z"},"links":{"cited_paper":"/paper/2406.10819","citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:2cd3ab28792f7111d102e20700b041b73fda52595f6c1d082704fb89bc9ae5e3","observation_id":"cd0caa97-4d37-457c-9657-47a2f6a4da83","resolution":{"observed_at":"2026-08-15T23:21:12.028976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16549","last_updated":"2026-04-18T11:44:37Z","snapshot_observed_at":"2026-08-14T11:57:47.359826Z","submitted_at":"2025-03-19T11:46:19Z","title":"MathFlow: Enhancing the Perceptual Flow of MLLMs for Visual Mathematical Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.16549","snapshot_observed_at":"2026-08-15T23:21:12.034219Z","title":"Mathflow: Enhancing the perceptual flow of mllms for visual mathematical problems, 2025 a","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:12.034219Z"},"links":{"cited_paper":"/paper/2503.16549","citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:736155aede234bfe245bf08e16e1295dcb0e8b365f00dc277fb53919e8e8fbde","observation_id":"5cdf7f91-a350-40bd-a4fc-25d56ad3c9df","resolution":{"observed_at":"2026-08-15T23:21:12.034219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17117","last_updated":"2023-12-28T16:54:21Z","snapshot_observed_at":"2026-08-16T14:31:08.211823Z","submitted_at":"2023-12-28T16:54:21Z","title":"Grounding-Prompter: Prompting LLM with Multimodal Information for Temporal Sentence Grounding in Long Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.17117","snapshot_observed_at":"2026-08-15T23:21:12.039359Z","title":"Grounding-prompter: Prompting llm with multimodal information for temporal sentence grounding in long videos","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:12.039359Z"},"links":{"cited_paper":"/paper/2312.17117","citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:9a6d59df75b710a8d01583b421e06dcc6b344d455e93456b3ee77978eb8f5354","observation_id":"ebb9cdb0-ca7f-4cec-967b-cf93217f955d","resolution":{"observed_at":"2026-08-15T23:21:12.039359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.14517","last_updated":"2022-01-11T03:50:31Z","snapshot_observed_at":"2026-08-17T03:33:20.954386Z","submitted_at":"2021-05-30T12:34:17Z","title":"GeoQA: A Geometric Question Answering Benchmark Towards Multimodal Numerical Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.14517","snapshot_observed_at":"2026-08-15T23:21:12.044445Z","title":"Xing, and Liang Lin","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:12.044445Z"},"links":{"cited_paper":"/paper/2105.14517","citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:0d762f7fceebf1ff1a494d901703ff37dc91538e9f62e7148f320f8a1837923e","observation_id":"415db557-b096-48c8-ae49-f1f428093b02","resolution":{"observed_at":"2026-08-15T23:21:12.044445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:21:12.049550Z","title":"Spa-bench: A comprehensive benchmark for smartphone agent evaluation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:12.049550Z"},"links":{"citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:01079cd22b479c71c64eacaf9319637e393a581b871af086d63dd4f627fd4843","observation_id":"5a46221f-8bfb-495c-bdfe-71b6c67920b7","resolution":{"observed_at":"2026-08-15T23:21:12.049550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:21:12.054756Z","title":"R e C oncile: Round-table conference improves reasoning via consensus among diverse LLM s","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:12.054756Z"},"links":{"citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:063a1bc54f95e0e7ebac9e01a9eab8edb27e2cb4204f55b30f8ac0eebeac80bd","observation_id":"2c4c9ce8-7edb-4e7b-b2d0-29d1a29877c5","resolution":{"observed_at":"2026-08-15T23:21:12.054756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15195","last_updated":"2023-07-03T16:08:00Z","snapshot_observed_at":"2026-08-13T14:42:26.982679Z","submitted_at":"2023-06-27T04:31:52Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15195","snapshot_observed_at":"2026-08-15T23:21:12.059706Z","title":"Shikra: Unleashing multimodal llm's referential dialogue magic","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:12.059706Z"},"links":{"cited_paper":"/paper/2306.15195","citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:dde3dd12dd96fff4314b029942d890c63ff4b453f5e63a5a14c30f09d7704e7e","observation_id":"f1e0544c-5e10-455f-940c-650e05412a27","resolution":{"observed_at":"2026-08-15T23:21:12.059706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13426","last_updated":"2025-05-19T17:54:39Z","snapshot_observed_at":"2026-08-18T13:37:18.485161Z","submitted_at":"2025-05-19T17:54:39Z","title":"G1: Bootstrapping Perception and Reasoning Abilities of Vision-Language Model via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13426","snapshot_observed_at":"2026-08-15T23:21:12.064728Z","title":"G1: Bootstrapping perception and reasoning abilities of vision-language model via reinforcement learning, 2025 b","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:12.064728Z"},"links":{"cited_paper":"/paper/2505.13426","citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:ab00e2f293ad99c9c3f6b216bc3f88c74988497176369f742c00a5c334d2789f","observation_id":"b6a2d442-edd3-43fe-b415-f99bd643a4e8","resolution":{"observed_at":"2026-08-15T23:21:12.064728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:21:12.070037Z","title":"R1-v: Reinforcing super generalization ability in vision-language models with less than \\ 3","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:12.070037Z"},"links":{"citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:0c0806e5ad836317bdde0b32a847cd40246c1f83570bd45e5d981b4fc93b4d64","observation_id":"cd3ccec9-a395-4171-b19e-c7ecafe883fc","resolution":{"observed_at":"2026-08-15T23:21:12.070037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12219","last_updated":"2024-10-16T04:29:46Z","snapshot_observed_at":"2026-08-17T13:13:38.204740Z","submitted_at":"2024-10-16T04:29:46Z","title":"OmnixR: Evaluating Omni-modality Language Models on Reasoning across Modalities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12219","snapshot_observed_at":"2026-08-15T23:21:12.075122Z","title":"Omnixr: Evaluating omni-modality language models on reasoning across modalities","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:12.075122Z"},"links":{"cited_paper":"/paper/2410.12219","citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:d7b078789efd56da82a6d343850fffbaf3997266cc2802e62a226c03acee0032","observation_id":"4c956736-d011-4c89-800f-6cbb2261f431","resolution":{"observed_at":"2026-08-15T23:21:12.075122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:21:12.080492Z","title":"Are we on the right way for evaluating large vision-language models? In Amir Globersons, Lester Mackey, Danielle Belgrave, Angela Fan, Ulrich Paquet, Jakub M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:12.080492Z"},"links":{"citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:d7c89c4c439e9ab53fe0bd15c0607391204fea99f041f6bfe25055e6c51686f0","observation_id":"5532dfc8-24b9-429c-aeb4-0df0c37ea199","resolution":{"observed_at":"2026-08-15T23:21:12.080492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.09465","last_updated":"2021-11-08T08:31:44Z","snapshot_observed_at":"2026-08-16T18:50:31.552736Z","submitted_at":"2021-01-23T09:43:44Z","title":"WebSRC: A Dataset for Web-Based Structural Reading Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.09465","snapshot_observed_at":"2026-08-15T23:21:12.085421Z","title":"Websrc: A dataset for web-based structural reading comprehension","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:12.085421Z"},"links":{"cited_paper":"/paper/2101.09465","citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:b93f47808a4d6271c19ba8f02d0ce1b7257d461644636aad58134210c5537b81","observation_id":"0aeccccd-7d59-4782-8178-f010a22f4db9","resolution":{"observed_at":"2026-08-15T23:21:12.085421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:21:12.090626Z","title":"Quantifying and mitigating unimodal biases in multimodal large language models: A causal perspective","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:12.090626Z"},"links":{"citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:5c0eb6c0267daea6e47ebc412ba58de8539942d5a69c151ca2882259727ac676","observation_id":"0bb90560-1470-4def-8e7f-4d5588cf6454","resolution":{"observed_at":"2026-08-15T23:21:12.090626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13307","last_updated":"2025-05-19T16:25:55Z","snapshot_observed_at":"2026-08-19T00:43:01.176067Z","submitted_at":"2025-05-19T16:25:55Z","title":"RBF++: Quantifying and Optimizing Reasoning Boundaries across Measurable and Unmeasurable Capabilities for Chain-of-Thought Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13307","snapshot_observed_at":"2026-08-15T23:21:12.095738Z","title":"Rbf++: Quantifying and optimizing reasoning boundaries across measurable and unmeasurable capabilities for chain-of-thought reasoning, 2025 d","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:12.095738Z"},"links":{"cited_paper":"/paper/2505.13307","citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:fce688a04c745569e391c6f2e3d01e2ac09d9035ca835523ec04ff388a8dc828","observation_id":"8b8b8fb4-4e33-46f0-bc71-d309f17be26f","resolution":{"observed_at":"2026-08-15T23:21:12.095738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:21:12.100895Z","title":"Advancing multimodal reasoning: From optimized cold start to staged reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:12.100895Z"},"links":{"citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:5f62f1bca27b86e4970a1f4d789acef8435b7e9b13339e42c3aeba938fde0ad1","observation_id":"8d3b8de2-eaee-40ec-92dc-6ad72db75456","resolution":{"observed_at":"2026-08-15T23:21:12.100895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.06794","last_updated":"2023-06-05T17:55:12Z","snapshot_observed_at":"2026-08-19T06:18:29.748887Z","submitted_at":"2022-09-14T17:24:07Z","title":"PaLI: A Jointly-Scaled Multilingual Language-Image Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.06794","snapshot_observed_at":"2026-08-15T23:21:12.106242Z","title":"Pali: A jointly-scaled multilingual language-image model","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:12.106242Z"},"links":{"cited_paper":"/paper/2209.06794","citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:c7938178e98666fc5fae13fca06fb404bd17150e06dbb86c5491294e08f79307","observation_id":"f723130b-be50-4c62-b4ac-ab2253118efa","resolution":{"observed_at":"2026-08-15T23:21:12.106242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04095","last_updated":"2025-03-07T05:18:44Z","snapshot_observed_at":"2026-08-18T03:22:17.816847Z","submitted_at":"2025-03-06T05:08:40Z","title":"Chart-HQA: A Benchmark for Hypothetical Question Answering in Charts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04095","snapshot_observed_at":"2026-08-15T23:21:12.111259Z","title":"Chart-hqa: A benchmark for hypothetical question answering in charts, 2025 f","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:12.111259Z"},"links":{"cited_paper":"/paper/2503.04095","citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:2faa46a7cb71736a66b6054cc33bfb2ecd0cc64dd6d2c3eb8896680a9a66df6c","observation_id":"948ca7e9-a83d-4938-a53e-30e0cd99ff5f","resolution":{"observed_at":"2026-08-15T23:21:12.111259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17811","last_updated":"2025-01-29T18:00:19Z","snapshot_observed_at":"2026-08-12T12:44:22.350068Z","submitted_at":"2025-01-29T18:00:19Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17811","snapshot_observed_at":"2026-08-15T23:21:12.116229Z","title":"Janus-pro: Unified multimodal understanding and generation with data and model scaling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:12.116229Z"},"links":{"cited_paper":"/paper/2501.17811","citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:a232ff78d699621c990e99a153b6828865fe59f220a3ddc987e7056947fa6701","observation_id":"6cc0b1a0-2e9d-4d2a-ab1e-73a7267e8945","resolution":{"observed_at":"2026-08-15T23:21:12.116229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.17821","last_updated":"2025-05-20T09:15:16Z","snapshot_observed_at":"2026-08-20T02:27:12.422618Z","submitted_at":"2025-04-23T13:47:30Z","title":"VideoVista-CulturalLingo: 360$^\\circ$ Horizons-Bridging Cultures, Languages, and Domains in Video Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.17821","snapshot_observed_at":"2026-08-15T23:21:12.121274Z","title":"Videovista-culturallingo: 360 ^ horizons-bridging cultures, languages, and domains in video comprehension, 2025 h","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:12.121274Z"},"links":{"cited_paper":"/paper/2504.17821","citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:f5637b5593bd43109793340042111e68b6c4db7eef44a542c5ed29d978575e56","observation_id":"23230567-8d6d-4e3e-bfb5-008657d004eb","resolution":{"observed_at":"2026-08-15T23:21:12.121274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:21:12.126392Z","title":"Rm-r1: Reward modeling as reasoning, 2025 i","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:12.126392Z"},"links":{"citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:fc7e0728926061504ded22b7270c1ac25d8a608db8b36f83ffa058015b15a63d","observation_id":"615e35ec-a315-4034-813a-b29fd827f967","resolution":{"observed_at":"2026-08-15T23:21:12.126392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:21:12.131136Z","title":"UNITER: universal image-text representation learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:12.131136Z"},"links":{"citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:9ea2e4b3e6f262593c825e33feccd5d8384071f2190002a22c29e85187a0f6b2","observation_id":"7618190d-598d-4a36-8b72-5873074a2736","resolution":{"observed_at":"2026-08-15T23:21:12.131136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24376","last_updated":"2025-03-31T17:55:23Z","snapshot_observed_at":"2026-08-19T14:09:21.322660Z","submitted_at":"2025-03-31T17:55:23Z","title":"Exploring the Effect of Reinforcement Learning on Video Understanding: Insights from SEED-Bench-R1","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.24376","snapshot_observed_at":"2026-08-15T23:21:12.136721Z","title":"Exploring the effect of reinforcement learning on video understanding: Insights from seed-bench-r1, 2025 j","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:12.136721Z"},"links":{"cited_paper":"/paper/2503.24376","citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:b54ef69e541dd1026f9c25b3862535a91b7f25111a67af2c1089b3763f563818","observation_id":"ae49687e-b698-47a0-b991-196655037c25","resolution":{"observed_at":"2026-08-15T23:21:12.136721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17196","last_updated":"2024-12-11T15:45:21Z","snapshot_observed_at":"2026-08-17T12:45:25.032324Z","submitted_at":"2024-10-22T17:15:20Z","title":"VoiceBench: Benchmarking LLM-Based Voice Assistants","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17196","snapshot_observed_at":"2026-08-15T23:21:12.141861Z","title":"Tan, and Haizhou Li","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:12.141861Z"},"links":{"cited_paper":"/paper/2410.17196","citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:eeaeac1cf87f4f98be2b3533f8272803954efa445ea3ce9a36d7823156b86b0b","observation_id":"3949f0ac-02e9-4c65-b970-85d7ace68290","resolution":{"observed_at":"2026-08-15T23:21:12.141861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:21:12.148590Z","title":"R1-code-interpreter: Training llms to reason with code via supervised and reinforcement learning, 2025 k","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:12.148590Z"},"links":{"citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:b3b82bc67e8fb4b3a4d8a4aec30f60a83745bdd604775fc41cf5338d3ae539b0","observation_id":"aa86a808-9685-4bec-8970-a7443441b959","resolution":{"observed_at":"2026-08-15T23:21:12.148590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:21:12.153731Z","title":"Octavius: Mitigating task interference in MLLM s via lo RA -moe","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:12.153731Z"},"links":{"citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:c1f53e0927c3e11ef32a054f1373a625abdec634264693979fb21781f14db160","observation_id":"6316e50a-17b5-4d4e-b912-a6adfd5d410f","resolution":{"observed_at":"2026-08-15T23:21:12.153731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07523","last_updated":"2025-04-01T04:23:59Z","snapshot_observed_at":"2026-08-20T02:46:24.660310Z","submitted_at":"2025-03-10T16:49:35Z","title":"VisRL: Intention-Driven Visual Perception via Reinforced Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07523","snapshot_observed_at":"2026-08-15T23:21:12.158630Z","title":"Visrl: Intention-driven visual perception via reinforced reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:12.158630Z"},"links":{"cited_paper":"/paper/2503.07523","citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:094b0424336e8ea8284fee5a46b753b63830f066169b0a09df259d159c06b92c","observation_id":"1ebe6319-e15f-4b5a-a07e-37c37ce79dea","resolution":{"observed_at":"2026-08-15T23:21:12.158630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:21:12.163846Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:12.163846Z"},"links":{"citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:3942e7aa4597ed12811764d5de8e456d24c3dce7035bcc48429f199a3edb57ce","observation_id":"151ec9df-9d1d-428e-9e0b-572b5d2a9a45","resolution":{"observed_at":"2026-08-15T23:21:12.163846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.05226","last_updated":"2023-01-12T18:59:50Z","snapshot_observed_at":"2026-08-16T16:02:46.455963Z","submitted_at":"2023-01-12T18:59:50Z","title":"See, Think, Confirm: Interactive Prompting Between Vision and Language Models for Knowledge-based Visual Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.05226","snapshot_observed_at":"2026-08-15T23:21:12.168772Z","title":"See, think, confirm: Interactive prompting between vision and language models for knowledge-based visual reasoning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:12.168772Z"},"links":{"cited_paper":"/paper/2301.05226","citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:0408415da2c5c8a5bbd1a62ae70079a6ea05000ed712a8e2cbe98cbc38f944ff","observation_id":"ef3516b1-70a7-4167-a7cb-03482615c18c","resolution":{"observed_at":"2026-08-15T23:21:12.168772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:21:12.174029Z","title":"Unmasking deceptive visuals: Benchmarking multimodal large language models on misleading chart question answering, 2025 m","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:12.174029Z"},"links":{"citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:27f1312b6aab947e67437ed62e79040579eddcb3fb261955d75642af48194f6c","observation_id":"dc29b802-f4b1-4b5d-9609-bb59cb2c2ae9","resolution":{"observed_at":"2026-08-15T23:21:12.174029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17694","last_updated":"2024-10-23T09:14:57Z","snapshot_observed_at":"2026-08-19T13:51:46.206183Z","submitted_at":"2024-10-23T09:14:57Z","title":"An Adaptive Framework for Generating Systematic Explanatory Answer in Online Q&A Platforms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17694","snapshot_observed_at":"2026-08-15T23:21:12.179725Z","title":"An adaptive framework for generating systematic explanatory answer in online q&a platforms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:12.179725Z"},"links":{"cited_paper":"/paper/2410.17694","citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:d45ac8c5e0bcddb1656085d29558364f35d3034a53ef16a8f9cc4d776dd71a5d","observation_id":"5d3dbfac-d71b-4238-9b60-ff90448c1bfa","resolution":{"observed_at":"2026-08-15T23:21:12.179725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19934","last_updated":"2024-10-11T15:41:23Z","snapshot_observed_at":"2026-08-17T11:59:59.618331Z","submitted_at":"2024-06-28T14:04:10Z","title":"From the Least to the Most: Building a Plug-and-Play Visual Reasoner via Data Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19934","snapshot_observed_at":"2026-08-15T23:21:12.184814Z","title":"From the least to the most: Building a plug-and-play visual reasoner via data synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:12.184814Z"},"links":{"cited_paper":"/paper/2406.19934","citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:7f49adcfc785bd307c9d8430965545d21dbfaef330fe3a4d913786317d9f5da9","observation_id":"73cb355d-1519-4a5c-be06-ae8aa85dfec1","resolution":{"observed_at":"2026-08-15T23:21:12.184814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10935","last_updated":"2024-02-23T04:36:51Z","snapshot_observed_at":"2026-08-18T02:03:58.046358Z","submitted_at":"2024-01-17T08:10:35Z","title":"SeeClick: Harnessing GUI Grounding for Advanced Visual GUI Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10935","snapshot_observed_at":"2026-08-15T23:21:12.190411Z","title":"Seeclick: Harnessing gui grounding for advanced visual gui agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:12.190411Z"},"links":{"cited_paper":"/paper/2401.10935","citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:d1a7687c4aa97ad97242b91146ef79ed59b87bcea515049c222e95021ebf678a","observation_id":"752549d0-f078-4e77-8439-63ece57c62eb","resolution":{"observed_at":"2026-08-15T23:21:12.190411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11858","last_updated":"2025-04-11T04:26:42Z","snapshot_observed_at":"2026-08-17T14:05:20.638470Z","submitted_at":"2025-01-21T03:22:10Z","title":"EmbodiedEval: Evaluate Multimodal LLMs as Embodied Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.11858","snapshot_observed_at":"2026-08-15T23:21:12.195994Z","title":"Embodiedeval: Evaluate multimodal llms as embodied agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:12.195994Z"},"links":{"cited_paper":"/paper/2501.11858","citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:950a142d29cfc4e6c81a558c1696c3935e5996bb5d709a4dd905c365e9eb1bed","observation_id":"91d461a9-d926-4de3-9adf-cd58371a0fab","resolution":{"observed_at":"2026-08-15T23:21:12.195994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-14T08:10:05.547421Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.12932","snapshot_observed_at":"2026-08-15T23:21:12.201133Z","title":"Comt: A novel benchmark for chain of multi-modal thought on large vision-language models, 2025 b","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:12.201133Z"},"links":{"cited_paper":"/paper/2412.12932","citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:6006a9c825fcf6a38155ad683c561f1a3ab514e679266875c363419884d32eec","observation_id":"fe5c8ca4-39fd-4ff4-9ba4-a7f26e3f0b0c","resolution":{"observed_at":"2026-08-15T23:21:12.201133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06135","last_updated":"2024-07-08T17:08:02Z","snapshot_observed_at":"2026-08-18T15:44:36.014181Z","submitted_at":"2024-07-08T17:08:02Z","title":"ANOLE: An Open, Autoregressive, Native Large Multimodal Models for Interleaved Image-Text Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06135","snapshot_observed_at":"2026-08-15T23:21:12.206435Z","title":"Anole: An open, autoregressive, native large multimodal models for interleaved image-text generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:12.206435Z"},"links":{"cited_paper":"/paper/2407.06135","citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:c9c6d6c9a8a0a4a916fe7b4e7de6dd170c4211c2b64607226b3d0752cdd877e6","observation_id":"bc66f83b-0978-4db4-8cbd-fa239220af94","resolution":{"observed_at":"2026-08-15T23:21:12.206435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15461","last_updated":"2025-06-10T08:08:33Z","snapshot_observed_at":"2026-08-19T04:15:39.916482Z","submitted_at":"2024-10-20T18:24:00Z","title":"EVA: An Embodied World Model for Future Video Anticipation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15461","snapshot_observed_at":"2026-08-15T23:21:12.211559Z","title":"Eva: An embodied world model for future video anticipation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:12.211559Z"},"links":{"cited_paper":"/paper/2410.15461","citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:24de6318f40e1f435d3da1a070d33adce556ffdd02f17c00a980f902f7f857de","observation_id":"763c1396-5dab-493f-b20e-cf6859d3b921","resolution":{"observed_at":"2026-08-15T23:21:12.211559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:21:12.216890Z","title":"Kitani, and Laszlo A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:12.216890Z"},"links":{"citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:d7671c618beabd0711212d0eea4bdbb7b09c015bf4d91be36546424afdd87d3d","observation_id":"5e89c04b-c750-406b-a36f-f7790b43f911","resolution":{"observed_at":"2026-08-15T23:21:12.216890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:21:12.222126Z","title":"Merit: Multilingual semantic retrieval with interleaved multi-condition query, 2025 a","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:12.222126Z"},"links":{"citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:489e697999a7f0bfc0aa07a24ea0e7c35208459d010ddac3a4bc40122030eecf","observation_id":"46127784-700b-42f2-974b-4ce9269e11c2","resolution":{"observed_at":"2026-08-15T23:21:12.222126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16411","last_updated":"2025-01-29T03:52:39Z","snapshot_observed_at":"2026-08-16T02:41:33.803283Z","submitted_at":"2025-01-27T18:59:58Z","title":"PhysBench: Benchmarking and Enhancing Vision-Language Models for Physical World Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16411","snapshot_observed_at":"2026-08-15T23:21:12.227048Z","title":"Physbench: Benchmarking and enhancing vision-language models for physical world understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:12.227048Z"},"links":{"cited_paper":"/paper/2501.16411","citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:3186bf8cb42e4a16322b912e69bf573827678caa3b8b97b2854e6e1964335af6","observation_id":"d0cd0ca3-4dbc-49ee-ac8c-52c7c301d3b4","resolution":{"observed_at":"2026-08-15T23:21:12.227048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08328","last_updated":"2024-10-10T19:31:35Z","snapshot_observed_at":"2026-08-18T13:49:23.428110Z","submitted_at":"2024-10-10T19:31:35Z","title":"Agents Thinking Fast and Slow: A Talker-Reasoner Architecture","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08328","snapshot_observed_at":"2026-08-15T23:21:12.232119Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:12.232119Z"},"links":{"cited_paper":"/paper/2410.08328","citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:277e4674525fb0818cde248c79055989f7e2be190aaddd5f60b1006ee818e4e2","observation_id":"c6cc558b-797b-4242-9bba-ba500745fcc9","resolution":{"observed_at":"2026-08-15T23:21:12.232119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17161","last_updated":"2025-05-26T17:16:45Z","snapshot_observed_at":"2026-08-09T18:26:12.869738Z","submitted_at":"2025-01-28T18:59:44Z","title":"SFT Memorizes, RL Generalizes: A Comparative Study of Foundation Model Post-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17161","snapshot_observed_at":"2026-08-15T23:21:12.237179Z","title":"Le, Sergey Levine, and Yi Ma","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:12.237179Z"},"links":{"cited_paper":"/paper/2501.17161","citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:cda821cfa899e024c7cd8d8670ba5f91c8b251cc609fd3b666334fe1d8ec1501","observation_id":"10de2b53-c208-485a-95e6-54b120226f6b","resolution":{"observed_at":"2026-08-15T23:21:12.237179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18842","last_updated":"2026-08-05T03:43:15Z","snapshot_observed_at":"2026-08-11T04:36:14.038696Z","submitted_at":"2025-05-24T19:30:47Z","title":"v1: Learning to Point Visual Tokens for Multimodal Grounded Reasoning","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18842","snapshot_observed_at":"2026-08-15T23:21:12.242700Z","title":"Don't look only once: Towards multimodal interactive reasoning with selective visual revisitation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:12.242700Z"},"links":{"cited_paper":"/paper/2505.18842","citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:9625f0f64c299c48e52b04067f5b3516edef0013b102ce0e00eec3e17c75c0b9","observation_id":"125a5fe9-59da-46af-9599-fa093e32d7ce","resolution":{"observed_at":"2026-08-15T23:21:12.242700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:21:12.247690Z","title":"FLEURS: few-shot learning evaluation of universal representations of speech","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:12.247690Z"},"links":{"citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:5a91fb435246a75f5c75feb3717347af268ba5ffd29a9194e897e28d367991e5","observation_id":"dbf2930a-9688-4b2a-a806-79e1e51bf814","resolution":{"observed_at":"2026-08-15T23:21:12.247690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:21:12.252434Z","title":"Receive, reason, and react: Drive as you say, with large language models in autonomous vehicles","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:12.252434Z"},"links":{"citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:2f37bd69bca303053ef435e34ed091e4cabbb1f946a7e0375f5c1329f3a24992","observation_id":"10d53e3e-6673-4830-9865-b696b61ad70b","resolution":{"observed_at":"2026-08-15T23:21:12.252434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:21:12.257157Z","title":"Draw with thought: Unleashing multimodal reasoning for scientific diagram generation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:12.257157Z"},"links":{"citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:ac44538495b486f6c8f7502e0d4f8ebe093dfd085d3cbf6bd1725a9799cae1fd","observation_id":"c0618d94-3641-42ef-bb9f-c18491a1050a","resolution":{"observed_at":"2026-08-15T23:21:12.257157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15791","last_updated":"2025-06-02T17:53:20Z","snapshot_observed_at":"2026-08-14T10:14:15.966312Z","submitted_at":"2025-05-21T17:44:37Z","title":"VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15791","snapshot_observed_at":"2026-08-15T23:21:12.263047Z","title":"Vard: Efficient and dense fine-tuning for diffusion models with value-based rl, 2025 a","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:12.263047Z"},"links":{"cited_paper":"/paper/2505.15791","citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:e0557ed5885898e2270e09efe1a233209fe8062bf5410407c58d5b151bc6d482","observation_id":"d255a3be-70f8-42d9-8d24-f07cd6d4d8b4","resolution":{"observed_at":"2026-08-15T23:21:12.263047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15472","last_updated":"2025-05-22T03:34:41Z","snapshot_observed_at":"2026-08-14T14:31:23.249216Z","submitted_at":"2025-05-21T12:48:16Z","title":"PhysicsArena: The First Multimodal Physics Reasoning Benchmark Exploring Variable, Process, and Solution Dimensions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15472","snapshot_observed_at":"2026-08-15T23:21:12.267860Z","title":"Physicsarena: The first multimodal physics reasoning benchmark exploring variable, process, and solution dimensions, 2025 b","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:12.267860Z"},"links":{"cited_paper":"/paper/2505.15472","citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:d2c12f2a3b4deda947f261d51092856238fafc7c05b9e2c1244050fa4c957f76","observation_id":"4c52a636-c6d5-4745-84ab-235d20a4687a","resolution":{"observed_at":"2026-08-15T23:21:12.267860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06500","last_updated":"2023-06-15T08:00:18Z","snapshot_observed_at":"2026-08-13T18:58:34.541884Z","submitted_at":"2023-05-11T00:38:10Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06500","snapshot_observed_at":"2026-08-15T23:21:12.273019Z","title":"Instructblip: Towards general-purpose vision-language models with instruction tuning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:12.273019Z"},"links":{"cited_paper":"/paper/2305.06500","citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:77e1dd82eac45aa7136bff8651ec096f3ffc4dfeef2a1a6a1dcdfdc45622a604","observation_id":"986e10f2-9de2-4497-b7d3-3128d2a2a072","resolution":{"observed_at":"2026-08-15T23:21:12.273019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24718","last_updated":"2025-06-08T14:43:47Z","snapshot_observed_at":"2026-08-18T02:01:36.218531Z","submitted_at":"2025-05-30T15:42:19Z","title":"Reinforcing Video Reasoning with Focused Thinking","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24718","snapshot_observed_at":"2026-08-15T23:21:12.278852Z","title":"Reinforcing video reasoning with focused thinking, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:12.278852Z"},"links":{"cited_paper":"/paper/2505.24718","citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:5512581148ddb1f6182d18eb2b2aeaab6a72c68b2e836acfa4c8ae18971d495a","observation_id":"20a21313-389b-424e-95f4-d4bf0c82cd26","resolution":{"observed_at":"2026-08-15T23:21:12.278852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.10378","last_updated":"2024-03-15T15:08:39Z","snapshot_observed_at":"2026-08-16T14:09:25.342714Z","submitted_at":"2024-03-15T15:08:39Z","title":"EXAMS-V: A Multi-Discipline Multilingual Multimodal Exam Benchmark for Evaluating Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.10378","snapshot_observed_at":"2026-08-15T23:21:12.284324Z","title":"Exams-v: A multi-discipline multilingual multimodal exam benchmark for evaluating vision language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:12.284324Z"},"links":{"cited_paper":"/paper/2403.10378","citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:e04ff19431deb8590d793ff15b9f1c1ba3988469d11d5b7dbb336f0c3389a185","observation_id":"f43cbe3c-13a3-4a2c-bfb5-e690d28dea38","resolution":{"observed_at":"2026-08-15T23:21:12.284324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07114","last_updated":"2024-10-25T07:57:44Z","snapshot_observed_at":"2026-08-19T19:57:25.975429Z","submitted_at":"2024-09-19T19:48:31Z","title":"System 2 thinking in OpenAI's o1-preview model: Near-perfect performance on a mathematics exam","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07114","snapshot_observed_at":"2026-08-15T23:21:12.289641Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:12.289641Z"},"links":{"cited_paper":"/paper/2410.07114","citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:193e2a86676b47ab7b10b521e171c62c46164228dd9db61353bd4120ef35b676","observation_id":"35ebd730-a49a-4bda-80e5-60a0cd2c4f35","resolution":{"observed_at":"2026-08-15T23:21:12.289641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-15T23:21:12.296251Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:12.296251Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:e0fad4a7c417db059949bce0ceb9c2597442c80502a729ef4e3ccb36a05712d7","observation_id":"39b6ebd5-6118-4dbb-93e6-e6301b0e500d","resolution":{"observed_at":"2026-08-15T23:21:12.296251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:21:12.301556Z","title":"Procthor: Large-scale embodied AI using procedural generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:12.301556Z"},"links":{"citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:61e2e9ffb43e698095bff5be11573a0be04bac8235f11bfe61d50be8a146db42","observation_id":"8bf1c400-807f-4a54-be5e-3c94037cdbc9","resolution":{"observed_at":"2026-08-15T23:21:12.301556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:21:12.306739Z","title":"Rico: A mobile app dataset for building data-driven design applications","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:12.306739Z"},"links":{"citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:a40fcb5a92a27c87f7702260fef0a79820cf58c277c799686a71aee69c850b3b","observation_id":"53c76fd7-204a-4c8a-bfbd-3ea0461ca7f4","resolution":{"observed_at":"2026-08-15T23:21:12.306739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14683","last_updated":"2025-07-27T11:45:16Z","snapshot_observed_at":"2026-08-17T01:11:44.872398Z","submitted_at":"2025-05-20T17:59:30Z","title":"Emerging Properties in Unified Multimodal Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14683","snapshot_observed_at":"2026-08-15T23:21:12.311953Z","title":"Emerging properties in unified multimodal pretraining","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:12.311953Z"},"links":{"cited_paper":"/paper/2505.14683","citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:2ba958dbe58e5034826cb120e2de2d6652619e571509b7cfbadc2de99442bc18","observation_id":"fd4b099d-9a83-4303-9f6b-2e0043ff5b8f","resolution":{"observed_at":"2026-08-15T23:21:12.311953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07065","last_updated":"2025-03-10T08:48:50Z","snapshot_observed_at":"2026-08-16T17:50:14.035660Z","submitted_at":"2025-03-10T08:48:50Z","title":"Boosting the Generalization and Reasoning of Vision Language Models with Curriculum Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07065","snapshot_observed_at":"2026-08-15T23:21:12.317779Z","title":"Boosting the generalization and reasoning of vision language models with curriculum reinforcement learning, 2025 b","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:12.317779Z"},"links":{"cited_paper":"/paper/2503.07065","citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:5110d7fa6d60da2571cc7a44abd4e204c110dd8edd6d50e775d872f0d38320b4","observation_id":"69ec2b47-087f-4ba7-b52a-c4cc0a292bf4","resolution":{"observed_at":"2026-08-15T23:21:12.317779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:21:12.322686Z","title":"Mind2web: Towards a generalist agent for the web","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:12.322686Z"},"links":{"citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:06a28d063738c5854027f032684e9b9d25e83f0b9c43c74a0be51617d8b5f6f0","observation_id":"f7b3b485-8d68-4d03-91f3-71911915551f","resolution":{"observed_at":"2026-08-15T23:21:12.322686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:21:12.327456Z","title":"Redcaps: Web-curated image-text data created by the people, for the people","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:12.327456Z"},"links":{"citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:cf56a60e9f7a3db8bd2a4ea1fa6044bbff61edd3eada2d15ec75bec6d327605d","observation_id":"bddc961a-5733-46db-adb5-149c0782994e","resolution":{"observed_at":"2026-08-15T23:21:12.327456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:21:12.332122Z","title":"BERT : Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:12.332122Z"},"links":{"citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:54f7b33d93b9cf3e4625117e35f09a86b44b537dbb493e6fa35b8315ad2fb8e6","observation_id":"27386cb4-1482-437f-a6d6-c4bb237a47c8","resolution":{"observed_at":"2026-08-15T23:21:12.332122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":100,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":298},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 100 of 298 outbound references and 35 inbound Pith citation observations for arXiv:2505.04921."}