{"as_of":"2026-08-10T19:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:672c244bbc3a0bb0d4c21191717ab5b907965a8babb5bbfb51045c64ed2f1ace","coverage":[{"denominator":118,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:36:26.033113Z","state":"measured"},{"denominator":102,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":102,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T23:15:38.962013Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T15:57:06.751718Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"cited_work":{"arxiv_id":"2505.24182","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.24182","snapshot_observed_at":"2026-07-02T15:57:06.751718Z","title":null,"venue":null,"work_id":"601b90d4-25ec-45d2-9b7c-801fb2aa4801","year":2025},"citing_paper":{"arxiv_id":"2604.06725","last_updated":"2026-04-08T06:47:55Z","snapshot_observed_at":"2026-08-02T13:53:46.692069Z","submitted_at":"2026-04-08T06:47:55Z","title":"Enhancing MLLM Spatial Understanding via Active 3D Scene Exploration for Multi-Perspective Reasoning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T19:16:46.753641Z"},"links":{"cited_paper":"/paper/2505.24182","citing_paper":"/paper/2604.06725"},"observation_digest":"sha256:32908b6fa5b2f8273f783ad13d946ba86c847e416127c600db238a4a1a7573c8","observation_id":"90ae6915-c9f9-44fc-92cc-1bf860ead61a","resolution":{"observed_at":"2026-05-10T23:15:47.826680Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"cited_work":{"arxiv_id":"2505.24182","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.24182","snapshot_observed_at":"2026-07-02T15:57:06.751718Z","title":null,"venue":null,"work_id":"601b90d4-25ec-45d2-9b7c-801fb2aa4801","year":2025},"citing_paper":{"arxiv_id":"2606.05966","last_updated":"2026-06-04T10:07:05Z","snapshot_observed_at":"2026-07-06T23:45:51.910263Z","submitted_at":"2026-06-04T10:07:05Z","title":"Causal Scaffolding for Physical Reasoning: A Benchmark for Causally-Informed Physical World Understanding in VLMs","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-27T23:15:38.962013Z"},"links":{"cited_paper":"/paper/2505.24182","citing_paper":"/paper/2606.05966"},"observation_digest":"sha256:e44ed836978763d0da772e63d45273e44d914aed8a97f6869473c29dd678672f","observation_id":"bdd9a7af-2d5f-44c5-961e-ebf3968c4329","resolution":{"observed_at":"2026-07-02T15:57:06.752989Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.24182/citation-record","integrity":"/paper/2505.24182/integrity","json":"/paper/2505.24182/citation-record.json","paper":"/paper/2505.24182"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:17.832939Z","title":"Origins of physical knowledge.Psychological Review, 99(4):605–632, 1992","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:17.832939Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:e3486d43f554aab741590c0a70a705016937ce6e57b25bb3b01ee76c15100c0e","observation_id":"3cd4d0b4-5021-4b0b-b540-c9ce30af7584","resolution":{"observed_at":"2026-08-07T12:36:17.832939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:17.919876Z","title":"Infants’ physical world.Current Directions in Psychological Science, 13(3):89–94, 2004","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:17.919876Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:d2f6b6463945775b2909f0b4c6332931fc66f2ca0c999867e7e4e2d6e8eb080d","observation_id":"13c7ee59-cebb-44aa-b4b2-d3e4e902b873","resolution":{"observed_at":"2026-08-07T12:36:17.919876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:18.059860Z","title":"A theory of causal learning in children: Causal maps and bayes nets.Psychological Review, 111(1):3–32, 2004","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:18.059860Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:7751678d71cf0a1e5d3c30d9bd54b03edeaf72601d5458609ac0e7296d748641","observation_id":"995443c2-dab8-49d0-a6b3-c5c29f4736a0","resolution":{"observed_at":"2026-08-07T12:36:18.059860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:18.157018Z","title":"Building machines that learn and think like people.Behavioral and Brain Sciences, 40, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:18.157018Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:39bacd41f4c5d144b89a56f514009d50b79689f01e8efe627e7bddf84a8df1db","observation_id":"a44fd7cb-17b2-4bab-b091-4b6ab85da1e6","resolution":{"observed_at":"2026-08-07T12:36:18.157018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:18.222324Z","title":"GPT o3.https://chatgpt.com/?model=o3, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:18.222324Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:9d2c0affb76399278ee4e25f0fd344b09af102091e9ca07d144a52721b0158c4","observation_id":"776a1c1e-6dda-4d08-8e04-6c6cb76f62f2","resolution":{"observed_at":"2026-08-07T12:36:18.222324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:18.298510Z","title":"Hello GPT-4o","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:18.298510Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:2a2a626366423492db4e4401faa80daa017ac37b19c310a5b4af242fb585d898","observation_id":"33fe6ec1-bae3-45d3-83a0-e8015b2aa7a8","resolution":{"observed_at":"2026-08-07T12:36:18.298510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:18.372868Z","title":"Gemini: A family of highly capable multimodal models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:18.372868Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:f02607ef637cd024261c72e58430e30cb0bec58310e0dd2e712279a33a24d98d","observation_id":"396f73ce-a2d5-4881-95b4-2ab07a32adcf","resolution":{"observed_at":"2026-08-07T12:36:18.372868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T12:36:18.458818Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models.arXiv preprint arXiv:2504.10479, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:18.458818Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:d8dd6ba3ddd7c42b09f25325ba119b437a4d348b9546b6561ea019ff0f1f1c49","observation_id":"01b07d1d-4d82-4309-8863-116f46653402","resolution":{"observed_at":"2026-08-07T12:36:18.458818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:18.521583Z","title":"Kimi k1.5: Scaling reinforcement learning with llms, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:18.521583Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:9767339af868a0b0ed48e19a184c916988ea8c021bd02fcd5c026a529e7bc70d","observation_id":"663549a3-a626-4a5a-8f3a-5289fad1bbea","resolution":{"observed_at":"2026-08-07T12:36:18.521583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:18.576525Z","title":"R1-v: Reinforcing super generalization ability in vision-language models with less than $3.https://github.com/Deep-Agent/R1-V, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:18.576525Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:3f4e62ba1245817171f3587d9bae65bedcf41f803f836a989fa53dedb22ffd9f","observation_id":"3eaaac8c-bd53-4cf9-a801-8daa0779959d","resolution":{"observed_at":"2026-08-07T12:36:18.576525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:18.668837Z","title":"Easyr1: An efficient, scalable, multi-modality rl training framework","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:18.668837Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:304d92f7c1c181b6827cfcadbae6ff5ae67c8784651ee241b1964c56d85c1e60","observation_id":"6f2bb7d3-6f3a-4e60-b81b-95b08d2efed1","resolution":{"observed_at":"2026-08-07T12:36:18.668837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16999","last_updated":"2024-11-04T05:50:56Z","snapshot_observed_at":"2026-07-06T17:50:18.017647Z","submitted_at":"2024-03-25T17:59:23Z","title":"Visual CoT: Advancing Multi-Modal Language Models with a Comprehensive Dataset and Benchmark for Chain-of-Thought Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.16999","snapshot_observed_at":"2026-08-07T12:36:18.739712Z","title":"Visual cot: Advancing multi-modal language models with a comprehensive dataset and benchmark for chain-of-thought reasoning.arXiv preprint arXiv:2403.16999, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:18.739712Z"},"links":{"cited_paper":"/paper/2403.16999","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:94a523d67d8b08b7fac12cd17cbbcaef6fd2ca278350bdec9b8205181e30cb22","observation_id":"23031486-063f-4993-8aa9-75308f6d03df","resolution":{"observed_at":"2026-08-07T12:36:18.739712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:18.817836Z","title":"Can we generate images with cot? let’s verify and reinforce image generation step by step, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:18.817836Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:54d48cc0340d49dfb6b4bb9144f5d4b75559fe5674183089cb489d91940f5320","observation_id":"c34fc8e9-6d24-4fa0-a12e-972dcae22fbb","resolution":{"observed_at":"2026-08-07T12:36:18.817836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:18.900204Z","title":"Imagine while reasoning in space: Multimodal visualization-of-thought, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:18.900204Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:3dbdeea8f88dd7e1b046fe67abc113b71e7a834a9ae196a56692dccdb05fd269","observation_id":"03e02f1f-4c35-46fe-ad00-18c1b505ff88","resolution":{"observed_at":"2026-08-07T12:36:18.900204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:18.968292Z","title":"Mm-spatial: Exploring 3d spatial understanding in multimodal llms, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:18.968292Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:90400f4c669d32a1b1cd440c069363620ba7db9329f2e6790ab51b1fe02e35c4","observation_id":"413a23f5-fecc-46b0-8e56-781aef5a4c35","resolution":{"observed_at":"2026-08-07T12:36:18.968292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:19.034689Z","title":"Mllm-for3d: Adapting multimodal large language model for 3d reasoning segmentation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:19.034689Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:993ad9bc565fb47fa73aec16acacac9614de726604b29cc796dd3737f978450f","observation_id":"f6977751-e323-4e53-9119-d5009e4ec2d1","resolution":{"observed_at":"2026-08-07T12:36:19.034689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:19.068799Z","title":"Mllm-sul: Multimodal large language model for semantic scene understanding and localization in traffic scenarios, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:19.068799Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:701b742789f22912c3a2d009b827fc12bd3326c25569bbd76c4356688f5ae7df","observation_id":"99a5dc0e-e9aa-441d-a29e-a7e888159747","resolution":{"observed_at":"2026-08-07T12:36:19.068799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:19.125517Z","title":"The second half","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:19.125517Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:bf449715210068bb44fd2ee520ef0d1a7b34d7f6d8f6f2b5a4f5b86d0bad6b37","observation_id":"15f5e482-fba9-4813-8c9b-f432791eeeb3","resolution":{"observed_at":"2026-08-07T12:36:19.125517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02385","last_updated":"2025-06-22T03:30:55Z","snapshot_observed_at":"2026-08-02T22:45:54.982294Z","submitted_at":"2024-11-04T18:53:05Z","title":"How Far is Video Generation from World Model: A Physical Law Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02385","snapshot_observed_at":"2026-08-07T12:36:19.219155Z","title":"How far is video generation from world model: A physical law perspective.arXiv preprint arXiv:2411.02385, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:19.219155Z"},"links":{"cited_paper":"/paper/2411.02385","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:d516b49ef66093113d82b358a92cc68565d4dfe1809b232fd63deb8e33683aaf","observation_id":"0485d055-943c-46a3-a326-8f9d22948a46","resolution":{"observed_at":"2026-08-07T12:36:19.219155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:19.278900Z","title":"Contphy: Continuum physical concept learning and reasoning from videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:19.278900Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:4a27361617e382d2fef197351d22b7569fb374519b1cc304812b6edda457651d","observation_id":"967eb7ff-d878-4022-b98b-1174ccc27284","resolution":{"observed_at":"2026-08-07T12:36:19.278900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:19.363631Z","title":"Mdk12-bench: A multi-discipline benchmark for evaluating reasoning in multimodal large language models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:19.363631Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:2c0f3b8956f12045a5fbba0284dcbf774b396545902def6f4791df48cc3cf287","observation_id":"ecfa2f21-7a48-4473-b7f1-aefb7dd0253e","resolution":{"observed_at":"2026-08-07T12:36:19.363631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:19.454947Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:19.454947Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:c90203c69fc63d4cf0968b0587a4620d66288578e8f3da5a4dbb5cc507b58f94","observation_id":"4fba22f8-6f71-4112-887c-6250eface497","resolution":{"observed_at":"2026-08-07T12:36:19.454947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:19.547264Z","title":"Vlind-bench: Measuring language priors in large vision-language models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:19.547264Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:072a0e09f01428d2dc91642cffbc725ba2115922bd735b652a3ea7f9cb576bff","observation_id":"297d6855-afaa-4ef4-821a-3b05c75a24fc","resolution":{"observed_at":"2026-08-07T12:36:19.547264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09621","last_updated":"2025-02-13T18:59:46Z","snapshot_observed_at":"2026-08-09T00:23:29.329507Z","submitted_at":"2025-02-13T18:59:46Z","title":"MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09621","snapshot_observed_at":"2026-08-07T12:36:19.638964Z","title":"Mme-cot: Benchmarking chain-of-thought in large multimodal models for reasoning quality, robustness, and efficiency.arXiv preprint arXiv:2502.09621, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:19.638964Z"},"links":{"cited_paper":"/paper/2502.09621","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:a0c73343cd1413c50e38e9fc6aa9a366c7506675c450fd8024d00bb7991f9d0b","observation_id":"cd3064e3-fe71-4bab-b0a8-eada1baeb521","resolution":{"observed_at":"2026-08-07T12:36:19.638964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14624","last_updated":"2024-08-18T08:10:16Z","snapshot_observed_at":"2026-08-04T04:40:00.850270Z","submitted_at":"2024-03-21T17:59:50Z","title":"MathVerse: Does Your Multi-modal LLM Truly See the Diagrams in Visual Math Problems?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14624","snapshot_observed_at":"2026-08-07T12:36:19.731991Z","title":"Mathverse: Does your multi-modal llm truly see the diagrams in visual math problems?arXiv preprint arXiv:2403.14624, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:19.731991Z"},"links":{"cited_paper":"/paper/2403.14624","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:cfbace406e9d2629be627e404c87a7682c898a3a1ea60945fa7a20c556cf634d","observation_id":"6b0461fd-5910-4188-ab00-2abd10dca60d","resolution":{"observed_at":"2026-08-07T12:36:19.731991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03174","last_updated":"2024-09-04T01:18:13Z","snapshot_observed_at":"2026-08-08T15:04:46.831297Z","submitted_at":"2024-03-05T18:08:45Z","title":"MOKA: Open-World Robotic Manipulation through Mark-Based Visual Prompting","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03174","snapshot_observed_at":"2026-08-07T12:36:19.820855Z","title":"Moka: Open-world robotic manipulation through mark-based visual prompting.arXiv preprint arXiv:2403.03174, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:19.820855Z"},"links":{"cited_paper":"/paper/2403.03174","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:3b0e4303a331602a2200417ab1270ceedb0913ad52bfd5738fb637353991cff1","observation_id":"95c3523d-ead9-4f75-98b5-12ad20117606","resolution":{"observed_at":"2026-08-07T12:36:19.820855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16836","last_updated":"2024-02-26T18:57:52Z","snapshot_observed_at":"2026-08-06T10:58:59.007571Z","submitted_at":"2024-02-26T18:57:52Z","title":"PhyGrasp: Generalizing Robotic Grasping with Physics-informed Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16836","snapshot_observed_at":"2026-08-07T12:36:19.942520Z","title":"Phygrasp: Generalizing robotic grasping with physics-informed large multimodal models.arXiv preprint arXiv:2402.16836, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:19.942520Z"},"links":{"cited_paper":"/paper/2402.16836","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:5f5c63eec836d6bcf56333fa0e570adab230a8d5bf160e82be0cb496a1d2e37a","observation_id":"c35339db-39e9-442c-84a5-24d7b06a90b9","resolution":{"observed_at":"2026-08-07T12:36:19.942520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.05862","last_updated":"2024-09-10T02:28:40Z","snapshot_observed_at":"2026-08-01T16:03:11.829608Z","submitted_at":"2024-09-09T17:59:13Z","title":"Evaluating Multiview Object Consistency in Humans and Image Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.05862","snapshot_observed_at":"2026-08-07T12:36:20.033626Z","title":"Tenenbaum, and Alexei A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:20.033626Z"},"links":{"cited_paper":"/paper/2409.05862","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:527c1fb74f45631062c6603115d251655372b2af475d4b4dbafd29391884bd88","observation_id":"e603c6ff-3b77-4693-aa7e-e097e3d5c118","resolution":{"observed_at":"2026-08-07T12:36:20.033626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06430","last_updated":"2025-01-11T04:08:44Z","snapshot_observed_at":"2026-08-08T04:27:13.360500Z","submitted_at":"2025-01-11T04:08:44Z","title":"Open Eyes, Then Reason: Fine-grained Visual Mathematical Understanding in MLLMs","version":1},"cited_work":{"arxiv_id":"2501.06430","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.06430","snapshot_observed_at":"2026-08-07T12:36:28.262113Z","title":"Open Eyes, Then Reason: Fine-grained Visual Mathematical Understanding in MLLMs","venue":"cs.CV","work_id":"6c3842fa-0e74-433e-9970-70421374580e","year":2025},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:20.108953Z"},"links":{"cited_paper":"/paper/2501.06430","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:26ac55ac8cff55c5c267646215496654872e1178a1d418ac506f494a6fd96959","observation_id":"82cf3d16-46a1-4666-86ca-38edf60f9724","resolution":{"observed_at":"2026-08-07T12:36:28.351368Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06148","last_updated":"2026-04-24T03:56:57Z","snapshot_observed_at":"2026-07-06T21:06:12.984419Z","submitted_at":"2025-04-08T15:43:01Z","title":"V-MAGE: A Game Evaluation Framework for Assessing Vision-Centric Capabilities in Multimodal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06148","snapshot_observed_at":"2026-08-07T12:36:20.191213Z","title":"V-mage: A game evaluation framework for assessing visual-centric capabilities in multimodal large language models.arXiv preprint arXiv:2504.06148, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:20.191213Z"},"links":{"cited_paper":"/paper/2504.06148","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:c451d7481374fcc83e1d1055dafae5a3c3f263619940d101daa407f6c30944f2","observation_id":"44b7c249-c56e-4905-bf2e-019f1cca6ebd","resolution":{"observed_at":"2026-08-07T12:36:20.191213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11557","last_updated":"2025-03-14T16:26:11Z","snapshot_observed_at":"2026-08-07T17:03:29.182749Z","submitted_at":"2025-03-14T16:26:11Z","title":"VERIFY: A Benchmark of Visual Explanation and Reasoning for Investigating Multimodal Reasoning Fidelity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.11557","snapshot_observed_at":"2026-08-07T12:36:20.262944Z","title":"Verify: A benchmark of visual explanation and reasoning for investigating multimodal reasoning fidelity.arXiv preprint arXiv:2503.11557, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:20.262944Z"},"links":{"cited_paper":"/paper/2503.11557","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:db2fd349e39a8c01a6fb07336fd78c6b6e4160ee77290234a8b6757be45176d1","observation_id":"cc6d883d-c664-4434-ba4b-aeca9bc13c0f","resolution":{"observed_at":"2026-08-07T12:36:20.262944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14008","last_updated":"2024-06-06T13:19:44Z","snapshot_observed_at":"2026-08-03T03:39:09.398343Z","submitted_at":"2024-02-21T18:49:26Z","title":"OlympiadBench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14008","snapshot_observed_at":"2026-08-07T12:36:20.318015Z","title":"Olympiadbench: A challenging benchmark for promoting agi with olympiad-level bilingual multimodal scientific problems","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:20.318015Z"},"links":{"cited_paper":"/paper/2402.14008","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:19ddff4e4416dd1a7fd40571e062e2983d389cad6044cb68177061edd5b53e1b","observation_id":"e2e65cdc-7675-4ef8-b54b-3b7d1475aaf4","resolution":{"observed_at":"2026-08-07T12:36:20.318015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01442","last_updated":"2020-03-08T00:09:07Z","snapshot_observed_at":"2026-07-06T08:26:38.349660Z","submitted_at":"2019-10-03T13:16:36Z","title":"CLEVRER: CoLlision Events for Video REpresentation and Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01442","snapshot_observed_at":"2026-08-07T12:36:20.404754Z","title":"Tenen- baum","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:20.404754Z"},"links":{"cited_paper":"/paper/1910.01442","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:67f15ead63e69b5a065eb72a6f046776d51c727cf33b6ada19ac853598dee8b5","observation_id":"908e0f4b-ba88-4a97-9a71-89a183d4a691","resolution":{"observed_at":"2026-08-07T12:36:20.404754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.08261","last_updated":"2022-06-20T14:27:21Z","snapshot_observed_at":"2026-08-10T06:40:24.240690Z","submitted_at":"2021-06-15T16:13:39Z","title":"Physion: Evaluating Physical Prediction from Vision in Humans and Machines","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.08261","snapshot_observed_at":"2026-08-07T12:36:20.520292Z","title":"Bear, Elias Wang, Damian Mrowca, Felix J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:20.520292Z"},"links":{"cited_paper":"/paper/2106.08261","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:e419226899cbec200cdf14be9f02e099a7735b4304afd623591ec4e51bd76a6c","observation_id":"b167a712-eb8e-46d2-8573-c78590142f6d","resolution":{"observed_at":"2026-08-07T12:36:20.520292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07018","last_updated":"2023-10-10T21:08:51Z","snapshot_observed_at":"2026-07-06T16:30:46.321160Z","submitted_at":"2023-10-10T21:08:51Z","title":"NEWTON: Are Large Language Models Capable of Physical Reasoning?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07018","snapshot_observed_at":"2026-08-07T12:36:20.594399Z","title":"Newton: Are large language models capable of physical reasoning?arXiv preprint arXiv:2310.07018, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:20.594399Z"},"links":{"cited_paper":"/paper/2310.07018","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:b0dff2bb524c07ea099c668406cd9007cc11e0d245568163703fe76b174c7035","observation_id":"ae3560fa-e2b2-468a-8aab-1a7ca3bbf029","resolution":{"observed_at":"2026-08-07T12:36:20.594399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:20.684237Z","title":"Krishnan","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:20.684237Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:b7a6d9f7de67ca3346090916dd0874040e1c8b66580f85e2d8c77c9dd52b8a61","observation_id":"ab2bb033-976e-482b-8352-b7c889977d56","resolution":{"observed_at":"2026-08-07T12:36:20.684237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12168","last_updated":"2024-01-22T18:01:01Z","snapshot_observed_at":"2026-08-08T07:48:26.170625Z","submitted_at":"2024-01-22T18:01:01Z","title":"SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12168","snapshot_observed_at":"2026-08-07T12:36:20.778339Z","title":"Spatialvlm: Endowing vision-language models with spatial reasoning capabilities","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:20.778339Z"},"links":{"cited_paper":"/paper/2401.12168","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:39fc0b13274b483b6908cbd8f91758b06897f99da04d54513ddfad9a22221ee0","observation_id":"ecee111c-99a8-4f8e-82a8-7493c4edd222","resolution":{"observed_at":"2026-08-07T12:36:20.778339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.13473","last_updated":"2023-10-20T13:14:38Z","snapshot_observed_at":"2026-07-06T16:36:07.860946Z","submitted_at":"2023-10-20T13:14:38Z","title":"Benchmarking Sequential Visual Input Reasoning and Prediction in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.13473","snapshot_observed_at":"2026-08-07T12:36:20.868896Z","title":"Benchmarking sequential visual input reasoning and prediction in multimodal large language models.arXiv preprint arXiv:2310.13473, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:20.868896Z"},"links":{"cited_paper":"/paper/2310.13473","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:a737289af1bb4154ab3c2ce345e426c903b9dcd3a5848043c1fe508888292432","observation_id":"8774458e-4ede-49ad-bdfb-5ade160e8838","resolution":{"observed_at":"2026-08-07T12:36:20.868896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15668","last_updated":"2023-11-02T03:35:51Z","snapshot_observed_at":"2026-07-06T15:47:26.532273Z","submitted_at":"2023-06-27T17:59:33Z","title":"Physion++: Evaluating Physical Scene Understanding that Requires Online Inference of Different Physical Properties","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15668","snapshot_observed_at":"2026-08-07T12:36:20.960291Z","title":"Tenenbaum, Daniel LK Yamins, Judith E Fan, and Kevin A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:20.960291Z"},"links":{"cited_paper":"/paper/2306.15668","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:00ae44d4d24a4025e2c6b9be4cf4e0aa3e1fb1e8572b70052fd568dfbb3ea26c","observation_id":"67a775f1-c542-4221-ae98-dab8d9f561d7","resolution":{"observed_at":"2026-08-07T12:36:20.960291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.07616","last_updated":"2020-02-11T10:05:20Z","snapshot_observed_at":"2026-08-10T11:58:53.944166Z","submitted_at":"2018-03-20T19:29:46Z","title":"IntPhys: A Framework and Benchmark for Visual Intuitive Physics Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.07616","snapshot_observed_at":"2026-08-07T12:36:21.046870Z","title":"Intphys: A framework and benchmark for visual intuitive physics reasoning.arXiv preprint arXiv:1803.07616, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:21.046870Z"},"links":{"cited_paper":"/paper/1803.07616","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:ae92e32b7d9a493d11d4fb6f8a299535c9596e1c3aab8a64bd5d7f47ceba4c88","observation_id":"822f327a-b428-42cd-8f6c-795c96b062b0","resolution":{"observed_at":"2026-08-07T12:36:21.046870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.13730","last_updated":"2024-12-02T15:11:23Z","snapshot_observed_at":"2026-08-08T09:34:50.724739Z","submitted_at":"2024-09-10T01:20:26Z","title":"VisScience: An Extensive Benchmark for Evaluating K12 Educational Multi-modal Scientific Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.13730","snapshot_observed_at":"2026-08-07T12:36:21.116573Z","title":"Visscience: An extensive benchmark for evaluating k12 educational multi-modal scientific reasoning.arXiv preprint arXiv:2409.13730, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:21.116573Z"},"links":{"cited_paper":"/paper/2409.13730","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:525670d736d1842f7e9bec708f77edf7dbdaf98ded2f022f7b12100af2f1f697","observation_id":"2b7f97da-6412-476c-a8ab-1630c8cc4cc2","resolution":{"observed_at":"2026-08-07T12:36:21.116573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.09513","last_updated":"2022-10-17T07:46:47Z","snapshot_observed_at":"2026-08-02T03:10:19.073297Z","submitted_at":"2022-09-20T07:04:24Z","title":"Learn to Explain: Multimodal Reasoning via Thought Chains for Science Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.09513","snapshot_observed_at":"2026-08-07T12:36:21.188252Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering.arXiv preprint arXiv:2209.09513, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:21.188252Z"},"links":{"cited_paper":"/paper/2209.09513","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:f23be0f1126ea00de3d5f180d1112c1356b429cc935e6bd839c51a9de26a00a2","observation_id":"c463ac39-5abf-407c-a49b-30cfbfc8bd6f","resolution":{"observed_at":"2026-08-07T12:36:21.188252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-07T17:40:59.052312Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-08-07T12:36:21.244871Z","title":"Can mllms reason in multimodality? emma: An enhanced multimodal reasoning benchmark.arXiv preprint arXiv:2501.05444, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:21.244871Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:83619df43fc214d75631dd66ec19d6f29146b395beb860bb53979130de509439","observation_id":"a5964cce-ce42-4bca-9940-f8b194a075a7","resolution":{"observed_at":"2026-08-07T12:36:21.244871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12054","last_updated":"2025-05-26T13:42:06Z","snapshot_observed_at":"2026-08-09T21:13:13.536782Z","submitted_at":"2025-02-17T17:24:14Z","title":"PhysReason: A Comprehensive Benchmark towards Physics-Based Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12054","snapshot_observed_at":"2026-08-07T12:36:21.317514Z","title":"Physreason: A comprehensive benchmark towards physics-based reasoning.arXiv preprint arXiv:2502.12054, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:21.317514Z"},"links":{"cited_paper":"/paper/2502.12054","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:342025d72d36d5e0b0bfc90fc659ef9a2715dafc6afb219434c0c89f9b63616e","observation_id":"5c35bf45-4fb4-40b1-8e39-8b6d0e7510ea","resolution":{"observed_at":"2026-08-07T12:36:21.317514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16170","last_updated":"2023-12-26T18:59:11Z","snapshot_observed_at":"2026-07-06T17:08:12.928414Z","submitted_at":"2023-12-26T18:59:11Z","title":"EmbodiedScan: A Holistic Multi-Modal 3D Perception Suite Towards Embodied AI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.16170","snapshot_observed_at":"2026-08-07T12:36:21.373436Z","title":"Embodiedscan: A holistic multi-modal 3d perception suite towards embodied ai.arXiv preprint arXiv:2312.16170, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:21.373436Z"},"links":{"cited_paper":"/paper/2312.16170","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:5c948f7e39b221309b5d1d04d7254502ba71fbe0b9a6cde5dcce4e2894477e9f","observation_id":"ad5b2f0c-bb69-4e52-85e7-1ab692f38bba","resolution":{"observed_at":"2026-08-07T12:36:21.373436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14171","last_updated":"2025-07-02T21:00:36Z","snapshot_observed_at":"2026-08-10T08:02:13.965614Z","submitted_at":"2024-12-18T18:59:54Z","title":"Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14171","snapshot_observed_at":"2026-08-07T12:36:21.417316Z","title":"Gupta, Rilyn Han, Li Fei-Fei, and Saining Xie","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:21.417316Z"},"links":{"cited_paper":"/paper/2412.14171","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:e7882025b9dfaa6c8631f292f29631e9cabbb26a0dfe6853477748943d47be57","observation_id":"63384adf-d6bd-4088-81a7-c43adc1af628","resolution":{"observed_at":"2026-08-07T12:36:21.417316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.06048","last_updated":"2024-11-09T03:07:33Z","snapshot_observed_at":"2026-08-10T11:17:09.108844Z","submitted_at":"2024-11-09T03:07:33Z","title":"An Empirical Analysis on Spatial Reasoning Capabilities of Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.06048","snapshot_observed_at":"2026-08-07T12:36:21.486935Z","title":"An empirical analysis on spatial reasoning capabilities of large multimodal models.arXiv preprint arXiv:2411.06048, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:21.486935Z"},"links":{"cited_paper":"/paper/2411.06048","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:d75693d049b713ac553ecc140819e0cc83f09530202a4f1f7991271897848f0e","observation_id":"a4532fb0-a63d-47eb-bfe9-83c99d75f682","resolution":{"observed_at":"2026-08-07T12:36:21.486935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.17862","last_updated":"2024-01-31T14:21:49Z","snapshot_observed_at":"2026-08-03T16:59:53.976215Z","submitted_at":"2024-01-31T14:21:49Z","title":"Proximity QA: Unleashing the Power of Multi-Modal Large Language Models for Spatial Proximity Analysis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.17862","snapshot_observed_at":"2026-08-07T12:36:21.555751Z","title":"Proximity qa: Unleashing the power of multi-modal large language models for spatial proximity analysis.arXiv preprint arXiv:2401.17862, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:21.555751Z"},"links":{"cited_paper":"/paper/2401.17862","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:a63d8d8c6919c01e827f0476bf7b73af146f9d5bffc669044d23a0447788a52a","observation_id":"7c262a1a-3ac7-447e-961c-842df6a37134","resolution":{"observed_at":"2026-08-07T12:36:21.555751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16411","last_updated":"2025-01-29T03:52:39Z","snapshot_observed_at":"2026-08-10T13:26:57.540152Z","submitted_at":"2025-01-27T18:59:58Z","title":"PhysBench: Benchmarking and Enhancing Vision-Language Models for Physical World Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16411","snapshot_observed_at":"2026-08-07T12:36:21.624537Z","title":"Physbench: Benchmarking and enhancing vision-language models for physical world understanding.arXiv preprint arXiv:2501.16411, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:21.624537Z"},"links":{"cited_paper":"/paper/2501.16411","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:3c0b90583051460109423d40c975d7b033f05f9168c0187e704a71fa5dbbec19","observation_id":"3d74019f-fe34-4f14-a255-a411d2c9ff04","resolution":{"observed_at":"2026-08-07T12:36:21.624537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T12:36:21.680691Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:21.680691Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:8ee744522b090381ccba0295e7b87de226bbe5d3977e84d43855d75162528a4d","observation_id":"90c1b8a9-7127-4475-8b08-8073d63496b9","resolution":{"observed_at":"2026-08-07T12:36:21.680691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-08T06:16:25.839566Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-07T12:36:21.723524Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:21.723524Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:bcd14e8381f03aec91fcecbaf506e0844931c170f92f5e3251f3641353cdd482","observation_id":"46b9bca8-e09f-48f8-8f36-3c31042c8101","resolution":{"observed_at":"2026-08-07T12:36:21.723524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02643","last_updated":"2023-04-05T17:59:46Z","snapshot_observed_at":"2026-08-08T05:14:59.435033Z","submitted_at":"2023-04-05T17:59:46Z","title":"Segment Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.02643","snapshot_observed_at":"2026-08-07T12:36:21.790062Z","title":"Berg, Wan-Yen Lo, Piotr Dollár, and Ross Girshick","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:21.790062Z"},"links":{"cited_paper":"/paper/2304.02643","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:ef6322e6aa1e9e7e484147bcef9f1df456d89957306b1789ba2cc2a83a179b05","observation_id":"ea89ced4-9a2c-4a8a-b32b-ea61316a9c9a","resolution":{"observed_at":"2026-08-07T12:36:21.790062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.03048","last_updated":"2023-10-04T01:15:21Z","snapshot_observed_at":"2026-08-06T10:14:06.161139Z","submitted_at":"2023-05-04T17:59:36Z","title":"Personalize Segment Anything Model with One Shot","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.03048","snapshot_observed_at":"2026-08-07T12:36:21.875766Z","title":"Personalize segment anything model with one shot.arXiv preprint arXiv:2305.03048, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:21.875766Z"},"links":{"cited_paper":"/paper/2305.03048","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:302c109e9623f671e3a1e0fc58e3a5f68d770e01c8caaac462bb3b955b21a032","observation_id":"9c6c0ba1-be81-4917-b8b0-dfa1ce47731e","resolution":{"observed_at":"2026-08-07T12:36:21.875766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:21.950051Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:21.950051Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:14d95d731733b60dfce55de51f33bd1a33f10e1926fbe2a6f1124bc6d9887d24","observation_id":"60c21250-ccb4-4717-a05e-19930cb6a5c7","resolution":{"observed_at":"2026-08-07T12:36:21.950051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:22.016171Z","title":"Instructblip: Towards general-purpose vision-language models with instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:22.016171Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:06e6ec938569a78eb1ac1970aac9dd489e371681a8a12492710d43c1afc6ec82","observation_id":"260abcfe-bd4f-44d9-826f-6b836f423142","resolution":{"observed_at":"2026-08-07T12:36:22.016171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:22.092255Z","title":"3d-llm: Injecting the 3d world into large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:22.092255Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:6349c36ab5816e450c94bbc3d59709abe0d5816c76a271435a676455d7dc9284","observation_id":"6d2a1a43-faca-45d4-8932-d7947869b798","resolution":{"observed_at":"2026-08-07T12:36:22.092255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:22.160080Z","title":"Pandagpt: One model to instruction- follow them all, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:22.160080Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:d80a8fe92d714980fb4e08357b55da64b253ec2dfc3da571404d2b880e920350","observation_id":"66df359e-d2d6-48f5-b4a9-24bd298106d0","resolution":{"observed_at":"2026-08-07T12:36:22.160080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05211","last_updated":"2025-05-30T12:57:16Z","snapshot_observed_at":"2026-07-06T18:58:56.504337Z","submitted_at":"2024-08-09T17:59:49Z","title":"VITA: Towards Open-Source Interactive Omni Multimodal LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.05211","snapshot_observed_at":"2026-08-07T12:36:22.224140Z","title":"Vita: Towards open-source interactive omni multimodal llm.arXiv preprint arXiv:2408.05211, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:22.224140Z"},"links":{"cited_paper":"/paper/2408.05211","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:a5f05220ab62a63c22b10453e61df2f935def17546ce7fb2b7135e972ab95d2e","observation_id":"1660023d-958b-4890-88a7-2a40bb1ad2aa","resolution":{"observed_at":"2026-08-07T12:36:22.224140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01957","last_updated":"2025-10-24T02:32:10Z","snapshot_observed_at":"2026-08-06T10:28:03.148202Z","submitted_at":"2025-01-03T18:59:52Z","title":"VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01957","snapshot_observed_at":"2026-08-07T12:36:22.280641Z","title":"Vita-1.5: Towards gpt-4o level real-time vision and speech interaction.arXiv preprint arXiv:2501.01957, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:22.280641Z"},"links":{"cited_paper":"/paper/2501.01957","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:a8aa13f55d2c15c546fc7229c5a34642dc930c643d3fbf092c09c05ed27465e3","observation_id":"69a0ebaa-6384-4a20-844d-d20a6dce74e1","resolution":{"observed_at":"2026-08-07T12:36:22.280641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:22.347165Z","title":"Vita-audio: Fast interleaved cross-modal token generation for efficient large speech-language model, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:22.347165Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:462e1960a239659530ac351aa673757cb2ac8297710afe0ebfc95e37b5f48cd3","observation_id":"6a9541b2-ccdc-4f3a-a939-c42387392cec","resolution":{"observed_at":"2026-08-07T12:36:22.347165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:22.411001Z","title":"Video-llama: An instruction-tuned audio-visual language model for video understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:22.411001Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:628784f03a91fbb653322a49add97d9845f75f9179f1f319e9efbfc12e5ab820","observation_id":"c913f7a9-5fba-4d67-9171-8d4f16a12530","resolution":{"observed_at":"2026-08-07T12:36:22.411001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:22.455709Z","title":"Spacevllm: Endowing multimodal large language model with spatio-temporal video grounding capability, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:22.455709Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:eb4df667751caa0de9519b86d04e41aa845e3753d32005cfacb33199a9e54073","observation_id":"f0a2e4ae-da02-4a79-a055-26a160efb31b","resolution":{"observed_at":"2026-08-07T12:36:22.455709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:22.458775Z","title":"LLaMA-adapter: Efficient fine-tuning of large language models with zero-initialized attention","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:22.458775Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:ce732887dedef6dcb01914f4eb1220e73cceb99e37e9173dcc57cbcc3948df15","observation_id":"c38a4c4e-a0af-437b-87f9-6d37036f53d4","resolution":{"observed_at":"2026-08-07T12:36:22.458775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:22.500101Z","title":"Visual instruction tuning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:22.500101Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:7cf08515b3b8d7c74a3ebaeb81954d0725734ecea2cdcabd947973d219537c20","observation_id":"5039bd49-cdd8-4f8f-acd0-96f3f80d5ec1","resolution":{"observed_at":"2026-08-07T12:36:22.500101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:22.652265Z","title":"Improved baselines with visual instruction tuning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:22.652265Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:acafa73181b98f5a4ba9f85bc5aed8bcaafdd355278948934c48af16e924dc7b","observation_id":"a0910820-c1db-4199-8789-e26c10fe9133","resolution":{"observed_at":"2026-08-07T12:36:22.652265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:22.725970Z","title":"Llava-next: Improved reasoning, ocr, and world knowledge, January 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:22.725970Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:284dc03cc62ea05a63cd8ebe2e17bb4e35fd511be5a84fee39b6488f25403ce6","observation_id":"ec98eba8-2dbb-41a3-9766-8566ca7da7d6","resolution":{"observed_at":"2026-08-07T12:36:22.725970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-07T12:36:22.768465Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models.arXiv preprint arXiv:2304.10592, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:22.768465Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:5650a600500aa0ee54322ab185bef3bc7cea37caa8b102bfedfebee3baaabd76","observation_id":"f454c4e6-b036-4bd8-841f-70ce1d281766","resolution":{"observed_at":"2026-08-07T12:36:22.768465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09478","last_updated":"2023-11-07T18:25:48Z","snapshot_observed_at":"2026-08-06T12:38:03.720232Z","submitted_at":"2023-10-14T03:22:07Z","title":"MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09478","snapshot_observed_at":"2026-08-07T12:36:22.815837Z","title":"Minigpt-v2: large language model as a unified interface for vision-language multi-task learning.arXiv preprint arXiv:2310.09478, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:22.815837Z"},"links":{"cited_paper":"/paper/2310.09478","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:517b9d47da1f72348375522f3d183d193b6200163e61bf3477b96b37ac7f28e0","observation_id":"799b57d4-03be-4d41-97ff-ac0b46c843a6","resolution":{"observed_at":"2026-08-07T12:36:22.815837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:22.899311Z","title":"Learning transferable visual models from natural language supervision, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:22.899311Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:b87a27f0b98ce4aba7b0b1a1dd973cd9e927d37dae32bd7fcb4ec24a0c3c8bed","observation_id":"df89751e-4604-4235-91ea-81e75435bd92","resolution":{"observed_at":"2026-08-07T12:36:22.899311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:23.010251Z","title":"mplug-owl3: Towards long image-sequence understanding in multi-modal large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:23.010251Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:28ab5fac467dbd4269d710ce7f621c3983c33a9ff11f973663f5bcd4aa9e985d","observation_id":"063ee0c4-8367-4705-b771-9415224150c9","resolution":{"observed_at":"2026-08-07T12:36:23.010251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T12:36:23.072424Z","title":"Qwen2.5-vl technical report.arXiv preprint arXiv:2502.13923, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:23.072424Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:987ae8750dfdc5c78fe4ee2c9fb7fa329566f33c5e448a2db195459d975d544c","observation_id":"0829e115-4579-4cab-b61f-6d19f0feaf4d","resolution":{"observed_at":"2026-08-07T12:36:23.072424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:23.154071Z","title":"Deepseek-vl2: Mixture-of-experts vision-language models for advanced multimodal understanding, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:23.154071Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:8bee3ad7ac4d74f5ecf5f0cd3daea4e2829e127002f44ba96d3bfc4efa73594b","observation_id":"7a499321-9580-4479-a01d-f51d21fdf84b","resolution":{"observed_at":"2026-08-07T12:36:23.154071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:23.217279Z","title":"Kimi-vl technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:23.217279Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:9f9a459157434833dfa27804fd12e62f00231addd6b16ffe7810216d6f65c6a9","observation_id":"fc6cd84c-e397-4d50-8e6a-f4c4ad5091a6","resolution":{"observed_at":"2026-08-07T12:36:23.217279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:23.280415Z","title":"Seed1.5-vl technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:23.280415Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:37b9000601a3196b8f8633cc51cab95f61bd00655dce3efa06e800226e67db16","observation_id":"c45492da-7ca0-454f-b188-c47c75f7fe41","resolution":{"observed_at":"2026-08-07T12:36:23.280415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:23.402170Z","title":"Skywork r1v2: Multimodal hybrid reinforcement learning for reasoning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:23.402170Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:c9f3b8c39f5c12106b0d1b515f75e44302a72fb30157ecaa21b09199fa333a6c","observation_id":"7cc228e6-1605-4f62-abf4-ecd5acaa5b31","resolution":{"observed_at":"2026-08-07T12:36:23.402170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01800","last_updated":"2024-12-02T18:47:25Z","snapshot_observed_at":"2026-08-02T07:22:42.764229Z","submitted_at":"2024-12-02T18:47:25Z","title":"PhysGame: Uncovering Physical Commonsense Violations in Gameplay Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01800","snapshot_observed_at":"2026-08-07T12:36:23.575813Z","title":"Physgame: Uncovering physical commonsense violations in gameplay videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:23.575813Z"},"links":{"cited_paper":"/paper/2412.01800","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:855eb831f56739f8a2f53d95811a196b33558bb0f785da6b35c9bdc3a11f753f","observation_id":"89ccdf80-22eb-491d-8121-9d1f4642d94a","resolution":{"observed_at":"2026-08-07T12:36:23.575813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:23.749834Z","title":"Embspatial-bench: Benchmarking spatial understanding for embodied tasks with large vision-language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:23.749834Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:d9df0a122bdf7c17273cdbe7bca6e027419dce307a335fbb6098b37d2d7fc232","observation_id":"b0d84298-b701-490d-9004-cafeff56dfbc","resolution":{"observed_at":"2026-08-07T12:36:23.749834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:34.689527Z","title":"LLaV A-onevision: Easy visual task transfer.Transactions on Machine Learning Research, 2025","venue":null,"work_id":"8d4d9eea-8f79-466b-819e-ecfb62ea92a1","year":2025},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:23.835605Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:0debf1acd9e3f5597444ae079d524a32f3deaab30605014db6d855ba90060f46","observation_id":"e0e312f6-0e91-4162-ad4c-8b73e58f1836","resolution":{"observed_at":"2026-08-07T12:36:34.765235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10440","last_updated":"2025-07-21T03:53:30Z","snapshot_observed_at":"2026-08-07T09:36:29.319006Z","submitted_at":"2024-11-15T18:58:31Z","title":"LLaVA-CoT: Let Vision Language Models Reason Step-by-Step","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10440","snapshot_observed_at":"2026-08-07T12:36:23.942050Z","title":"Llava-cot: Let vision language models reason step-by-step.arXiv preprint arXiv:2411.10440, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:23.942050Z"},"links":{"cited_paper":"/paper/2411.10440","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:03852983235a6c56b1c0979fbf1268dff3fd6611bb0fccbdacbfadb643993475","observation_id":"e654eca7-a0bb-4e73-b503-0d0c8e84f0dd","resolution":{"observed_at":"2026-08-07T12:36:23.942050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T12:36:24.031956Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling.arXiv preprint arXiv:2412.05271, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:24.031956Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:32f2e39c55c764bf8e18af9cfeb6d8af27ace4f2b5dbb98332520bfc426c9568","observation_id":"24f747fc-509d-416c-80e3-8e1d9704fa43","resolution":{"observed_at":"2026-08-07T12:36:24.031956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10442","last_updated":"2025-04-07T09:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-15T18:59:27Z","title":"Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10442","snapshot_observed_at":"2026-08-07T12:36:24.114630Z","title":"Enhancing the reasoning ability of multimodal large language models via mixed preference optimization.arXiv preprint arXiv:2411.10442, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:24.114630Z"},"links":{"cited_paper":"/paper/2411.10442","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:ab33b5e2938067c6cc7a1c89f9e9a096bdf7e4289d293d5b85fc5dc3ec1b6680","observation_id":"b3d77043-991d-4814-96cc-777a89c0029a","resolution":{"observed_at":"2026-08-07T12:36:24.114630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:34.470463Z","title":"QVQ: To See the World with Wisdom, December 2024","venue":null,"work_id":"5b480c20-82dc-41a1-957b-a3c5d542cc57","year":2024},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:24.200139Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:3f89d2fbce42ceb5763e8f0341275c003fff3d1b28f07f38f8aaa3b64e148ba2","observation_id":"5287267f-c1fb-4c71-bd5f-a630bed012fa","resolution":{"observed_at":"2026-08-07T12:36:34.558651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:34.251609Z","title":"Claude 3.7 sonnet.https://claude.ai/new, 2025","venue":null,"work_id":"f51f1493-9121-4c45-845e-26a3e21538bb","year":2025},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:24.300733Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:bc70371d4ad6969cf5398d3b167e62d2c129b0cc3830ecedccfd2911041ceb4c","observation_id":"51437547-c18b-432c-bb4a-c2b70deba3b6","resolution":{"observed_at":"2026-08-07T12:36:34.368817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:34.089534Z","title":"Grok 3.https://grok.com, 2025","venue":null,"work_id":"13748c83-753b-4fe8-b334-0829b4e584d4","year":2025},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:24.375824Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:18fdc64d1a65876f67393adab40267a2d6b25173f1b3d2cf72c7cc75df75bab6","observation_id":"4d2394ab-553a-4aac-93ea-025791a148fd","resolution":{"observed_at":"2026-08-07T12:36:34.160168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T12:36:24.505754Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution.arXiv preprint arXiv:2409.12191, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:24.505754Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:9810c389bbf7846dfb48f6b1c626721d8edfcd12be6ad98c0b5050cd306b7613","observation_id":"ea1e89af-7f03-487e-85f2-927165fd8616","resolution":{"observed_at":"2026-08-07T12:36:24.505754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07365","last_updated":"2025-04-15T14:22:45Z","snapshot_observed_at":"2026-08-09T01:06:58.674891Z","submitted_at":"2025-03-10T14:23:12Z","title":"MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07365","snapshot_observed_at":"2026-08-07T12:36:24.617986Z","title":"Mm-eureka: Exploring visual aha moment with rule-based large-scale reinforcement learning.arXiv preprint arXiv:2503.07365, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:24.617986Z"},"links":{"cited_paper":"/paper/2503.07365","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:60ce90f1dcd6b42fc1f9a1d53ed51f47cf0e65928ddeced944f0e3b7552d1fae","observation_id":"50f62abb-79ea-4f38-a606-848e71f52a4a","resolution":{"observed_at":"2026-08-07T12:36:24.617986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12937","last_updated":"2025-08-04T04:22:09Z","snapshot_observed_at":"2026-08-06T21:34:54.534751Z","submitted_at":"2025-03-17T08:51:44Z","title":"R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12937","snapshot_observed_at":"2026-08-07T12:36:24.686510Z","title":"R1-vl: Learning to reason with multimodal large language models via step-wise group relative policy optimization.arXiv preprint arXiv:2503.12937, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:24.686510Z"},"links":{"cited_paper":"/paper/2503.12937","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:093c5e3c39eaad1317fd5f21293981295f9abd76085a57ff58feb7e55c73a4c0","observation_id":"dab57297-c8b5-4a3c-8834-853a5d28a0ae","resolution":{"observed_at":"2026-08-07T12:36:24.686510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:33.905735Z","title":"Lighthouse Laboratory","venue":null,"work_id":"abb412b3-2ba8-4f4e-8343-4bde87805b09","year":2022},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:24.794031Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:47254d93c364f3e97019e2e0454d1e579789c7b993c4a39920602564d973f923","observation_id":"61e06049-98a8-406e-8436-d662c5ea8d02","resolution":{"observed_at":"2026-08-07T12:36:33.993893Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:33.748424Z","title":"How to accelerate the separation of B peels?","venue":null,"work_id":"2d3c7604-011c-4bf4-9995-d9345b8f7b08","year":null},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:24.862619Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:770157b7347b88492def654eddf362180eb614a14a6cef8904dfa7870ea1ceb6","observation_id":"6eeef0b3-d4b8-4833-a11e-7b52f54d542e","resolution":{"observed_at":"2026-08-07T12:36:33.827548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:33.265260Z","title":"Match\": Aligns with ground truth -","venue":null,"work_id":"e498b658-fcad-403a-921a-f006f4305f72","year":null},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:25.116132Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:04fe6a53c8988857d9066f281419f242128d6ca734101909e3736a00fdde945a","observation_id":"27d068b8-2425-4329-a5b6-587f40f4b301","resolution":{"observed_at":"2026-08-07T12:36:33.349581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:33.061512Z","title":null,"venue":null,"work_id":"e291e586-b801-4a74-8334-cff0530d1e91","year":null},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:25.210835Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:ed1ef2752a47edb407a09596e6dcc335f068aa8b46938e8520e9619cd7968c29","observation_id":"d1cff303-65e1-4032-8fb2-3e94366bda11","resolution":{"observed_at":"2026-08-07T12:36:33.161374Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:32.875647Z","title":null,"venue":null,"work_id":"a2f0b949-1a1b-4a07-b662-6a8fc09d1c21","year":null},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:25.270152Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:8bbb74a126e19d8bd91b17b7169d9ad6aba3a238af9baefd8b23ac1ed7104551","observation_id":"46994528-e7f1-4df4-9cc5-0f478736c365","resolution":{"observed_at":"2026-08-07T12:36:32.975801Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:32.732674Z","title":"step_type","venue":null,"work_id":"ff26224a-de38-4077-a246-6b3b138108cd","year":null},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:25.327962Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:af6894176091739b430c4600d5bd5285328e818e26e909e1db3071dc15802cc6","observation_id":"4bd75fcd-905f-471e-9ccb-710fa60f1e58","resolution":{"observed_at":"2026-08-07T12:36:32.788316Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:32.565290Z","title":null,"venue":null,"work_id":"43a0cda0-c2aa-40bd-ae43-50333a6fa47f","year":null},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:25.377531Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:7e989df962f81b661901c51bfe87e0065ef498c4123f4703b5819531977e54fc","observation_id":"c66b620a-fc0a-4b2c-b5e3-ac3a7dec9427","resolution":{"observed_at":"2026-08-07T12:36:32.636472Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:32.354466Z","title":null,"venue":null,"work_id":"5eb10890-7848-443d-8bdb-b45a597a1790","year":null},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:25.437494Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:81c1d69474f41c5b9490e83f7d0e3d77ce82d96f1112274e570a1e6bd296d032","observation_id":"922b58cc-43e4-4bd1-8e6d-61ed70f34379","resolution":{"observed_at":"2026-08-07T12:36:32.446079Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:32.160364Z","title":"step_index","venue":null,"work_id":"6bdeffa2-2273-4685-9f81-acab28867038","year":null},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:25.529787Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:04acdea5e53bc047821bd4b6cea01bf562e9c01d0032b4aecacf642b01212237","observation_id":"bd4f9cf0-0f23-4be6-8ff7-5ebbe941f9fe","resolution":{"observed_at":"2026-08-07T12:36:32.256146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:31.930199Z","title":null,"venue":null,"work_id":"5267bdb0-46a6-45a1-bc0c-e74504d5e04e","year":null},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:25.673411Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:1ec27a2a482a9e90df2db2a947b509d39fd449d81c183f61135e6d0bfe8926d5","observation_id":"f6e2c853-6c79-4e77-b795-20ce8555daf2","resolution":{"observed_at":"2026-08-07T12:36:32.013586Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:31.736265Z","title":null,"venue":null,"work_id":"74b6715a-4e4c-4ffd-9ad1-ddc86ec0e91f","year":null},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:25.792224Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:4c9007b43397a5dce5673f676e17ee767fb14edd48ad77c482f7dac998e6e856","observation_id":"bdad26ad-30d8-437d-8bc8-bb1be0eca3bd","resolution":{"observed_at":"2026-08-07T12:36:31.807240Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:31.515743Z","title":null,"venue":null,"work_id":"71a3d72c-618b-43da-b436-30aba7baee6c","year":null},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:25.911829Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:09724eaa73d64e4a956c414950bbf5ca5a47e37d1d1aa1ea5e743cd667620ca0","observation_id":"2d06af11-b0a8-43e7-abe8-135072fcb745","resolution":{"observed_at":"2026-08-07T12:36:31.634903Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:31.292251Z","title":null,"venue":null,"work_id":"85911318-7e70-4f7b-864a-3a1807129bbf","year":null},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:26.033113Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:a6189e810c969cf9e688fbb2a1212de1a2d4f4f6e579cb85da7835f630881831","observation_id":"157d4246-ebd0-4774-a782-365a36baeb31","resolution":{"observed_at":"2026-08-07T12:36:31.403584Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":89,"verified_exact":1,"verified_fuzzy":8},"total_outbound_references":118},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 100 of 118 outbound references and 2 inbound Pith citation observations for arXiv:2505.24182."}