{"as_of":"2026-08-20T04:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c828089fa240df0c2434182f24643958a8df21156f9ceba969130cf1f36d0ac4","coverage":[{"denominator":93,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":93,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T09:09:24.905094Z","state":"measured"},{"denominator":93,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":93,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.20868/citation-record","integrity":"/paper/2607.20868/integrity","json":"/paper/2607.20868/citation-record.json","paper":"/paper/2607.20868"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:09:24.663697Z","title":"Anthropic Model System Cards,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-15T09:32:21.039236Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.663697Z"},"links":{"citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:cddd9d04e159231cbf146f8e79243ea6432322bb23e790d2ba3154c37d567a8f","observation_id":"8125c7ac-7cdf-4e38-9344-8fc03592cdb2","resolution":{"observed_at":"2026-08-01T09:09:24.663697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:09:24.668129Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-15T09:32:21.039236Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.668129Z"},"links":{"citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:a51e94f3ce951531889da4bb5169677f9909f4a771435fb3414126587121ef44","observation_id":"66b3c9d1-5eac-4fcc-b675-245d1353e068","resolution":{"observed_at":"2026-08-01T09:09:24.668129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:09:24.671372Z","title":"Measuring Multimodal Mathematical Reasoning with MATH-Vision Dataset,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-15T09:32:21.039236Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.671372Z"},"links":{"citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:f837c9c159bc8cc92f6c95dd363f66ab102d4e22222a13fa9790578a396ac7bf","observation_id":"c603d0e4-fa8f-48d3-91b0-3c234ede0cbd","resolution":{"observed_at":"2026-08-01T09:09:24.671372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:09:24.674212Z","title":"MATHVERSE: Does Your Multi-modal LLM Truly See the Diagrams in Visual Math Problems?","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-15T09:32:21.039236Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.674212Z"},"links":{"citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:ac420f034d868c8b33871114ca455872911e9dd48c5c828f5a457b27b5f18a61","observation_id":"0dfb85d0-7dcb-4255-b922-e76af0dfe948","resolution":{"observed_at":"2026-08-01T09:09:24.674212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:09:24.677053Z","title":"MMCode: Bench- marking Multimodal Large Language Models for Code Generation with Visually Rich Programming Problems,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-15T09:32:21.039236Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.677053Z"},"links":{"citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:4e028ff024afa402a8d170ceff302c838788768552e43bb33318e91da3e3a4c7","observation_id":"d3a52870-9495-4760-80a0-20d6d78dfc39","resolution":{"observed_at":"2026-08-01T09:09:24.677053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:09:24.679870Z","title":"Design2Code: Benchmarking Multimodal Code Generation for Automated Front-End Engineering,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-15T09:32:21.039236Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.679870Z"},"links":{"citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:736f064d0a19f8dbabc5d6596adc9c2c013adbb89dd7fd68e2cf2a0ac5619abd","observation_id":"6f30c3b6-0f4a-439d-ae62-4ba10ff86033","resolution":{"observed_at":"2026-08-01T09:09:24.679870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-01T09:09:24.683051Z","title":"Emu3: Next-Token Prediction is All You Need,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-15T09:32:21.039236Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.683051Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:dcf6cd7401abd6f111da722114d15593408e3951eb4b1899823b1442bc45f924","observation_id":"2e42d47d-a9aa-425d-bbe5-8ce38f1520ea","resolution":{"observed_at":"2026-08-01T09:09:24.683051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:09:24.686490Z","title":"NExT-GPT: Any-to-Any Multimodal LLM,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-15T09:32:21.039236Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.686490Z"},"links":{"citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:40a3ff1047d9e6d797c4dc51aecfebcea8635eb1049d013c39c8cd4d9ba5f71b","observation_id":"1a587680-5cd6-4e9a-ab65-1ac8f160b1f8","resolution":{"observed_at":"2026-08-01T09:09:24.686490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:09:24.689064Z","title":"MiniGPT-5: Interleaved Vision- and-Language Generation via Generative V okens,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-15T09:32:21.039236Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.689064Z"},"links":{"citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:9d33331e7699450bff1f08b52ec3765bd406d5f06aef8e98930c2aae01a0ccd6","observation_id":"b646d324-077b-4ef7-bf9e-3076e5feab10","resolution":{"observed_at":"2026-08-01T09:09:24.689064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:09:24.692319Z","title":"Introducing GPT-5,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-15T09:32:21.039236Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.692319Z"},"links":{"citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:bf80468df97d5ec74f4e20f02e540a1c02441fe0d0dbdab8770f01ab4757ce2e","observation_id":"e092185f-4012-463c-8ad9-5caf242f27f1","resolution":{"observed_at":"2026-08-01T09:09:24.692319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-08-18T14:12:03.598270Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-08-01T09:09:24.694712Z","title":"GPQA: A Graduate-Level Google- Proof Q&A Benchmark,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-15T09:32:21.039236Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.694712Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:ce57dbfd94180c0fd065354e0d993e5e4c8c8bdfc2d261277a3f062432504da6","observation_id":"d5414616-3fa1-4111-81e7-c2254d124fb8","resolution":{"observed_at":"2026-08-01T09:09:24.694712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:09:24.697578Z","title":"Gemini Achieves Gold-Medal Level at the Interna- tional Collegiate Programming Contest World Finals,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-15T09:32:21.039236Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.697578Z"},"links":{"citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:d73eadfd29a4ab2c611a0d78e98d4a22d1f85adf34c2e6fe4f138d88bc4d59b5","observation_id":"4a219f89-569b-4bcb-983f-01c58090da0d","resolution":{"observed_at":"2026-08-01T09:09:24.697578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:09:24.699983Z","title":"LMDrive: Closed-Loop End-to-End Driving with Large Language Models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-15T09:32:21.039236Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.699983Z"},"links":{"citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:cd52596b10ccada168afd37abed482711c07aebda919370474b3f07b503b4728","observation_id":"999c13da-e07a-4e30-886b-2152ef9bb75c","resolution":{"observed_at":"2026-08-01T09:09:24.699983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:09:24.702398Z","title":"DriveLM: Driving with Graph Visual Question Answering,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-15T09:32:21.039236Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.702398Z"},"links":{"citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:a9f4096e5fc5d74a6a9f3bb396175c5d262accf84e22aeea8cf8749c618a507a","observation_id":"88ca3259-f664-4575-9707-708e924734c5","resolution":{"observed_at":"2026-08-01T09:09:24.702398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:09:24.704882Z","title":"DriveGPT4: Interpretable End-to-End Autonomous Driving Via Large Language Model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-15T09:32:21.039236Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.704882Z"},"links":{"citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:dcf9c83c62e53050c121876511a9dea08de17ed730f9d8c746a88a8739950880","observation_id":"875c0729-2bc9-4309-8560-39c395827fa0","resolution":{"observed_at":"2026-08-01T09:09:24.704882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-08-16T21:53:14.144225Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-01T09:09:24.707452Z","title":"Open- VLA: An Open-Source Vision-Language-Action Model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-15T09:32:21.039236Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.707452Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:89d51fa7aa83595d30f31ca652a5ce7e80462231d409e29c064387a95fe3a369","observation_id":"ff14f369-bb9d-4d3e-a525-eefa7817b933","resolution":{"observed_at":"2026-08-01T09:09:24.707452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:09:24.710169Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-15T09:32:21.039236Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.710169Z"},"links":{"citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:23d94cd040b0b91a822966306511d373d50af2ff908a7cfd1299e61a611e63d4","observation_id":"a1097f00-afa0-4748-85b3-b4a86d71b181","resolution":{"observed_at":"2026-08-01T09:09:24.710169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.01691","last_updated":"2022-08-16T16:06:33Z","snapshot_observed_at":"2026-08-18T11:44:22.813405Z","submitted_at":"2022-04-04T17:57:11Z","title":"Do As I Can, Not As I Say: Grounding Language in Robotic Affordances","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.01691","snapshot_observed_at":"2026-08-01T09:09:24.713143Z","title":"Do As I Can, Not As I Say: Grounding Language in Robotic Affordances,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-15T09:32:21.039236Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.713143Z"},"links":{"cited_paper":"/paper/2204.01691","citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:67f15e2481078eb09e4937e23bae12135ea7d074b8315f345943913585e20ad6","observation_id":"932ca2e5-c28f-44e2-9e9a-d088986d966d","resolution":{"observed_at":"2026-08-01T09:09:24.713143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-08-14T18:47:26.721223Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-08-01T09:09:24.716271Z","title":"PaLM-E: An Embodied Multimodal Language Model,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-15T09:32:21.039236Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.716271Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:7629fbcdfee489b79da1ba1cb640769a104e0935b5ff1b24424a3dfb1d5ec8b0","observation_id":"e0694721-20aa-4bcc-82a2-4ce2beb7384d","resolution":{"observed_at":"2026-08-01T09:09:24.716271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:09:24.719792Z","title":"OmniSpatial: Towards Comprehensive Spatial Reasoning Benchmark for Vision Language Models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-15T09:32:21.039236Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.719792Z"},"links":{"citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:e202ec883ae34316882702e8a191a85e70113e0b82526ec9f45cfc02763a98e9","observation_id":"41ae75f9-3ea0-4dc3-96ab-dfaa6c831990","resolution":{"observed_at":"2026-08-01T09:09:24.719792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:09:24.722330Z","title":"MMSI-Video-Bench: A Holistic Benchmark for Video- Based Spatial Intelligence,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-15T09:32:21.039236Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.722330Z"},"links":{"citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:753ae1e505555b8b9bc655ee7f2a0ba6659c21da9c246cba26263147126970f6","observation_id":"50629123-22f8-4624-bc15-ab6f08732a88","resolution":{"observed_at":"2026-08-01T09:09:24.722330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01805","last_updated":"2025-05-21T09:38:44Z","snapshot_observed_at":"2026-08-16T19:57:59.994547Z","submitted_at":"2025-04-02T15:12:17Z","title":"SpaceR: Reinforcing MLLMs in Video Spatial Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01805","snapshot_observed_at":"2026-08-01T09:09:24.724789Z","title":"SpaceR: Reinforcing MLLMs in Video Spatial Reasoning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-15T09:32:21.039236Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.724789Z"},"links":{"cited_paper":"/paper/2504.01805","citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:b73911c14a2548d0dde946db8992f71a3282d3d131dd2e2e44927d456074ac3a","observation_id":"6f47daa6-4eac-4045-8d67-766dd6457b75","resolution":{"observed_at":"2026-08-01T09:09:24.724789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:09:24.727867Z","title":"Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-15T09:32:21.039236Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.727867Z"},"links":{"citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:eaa719d140e6d296d5bca4ed1bb056275565b7d99ac5d208da845e54a9a9fc35","observation_id":"2e2a0d0c-1278-4573-9d1d-47c318a0ba71","resolution":{"observed_at":"2026-08-01T09:09:24.727867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:09:24.730202Z","title":"Cambrian-S: Towards Spatial Supersensing in Video,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-15T09:32:21.039236Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.730202Z"},"links":{"citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:3085a15274a9582b5a56defa3636d8bb4dfa511ce8c8746bb5b07ed40d2c2671","observation_id":"681bffab-3e86-480f-b187-6841f26bc275","resolution":{"observed_at":"2026-08-01T09:09:24.730202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:09:24.733000Z","title":"From Flatland to Space: Teaching Vision-Language Models to Perceive and Reason in 3D,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-15T09:32:21.039236Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.733000Z"},"links":{"citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:6e7a0e12550b3a248b4835bcf569ea3250d2c88b609dd43793cd47a6e6950cd9","observation_id":"cbff37c7-3f65-47ca-ad89-4b8ee1f4dc27","resolution":{"observed_at":"2026-08-01T09:09:24.733000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:09:24.735966Z","title":"Thinking in Dynamics: How Multimodal Large Language Models Perceive, Track, and Reason Dynamics in Physical 4D World,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-15T09:32:21.039236Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.735966Z"},"links":{"citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:8d4b1d1ff1298a6da8bae8c97095d357028987d66a8e7644d8bdf6296d8033cc","observation_id":"c46b15c0-31fe-4bbf-8168-4f84d3b93821","resolution":{"observed_at":"2026-08-01T09:09:24.735966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:09:24.738778Z","title":"STI- Bench: Are MLLMs Ready for Precise Spatial-Temporal World Under- standing?","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-15T09:32:21.039236Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.738778Z"},"links":{"citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:838f2aa0a3af9d25cec098579067f14af61cb6c11c11165d979fe26e76cc64bf","observation_id":"e0fc3fc2-9ee6-46d0-b1ba-665cc9a35428","resolution":{"observed_at":"2026-08-01T09:09:24.738778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:09:24.741574Z","title":"OST- Bench: Evaluating the Capabilities of MLLMs in Online Spatio-temporal Scene Understanding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-15T09:32:21.039236Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.741574Z"},"links":{"citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:eb2afec28a49af730ae365131425744870551985ff84da1864a2274597e7f72b","observation_id":"e7d91ab7-bc77-41c4-9f5b-7740f17bfe69","resolution":{"observed_at":"2026-08-01T09:09:24.741574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:09:24.743929Z","title":"VideoLoom: A Video Large Language Model for Joint Spatial-Temporal Understanding,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-15T09:32:21.039236Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.743929Z"},"links":{"citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:451682bd62159cea5c9a770fde6119ab2990f71228b8abc5ea56445edfe3d4ca","observation_id":"8e438968-41c0-4e76-87c2-3143e44f20e1","resolution":{"observed_at":"2026-08-01T09:09:24.743929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:09:24.746577Z","title":"MLLM-4D: Towards Visual-based Spatial-Temporal Intelligence,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-15T09:32:21.039236Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.746577Z"},"links":{"citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:575827083aa50678eba1b7f56dfdb62173eaaa91974c5654a31149f4ef21ed9f","observation_id":"99fcb42e-2cd8-47a6-8527-7d5036bf4f43","resolution":{"observed_at":"2026-08-01T09:09:24.746577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:09:24.748874Z","title":"DSI-Bench: A Benchmark for Dynamic Spatial Intelligence,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-15T09:32:21.039236Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.748874Z"},"links":{"citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:9bfd7f6f75ec6a9a439367a64afd71165ffc29263de841c4bf6497ced5029503","observation_id":"632c029d-ae40-4b0a-9287-5be632dd2d34","resolution":{"observed_at":"2026-08-01T09:09:24.748874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:09:24.751284Z","title":"Learning to Reason in 4D: Dynamic Spatial Understanding for Vision Language Models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-15T09:32:21.039236Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.751284Z"},"links":{"citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:853ad5b7c95c5b2abd2bf53687e0a22892bdd08b327b73af6fb5de57db5b6d37","observation_id":"4f25c53d-8930-4d28-90c6-36fd72a12aaa","resolution":{"observed_at":"2026-08-01T09:09:24.751284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:09:24.753671Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-15T09:32:21.039236Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.753671Z"},"links":{"citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:96e4d04c752ad626a60c9b2a0d3523b7ba9ec99c305d8a44c25e55493735338f","observation_id":"23a937fd-b478-45b6-9168-acefdddd79b4","resolution":{"observed_at":"2026-08-01T09:09:24.753671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:09:24.756395Z","title":"Ego4D: Around the World in 3,000 Hours of Egocentric Video,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-15T09:32:21.039236Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.756395Z"},"links":{"citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:05463be8cdb84a835c60b39d3e1d94a9f057880c521f776a42d5245e786859cf","observation_id":"6c921455-a00c-4eda-9ec9-2b29bf2ca76c","resolution":{"observed_at":"2026-08-01T09:09:24.756395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:09:24.759041Z","title":"ScanNet: Richly-Annotated 3D Reconstructions of Indoor Scenes,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-15T09:32:21.039236Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.759041Z"},"links":{"citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:3f1bb0d250331bf36691ec6a1ff8a4b85ffd1e6790ec746b57eb2d11296b9de2","observation_id":"d5a9cd58-b35e-4787-b9ea-d3a24d45bd36","resolution":{"observed_at":"2026-08-01T09:09:24.759041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:09:24.761354Z","title":"ScanNet++: A High- Fidelity Dataset of 3D Indoor Scenes,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-15T09:32:21.039236Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.761354Z"},"links":{"citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:6276849df64fd55f3bca1f7849c080a5389cc3e373642266079041aee3f150a6","observation_id":"dbee15b2-dffa-44e3-8b21-9ed07d5187f3","resolution":{"observed_at":"2026-08-01T09:09:24.761354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.08897","last_updated":"2022-01-12T08:19:29Z","snapshot_observed_at":"2026-07-06T12:09:19.763667Z","submitted_at":"2021-11-17T04:27:01Z","title":"ARKitScenes: A Diverse Real-World Dataset For 3D Indoor Scene Understanding Using Mobile RGB-D Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.08897","snapshot_observed_at":"2026-08-01T09:09:24.763704Z","title":"ARKitScenes: A Diverse Real- World Dataset For 3D Indoor Scene Understanding Using Mobile RGB- D Data,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-15T09:32:21.039236Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.763704Z"},"links":{"cited_paper":"/paper/2111.08897","citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:96a22b14c1a3da7369a9015360473a93611d8d639b78bac1a7e4bf33e1c203e6","observation_id":"6cc901f7-7838-409d-9765-20db563219af","resolution":{"observed_at":"2026-08-01T09:09:24.763704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:09:24.766167Z","title":"Scalability in Perception for Autonomous Driving: Waymo Open Dataset,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-15T09:32:21.039236Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.766167Z"},"links":{"citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:6c5b7d6e81989a0db1ab8ad3d632dad037900012ee08a6ef75ee33767233f133","observation_id":"8ced9224-8fc2-47cb-ac81-07854632bd49","resolution":{"observed_at":"2026-08-01T09:09:24.766167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:09:24.768553Z","title":"Motion-X: A Large-scale 3D Expressive Whole-body Human Motion Dataset,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-15T09:32:21.039236Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.768553Z"},"links":{"citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:44c41b4f3772cc0f20fe8d2601ce747def52fb6f6fcc1eaac69510052dc58e66","observation_id":"e4bb028a-ca57-4dee-b0d1-c42c7325a144","resolution":{"observed_at":"2026-08-01T09:09:24.768553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.03267","last_updated":"2026-05-01T23:55:43Z","snapshot_observed_at":"2026-08-15T00:17:32.875866Z","submitted_at":"2025-12-19T07:05:38Z","title":"OpenAI GPT-5 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.03267","snapshot_observed_at":"2026-08-01T09:09:24.770874Z","title":"OpenAI GPT-5 System Card,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-15T09:32:21.039236Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.770874Z"},"links":{"cited_paper":"/paper/2601.03267","citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:367d54f389d52361175d4b440bc0fe402122c9be64cce1455ea459b8e1a75ae9","observation_id":"92f9d890-4491-4575-89c3-834484b10ef8","resolution":{"observed_at":"2026-08-01T09:09:24.770874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:09:24.773584Z","title":"Google DeepMind Model Cards,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-15T09:32:21.039236Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.773584Z"},"links":{"citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:346b415263df775aa09505845c0603a127c768cdf07cb6249f4dc7cca3a051cb","observation_id":"247ccc9a-97cb-43c8-9e23-f0a745cc11c3","resolution":{"observed_at":"2026-08-01T09:09:24.773584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:09:24.776046Z","title":"Seed2.0 Model Card: Towards Intelligence Frontier for Real-World Complexity,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-15T09:32:21.039236Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.776046Z"},"links":{"citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:0e5d004dad0a0e9f16418a33661f49e78dd62a7144678d342174532ce98e43ee","observation_id":"98f70b11-33f6-48ac-a5db-a7d93346b331","resolution":{"observed_at":"2026-08-01T09:09:24.776046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:09:24.778427Z","title":"Xiaomi MiMo-V2.5: A Leap in Agency and Multimodality,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-15T09:32:21.039236Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.778427Z"},"links":{"citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:c8e596941976e7ad63a01c741303b73cb38ba912af96f9c7397aaed24084accc","observation_id":"337004c1-8c65-4208-9792-2559028c0d95","resolution":{"observed_at":"2026-08-01T09:09:24.778427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-01T09:09:24.780739Z","title":"LLaV A-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-15T09:32:21.039236Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.780739Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:225f9c6ab4fc888df5c4ac936379949834cae72da0111caa9870568c8c070f8f","observation_id":"33d380a1-a1f7-4aa6-9722-3a6bf90d670d","resolution":{"observed_at":"2026-08-01T09:09:24.780739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:09:24.783278Z","title":"Qwen3.5: Towards Native Multimodal Agents,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-15T09:32:21.039236Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.783278Z"},"links":{"citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:20c0222fd052ffefdfd050b5deb3b577191c6f78758d3035555b06d454f926ff","observation_id":"4cf4b523-2e5a-4b0e-936b-6018b2bd5414","resolution":{"observed_at":"2026-08-01T09:09:24.783278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-08-17T12:32:16.575866Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18265","snapshot_observed_at":"2026-08-01T09:09:24.785627Z","title":"InternVL3.5: Advancing Open-Source Multi- modal Models in Versatility, Reasoning, and Efficiency,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-15T09:32:21.039236Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.785627Z"},"links":{"cited_paper":"/paper/2508.18265","citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:5b44c2708da95a1514c562931da3b3c654861e9973ac70fb7f085599a1ef69c2","observation_id":"6455fee5-e63b-46c8-9063-9e292c0667d1","resolution":{"observed_at":"2026-08-01T09:09:24.785627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:09:24.788197Z","title":"GLM-4.6V: Open Source Multimodal Models with Native Multi- modal Tool Use,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-15T09:32:21.039236Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.788197Z"},"links":{"citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:45b9fe59466a493c173579dcb0d38c2e0e5db42f367e04429cc476f4c492cab4","observation_id":"5da3ae93-117f-48fa-aaf2-e6e92ac16acb","resolution":{"observed_at":"2026-08-01T09:09:24.788197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:09:24.790764Z","title":"Learning from Videos for 3D World: Enhancing MLLMs with 3D Vision Geometry Priors,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-15T09:32:21.039236Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.790764Z"},"links":{"citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:ee49020803029b4f572e1fdf81a77d4934376835af300d9bd0a01143090af867","observation_id":"5e90f630-c0bb-4991-b1e6-85310d822e28","resolution":{"observed_at":"2026-08-01T09:09:24.790764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23747","last_updated":"2026-05-19T02:23:16Z","snapshot_observed_at":"2026-08-15T23:37:18.723910Z","submitted_at":"2025-05-29T17:59:04Z","title":"Spatial-MLLM: Boosting MLLM Capabilities in Visual-based Spatial Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23747","snapshot_observed_at":"2026-08-01T09:09:24.792992Z","title":"Spatial-MLLM: Boosting MLLM Capabilities in Visual-based Spatial Intelligence,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-15T09:32:21.039236Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.792992Z"},"links":{"cited_paper":"/paper/2505.23747","citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:9bbddb62f6cd1e41581ce7b12b66643dc4b4ec64b5e7737a04034793e1f07511","observation_id":"c77c7cc0-872d-45d2-ba58-5634e812fa33","resolution":{"observed_at":"2026-08-01T09:09:24.792992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:09:24.795701Z","title":"Spatial-SSRL: Enhancing Spatial Understanding via Self- Supervised Reinforcement Learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-15T09:32:21.039236Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.795701Z"},"links":{"citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:e6258d06bb2862a3912363a099d3dae27d0bc876f80eb05ac30fe1e3858fdf24","observation_id":"4cfc4348-ae37-4563-81a8-274ba30d4094","resolution":{"observed_at":"2026-08-01T09:09:24.795701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.06037","last_updated":"2026-05-01T09:36:02Z","snapshot_observed_at":"2026-08-11T16:15:54.233875Z","submitted_at":"2026-02-05T18:59:32Z","title":"Thinking with Geometry: Active Geometry Integration for Spatial Reasoning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.06037","snapshot_observed_at":"2026-08-01T09:09:24.798206Z","title":"Thinking with Geometry: Active Geometry Integration for Spatial Reasoning,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-15T09:32:21.039236Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.798206Z"},"links":{"cited_paper":"/paper/2602.06037","citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:1282de07e19d04b7b2f76bc8b51b5368127c1aa3705f5ea8270ba219e7328af8","observation_id":"b84a6140-9ecb-4bcc-9046-4edac70496b4","resolution":{"observed_at":"2026-08-01T09:09:24.798206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:09:24.800745Z","title":"SEED-Bench: Benchmarking Multimodal Large Language Models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-15T09:32:21.039236Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.800745Z"},"links":{"citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:455fd5e8c676b54e358c29032d872c113334ec72c8f6001b871ce112bb168d88","observation_id":"03be65a3-aa7f-4204-8ec4-665c49ad8588","resolution":{"observed_at":"2026-08-01T09:09:24.800745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:09:24.803050Z","title":"MMBench: Is Your Multi-modal Model an All- around Player?","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-15T09:32:21.039236Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.803050Z"},"links":{"citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:188ca79a8c6c2476938f55b677c47d6aa1bc2bf25f5c2bbc8aa03cbdb8b0ca43","observation_id":"89616508-088f-4ae6-90f7-2d7ae391846a","resolution":{"observed_at":"2026-08-01T09:09:24.803050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:09:24.805758Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-15T09:32:21.039236Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.805758Z"},"links":{"citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:e261f8acda41cc63f3a76ce6f71d3481758ed39482f95ebcf38828e39494c729","observation_id":"6948210e-ade8-4669-bdde-8e30be83d835","resolution":{"observed_at":"2026-08-01T09:09:24.805758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:09:24.808032Z","title":"MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-15T09:32:21.039236Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.808032Z"},"links":{"citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:f41f11bcb6dcae3e281b21cf832647c6fe12baa1715bfa157e6815da5796098c","observation_id":"e166ab93-87c6-4c3b-b29e-a20fccb9a6a4","resolution":{"observed_at":"2026-08-01T09:09:24.808032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:09:24.810555Z","title":"MMBench-Video: A Long-Form Multi-Shot Benchmark for Holistic Video Understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-15T09:32:21.039236Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.810555Z"},"links":{"citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:a70da8f8072d6e9b3e29aae0c577d25e68a3277794a9f6bc9c9cb4b0125ce641","observation_id":"13d929df-7a87-4e2f-be7f-833a94d8cddd","resolution":{"observed_at":"2026-08-01T09:09:24.810555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:09:24.813414Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-15T09:32:21.039236Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.813414Z"},"links":{"citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:6f1c71b6b08d297886ab107567d6212dad93683193f8703325cb44982bae3ce6","observation_id":"fb8d6b51-583c-4c71-aee1-e45228e295bc","resolution":{"observed_at":"2026-08-01T09:09:24.813414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:09:24.816253Z","title":"MVBench: A Comprehensive Multi-modal Video Understanding Benchmark,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-15T09:32:21.039236Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.816253Z"},"links":{"citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:93315cb8e6e9ee81996f990c8ee19801167f588fa5b0fc82667103b68df7350e","observation_id":"b6d05bc6-eccd-48a7-b2a8-d7b69db06a4e","resolution":{"observed_at":"2026-08-01T09:09:24.816253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:09:24.818649Z","title":"VI- TATECS: A Diagnostic Dataset for Temporal Concept Understanding of Video-Language Models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-15T09:32:21.039236Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.818649Z"},"links":{"citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:663ddfdc9e41ca858675258bf5932d90b6ab8456f51cd76415ee1d2c0c1e6fae","observation_id":"e41dc602-b913-4dbb-9eb1-9da3df568b13","resolution":{"observed_at":"2026-08-01T09:09:24.818649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:09:24.820974Z","title":"Multi-modal Situated Reasoning in 3D Scenes,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-15T09:32:21.039236Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.820974Z"},"links":{"citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:6f7143a4dffeea56b370880399d3f6aeb4c3efa670381309a0717e4a3bdb2719","observation_id":"524bb6cc-c8cd-42aa-b39e-26b785af56bb","resolution":{"observed_at":"2026-08-01T09:09:24.820974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:09:24.823535Z","title":"TempCompass: Do Video LLMs Really Understand Videos?","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-15T09:32:21.039236Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.823535Z"},"links":{"citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:20215c7cabeaffdaefffb34401f6bb6444a90984cd692e05f37f04eb66bd106a","observation_id":"0bd3159b-4ab0-4644-8bd1-b6ce4ab685b2","resolution":{"observed_at":"2026-08-01T09:09:24.823535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:09:24.825795Z","title":"OpenEQA: Embodied Question Answering in the Era of Foundation Models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-15T09:32:21.039236Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.825795Z"},"links":{"citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:b52176b54b40956dea9ce1a02902614ae0bf127704a3e4f0d5b45895a32b6377","observation_id":"5d18da41-9fde-47ab-9a22-e8f88c443101","resolution":{"observed_at":"2026-08-01T09:09:24.825795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:09:24.828521Z","title":"EgoSchema: A Diagnostic Benchmark for Very Long-form Video Language Understanding,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-15T09:32:21.039236Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.828521Z"},"links":{"citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:46005055c3671d1875892163331b72311e9b12472c0af28fcf28671ac2443515","observation_id":"fde51b8d-79f0-4ace-81d5-51ad129d2d86","resolution":{"observed_at":"2026-08-01T09:09:24.828521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:09:24.830810Z","title":"Video-Bench: A Comprehensive Benchmark and Toolkit for Evaluating Video-based Large Language Models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-15T09:32:21.039236Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.830810Z"},"links":{"citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:4fa1c8e57da95dc1cb25baaadd5b39f49c0bff0a37b60918029653ebf47ff5da","observation_id":"e8dde046-2a09-4779-9adc-afc15e2487f4","resolution":{"observed_at":"2026-08-01T09:09:24.830810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:09:24.833173Z","title":"TOMATO: Assessing Visual Temporal Reasoning Capabili- ties in Multimodal Foundation Models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-15T09:32:21.039236Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.833173Z"},"links":{"citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:d6ba137cef9f84a24da7553392bbb159cc170ef52c94153193fac8c3e3f67dcb","observation_id":"2a345f21-38be-4288-af8b-a5b1c96cb446","resolution":{"observed_at":"2026-08-01T09:09:24.833173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:09:24.835897Z","title":"Is A Picture Worth A Thousand Words? Delving Into Spatial Reasoning for 14 Vision Language Models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-15T09:32:21.039236Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.835897Z"},"links":{"citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:52caae03e74f3ae817c4daa3a5571b4cc811a26690e32838c1bc54014d742baa","observation_id":"ff9858ce-15bf-4eb1-aa57-f8cfb0b83e54","resolution":{"observed_at":"2026-08-01T09:09:24.835897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:09:24.838563Z","title":"MM-Ego: Towards Building Egocentric Multimodal LLMs for Video QA,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-15T09:32:21.039236Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.838563Z"},"links":{"citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:7729504f537c829f54e249f9bbab07a0449aed2d402d4e1de67496bf4c6d59ec","observation_id":"6551dddb-c522-45a8-9185-daaba9d91f10","resolution":{"observed_at":"2026-08-01T09:09:24.838563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-16T04:27:36.181491Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-08-01T09:09:24.840911Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-15T09:32:21.039236Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.840911Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:462bb6c33c47b300be6e799f6649dca59fd601c01def3bd8a91e0c2ad84014bb","observation_id":"8de799c9-32c9-4146-a16d-4d1b0ec32444","resolution":{"observed_at":"2026-08-01T09:09:24.840911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-08-18T11:56:50.710310Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-01T09:09:24.843366Z","title":"LLaV A-OneVision: Easy Visual Task Transfer,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-15T09:32:21.039236Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.843366Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:f965ab7c2c58822063fcbe0318ca2b42dae20be15d313163c6431ea77364be8c","observation_id":"39dce1a1-745c-4a50-b46d-6c43222b2287","resolution":{"observed_at":"2026-08-01T09:09:24.843366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:09:24.845806Z","title":"VILA: On Pre-training for Visual Language Models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-15T09:32:21.039236Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.845806Z"},"links":{"citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:48809904d8b2392e3551e5fb7e1c19340649e2b6ab9b6e3b22fab5d6e66cc971","observation_id":"882ebf22-81cb-44cd-b186-957cea2eff66","resolution":{"observed_at":"2026-08-01T09:09:24.845806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-01T09:09:24.848120Z","title":"Long Context Transfer from Language to Vision,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-15T09:32:21.039236Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.848120Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:5a795ec759ab38b1d0960b8c8c35f6778c051d0a8a8dc2c21677dc426f156027","observation_id":"883af380-5307-4f7e-ab65-3a07c3726633","resolution":{"observed_at":"2026-08-01T09:09:24.848120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-19T14:11:01.412437Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-01T09:09:24.850709Z","title":"LLaV A- Video: Video Instruction Tuning With Synthetic Data,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-15T09:32:21.039236Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.850709Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:106528a16d51be8b99d3a961acb06b4b14b8cab69c65c909022dabe690fdb07e","observation_id":"9a87c986-facc-45bf-96c2-e2730d1a1934","resolution":{"observed_at":"2026-08-01T09:09:24.850709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:09:24.853411Z","title":"SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-15T09:32:21.039236Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.853411Z"},"links":{"citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:1741ba9229beacaee7bdc911d71444308f3ec35d2c461c4735083596af16fd26","observation_id":"d42219e3-3d23-455c-a964-dfce1e82254e","resolution":{"observed_at":"2026-08-01T09:09:24.853411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20279","snapshot_observed_at":"2026-08-01T09:09:24.856306Z","title":"VLM-3R: Vision-Language Models Aug- mented with Instruction-Aligned 3D Reconstruction,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-15T09:32:21.039236Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.856306Z"},"links":{"cited_paper":"/paper/2505.20279","citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:d742f8486330210b28721482f9771d93db840b3bb5425fccbd792b917ac3a930","observation_id":"b57eb1c8-c706-43c6-9117-8cb5704b1a7c","resolution":{"observed_at":"2026-08-01T09:09:24.856306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:09:24.859084Z","title":"3DRS: MLLMs Need 3D-Aware Representation Supervision for Scene Understanding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-15T09:32:21.039236Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.859084Z"},"links":{"citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:ff8d78dcc057b0d8eef8bb279a05d6a4f1a0928fcadc1119e9e586355c16086e","observation_id":"6e38d04a-b57f-4306-9cc8-c17f46773ee0","resolution":{"observed_at":"2026-08-01T09:09:24.859084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:09:24.861575Z","title":"SpatialLadder: Progressive Training for Spatial Rea- soning in Vision-Language Models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-15T09:32:21.039236Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.861575Z"},"links":{"citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:1cfa02fb6dc29627c234104a22318ae2b8f261b7e9e755ab7d7e6cc313bad24c","observation_id":"743219f6-c244-41e2-8a38-3154353896ba","resolution":{"observed_at":"2026-08-01T09:09:24.861575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.10074","last_updated":"2025-01-23T02:31:25Z","snapshot_observed_at":"2026-08-15T23:57:27.978058Z","submitted_at":"2025-01-17T09:46:27Z","title":"SpatialCoT: Advancing Spatial Reasoning through Coordinate Alignment and Chain-of-Thought for Embodied Task Planning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.10074","snapshot_observed_at":"2026-08-01T09:09:24.863958Z","title":"SpatialCoT: Advancing Spatial Reasoning through Coordinate Alignment and Chain-of-Thought for Embodied Task Planning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-15T09:32:21.039236Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.863958Z"},"links":{"cited_paper":"/paper/2501.10074","citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:e21319c8f8a9ffa0256628b771259e8637bd7582bf6a0bc6f6f75a910d895f1f","observation_id":"ddc2f67e-6117-4bc4-8b82-5fb77958e9ed","resolution":{"observed_at":"2026-08-01T09:09:24.863958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:09:24.866486Z","title":"SoFar: Language-Grounded Orientation Bridges Spatial Reasoning and Object Manipulation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-15T09:32:21.039236Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.866486Z"},"links":{"citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:b0eb46f9751497c1ef976ddc111a0c99ec47a275fba2178b87749f4982d75bbf","observation_id":"14b0b770-7908-4719-8dff-ecf4885d6455","resolution":{"observed_at":"2026-08-01T09:09:24.866486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:09:24.869265Z","title":"Visual Spatial Tuning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-15T09:32:21.039236Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.869265Z"},"links":{"citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:d896cae8623a6a18212943f930c75e10ff5e0616a169034485bdd85ef3ff5f7c","observation_id":"e93bd3a3-2d60-4ff0-b19f-c9060cbf3e57","resolution":{"observed_at":"2026-08-01T09:09:24.869265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:09:24.872032Z","title":"Make Geometry Matter for Spatial Reasoning,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-15T09:32:21.039236Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.872032Z"},"links":{"citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:6308ac297fc318bf30aa0fc650bacbb818e3adf23d89dbd02a75dc3b705696c6","observation_id":"33160b22-2cbc-44e1-8997-73fbb7384a94","resolution":{"observed_at":"2026-08-01T09:09:24.872032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:09:24.874635Z","title":"Think3D: Thinking with Space for Spatial Reasoning,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-15T09:32:21.039236Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.874635Z"},"links":{"citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:6f2749dfeff46c3726142e5e1881469551b6b6c29dc0b34aaf847bddd3f29899","observation_id":"3e848a5f-55d4-489b-aa0f-50fabea23b58","resolution":{"observed_at":"2026-08-01T09:09:24.874635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18125","last_updated":"2025-04-27T06:50:23Z","snapshot_observed_at":"2026-08-16T13:15:01.097068Z","submitted_at":"2024-09-26T17:59:11Z","title":"LLaVA-3D: A Simple yet Effective Pathway to Empowering LMMs with 3D-awareness","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18125","snapshot_observed_at":"2026-08-01T09:09:24.877243Z","title":"LLaV A-3D: A Simple yet Effective Pathway to Empowering LMMs with 3D-awareness,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-15T09:32:21.039236Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.877243Z"},"links":{"cited_paper":"/paper/2409.18125","citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:0b912daa612383065e5ebf718b0774230c2aceb509d1e45bf56f51202b2a6e4e","observation_id":"8fd70c46-7875-4f27-8e60-647ad55a4dc6","resolution":{"observed_at":"2026-08-01T09:09:24.877243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:09:24.880262Z","title":"LLaV A-4D: Embedding SpatioTemporal Prompt into LMMs for 4D Scene Understanding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-15T09:32:21.039236Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.880262Z"},"links":{"citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:315ec49e6d62045e9914051cc6d0ca5b1a7d40686d8bd81d2af67d563de4084a","observation_id":"580c64bb-00ed-4e6d-ab08-d8e487189a6d","resolution":{"observed_at":"2026-08-01T09:09:24.880262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:09:24.882646Z","title":"Uni4D-LLM: A Unified SpatioTemporal-Aware VLM for 4D Understanding and Generation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-15T09:32:21.039236Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.882646Z"},"links":{"citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:3b31e12ac92264ed6910cccf5aabff98cbf61456b7931fe08ed25dee9251a8d7","observation_id":"bb0b883b-ef1c-4982-a3ad-26960e6d9e7e","resolution":{"observed_at":"2026-08-01T09:09:24.882646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:09:24.885007Z","title":"Intern-S1: A Scientific Multimodal Foundation Model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-15T09:32:21.039236Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.885007Z"},"links":{"citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:9cc1221434ce66ad1a9e880a27e070fef1f638e45fc4519f5b9a8f915ac5fb0a","observation_id":"280bde41-c338-4562-a0c0-b2dcfa96dfbf","resolution":{"observed_at":"2026-08-01T09:09:24.885007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:09:24.887384Z","title":"Intern-S1-Pro: Sci- entific Multimodal Foundation Model at Trillion Scale,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-15T09:32:21.039236Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.887384Z"},"links":{"citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:5fefd38bb0e6c9ec24a06a94d19a1956c94046e76f03a7259e193811196759d3","observation_id":"9a91b1af-aaaa-408e-9f59-3c47bbe65175","resolution":{"observed_at":"2026-08-01T09:09:24.887384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:09:24.889889Z","title":"Large Language Models are Zero-Shot Reasoners,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-15T09:32:21.039236Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.889889Z"},"links":{"citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:394e945f153e947335e27a81b5c232055185be03aa18add5925f4ed80e36b193","observation_id":"0c89f018-dcca-4964-a10f-5587d10da16c","resolution":{"observed_at":"2026-08-01T09:09:24.889889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-08-16T01:49:22.176843Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-01T09:09:24.892212Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-15T09:32:21.039236Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.892212Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:a48877d58e8cfec554834b7e76082d4e4baf7e92f5ba9798f4f5bc4ac1d530f9","observation_id":"587cae99-1559-4369-96cb-9b89e10aceaa","resolution":{"observed_at":"2026-08-01T09:09:24.892212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:09:24.894758Z","title":"Plan-and-Solve Prompting: Improving Zero-Shot Chain-of- Thought Reasoning by Large Language Models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-15T09:32:21.039236Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.894758Z"},"links":{"citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:b9e34e35b0c9a75c98a752c191b581834ca6e649414b5438c65a8e3202061e68","observation_id":"3c507d2f-5628-4032-8526-de369a708b92","resolution":{"observed_at":"2026-08-01T09:09:24.894758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.15195","last_updated":"2026-05-14T17:59:51Z","snapshot_observed_at":"2026-08-14T11:50:52.930098Z","submitted_at":"2026-05-14T17:59:51Z","title":"VGGT-$\\Omega$","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.15195","snapshot_observed_at":"2026-08-01T09:09:24.897251Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-15T09:32:21.039236Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.897251Z"},"links":{"cited_paper":"/paper/2605.15195","citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:fbbf09e6a445ff2a796027be308076a15596ddb0571ffc46f4b36251edf84cc6","observation_id":"1b23c6ca-48b5-4ef3-9cc8-b2fafe368bfb","resolution":{"observed_at":"2026-08-01T09:09:24.897251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:09:24.900080Z","title":"W AFT: Warping-Alone Field Transforms for Optical Flow,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-15T09:32:21.039236Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.900080Z"},"links":{"citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:7a56e3a085109b8cc5634d28a0e4a08aa43a196bbac2581507f89bfeceba0b6e","observation_id":"c94e877c-cabd-403b-8e2a-0c82c5592813","resolution":{"observed_at":"2026-08-01T09:09:24.900080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:09:24.902395Z","title":"Don’t Show Pixels, Show Cues: Unlocking Visual Tool Reasoning in Language Models via Perception Programs,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-15T09:32:21.039236Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.902395Z"},"links":{"citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:e776f3ede6363ba03054c1ba16df6fe63e4bf388d1429a305ca38eadc8bed428","observation_id":"598cb3f3-053b-4e6d-be57-2e196cb507a1","resolution":{"observed_at":"2026-08-01T09:09:24.902395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:09:24.905094Z","title":"Expressive Body Capture: 3D Hands, Face, and Body From a Single Image,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-15T09:32:21.039236Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.905094Z"},"links":{"citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:96fac4c81f2c87257acef11a0945d2189a47fd72bb74ed807a5805e55e82da41","observation_id":"a120e0d9-4958-4b31-aeb2-b0ab30f7dd23","resolution":{"observed_at":"2026-08-01T09:09:24.905094Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T09:32:21.039236Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?"},"reference_resolution":{"displayed":93,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":92,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":93},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 93 of 93 outbound references and 0 inbound Pith citation observations for arXiv:2607.20868."}