{"as_of":"2026-08-09T20:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:adec3e4bc2eefc90da3fc56af994f28e2cd6a6f3372cf2a52effa31c016ebb00","coverage":[{"denominator":69,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":69,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T05:40:03.923875Z","state":"measured"},{"denominator":69,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":69,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.13305/citation-record","integrity":"/paper/2607.13305/integrity","json":"/paper/2607.13305/citation-record.json","paper":"/paper/2607.13305"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:39:57.600887Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.13305","last_updated":"2026-07-14T22:15:50Z","snapshot_observed_at":"2026-08-04T07:12:56.462277Z","submitted_at":"2026-07-14T22:15:50Z","title":"Accuracy Without Grounding: Diagnosing Visual Dependency Dissociation in Video LLM Benchmarks","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T05:39:57.600887Z"},"links":{"citing_paper":"/paper/2607.13305"},"observation_digest":"sha256:2bbae5115cf12e209f0b18c3efa9e3241c587af31433221af63878f81ac669bd","observation_id":"8c4c2e9f-b061-4578-8d7e-a8d72d7a2c43","resolution":{"observed_at":"2026-08-02T05:39:57.600887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:39:57.713094Z","title":"Lawrence Zitnick, and Devi Parikh","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.13305","last_updated":"2026-07-14T22:15:50Z","snapshot_observed_at":"2026-08-04T07:12:56.462277Z","submitted_at":"2026-07-14T22:15:50Z","title":"Accuracy Without Grounding: Diagnosing Visual Dependency Dissociation in Video LLM Benchmarks","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T05:39:57.713094Z"},"links":{"citing_paper":"/paper/2607.13305"},"observation_digest":"sha256:d1167b77415ada3df2f2ae19ab3f7323f7d1eac37347a4691dcd9fdd1ae2a563","observation_id":"fce505ba-bda7-4249-9f3e-e6de1e8d9eb2","resolution":{"observed_at":"2026-08-02T05:39:57.713094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-02T05:39:57.826858Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13305","last_updated":"2026-07-14T22:15:50Z","snapshot_observed_at":"2026-08-04T07:12:56.462277Z","submitted_at":"2026-07-14T22:15:50Z","title":"Accuracy Without Grounding: Diagnosing Visual Dependency Dissociation in Video LLM Benchmarks","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T05:39:57.826858Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2607.13305"},"observation_digest":"sha256:87a6efb019f6b7757d129beaa67233436d5ab6297ad5adb036c6a26310ae891a","observation_id":"52e57a86-9e46-405d-ba97-f4649cae4a02","resolution":{"observed_at":"2026-08-02T05:39:57.826858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:39:57.930362Z","title":"Bowman and George E","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.13305","last_updated":"2026-07-14T22:15:50Z","snapshot_observed_at":"2026-08-04T07:12:56.462277Z","submitted_at":"2026-07-14T22:15:50Z","title":"Accuracy Without Grounding: Diagnosing Visual Dependency Dissociation in Video LLM Benchmarks","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T05:39:57.930362Z"},"links":{"citing_paper":"/paper/2607.13305"},"observation_digest":"sha256:4998e8ab7cd45300c0fa7c3848ccff2159e8904468cb5c27baf6c432bb5591d5","observation_id":"810af2aa-da19-4e03-930b-7ff3c28f372e","resolution":{"observed_at":"2026-08-02T05:39:57.930362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:39:58.057200Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13305","last_updated":"2026-07-14T22:15:50Z","snapshot_observed_at":"2026-08-04T07:12:56.462277Z","submitted_at":"2026-07-14T22:15:50Z","title":"Accuracy Without Grounding: Diagnosing Visual Dependency Dissociation in Video LLM Benchmarks","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T05:39:58.057200Z"},"links":{"citing_paper":"/paper/2607.13305"},"observation_digest":"sha256:f78e9bfea04b2ba5dc7033fabd2ab8c960c6bcab2abb5d8ec5719cbd82d4b3b6","observation_id":"d3d894c7-68cc-4992-bf91-8b391df8a77a","resolution":{"observed_at":"2026-08-02T05:39:58.057200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:39:58.129096Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.13305","last_updated":"2026-07-14T22:15:50Z","snapshot_observed_at":"2026-08-04T07:12:56.462277Z","submitted_at":"2026-07-14T22:15:50Z","title":"Accuracy Without Grounding: Diagnosing Visual Dependency Dissociation in Video LLM Benchmarks","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T05:39:58.129096Z"},"links":{"citing_paper":"/paper/2607.13305"},"observation_digest":"sha256:5c1aac41126c669357be62158190eb38ecdf8cbc8ebec0d6a9bfd040076c8de8","observation_id":"22587a3d-5d00-4df4-b855-0de76ecc29f8","resolution":{"observed_at":"2026-08-02T05:39:58.129096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:39:58.193710Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13305","last_updated":"2026-07-14T22:15:50Z","snapshot_observed_at":"2026-08-04T07:12:56.462277Z","submitted_at":"2026-07-14T22:15:50Z","title":"Accuracy Without Grounding: Diagnosing Visual Dependency Dissociation in Video LLM Benchmarks","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T05:39:58.193710Z"},"links":{"citing_paper":"/paper/2607.13305"},"observation_digest":"sha256:b475c3c975bf10d037cba86a8f7d9d3c60744efd935fd64c20f371e10a4be4bb","observation_id":"1a7021da-5e1e-45d4-ba1a-f250f612f740","resolution":{"observed_at":"2026-08-02T05:39:58.193710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-02T05:39:58.304521Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13305","last_updated":"2026-07-14T22:15:50Z","snapshot_observed_at":"2026-08-04T07:12:56.462277Z","submitted_at":"2026-07-14T22:15:50Z","title":"Accuracy Without Grounding: Diagnosing Visual Dependency Dissociation in Video LLM Benchmarks","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T05:39:58.304521Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2607.13305"},"observation_digest":"sha256:4df300a7fb2abb7acf2f1fbfdeb35275618e0e77e929fac2c130ae44317f22e4","observation_id":"112579b2-942d-46f2-af87-a0f902eed5f7","resolution":{"observed_at":"2026-08-02T05:39:58.304521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-02T05:39:58.422262Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13305","last_updated":"2026-07-14T22:15:50Z","snapshot_observed_at":"2026-08-04T07:12:56.462277Z","submitted_at":"2026-07-14T22:15:50Z","title":"Accuracy Without Grounding: Diagnosing Visual Dependency Dissociation in Video LLM Benchmarks","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T05:39:58.422262Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2607.13305"},"observation_digest":"sha256:d6ae692fb929ef95e4a3c17e184a76267f0938b79b6ae122ff787d9ee4d4ce12","observation_id":"093ffb2b-c3d0-4597-96f8-9bc390d442ba","resolution":{"observed_at":"2026-08-02T05:39:58.422262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07752","last_updated":"2025-03-25T09:46:02Z","snapshot_observed_at":"2026-08-05T14:33:12.627325Z","submitted_at":"2024-10-10T09:28:36Z","title":"Lost in Time: A New Temporal Benchmark for VideoLLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07752","snapshot_observed_at":"2026-08-02T05:39:58.511387Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13305","last_updated":"2026-07-14T22:15:50Z","snapshot_observed_at":"2026-08-04T07:12:56.462277Z","submitted_at":"2026-07-14T22:15:50Z","title":"Accuracy Without Grounding: Diagnosing Visual Dependency Dissociation in Video LLM Benchmarks","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T05:39:58.511387Z"},"links":{"cited_paper":"/paper/2410.07752","citing_paper":"/paper/2607.13305"},"observation_digest":"sha256:30c3fe4fe6c9b90740559b79467c1bd61d510886b8c845b9431fa9aaaeec0a34","observation_id":"9bddb493-8b2a-4d5b-9e5e-2f5ace7445cc","resolution":{"observed_at":"2026-08-02T05:39:58.511387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:39:58.668854Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13305","last_updated":"2026-07-14T22:15:50Z","snapshot_observed_at":"2026-08-04T07:12:56.462277Z","submitted_at":"2026-07-14T22:15:50Z","title":"Accuracy Without Grounding: Diagnosing Visual Dependency Dissociation in Video LLM Benchmarks","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T05:39:58.668854Z"},"links":{"citing_paper":"/paper/2607.13305"},"observation_digest":"sha256:38ad9c4136112dc5ea878f9807bcd7cf624b954a142b4bbfb40488264dd17804","observation_id":"0495a180-45d9-416f-a903-5c2a9998ac52","resolution":{"observed_at":"2026-08-02T05:39:58.668854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:39:58.763016Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.13305","last_updated":"2026-07-14T22:15:50Z","snapshot_observed_at":"2026-08-04T07:12:56.462277Z","submitted_at":"2026-07-14T22:15:50Z","title":"Accuracy Without Grounding: Diagnosing Visual Dependency Dissociation in Video LLM Benchmarks","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T05:39:58.763016Z"},"links":{"citing_paper":"/paper/2607.13305"},"observation_digest":"sha256:8f533a743ba8f3b1db227cc07c36e583c3945b5f09c5564130043cdb30e61f57","observation_id":"c97d7898-632f-4fdf-8c82-c1cf100cd3d7","resolution":{"observed_at":"2026-08-02T05:39:58.763016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:39:58.882828Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.13305","last_updated":"2026-07-14T22:15:50Z","snapshot_observed_at":"2026-08-04T07:12:56.462277Z","submitted_at":"2026-07-14T22:15:50Z","title":"Accuracy Without Grounding: Diagnosing Visual Dependency Dissociation in Video LLM Benchmarks","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T05:39:58.882828Z"},"links":{"citing_paper":"/paper/2607.13305"},"observation_digest":"sha256:d42b302a041df17ca61e7a62d05dbb8798cc3d671bbd9beea9d2668e8687d15c","observation_id":"9e6181f3-cdba-432d-a3a8-c08d9fa17a02","resolution":{"observed_at":"2026-08-02T05:39:58.882828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:39:58.991292Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.13305","last_updated":"2026-07-14T22:15:50Z","snapshot_observed_at":"2026-08-04T07:12:56.462277Z","submitted_at":"2026-07-14T22:15:50Z","title":"Accuracy Without Grounding: Diagnosing Visual Dependency Dissociation in Video LLM Benchmarks","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T05:39:58.991292Z"},"links":{"citing_paper":"/paper/2607.13305"},"observation_digest":"sha256:d0dc201d1615109bb937a3ef22246d7202a9eb8a3c68900f426e7946f6a84c88","observation_id":"395338e2-7ed2-47ed-9277-3b18dcb1de4c","resolution":{"observed_at":"2026-08-02T05:39:58.991292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:39:59.134362Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13305","last_updated":"2026-07-14T22:15:50Z","snapshot_observed_at":"2026-08-04T07:12:56.462277Z","submitted_at":"2026-07-14T22:15:50Z","title":"Accuracy Without Grounding: Diagnosing Visual Dependency Dissociation in Video LLM Benchmarks","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T05:39:59.134362Z"},"links":{"citing_paper":"/paper/2607.13305"},"observation_digest":"sha256:2abd2719084c952ef225793ce7fcf3ab6abb00ec9396964fa5298cda65756548","observation_id":"cf1d9a7f-f21d-44bb-8336-92b7259a7360","resolution":{"observed_at":"2026-08-02T05:39:59.134362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:39:59.247071Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.13305","last_updated":"2026-07-14T22:15:50Z","snapshot_observed_at":"2026-08-04T07:12:56.462277Z","submitted_at":"2026-07-14T22:15:50Z","title":"Accuracy Without Grounding: Diagnosing Visual Dependency Dissociation in Video LLM Benchmarks","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T05:39:59.247071Z"},"links":{"citing_paper":"/paper/2607.13305"},"observation_digest":"sha256:ad4d7f65f6a7242a34643df1c7f5ab5a5b4eb5909248790c470ca6d2538a138e","observation_id":"82806010-9264-43ae-a3da-ba2e3ed27cdc","resolution":{"observed_at":"2026-08-02T05:39:59.247071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-02T05:39:59.334933Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13305","last_updated":"2026-07-14T22:15:50Z","snapshot_observed_at":"2026-08-04T07:12:56.462277Z","submitted_at":"2026-07-14T22:15:50Z","title":"Accuracy Without Grounding: Diagnosing Visual Dependency Dissociation in Video LLM Benchmarks","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T05:39:59.334933Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2607.13305"},"observation_digest":"sha256:b1e1c772606cffe476543867beb427906f37a4fc97640750f9e361af7dc6b5ed","observation_id":"3439c299-eec7-4a47-ad8c-04e3332b9f17","resolution":{"observed_at":"2026-08-02T05:39:59.334933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:39:59.418390Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13305","last_updated":"2026-07-14T22:15:50Z","snapshot_observed_at":"2026-08-04T07:12:56.462277Z","submitted_at":"2026-07-14T22:15:50Z","title":"Accuracy Without Grounding: Diagnosing Visual Dependency Dissociation in Video LLM Benchmarks","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T05:39:59.418390Z"},"links":{"citing_paper":"/paper/2607.13305"},"observation_digest":"sha256:98b90c74490d504241bd813f549e01f53a741da278ad4709aa1faabe2ac405cd","observation_id":"56399d64-e249-444e-8446-50a6b8901f5e","resolution":{"observed_at":"2026-08-02T05:39:59.418390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:39:59.498182Z","title":"Zemel, Wieland Brendel, Matthias Bethge, and Felix A","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.13305","last_updated":"2026-07-14T22:15:50Z","snapshot_observed_at":"2026-08-04T07:12:56.462277Z","submitted_at":"2026-07-14T22:15:50Z","title":"Accuracy Without Grounding: Diagnosing Visual Dependency Dissociation in Video LLM Benchmarks","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T05:39:59.498182Z"},"links":{"citing_paper":"/paper/2607.13305"},"observation_digest":"sha256:aa08497bc5e44d7d161bb55af399b6383b6721c81b0583e4d0ac203c5d3981d9","observation_id":"cf446f78-da09-4646-8c5c-8981b22052e1","resolution":{"observed_at":"2026-08-02T05:39:59.498182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:39:59.548688Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13305","last_updated":"2026-07-14T22:15:50Z","snapshot_observed_at":"2026-08-04T07:12:56.462277Z","submitted_at":"2026-07-14T22:15:50Z","title":"Accuracy Without Grounding: Diagnosing Visual Dependency Dissociation in Video LLM Benchmarks","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T05:39:59.548688Z"},"links":{"citing_paper":"/paper/2607.13305"},"observation_digest":"sha256:e24b9d54aa932e00eff6d338343301fd3476a809fd5b85a48fb09705507a4487","observation_id":"e300f59b-7418-45b9-a226-fd1cf9c3a8d5","resolution":{"observed_at":"2026-08-02T05:39:59.548688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:39:59.669780Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13305","last_updated":"2026-07-14T22:15:50Z","snapshot_observed_at":"2026-08-04T07:12:56.462277Z","submitted_at":"2026-07-14T22:15:50Z","title":"Accuracy Without Grounding: Diagnosing Visual Dependency Dissociation in Video LLM Benchmarks","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T05:39:59.669780Z"},"links":{"citing_paper":"/paper/2607.13305"},"observation_digest":"sha256:3bd3cd676328ea945fb18573e006e95ac913c1eec3406bc6d98176e07342482b","observation_id":"6d7f80b4-41d2-42b0-8a6f-fe868a6ea795","resolution":{"observed_at":"2026-08-02T05:39:59.669780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:39:59.753727Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.13305","last_updated":"2026-07-14T22:15:50Z","snapshot_observed_at":"2026-08-04T07:12:56.462277Z","submitted_at":"2026-07-14T22:15:50Z","title":"Accuracy Without Grounding: Diagnosing Visual Dependency Dissociation in Video LLM Benchmarks","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T05:39:59.753727Z"},"links":{"citing_paper":"/paper/2607.13305"},"observation_digest":"sha256:16ab02fd3ede0fcb2180030c9387605a4247d489385fb283f4c6385619c32f1a","observation_id":"aa1e95f8-c2ff-4135-8747-9a455e13bfbb","resolution":{"observed_at":"2026-08-02T05:39:59.753727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:39:59.835431Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.13305","last_updated":"2026-07-14T22:15:50Z","snapshot_observed_at":"2026-08-04T07:12:56.462277Z","submitted_at":"2026-07-14T22:15:50Z","title":"Accuracy Without Grounding: Diagnosing Visual Dependency Dissociation in Video LLM Benchmarks","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T05:39:59.835431Z"},"links":{"citing_paper":"/paper/2607.13305"},"observation_digest":"sha256:e12f376f569bc06a0a024acf9d0c198b500f72b9c8f4ce0faf03ddbc00d653c8","observation_id":"e44980ea-aa32-4725-8b0d-93191be3a2da","resolution":{"observed_at":"2026-08-02T05:39:59.835431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/j.patrec.2026","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:43:29.379218Z","title":null,"venue":null,"work_id":"ce425e33-13ca-4722-a3b7-e2fba47a6281","year":2026},"citing_paper":{"arxiv_id":"2607.13305","last_updated":"2026-07-14T22:15:50Z","snapshot_observed_at":"2026-08-04T07:12:56.462277Z","submitted_at":"2026-07-14T22:15:50Z","title":"Accuracy Without Grounding: Diagnosing Visual Dependency Dissociation in Video LLM Benchmarks","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T05:39:59.918670Z"},"links":{"citing_paper":"/paper/2607.13305"},"observation_digest":"sha256:ffb5790616b9d00d9c72e1a2d4660492dbdc4a8017786e31f7dde74af013444e","observation_id":"c2d6d35d-6716-4c9f-8f78-27c0db5d3e30","resolution":{"observed_at":"2026-08-02T05:43:29.470255Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:00.005089Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13305","last_updated":"2026-07-14T22:15:50Z","snapshot_observed_at":"2026-08-04T07:12:56.462277Z","submitted_at":"2026-07-14T22:15:50Z","title":"Accuracy Without Grounding: Diagnosing Visual Dependency Dissociation in Video LLM Benchmarks","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:00.005089Z"},"links":{"citing_paper":"/paper/2607.13305"},"observation_digest":"sha256:f350617e5cda4085cc9dabe8a6bef858c04dc5ad6f5b32aec6f7f6ef0c14f24b","observation_id":"99bb3130-d109-4f80-afe0-3b4e302cd7a2","resolution":{"observed_at":"2026-08-02T05:40:00.005089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:00.058046Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13305","last_updated":"2026-07-14T22:15:50Z","snapshot_observed_at":"2026-08-04T07:12:56.462277Z","submitted_at":"2026-07-14T22:15:50Z","title":"Accuracy Without Grounding: Diagnosing Visual Dependency Dissociation in Video LLM Benchmarks","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:00.058046Z"},"links":{"citing_paper":"/paper/2607.13305"},"observation_digest":"sha256:eb50895dd9b8e73c6587a2353d1fedbe4c0dbc135231d32434951217b44cfecc","observation_id":"b0076fe8-fc2b-4eac-978a-c1200b2236ca","resolution":{"observed_at":"2026-08-02T05:40:00.058046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:00.109659Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13305","last_updated":"2026-07-14T22:15:50Z","snapshot_observed_at":"2026-08-04T07:12:56.462277Z","submitted_at":"2026-07-14T22:15:50Z","title":"Accuracy Without Grounding: Diagnosing Visual Dependency Dissociation in Video LLM Benchmarks","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:00.109659Z"},"links":{"citing_paper":"/paper/2607.13305"},"observation_digest":"sha256:a851d84fe27e4e65d1abd1b78dea029db122dfc8fa7d5cab3dc0e70c814825c6","observation_id":"d541dcf3-4c51-429d-b9ee-1c09a06bf809","resolution":{"observed_at":"2026-08-02T05:40:00.109659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-02T05:40:00.150006Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13305","last_updated":"2026-07-14T22:15:50Z","snapshot_observed_at":"2026-08-04T07:12:56.462277Z","submitted_at":"2026-07-14T22:15:50Z","title":"Accuracy Without Grounding: Diagnosing Visual Dependency Dissociation in Video LLM Benchmarks","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:00.150006Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2607.13305"},"observation_digest":"sha256:2eaa77f29c0cc4a4ca0673d8947e273e3c48f2c9b155cae24733bb2406304b5b","observation_id":"65b5f618-9f8e-466f-af8a-41dd82458b81","resolution":{"observed_at":"2026-08-02T05:40:00.150006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:00.230243Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13305","last_updated":"2026-07-14T22:15:50Z","snapshot_observed_at":"2026-08-04T07:12:56.462277Z","submitted_at":"2026-07-14T22:15:50Z","title":"Accuracy Without Grounding: Diagnosing Visual Dependency Dissociation in Video LLM Benchmarks","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:00.230243Z"},"links":{"citing_paper":"/paper/2607.13305"},"observation_digest":"sha256:ce1cd93ea02004d6cdec81d6c811e53b73f466c16a6d31ffdc4b8aec744e6caa","observation_id":"9ea4ba5e-bda6-4828-b254-b12d54737f2b","resolution":{"observed_at":"2026-08-02T05:40:00.230243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:00.319309Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13305","last_updated":"2026-07-14T22:15:50Z","snapshot_observed_at":"2026-08-04T07:12:56.462277Z","submitted_at":"2026-07-14T22:15:50Z","title":"Accuracy Without Grounding: Diagnosing Visual Dependency Dissociation in Video LLM Benchmarks","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:00.319309Z"},"links":{"citing_paper":"/paper/2607.13305"},"observation_digest":"sha256:490ff111ea9af7c03468f441e6ece96f1a4c221097c648b2a5998386b5450169","observation_id":"1dcff5cd-7e50-440c-95ab-206b2158e3ab","resolution":{"observed_at":"2026-08-02T05:40:00.319309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:00.381058Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13305","last_updated":"2026-07-14T22:15:50Z","snapshot_observed_at":"2026-08-04T07:12:56.462277Z","submitted_at":"2026-07-14T22:15:50Z","title":"Accuracy Without Grounding: Diagnosing Visual Dependency Dissociation in Video LLM Benchmarks","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:00.381058Z"},"links":{"citing_paper":"/paper/2607.13305"},"observation_digest":"sha256:7e14d8f912b30a6d21a03fe641a61e86b334357352d18971e26957d57b59b85d","observation_id":"2bafb80f-2db4-4f26-8d43-3a7880eb2224","resolution":{"observed_at":"2026-08-02T05:40:00.381058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:00.452221Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13305","last_updated":"2026-07-14T22:15:50Z","snapshot_observed_at":"2026-08-04T07:12:56.462277Z","submitted_at":"2026-07-14T22:15:50Z","title":"Accuracy Without Grounding: Diagnosing Visual Dependency Dissociation in Video LLM Benchmarks","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:00.452221Z"},"links":{"citing_paper":"/paper/2607.13305"},"observation_digest":"sha256:1bcd2fa9cbf435df9c0f52ecd7e8550579b74f676dd666e16db279352f2768f2","observation_id":"1065a48a-0c82-4973-b6a6-5f81e9a8c21a","resolution":{"observed_at":"2026-08-02T05:40:00.452221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:00.507434Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13305","last_updated":"2026-07-14T22:15:50Z","snapshot_observed_at":"2026-08-04T07:12:56.462277Z","submitted_at":"2026-07-14T22:15:50Z","title":"Accuracy Without Grounding: Diagnosing Visual Dependency Dissociation in Video LLM Benchmarks","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:00.507434Z"},"links":{"citing_paper":"/paper/2607.13305"},"observation_digest":"sha256:fee8e51febc4011d01b5882a739afa0d0a91010d4f03350db150295f67e0d678","observation_id":"04ab5978-e38a-4679-9454-2e2465f62a16","resolution":{"observed_at":"2026-08-02T05:40:00.507434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:00.647370Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13305","last_updated":"2026-07-14T22:15:50Z","snapshot_observed_at":"2026-08-04T07:12:56.462277Z","submitted_at":"2026-07-14T22:15:50Z","title":"Accuracy Without Grounding: Diagnosing Visual Dependency Dissociation in Video LLM Benchmarks","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:00.647370Z"},"links":{"citing_paper":"/paper/2607.13305"},"observation_digest":"sha256:ab77ded16400bc15438bed2dcbf6a727af092357957c8fad6c7c0bdf2c4820d0","observation_id":"0b6c29a4-879a-4de9-a7a9-fb049958f43e","resolution":{"observed_at":"2026-08-02T05:40:00.647370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06928","last_updated":"2025-06-07T21:32:19Z","snapshot_observed_at":"2026-08-07T05:43:53.719506Z","submitted_at":"2025-06-07T21:32:19Z","title":"How Important are Videos for Training Video LLMs?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.06928","snapshot_observed_at":"2026-08-02T05:40:00.723218Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13305","last_updated":"2026-07-14T22:15:50Z","snapshot_observed_at":"2026-08-04T07:12:56.462277Z","submitted_at":"2026-07-14T22:15:50Z","title":"Accuracy Without Grounding: Diagnosing Visual Dependency Dissociation in Video LLM Benchmarks","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:00.723218Z"},"links":{"cited_paper":"/paper/2506.06928","citing_paper":"/paper/2607.13305"},"observation_digest":"sha256:fb3d6d95b4624b38865c24cedf259b0f626b47f6239be6e54bed7ce251f0baf7","observation_id":"8c7647d5-6f3e-4110-8c64-34e90ee76aa9","resolution":{"observed_at":"2026-08-02T05:40:00.723218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:00.807346Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13305","last_updated":"2026-07-14T22:15:50Z","snapshot_observed_at":"2026-08-04T07:12:56.462277Z","submitted_at":"2026-07-14T22:15:50Z","title":"Accuracy Without Grounding: Diagnosing Visual Dependency Dissociation in Video LLM Benchmarks","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:00.807346Z"},"links":{"citing_paper":"/paper/2607.13305"},"observation_digest":"sha256:ce522c36cdec1a69fcf8e27834b2a594fc70e45c4d373ffbbca1bb9e27c5cd43","observation_id":"7cae9831-bfc6-448f-897c-949d2d72c06a","resolution":{"observed_at":"2026-08-02T05:40:00.807346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:00.998318Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13305","last_updated":"2026-07-14T22:15:50Z","snapshot_observed_at":"2026-08-04T07:12:56.462277Z","submitted_at":"2026-07-14T22:15:50Z","title":"Accuracy Without Grounding: Diagnosing Visual Dependency Dissociation in Video LLM Benchmarks","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:00.998318Z"},"links":{"citing_paper":"/paper/2607.13305"},"observation_digest":"sha256:984e31519e48bc5635a477e84b5728b90eb4e96f0ea975caed3ca7888679529c","observation_id":"819148cc-a913-494b-a1b6-3d882d194dc3","resolution":{"observed_at":"2026-08-02T05:40:00.998318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:01.066077Z","title":null,"venue":null,"work_id":null,"year":1947},"citing_paper":{"arxiv_id":"2607.13305","last_updated":"2026-07-14T22:15:50Z","snapshot_observed_at":"2026-08-04T07:12:56.462277Z","submitted_at":"2026-07-14T22:15:50Z","title":"Accuracy Without Grounding: Diagnosing Visual Dependency Dissociation in Video LLM Benchmarks","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:01.066077Z"},"links":{"citing_paper":"/paper/2607.13305"},"observation_digest":"sha256:bbc1b6bd6dfa1170a010d30b630fdd1f869a96c4f301b0522da81d4f082f05f5","observation_id":"c1780559-5c42-46bb-b12e-bc9b44544759","resolution":{"observed_at":"2026-08-02T05:40:01.066077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:00.891541Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13305","last_updated":"2026-07-14T22:15:50Z","snapshot_observed_at":"2026-08-04T07:12:56.462277Z","submitted_at":"2026-07-14T22:15:50Z","title":"Accuracy Without Grounding: Diagnosing Visual Dependency Dissociation in Video LLM Benchmarks","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:00.891541Z"},"links":{"citing_paper":"/paper/2607.13305"},"observation_digest":"sha256:0317eb3eb4043efeb52a2e56c76db5b4e51eda292960f54ec8ccbd32f36118a0","observation_id":"bb4df676-725d-4b28-8606-092d7bf326cf","resolution":{"observed_at":"2026-08-02T05:40:00.891541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:01.269690Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.13305","last_updated":"2026-07-14T22:15:50Z","snapshot_observed_at":"2026-08-04T07:12:56.462277Z","submitted_at":"2026-07-14T22:15:50Z","title":"Accuracy Without Grounding: Diagnosing Visual Dependency Dissociation in Video LLM Benchmarks","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:01.269690Z"},"links":{"citing_paper":"/paper/2607.13305"},"observation_digest":"sha256:37a6e9488c156821d772abe33ed608660d19a1eeff59699df2e0dbb978f868b5","observation_id":"0544386b-8a72-483d-9540-b2824ca9aefe","resolution":{"observed_at":"2026-08-02T05:40:01.269690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-02T05:40:01.346008Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13305","last_updated":"2026-07-14T22:15:50Z","snapshot_observed_at":"2026-08-04T07:12:56.462277Z","submitted_at":"2026-07-14T22:15:50Z","title":"Accuracy Without Grounding: Diagnosing Visual Dependency Dissociation in Video LLM Benchmarks","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:01.346008Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2607.13305"},"observation_digest":"sha256:fc9edc564e0146e00aacdf1469d8d9093786f7da83c4a0b9fe0687600f732310","observation_id":"39e74f2a-4952-4558-b301-7f2e01cafde1","resolution":{"observed_at":"2026-08-02T05:40:01.346008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:01.133624Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13305","last_updated":"2026-07-14T22:15:50Z","snapshot_observed_at":"2026-08-04T07:12:56.462277Z","submitted_at":"2026-07-14T22:15:50Z","title":"Accuracy Without Grounding: Diagnosing Visual Dependency Dissociation in Video LLM Benchmarks","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:01.133624Z"},"links":{"citing_paper":"/paper/2607.13305"},"observation_digest":"sha256:fc60781125ec77791138e9013012239861509ac047de0a3001ee9f9ddec92ce3","observation_id":"a44c91d4-b6b8-4113-8516-c9ec91cf8dd3","resolution":{"observed_at":"2026-08-02T05:40:01.133624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:01.217943Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13305","last_updated":"2026-07-14T22:15:50Z","snapshot_observed_at":"2026-08-04T07:12:56.462277Z","submitted_at":"2026-07-14T22:15:50Z","title":"Accuracy Without Grounding: Diagnosing Visual Dependency Dissociation in Video LLM Benchmarks","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:01.217943Z"},"links":{"citing_paper":"/paper/2607.13305"},"observation_digest":"sha256:934d76d0794a7945d93b4cbe77e0015985e7dade35a586bc264979dbff0af5eb","observation_id":"0ed675fe-c90f-449c-af0d-f1ead29cebc8","resolution":{"observed_at":"2026-08-02T05:40:01.217943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:01.540575Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.13305","last_updated":"2026-07-14T22:15:50Z","snapshot_observed_at":"2026-08-04T07:12:56.462277Z","submitted_at":"2026-07-14T22:15:50Z","title":"Accuracy Without Grounding: Diagnosing Visual Dependency Dissociation in Video LLM Benchmarks","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:01.540575Z"},"links":{"citing_paper":"/paper/2607.13305"},"observation_digest":"sha256:706fbe1ad6d42c7ab97971c7ff15f4325cebd03f2a1013f9608749bcdd368390","observation_id":"82dd2577-9562-4786-a997-ba397eaf1518","resolution":{"observed_at":"2026-08-02T05:40:01.540575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:01.611063Z","title":"Bender, Amandalynne Paullada, Emily Den- ton, and Alex Hanna","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.13305","last_updated":"2026-07-14T22:15:50Z","snapshot_observed_at":"2026-08-04T07:12:56.462277Z","submitted_at":"2026-07-14T22:15:50Z","title":"Accuracy Without Grounding: Diagnosing Visual Dependency Dissociation in Video LLM Benchmarks","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:01.611063Z"},"links":{"citing_paper":"/paper/2607.13305"},"observation_digest":"sha256:d04948a0004546fb7c37f2a0b2b2453dd2d035c84a8ea76688448c4d6479282f","observation_id":"a2c29ea9-b89c-4f2d-9a66-f9496704d13c","resolution":{"observed_at":"2026-08-02T05:40:01.611063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:01.424816Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13305","last_updated":"2026-07-14T22:15:50Z","snapshot_observed_at":"2026-08-04T07:12:56.462277Z","submitted_at":"2026-07-14T22:15:50Z","title":"Accuracy Without Grounding: Diagnosing Visual Dependency Dissociation in Video LLM Benchmarks","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:01.424816Z"},"links":{"citing_paper":"/paper/2607.13305"},"observation_digest":"sha256:98ebe7128736f2d08fbf3ed523a422faa67e2e19f2c06db5ef50742d73da5496","observation_id":"449613b5-47c3-4858-ab9c-e0f0cd4d4484","resolution":{"observed_at":"2026-08-02T05:40:01.424816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:01.488514Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13305","last_updated":"2026-07-14T22:15:50Z","snapshot_observed_at":"2026-08-04T07:12:56.462277Z","submitted_at":"2026-07-14T22:15:50Z","title":"Accuracy Without Grounding: Diagnosing Visual Dependency Dissociation in Video LLM Benchmarks","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:01.488514Z"},"links":{"citing_paper":"/paper/2607.13305"},"observation_digest":"sha256:79892bf39b6fab6392ed098a76c424e7d3d92daaf789b882603fe0c2d8f3170c","observation_id":"b0363e57-b29d-47c3-b3e3-a62d9571ac7f","resolution":{"observed_at":"2026-08-02T05:40:01.488514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:01.827702Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.13305","last_updated":"2026-07-14T22:15:50Z","snapshot_observed_at":"2026-08-04T07:12:56.462277Z","submitted_at":"2026-07-14T22:15:50Z","title":"Accuracy Without Grounding: Diagnosing Visual Dependency Dissociation in Video LLM Benchmarks","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:01.827702Z"},"links":{"citing_paper":"/paper/2607.13305"},"observation_digest":"sha256:64aae3992ef2b8cc70cf99888e764684a889be82e3256a56f6f4c81299609e92","observation_id":"dde3bc30-8241-4acc-adae-edd007469825","resolution":{"observed_at":"2026-08-02T05:40:01.827702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:01.971946Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13305","last_updated":"2026-07-14T22:15:50Z","snapshot_observed_at":"2026-08-04T07:12:56.462277Z","submitted_at":"2026-07-14T22:15:50Z","title":"Accuracy Without Grounding: Diagnosing Visual Dependency Dissociation in Video LLM Benchmarks","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:01.971946Z"},"links":{"citing_paper":"/paper/2607.13305"},"observation_digest":"sha256:afd188a523bf307a9980986333a9eb2f32cff9111ecdf8c32bd966f262bb476c","observation_id":"4ad85279-2ed8-4a15-ae59-8e95c2862043","resolution":{"observed_at":"2026-08-02T05:40:01.971946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-02T05:40:01.671958Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13305","last_updated":"2026-07-14T22:15:50Z","snapshot_observed_at":"2026-08-04T07:12:56.462277Z","submitted_at":"2026-07-14T22:15:50Z","title":"Accuracy Without Grounding: Diagnosing Visual Dependency Dissociation in Video LLM Benchmarks","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:01.671958Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2607.13305"},"observation_digest":"sha256:e2ffdb16f23446d9b36134eed0a240719fe05a3f78cd1fbcc9d6781ad8749d1f","observation_id":"95b20dc9-1c0b-4cfb-a755-8d57c6d6de43","resolution":{"observed_at":"2026-08-02T05:40:01.671958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:01.757182Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.13305","last_updated":"2026-07-14T22:15:50Z","snapshot_observed_at":"2026-08-04T07:12:56.462277Z","submitted_at":"2026-07-14T22:15:50Z","title":"Accuracy Without Grounding: Diagnosing Visual Dependency Dissociation in Video LLM Benchmarks","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:01.757182Z"},"links":{"citing_paper":"/paper/2607.13305"},"observation_digest":"sha256:e858fdbcfeed9a00c7468260003ce296af4459b09e35c22adb044c41c075b7a7","observation_id":"d843c9c9-8f47-4962-bbf3-27e1e978544a","resolution":{"observed_at":"2026-08-02T05:40:01.757182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-02T05:40:02.260554Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13305","last_updated":"2026-07-14T22:15:50Z","snapshot_observed_at":"2026-08-04T07:12:56.462277Z","submitted_at":"2026-07-14T22:15:50Z","title":"Accuracy Without Grounding: Diagnosing Visual Dependency Dissociation in Video LLM Benchmarks","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:02.260554Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2607.13305"},"observation_digest":"sha256:18b6def9a00fa4dcb567a56a459000f8d5dcf152d03a478f8e9abd7077683c01","observation_id":"190c0618-54cf-45a8-824b-a77582b19480","resolution":{"observed_at":"2026-08-02T05:40:02.260554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:02.459098Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13305","last_updated":"2026-07-14T22:15:50Z","snapshot_observed_at":"2026-08-04T07:12:56.462277Z","submitted_at":"2026-07-14T22:15:50Z","title":"Accuracy Without Grounding: Diagnosing Visual Dependency Dissociation in Video LLM Benchmarks","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:02.459098Z"},"links":{"citing_paper":"/paper/2607.13305"},"observation_digest":"sha256:4ae061cae974b50b0b893245e016e56bb70349d65c4af5de077a9dcb9005357f","observation_id":"ff13f5e3-0e5e-4ffb-8442-f6ecfb4c068c","resolution":{"observed_at":"2026-08-02T05:40:02.459098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:02.066132Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.13305","last_updated":"2026-07-14T22:15:50Z","snapshot_observed_at":"2026-08-04T07:12:56.462277Z","submitted_at":"2026-07-14T22:15:50Z","title":"Accuracy Without Grounding: Diagnosing Visual Dependency Dissociation in Video LLM Benchmarks","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:02.066132Z"},"links":{"citing_paper":"/paper/2607.13305"},"observation_digest":"sha256:14c107038af98efcea4af08c628e2a65beec60bb81cbf254074f3e44dd245321","observation_id":"d1772c9e-7341-4119-8ecd-db6dee66f878","resolution":{"observed_at":"2026-08-02T05:40:02.066132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:02.146234Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13305","last_updated":"2026-07-14T22:15:50Z","snapshot_observed_at":"2026-08-04T07:12:56.462277Z","submitted_at":"2026-07-14T22:15:50Z","title":"Accuracy Without Grounding: Diagnosing Visual Dependency Dissociation in Video LLM Benchmarks","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:02.146234Z"},"links":{"citing_paper":"/paper/2607.13305"},"observation_digest":"sha256:00a6f75f0289574cf0981c350078483777dc3ee9b50c72ed41d0bd0c27dbcb39","observation_id":"6c7e3083-f550-4542-b88c-4f9cb370bbd1","resolution":{"observed_at":"2026-08-02T05:40:02.146234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:02.795629Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.13305","last_updated":"2026-07-14T22:15:50Z","snapshot_observed_at":"2026-08-04T07:12:56.462277Z","submitted_at":"2026-07-14T22:15:50Z","title":"Accuracy Without Grounding: Diagnosing Visual Dependency Dissociation in Video LLM Benchmarks","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:02.795629Z"},"links":{"citing_paper":"/paper/2607.13305"},"observation_digest":"sha256:a7d9295de325a19a9a3a389e19bad1d0e8c4fe7d629ccde318dcd7c5c4e7a197","observation_id":"f67f2a76-7148-4a79-9ffe-84045e00b8d3","resolution":{"observed_at":"2026-08-02T05:40:02.795629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:03.019410Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13305","last_updated":"2026-07-14T22:15:50Z","snapshot_observed_at":"2026-08-04T07:12:56.462277Z","submitted_at":"2026-07-14T22:15:50Z","title":"Accuracy Without Grounding: Diagnosing Visual Dependency Dissociation in Video LLM Benchmarks","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:03.019410Z"},"links":{"citing_paper":"/paper/2607.13305"},"observation_digest":"sha256:b739bb0dc532a36fc1be29f78232aa66339e43c6330f7dabea1a786fc726d47d","observation_id":"a7aef91c-0ba7-431a-9eb1-b55ef146921f","resolution":{"observed_at":"2026-08-02T05:40:03.019410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:02.571288Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.13305","last_updated":"2026-07-14T22:15:50Z","snapshot_observed_at":"2026-08-04T07:12:56.462277Z","submitted_at":"2026-07-14T22:15:50Z","title":"Accuracy Without Grounding: Diagnosing Visual Dependency Dissociation in Video LLM Benchmarks","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:02.571288Z"},"links":{"citing_paper":"/paper/2607.13305"},"observation_digest":"sha256:cd74eb2b7c945c00d1f7438e2d4320ac88078b11f9a9f738aaa07371cc42039c","observation_id":"c60d7372-ce3b-4dd3-8f35-a488fdff2b97","resolution":{"observed_at":"2026-08-02T05:40:02.571288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:02.642953Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13305","last_updated":"2026-07-14T22:15:50Z","snapshot_observed_at":"2026-08-04T07:12:56.462277Z","submitted_at":"2026-07-14T22:15:50Z","title":"Accuracy Without Grounding: Diagnosing Visual Dependency Dissociation in Video LLM Benchmarks","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:02.642953Z"},"links":{"citing_paper":"/paper/2607.13305"},"observation_digest":"sha256:135c855bab969f898b23774faed2ecda7a6f40bc7aadf8a37241e74c0a181b35","observation_id":"494672e7-f5a8-43e8-8cfc-a06f8c32308e","resolution":{"observed_at":"2026-08-02T05:40:02.642953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:03.530021Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13305","last_updated":"2026-07-14T22:15:50Z","snapshot_observed_at":"2026-08-04T07:12:56.462277Z","submitted_at":"2026-07-14T22:15:50Z","title":"Accuracy Without Grounding: Diagnosing Visual Dependency Dissociation in Video LLM Benchmarks","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:03.530021Z"},"links":{"citing_paper":"/paper/2607.13305"},"observation_digest":"sha256:79e8ed318638570871114976090e8c5052153937b025441e3e4eb6f08e43a156","observation_id":"22a5cf77-c64a-4e89-a14d-703f6ca616d7","resolution":{"observed_at":"2026-08-02T05:40:03.530021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:03.616164Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13305","last_updated":"2026-07-14T22:15:50Z","snapshot_observed_at":"2026-08-04T07:12:56.462277Z","submitted_at":"2026-07-14T22:15:50Z","title":"Accuracy Without Grounding: Diagnosing Visual Dependency Dissociation in Video LLM Benchmarks","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:03.616164Z"},"links":{"citing_paper":"/paper/2607.13305"},"observation_digest":"sha256:2893b06fd06a51ade8861f2333e4585fd2a67e395f3907256d76108129d020d2","observation_id":"bed14ae9-295a-4354-89c0-8b0dff86def7","resolution":{"observed_at":"2026-08-02T05:40:03.616164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16994","last_updated":"2024-04-29T14:52:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T19:29:55Z","title":"PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16994","snapshot_observed_at":"2026-08-02T05:40:03.134421Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13305","last_updated":"2026-07-14T22:15:50Z","snapshot_observed_at":"2026-08-04T07:12:56.462277Z","submitted_at":"2026-07-14T22:15:50Z","title":"Accuracy Without Grounding: Diagnosing Visual Dependency Dissociation in Video LLM Benchmarks","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:03.134421Z"},"links":{"cited_paper":"/paper/2404.16994","citing_paper":"/paper/2607.13305"},"observation_digest":"sha256:d79707ca72e41a3077818fb9508758dd78a342271c64ee290fb657436fe14557","observation_id":"e3a98016-eef4-4e8d-99ad-fa6b9a702166","resolution":{"observed_at":"2026-08-02T05:40:03.134421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-02T05:40:03.297317Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13305","last_updated":"2026-07-14T22:15:50Z","snapshot_observed_at":"2026-08-04T07:12:56.462277Z","submitted_at":"2026-07-14T22:15:50Z","title":"Accuracy Without Grounding: Diagnosing Visual Dependency Dissociation in Video LLM Benchmarks","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:03.297317Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2607.13305"},"observation_digest":"sha256:9baf894bee682dc45d9b6a3b845b452a5c3a02c573c3938119d0b2d91dd6094b","observation_id":"75b6b747-2a8b-4b54-ba4f-83022b967f09","resolution":{"observed_at":"2026-08-02T05:40:03.297317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:03.417421Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.13305","last_updated":"2026-07-14T22:15:50Z","snapshot_observed_at":"2026-08-04T07:12:56.462277Z","submitted_at":"2026-07-14T22:15:50Z","title":"Accuracy Without Grounding: Diagnosing Visual Dependency Dissociation in Video LLM Benchmarks","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:03.417421Z"},"links":{"citing_paper":"/paper/2607.13305"},"observation_digest":"sha256:305f95335ab6a07944f15f314a018cf5a0b57a2215b99471c964d05a890e9385","observation_id":"8e2bfd8a-e4c3-413a-bc5d-1a747b2f930b","resolution":{"observed_at":"2026-08-02T05:40:03.417421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:03.688212Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13305","last_updated":"2026-07-14T22:15:50Z","snapshot_observed_at":"2026-08-04T07:12:56.462277Z","submitted_at":"2026-07-14T22:15:50Z","title":"Accuracy Without Grounding: Diagnosing Visual Dependency Dissociation in Video LLM Benchmarks","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:03.688212Z"},"links":{"citing_paper":"/paper/2607.13305"},"observation_digest":"sha256:a695d20e675f80f8ebbecba008454ad85688cc64fda92923d06ecec7dcd645e9","observation_id":"56255643-cefd-4e7e-91cc-121265b1fc73","resolution":{"observed_at":"2026-08-02T05:40:03.688212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-02T05:40:03.799588Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13305","last_updated":"2026-07-14T22:15:50Z","snapshot_observed_at":"2026-08-04T07:12:56.462277Z","submitted_at":"2026-07-14T22:15:50Z","title":"Accuracy Without Grounding: Diagnosing Visual Dependency Dissociation in Video LLM Benchmarks","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:03.799588Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2607.13305"},"observation_digest":"sha256:6ae22087a62776d3a1b8773cacd23ce68b3e0cf395b2e9810bd904ff35865fe1","observation_id":"c0d31383-cfea-4b77-b7a0-a88c03d30b9a","resolution":{"observed_at":"2026-08-02T05:40:03.799588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:03.923875Z","title":"pure visual core","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13305","last_updated":"2026-07-14T22:15:50Z","snapshot_observed_at":"2026-08-04T07:12:56.462277Z","submitted_at":"2026-07-14T22:15:50Z","title":"Accuracy Without Grounding: Diagnosing Visual Dependency Dissociation in Video LLM Benchmarks","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:03.923875Z"},"links":{"citing_paper":"/paper/2607.13305"},"observation_digest":"sha256:acfcc2273ca6133825f415671f33d71f726457a509a79d951209f922d003329f","observation_id":"1522bcac-020d-48fe-bea8-8818e3b48245","resolution":{"observed_at":"2026-08-02T05:40:03.923875Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:39:59.609797Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13305","last_updated":"2026-07-14T22:15:50Z","snapshot_observed_at":"2026-08-04T07:12:56.462277Z","submitted_at":"2026-07-14T22:15:50Z","title":"Accuracy Without Grounding: Diagnosing Visual Dependency Dissociation in Video LLM Benchmarks","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-02T05:39:59.609797Z"},"links":{"citing_paper":"/paper/2607.13305"},"observation_digest":"sha256:e7a3920620c754b5c882c2a527b0cc9f3f84786644c79ceb4ff47bd26a03437a","observation_id":"c5bedfdf-59e0-4e0b-ab0c-df127c06e164","resolution":{"observed_at":"2026-08-02T05:39:59.609797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:40:00.566571Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13305","last_updated":"2026-07-14T22:15:50Z","snapshot_observed_at":"2026-08-04T07:12:56.462277Z","submitted_at":"2026-07-14T22:15:50Z","title":"Accuracy Without Grounding: Diagnosing Visual Dependency Dissociation in Video LLM Benchmarks","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:00.566571Z"},"links":{"citing_paper":"/paper/2607.13305"},"observation_digest":"sha256:3e3c386546c91afdeed4b83dd802647d04bbc30dfb82c00d62b0511aeb92d0b7","observation_id":"a7f2e367-5194-4cf3-ac30-bf1c1ba47b59","resolution":{"observed_at":"2026-08-02T05:40:00.566571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.13305","last_updated":"2026-07-14T22:15:50Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-04T07:12:56.462277Z","submitted_at":"2026-07-14T22:15:50Z","title":"Accuracy Without Grounding: Diagnosing Visual Dependency Dissociation in Video LLM Benchmarks"},"reference_resolution":{"displayed":69,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":67,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":69},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 69 of 69 outbound references and 0 inbound Pith citation observations for arXiv:2607.13305."}