{"as_of":"2026-08-09T15:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:498bcfe4c7cfd47ffb58cf7f03a7924b08899891106982a7f05138355339d51b","coverage":[{"denominator":94,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":94,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T23:42:35.360123Z","state":"measured"},{"denominator":94,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":94,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.05780/citation-record","integrity":"/paper/2608.05780/integrity","json":"/paper/2608.05780/citation-record.json","paper":"/paper/2608.05780"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:34.967551Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:34.967551Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:dad62e1c4c7fb2159cfde7f6a13cf437921a8d04c8997b2e34841742e005d705","observation_id":"88193e5c-508a-4353-a368-0423a0a7db08","resolution":{"observed_at":"2026-08-07T23:42:34.967551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:34.972401Z","title":"2025 IEEE/CVF International Conference on Computer Vision (ICCV) , pages=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:34.972401Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:84a12f02f61abe42dc8ce019651da8b298b00a033ec07f7827ba0bf62b4e9d37","observation_id":"322731e2-edaa-4f28-8a97-e0626bd31fe9","resolution":{"observed_at":"2026-08-07T23:42:34.972401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:34.976757Z","title":"Proceedings of the AAAI Conference on Artificial Intelligence , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:34.976757Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:34a8c52b56c5161357c25ddf58f0f29be551f669e198003cadbb3974cd7d45cd","observation_id":"95c97b24-1dcf-4dab-98bd-8c7ddd47d332","resolution":{"observed_at":"2026-08-07T23:42:34.976757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.22540","last_updated":"2026-06-25T01:18:44Z","snapshot_observed_at":"2026-07-06T23:57:23.574340Z","submitted_at":"2026-06-21T14:54:07Z","title":"PolicyTrim: Boosting Intrinsic Policy Efficiency of Vision-Language-Action Models","version":3},"cited_work":{"arxiv_id":"2606.22540","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.22540","snapshot_observed_at":"2026-08-07T23:42:38.257805Z","title":"PolicyTrim: Boosting Intrinsic Policy Efficiency of Vision-Language-Action Models","venue":"cs.CV","work_id":"861f24e4-9efa-45d3-90ca-500ca2759535","year":2026},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:34.980982Z"},"links":{"cited_paper":"/paper/2606.22540","citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:9c558b8013d622df43205b4bccef43c7844a7a9c373c8dd55208971642b0661a","observation_id":"fe9af7a0-9666-432a-bea8-55eb0c103604","resolution":{"observed_at":"2026-08-07T23:42:38.263471Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:34.986046Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:34.986046Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:665fad0c0a313878563d02402a5a7bb2639cfe4475021911eab38be7230e81c6","observation_id":"95e3be72-963b-4e16-8dc1-e63d4aaedbf0","resolution":{"observed_at":"2026-08-07T23:42:34.986046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:34.990368Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:34.990368Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:ea48d3bec05e965ef5433b08569d7e280c23e3ece69eab11c22381b7378edeba","observation_id":"91da7fbf-cf4c-42e8-859b-57cdbc5c4565","resolution":{"observed_at":"2026-08-07T23:42:34.990368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02438","last_updated":"2025-09-10T04:22:46Z","snapshot_observed_at":"2026-08-07T16:12:02.851576Z","submitted_at":"2025-04-03T09:55:09Z","title":"Scaling Video-Language Models to 10K Frames via Hierarchical Differential Distillation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02438","snapshot_observed_at":"2026-08-07T23:42:34.994738Z","title":"arXiv preprint arXiv:2504.02438 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:34.994738Z"},"links":{"cited_paper":"/paper/2504.02438","citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:bfc09ba4cc7a1f915f542a75a3707b12861d07a4884cb70c5fc1ccd934bdafea","observation_id":"1468d980-9e42-4d3b-9c1b-9749f003a400","resolution":{"observed_at":"2026-08-07T23:42:34.994738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19225","last_updated":"2025-06-24T01:19:56Z","snapshot_observed_at":"2026-08-07T21:07:46.308380Z","submitted_at":"2025-06-24T01:19:56Z","title":"Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.19225","snapshot_observed_at":"2026-08-07T23:42:34.999140Z","title":"arXiv preprint arXiv:2506.19225 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:34.999140Z"},"links":{"cited_paper":"/paper/2506.19225","citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:aefc3753c9d51a1cb7ad7aa34df53a1a7282d7a7a73b93c947e572809805af8c","observation_id":"da832fe9-bd47-4155-84ab-af0c83ea644c","resolution":{"observed_at":"2026-08-07T23:42:34.999140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:35.003049Z","title":"arXiv preprint arXiv:2507.07966 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.003049Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:8c245b3faa0b449482c96eb170b3824309fe17e24a877869efdf9d8f22faf367","observation_id":"791ff586-6a7d-43bc-80a3-1bcf324214ed","resolution":{"observed_at":"2026-08-07T23:42:35.003049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12326","last_updated":"2025-01-21T17:48:10Z","snapshot_observed_at":"2026-07-06T20:23:58.426780Z","submitted_at":"2025-01-21T17:48:10Z","title":"UI-TARS: Pioneering Automated GUI Interaction with Native Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12326","snapshot_observed_at":"2026-08-07T23:42:35.006944Z","title":"arXiv preprint arXiv:2501.12326 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.006944Z"},"links":{"cited_paper":"/paper/2501.12326","citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:e875770c4d7ca99a125ae4a2e398b3bf56d414f616ed5b5611722207b7f61676","observation_id":"1632a862-58f5-49aa-adfd-28d2d8552ee2","resolution":{"observed_at":"2026-08-07T23:42:35.006944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T23:42:35.011144Z","title":"5-vl technical report , author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.011144Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:ccbee08208cb68596844a8dc8fb7caa52b62e4abd549d97015c92a91b6ec5c8a","observation_id":"aece37f1-91a7-455a-af84-5edb8d9f13be","resolution":{"observed_at":"2026-08-07T23:42:35.011144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:35.019850Z","title":"Journal of Visual Communication and Image Representation , volume=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.019850Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:c18d326874609e0a38feaac152de73ef478debdb1b7f416ba8d987af1f06df8d","observation_id":"5e7d020c-7a32-4010-9062-a055c58b0abf","resolution":{"observed_at":"2026-08-07T23:42:35.019850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.06733","last_updated":"2026-05-10T12:54:52Z","snapshot_observed_at":"2026-07-06T22:44:51.126114Z","submitted_at":"2026-02-06T14:28:54Z","title":"Pairwise is Not Enough: Hypergraph Neural Networks for Multi-Agent Pathfinding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.06733","snapshot_observed_at":"2026-08-07T23:42:35.024660Z","title":"arXiv preprint arXiv:2602.06733 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.024660Z"},"links":{"cited_paper":"/paper/2602.06733","citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:064d6bbc3260e05a95e61a6d73155dca9ff757a8c9b4f085c1c60055ab94e734","observation_id":"93f062a9-c40d-4f58-b11d-11d09aa7a2b2","resolution":{"observed_at":"2026-08-07T23:42:35.024660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08813","last_updated":"2024-10-21T03:08:08Z","snapshot_observed_at":"2026-08-07T17:42:30.374808Z","submitted_at":"2024-05-14T17:59:02Z","title":"CinePile: A Long Video Question Answering Dataset and Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08813","snapshot_observed_at":"2026-08-07T23:42:35.029043Z","title":"URL https://arxiv","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.029043Z"},"links":{"cited_paper":"/paper/2405.08813","citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:4052b55d15a4f5317dca50991fd982ec2791f3691db494e2f3bee2a4bc73625b","observation_id":"076c26d2-d334-4f85-ace0-5774c15b4a2e","resolution":{"observed_at":"2026-08-07T23:42:35.029043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12329","last_updated":"2025-03-16T02:56:09Z","snapshot_observed_at":"2026-08-07T17:01:14.327939Z","submitted_at":"2025-03-16T02:56:09Z","title":"CapArena: Benchmarking and Analyzing Detailed Image Captioning in the LLM Era","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12329","snapshot_observed_at":"2026-08-07T23:42:35.033889Z","title":"arXiv preprint arXiv:2503.12329 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.033889Z"},"links":{"cited_paper":"/paper/2503.12329","citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:75a27ab345042c45c4e73688f267c313efcd83a72777a275dc71fc265a6d165c","observation_id":"e6977576-efe3-4033-b901-1ae2ef49a408","resolution":{"observed_at":"2026-08-07T23:42:35.033889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16072","last_updated":"2025-04-22T17:51:41Z","snapshot_observed_at":"2026-08-07T16:00:09.944765Z","submitted_at":"2025-04-22T17:51:41Z","title":"Describe Anything: Detailed Localized Image and Video Captioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16072","snapshot_observed_at":"2026-08-07T23:42:35.038915Z","title":"arXiv preprint arXiv:2504.16072 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.038915Z"},"links":{"cited_paper":"/paper/2504.16072","citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:23c2d7fd481a808c2cc4aba9c917549a44c26e90652bfd63db3e02d93f1a5d55","observation_id":"49e25a13-f186-45c8-85a8-c1ed82e9cc6e","resolution":{"observed_at":"2026-08-07T23:42:35.038915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:35.044026Z","title":"Proceedings of the IEEE/CVF conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.044026Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:826c1b813efc31515854667cc6d2394c90c7aa624ee7b1acf7bea0d254d84b3a","observation_id":"40435e09-dda2-458e-b446-000310e5d923","resolution":{"observed_at":"2026-08-07T23:42:35.044026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:35.047867Z","title":"Proceedings of the IEEE/CVF winter conference on applications of computer vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.047867Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:1a3c24d19a5c449b5a1591e83d65ce0150cef6a7b8197b2887ad9d16fbf5c35c","observation_id":"b18ccfcd-fb5a-49d3-a109-90f2e479835f","resolution":{"observed_at":"2026-08-07T23:42:35.047867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:35.051735Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.051735Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:a853568a142b405a58eb7a68f3b018c24c2c9c56a9b4727706a3fac947ab9d4e","observation_id":"a50bf22f-14fb-4ea0-bc91-1d05444a9348","resolution":{"observed_at":"2026-08-07T23:42:35.051735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:35.055629Z","title":"arXiv e-prints , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.055629Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:e2d6cf431c79d2997b7f034f5138c6ce894d31ca1cbb0060e8b6e2db2180b1e7","observation_id":"67558f6b-def8-4ec3-9a80-11676bf87a67","resolution":{"observed_at":"2026-08-07T23:42:35.055629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:35.060058Z","title":"Proceedings of the Computer Vision and Pattern Recognition Conference , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.060058Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:11f09036f2330f17236dd7a9d8b47d81ca1293c2765e9faf8d07e5ca998794cf","observation_id":"532e0f22-be28-400e-b515-63fca5abadf7","resolution":{"observed_at":"2026-08-07T23:42:35.060058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:35.063900Z","title":"Proceedings of the IEEE/CVF International Conference on Computer Vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.063900Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:005c0e470e532741465d6a48dcb28257f1eace3f90eba1b4afe35cd8cb31af2f","observation_id":"bc3329b6-0a19-48fe-9578-f8319e3a2843","resolution":{"observed_at":"2026-08-07T23:42:35.063900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:35.067606Z","title":"arXiv preprint arXiv:2508.04369 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.067606Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:026e0cbaa9854d4ec61187d76d88a8399c883cb7989436aa2748e00ab277bc0c","observation_id":"9b1d950f-353f-427b-b794-37e0b9e0cecf","resolution":{"observed_at":"2026-08-07T23:42:35.067606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:35.071742Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.071742Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:0feaaf441d57a557ba1487931929346d1d0d8ef0a343b28fa21c73ab1ab778ba","observation_id":"577608bd-94de-4b36-a3c6-6450c71c66ed","resolution":{"observed_at":"2026-08-07T23:42:35.071742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:35.075368Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.075368Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:3eb06cda1014d14a69996ba681e94d6792575710d6d1d6e2f8cdb42ea5672f6b","observation_id":"9fc0d62d-9555-459d-94bf-0351f54c83b0","resolution":{"observed_at":"2026-08-07T23:42:35.075368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-07T23:42:35.079279Z","title":"arXiv preprint arXiv:2507.06261 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.079279Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:5e5f584beb605739fbaa861a83bd26738714f8675912636409c8902f2fa75b83","observation_id":"1df357a6-03e0-4789-a052-6628592dcd04","resolution":{"observed_at":"2026-08-07T23:42:35.079279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:35.083243Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.083243Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:e3daec1586922820d3e2214d3a618b2d500be7e25930bd6da38ac1853d2ac1cc","observation_id":"a5af1714-1c85-4d3d-8b9e-8d47f4503caf","resolution":{"observed_at":"2026-08-07T23:42:35.083243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:35.086792Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.086792Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:faa674839aa56718b8973e3a3a0c96f7c0a34da38691ba08dcf8ea20e50bc3af","observation_id":"2faaf74f-9daf-450d-a617-3a4466d330b6","resolution":{"observed_at":"2026-08-07T23:42:35.086792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-08-07T23:42:35.091644Z","title":"arXiv preprint arXiv:2408.10188 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.091644Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:2f43d8dbd6ff90d177c09e2fb3f8d38a5cb856f943963032ba0085b6a32c147c","observation_id":"5a542cce-ab43-4480-b6da-baf3ac9d6403","resolution":{"observed_at":"2026-08-07T23:42:35.091644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-07T23:42:35.096042Z","title":"arXiv preprint arXiv:2406.16852 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.096042Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:77f0469ed17e0eeeec7570d19037f972d470352006ed2c400d2541474f53ce20","observation_id":"308c53c7-5f8d-4242-8dec-85a3af4acfb3","resolution":{"observed_at":"2026-08-07T23:42:35.096042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:35.100870Z","title":"arXiv preprint arXiv:2502.05177 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.100870Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:e689537460aa59366b075ae13fab7f5aaed541bd72e3c469d2fa8e9e02a7a87f","observation_id":"1a34726a-c37f-4148-b236-4e7398ac6ccc","resolution":{"observed_at":"2026-08-07T23:42:35.100870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:35.104559Z","title":"European Conference on Computer Vision , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.104559Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:ab9e47264560b9868a0c0b7da9a9bdde55959bde2c3287a090840dc2e53dac67","observation_id":"62eb75a8-496f-4c5b-9297-5a32e09166bc","resolution":{"observed_at":"2026-08-07T23:42:35.104559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:35.108718Z","title":"Proceedings of the Computer Vision and Pattern Recognition Conference , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.108718Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:f3d03fad55e90b3283e10d5963434825eef0a223b3e60a40ca18a19cd278ea3e","observation_id":"9d0d5924-46e1-4636-bc0c-4ef0ccd7060d","resolution":{"observed_at":"2026-08-07T23:42:35.108718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21862","last_updated":"2025-06-27T02:29:58Z","snapshot_observed_at":"2026-08-09T10:29:21.701927Z","submitted_at":"2025-06-27T02:29:58Z","title":"LLaVA-Scissor: Token Compression with Semantic Connected Components for Video LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21862","snapshot_observed_at":"2026-08-07T23:42:35.112820Z","title":"arXiv preprint arXiv:2506.21862 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.112820Z"},"links":{"cited_paper":"/paper/2506.21862","citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:17ceac671937028a1960749676eeb6d125449ddd614c1f01da3126aef15e06c2","observation_id":"23615e5f-63f5-473a-ae1e-29277313f056","resolution":{"observed_at":"2026-08-07T23:42:35.112820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-06T05:58:29.182448Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-07T23:42:35.116786Z","title":"arXiv preprint arXiv:2304.07193 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.116786Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:5c6743e09cfc254aa93a59af3c2448770292f1db56c09f32cd75d5ab80124261","observation_id":"3a363538-f653-4df9-86c7-043fdc5295c8","resolution":{"observed_at":"2026-08-07T23:42:35.116786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:35.120837Z","title":"Proceedings of the Computer Vision and Pattern Recognition Conference , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.120837Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:88333874fa6bdd5313fc42758e854977a919ed3fcfc1cd454cc199e971966342","observation_id":"2528b329-713a-44be-acd8-f0ffde781769","resolution":{"observed_at":"2026-08-07T23:42:35.120837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:38.434829Z","title":"Proceedings of the Computer Vision and Pattern Recognition Conference , pages=","venue":null,"work_id":"22f49cf0-b0f5-49d3-b49b-84b3ab01e6c6","year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.125004Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:96d9e39371826d8629df58a301084f8c4af263508753539b414d62e11f13e4db","observation_id":"31af810c-b90a-453a-8506-cbaa23064c22","resolution":{"observed_at":"2026-08-07T23:42:38.438990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16994","last_updated":"2024-04-29T14:52:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T19:29:55Z","title":"PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16994","snapshot_observed_at":"2026-08-07T23:42:35.128973Z","title":"arXiv preprint arXiv:2404.16994 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.128973Z"},"links":{"cited_paper":"/paper/2404.16994","citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:5f0c2ea816fc3fa947127ffb84784b39449d9b8a21507fd295b3b69d2fc185c2","observation_id":"fc745383-719e-47c8-9c37-c19f8d4f6247","resolution":{"observed_at":"2026-08-07T23:42:35.128973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:35.133666Z","title":"arXiv preprint arXiv:2510.27280 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.133666Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:e816eb534fdd1a13646aef1ca7d42f125eb05b577ad8cbc4cc4e740e8512acf3","observation_id":"dd591fcd-b595-4d6b-8978-6099f1586b65","resolution":{"observed_at":"2026-08-07T23:42:35.133666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-06T22:07:43.493361Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.22139","snapshot_observed_at":"2026-08-07T23:42:35.137666Z","title":"arXiv preprint arXiv:2506.22139 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.137666Z"},"links":{"cited_paper":"/paper/2506.22139","citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:766487c93488e3c554126510e8e4d4b9dd9c9fd0d55ff746e0971ef5acb3448c","observation_id":"83ce1718-bef9-4d79-a24a-13456167b10f","resolution":{"observed_at":"2026-08-07T23:42:35.137666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00993","last_updated":"2025-06-01T12:49:39Z","snapshot_observed_at":"2026-08-08T18:44:33.509277Z","submitted_at":"2025-06-01T12:49:39Z","title":"FlexSelect: Flexible Token Selection for Efficient Long Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00993","snapshot_observed_at":"2026-08-07T23:42:35.141746Z","title":"arXiv preprint arXiv:2506.00993 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.141746Z"},"links":{"cited_paper":"/paper/2506.00993","citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:03fb6d9108698c01b2f4a2cc3d66db4de49d098d186a9a04bad854a7289a5eb2","observation_id":"1b80a305-06b8-4a90-b461-e9b9d104db82","resolution":{"observed_at":"2026-08-07T23:42:35.141746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:38.421671Z","title":"Proceedings of the Computer Vision and Pattern Recognition Conference , pages=","venue":null,"work_id":"c3f47fe3-4359-47fd-b8f2-c45f19e0e5dd","year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.146226Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:1c01ae463b748ac4494b4164ce879e132d7662f635022061ade86b7e671500a5","observation_id":"d680571f-867a-4a75-881e-03ebc212f6d2","resolution":{"observed_at":"2026-08-07T23:42:38.426552Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:38.409745Z","title":"Proceedings of the Computer Vision and Pattern Recognition Conference , pages=","venue":null,"work_id":"79b1c8de-6c8b-41a8-abed-92c0db18c0c4","year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.149849Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:e38ddcc559f272c4bd94d64c740052c6f7873b79a3a0f16f36fd0d18bb7f0667","observation_id":"104a7dd4-af46-47c8-989c-76bb7ba2552c","resolution":{"observed_at":"2026-08-07T23:42:38.413824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:35.154446Z","title":"arXiv preprint arXiv:2510.13891 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.154446Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:b0c64c84bb44782f65ea3a90e5b294f55f056fef9337a4124d38d3b76d07d5ef","observation_id":"9a674896-953e-4cc1-aae0-29c2ccddcae7","resolution":{"observed_at":"2026-08-07T23:42:35.154446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03226","last_updated":"2025-03-28T03:19:52Z","snapshot_observed_at":"2026-07-06T19:27:33.934338Z","submitted_at":"2024-10-04T08:26:06Z","title":"Frame-Voyager: Learning to Query Frames for Video Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03226","snapshot_observed_at":"2026-08-07T23:42:35.158387Z","title":"arXiv preprint arXiv:2410.03226 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.158387Z"},"links":{"cited_paper":"/paper/2410.03226","citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:f8a128f83a2da1ca4aec8209e99c98b4d971e59e02877a1b7cba028557ec784c","observation_id":"949b5c8a-2cf7-4ce3-a17a-63fc99fbed09","resolution":{"observed_at":"2026-08-07T23:42:35.158387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01258","last_updated":"2024-04-02T12:47:49Z","snapshot_observed_at":"2026-08-08T06:22:53.769876Z","submitted_at":"2024-04-01T17:28:16Z","title":"Direct Preference Optimization of Video Large Multimodal Models from Language Model Reward","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01258","snapshot_observed_at":"2026-08-07T23:42:35.162434Z","title":"arXiv preprint arXiv:2404.01258 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.162434Z"},"links":{"cited_paper":"/paper/2404.01258","citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:d1a7374be3e86bc97aff15c85e1ebb10dbd71219524c3b0717ac545e8deb66bd","observation_id":"b9026e97-5b11-4dc2-88ff-3fe443f527e5","resolution":{"observed_at":"2026-08-07T23:42:35.162434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T23:42:35.166581Z","title":"arXiv preprint arXiv:2503.14476 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.166581Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:a21dc1910bff1ca6f5efeb18640191b7fad3fbe5c022a4d493e8d865436d76a2","observation_id":"4ac55cbc-22b6-42bd-9fff-474e2edde272","resolution":{"observed_at":"2026-08-07T23:42:35.166581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:35.170212Z","title":"arXiv preprint arXiv:2512.11534 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.170212Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:7d5aeecff083e336ae57cdd6285553423d47fdd0f20ebcaa46af51c04000eff6","observation_id":"a341499c-793e-48c2-9e41-3b2136d50295","resolution":{"observed_at":"2026-08-07T23:42:35.170212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T23:42:35.173910Z","title":"arXiv preprint arXiv:1707.06347 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.173910Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:ce65c55401ce0e1f24c02b71add5eb0acd7ceedde2aeafa1430d1394c65bca8b","observation_id":"f24d6f3c-e584-445e-93d1-99d3b7bafd5b","resolution":{"observed_at":"2026-08-07T23:42:35.173910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:35.177728Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.177728Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:ec8ee09ce3e6820dc269d354a1037acd128f9c621ff656315c2f79b582d3df23","observation_id":"454c92c5-a9de-4550-9945-7fb52ba7f392","resolution":{"observed_at":"2026-08-07T23:42:35.177728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:35.181274Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.181274Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:81b4ec1d268e239460e28db4298a387abac9f738e105c7059b7994f8226c7b82","observation_id":"ca11859a-759c-41e5-a5f9-85d0663ace74","resolution":{"observed_at":"2026-08-07T23:42:35.181274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T23:42:35.185360Z","title":"arXiv preprint arXiv:2402.03300 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.185360Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:46693d3938e131349e2dce9104874dfec2fa1e9b8bfffa887662fc4b7aa2f14f","observation_id":"ef3320d5-b85e-4927-9168-7fd73b355b84","resolution":{"observed_at":"2026-08-07T23:42:35.185360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:35.190392Z","title":"Proceedings of the 2024 conference on empirical methods in natural language processing , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.190392Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:e2141afd7123fd0efe6790336849a3e5e566d669ee097fc1b3d33c9a6206cc60","observation_id":"9acbfab0-4321-4bc9-b2a6-ab619266c7e4","resolution":{"observed_at":"2026-08-07T23:42:35.190392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:35.195518Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.195518Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:1e1a2745f4a315175005e79c3c6e6c790de987b9a3a36d8236d770c416c7b7a3","observation_id":"0dfa2b5b-5896-496c-ba1e-69fde5afd8e0","resolution":{"observed_at":"2026-08-07T23:42:35.195518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:38.373309Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":"0d72cbf6-d32a-4ebc-8117-0d0ee20dd748","year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.199407Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:0c023edc1e2f2abc18a3e4dd0e728fa9a65675539e399ed0fd969c1a8c49738d","observation_id":"a3fbdcb7-97d9-4efe-8d32-f232731bec8c","resolution":{"observed_at":"2026-08-07T23:42:38.376340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-07T23:42:35.203009Z","title":"arXiv preprint arXiv:2406.07476 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.203009Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:061dbc3ca0651b3b53b03c7e05a1c6b2a371fe00e9397714935820e62d2f2d9b","observation_id":"b44f048c-53c6-4815-8e91-8912f439fc1a","resolution":{"observed_at":"2026-08-07T23:42:35.203009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:35.207163Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.207163Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:cda9422ea35c56a9f39d06ce302395aa66b20f6f9cd6b3bf1f964f5caac1a819","observation_id":"dce91058-7b8c-47d8-99cd-fdaad28ec38e","resolution":{"observed_at":"2026-08-07T23:42:35.207163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T23:42:35.211189Z","title":"arXiv preprint arXiv:2408.03326 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.211189Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:ac8260556b526c2078b8be6e2738e2a7a2e8b195a4838879cebcbb4dc6001d48","observation_id":"108275d8-c8cc-4622-9a7c-4a52af0a8537","resolution":{"observed_at":"2026-08-07T23:42:35.211189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14023","last_updated":"2024-08-26T05:27:14Z","snapshot_observed_at":"2026-08-07T05:22:51.503928Z","submitted_at":"2024-08-26T05:27:14Z","title":"Video-CCAM: Enhancing Video-Language Understanding with Causal Cross-Attention Masks for Short and Long Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.14023","snapshot_observed_at":"2026-08-07T23:42:35.215228Z","title":"arXiv preprint arXiv:2408.14023 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.215228Z"},"links":{"cited_paper":"/paper/2408.14023","citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:d0787ef1f95288d5062e4c7d652a32304536355e49bf7dc34056cda8dc013a7f","observation_id":"2adaf088-b632-4f60-a978-61943e5b8a5f","resolution":{"observed_at":"2026-08-07T23:42:35.215228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:35.219360Z","title":"Proceedings of the IEEE/CVF conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.219360Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:3c0676e6834ec1aad57c539bb17f2ed542ce638939b9e892d1272c58f3e1a885","observation_id":"735d3b90-9c25-467b-b563-83d0b51517eb","resolution":{"observed_at":"2026-08-07T23:42:35.219360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:38.350706Z","title":"GPT-4V(ision) system card , url=","venue":null,"work_id":"02a2fa94-1928-49ae-8b36-f0c1bf1f3c88","year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.224392Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:bb6c16cfad0bbc240f849fe03bbe7883bbcf1efe7e315edaa5d08d935f63edda","observation_id":"6ff40cdd-5706-4348-972a-deb5b3b8976f","resolution":{"observed_at":"2026-08-07T23:42:38.353966Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T23:42:35.228769Z","title":"arXiv preprint arXiv:2312.11805 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.228769Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:1085147be8a8e7424d9018596a9091774058ca296fd2f6e991cd5f2359900693","observation_id":"e7ee0b09-26c2-494a-9af5-f554f2efc499","resolution":{"observed_at":"2026-08-07T23:42:35.228769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12961","last_updated":"2025-02-27T06:09:46Z","snapshot_observed_at":"2026-07-06T19:18:17.523057Z","submitted_at":"2024-09-19T17:59:51Z","title":"Oryx MLLM: On-Demand Spatial-Temporal Understanding at Arbitrary Resolution","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12961","snapshot_observed_at":"2026-08-07T23:42:35.233288Z","title":"arXiv preprint arXiv:2409.12961 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.233288Z"},"links":{"cited_paper":"/paper/2409.12961","citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:5604f8aa91ebd6a355782a1508a67e24817fab58e4b783ef7a6807b51be5b430","observation_id":"acfb088c-807c-40ce-a2ea-8892e3ff6b96","resolution":{"observed_at":"2026-08-07T23:42:35.233288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:38.340589Z","title":"Proceedings of the Computer Vision and Pattern Recognition Conference , pages=","venue":null,"work_id":"6a5cef5a-e813-4650-b726-fa6f8eaf5a24","year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.237827Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:1b791403f5e984a7e2c3891a3bc33ed985593c2e83550dcf207d133ca4e6c3aa","observation_id":"29663a2e-d21d-4b52-8965-a6238af709bf","resolution":{"observed_at":"2026-08-07T23:42:38.343764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:38.330294Z","title":"Proceedings of the Computer Vision and Pattern Recognition Conference , pages=","venue":null,"work_id":"51be64f4-8518-48e0-b110-994b75d3c017","year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.241909Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:d2df96cde91838be03a1746b3e44e14de9321f089bea62ffd07a9b92319a6edc","observation_id":"d3ac00bb-b2ca-4bee-bfe6-89ec6ab877b7","resolution":{"observed_at":"2026-08-07T23:42:38.333721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04840","last_updated":"2024-08-13T08:10:32Z","snapshot_observed_at":"2026-07-06T18:58:39.334273Z","submitted_at":"2024-08-09T03:25:42Z","title":"mPLUG-Owl3: Towards Long Image-Sequence Understanding in Multi-Modal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04840","snapshot_observed_at":"2026-08-07T23:42:35.246208Z","title":"arXiv preprint arXiv:2408.04840 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.246208Z"},"links":{"cited_paper":"/paper/2408.04840","citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:c83b1430fc0e725bf670f1cfb418b763e1ebcad428fac716270a3e076f6ddee8","observation_id":"1b31cd46-dfdf-4aac-94d0-baf39675fb3c","resolution":{"observed_at":"2026-08-07T23:42:35.246208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T23:42:35.250414Z","title":"arXiv preprint arXiv:2412.05271 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.250414Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:0a4ec8aa46e32d11071c9c50234f9a8e3ec4f881d2659352d01a9a1f5ee42de7","observation_id":"4b778ed7-8140-41ab-a1f1-b6e80088b44b","resolution":{"observed_at":"2026-08-07T23:42:35.250414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17434","last_updated":"2024-10-22T21:21:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-22T21:21:37Z","title":"LongVU: Spatiotemporal Adaptive Compression for Long Video-Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17434","snapshot_observed_at":"2026-08-07T23:42:35.254789Z","title":"arXiv preprint arXiv:2410.17434 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.254789Z"},"links":{"cited_paper":"/paper/2410.17434","citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:f09c8267adaf11fa32fa77a5618ddee008baf28fe49b45d55c56dfe489d203f3","observation_id":"8be2849b-f821-4698-84c7-b874683bd49a","resolution":{"observed_at":"2026-08-07T23:42:35.254789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T23:42:35.259354Z","title":"arXiv preprint arXiv:2409.12191 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.259354Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:f547c555c0868df256ab6cf4c23bccda82a52d7acebd04aae431755cc4c438d4","observation_id":"2adc3bb7-81f2-47ca-942d-a0b06f11b82b","resolution":{"observed_at":"2026-08-07T23:42:35.259354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:35.263951Z","title":"Findings of the Association for Computational Linguistics: NAACL 2025 , pages=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.263951Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:9bd96236919dc3167ffc524d97d9682de65fcd14c5a791f7e49110bf79338096","observation_id":"a3caf4fb-be58-49e2-ac26-315351eaeb75","resolution":{"observed_at":"2026-08-07T23:42:35.263951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:35.267788Z","title":"arXiv preprint arXiv:2510.20622 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.267788Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:8da583c11bc587455597e078852041d27769c5addde3a92d3ab293285e962adc","observation_id":"ce3af3d7-e684-4f93-85a3-4ea4f6cb84df","resolution":{"observed_at":"2026-08-07T23:42:35.267788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03104","last_updated":"2024-08-10T14:57:37Z","snapshot_observed_at":"2026-07-06T18:40:57.362549Z","submitted_at":"2024-07-03T13:41:44Z","title":"KeyVideoLLM: Towards Large-scale Video Keyframe Selection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03104","snapshot_observed_at":"2026-08-07T23:42:35.271317Z","title":"arXiv preprint arXiv:2407.03104 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.271317Z"},"links":{"cited_paper":"/paper/2407.03104","citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:d4025fbcc32b7898ce641a608609a3ab0dd58ac957a0b42b34af32c24c0306ee","observation_id":"d5d5aada-913e-4dd2-af7c-e63665cd10d5","resolution":{"observed_at":"2026-08-07T23:42:35.271317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13189","snapshot_observed_at":"2026-08-07T23:42:35.275164Z","title":"arXiv preprint arXiv:2502.13189 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.275164Z"},"links":{"cited_paper":"/paper/2502.13189","citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:0361b1de071d2f2968b92f0520097e837a6faa5b2240ee94f2677f2fa17b0eb1","observation_id":"3edf887e-ae98-487f-8ca2-118820cb80a6","resolution":{"observed_at":"2026-08-07T23:42:35.275164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08584","last_updated":"2024-12-18T07:45:11Z","snapshot_observed_at":"2026-07-06T19:31:40.352383Z","submitted_at":"2024-10-11T07:24:21Z","title":"ZipVL: Efficient Large Vision-Language Models with Dynamic Token Sparsification","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08584","snapshot_observed_at":"2026-08-07T23:42:35.279225Z","title":"arXiv preprint arXiv:2410.08584 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.279225Z"},"links":{"cited_paper":"/paper/2410.08584","citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:5c9f9e4c1af9a57c13ad5ccb2c0d3abf7e18acb8283c193375ef11ad25219f58","observation_id":"ea224450-abc1-42c2-b9ae-bca17a4f097c","resolution":{"observed_at":"2026-08-07T23:42:35.279225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:35.282895Z","title":"European Conference on Computer Vision , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.282895Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:c1e08a196268aeb972a35cd877539ad1ea863589064bc9989f079d5184733514","observation_id":"64354bbb-8bc1-43d1-8297-6a99e744addb","resolution":{"observed_at":"2026-08-07T23:42:35.282895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:35.286834Z","title":"arXiv preprint arXiv:2512.04000 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.286834Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:5fb89e80480b1f078b6047d17214dc474a2363fbb907e6ce85dde8c57c5e4b03","observation_id":"70505639-07af-4d2d-ac65-935bf4ad9567","resolution":{"observed_at":"2026-08-07T23:42:35.286834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:35.290721Z","title":"Proceedings of the IEEE/CVF International Conference on Computer Vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.290721Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:fb986035db34fdd5601e0c45e9a0f0e0eba53d3cdd601dba4d8713c3121e8c0e","observation_id":"7231cc6d-7072-4e4c-bb8f-8dc3ddd4dd39","resolution":{"observed_at":"2026-08-07T23:42:35.290721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:38.298869Z","title":"Findings of the Association for Computational Linguistics: ACL 2024 , pages=","venue":null,"work_id":"87aae588-2c76-42ec-841e-9d5d83b6fe39","year":2024},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.294520Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:a035bca25de13804d870d1c0a3fa9f79f44ce63f110d7b8526d82a468d7a63ec","observation_id":"0f75b74b-7551-4bf3-a952-b6523142cad7","resolution":{"observed_at":"2026-08-07T23:42:38.302472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:35.298403Z","title":"arXiv preprint arXiv:2512.06866 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.298403Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:6463c16eca1e42345ffa399d0d9c1452bb38b3d8261026b8cf5e056b9ae37efd","observation_id":"3f747f0b-d0cf-4dcc-9a4d-28bae416a214","resolution":{"observed_at":"2026-08-07T23:42:35.298403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:35.302345Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.302345Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:771797132b5d10066583a79883e8afe73744f3db276107190c93c209db68e308","observation_id":"e82103f8-687e-4358-be36-fd9b36733719","resolution":{"observed_at":"2026-08-07T23:42:35.302345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.18234","last_updated":"2025-10-21T02:41:44Z","snapshot_observed_at":"2026-07-06T22:33:39.148066Z","submitted_at":"2025-10-21T02:41:44Z","title":"DeepSeek-OCR: Contexts Optical Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.18234","snapshot_observed_at":"2026-08-07T23:42:35.306068Z","title":"arXiv preprint arXiv:2510.18234 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.306068Z"},"links":{"cited_paper":"/paper/2510.18234","citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:83b34997bee422030bbe5d2bc9bf805764113dda2ef2838118a97ef96133d317","observation_id":"386423a4-cb6a-4ec6-9647-fab143900a02","resolution":{"observed_at":"2026-08-07T23:42:35.306068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:35.310474Z","title":"arXiv preprint arXiv:2502.02770 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.310474Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:5a15b0ceec1ed34f013a5d94761fe0154a96c4809e10587519bffd68d60ad479","observation_id":"a8e0168f-e7cf-496b-be61-0b99e380d554","resolution":{"observed_at":"2026-08-07T23:42:35.310474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00574","last_updated":"2025-07-13T16:21:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-31T18:01:23Z","title":"VideoChat-Flash: Hierarchical Compression for Long-Context Video Modeling","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00574","snapshot_observed_at":"2026-08-07T23:42:35.314074Z","title":"arXiv preprint arXiv:2501.00574 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.314074Z"},"links":{"cited_paper":"/paper/2501.00574","citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:45be44819819730c3f327422967299c538eabd2018ba7101ff1408ec7a1a7520","observation_id":"8651f988-a6eb-478d-9397-9933409b53f1","resolution":{"observed_at":"2026-08-07T23:42:35.314074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:35.318166Z","title":"arXiv preprint arXiv:2601.22582 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.318166Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:7ad92b9b6efcc6da6495788212aa0248e300c835d093895f216f1be8b1f1034f","observation_id":"0c39dbf2-088b-4d6a-9299-72b5745b961d","resolution":{"observed_at":"2026-08-07T23:42:35.318166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06428","last_updated":"2025-02-11T14:59:25Z","snapshot_observed_at":"2026-08-08T15:25:00.286848Z","submitted_at":"2025-02-10T13:03:05Z","title":"CoS: Chain-of-Shot Prompting for Long Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06428","snapshot_observed_at":"2026-08-07T23:42:35.322337Z","title":"arXiv preprint arXiv:2502.06428 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.322337Z"},"links":{"cited_paper":"/paper/2502.06428","citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:1a42b7085bfa5fabbbf451bdf42f4a69b6f2c74c9a342c69b191dd23b124911c","observation_id":"89644a61-823b-477b-9050-d893594e292f","resolution":{"observed_at":"2026-08-07T23:42:35.322337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-07T23:42:35.326390Z","title":"arXiv preprint arXiv:2410.02713 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.326390Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:2c38c5a8f3792af39c754b174fb40c57f76d9d062ca56cc6fe41a6e3f025b1f9","observation_id":"0f00d2cd-5d32-4612-8501-582a08c55afb","resolution":{"observed_at":"2026-08-07T23:42:35.326390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23747","last_updated":"2026-05-19T02:23:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-29T17:59:04Z","title":"Spatial-MLLM: Boosting MLLM Capabilities in Visual-based Spatial Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23747","snapshot_observed_at":"2026-08-07T23:42:35.330473Z","title":"arXiv preprint arXiv:2505.23747 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.330473Z"},"links":{"cited_paper":"/paper/2505.23747","citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:4a9ebdc35f535c6a0f0c8f23c419910b822f25260a9593a6bdb4388cca05f94d","observation_id":"6e9bdbae-b87b-4365-9025-a400c1fbc98a","resolution":{"observed_at":"2026-08-07T23:42:35.330473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.10978","last_updated":"2025-10-28T15:11:36Z","snapshot_observed_at":"2026-07-29T19:20:21.974239Z","submitted_at":"2025-05-16T08:26:59Z","title":"Group-in-Group Policy Optimization for LLM Agent Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.10978","snapshot_observed_at":"2026-08-07T23:42:35.334661Z","title":"arXiv preprint arXiv:2505.10978 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.334661Z"},"links":{"cited_paper":"/paper/2505.10978","citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:071819feea31a59c639fc7aad8f3bc3ebcc1e20794c635352ef7d1e6057edb98","observation_id":"ef3c325f-9b54-45f3-b907-81c8326c3dbb","resolution":{"observed_at":"2026-08-07T23:42:35.334661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01951","last_updated":"2025-08-09T19:48:07Z","snapshot_observed_at":"2026-08-09T13:50:22.834049Z","submitted_at":"2025-02-04T02:53:07Z","title":"On the Emergence of Position Bias in Transformers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01951","snapshot_observed_at":"2026-08-07T23:42:35.338843Z","title":"arXiv preprint arXiv:2502.01951 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.338843Z"},"links":{"cited_paper":"/paper/2502.01951","citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:92b26a60b00fb23f37cda3be1b54ee4c002990b741b11123d6601257cac317d7","observation_id":"a46cfd20-1e86-4467-b0c4-b3d875e8158c","resolution":{"observed_at":"2026-08-07T23:42:35.338843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:38.281679Z","title":"Proceedings of the Computer Vision and Pattern Recognition Conference , pages=","venue":null,"work_id":"5b1159e1-6419-4ce3-828c-8f659473396d","year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.343208Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:e6de6512386b6f94c76789616d20591307c6462fb9c281fb592b2bcc5e33f19b","observation_id":"df6bbcc7-9e88-4fbf-96b0-9b851f16bda6","resolution":{"observed_at":"2026-08-07T23:42:38.284992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:38.271498Z","title":"Proceedings of the 2022 Conference on Empirical Methods in Natural Language Processing , pages=","venue":null,"work_id":"56e0a4c2-8a9c-47d1-aa07-a37c6acda30b","year":2022},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.347966Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:c418872c355de53f455f3f74cd6faf3c0e34268103202a4775f01d01dcbb89a6","observation_id":"8aace232-8f19-4705-b6a3-084255d68645","resolution":{"observed_at":"2026-08-07T23:42:38.274866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:35.351819Z","title":"arXiv preprint arXiv:2504.18579 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.351819Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:6df672d7cab3451d59bbf579794860d4a007075c025d3febf8e73c5a837d8d97","observation_id":"8a677408-6190-4db3-9c70-bd63b83027e4","resolution":{"observed_at":"2026-08-07T23:42:35.351819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:35.355809Z","title":"arXiv preprint arXiv:2603.06199 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.355809Z"},"links":{"citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:54e3b792858b6bb5955141175d7f1d00d0499a4bd941025b716bbafbaa5ea41a","observation_id":"f91a1cdf-23b2-4ce0-b2ec-332e7591b29c","resolution":{"observed_at":"2026-08-07T23:42:35.355809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20766","last_updated":"2025-02-28T06:34:53Z","snapshot_observed_at":"2026-08-07T17:40:46.337382Z","submitted_at":"2025-02-28T06:34:53Z","title":"FlexPrefill: A Context-Aware Sparse Attention Mechanism for Efficient Long-Sequence Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.20766","snapshot_observed_at":"2026-08-07T23:42:35.360123Z","title":"arXiv preprint arXiv:2502.20766 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.360123Z"},"links":{"cited_paper":"/paper/2502.20766","citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:c9199d1922b3a0b36f6f86679b99ad96e5174065872a8f24196d515ba2d9a9fb","observation_id":"6083fe37-9c5f-40e6-97e3-d61f110a605a","resolution":{"observed_at":"2026-08-07T23:42:35.360123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T14:10:59.379725Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding"},"reference_resolution":{"displayed":94,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":83,"verified_exact":0,"verified_fuzzy":10},"total_outbound_references":94},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 94 of 94 outbound references and 0 inbound Pith citation observations for arXiv:2608.05780."}