{"as_of":"2026-08-14T11:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4a87433c39b3f3c0372d27fda4d8afa4411c0287b8475142a80b5fe815fb7288","coverage":[{"denominator":80,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":80,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T17:43:03.400998Z","state":"measured"},{"denominator":80,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":80,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.12355/citation-record","integrity":"/paper/2411.12355/integrity","json":"/paper/2411.12355/citation-record.json","paper":"/paper/2411.12355"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:04.834107Z","title":null,"venue":null,"work_id":"55406728-5344-4476-85bc-09addb898427","year":2017},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:02.999634Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:4648d366a53d52e7a920637bcdb1f2cb7e9d02e02927a20c030030755754d551","observation_id":"2192909b-a3ec-40ac-aa7f-5a5b0ac5a6cd","resolution":{"observed_at":"2026-08-12T17:43:04.840167Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:04.815371Z","title":"Textvqa: Towards understanding of visible and invisible text in images","venue":null,"work_id":"e522ac3f-a3b5-4b92-865b-5b612052ffd0","year":2019},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.005333Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:e77b375f2b00cfeaace429e1eef780aa81d7d93fff74721c73fade372c74c91c","observation_id":"ccf63729-4ef7-4c31-9099-15657401fcf3","resolution":{"observed_at":"2026-08-12T17:43:04.821791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03413","last_updated":"2024-04-04T12:46:01Z","snapshot_observed_at":"2026-08-13T00:37:45.501808Z","submitted_at":"2024-04-04T12:46:01Z","title":"MiniGPT4-Video: Advancing Multimodal LLMs for Video Understanding with Interleaved Visual-Textual Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03413","snapshot_observed_at":"2026-08-12T17:43:03.010674Z","title":"Minigpt4-video: Advancing multimodal llms for video un- derstanding with interleaved visual-textual tokens","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.010674Z"},"links":{"cited_paper":"/paper/2404.03413","citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:f0f9dc703c8f2241b22c3c0a85c2708ef34408d86035c736f05247a3b1246f70","observation_id":"a7df40f1-6a21-465e-8c84-95e39da5afaa","resolution":{"observed_at":"2026-08-12T17:43:03.010674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:04.795565Z","title":"Frozen in time: A joint video and image encoder for end-to- end retrieval","venue":null,"work_id":"c32cc981-1fb9-4e01-be79-0b98f9e2441b","year":2021},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.016186Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:9ad51acd8271bbd9da4e067d9d38bc02389252804bcf0e31e15b3851c3cbd3c5","observation_id":"ae255e3c-586c-4dc1-aa72-d127c3ac2d32","resolution":{"observed_at":"2026-08-12T17:43:04.802082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:04.775566Z","title":"Frozen in time: A joint video and image encoder for end-to- end retrieval","venue":null,"work_id":"615e2ebb-6c00-49ba-a760-4a4fd9775e11","year":2021},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.021259Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:e3ea373804777fd7f13a85de370500a53d8b24ba99ddac368228d5c5667c3e45","observation_id":"036feb4b-a3b7-4b69-93c4-d10d7eba5f3c","resolution":{"observed_at":"2026-08-12T17:43:04.782344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.08676","last_updated":"2020-06-09T15:09:00Z","snapshot_observed_at":"2026-08-11T01:42:10.269368Z","submitted_at":"2020-02-20T11:11:32Z","title":"Learning with Differentiable Perturbed Optimizers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.08676","snapshot_observed_at":"2026-08-12T17:43:03.026435Z","title":null,"venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.026435Z"},"links":{"cited_paper":"/paper/2002.08676","citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:40448882e330137520e8ed9e93c91a245874ff8bf705fe0bb270d3cc13c554d0","observation_id":"47c3774e-a343-4e4e-9a7a-3209d40cd88d","resolution":{"observed_at":"2026-08-12T17:43:03.026435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:04.755464Z","title":"Activitynet: A large-scale video bench- mark for human activity understanding","venue":null,"work_id":"3a077549-4f0f-447e-bf9e-36234ca92e0a","year":2015},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.032611Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:64791a50538bd3797e97305b6fd319bbe4b8463f57f596a67e6f695c2cf4da59","observation_id":"169e7c30-2c2d-47b9-b16c-25b842bf533a","resolution":{"observed_at":"2026-08-12T17:43:04.762216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:04.733629Z","title":"Chen and William B","venue":null,"work_id":"cc767ab4-0220-4374-aee5-019f13ef5c08","year":2011},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.037293Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:5fa7bab2e492d8d7c9d4d009fef5e8eace5f8f46243d8a12fa6b3017e3ce28ee","observation_id":"e2174da7-e12b-41df-aeb8-06e665057820","resolution":{"observed_at":"2026-08-12T17:43:04.741759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-12T17:43:03.047959Z","title":"Videollama 2: Advancing spatial-temporal modeling and audio understanding in video- llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.047959Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:b17f44ce260e55578db5db51801e5a59c7cf92901469dda418f9e4177282aeed","observation_id":"8c0bab9f-0d08-4aef-b355-b32aadb75f55","resolution":{"observed_at":"2026-08-12T17:43:03.047959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:03.053816Z","title":"Gonzalez, Ion Stoica, and Eric P","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.053816Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:842250277bda918df4048015c791bea4771ea285e335cb3de06ab075aac1db31","observation_id":"7c0a61f2-f1a3-46bd-9800-de413e0a100f","resolution":{"observed_at":"2026-08-12T17:43:03.053816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:03.058756Z","title":"Palm: Scaling language modeling with pathways","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.058756Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:771ddce11742d9acb8bd90122aa603881fd1e01183330156dcd9d7d67280af4b","observation_id":"53588708-e7e8-44db-86f2-a24f74c2d2c5","resolution":{"observed_at":"2026-08-12T17:43:03.058756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:04.671079Z","title":null,"venue":null,"work_id":"901e8cff-c914-4248-a743-1bd2a65cf066","year":2023},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.063662Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:2f09fd9e32d28b795afc4df8cfec85ece311ed912e9820b9a5e833fddf7fb3bd","observation_id":"a94e7e06-e704-43d2-8ba4-b05789559123","resolution":{"observed_at":"2026-08-12T17:43:04.677150Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:04.652766Z","title":"EgoQA: Egocentric question an- swering","venue":null,"work_id":"7ad3dbdd-72f0-4e23-bb59-84987b6c297e","year":2023},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.068378Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:cdb98ff9fabf0acc2c39ad83d5e8c6eeb6fc8ef364f2d91b316e163fc0357ad3","observation_id":"8923c3c4-b5a4-4d60-b4ec-53ed7bae0b2e","resolution":{"observed_at":"2026-08-12T17:43:04.659167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:04.634322Z","title":"Study on density peaks clustering based on k-nearest neighbors and principal component analysis","venue":null,"work_id":"774075d5-aaa7-4fa8-afea-e8abd4bfa036","year":2016},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.073060Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:bea77f0838a7b526bda804a81792dc7108b27950ee54ed49b6043743ba166523","observation_id":"5178ef37-024c-4463-8b7d-feb5f9a4adf1","resolution":{"observed_at":"2026-08-12T17:43:04.640474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:04.617102Z","title":"EV A: exploring the limits of masked visual representation learning at scale","venue":null,"work_id":"e5d7892b-709d-42ec-8d36-9981267e4df6","year":2023},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.077586Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:2ed791b07af75f08e79f07cded97564dfd9d2bed63a752dc3378fc11aef8aadd","observation_id":"114aef3b-3e26-4775-92a2-779f5607bec3","resolution":{"observed_at":"2026-08-12T17:43:04.622796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:04.599340Z","title":"Making the V in VQA matter: Elevating the role of image understanding in visual question answering","venue":null,"work_id":"78918f52-6cb1-4b18-ad3c-47dc7f1dcf55","year":2019},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.082185Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:8107bc1fdd5649f7abc8aeba3a35c52c3c1f99949051b6ab3b4a8dce12ed1245","observation_id":"7a073534-89e0-4cd5-8319-8f235bfaaaef","resolution":{"observed_at":"2026-08-12T17:43:04.604589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:04.580546Z","title":"Semantic-aware modular capsule routing for visual question answering","venue":null,"work_id":"d9dd02a8-2a3a-45ba-9a23-9d7f45b8c629","year":2023},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.086860Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:6de781c47029c79dba957756c3ee9488580dd1445964a99b19dda7dd5d6c2588","observation_id":"2b2efb6a-fb1c-44e9-ad25-53a1c8e3cfd0","resolution":{"observed_at":"2026-08-12T17:43:04.587504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:04.563248Z","title":"MA-LMM: memory-augmented large multimodal model for long-term video understanding","venue":null,"work_id":"9c077dba-f275-4c2c-9b5e-e20d3174b434","year":2024},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.091661Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:89ab07e9e2d59098b5a9f755e3daa4f5d5652a02c73173bd77828df6e96ec98d","observation_id":"967e23a5-a606-4c25-8945-23b63da30962","resolution":{"observed_at":"2026-08-12T17:43:04.568683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:04.546773Z","title":"Ma-lmm: Memory-augmented large multimodal model for long-term video understanding","venue":null,"work_id":"d71da16c-1d00-484d-8914-43aaddb3025d","year":2024},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.096166Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:490d515f687a3d63350e9ed1bf23fcdc6582998a70f8846a6d60c9443f0ddde4","observation_id":"5de07298-2e8b-4d31-94ad-f6ed51167c0a","resolution":{"observed_at":"2026-08-12T17:43:04.551934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:04.530062Z","title":"Activitynet: A large-scale video bench- mark for human activity understanding","venue":null,"work_id":"f5349d4b-d332-4de2-b456-6bf5e54060f4","year":2015},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.100797Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:1c160fbc4cc08a677c901e7be7c973468ba167ac235ba3355de07589d7ac0c4a","observation_id":"6d4b9996-60c8-438c-b156-f73174c9c75e","resolution":{"observed_at":"2026-08-12T17:43:04.535708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:04.511824Z","title":null,"venue":null,"work_id":"44f9733b-563f-4997-b1c7-dd3b3ec59c1a","year":1986},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.105442Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:4a7be0946dcbebcc86d15d0e733c736325a1f6a77cfea042303f5f35e5e6df5c","observation_id":"3d217d76-55f0-4919-988e-a7158c81f2f2","resolution":{"observed_at":"2026-08-12T17:43:04.518297Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18445","last_updated":"2023-11-30T10:49:56Z","snapshot_observed_at":"2026-08-13T05:13:34.055524Z","submitted_at":"2023-11-30T10:49:56Z","title":"VTimeLLM: Empower LLM to Grasp Video Moments","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.18445","snapshot_observed_at":"2026-08-12T17:43:03.110131Z","title":"Vtimellm: Empower llm to grasp video moments","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.110131Z"},"links":{"cited_paper":"/paper/2311.18445","citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:93bc78f235ed25aeb5ba92c5a87f151e3b715ddd2d87992619148868e8e4133c","observation_id":"02a8aba9-ed37-42e7-a542-a2bc61b21d20","resolution":{"observed_at":"2026-08-12T17:43:03.110131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:04.496000Z","title":"Ng, Hongqiang Rong, and Zichen Li","venue":null,"work_id":"1b35e6bc-a13d-4295-8a9c-ee7467bb41c1","year":2005},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.115496Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:3dd383a367c720b2cc5761e03d42eabe5945af1bd9ae786915a6a8a2f137a9a9","observation_id":"a4a3e019-fd4d-42d8-8cec-21765358ad1e","resolution":{"observed_at":"2026-08-12T17:43:04.501170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:04.479225Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional questions","venue":null,"work_id":"23d5c386-0087-400e-af44-7e19ec3af91f","year":2019},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.120120Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:d22754f8bb969f94e429008160f5975f1b82027896ebe00b0a5f81528d2541dc","observation_id":"1c862dea-09fb-40c2-8280-c60f3386f8ad","resolution":{"observed_at":"2026-08-12T17:43:04.484544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08046","last_updated":"2024-04-05T15:21:09Z","snapshot_observed_at":"2026-08-13T05:25:45.984864Z","submitted_at":"2023-11-14T10:11:36Z","title":"Chat-UniVi: Unified Visual Representation Empowers Large Language Models with Image and Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08046","snapshot_observed_at":"2026-08-12T17:43:03.124790Z","title":"Chat-univi: Unified visual representation em- powers large language models with image and video under- standing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.124790Z"},"links":{"cited_paper":"/paper/2311.08046","citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:29bd629076fd4b9c2e4dc711e985caea3792c832f4dc5a9fdebd2bc79fdeee9d","observation_id":"a63abfb8-567c-49a0-aabe-73c348fdd3a4","resolution":{"observed_at":"2026-08-12T17:43:03.124790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-12T17:43:03.130132Z","title":"Brown, Benjamin Chess, Rewon Child, Scott Gray, Alec Radford, Jeffrey Wu, and Dario Amodei","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.130132Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:101f0ca19642808dfe29f32947c211c349a0f142d0297c31b34f58ddf147170a","observation_id":"2611f948-041c-4fcb-8df2-73f54e44b3ed","resolution":{"observed_at":"2026-08-12T17:43:03.130132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:04.457712Z","title":null,"venue":null,"work_id":"15ee55e5-867c-4bdf-8d7d-6c1c3a4aca96","year":2014},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.135145Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:ebc7d6bd41e05654fd1d0fefba887fef66151be6c234559b90d54ed8f7859960","observation_id":"7b32a324-e24f-4f7b-ac0d-ebe87d4d61ba","resolution":{"observed_at":"2026-08-12T17:43:04.463976Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:04.439634Z","title":"Kingma and Jimmy Ba","venue":null,"work_id":"e92cfe5d-ff90-472a-bb62-9ae97069f616","year":2015},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.140583Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:97f92e83320533e59e1f2efae2750025e810ba2ffa5baacff18231f749100a5f","observation_id":"d1aedadd-e8e9-4b7c-bc4b-b87f8f061e44","resolution":{"observed_at":"2026-08-12T17:43:04.444757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:04.422793Z","title":"Visual genome: Connecting language and vision using crowdsourced dense image annotations","venue":null,"work_id":"e0450b3f-4408-4979-8889-2163b6d19092","year":2017},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.145305Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:1bb485e5f78309a195196ebdbc20221cfe69a9cc1682ba999775df94b2f1f3c2","observation_id":"1358aabb-24c5-4dfd-84b4-abf6534493aa","resolution":{"observed_at":"2026-08-12T17:43:04.428366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:04.405325Z","title":"Visual genome: Connecting language and vision using crowdsourced dense image annotations","venue":null,"work_id":"69e8c8ee-b0b8-47d1-980a-484e8ef94ae1","year":2017},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.150322Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:a4d791903b2a8490d30c377ad145886256e51653ac0cdc74bdfe02c62edc7470","observation_id":"fe1aeb9e-49b2-4b88-8ada-5996889d545e","resolution":{"observed_at":"2026-08-12T17:43:04.411158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-12T17:43:03.155428Z","title":"Videochat: Chat-centric video understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.155428Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:00bd4c9f5f69fe90fd19a9f5f3eed17b577294123d7f904f204ed58762ca1dd2","observation_id":"8dd26375-64c0-4b7c-87be-1d82ecc6d9e3","resolution":{"observed_at":"2026-08-12T17:43:03.155428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17005","last_updated":"2024-05-23T14:49:29Z","snapshot_observed_at":"2026-07-06T16:53:55.269172Z","submitted_at":"2023-11-28T17:59:04Z","title":"MVBench: A Comprehensive Multi-modal Video Understanding Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17005","snapshot_observed_at":"2026-08-12T17:43:03.160467Z","title":"Mvbench: A comprehensive multi-modal video understand- ing benchmark","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.160467Z"},"links":{"cited_paper":"/paper/2311.17005","citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:a99c957f393a939ce85e01be1641c7458770abd69246743411515c636ca76831","observation_id":"4b36e757-7f2d-47c3-b746-91d1986490f7","resolution":{"observed_at":"2026-08-12T17:43:03.160467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:04.387118Z","title":"Scienceqa: A new dataset for science question answering","venue":null,"work_id":"7bafe729-16d2-44a1-8529-e32417d6f5a5","year":2021},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.165529Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:7503a1711ca92acdcea4d95e114ff286ce380eb08e273757f716e4909153fa8e","observation_id":"d816dd29-779c-4244-9cf9-18ca9a8829ea","resolution":{"observed_at":"2026-08-12T17:43:04.392817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:04.367043Z","title":"Learning dynamic routing for semantic segmentation","venue":null,"work_id":"07485e90-d352-437c-9694-d1db392354b0","year":2020},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.170423Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:ae9cb2e3c3716a81c0c36419a946755fb242c2e60a5a988617aabb13de09ce4f","observation_id":"afc0463e-dede-48a9-9cd3-afd740fe1de1","resolution":{"observed_at":"2026-08-12T17:43:04.373424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17043","last_updated":"2023-11-28T18:53:43Z","snapshot_observed_at":"2026-08-13T05:15:07.522678Z","submitted_at":"2023-11-28T18:53:43Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17043","snapshot_observed_at":"2026-08-12T17:43:03.175123Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.175123Z"},"links":{"cited_paper":"/paper/2311.17043","citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:7877ced20e530779f8efcc79f4baee4879d4626ecac39812cb562f85f0df32f4","observation_id":"eb7e9455-6eaf-461f-8f19-563a7e6d1ab0","resolution":{"observed_at":"2026-08-12T17:43:03.175123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:04.345748Z","title":"Video-llava: Learning united visual representa- tion by alignment before projection","venue":null,"work_id":"2d8a12c3-8c27-466e-8e8b-5d4a509cb5c6","year":2024},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.180928Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:88347995c05d4b986c017bbf60b7844ffed41933932b7b3215f9b2760317aab8","observation_id":"66d3c174-85f9-447b-a60a-1f540dc777cb","resolution":{"observed_at":"2026-08-12T17:43:04.351160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-12T17:43:03.186135Z","title":"Video-llava: Learning united visual represen- tation by alignment before projection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.186135Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:8c90836fd8f6718597bcbc46a5ee1ae2c9a002c5fa4612dd5e50e4ae30d9b1c7","observation_id":"c1e97409-d45b-42bf-98a6-7a84d74224b8","resolution":{"observed_at":"2026-08-12T17:43:03.186135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:04.328246Z","title":"Vila: On pre-training for visual language models","venue":null,"work_id":"f37d5520-9a63-4ee7-bf8a-c7d0fc868054","year":2023},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.191688Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:2933b9956e6aaf9de97af3d1cfc18b1aa438845e7f2d60a7797dd1dd15103e5a","observation_id":"90fcb0c1-438f-463f-8bb4-6fd700a3c9d0","resolution":{"observed_at":"2026-08-12T17:43:04.333933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:04.310396Z","title":"Lawrence Zitnick","venue":null,"work_id":"0ad956e1-4d76-4ebb-a1f0-12a380e2c5a2","year":2014},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.196680Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:7ba3e5798be86d6fd395183650745186561271c3e54b270ef159c24c1745072f","observation_id":"79bff67f-cb71-4e27-9c1b-2d75451d3a95","resolution":{"observed_at":"2026-08-12T17:43:04.315970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:03.203557Z","title":"Improved baselines with visual instruction tuning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.203557Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:6b5c5ab3305c70097bc074c722b7c23a47fbeb6dd7fc44f870745ee198e307ed","observation_id":"25d71ced-da19-4f2f-a516-afa49035b62f","resolution":{"observed_at":"2026-08-12T17:43:03.203557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08268","last_updated":"2025-02-03T21:47:31Z","snapshot_observed_at":"2026-08-14T09:16:47.522119Z","submitted_at":"2024-02-13T07:47:36Z","title":"World Model on Million-Length Video And Language With Blockwise RingAttention","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08268","snapshot_observed_at":"2026-08-12T17:43:03.208853Z","title":"World model on million-length video and language with blockwise ringattention","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.208853Z"},"links":{"cited_paper":"/paper/2402.08268","citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:39b0ff083e13541aa81358ffa34466b000632414cfcb50152232c437e6107437","observation_id":"de0d25fb-e774-4205-9732-0b5a640fbf72","resolution":{"observed_at":"2026-08-12T17:43:03.208853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15785","last_updated":"2024-06-27T12:05:48Z","snapshot_observed_at":"2026-08-13T10:03:47.236571Z","submitted_at":"2023-09-27T16:58:35Z","title":"BT-Adapter: Video Conversation is Feasible Without Video Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15785","snapshot_observed_at":"2026-08-12T17:43:03.214641Z","title":"One for all: Video conversation is feasible without video instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.214641Z"},"links":{"cited_paper":"/paper/2309.15785","citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:549dcbe93542c949734cb65b5291c736c56c773859a84524440b537038b0474f","observation_id":"60a8e0cb-1022-4047-a7ed-825647eab5e4","resolution":{"observed_at":"2026-08-12T17:43:03.214641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00308","last_updated":"2024-03-30T10:11:26Z","snapshot_observed_at":"2026-08-13T00:40:59.749269Z","submitted_at":"2024-03-30T10:11:26Z","title":"ST-LLM: Large Language Models Are Effective Temporal Learners","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00308","snapshot_observed_at":"2026-08-12T17:43:03.220788Z","title":"ST-LLM: large language models are effective temporal learners","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.220788Z"},"links":{"cited_paper":"/paper/2404.00308","citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:b5667bf3f242530461d3cf5109dab8ce8bf9cf135a56ae8ea7eef6fa31a77265","observation_id":"1593324f-320e-4af4-9cb9-cfc8b1ed7bc7","resolution":{"observed_at":"2026-08-12T17:43:03.220788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:03.226223Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.226223Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:49bb1bba243983c46cffed73718577eb64e15c8190eeac08e0e14fcb34fdcce9","observation_id":"2af014f9-11db-4cdd-aa50-d2a8f3d2c860","resolution":{"observed_at":"2026-08-12T17:43:03.226223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05424","last_updated":"2024-06-10T01:36:53Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05424","snapshot_observed_at":"2026-08-12T17:43:03.231069Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.231069Z"},"links":{"cited_paper":"/paper/2306.05424","citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:ab91385dad431dd064bc26af992197c7f2635f85cd21600e25615ba9a0730ae0","observation_id":"2ffbb597-19fb-4961-93fd-8e4f31a16a59","resolution":{"observed_at":"2026-08-12T17:43:03.231069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:04.266465Z","title":"Some methods for classification and anal- ysis of multivariate observations","venue":null,"work_id":"f9f38a5f-7471-4f7b-ad39-73986b73a225","year":1967},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.236284Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:de4d4a38d881eba69f1a0b004a1f09f5db1b960c15a78b293111a296077ec6f9","observation_id":"b8a8055a-73b3-44f0-91dd-8e70d97aa0ee","resolution":{"observed_at":"2026-08-12T17:43:04.272680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:04.248052Z","title":"Yuille, and Kevin Murphy","venue":null,"work_id":"c8a2b5ed-f9cb-4db7-8da8-128b5b2e7f95","year":2016},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.241058Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:9324926a431098f4a95a47c47178e464ae970643feb7581938e15677a264a3a0","observation_id":"1f1405bd-bdfa-4a08-b6e1-179d714a455f","resolution":{"observed_at":"2026-08-12T17:43:04.253109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:03.245850Z","title":"Ocr-vqa: Visual question answering by reading text in images","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.245850Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:09b0770cce37da5d2cd82c5ef1c18556e3628655146f18f4f5a5222ca2113814","observation_id":"fbd14a40-e224-4093-8831-e1162e9cf647","resolution":{"observed_at":"2026-08-12T17:43:03.245850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:04.219501Z","title":"Webvidqa: A large-scale dataset for video question answering","venue":null,"work_id":"28940367-b386-407a-b910-528d97e115a6","year":2021},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.251180Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:c6b8c7ca5346da325e8ccd9b05d14456fe0b980d245a250b3cb0105eabcd64b7","observation_id":"ba16ab19-d20a-4e06-9572-00797ee7c6ab","resolution":{"observed_at":"2026-08-12T17:43:04.224590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:04.203850Z","title":"Introducing chatgpt","venue":null,"work_id":"e0c89c35-b7d4-432e-8574-e545774fb89a","year":2022},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.256692Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:6a9e650c91761239d01a6170272a07cd455de321e5370b18e2e8bc38c31331ca","observation_id":"6ea3099d-e5d3-48e4-be36-b99bf90505b1","resolution":{"observed_at":"2026-08-12T17:43:04.208955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:04.188250Z","title":"GPT-4o system card, 2024","venue":null,"work_id":"17e32fab-8cd1-4792-ae8a-688dcb68b67e","year":2024},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.261844Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:375e83737704801bfa960ccfbf36d15e8a2787848d9141923c8392845347e49d","observation_id":"b9e6b080-9048-43f3-8b18-406637cedd42","resolution":{"observed_at":"2026-08-12T17:43:04.192873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:04.172596Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"4ef6a94a-600e-47d0-8a8e-c0fa2e8b30df","year":2021},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.267235Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:4b9200154b3d09b77f2e47c6c15b5c74c0e49e9ab32e433de1f79029de44d685","observation_id":"6ecae718-bdbf-4511-a75c-0ff1b842447e","resolution":{"observed_at":"2026-08-12T17:43:04.177914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:04.156885Z","title":"Improving language understanding by gener- ative pre-training","venue":null,"work_id":"1a8ed6ea-efc2-4ef3-8928-c9d6c5839174","year":2018},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.272111Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:ee7867105cdce3debc484a60b1367cbe178b47bdac7ce40794b8906fcaf10752","observation_id":"b2a3c4cd-944a-46b1-a257-bab491b451bf","resolution":{"observed_at":"2026-08-12T17:43:04.162143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:04.140985Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","venue":null,"work_id":"bcd0a018-48cf-4c43-ac0d-05a828a0aca5","year":2024},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.277089Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:2138aec9178559805992d8234af292010e9a83c958bed5bde7aacb73a0c56344","observation_id":"80ab209e-d25d-468f-b4f5-f2c99e816a88","resolution":{"observed_at":"2026-08-12T17:43:04.146210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:04.124156Z","title":"Timechat: A time-sensitive multimodal large language model for long video understanding","venue":null,"work_id":"1c963c74-3a2e-494c-8ea0-fae2dbdc7e41","year":2023},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.281962Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:2e8bd0b6c102e0887f4589bbec9290a6c986dac5eca0127114a24a8185e9855b","observation_id":"849ce177-89ab-4c57-84b2-263947569873","resolution":{"observed_at":"2026-08-12T17:43:04.129764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:04.106432Z","title":"Massof Sarah L","venue":null,"work_id":"77529eac-98a5-4b39-8490-0a63a1a37412","year":2021},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.288087Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:cb34b4c1dc71058703a78a4afc81fdfcfd08307cdab3040db30693f2877d957b","observation_id":"c8db052f-139d-4721-92db-375d350333a0","resolution":{"observed_at":"2026-08-12T17:43:04.112583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:04.090060Z","title":"A-okvqa: A bench- mark for visual question answering using world knowledge","venue":null,"work_id":"f7e971e2-86d0-4bb6-b544-0b1b79c904bc","year":2022},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.292697Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:8540432166d165a8f0c7d880dd2a7fb87ef0b72b137a4e7c6416f7ab760940c4","observation_id":"e74eb7fb-e81a-4a1a-aedb-f5c5f9d1a06d","resolution":{"observed_at":"2026-08-12T17:43:04.095257Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:04.073266Z","title":"Conceptual captions: A cleaned, hypernymed, image alt-text dataset for automatic image captioning","venue":null,"work_id":"3d237e96-a50b-4cd4-96bf-38aa45599483","year":2018},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.297505Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:a162aac9d7164ec48510f42130a1511245abe6845ec6ec44288dd7f574cc2df1","observation_id":"35c00115-a116-4de1-9640-eabf185e24a1","resolution":{"observed_at":"2026-08-12T17:43:04.078763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:04.052443Z","title":"Textcaps: a dataset for image captioning with reading comprehension","venue":null,"work_id":"225d72af-0aac-498d-bfe1-be39df72c9fd","year":2020},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.302047Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:c39a53702d2269e5f7e4ff10f82b259fa98fff2261db5a9ccc3b8367d373a284","observation_id":"04cbea46-a537-4ccb-a7c1-a20ce0943b2b","resolution":{"observed_at":"2026-08-12T17:43:04.059597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16449","last_updated":"2024-03-09T06:43:37Z","snapshot_observed_at":"2026-08-13T10:44:25.209833Z","submitted_at":"2023-07-31T07:15:45Z","title":"MovieChat: From Dense Token to Sparse Memory for Long Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16449","snapshot_observed_at":"2026-08-12T17:43:03.306611Z","title":"Moviechat: From dense token to sparse memory for long video understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.306611Z"},"links":{"cited_paper":"/paper/2307.16449","citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:c14e3e6db54cab5f2b818709722466c4ed0b79aa08182f06c03fce58c3df5063","observation_id":"07fcd0e9-4a9d-48f4-913e-16a82ba77ff9","resolution":{"observed_at":"2026-08-12T17:43:03.306611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:04.032303Z","title":"Moviechat: From dense token to sparse memory for long video understanding","venue":null,"work_id":"92286974-509a-4f92-af9c-6804b46e88ea","year":2023},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.311747Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:7bd46da2dba4afb2c5432060162ca62f848ccf4976bb12540fa68a067cd539bc","observation_id":"244acf83-61ea-4a6b-9dd9-53248aa8ebca","resolution":{"observed_at":"2026-08-12T17:43:04.038794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.01422","last_updated":"2025-08-11T12:47:49Z","snapshot_observed_at":"2026-08-13T04:04:45.669973Z","submitted_at":"2024-03-03T07:43:39Z","title":"DreamFrame: Enhancing Video Understanding via Automatically Generated QA and Style-Consistent Keyframes","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.01422","snapshot_observed_at":"2026-08-12T17:43:03.316445Z","title":"Moviellm: Enhancing long video understanding with ai-generated movies","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.316445Z"},"links":{"cited_paper":"/paper/2403.01422","citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:fe5c9fe76fb6120600da86abce516585be4690ff853f88453bb3cd03ad33b92b","observation_id":"adc1f000-41c0-4e15-beea-8be646f352d0","resolution":{"observed_at":"2026-08-12T17:43:03.316445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-12T17:43:03.321491Z","title":"Llama: Open and efficient foundation language models.arXiv preprint arXiv:2302.13971, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.321491Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:f63fe3260e7303519490cb385a55b520e0ba67c7bab7bf7ac0531c21f630c790","observation_id":"f27cfd0f-7d32-4381-9795-91a3214f24e6","resolution":{"observed_at":"2026-08-12T17:43:03.321491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:04.014741Z","title":"Ocrvqa: A new dataset for optical character recognition in visual question answering","venue":null,"work_id":"d40c9e40-51d3-450d-85b0-5893dcecad37","year":2018},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.326429Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:61686b59ef9142dbbd84e74b0ad1a69954e76438c950aff0d7dacb35c8af0306","observation_id":"43a75b67-c0a8-435b-9aac-d5c43325d460","resolution":{"observed_at":"2026-08-12T17:43:04.020499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08035","last_updated":"2025-08-09T10:54:59Z","snapshot_observed_at":"2026-08-08T19:38:26.415599Z","submitted_at":"2024-06-12T09:36:52Z","title":"LVBench: An Extreme Long Video Understanding Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08035","snapshot_observed_at":"2026-08-12T17:43:03.331072Z","title":"Lvbench: An extreme long video understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.331072Z"},"links":{"cited_paper":"/paper/2406.08035","citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:0d6f29f75cb6366f7b869edbad2fb108e96dc25ae01d55f600bcb657206a7350","observation_id":"7e892c22-933f-4318-965b-dc19ed6cf8a9","resolution":{"observed_at":"2026-08-12T17:43:03.331072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16338","last_updated":"2024-06-24T06:21:59Z","snapshot_observed_at":"2026-08-12T23:36:27.585760Z","submitted_at":"2024-06-24T06:21:59Z","title":"VideoHallucer: Evaluating Intrinsic and Extrinsic Hallucinations in Large Video-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16338","snapshot_observed_at":"2026-08-12T17:43:03.336459Z","title":"Videohallucer: Evaluating intrinsic and ex- trinsic hallucinations in large video-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.336459Z"},"links":{"cited_paper":"/paper/2406.16338","citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:7a8dedb7bb96f9bcea3e38e8a9d545f1f75511c01188d9a8ab02b68062edba93","observation_id":"97f740c3-73c6-4c9e-8958-67f8bdfdf36e","resolution":{"observed_at":"2026-08-12T17:43:03.336459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:03.997911Z","title":"Videollamb: Long video understanding with recurrent mem- ory bridges","venue":null,"work_id":"9ec7736f-9473-4841-aeed-f5e36c13a6ed","year":2024},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.341593Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:6a79fbc93212d7e74eb8fe957a3b8320c60bb533064ef5579ee4b6fc86770cea","observation_id":"bd29c8d1-fd60-4a56-b0ad-e2dc3962211b","resolution":{"observed_at":"2026-08-12T17:43:04.003342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07798","last_updated":"2024-06-10T13:55:21Z","snapshot_observed_at":"2026-08-13T00:08:51.202655Z","submitted_at":"2024-05-13T14:42:13Z","title":"FreeVA: Offline MLLM as Training-Free Video Assistant","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.07798","snapshot_observed_at":"2026-08-12T17:43:03.346619Z","title":"Freeva: Offline MLLM as training-free video assistant","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.346619Z"},"links":{"cited_paper":"/paper/2405.07798","citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:31518b86c0012798a51a79a25d3b69538539f9b90ea2a1ae9c86eda4773755ba","observation_id":"cc9702e0-bbdb-40bd-a4b7-33a4e5b83220","resolution":{"observed_at":"2026-08-12T17:43:03.346619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:03.981054Z","title":"Davis, Kristen Grauman, and Rog´erio Schmidt Feris","venue":null,"work_id":"0ffa4105-1c60-4dec-ab33-948cedf7f307","year":2018},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.352245Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:06bc5b30b9889f8d9c8806a0daa5fe8e183c1b47ade13f26aa6981d4fba2ed54","observation_id":"0d789eab-03a8-4918-a2c7-8a4e8d87ea3a","resolution":{"observed_at":"2026-08-12T17:43:03.986333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:03.964245Z","title":"Deep learning for video classification and captioning","venue":null,"work_id":"cb656d8e-fe7f-48c4-89a5-f259e9cc76d9","year":2017},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.356916Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:cb2ea7eea1b7b7dc4efdc3ef41ecfbf521526d940d4021c9edb95163ddd0181e","observation_id":"c824db95-0761-4a49-8aef-c606a9170226","resolution":{"observed_at":"2026-08-12T17:43:03.969334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:03.361819Z","title":"Msr-vtt: A large video description dataset for bridging video and language","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.361819Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:e52945ab66a3b42a52930f723eed6ec3d49f40058f1df3eb7a4723c1324a1aca","observation_id":"b0b61000-7204-46e3-9c89-70cbe5eb90f7","resolution":{"observed_at":"2026-08-12T17:43:03.361819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:03.935726Z","title":"MSR-VTT: A large video description dataset for bridging video and language","venue":null,"work_id":"5628d046-7cbd-4bb8-a525-ab5d52d66c3a","year":2016},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.366481Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:3995b65d0a6a77740364c15408dbbd412f7682f2c7bd0588363c3e86399eb9c1","observation_id":"b417a12e-c613-4623-b461-5dcfb2fc48c0","resolution":{"observed_at":"2026-08-12T17:43:03.940819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16994","last_updated":"2024-04-29T14:52:02Z","snapshot_observed_at":"2026-08-13T20:40:43.794560Z","submitted_at":"2024-04-25T19:29:55Z","title":"PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16994","snapshot_observed_at":"2026-08-12T17:43:03.371221Z","title":"Pllava: Parameter-free llava extension from images to videos for video dense captioning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.371221Z"},"links":{"cited_paper":"/paper/2404.16994","citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:33f9faeddc04ec9968d97045a3d2593cbacd89eb890d07420e98395009bcce1b","observation_id":"580d49b8-86fd-4237-b6e6-0aaf0f50a8b1","resolution":{"observed_at":"2026-08-12T17:43:03.371221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01442","last_updated":"2020-03-08T00:09:07Z","snapshot_observed_at":"2026-07-06T08:26:38.349660Z","submitted_at":"2019-10-03T13:16:36Z","title":"CLEVRER: CoLlision Events for Video REpresentation and Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01442","snapshot_observed_at":"2026-08-12T17:43:03.376477Z","title":"Clevrer: Collision events for video representation and reasoning.arXiv preprint arXiv:1910.01442, 2019","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.376477Z"},"links":{"cited_paper":"/paper/1910.01442","citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:606a8ebfd4faf877182dc93ae83b7c3bf082d63d389b01a133f23ae1a644474e","observation_id":"0886b48f-09a5-4d1f-a63a-4601f2da034d","resolution":{"observed_at":"2026-08-12T17:43:03.376477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:03.919198Z","title":"Tenenbaum","venue":null,"work_id":"4299cf58-964a-4721-8b0d-5d517b8909be","year":2020},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.381552Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:2a7186e2e3be203928234d031a597b62326243b5d66aeebb20ac6a7a06632699","observation_id":"86ed1b74-7c25-43e6-9888-5a20b69ec836","resolution":{"observed_at":"2026-08-12T17:43:03.924319Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-08-13T15:50:38.254753Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-12T17:43:03.386720Z","title":"Video-llama: An instruction-tuned audio-visual language model for video un- derstanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.386720Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:9cf6e25095a6cdce9f08c9c329e721368f8ef0593a1e0f2372e7feae562cc617","observation_id":"ac5110db-7965-434d-a3c8-be105974b135","resolution":{"observed_at":"2026-08-12T17:43:03.386720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08085","last_updated":"2024-06-30T05:39:46Z","snapshot_observed_at":"2026-08-13T01:15:12.087659Z","submitted_at":"2024-06-12T11:07:55Z","title":"Flash-VStream: Memory-Based Real-Time Understanding for Long Video Streams","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08085","snapshot_observed_at":"2026-08-12T17:43:03.391576Z","title":"Flash-vstream: Memory- based real-time understanding for long video streams","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.391576Z"},"links":{"cited_paper":"/paper/2406.08085","citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:31456ed7eac4261b59a6f544801dff8d280ff545a2d587ffbe26e4795a88bceb","observation_id":"5cbfdf1e-ed6a-4579-8036-f4c7b9d9ea87","resolution":{"observed_at":"2026-08-12T17:43:03.391576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:03.900651Z","title":"Llama- adapter: Efficient fine-tuning of language models with zero- init attention","venue":null,"work_id":"53285447-3c9b-413f-9a2e-367cc5d31c72","year":2023},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.396276Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:6f10a7e0a1c628c28c7df906a5c8e533b4828af6965edfa13f662703001583b6","observation_id":"f67af649-7e95-4e51-9057-9c8392cd8a03","resolution":{"observed_at":"2026-08-12T17:43:03.906623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:03.880461Z","title":"Please Carefully Think","venue":null,"work_id":"844b2ec3-e896-4270-b50f-5fd43a489fd7","year":2024},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.400998Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:dc78ca373219731b255b95a902a17ade1ea07eaac16e1aa4c80f53f95215a8eb","observation_id":"f7d1270e-acba-4a7c-b2a9-061431d94cc9","resolution":{"observed_at":"2026-08-12T17:43:03.887845Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:04.711793Z","title":null,"venue":null,"work_id":"be22713c-7f7f-4c33-92c4-26541cfdf1d0","year":2011},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":200,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.042499Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:a11e96ffcf05d4f0c19aaf9083c04fd82ef4a0cb69af3cc74a68f3294937c642","observation_id":"831ab334-8259-405f-a2cb-5c78bfdc1331","resolution":{"observed_at":"2026-08-12T17:43:04.719668Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding"},"reference_resolution":{"displayed":80,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":35,"verified_exact":0,"verified_fuzzy":44},"total_outbound_references":80},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 80 of 80 outbound references and 0 inbound Pith citation observations for arXiv:2411.12355."}