{"as_of":"2026-08-10T19:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a53713cc5f264c9fbcd19273100522aab4b749f312db33ba2f25d021844973fc","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":33,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":33,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":33,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":33,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T15:35:30.244486Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T06:39:37.682244Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2409.14485","last_updated":"2024-12-10T12:45:31Z","snapshot_observed_at":"2026-08-10T13:02:21.561135Z","submitted_at":"2024-09-22T15:13:31Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","version":4},"cited_work":{"arxiv_id":"2409.14485","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.14485","snapshot_observed_at":"2026-07-04T06:39:37.682244Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","venue":null,"work_id":"1974d26a-10e2-4170-b1ee-626217ce7f74","year":2024},"citing_paper":{"arxiv_id":"2406.04264","last_updated":"2025-01-01T15:53:58Z","snapshot_observed_at":"2026-08-03T20:38:36.602554Z","submitted_at":"2024-06-06T17:09:32Z","title":"MLVU: Benchmarking Multi-task Long Video Understanding","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-14T19:55:26.333923Z"},"links":{"cited_paper":"/paper/2409.14485","citing_paper":"/paper/2406.04264"},"observation_digest":"sha256:fe950cbc399b58553f88a806c17fb1f9e4a1cf753488c05a55a217bd60649487","observation_id":"60d92558-0dc5-40b6-b968-b9685ac8c8b2","resolution":{"observed_at":"2026-05-14T19:55:26.433404Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14485","last_updated":"2024-12-10T12:45:31Z","snapshot_observed_at":"2026-08-10T13:02:21.561135Z","submitted_at":"2024-09-22T15:13:31Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","version":4},"cited_work":{"arxiv_id":"2409.14485","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.14485","snapshot_observed_at":"2026-07-04T06:39:37.682244Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","venue":null,"work_id":"1974d26a-10e2-4170-b1ee-626217ce7f74","year":2024},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"cited_paper":"/paper/2409.14485","citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:a29def8c1a3639e0d2e00e41851d25b5162a20160b3ad1fd8023802d1c9d338a","observation_id":"1cf91e4a-058b-46e0-825a-d4ae68ca3742","resolution":{"observed_at":"2026-05-23T07:42:42.987016Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14485","last_updated":"2024-12-10T12:45:31Z","snapshot_observed_at":"2026-08-10T13:02:21.561135Z","submitted_at":"2024-09-22T15:13:31Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","version":4},"cited_work":{"arxiv_id":"2409.14485","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.14485","snapshot_observed_at":"2026-07-04T06:39:37.682244Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","venue":null,"work_id":"1974d26a-10e2-4170-b1ee-626217ce7f74","year":2024},"citing_paper":{"arxiv_id":"2501.00574","last_updated":"2025-07-13T16:21:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-31T18:01:23Z","title":"VideoChat-Flash: Hierarchical Compression for Long-Context Video Modeling","version":4},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-18T04:02:43.261543Z"},"links":{"cited_paper":"/paper/2409.14485","citing_paper":"/paper/2501.00574"},"observation_digest":"sha256:b8df03eda47578414ddd66eda0e5890e4e241eac03bd9ea21576fd62d016a24e","observation_id":"731ff6fb-eb7b-48c7-b925-bcf2ff8d0414","resolution":{"observed_at":"2026-05-18T04:02:43.503594Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14485","last_updated":"2024-12-10T12:45:31Z","snapshot_observed_at":"2026-08-10T13:02:21.561135Z","submitted_at":"2024-09-22T15:13:31Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","version":4},"cited_work":{"arxiv_id":"2409.14485","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.14485","snapshot_observed_at":"2026-07-04T06:39:37.682244Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","venue":null,"work_id":"1974d26a-10e2-4170-b1ee-626217ce7f74","year":2024},"citing_paper":{"arxiv_id":"2501.12386","last_updated":"2025-07-13T18:57:17Z","snapshot_observed_at":"2026-08-06T07:17:05.291678Z","submitted_at":"2025-01-21T18:59:00Z","title":"InternVideo2.5: Empowering Video MLLMs with Long and Rich Context Modeling","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-17T02:52:20.643070Z"},"links":{"cited_paper":"/paper/2409.14485","citing_paper":"/paper/2501.12386"},"observation_digest":"sha256:f4c1ca932bbd9bdf20d0c04f07fb546ada66862b760f4fc6fef95665b1d265aa","observation_id":"8467a30b-0658-47f3-8e17-081184e9bdde","resolution":{"observed_at":"2026-05-17T02:52:20.770114Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14485","last_updated":"2024-12-10T12:45:31Z","snapshot_observed_at":"2026-08-10T13:02:21.561135Z","submitted_at":"2024-09-22T15:13:31Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14485","snapshot_observed_at":"2026-08-10T15:35:30.244486Z","title":"Video-xl: Extra-long vision language model for hour-scale video understanding.arXiv preprint arXiv:2409.14485, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-08-10T15:26:21.476918Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T15:35:30.244486Z"},"links":{"cited_paper":"/paper/2409.14485","citing_paper":"/paper/2501.13919"},"observation_digest":"sha256:e7359e3193041764f0e3eb115f0e6fe9dbc3ab2e59bf1af76bb57e1917cead4f","observation_id":"7b71ba94-2146-45e8-8a0f-07d06ad2a63e","resolution":{"observed_at":"2026-08-10T15:35:30.244486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14485","last_updated":"2024-12-10T12:45:31Z","snapshot_observed_at":"2026-08-10T13:02:21.561135Z","submitted_at":"2024-09-22T15:13:31Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14485","snapshot_observed_at":"2026-08-09T15:04:36.988659Z","title":"Video-xl: Extra-long vision language model for hour-scale video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01549","last_updated":"2025-02-03T17:30:19Z","snapshot_observed_at":"2026-08-09T16:01:36.816495Z","submitted_at":"2025-02-03T17:30:19Z","title":"VideoRAG: Retrieval-Augmented Generation with Extreme Long-Context Videos","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:36.988659Z"},"links":{"cited_paper":"/paper/2409.14485","citing_paper":"/paper/2502.01549"},"observation_digest":"sha256:db40574bcb7b27e0963f522cf7707171778c09cc3d97c887854f9dd11fc2fcc9","observation_id":"beec19e8-68f9-4737-ac36-e866b13ef6d7","resolution":{"observed_at":"2026-08-09T15:04:36.988659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14485","last_updated":"2024-12-10T12:45:31Z","snapshot_observed_at":"2026-08-10T13:02:21.561135Z","submitted_at":"2024-09-22T15:13:31Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14485","snapshot_observed_at":"2026-08-08T15:31:16.956964Z","title":"Video-xl: Extra-long vision language model for hour-scale video understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06428","last_updated":"2025-02-11T14:59:25Z","snapshot_observed_at":"2026-08-10T08:26:15.411427Z","submitted_at":"2025-02-10T13:03:05Z","title":"CoS: Chain-of-Shot Prompting for Long Video Understanding","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T15:31:16.956964Z"},"links":{"cited_paper":"/paper/2409.14485","citing_paper":"/paper/2502.06428"},"observation_digest":"sha256:842131f2a74dfbe16c24788ee42cebfeb372641d375476e0695371938bc978de","observation_id":"70421979-ef9e-42f6-a482-5d1d7dcc3c9e","resolution":{"observed_at":"2026-08-08T15:31:16.956964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14485","last_updated":"2024-12-10T12:45:31Z","snapshot_observed_at":"2026-08-10T13:02:21.561135Z","submitted_at":"2024-09-22T15:13:31Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14485","snapshot_observed_at":"2026-08-07T15:34:43.251039Z","title":"Video-xl: Extra-long vision language model for hour-scale video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14640","last_updated":"2025-05-20T17:26:32Z","snapshot_observed_at":"2026-08-10T08:26:12.719387Z","submitted_at":"2025-05-20T17:26:32Z","title":"VideoEval-Pro: Robust and Realistic Long Video Understanding Evaluation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:43.251039Z"},"links":{"cited_paper":"/paper/2409.14485","citing_paper":"/paper/2505.14640"},"observation_digest":"sha256:3250f24f333e7cc12eda8d904e82b7a7162575e8103086871aba54c87c2aa045","observation_id":"5523b6de-9a63-4e83-8221-c14dd59cc6bc","resolution":{"observed_at":"2026-08-07T15:34:43.251039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14485","last_updated":"2024-12-10T12:45:31Z","snapshot_observed_at":"2026-08-10T13:02:21.561135Z","submitted_at":"2024-09-22T15:13:31Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14485","snapshot_observed_at":"2026-08-07T15:20:58.584507Z","title":"Video-xl: Extra-long vision language model for hour-scale video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15447","last_updated":"2025-05-21T12:29:40Z","snapshot_observed_at":"2026-08-09T00:23:31.907645Z","submitted_at":"2025-05-21T12:29:40Z","title":"ViaRL: Adaptive Temporal Grounding via Visual Iterated Amplification Reinforcement Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T15:20:58.584507Z"},"links":{"cited_paper":"/paper/2409.14485","citing_paper":"/paper/2505.15447"},"observation_digest":"sha256:77b2d08639f735c4094a27fa4b926209bb1ffa03122f23b5dc9a5009b907dd3c","observation_id":"8d9c289e-2d5a-4082-a8ec-fcc72a4a1192","resolution":{"observed_at":"2026-08-07T15:20:58.584507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14485","last_updated":"2024-12-10T12:45:31Z","snapshot_observed_at":"2026-08-10T13:02:21.561135Z","submitted_at":"2024-09-22T15:13:31Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14485","snapshot_observed_at":"2026-08-07T12:37:20.806587Z","title":"Video-xl: Extra-long vision language model for hour-scale video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24158","last_updated":"2025-05-30T03:04:28Z","snapshot_observed_at":"2026-08-10T08:26:14.415807Z","submitted_at":"2025-05-30T03:04:28Z","title":"Threading Keyframe with Narratives: MLLMs as Strong Long Video Comprehenders","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:20.806587Z"},"links":{"cited_paper":"/paper/2409.14485","citing_paper":"/paper/2505.24158"},"observation_digest":"sha256:d59bdc39a51abbb004d392286157b2f022271150a1b9335d0811df2f6081b712","observation_id":"f19b5cbc-5429-425a-8010-6d84e9d4ed61","resolution":{"observed_at":"2026-08-07T12:37:20.806587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14485","last_updated":"2024-12-10T12:45:31Z","snapshot_observed_at":"2026-08-10T13:02:21.561135Z","submitted_at":"2024-09-22T15:13:31Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14485","snapshot_observed_at":"2026-08-07T11:59:08.637236Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.00993","last_updated":"2025-06-01T12:49:39Z","snapshot_observed_at":"2026-08-08T18:44:33.509277Z","submitted_at":"2025-06-01T12:49:39Z","title":"FlexSelect: Flexible Token Selection for Efficient Long Video Understanding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:08.637236Z"},"links":{"cited_paper":"/paper/2409.14485","citing_paper":"/paper/2506.00993"},"observation_digest":"sha256:1d7dae2a227bd1e40c8713a88a9437b2991c35e1cbf8da3279adb68fb2fe7d90","observation_id":"358355fd-9998-444c-aae7-b87c1418de3a","resolution":{"observed_at":"2026-08-07T11:59:08.637236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14485","last_updated":"2024-12-10T12:45:31Z","snapshot_observed_at":"2026-08-10T13:02:21.561135Z","submitted_at":"2024-09-22T15:13:31Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14485","snapshot_observed_at":"2026-08-07T12:50:04.246155Z","title":"Video-xl: Extra-long vision language model for hour-scale video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03179","last_updated":"2025-05-29T13:17:25Z","snapshot_observed_at":"2026-08-08T00:26:20.360231Z","submitted_at":"2025-05-29T13:17:25Z","title":"Vid-SME: Membership Inference Attacks against Large Video Understanding Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:04.246155Z"},"links":{"cited_paper":"/paper/2409.14485","citing_paper":"/paper/2506.03179"},"observation_digest":"sha256:a7c0dab2573b3a011fcbc13f3a12e9c2faa63ec5a9655fbd76abf01979d55441","observation_id":"c8017646-7848-455d-855d-be4096fd1aca","resolution":{"observed_at":"2026-08-07T12:50:04.246155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14485","last_updated":"2024-12-10T12:45:31Z","snapshot_observed_at":"2026-08-10T13:02:21.561135Z","submitted_at":"2024-09-22T15:13:31Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14485","snapshot_observed_at":"2026-08-07T05:26:47.226160Z","title":"Video-xl: Extra-long vision language model for hour-scale video understanding.arXiv preprint arXiv:2409.14485, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-09T13:06:51.941159Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.226160Z"},"links":{"cited_paper":"/paper/2409.14485","citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:5179423f23297a925b02d3a89a0f675f8665a44239e6787543f46b2898b973e8","observation_id":"e951b058-651e-41cb-82f6-f9ca968c09dd","resolution":{"observed_at":"2026-08-07T05:26:47.226160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14485","last_updated":"2024-12-10T12:45:31Z","snapshot_observed_at":"2026-08-10T13:02:21.561135Z","submitted_at":"2024-09-22T15:13:31Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14485","snapshot_observed_at":"2026-08-06T22:36:38.507321Z","title":"Video-xl: Extra-long vision language model for hour-scale video understanding.arXiv preprint arXiv:2409.14485, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-08T13:40:41.778180Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:38.507321Z"},"links":{"cited_paper":"/paper/2409.14485","citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:3a7eada83fb10fda68df15a2b9662f2cfd46ee19254194dce2a9be03131374a5","observation_id":"b3b21a56-e1ad-4778-a6ce-c322c3a42042","resolution":{"observed_at":"2026-08-06T22:36:38.507321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14485","last_updated":"2024-12-10T12:45:31Z","snapshot_observed_at":"2026-08-10T13:02:21.561135Z","submitted_at":"2024-09-22T15:13:31Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14485","snapshot_observed_at":"2026-08-06T22:15:03.755141Z","title":"Video-xl: Extra-long vision language model for hour-scale video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-09T21:52:46.816951Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:03.755141Z"},"links":{"cited_paper":"/paper/2409.14485","citing_paper":"/paper/2506.22139"},"observation_digest":"sha256:60ae6515121c4e00c5173f5e1841330ec64afe1430e4b912f22cd83bfeb621a3","observation_id":"51b1b8f9-be18-4d35-bc41-a649916768d0","resolution":{"observed_at":"2026-08-06T22:15:03.755141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14485","last_updated":"2024-12-10T12:45:31Z","snapshot_observed_at":"2026-08-10T13:02:21.561135Z","submitted_at":"2024-09-22T15:13:31Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14485","snapshot_observed_at":"2026-08-06T22:00:07.069669Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00068","last_updated":"2025-06-28T12:12:06Z","snapshot_observed_at":"2026-08-09T10:41:05.778908Z","submitted_at":"2025-06-28T12:12:06Z","title":"MANTA: Cross-Modal Semantic Alignment and Information-Theoretic Optimization for Long-form Multimodal Understanding","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T22:00:07.069669Z"},"links":{"cited_paper":"/paper/2409.14485","citing_paper":"/paper/2507.00068"},"observation_digest":"sha256:a6c1c45a22e79884f8953d380ec8c71d7aaa11531f75d81e2c31eee8e8599586","observation_id":"bee69751-5848-4f41-9434-e3ee6d7c25b8","resolution":{"observed_at":"2026-08-06T22:00:07.069669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14485","last_updated":"2024-12-10T12:45:31Z","snapshot_observed_at":"2026-08-10T13:02:21.561135Z","submitted_at":"2024-09-22T15:13:31Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14485","snapshot_observed_at":"2026-08-06T20:44:02.472353Z","title":"Video-xl: Extra-long vision language model for hour-scale video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-09T14:38:44.861382Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:02.472353Z"},"links":{"cited_paper":"/paper/2409.14485","citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:17de67afefa1e3793f51e17d816abd9c48db3ca99dcbb340b6393c0c1966d221","observation_id":"402060c6-11ee-452e-afb6-8d77ad4cb01e","resolution":{"observed_at":"2026-08-06T20:44:02.472353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14485","last_updated":"2024-12-10T12:45:31Z","snapshot_observed_at":"2026-08-10T13:02:21.561135Z","submitted_at":"2024-09-22T15:13:31Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14485","snapshot_observed_at":"2026-08-06T20:29:54.223612Z","title":"Video-xl: Extra-long vision language model for hour-scale video understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:54.223612Z"},"links":{"cited_paper":"/paper/2409.14485","citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:cd265972976dfe01648970ed98ce0ed272d89bafcd78080280e3ef3127b9e9df","observation_id":"11789708-fe6c-41c0-b5a3-1c112e649775","resolution":{"observed_at":"2026-08-06T20:29:54.223612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14485","last_updated":"2024-12-10T12:45:31Z","snapshot_observed_at":"2026-08-10T13:02:21.561135Z","submitted_at":"2024-09-22T15:13:31Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14485","snapshot_observed_at":"2026-08-06T21:59:16.899236Z","title":"arXiv preprint arXiv:2409.14485","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02946","last_updated":"2025-06-28T15:24:05Z","snapshot_observed_at":"2026-08-10T17:05:48.881739Z","submitted_at":"2025-06-28T15:24:05Z","title":"Iterative Zoom-In: Temporal Interval Exploration for Long Video Understanding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:16.899236Z"},"links":{"cited_paper":"/paper/2409.14485","citing_paper":"/paper/2507.02946"},"observation_digest":"sha256:5ea25c802648043546afbf01c0119750289498a80b691f977cfd3083aa497f01","observation_id":"a03ecc67-4006-4690-9bf6-bdae02f2ad6f","resolution":{"observed_at":"2026-08-06T21:59:16.899236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14485","last_updated":"2024-12-10T12:45:31Z","snapshot_observed_at":"2026-08-10T13:02:21.561135Z","submitted_at":"2024-09-22T15:13:31Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14485","snapshot_observed_at":"2026-08-06T18:10:13.296306Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-10T05:00:18.779933Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:13.296306Z"},"links":{"cited_paper":"/paper/2409.14485","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:8fd82b6ac9ac73c85c10e5cf1d91278ead83186856eb01c8f46162b9257e413e","observation_id":"c2df738d-2eb6-4bef-b7fd-a788422984d2","resolution":{"observed_at":"2026-08-06T18:10:13.296306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14485","last_updated":"2024-12-10T12:45:31Z","snapshot_observed_at":"2026-08-10T13:02:21.561135Z","submitted_at":"2024-09-22T15:13:31Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14485","snapshot_observed_at":"2026-08-06T17:55:45.402521Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09693","last_updated":"2025-07-13T16:09:58Z","snapshot_observed_at":"2026-08-10T16:27:53.336213Z","submitted_at":"2025-07-13T16:09:58Z","title":"ExpStar: Towards Automatic Commentary Generation for Multi-discipline Scientific Experiments","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T17:55:45.402521Z"},"links":{"cited_paper":"/paper/2409.14485","citing_paper":"/paper/2507.09693"},"observation_digest":"sha256:4de04f5d4293c25663fc88eb14218ffff9c243baa97e333022fcdc303c3ab267","observation_id":"e6347225-408e-4c8d-a637-f6576a7f0245","resolution":{"observed_at":"2026-08-06T17:55:45.402521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14485","last_updated":"2024-12-10T12:45:31Z","snapshot_observed_at":"2026-08-10T13:02:21.561135Z","submitted_at":"2024-09-22T15:13:31Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14485","snapshot_observed_at":"2026-08-06T17:52:02.738153Z","title":"Video-xl: Extra-long vision language model for hour-scale video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09815","last_updated":"2025-07-22T17:15:14Z","snapshot_observed_at":"2026-08-10T11:50:06.525402Z","submitted_at":"2025-07-13T22:14:35Z","title":"VRU-Accident: A Vision-Language Benchmark for Video Question Answering and Dense Captioning for Accident Scene Understanding","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T17:52:02.738153Z"},"links":{"cited_paper":"/paper/2409.14485","citing_paper":"/paper/2507.09815"},"observation_digest":"sha256:c6f34e4ca5b6e7d26c7d1483c787705c539956b2b09c338a8b728b5137218945","observation_id":"dab9472d-2449-4130-acf1-d9b6d776d216","resolution":{"observed_at":"2026-08-06T17:52:02.738153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14485","last_updated":"2024-12-10T12:45:31Z","snapshot_observed_at":"2026-08-10T13:02:21.561135Z","submitted_at":"2024-09-22T15:13:31Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14485","snapshot_observed_at":"2026-08-06T12:46:19.505318Z","title":"Video-xl: Extra-long vision language model for hour-scale video understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21507","last_updated":"2025-07-29T05:17:48Z","snapshot_observed_at":"2026-08-10T17:59:33.254256Z","submitted_at":"2025-07-29T05:17:48Z","title":"VAGU & GtS: LLM-Based Benchmark and Framework for Joint Video Anomaly Grounding and Understanding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T12:46:19.505318Z"},"links":{"cited_paper":"/paper/2409.14485","citing_paper":"/paper/2507.21507"},"observation_digest":"sha256:91393ee954886ea224161b342e6c3c71d5da86c23fd82c5469eff8ea53516a97","observation_id":"e27b375b-5317-4540-b42d-d6fe98846f67","resolution":{"observed_at":"2026-08-06T12:46:19.505318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14485","last_updated":"2024-12-10T12:45:31Z","snapshot_observed_at":"2026-08-10T13:02:21.561135Z","submitted_at":"2024-09-22T15:13:31Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14485","snapshot_observed_at":"2026-08-04T20:32:56.818052Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.818052Z"},"links":{"cited_paper":"/paper/2409.14485","citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:d8d454aa39c18a5a5f3a83c08b757fa01597a97d79c609326114438a55d5b10f","observation_id":"b7efc35b-e33d-4610-9fea-8e2297ab618c","resolution":{"observed_at":"2026-08-04T20:32:56.818052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14485","last_updated":"2024-12-10T12:45:31Z","snapshot_observed_at":"2026-08-10T13:02:21.561135Z","submitted_at":"2024-09-22T15:13:31Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14485","snapshot_observed_at":"2026-08-03T18:22:29.150095Z","title":"Video- xl: Extra-long vision language model for hour-scale video understanding.arXiv preprint arXiv:2409.14485, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-03T18:22:29.150095Z"},"links":{"cited_paper":"/paper/2409.14485","citing_paper":"/paper/2512.05774"},"observation_digest":"sha256:ff975aec74ecce6bdcfce12e890b7a96c98770d259033b95c11869a4053fc908","observation_id":"b0b2081b-5f53-4d21-8b42-08d2cc83303b","resolution":{"observed_at":"2026-08-03T18:22:29.150095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14485","last_updated":"2024-12-10T12:45:31Z","snapshot_observed_at":"2026-08-10T13:02:21.561135Z","submitted_at":"2024-09-22T15:13:31Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","version":4},"cited_work":{"arxiv_id":"2409.14485","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.14485","snapshot_observed_at":"2026-07-04T06:39:37.682244Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","venue":null,"work_id":"1974d26a-10e2-4170-b1ee-626217ce7f74","year":2024},"citing_paper":{"arxiv_id":"2603.27259","last_updated":"2026-06-18T21:01:40Z","snapshot_observed_at":"2026-08-02T11:52:58.572026Z","submitted_at":"2026-03-28T12:44:19Z","title":"Seeing the Scene Matters: Revealing Forgetting in Video Understanding Models with a Scene-Aware Long-Video Benchmark","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-14T22:05:07.326202Z"},"links":{"cited_paper":"/paper/2409.14485","citing_paper":"/paper/2603.27259"},"observation_digest":"sha256:3fe906abb18df544f86b589e3112af80ae9bf9e56b22e5f7d4ef4619108c4791","observation_id":"be7f6567-0ae3-4f92-81cc-1cc6f5346e46","resolution":{"observed_at":"2026-05-14T22:08:04.322261Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14485","last_updated":"2024-12-10T12:45:31Z","snapshot_observed_at":"2026-08-10T13:02:21.561135Z","submitted_at":"2024-09-22T15:13:31Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","version":4},"cited_work":{"arxiv_id":"2409.14485","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.14485","snapshot_observed_at":"2026-07-04T06:39:37.682244Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","venue":null,"work_id":"1974d26a-10e2-4170-b1ee-626217ce7f74","year":2024},"citing_paper":{"arxiv_id":"2604.11627","last_updated":"2026-04-13T15:38:22Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-13T15:38:22Z","title":"POINTS-Long: Adaptive Dual-Mode Visual Reasoning in MLLMs","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:08.671342Z"},"links":{"cited_paper":"/paper/2409.14485","citing_paper":"/paper/2604.11627"},"observation_digest":"sha256:a18d65cc47b65eb7946b35d596afe62808107e2a0ef491e67a5ca8c326f574a8","observation_id":"32f16455-d6c1-4bea-9e65-a38aff7fcc5c","resolution":{"observed_at":"2026-05-11T10:41:04.170343Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14485","last_updated":"2024-12-10T12:45:31Z","snapshot_observed_at":"2026-08-10T13:02:21.561135Z","submitted_at":"2024-09-22T15:13:31Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","version":4},"cited_work":{"arxiv_id":"2409.14485","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.14485","snapshot_observed_at":"2026-07-04T06:39:37.682244Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","venue":null,"work_id":"1974d26a-10e2-4170-b1ee-626217ce7f74","year":2024},"citing_paper":{"arxiv_id":"2604.14149","last_updated":"2026-04-16T15:48:38Z","snapshot_observed_at":"2026-07-06T23:02:00.082783Z","submitted_at":"2026-04-15T17:59:52Z","title":"One Token per Highly Selective Frame: Towards Extreme Compression for Long Video Understanding","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-10T13:28:58.920442Z"},"links":{"cited_paper":"/paper/2409.14485","citing_paper":"/paper/2604.14149"},"observation_digest":"sha256:f1e3454f830bbd0af2388f98a9c22b253896aed4f0c3c73691f07eb58a2a070c","observation_id":"eb07d3ab-fd95-49e8-babd-079361566bca","resolution":{"observed_at":"2026-05-10T13:30:26.608836Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14485","last_updated":"2024-12-10T12:45:31Z","snapshot_observed_at":"2026-08-10T13:02:21.561135Z","submitted_at":"2024-09-22T15:13:31Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","version":4},"cited_work":{"arxiv_id":"2409.14485","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.14485","snapshot_observed_at":"2026-07-04T06:39:37.682244Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","venue":null,"work_id":"1974d26a-10e2-4170-b1ee-626217ce7f74","year":2024},"citing_paper":{"arxiv_id":"2606.06532","last_updated":"2026-06-03T17:47:49Z","snapshot_observed_at":"2026-08-07T12:55:44.925060Z","submitted_at":"2026-06-03T17:47:49Z","title":"GOPAgen: Motion-Aware and Efficient Agentic Long-Video Understanding with Structural Memory and Hierarchical Reasoning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-28T06:33:32.090913Z"},"links":{"cited_paper":"/paper/2409.14485","citing_paper":"/paper/2606.06532"},"observation_digest":"sha256:3572df25ecd6bdf5bfcb0d52e329c8ecd31586bfc2d2a1b30886ee9e435552df","observation_id":"396f883b-4be0-4ea3-8768-009ca23e2b43","resolution":{"observed_at":"2026-07-02T07:56:47.379342Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14485","last_updated":"2024-12-10T12:45:31Z","snapshot_observed_at":"2026-08-10T13:02:21.561135Z","submitted_at":"2024-09-22T15:13:31Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","version":4},"cited_work":{"arxiv_id":"2409.14485","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.14485","snapshot_observed_at":"2026-07-04T06:39:37.682244Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","venue":null,"work_id":"1974d26a-10e2-4170-b1ee-626217ce7f74","year":2024},"citing_paper":{"arxiv_id":"2606.11740","last_updated":"2026-06-10T07:16:27Z","snapshot_observed_at":"2026-08-02T02:17:16.809620Z","submitted_at":"2026-06-10T07:16:27Z","title":"UniReason-Med: A Shared Grounded Reasoning Interface for 2D-to-3D Transfer in Medical VQA","version":1},"reference_index":111,"source":"arxiv_source","source_observed_at":"2026-06-27T10:21:12.782864Z"},"links":{"cited_paper":"/paper/2409.14485","citing_paper":"/paper/2606.11740"},"observation_digest":"sha256:f77aa87a9a069f324b5e9d7378e646fa068e92f2440eb088a59d0cb38a7e3627","observation_id":"6dc7a3a2-5fda-4960-a6a6-90e408212562","resolution":{"observed_at":"2026-07-03T09:47:59.401036Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14485","last_updated":"2024-12-10T12:45:31Z","snapshot_observed_at":"2026-08-10T13:02:21.561135Z","submitted_at":"2024-09-22T15:13:31Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","version":4},"cited_work":{"arxiv_id":"2409.14485","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.14485","snapshot_observed_at":"2026-07-04T06:39:37.682244Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","venue":null,"work_id":"1974d26a-10e2-4170-b1ee-626217ce7f74","year":2024},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":253,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"cited_paper":"/paper/2409.14485","citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:f87fe684129ffa0a764d459a90c3f4c107753fccaa99e210dd7d148eef6e2ec7","observation_id":"a4d5c3f9-8265-4d0c-8731-2cf740e7b81c","resolution":{"observed_at":"2026-07-03T10:48:02.928923Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14485","last_updated":"2024-12-10T12:45:31Z","snapshot_observed_at":"2026-08-10T13:02:21.561135Z","submitted_at":"2024-09-22T15:13:31Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","version":4},"cited_work":{"arxiv_id":"2409.14485","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.14485","snapshot_observed_at":"2026-07-04T06:39:37.682244Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","venue":null,"work_id":"1974d26a-10e2-4170-b1ee-626217ce7f74","year":2024},"citing_paper":{"arxiv_id":"2606.21734","last_updated":"2026-06-19T20:43:49Z","snapshot_observed_at":"2026-08-05T18:05:51.515234Z","submitted_at":"2026-06-19T20:43:49Z","title":"HPP: Hierarchical Programmatic Probing for Long Video Understanding by Decoupling Perception and Reasoning","version":1},"reference_index":139,"source":"arxiv_source","source_observed_at":"2026-06-26T14:19:53.450263Z"},"links":{"cited_paper":"/paper/2409.14485","citing_paper":"/paper/2606.21734"},"observation_digest":"sha256:1806503886c01a1af52514b1f761b3d955065136b937ec1d1ad72acc2bc4be46","observation_id":"73de4bda-be24-4798-8bc7-9b58a48d0114","resolution":{"observed_at":"2026-07-04T06:39:37.683787Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14485","last_updated":"2024-12-10T12:45:31Z","snapshot_observed_at":"2026-08-10T13:02:21.561135Z","submitted_at":"2024-09-22T15:13:31Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14485","snapshot_observed_at":"2026-08-04T23:46:51.608318Z","title":"IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01644","last_updated":"2026-08-03T03:27:46Z","snapshot_observed_at":"2026-08-10T14:57:44.819541Z","submitted_at":"2026-08-03T03:27:46Z","title":"CRAFT: Compression via Recursive Adaptive Fusion of Video Tokens for Vision-Language Models","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-04T23:46:51.608318Z"},"links":{"cited_paper":"/paper/2409.14485","citing_paper":"/paper/2608.01644"},"observation_digest":"sha256:97befe61c7c9486e65f0f93b4356df7a4221751fdede45f2bf7c992ed716972b","observation_id":"7dc63e75-60e7-488f-827d-82080ef78b28","resolution":{"observed_at":"2026-08-04T23:46:51.608318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2409.14485/citation-record","integrity":"/paper/2409.14485/integrity","json":"/paper/2409.14485/citation-record.json","paper":"/paper/2409.14485"},"outbound":[],"paper":{"arxiv_id":"2409.14485","last_updated":"2024-12-10T12:45:31Z","latest_version":4,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T13:02:21.561135Z","submitted_at":"2024-09-22T15:13:31Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 33 inbound Pith citation observations for arXiv:2409.14485."}