{"as_of":"2026-08-13T15:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:360f10d3eae312f43608b0a36ea857d2748f7a684e163a063916a87e64bf1b29","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:51:07.923531Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T05:40:00.723218Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.06928","last_updated":"2025-06-07T21:32:19Z","snapshot_observed_at":"2026-08-10T12:00:26.470686Z","submitted_at":"2025-06-07T21:32:19Z","title":"How Important are Videos for Training Video LLMs?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.06928","snapshot_observed_at":"2026-08-02T05:40:00.723218Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13305","last_updated":"2026-07-14T22:15:50Z","snapshot_observed_at":"2026-08-04T07:12:56.462277Z","submitted_at":"2026-07-14T22:15:50Z","title":"Accuracy Without Grounding: Diagnosing Visual Dependency Dissociation in Video LLM Benchmarks","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:00.723218Z"},"links":{"cited_paper":"/paper/2506.06928","citing_paper":"/paper/2607.13305"},"observation_digest":"sha256:e859b7f73a176565dc122f36b31ff6748693fa82221e6afb2166ff7f35a1a990","observation_id":"8c7647d5-6f3e-4110-8c64-34e90ee76aa9","resolution":{"observed_at":"2026-08-02T05:40:00.723218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.06928/citation-record","integrity":"/paper/2506.06928/integrity","json":"/paper/2506.06928/citation-record.json","paper":"/paper/2506.06928"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-12T17:29:41.806995Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T05:51:07.773495Z","title":"Qwen2.5-VL Technical Report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06928","last_updated":"2025-06-07T21:32:19Z","snapshot_observed_at":"2026-08-10T12:00:26.470686Z","submitted_at":"2025-06-07T21:32:19Z","title":"How Important are Videos for Training Video LLMs?","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:07.773495Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.06928"},"observation_digest":"sha256:2b0344fc9ceb79475fcb2becedc38d6039eeba5d4eb1bb9da602364c50eaaa60","observation_id":"65c748a2-cd0b-461a-97a9-c9cd92477f4f","resolution":{"observed_at":"2026-08-07T05:51:07.773495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:51:08.454497Z","title":"ShareGPT4Video: Improving Video Under- standing and Generation with Better Captions","venue":null,"work_id":"c8fb9dc7-875f-4639-af30-7faf82da2d44","year":null},"citing_paper":{"arxiv_id":"2506.06928","last_updated":"2025-06-07T21:32:19Z","snapshot_observed_at":"2026-08-10T12:00:26.470686Z","submitted_at":"2025-06-07T21:32:19Z","title":"How Important are Videos for Training Video LLMs?","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:07.779399Z"},"links":{"citing_paper":"/paper/2506.06928"},"observation_digest":"sha256:dad816d635019155854f90a2252352898999278fd544e942969b02aa6c224104","observation_id":"285cf941-cb86-40de-8a0d-f2cc99af891e","resolution":{"observed_at":"2026-08-07T05:51:08.459611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-07T05:51:07.784472Z","title":"VideoLLaMA 2: Advancing Spatial- Temporal Modeling and Audio Understanding in Video- LLMs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06928","last_updated":"2025-06-07T21:32:19Z","snapshot_observed_at":"2026-08-10T12:00:26.470686Z","submitted_at":"2025-06-07T21:32:19Z","title":"How Important are Videos for Training Video LLMs?","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:07.784472Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2506.06928"},"observation_digest":"sha256:86cd5e4633c59da9efa754abe3c554709af6d87fb8c32be3d1c4f09164e93fe2","observation_id":"ea581482-7c3a-42a9-a25d-ee24df90f017","resolution":{"observed_at":"2026-08-07T05:51:07.784472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07752","last_updated":"2025-03-25T09:46:02Z","snapshot_observed_at":"2026-08-12T22:26:31.050613Z","submitted_at":"2024-10-10T09:28:36Z","title":"Lost in Time: A New Temporal Benchmark for VideoLLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07752","snapshot_observed_at":"2026-08-07T05:51:07.790019Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06928","last_updated":"2025-06-07T21:32:19Z","snapshot_observed_at":"2026-08-10T12:00:26.470686Z","submitted_at":"2025-06-07T21:32:19Z","title":"How Important are Videos for Training Video LLMs?","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:07.790019Z"},"links":{"cited_paper":"/paper/2410.07752","citing_paper":"/paper/2506.06928"},"observation_digest":"sha256:709cc0dca298bac973b2a31ea7f9956403f191d8d9ea34d4d7cfd3a5503aea35","observation_id":"03cff194-f5a0-4074-90c0-a2701db95f6b","resolution":{"observed_at":"2026-08-07T05:51:07.790019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-07T05:51:07.795669Z","title":"Video-MME: The First- Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06928","last_updated":"2025-06-07T21:32:19Z","snapshot_observed_at":"2026-08-10T12:00:26.470686Z","submitted_at":"2025-06-07T21:32:19Z","title":"How Important are Videos for Training Video LLMs?","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:07.795669Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2506.06928"},"observation_digest":"sha256:3385105d497d24726a01e7d6b21685a3a88c0701ff74541d8afcb4ad04530b50","observation_id":"4f6aa8c0-6d3b-4c63-9c20-f096c821bc1d","resolution":{"observed_at":"2026-08-07T05:51:07.795669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T05:51:07.800928Z","title":"The Llama 3 Herd of Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06928","last_updated":"2025-06-07T21:32:19Z","snapshot_observed_at":"2026-08-10T12:00:26.470686Z","submitted_at":"2025-06-07T21:32:19Z","title":"How Important are Videos for Training Video LLMs?","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:07.800928Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.06928"},"observation_digest":"sha256:545c82935e69d8a4e5441b3caaf81a4a8c155662ba820ea1508772334bff4265","observation_id":"1c2a4e8b-65ba-4337-a695-abd2ff200285","resolution":{"observed_at":"2026-08-07T05:51:07.800928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:51:08.438605Z","title":"MA-LMM: Memory-Augmented Large Multimodal Model for Long-Term Video Understanding","venue":null,"work_id":"2e84e976-f48c-455b-8479-075eb246e51b","year":2024},"citing_paper":{"arxiv_id":"2506.06928","last_updated":"2025-06-07T21:32:19Z","snapshot_observed_at":"2026-08-10T12:00:26.470686Z","submitted_at":"2025-06-07T21:32:19Z","title":"How Important are Videos for Training Video LLMs?","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:07.806446Z"},"links":{"citing_paper":"/paper/2506.06928"},"observation_digest":"sha256:9d02529a4671516c6d360197f12bd7bfb4bf875b30b7467a507a0fdf5b323d01","observation_id":"bf156721-0a82-4991-b65e-8aa7f00a3508","resolution":{"observed_at":"2026-08-07T05:51:08.443799Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:51:08.421489Z","title":"LoRA: Low- Rank Adaptation of Large Language Models","venue":null,"work_id":"a7421821-9684-4df4-b10a-18ad7ac4d896","year":2022},"citing_paper":{"arxiv_id":"2506.06928","last_updated":"2025-06-07T21:32:19Z","snapshot_observed_at":"2026-08-10T12:00:26.470686Z","submitted_at":"2025-06-07T21:32:19Z","title":"How Important are Videos for Training Video LLMs?","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:07.811592Z"},"links":{"citing_paper":"/paper/2506.06928"},"observation_digest":"sha256:d8889c069dfaad829d78c8bbf3e8e92f2823e85281a30216d174d5c60e0d05ea","observation_id":"063e0f5c-e995-4454-a493-83357a8972d4","resolution":{"observed_at":"2026-08-07T05:51:08.427508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:51:08.401954Z","title":"TGIF-QA: Toward Spatio-Temporal Reason- ing in Visual Question Answering","venue":null,"work_id":"79acf9b4-d30b-49c1-a0ca-ffe55ed20eac","year":2017},"citing_paper":{"arxiv_id":"2506.06928","last_updated":"2025-06-07T21:32:19Z","snapshot_observed_at":"2026-08-10T12:00:26.470686Z","submitted_at":"2025-06-07T21:32:19Z","title":"How Important are Videos for Training Video LLMs?","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:07.817057Z"},"links":{"citing_paper":"/paper/2506.06928"},"observation_digest":"sha256:b7d5c0b28a4a80633236e4fc97bfbfc881098e29c865b7244cb9f271e1dce58c","observation_id":"ed31497f-5f07-422d-869b-cc8a4a3fd827","resolution":{"observed_at":"2026-08-07T05:51:08.408349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:51:08.383472Z","title":"CLEVR: A Diagnostic Dataset for Compositional Language and Elementary Visual Reasoning","venue":null,"work_id":"4fbf0fe8-3a87-428d-8340-ebd097dbee63","year":null},"citing_paper":{"arxiv_id":"2506.06928","last_updated":"2025-06-07T21:32:19Z","snapshot_observed_at":"2026-08-10T12:00:26.470686Z","submitted_at":"2025-06-07T21:32:19Z","title":"How Important are Videos for Training Video LLMs?","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:07.822018Z"},"links":{"citing_paper":"/paper/2506.06928"},"observation_digest":"sha256:95734b2768aeb4a4052ddf28a5400c4e6a484e74368e46c5dc8421566b5d8bb0","observation_id":"09ad63b2-12d0-452e-b6c1-6bcae633622a","resolution":{"observed_at":"2026-08-07T05:51:08.389004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:51:08.367735Z","title":"JUWELS Cluster and Booster: Exascale Pathfinder with Modular Supercomputing Architecture at Juelich Supercomputing Centre","venue":null,"work_id":"2b0c624d-0b56-4c16-ae6c-710ba64076f4","year":2021},"citing_paper":{"arxiv_id":"2506.06928","last_updated":"2025-06-07T21:32:19Z","snapshot_observed_at":"2026-08-10T12:00:26.470686Z","submitted_at":"2025-06-07T21:32:19Z","title":"How Important are Videos for Training Video LLMs?","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:07.827043Z"},"links":{"citing_paper":"/paper/2506.06928"},"observation_digest":"sha256:1e8f589a4d0a370e808c484ebd57276db9f14de761eafe5402e16e47769e9045","observation_id":"053fb2fb-be20-41d5-ad0e-0dc963146e8b","resolution":{"observed_at":"2026-08-07T05:51:08.373009Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T05:51:07.831670Z","title":"LLaV A-OneVision: Easy Visual Task Trans- fer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06928","last_updated":"2025-06-07T21:32:19Z","snapshot_observed_at":"2026-08-10T12:00:26.470686Z","submitted_at":"2025-06-07T21:32:19Z","title":"How Important are Videos for Training Video LLMs?","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:07.831670Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2506.06928"},"observation_digest":"sha256:6ae29a84db1a0f5d29db13de3a145d5022bd27623b9f29d8e3c97178dc5c4c69","observation_id":"a8b5ff99-15ec-41f0-8177-5e10f582f342","resolution":{"observed_at":"2026-08-07T05:51:07.831670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:51:08.352792Z","title":"MVBench: A Comprehensive Multi-modal Video Under- standing Benchmark","venue":null,"work_id":"277ed4e3-f05d-454f-b2dc-f40e1d204566","year":2024},"citing_paper":{"arxiv_id":"2506.06928","last_updated":"2025-06-07T21:32:19Z","snapshot_observed_at":"2026-08-10T12:00:26.470686Z","submitted_at":"2025-06-07T21:32:19Z","title":"How Important are Videos for Training Video LLMs?","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:07.836882Z"},"links":{"citing_paper":"/paper/2506.06928"},"observation_digest":"sha256:3158c4058d39f73b59a069a75f270513fb3b71d183e914dec03e9b8976680165","observation_id":"39381d6c-50ee-468e-a4a9-55417ca9e93c","resolution":{"observed_at":"2026-08-07T05:51:08.357663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-08-11T01:32:58.320917Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13919","snapshot_observed_at":"2026-08-07T05:51:07.841588Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06928","last_updated":"2025-06-07T21:32:19Z","snapshot_observed_at":"2026-08-10T12:00:26.470686Z","submitted_at":"2025-06-07T21:32:19Z","title":"How Important are Videos for Training Video LLMs?","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:07.841588Z"},"links":{"cited_paper":"/paper/2501.13919","citing_paper":"/paper/2506.06928"},"observation_digest":"sha256:61d7f4ac13d46556c0c8a6c2dd7b795d57cb39035f3716497b060bfbd268e90e","observation_id":"ad71e2fe-5895-4c17-814c-8f8992cfa555","resolution":{"observed_at":"2026-08-07T05:51:07.841588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:51:08.338169Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","venue":null,"work_id":"59e806c0-6f5f-4cf4-acca-c73ac3925997","year":2024},"citing_paper":{"arxiv_id":"2506.06928","last_updated":"2025-06-07T21:32:19Z","snapshot_observed_at":"2026-08-10T12:00:26.470686Z","submitted_at":"2025-06-07T21:32:19Z","title":"How Important are Videos for Training Video LLMs?","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:07.846524Z"},"links":{"citing_paper":"/paper/2506.06928"},"observation_digest":"sha256:d40a045179fb73754f869a852e1b17ffbbc82d6fd9f89a45c3c922efbb34c740","observation_id":"6e1e2824-7908-4c1d-9206-0cf2f47da698","resolution":{"observed_at":"2026-08-07T05:51:08.342865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:51:08.323042Z","title":"Video-LLaV A: Learning United Visual Representation by Alignment Before Projection","venue":null,"work_id":"143e91b7-b2c7-4fe8-991b-a770a76f5b4e","year":null},"citing_paper":{"arxiv_id":"2506.06928","last_updated":"2025-06-07T21:32:19Z","snapshot_observed_at":"2026-08-10T12:00:26.470686Z","submitted_at":"2025-06-07T21:32:19Z","title":"How Important are Videos for Training Video LLMs?","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:07.851065Z"},"links":{"citing_paper":"/paper/2506.06928"},"observation_digest":"sha256:2dbc17a354931c46dc39a826016152cd8737cc36f3c85002a1a1d078fdc99546","observation_id":"9f8edbfe-10aa-4d2c-ae75-c677098d699e","resolution":{"observed_at":"2026-08-07T05:51:08.327932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:51:08.306752Z","title":"Microsoft COCO: Common Objects in Context","venue":null,"work_id":"1e2a3380-b980-4292-af50-518acf7b3343","year":2014},"citing_paper":{"arxiv_id":"2506.06928","last_updated":"2025-06-07T21:32:19Z","snapshot_observed_at":"2026-08-10T12:00:26.470686Z","submitted_at":"2025-06-07T21:32:19Z","title":"How Important are Videos for Training Video LLMs?","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:07.855756Z"},"links":{"citing_paper":"/paper/2506.06928"},"observation_digest":"sha256:e3db656d236d6a9a7d06347230fd0c1ebaea9dbfd7e4ccd3c7696c93ced780f0","observation_id":"5b7ce0b0-5171-461d-a9b3-8f1314059ba4","resolution":{"observed_at":"2026-08-07T05:51:08.312225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12961","last_updated":"2025-02-27T06:09:46Z","snapshot_observed_at":"2026-08-12T22:41:32.229292Z","submitted_at":"2024-09-19T17:59:51Z","title":"Oryx MLLM: On-Demand Spatial-Temporal Understanding at Arbitrary Resolution","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12961","snapshot_observed_at":"2026-08-07T05:51:07.860377Z","title":"Oryx MLLM: On-Demand Spatial- Temporal Understanding at Arbitrary Resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06928","last_updated":"2025-06-07T21:32:19Z","snapshot_observed_at":"2026-08-10T12:00:26.470686Z","submitted_at":"2025-06-07T21:32:19Z","title":"How Important are Videos for Training Video LLMs?","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:07.860377Z"},"links":{"cited_paper":"/paper/2409.12961","citing_paper":"/paper/2506.06928"},"observation_digest":"sha256:6d606a4fd45017c45395b70a058ef1b6ba9d8680fc0bdd0df14f9d1b5bc96930","observation_id":"9ebd11f4-cb7d-4fc7-9870-6582a89258f8","resolution":{"observed_at":"2026-08-07T05:51:07.860377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:51:08.291049Z","title":"Video-ChatGPT: Towards Detailed Video Under- standing via Large Vision and Language Models","venue":null,"work_id":"b5719ba5-e94f-41ca-914b-ab8a171cb09a","year":null},"citing_paper":{"arxiv_id":"2506.06928","last_updated":"2025-06-07T21:32:19Z","snapshot_observed_at":"2026-08-10T12:00:26.470686Z","submitted_at":"2025-06-07T21:32:19Z","title":"How Important are Videos for Training Video LLMs?","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:07.865389Z"},"links":{"citing_paper":"/paper/2506.06928"},"observation_digest":"sha256:159b4078b03d938f7c663dc666df306eb29651dd59bdaf2d0ccdaf9cc46af7c6","observation_id":"bf28ca4d-4cfe-4ed5-8dd5-db851bd7a74d","resolution":{"observed_at":"2026-08-07T05:51:08.296144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:51:08.273628Z","title":null,"venue":null,"work_id":"cfedf968-6053-4027-bfb7-971cefe7c1a8","year":2024},"citing_paper":{"arxiv_id":"2506.06928","last_updated":"2025-06-07T21:32:19Z","snapshot_observed_at":"2026-08-10T12:00:26.470686Z","submitted_at":"2025-06-07T21:32:19Z","title":"How Important are Videos for Training Video LLMs?","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:07.869984Z"},"links":{"citing_paper":"/paper/2506.06928"},"observation_digest":"sha256:0326ebdda53741338102b95f853dc19a0aeff687e3dcab8d583a40041bacee14","observation_id":"d9d66231-4270-478c-bf57-9fa8221d2497","resolution":{"observed_at":"2026-08-07T05:51:08.279071Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:51:08.256807Z","title":"Learning Transferable Visual Models From Natural Language Super- vision","venue":null,"work_id":"4cdd1df3-4105-4846-985f-2780d0cd86fd","year":2021},"citing_paper":{"arxiv_id":"2506.06928","last_updated":"2025-06-07T21:32:19Z","snapshot_observed_at":"2026-08-10T12:00:26.470686Z","submitted_at":"2025-06-07T21:32:19Z","title":"How Important are Videos for Training Video LLMs?","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:07.874688Z"},"links":{"citing_paper":"/paper/2506.06928"},"observation_digest":"sha256:aa2d390c8782866fc8c34dd538bab0ea8cde1f19902a6b8521659eebe112a3e1","observation_id":"f86bf564-bf9b-4076-b424-f45354ce05a1","resolution":{"observed_at":"2026-08-07T05:51:08.262254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17434","last_updated":"2024-10-22T21:21:37Z","snapshot_observed_at":"2026-08-13T11:36:11.821356Z","submitted_at":"2024-10-22T21:21:37Z","title":"LongVU: Spatiotemporal Adaptive Compression for Long Video-Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17434","snapshot_observed_at":"2026-08-07T05:51:07.879150Z","title":"Kim, Bilge Soran, Raghuraman Krishnamoor- thi, Mohamed Elhoseiny, and Vikas Chandra","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06928","last_updated":"2025-06-07T21:32:19Z","snapshot_observed_at":"2026-08-10T12:00:26.470686Z","submitted_at":"2025-06-07T21:32:19Z","title":"How Important are Videos for Training Video LLMs?","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:07.879150Z"},"links":{"cited_paper":"/paper/2410.17434","citing_paper":"/paper/2506.06928"},"observation_digest":"sha256:346b417d4d190cd7a10f6a74359ef626af73e01a9a895d0417694b56e5e4ea05","observation_id":"6dce3466-df81-459c-a18d-87100f0d2f40","resolution":{"observed_at":"2026-08-07T05:51:07.879150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00634","last_updated":"2024-09-24T04:41:08Z","snapshot_observed_at":"2026-08-12T23:31:58.325076Z","submitted_at":"2024-06-30T09:21:01Z","title":"Tarsier: Recipes for Training and Evaluating Large Video Description Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00634","snapshot_observed_at":"2026-08-07T05:51:07.884760Z","title":"Tarsier: Recipes for Training and Evalu- ating Large Video Description Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06928","last_updated":"2025-06-07T21:32:19Z","snapshot_observed_at":"2026-08-10T12:00:26.470686Z","submitted_at":"2025-06-07T21:32:19Z","title":"How Important are Videos for Training Video LLMs?","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:07.884760Z"},"links":{"cited_paper":"/paper/2407.00634","citing_paper":"/paper/2506.06928"},"observation_digest":"sha256:bb331ade382170afa62e26e4b35d0ff1f43262f26528211462158c5987d28e90","observation_id":"0cb707a5-6917-4e9f-b00d-1c255f096643","resolution":{"observed_at":"2026-08-07T05:51:07.884760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:51:08.239463Z","title":"LongVideoBench: A Benchmark for Long-context Inter- leaved Video-Language Understanding","venue":null,"work_id":"3bc68393-218b-40bb-8a1b-5026db448c45","year":2024},"citing_paper":{"arxiv_id":"2506.06928","last_updated":"2025-06-07T21:32:19Z","snapshot_observed_at":"2026-08-10T12:00:26.470686Z","submitted_at":"2025-06-07T21:32:19Z","title":"How Important are Videos for Training Video LLMs?","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:07.889776Z"},"links":{"citing_paper":"/paper/2506.06928"},"observation_digest":"sha256:b929199fab8411f4d9508bcafd3a60205190b99daf9c7a600488f0149c3bf8ac","observation_id":"c3ee944a-08d6-479e-a3b3-22b187f7925e","resolution":{"observed_at":"2026-08-07T05:51:08.244690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:51:08.222986Z","title":"MSR-VTT: A Large Video Description Dataset for Bridging Video and Language","venue":null,"work_id":"835c11ea-da7c-44f0-ad6a-bb49114f7ace","year":2016},"citing_paper":{"arxiv_id":"2506.06928","last_updated":"2025-06-07T21:32:19Z","snapshot_observed_at":"2026-08-10T12:00:26.470686Z","submitted_at":"2025-06-07T21:32:19Z","title":"How Important are Videos for Training Video LLMs?","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:07.895050Z"},"links":{"citing_paper":"/paper/2506.06928"},"observation_digest":"sha256:d921f0a3397e48b2aaadddba9bf1b5d86ac1201ba8e0fa0c31307e5226b737c2","observation_id":"4e0dc231-9de6-4f15-8f1e-0112554d8688","resolution":{"observed_at":"2026-08-07T05:51:08.228268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16994","last_updated":"2024-04-29T14:52:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T19:29:55Z","title":"PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16994","snapshot_observed_at":"2026-08-07T05:51:07.899664Z","title":"PLLaV A : Parameter-free LLaV A Extension from Images to Videos for Video Dense Captioning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06928","last_updated":"2025-06-07T21:32:19Z","snapshot_observed_at":"2026-08-10T12:00:26.470686Z","submitted_at":"2025-06-07T21:32:19Z","title":"How Important are Videos for Training Video LLMs?","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:07.899664Z"},"links":{"cited_paper":"/paper/2404.16994","citing_paper":"/paper/2506.06928"},"observation_digest":"sha256:0acecbc9eee827c616e13e11dcd7b8c55292e0685844d6f3db6a90fd131f11a4","observation_id":"897dc92b-73ff-4532-9744-3ca2e42c1f23","resolution":{"observed_at":"2026-08-07T05:51:07.899664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:51:08.206365Z","title":"CLEVRER: CoLlision Events for Video REpresentation and Reasoning","venue":null,"work_id":"573a6da5-ff52-48ef-aaee-8591f2628a74","year":2019},"citing_paper":{"arxiv_id":"2506.06928","last_updated":"2025-06-07T21:32:19Z","snapshot_observed_at":"2026-08-10T12:00:26.470686Z","submitted_at":"2025-06-07T21:32:19Z","title":"How Important are Videos for Training Video LLMs?","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:07.904430Z"},"links":{"citing_paper":"/paper/2506.06928"},"observation_digest":"sha256:e59453baef5f0f09a5439741ff393af8b4f725af1f5ed16d8a3a1ba5585099e3","observation_id":"87ec161b-a15b-4e8c-afd8-4be53ef31414","resolution":{"observed_at":"2026-08-07T05:51:08.211642Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:51:08.189942Z","title":"ActivityNet-QA: A Dataset for Understanding Complex Web Videos via Question Answer- ing","venue":null,"work_id":"629ee871-1d76-4326-9926-ba4f40bbb7f7","year":2019},"citing_paper":{"arxiv_id":"2506.06928","last_updated":"2025-06-07T21:32:19Z","snapshot_observed_at":"2026-08-10T12:00:26.470686Z","submitted_at":"2025-06-07T21:32:19Z","title":"How Important are Videos for Training Video LLMs?","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:07.909084Z"},"links":{"citing_paper":"/paper/2506.06928"},"observation_digest":"sha256:2a8e0ad331d877556050b160d61f8ebdbef8255381627a0c98ab5d8c62d6b7cb","observation_id":"ff108d37-dfb5-4f80-8fa6-b5a81e09e326","resolution":{"observed_at":"2026-08-07T05:51:08.195305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07888","last_updated":"2025-01-24T05:16:36Z","snapshot_observed_at":"2026-08-10T20:27:34.844428Z","submitted_at":"2025-01-14T06:54:39Z","title":"Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07888","snapshot_observed_at":"2026-08-07T05:51:07.913992Z","title":"Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06928","last_updated":"2025-06-07T21:32:19Z","snapshot_observed_at":"2026-08-10T12:00:26.470686Z","submitted_at":"2025-06-07T21:32:19Z","title":"How Important are Videos for Training Video LLMs?","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:07.913992Z"},"links":{"cited_paper":"/paper/2501.07888","citing_paper":"/paper/2506.06928"},"observation_digest":"sha256:dc0a8d5c3184463610d957dd6eee1500e1f315c0e5f1b5ade91031e4bebdf06b","observation_id":"c96d5b97-b387-450b-a5f1-13dc333d2a9f","resolution":{"observed_at":"2026-08-07T05:51:07.913992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:51:08.170484Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","venue":null,"work_id":"4580149a-918a-48b7-b6e3-9e8144196a38","year":2023},"citing_paper":{"arxiv_id":"2506.06928","last_updated":"2025-06-07T21:32:19Z","snapshot_observed_at":"2026-08-10T12:00:26.470686Z","submitted_at":"2025-06-07T21:32:19Z","title":"How Important are Videos for Training Video LLMs?","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:07.918987Z"},"links":{"citing_paper":"/paper/2506.06928"},"observation_digest":"sha256:68c98898bbff701296595d63b8e1ea56d5605a09d268c4425358ae554450c67f","observation_id":"5faf4ef4-d8e6-4340-b5db-458784a5186f","resolution":{"observed_at":"2026-08-07T05:51:08.177820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-07T05:51:07.923531Z","title":"Video Instruction Tuning With Synthetic Data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06928","last_updated":"2025-06-07T21:32:19Z","snapshot_observed_at":"2026-08-10T12:00:26.470686Z","submitted_at":"2025-06-07T21:32:19Z","title":"How Important are Videos for Training Video LLMs?","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:07.923531Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2506.06928"},"observation_digest":"sha256:8d41d9ba802d9ef561257bcb744d93dfd74de201b456b77c752107de7d46f731","observation_id":"b6f15c9d-18d7-4e73-9bcc-4a2501bf2bc6","resolution":{"observed_at":"2026-08-07T05:51:07.923531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.06928","last_updated":"2025-06-07T21:32:19Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T12:00:26.470686Z","submitted_at":"2025-06-07T21:32:19Z","title":"How Important are Videos for Training Video LLMs?"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":0,"verified_fuzzy":17},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 1 inbound Pith citation observation for arXiv:2506.06928."}