{"as_of":"2026-08-10T11:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4815cbc78d40ff620cc288f1003d478ffd44a30f20e98a6b6c8c6e492b7e2c09","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:36:39.894521Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.21184/citation-record","integrity":"/paper/2506.21184/integrity","json":"/paper/2506.21184/citation-record.json","paper":"/paper/2506.21184"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:41.560937Z","title":"Flamingo: a visual language model for few-shot learning.NeurIPS, 2022","venue":null,"work_id":"7cad37d1-427e-4616-af72-46bf0808bbde","year":2022},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-08T13:40:41.778180Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:36.457741Z"},"links":{"citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:9c55c43b9837de630bdb38b1f0293447a8e0586f87ca59cf404e2cd7e636318c","observation_id":"0bf89560-8927-4e62-a325-3ac8e3dc034c","resolution":{"observed_at":"2026-08-06T22:36:41.772060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T22:36:36.521460Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-08T13:40:41.778180Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:36.521460Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:fa019aa7ae6c608cf48a158fa9a0f4a93b44680e6e1ebd4011c8d82676fde962","observation_id":"89ab8ae2-2bac-47c4-9175-999e557b1902","resolution":{"observed_at":"2026-08-06T22:36:36.521460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-07-06T18:26:42.010940Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-06T22:36:36.613827Z","title":"Sharegpt4video: Improving video understanding and generation with better captions.arXiv preprint arXiv:2406.04325, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-08T13:40:41.778180Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:36.613827Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:5c755b7144f7cd8051cdf83def20d03da52a263d8c0915c0f0e04984b33ccabe","observation_id":"3c9cd646-4ba3-44ce-8828-ca0f1aeea3ea","resolution":{"observed_at":"2026-08-06T22:36:36.613827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-06T22:36:36.671820Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites.arXiv preprint arXiv:2404.16821, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-08T13:40:41.778180Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:36.671820Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:00e6907a32d15877cc73ff27eb6aebc1e637b1a8f933427f1a8eb5c5564124e4","observation_id":"636967fc-0fe2-4008-8d22-6ac784cd54cc","resolution":{"observed_at":"2026-08-06T22:36:36.671820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-06T22:36:36.711180Z","title":"Videollama 2: Advancing spatial-temporal modeling and audio understanding in video-llms.arXiv preprint arXiv:2406.07476, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-08T13:40:41.778180Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:36.711180Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:af17822731b187412f6124977a84b9cffc5ab2bd1839fe41af33edaa5b42d6d7","observation_id":"df79a092-af4f-40f0-8f24-efedd0d61324","resolution":{"observed_at":"2026-08-06T22:36:36.711180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11402","last_updated":"2024-10-22T23:13:34Z","snapshot_observed_at":"2026-07-06T19:17:02.745056Z","submitted_at":"2024-09-17T17:59:06Z","title":"NVLM: Open Frontier-Class Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11402","snapshot_observed_at":"2026-08-06T22:36:36.783376Z","title":"Nvlm: Open frontier-class multimodal llms.arXiv preprint arXiv:2409.11402, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-08T13:40:41.778180Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:36.783376Z"},"links":{"cited_paper":"/paper/2409.11402","citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:0de321faca50fc7a9ec7206f16212beab86ddb7105f40b9fdef3ed4dcc99d31c","observation_id":"2e9a38c5-4775-4a78-91b0-82d2885203f9","resolution":{"observed_at":"2026-08-06T22:36:36.783376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14023","last_updated":"2024-08-26T05:27:14Z","snapshot_observed_at":"2026-08-10T07:39:00.084462Z","submitted_at":"2024-08-26T05:27:14Z","title":"Video-CCAM: Enhancing Video-Language Understanding with Causal Cross-Attention Masks for Short and Long Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.14023","snapshot_observed_at":"2026-08-06T22:36:36.868717Z","title":"Video-ccam: Enhancing video-language understanding with causal cross-attention masks for short and long videos.arXiv preprint arXiv:2408.14023, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-08T13:40:41.778180Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:36.868717Z"},"links":{"cited_paper":"/paper/2408.14023","citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:1e7de03975b73b16d9192d2f54b5e7121269327161e5311a8a96a9fb20e0b52b","observation_id":"29079ea3-7f5a-45e3-b673-b96d566aed81","resolution":{"observed_at":"2026-08-06T22:36:36.868717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-06T22:36:36.961899Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis.arXiv preprint arXiv:2405.21075, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-08T13:40:41.778180Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:36.961899Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:7e260dfaee7576c0009651788ca861f96d5865d8665f83fa4458ad9a12a091bd","observation_id":"ad67feca-2ef2-4227-929e-8d25852f59fd","resolution":{"observed_at":"2026-08-06T22:36:36.961899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05726","last_updated":"2024-04-24T15:38:48Z","snapshot_observed_at":"2026-08-09T23:36:22.208556Z","submitted_at":"2024-04-08T17:59:24Z","title":"MA-LMM: Memory-Augmented Large Multimodal Model for Long-Term Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05726","snapshot_observed_at":"2026-08-06T22:36:37.020202Z","title":"Ma-lmm: Memory-augmented large multimodal model for long-term video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-08T13:40:41.778180Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:37.020202Z"},"links":{"cited_paper":"/paper/2404.05726","citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:e18d0120fdb33a6bde7f916617cc2b3f0605c198817f302255768ac63794a89f","observation_id":"2800f197-06c6-49eb-bd7d-99a1b40740be","resolution":{"observed_at":"2026-08-06T22:36:37.020202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:37.156162Z","title":"Chat-univi: Unified visual representation empowers large language models with image and video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-08T13:40:41.778180Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:37.156162Z"},"links":{"citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:a303fe61267f5fa2789b46a0a44c1e349affc86f30f5087ddd4eb46ad30a7ef0","observation_id":"2140fb08-a1a6-43e6-a721-ec067c175a23","resolution":{"observed_at":"2026-08-06T22:36:37.156162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-06T22:36:37.209127Z","title":"Llava-onevision: Easy visual task transfer.arXiv preprint arXiv:2408.03326, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-08T13:40:41.778180Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:37.209127Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:371fcb1f8aba1cd1bb7dc627ff9879a8213a53b9b60f73555951d2a84825b80c","observation_id":"f7a744d3-7a27-4fd3-be55-82d104ffe9b1","resolution":{"observed_at":"2026-08-06T22:36:37.209127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:41.266823Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models.ICML, 2023","venue":null,"work_id":"fc3cef79-b8bf-4fce-9ba0-d7dfdb5e7a07","year":2023},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-08T13:40:41.778180Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:37.288226Z"},"links":{"citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:e3d0cb192a55ea93ae71347b84d1cb3e1cc18b25a1480e63552434f10c971c43","observation_id":"a35b2b65-cf45-416e-b0d5-41cc98cb33d9","resolution":{"observed_at":"2026-08-06T22:36:41.378601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-06T22:36:37.359101Z","title":"Videochat: Chat-centric video understanding.arXiv preprint arXiv:2305.06355, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-08T13:40:41.778180Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:37.359101Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:c0eaa1707b63d86d293bfab9667f1de266b2cdbada8dbe215a620d43ab90d619","observation_id":"52d6f597-9a2e-40e1-8491-2f15f6a944e9","resolution":{"observed_at":"2026-08-06T22:36:37.359101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:37.422766Z","title":"Mvbench: A comprehensive multi-modal video understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-08T13:40:41.778180Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:37.422766Z"},"links":{"citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:1473da1cb8e887c551c8658b8c4ad60fc8fbd7c27fcb760c1068dc4838df459c","observation_id":"e90a2db6-5f6f-4e3e-a0ed-6b1928ac8116","resolution":{"observed_at":"2026-08-06T22:36:37.422766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17043","last_updated":"2023-11-28T18:53:43Z","snapshot_observed_at":"2026-08-06T05:08:17.428238Z","submitted_at":"2023-11-28T18:53:43Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17043","snapshot_observed_at":"2026-08-06T22:36:37.514961Z","title":"Llama-vid: An image is worth 2 tokens in large language models.arXiv preprint arXiv:2311.17043, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-08T13:40:41.778180Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:37.514961Z"},"links":{"cited_paper":"/paper/2311.17043","citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:d5caaa1bc26512b062655700e044e8403084351f41f78458199e464a976b7720","observation_id":"3de1bfdc-6e02-41d3-98f1-9a17c5964c27","resolution":{"observed_at":"2026-08-06T22:36:37.514961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:37.563665Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-08T13:40:41.778180Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:37.563665Z"},"links":{"citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:e68add7b78663b1b51f8a86cb6851fa8d67b47746344c88d9156196f3cfce1ce","observation_id":"2fa3dd12-bc54-41ac-8ae1-f4f037053790","resolution":{"observed_at":"2026-08-06T22:36:37.563665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-06T22:36:37.622776Z","title":"Video-llava: Learning united visual representation by alignment before projection.arXiv preprint arXiv:2311.10122, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-08T13:40:41.778180Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:37.622776Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:9115cc806b0af45912a02478fd0974259e976d1d7ab204f24cb2ec0fc897baa7","observation_id":"f8481452-cfd8-4211-b57b-d2ce89db70bc","resolution":{"observed_at":"2026-08-06T22:36:37.622776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:37.715027Z","title":"Llava-next: Improved reasoning, ocr, and world knowledge, January 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-08T13:40:41.778180Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:37.715027Z"},"links":{"citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:bfeb72f4805b0da0d10150e3ee4a43cfcd74c7d76f22b0394f3b9d071ea52b63","observation_id":"98d511ea-937f-486f-8f0b-2f0166c69cb9","resolution":{"observed_at":"2026-08-06T22:36:37.715027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-06T22:36:37.790351Z","title":"Visual instruction tuning.arXiv preprint arXiv:2304.08485, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-08T13:40:41.778180Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:37.790351Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:e4481e922dff0dfec3fea6d1d4b053d87a347aaf27d3084a929224e4f98c6656","observation_id":"b1f090d4-785c-47d6-aa1c-6eb6d28552d2","resolution":{"observed_at":"2026-08-06T22:36:37.790351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:37.899741Z","title":"Visual instruction tuning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-08T13:40:41.778180Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:37.899741Z"},"links":{"citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:2a71c3f57276193b0df3f212e9d4eaacadf98b7ebfd435a1cea4fa9e9a10f8d4","observation_id":"699307ac-b544-4401-aa11-366d012c7f29","resolution":{"observed_at":"2026-08-06T22:36:37.899741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00308","last_updated":"2024-03-30T10:11:26Z","snapshot_observed_at":"2026-08-10T01:25:17.951254Z","submitted_at":"2024-03-30T10:11:26Z","title":"ST-LLM: Large Language Models Are Effective Temporal Learners","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00308","snapshot_observed_at":"2026-08-06T22:36:37.979162Z","title":"St-llm: Large language models are effective temporal learners.arXiv:2404.00308, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-08T13:40:41.778180Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:37.979162Z"},"links":{"cited_paper":"/paper/2404.00308","citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:0b5372cecb6ff5ec160dabd562d36b3750ec4a6eee6336212d13485e657139f2","observation_id":"8e75c140-9583-4936-995e-a5ad9f726e48","resolution":{"observed_at":"2026-08-06T22:36:37.979162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18478","last_updated":"2025-04-27T10:39:51Z","snapshot_observed_at":"2026-08-07T16:41:53.661756Z","submitted_at":"2025-03-24T09:21:48Z","title":"Video-XL-Pro: Reconstructive Token Compression for Extremely Long Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18478","snapshot_observed_at":"2026-08-06T22:36:38.084306Z","title":"Video-xl-pro: Reconstructive token compression for extremely long video understanding.arXiv preprint arXiv:2503.18478, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-08T13:40:41.778180Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:38.084306Z"},"links":{"cited_paper":"/paper/2503.18478","citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:b8a1730a0c06db629e4de1234449b8890aada9aa168aeec980fec97d0a8eca40","observation_id":"7b1cea3d-234c-40a5-8664-57c158420a68","resolution":{"observed_at":"2026-08-06T22:36:38.084306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","snapshot_observed_at":"2026-08-09T19:40:57.491981Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07207","snapshot_observed_at":"2026-08-06T22:36:38.176899Z","title":"Valley: Video assistant with large language model enhanced ability.arXiv preprint arXiv:2306.07207, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-08T13:40:41.778180Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:38.176899Z"},"links":{"cited_paper":"/paper/2306.07207","citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:e59b84d1e6eb2f449335d05e9aa59ae526ebb82a1d4f0a48cec5441457c84be4","observation_id":"a50540c1-0041-4ace-8dd5-f98bb031f217","resolution":{"observed_at":"2026-08-06T22:36:38.176899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05424","last_updated":"2024-06-10T01:36:53Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05424","snapshot_observed_at":"2026-08-06T22:36:38.221582Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models.arXiv preprint arXiv:2306.05424, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-08T13:40:41.778180Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:38.221582Z"},"links":{"cited_paper":"/paper/2306.05424","citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:caf2c6b527bf48185bc55f4f6eed339b67bd48c301593661fb908f2bf4259bc1","observation_id":"450847d4-afc5-4fe9-9ad1-f79661ed5286","resolution":{"observed_at":"2026-08-06T22:36:38.221582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:38.276888Z","title":"Gpt-4 technical report, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-08T13:40:41.778180Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:38.276888Z"},"links":{"citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:08b0693df61eb71e9ed3ff054e604f38910c2f104dbb2da58d2d2a30cc5bc906","observation_id":"0589e541-1a20-440f-a926-855b8c3b8573","resolution":{"observed_at":"2026-08-06T22:36:38.276888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:40.900560Z","title":"Gpt-4o.https://openai.com/index/hello-gpt-4o/, May 2024","venue":null,"work_id":"323fc97e-f713-45d5-aaa9-22cebdc280fb","year":2024},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-08T13:40:41.778180Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:38.352178Z"},"links":{"citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:1e43f90120cec51b11d559a2349c5e6052b3ff4335686fba126127adef53a22c","observation_id":"6b2c5357-e7ff-4183-bfbd-6f2f9be7bf05","resolution":{"observed_at":"2026-08-06T22:36:41.041465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-06T22:36:38.387129Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context.arXiv preprint arXiv:2403.05530, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-08T13:40:41.778180Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:38.387129Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:0beeb2ea1de92d634b23b4e660bb886a2874c774efdd4d198cd32e59de824043","observation_id":"92e400c0-ffa5-4f75-ac26-451ca4a7d5f8","resolution":{"observed_at":"2026-08-06T22:36:38.387129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17434","last_updated":"2024-10-22T21:21:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-22T21:21:37Z","title":"LongVU: Spatiotemporal Adaptive Compression for Long Video-Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17434","snapshot_observed_at":"2026-08-06T22:36:38.446461Z","title":"Longvu: Spatiotemporal adaptive compression for long video-language understanding.arXiv preprint arXiv:2410.17434, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-08T13:40:41.778180Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:38.446461Z"},"links":{"cited_paper":"/paper/2410.17434","citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:bc9640decd1b1d93a71e27418711774a435142afaf2c08873770da11f0e2a063","observation_id":"69f4681f-c7bd-4a2d-b978-8acdd833a70a","resolution":{"observed_at":"2026-08-06T22:36:38.446461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14485","last_updated":"2024-12-10T12:45:31Z","snapshot_observed_at":"2026-07-06T19:19:28.953455Z","submitted_at":"2024-09-22T15:13:31Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14485","snapshot_observed_at":"2026-08-06T22:36:38.507321Z","title":"Video-xl: Extra-long vision language model for hour-scale video understanding.arXiv preprint arXiv:2409.14485, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-08T13:40:41.778180Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:38.507321Z"},"links":{"cited_paper":"/paper/2409.14485","citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:6092814821ae88e361a8c884ebda0f9d9850c98da733a998d0b98d89f3d6a581","observation_id":"b3b21a56-e1ad-4778-a6ce-c322c3a42042","resolution":{"observed_at":"2026-08-06T22:36:38.507321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16449","last_updated":"2024-03-09T06:43:37Z","snapshot_observed_at":"2026-08-05T04:26:02.499259Z","submitted_at":"2023-07-31T07:15:45Z","title":"MovieChat: From Dense Token to Sparse Memory for Long Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16449","snapshot_observed_at":"2026-08-06T22:36:38.567659Z","title":"Moviechat: From dense token to sparse memory for long video understanding.arXiv preprint arXiv:2307.16449, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-08T13:40:41.778180Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:38.567659Z"},"links":{"cited_paper":"/paper/2307.16449","citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:579facb6d322956dfa7c4162871239636fdb7818adc80f9feab7320eff3c5ea1","observation_id":"b25ca4dc-5cdc-466e-a600-f35ebdf1f7d5","resolution":{"observed_at":"2026-08-06T22:36:38.567659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:38.677891Z","title":"Cambrian-1: A fully open, vision-centric exploration of multimodal llms.Advances in Neural Information Processing Systems, 37:87310–87356, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-08T13:40:41.778180Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:38.677891Z"},"links":{"citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:813ed06146d1b4244c5dacf39cdee67263bfaf9b08738fcce1dd5c441bb57bd0","observation_id":"55d743eb-1d52-4b25-92e5-2c110b521247","resolution":{"observed_at":"2026-08-06T22:36:38.677891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-06T22:36:38.709295Z","title":"Siglip 2: Multilingual vision-language encoders with improved semantic understanding, localization, and dense features.arXiv preprint arXiv:2502.14786, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-08T13:40:41.778180Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:38.709295Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:a523b56aa16a8657cbdd7c143b4749e7d623e4baa2fc4c6587d14952c93b03ec","observation_id":"c0fe3f2f-7ee5-458f-9016-4aeb9d543755","resolution":{"observed_at":"2026-08-06T22:36:38.709295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-06T22:36:38.757096Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution.arXiv preprint arXiv:2409.12191, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-08T13:40:41.778180Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:38.757096Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:77db36277889f02bc941d017387978db19c5723ea4fbf301f45f9f89462576c9","observation_id":"be7b36a6-61cb-4357-be28-6e974b9a6c70","resolution":{"observed_at":"2026-08-06T22:36:38.757096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:38.823039Z","title":"Longllava: Scaling multi- modal llms to 1000 images efficiently via hybrid architecture.arXiv preprint arXiv:2409.02889, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-08T13:40:41.778180Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:38.823039Z"},"links":{"citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:d9ee2937dc0baa5f9177ec828a424e30606cb676f520aa0103dcd4b0bc0b5c3e","observation_id":"aad14b21-a422-405e-9593-c7614134390f","resolution":{"observed_at":"2026-08-06T22:36:38.823039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:38.922661Z","title":"Internvideo2: Scaling foundation models for multimodal video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-08T13:40:41.778180Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:38.922661Z"},"links":{"citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:c3670c335ca6973e1b2ce6478dabe7e9a1ed6b5c150313cff989acf424f9aacb","observation_id":"b69461d4-c78c-4c67-801a-af0204f757d2","resolution":{"observed_at":"2026-08-06T22:36:38.922661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05173","last_updated":"2025-05-30T03:54:16Z","snapshot_observed_at":"2026-08-09T16:45:21.957564Z","submitted_at":"2025-02-07T18:56:04Z","title":"VideoRoPE: What Makes for Good Video Rotary Position Embedding?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05173","snapshot_observed_at":"2026-08-06T22:36:38.968114Z","title":"Videorope: What makes for good video rotary position embedding?arXiv preprint arXiv:2502.05173, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-08T13:40:41.778180Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:38.968114Z"},"links":{"cited_paper":"/paper/2502.05173","citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:6d9331ec38df31529145f0f78df0fe1c6fb1862f1d028362b499a1ed1a975c81","observation_id":"333a114b-7802-40da-aee7-bd656b079e76","resolution":{"observed_at":"2026-08-06T22:36:38.968114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15754","last_updated":"2024-07-22T16:00:55Z","snapshot_observed_at":"2026-08-06T14:12:05.548569Z","submitted_at":"2024-07-22T16:00:55Z","title":"LongVideoBench: A Benchmark for Long-context Interleaved Video-Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15754","snapshot_observed_at":"2026-08-06T22:36:39.027331Z","title":"Longvideobench: A benchmark for long-context interleaved video-language understanding.arXiv preprint arXiv:2407.15754, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-08T13:40:41.778180Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:39.027331Z"},"links":{"cited_paper":"/paper/2407.15754","citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:ef759af5b6c69ee08e960f7794a503300b2394c745aca4767ea562292f3746b4","observation_id":"dc1e9d7c-528b-49e6-9fda-5a5a44fc868c","resolution":{"observed_at":"2026-08-06T22:36:39.027331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10302","last_updated":"2024-12-13T17:37:48Z","snapshot_observed_at":"2026-08-07T03:01:29.031129Z","submitted_at":"2024-12-13T17:37:48Z","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10302","snapshot_observed_at":"2026-08-06T22:36:39.126615Z","title":"Deepseek-vl2: Mixture-of-experts vision-language models for advanced multimodal understanding.arXiv preprint arXiv:2412.10302, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-08T13:40:41.778180Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:39.126615Z"},"links":{"cited_paper":"/paper/2412.10302","citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:a974659b71191911381df515d5b18e060b9704ead53cb29b5db435fa48d7a4f2","observation_id":"6124ce6e-9411-4742-a532-b56e838e24cf","resolution":{"observed_at":"2026-08-06T22:36:39.126615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04617","last_updated":"2024-05-28T12:05:12Z","snapshot_observed_at":"2026-07-06T17:26:39.109878Z","submitted_at":"2024-02-07T06:50:42Z","title":"InfLLM: Training-Free Long-Context Extrapolation for LLMs with an Efficient Context Memory","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04617","snapshot_observed_at":"2026-08-06T22:36:39.216006Z","title":"Infllm: Unveiling the intrinsic capacity of llms for understanding extremely long sequences with training-free memory.arXiv preprint arXiv:2402.04617, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-08T13:40:41.778180Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:39.216006Z"},"links":{"cited_paper":"/paper/2402.04617","citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:364caedabb51b421158cb57af621cae97d03b7da02421f2e880ace673d21ffd4","observation_id":"d34835d6-5ad3-46c6-b379-d68751029d8a","resolution":{"observed_at":"2026-08-06T22:36:39.216006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12275","last_updated":"2025-03-03T09:05:52Z","snapshot_observed_at":"2026-07-06T18:32:44.452493Z","submitted_at":"2024-06-18T05:05:12Z","title":"VoCo-LLaMA: Towards Vision Compression with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12275","snapshot_observed_at":"2026-08-06T22:36:39.267392Z","title":"V oco-llama: Towards vision compression with large language models.arXiv preprint arXiv:2406.12275, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-08T13:40:41.778180Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:39.267392Z"},"links":{"cited_paper":"/paper/2406.12275","citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:fae5fa3ff263e1f73e877eabb03a5257ff59a1b0ead9bef9975251ee4649e367","observation_id":"68ed76ec-112b-4f43-92a6-a1c7b91af129","resolution":{"observed_at":"2026-08-06T22:36:39.267392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-07-06T15:38:39.712379Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-06T22:36:39.329386Z","title":"Video-llama: An instruction-tuned audio-visual language model for video understanding.arXiv preprint arXiv:2306.02858, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-08T13:40:41.778180Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:39.329386Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:25e70c2268d83c4cb8b4bcd75e48d439ce52074a55d10be32a57bc514c6b9194","observation_id":"a48fd399-8528-405c-9c19-0202d1e113de","resolution":{"observed_at":"2026-08-06T22:36:39.329386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-06T22:36:39.426259Z","title":"Long context transfer from language to vision.arXiv preprint arXiv:2406.16852, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-08T13:40:41.778180Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:39.426259Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:b8a050cbe0470a07200d1703a1e5aec0324a90e913c93acc5a7721c90b5c3992","observation_id":"122a666a-3a86-4f3c-a925-119f5f0a1358","resolution":{"observed_at":"2026-08-06T22:36:39.426259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:39.503476Z","title":"Llava-next: A strong zero-shot video understanding model, April 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-08T13:40:41.778180Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:39.503476Z"},"links":{"citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:a3534f5d5926a393a8ff80fb6c8b1bb82a3def66209df1dadbd93bba6beeddc6","observation_id":"2ddb7bf0-c48a-4da6-8128-73469e3d4e19","resolution":{"observed_at":"2026-08-06T22:36:39.503476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:39.551825Z","title":"H2o: Heavy-hitter oracle for efficient generative inference of large language models.Advances in Neural Information Processing Systems, 36:34661–34710, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-08T13:40:41.778180Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:39.551825Z"},"links":{"citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:e3c96654b7b2be4315f1ec4281108b2157e555a8e385afa12b84d55230d06ed7","observation_id":"5360d085-0391-455f-b137-d4d1dc11a146","resolution":{"observed_at":"2026-08-06T22:36:39.551825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09367","last_updated":"2025-03-07T09:40:34Z","snapshot_observed_at":"2026-08-03T15:46:09.775614Z","submitted_at":"2024-06-13T17:50:05Z","title":"Needle In A Video Haystack: A Scalable Synthetic Evaluator for Video MLLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09367","snapshot_observed_at":"2026-08-06T22:36:39.601082Z","title":"Needle in a video haystack: A scalable synthetic framework for benchmarking video mllms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-08T13:40:41.778180Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:39.601082Z"},"links":{"cited_paper":"/paper/2406.09367","citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:11166910f909ef1294f6924d024761c53ea8659b1668713fcf55e19b6235dc20","observation_id":"52688802-2f3f-46f2-8c31-bdd3aad996d9","resolution":{"observed_at":"2026-08-06T22:36:39.601082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04264","last_updated":"2025-01-01T15:53:58Z","snapshot_observed_at":"2026-08-03T20:38:36.602554Z","submitted_at":"2024-06-06T17:09:32Z","title":"MLVU: Benchmarking Multi-task Long Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04264","snapshot_observed_at":"2026-08-06T22:36:39.692207Z","title":"Mlvu: A comprehensive benchmark for multi-task long video understanding.arXiv preprint arXiv:2406.04264, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-08T13:40:41.778180Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:39.692207Z"},"links":{"cited_paper":"/paper/2406.04264","citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:29a0ee2ba371c20b6d4f88429f2782b36b79b1f46c96d401d6a426c90bf8e9ae","observation_id":"7ef244d8-c636-4f1a-8998-377c3e8507fa","resolution":{"observed_at":"2026-08-06T22:36:39.692207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01852","last_updated":"2024-01-22T03:11:15Z","snapshot_observed_at":"2026-08-07T05:10:33.059352Z","submitted_at":"2023-10-03T07:33:27Z","title":"LanguageBind: Extending Video-Language Pretraining to N-modality by Language-based Semantic Alignment","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01852","snapshot_observed_at":"2026-08-06T22:36:39.772187Z","title":"Languagebind: Extending video-language pretraining to n-modality by language- based semantic alignment.arXiv preprint arXiv:2310.01852, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-08T13:40:41.778180Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:39.772187Z"},"links":{"cited_paper":"/paper/2310.01852","citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:a646cba76998d6b88cbb3e6cdb25a7bf444831c38fa27b4b36be0b2f5bb8419c","observation_id":"03bdf067-a8a2-409b-ace8-51dffb6b97b6","resolution":{"observed_at":"2026-08-06T22:36:39.772187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-06T22:36:39.829071Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models.arXiv preprint arXiv:2304.10592, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-08T13:40:41.778180Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:39.829071Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:1b5ca15627c65cdf5e88b645850f904bf50628e91158afd804845795f1bb166a","observation_id":"0e76717b-f6d5-4173-ba86-00d49d6b5f0d","resolution":{"observed_at":"2026-08-06T22:36:39.829071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T07:07:56.707005Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-06T22:36:39.894521Z","title":"Video-XL:2×","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-08T13:40:41.778180Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:39.894521Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:8f62a707b9955b9711550e0f477c2110a7f3aaff1c683567cf140c0286fca815","observation_id":"349009e5-9f3b-4f1c-9ff6-80ab18e6d2ae","resolution":{"observed_at":"2026-08-06T22:36:39.894521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T13:40:41.778180Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":46,"verified_exact":0,"verified_fuzzy":3},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 0 inbound Pith citation observations for arXiv:2506.21184."}