{"as_of":"2026-08-08T20:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:728476f7a6d4816ffc915170538e60bf4fa8e57e34bf5c0a84ed172408db614a","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":12,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":12,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":12,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T23:42:34.994738Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T23:57:29.022097Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.02438","last_updated":"2025-09-10T04:22:46Z","snapshot_observed_at":"2026-08-07T16:12:02.851576Z","submitted_at":"2025-04-03T09:55:09Z","title":"Scaling Video-Language Models to 10K Frames via Hierarchical Differential Distillation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02438","snapshot_observed_at":"2026-08-07T11:59:06.098310Z","title":"Scaling video-language models to 10k frames via hierarchical differential distillation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00993","last_updated":"2025-06-01T12:49:39Z","snapshot_observed_at":"2026-08-08T18:44:33.509277Z","submitted_at":"2025-06-01T12:49:39Z","title":"FlexSelect: Flexible Token Selection for Efficient Long Video Understanding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:06.098310Z"},"links":{"cited_paper":"/paper/2504.02438","citing_paper":"/paper/2506.00993"},"observation_digest":"sha256:cd47f2aef53834e52ea57b1e083c5a15ca30b16638eed4e1fa07f26dcbc2cf00","observation_id":"d536abaf-3295-4fbb-a432-666bc4a20e34","resolution":{"observed_at":"2026-08-07T11:59:06.098310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02438","last_updated":"2025-09-10T04:22:46Z","snapshot_observed_at":"2026-08-07T16:12:02.851576Z","submitted_at":"2025-04-03T09:55:09Z","title":"Scaling Video-Language Models to 10K Frames via Hierarchical Differential Distillation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02438","snapshot_observed_at":"2026-08-06T21:59:15.855545Z","title":"arXiv preprint arXiv:2504.02438","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02946","last_updated":"2025-06-28T15:24:05Z","snapshot_observed_at":"2026-08-08T00:43:49.554763Z","submitted_at":"2025-06-28T15:24:05Z","title":"Iterative Zoom-In: Temporal Interval Exploration for Long Video Understanding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:15.855545Z"},"links":{"cited_paper":"/paper/2504.02438","citing_paper":"/paper/2507.02946"},"observation_digest":"sha256:4cad0d7adfc04c2d0893a8f94e5127a8fe9872d478864111637f67531f90ffd5","observation_id":"b4e04e31-54a1-4856-ae77-3dd741cf5db7","resolution":{"observed_at":"2026-08-06T21:59:15.855545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02438","last_updated":"2025-09-10T04:22:46Z","snapshot_observed_at":"2026-08-07T16:12:02.851576Z","submitted_at":"2025-04-03T09:55:09Z","title":"Scaling Video-Language Models to 10K Frames via Hierarchical Differential Distillation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02438","snapshot_observed_at":"2026-08-06T18:09:18.568750Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-07T05:26:16.655495Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T18:09:18.568750Z"},"links":{"cited_paper":"/paper/2504.02438","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:800a23da062b210c61809d33a670cd897dafceb069e184d507c148bb0a7c31b2","observation_id":"809b2dcf-8bb2-479b-964a-3488ccdb6144","resolution":{"observed_at":"2026-08-06T18:09:18.568750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02438","last_updated":"2025-09-10T04:22:46Z","snapshot_observed_at":"2026-08-07T16:12:02.851576Z","submitted_at":"2025-04-03T09:55:09Z","title":"Scaling Video-Language Models to 10K Frames via Hierarchical Differential Distillation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02438","snapshot_observed_at":"2026-08-02T20:14:05.166776Z","title":"Scaling video-language models to 10k frames via hierarchical differential distillation.arXiv preprint arXiv:2504.02438, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.00198","last_updated":"2026-07-01T00:40:56Z","snapshot_observed_at":"2026-08-08T00:25:26.077628Z","submitted_at":"2026-02-27T08:11:06Z","title":"Stateful Token Reduction for Long-Video Hybrid VLMs","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T20:14:05.166776Z"},"links":{"cited_paper":"/paper/2504.02438","citing_paper":"/paper/2603.00198"},"observation_digest":"sha256:d670f8ffad1a4c7daa5122af7a55a74de3528ca67f65d0443a9fac8d9346eef4","observation_id":"46aa2c03-e352-4525-9cdc-8d2919322937","resolution":{"observed_at":"2026-08-02T20:14:05.166776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02438","last_updated":"2025-09-10T04:22:46Z","snapshot_observed_at":"2026-08-07T16:12:02.851576Z","submitted_at":"2025-04-03T09:55:09Z","title":"Scaling Video-Language Models to 10K Frames via Hierarchical Differential Distillation","version":5},"cited_work":{"arxiv_id":"2504.02438","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.02438","snapshot_observed_at":"2026-07-02T23:57:29.022097Z","title":"Scaling video-language models to 10k frames via hierarchical differential distillation","venue":null,"work_id":"0a6b0011-908b-4498-b4f3-1ba634df498f","year":2025},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-02T05:26:21.584719Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-10T16:36:33.264166Z"},"links":{"cited_paper":"/paper/2504.02438","citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:92f7466d537a5cf00c8aa559b8939bfd3da03ce13de82499490dfe56317764db","observation_id":"0ca175e9-d415-434b-a2af-cc830cb9d6ec","resolution":{"observed_at":"2026-05-11T08:30:57.064377Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02438","last_updated":"2025-09-10T04:22:46Z","snapshot_observed_at":"2026-08-07T16:12:02.851576Z","submitted_at":"2025-04-03T09:55:09Z","title":"Scaling Video-Language Models to 10K Frames via Hierarchical Differential Distillation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02438","snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Scaling video-language models to 10k frames via hierarchical differential distillation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-02T05:26:21.584719Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":128,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"cited_paper":"/paper/2504.02438","citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:4ed8aa242b5acc912d13087b2493433f0834cb6e39bc88a286a8becf8808a04e","observation_id":"29279496-f3cf-4c73-8508-c90752bb7e55","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02438","last_updated":"2025-09-10T04:22:46Z","snapshot_observed_at":"2026-08-07T16:12:02.851576Z","submitted_at":"2025-04-03T09:55:09Z","title":"Scaling Video-Language Models to 10K Frames via Hierarchical Differential Distillation","version":5},"cited_work":{"arxiv_id":"2504.02438","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.02438","snapshot_observed_at":"2026-07-02T23:57:29.022097Z","title":"Scaling video-language models to 10k frames via hierarchical differential distillation","venue":null,"work_id":"0a6b0011-908b-4498-b4f3-1ba634df498f","year":2025},"citing_paper":{"arxiv_id":"2605.06537","last_updated":"2026-05-07T16:37:10Z","snapshot_observed_at":"2026-07-06T23:19:00.794334Z","submitted_at":"2026-05-07T16:37:10Z","title":"MedHorizon: Towards Long-context Medical Video Understanding in the Wild","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-05-08T12:28:35.008604Z"},"links":{"cited_paper":"/paper/2504.02438","citing_paper":"/paper/2605.06537"},"observation_digest":"sha256:9c5af3048feadbdea6caa586f2452ff5e4779f44404461e5e1870f7e541018bc","observation_id":"9b09393b-1b9e-482f-8bcb-fdd8bcb23fa0","resolution":{"observed_at":"2026-05-11T19:16:07.499176Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02438","last_updated":"2025-09-10T04:22:46Z","snapshot_observed_at":"2026-08-07T16:12:02.851576Z","submitted_at":"2025-04-03T09:55:09Z","title":"Scaling Video-Language Models to 10K Frames via Hierarchical Differential Distillation","version":5},"cited_work":{"arxiv_id":"2504.02438","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.02438","snapshot_observed_at":"2026-07-02T23:57:29.022097Z","title":"Scaling video-language models to 10k frames via hierarchical differential distillation","venue":null,"work_id":"0a6b0011-908b-4498-b4f3-1ba634df498f","year":2025},"citing_paper":{"arxiv_id":"2605.22678","last_updated":"2026-05-21T16:20:31Z","snapshot_observed_at":"2026-08-01T16:56:58.243776Z","submitted_at":"2026-05-21T16:20:31Z","title":"Swift Sampling: Selecting Temporal Surprises via Taylor Series","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-22T05:55:23.479344Z"},"links":{"cited_paper":"/paper/2504.02438","citing_paper":"/paper/2605.22678"},"observation_digest":"sha256:dccb7756353347f555df9d3f4ad4cdc52d0155e43ce8b44a9c63efb3953a8ab7","observation_id":"b3c77a53-5529-4596-bf03-d20fc9750306","resolution":{"observed_at":"2026-05-22T05:56:07.829198Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02438","last_updated":"2025-09-10T04:22:46Z","snapshot_observed_at":"2026-08-07T16:12:02.851576Z","submitted_at":"2025-04-03T09:55:09Z","title":"Scaling Video-Language Models to 10K Frames via Hierarchical Differential Distillation","version":5},"cited_work":{"arxiv_id":"2504.02438","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.02438","snapshot_observed_at":"2026-07-02T23:57:29.022097Z","title":"Scaling video-language models to 10k frames via hierarchical differential distillation","venue":null,"work_id":"0a6b0011-908b-4498-b4f3-1ba634df498f","year":2025},"citing_paper":{"arxiv_id":"2606.06338","last_updated":"2026-06-04T16:12:43Z","snapshot_observed_at":"2026-07-06T23:46:10.612537Z","submitted_at":"2026-06-04T16:12:43Z","title":"StoryVideoQA: Scaling Deep Video Understanding with a Large-Scale, Multi-Genre and Auto-Generated Dataset","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-06-28T02:05:47.810096Z"},"links":{"cited_paper":"/paper/2504.02438","citing_paper":"/paper/2606.06338"},"observation_digest":"sha256:84f547841e958ac90eebb33757152195ddc5aa527dd3f609d29c24f4134cd234","observation_id":"9bc7cd0e-d49f-424d-948b-e164c258782e","resolution":{"observed_at":"2026-07-02T12:26:57.175123Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02438","last_updated":"2025-09-10T04:22:46Z","snapshot_observed_at":"2026-08-07T16:12:02.851576Z","submitted_at":"2025-04-03T09:55:09Z","title":"Scaling Video-Language Models to 10K Frames via Hierarchical Differential Distillation","version":5},"cited_work":{"arxiv_id":"2504.02438","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.02438","snapshot_observed_at":"2026-07-02T23:57:29.022097Z","title":"Scaling video-language models to 10k frames via hierarchical differential distillation","venue":null,"work_id":"0a6b0011-908b-4498-b4f3-1ba634df498f","year":2025},"citing_paper":{"arxiv_id":"2606.09064","last_updated":"2026-06-08T06:02:05Z","snapshot_observed_at":"2026-07-06T23:48:30.569726Z","submitted_at":"2026-06-08T06:02:05Z","title":"See More, Think Deeper: Query-Expanded Visual Evidence and Answer-Clue Guided Reflection for Long Video Understanding","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-06-27T17:35:07.667016Z"},"links":{"cited_paper":"/paper/2504.02438","citing_paper":"/paper/2606.09064"},"observation_digest":"sha256:b416801e73ed4910b5aa81db5391e7940508244786e9b9b423947cc94f04020a","observation_id":"78c047b2-28ce-4fbb-b0f0-dac2af1b1ee5","resolution":{"observed_at":"2026-07-02T23:57:29.023381Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02438","last_updated":"2025-09-10T04:22:46Z","snapshot_observed_at":"2026-08-07T16:12:02.851576Z","submitted_at":"2025-04-03T09:55:09Z","title":"Scaling Video-Language Models to 10K Frames via Hierarchical Differential Distillation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02438","snapshot_observed_at":"2026-08-01T22:38:42.291857Z","title":"arXiv preprint arXiv:2504.02438 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15689","last_updated":"2026-07-17T07:04:31Z","snapshot_observed_at":"2026-08-06T19:22:15.675454Z","submitted_at":"2026-07-17T07:04:31Z","title":"Efficient Frame Selection for Long Videos at Test Time with Attention-Based MLLM Selectors","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-01T22:38:42.291857Z"},"links":{"cited_paper":"/paper/2504.02438","citing_paper":"/paper/2607.15689"},"observation_digest":"sha256:aa2f8b1376788f71c9db1ec878cc4b4e592eb753abddf2f92b2d029bb44d83c0","observation_id":"9d159b4b-e366-4cc5-8ef7-38491711865f","resolution":{"observed_at":"2026-08-01T22:38:42.291857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02438","last_updated":"2025-09-10T04:22:46Z","snapshot_observed_at":"2026-08-07T16:12:02.851576Z","submitted_at":"2025-04-03T09:55:09Z","title":"Scaling Video-Language Models to 10K Frames via Hierarchical Differential Distillation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02438","snapshot_observed_at":"2026-08-07T23:42:34.994738Z","title":"arXiv preprint arXiv:2504.02438 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-08T20:16:38.292685Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:34.994738Z"},"links":{"cited_paper":"/paper/2504.02438","citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:0bcaa226759f18685b15c27ed5436b30f57ac7ca6d8288b13b33d621d447f736","observation_id":"1468d980-9e42-4d3b-9c1b-9749f003a400","resolution":{"observed_at":"2026-08-07T23:42:34.994738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2504.02438/citation-record","integrity":"/paper/2504.02438/integrity","json":"/paper/2504.02438/citation-record.json","paper":"/paper/2504.02438"},"outbound":[],"paper":{"arxiv_id":"2504.02438","last_updated":"2025-09-10T04:22:46Z","latest_version":5,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T16:12:02.851576Z","submitted_at":"2025-04-03T09:55:09Z","title":"Scaling Video-Language Models to 10K Frames via Hierarchical Differential Distillation"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 12 inbound Pith citation observations for arXiv:2504.02438."}