{"as_of":"2026-08-09T12:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4faa98ef5cc91b01c97f292b6866a669ed43bb1244f994de14cbb208fba5ab73","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":17,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":17,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":17,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":17,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:20:58.751103Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T19:16:01.333138Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.21271","last_updated":"2025-02-28T17:46:29Z","snapshot_observed_at":"2026-08-07T17:39:04.434684Z","submitted_at":"2025-02-28T17:46:29Z","title":"Adaptive Keyframe Sampling for Long Video Understanding","version":1},"cited_work":{"arxiv_id":"2502.21271","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.21271","snapshot_observed_at":"2026-07-01T19:16:01.333138Z","title":"Adaptive keyframe sampling for long video understanding","venue":null,"work_id":"36648ec4-5543-4719-bedd-4b4c88c7ce48","year":2025},"citing_paper":{"arxiv_id":"2505.15269","last_updated":"2026-04-23T12:54:38Z","snapshot_observed_at":"2026-08-03T01:07:06.468931Z","submitted_at":"2025-05-21T08:47:15Z","title":"LiveVLM: Efficient Online Video Understanding via Streaming-Oriented KV Cache and Retrieval","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-22T14:26:59.015559Z"},"links":{"cited_paper":"/paper/2502.21271","citing_paper":"/paper/2505.15269"},"observation_digest":"sha256:f8a1719e31b729b03a18b4ca00cd8f5c463d107605b7202d541aec648e7adbd0","observation_id":"f24fb277-c4a9-41b8-a85c-ff10bdafcc62","resolution":{"observed_at":"2026-05-22T14:31:40.790642Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.21271","last_updated":"2025-02-28T17:46:29Z","snapshot_observed_at":"2026-08-07T17:39:04.434684Z","submitted_at":"2025-02-28T17:46:29Z","title":"Adaptive Keyframe Sampling for Long Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.21271","snapshot_observed_at":"2026-08-07T15:20:58.751103Z","title":"Adaptive keyframe sampling for long video understanding.arXiv preprint arXiv:2502.21271, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15447","last_updated":"2025-05-21T12:29:40Z","snapshot_observed_at":"2026-08-09T00:23:31.907645Z","submitted_at":"2025-05-21T12:29:40Z","title":"ViaRL: Adaptive Temporal Grounding via Visual Iterated Amplification Reinforcement Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T15:20:58.751103Z"},"links":{"cited_paper":"/paper/2502.21271","citing_paper":"/paper/2505.15447"},"observation_digest":"sha256:857526f431023e06b00de41a36304c1f80ae772f3aba13451b500059d1614097","observation_id":"a5fc3f40-2601-4cb8-a4ee-395a76b206cf","resolution":{"observed_at":"2026-08-07T15:20:58.751103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.21271","last_updated":"2025-02-28T17:46:29Z","snapshot_observed_at":"2026-08-07T17:39:04.434684Z","submitted_at":"2025-02-28T17:46:29Z","title":"Adaptive Keyframe Sampling for Long Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.21271","snapshot_observed_at":"2026-08-05T19:03:07.977401Z","title":"Adaptive keyframe sampling for long video understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.13692","last_updated":"2025-08-19T09:52:04Z","snapshot_observed_at":"2026-08-09T03:24:13.317916Z","submitted_at":"2025-08-19T09:52:04Z","title":"HumanPCR: Probing MLLM Capabilities in Diverse Human-Centric Scenes","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-05T19:03:07.977401Z"},"links":{"cited_paper":"/paper/2502.21271","citing_paper":"/paper/2508.13692"},"observation_digest":"sha256:872f679e3a8d0667d5f31dfb8a77a55f9e411042bf70814fd26589b6eeccc144","observation_id":"3df37c4b-fbea-44e8-971a-bf77ec8063c4","resolution":{"observed_at":"2026-08-05T19:03:07.977401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.21271","last_updated":"2025-02-28T17:46:29Z","snapshot_observed_at":"2026-08-07T17:39:04.434684Z","submitted_at":"2025-02-28T17:46:29Z","title":"Adaptive Keyframe Sampling for Long Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.21271","snapshot_observed_at":"2026-08-04T19:28:31.595682Z","title":"Adaptive keyframe sampling for long video understanding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09263","last_updated":"2025-09-11T08:49:22Z","snapshot_observed_at":"2026-08-09T11:40:10.651044Z","submitted_at":"2025-09-11T08:49:22Z","title":"DATE: Dynamic Absolute Time Enhancement for Long Video Understanding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T19:28:31.595682Z"},"links":{"cited_paper":"/paper/2502.21271","citing_paper":"/paper/2509.09263"},"observation_digest":"sha256:08e8dc8980a0a5b8cdaacf6cc04ae67e4c13129b7cbd8d9e367a7bd29619a636","observation_id":"cf1d15db-9e10-4c41-918f-dccbe1e2c010","resolution":{"observed_at":"2026-08-04T19:28:31.595682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.21271","last_updated":"2025-02-28T17:46:29Z","snapshot_observed_at":"2026-08-07T17:39:04.434684Z","submitted_at":"2025-02-28T17:46:29Z","title":"Adaptive Keyframe Sampling for Long Video Understanding","version":1},"cited_work":{"arxiv_id":"2502.21271","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.21271","snapshot_observed_at":"2026-07-01T19:16:01.333138Z","title":"Adaptive keyframe sampling for long video understanding","venue":null,"work_id":"36648ec4-5543-4719-bedd-4b4c88c7ce48","year":2025},"citing_paper":{"arxiv_id":"2512.08410","last_updated":"2026-04-09T06:44:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-09T09:40:20Z","title":"Towards Effective Long Video Understanding of Multimodal Large Language Models via One-shot Clip Retrieval","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-17T00:10:01.596422Z"},"links":{"cited_paper":"/paper/2502.21271","citing_paper":"/paper/2512.08410"},"observation_digest":"sha256:b924f3f5f4f17158b69cf4bef9fb520479208c0e5b1779a21bd93ebc2bcd13a7","observation_id":"854a22aa-db1d-4618-ad27-7850edfbf80e","resolution":{"observed_at":"2026-05-17T00:11:23.225426Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.21271","last_updated":"2025-02-28T17:46:29Z","snapshot_observed_at":"2026-08-07T17:39:04.434684Z","submitted_at":"2025-02-28T17:46:29Z","title":"Adaptive Keyframe Sampling for Long Video Understanding","version":1},"cited_work":{"arxiv_id":"2502.21271","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.21271","snapshot_observed_at":"2026-07-01T19:16:01.333138Z","title":"Adaptive keyframe sampling for long video understanding","venue":null,"work_id":"36648ec4-5543-4719-bedd-4b4c88c7ce48","year":2025},"citing_paper":{"arxiv_id":"2601.14594","last_updated":"2026-05-07T03:54:39Z","snapshot_observed_at":"2026-07-06T22:42:26.083572Z","submitted_at":"2026-01-21T02:26:48Z","title":"LFS: Learnable Frame Selector for Event-Aware and Temporally Diverse Video Captioning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-16T12:21:19.606631Z"},"links":{"cited_paper":"/paper/2502.21271","citing_paper":"/paper/2601.14594"},"observation_digest":"sha256:0d7201b0d7c624511ae3964935d129674687182efcf92712e355cc5bc50579d3","observation_id":"296506d5-3962-4999-992c-24480b648df6","resolution":{"observed_at":"2026-05-16T12:22:52.390755Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.21271","last_updated":"2025-02-28T17:46:29Z","snapshot_observed_at":"2026-08-07T17:39:04.434684Z","submitted_at":"2025-02-28T17:46:29Z","title":"Adaptive Keyframe Sampling for Long Video Understanding","version":1},"cited_work":{"arxiv_id":"2502.21271","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.21271","snapshot_observed_at":"2026-07-01T19:16:01.333138Z","title":"Adaptive keyframe sampling for long video understanding","venue":null,"work_id":"36648ec4-5543-4719-bedd-4b4c88c7ce48","year":2025},"citing_paper":{"arxiv_id":"2605.09223","last_updated":"2026-07-30T19:00:53Z","snapshot_observed_at":"2026-08-05T23:10:41.225358Z","submitted_at":"2026-05-09T23:47:46Z","title":"CREST: Curvature-Regulated Event-Centric Sampling for Efficient Long-Video Understanding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-12T03:06:09.753634Z"},"links":{"cited_paper":"/paper/2502.21271","citing_paper":"/paper/2605.09223"},"observation_digest":"sha256:152157cdcbf559763c1f4d0f65a1f5b6727416c433f9373c71079c49805db0dc","observation_id":"3df1e43e-e7fd-49b4-8f1c-7de83fe1a2b6","resolution":{"observed_at":"2026-05-12T03:06:18.749863Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.21271","last_updated":"2025-02-28T17:46:29Z","snapshot_observed_at":"2026-08-07T17:39:04.434684Z","submitted_at":"2025-02-28T17:46:29Z","title":"Adaptive Keyframe Sampling for Long Video Understanding","version":1},"cited_work":{"arxiv_id":"2502.21271","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.21271","snapshot_observed_at":"2026-07-01T19:16:01.333138Z","title":"Adaptive keyframe sampling for long video understanding","venue":null,"work_id":"36648ec4-5543-4719-bedd-4b4c88c7ce48","year":2025},"citing_paper":{"arxiv_id":"2605.16740","last_updated":"2026-06-01T13:41:41Z","snapshot_observed_at":"2026-08-01T07:38:35.881679Z","submitted_at":"2026-05-16T01:37:10Z","title":"TRACE: Evidence Grounding-Guided Multi-Video Event Understanding and Claim Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-19T21:36:43.971666Z"},"links":{"cited_paper":"/paper/2502.21271","citing_paper":"/paper/2605.16740"},"observation_digest":"sha256:979964c7bd3af5892c8632b55e8bef80c598cefb56bad5c16d6c9be7599b58e7","observation_id":"e2f49626-964a-4c93-ac9c-e8522015cd63","resolution":{"observed_at":"2026-05-19T21:37:47.870546Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.21271","last_updated":"2025-02-28T17:46:29Z","snapshot_observed_at":"2026-08-07T17:39:04.434684Z","submitted_at":"2025-02-28T17:46:29Z","title":"Adaptive Keyframe Sampling for Long Video Understanding","version":1},"cited_work":{"arxiv_id":"2502.21271","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.21271","snapshot_observed_at":"2026-07-01T19:16:01.333138Z","title":"Adaptive keyframe sampling for long video understanding","venue":null,"work_id":"36648ec4-5543-4719-bedd-4b4c88c7ce48","year":2025},"citing_paper":{"arxiv_id":"2605.16740","last_updated":"2026-06-01T13:41:41Z","snapshot_observed_at":"2026-08-01T07:38:35.881679Z","submitted_at":"2026-05-16T01:37:10Z","title":"TRACE: Evidence Grounding-Guided Multi-Video Event Understanding and Claim Generation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-30T19:33:24.558488Z"},"links":{"cited_paper":"/paper/2502.21271","citing_paper":"/paper/2605.16740"},"observation_digest":"sha256:8e927152c39b4bdb0a544972120855fb1a3d6505bbad9dd7366f1a61678d7864","observation_id":"2ec06c4b-e044-4144-88bf-174adad26ad6","resolution":{"observed_at":"2026-06-30T19:35:01.054222Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.21271","last_updated":"2025-02-28T17:46:29Z","snapshot_observed_at":"2026-08-07T17:39:04.434684Z","submitted_at":"2025-02-28T17:46:29Z","title":"Adaptive Keyframe Sampling for Long Video Understanding","version":1},"cited_work":{"arxiv_id":"2502.21271","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.21271","snapshot_observed_at":"2026-07-01T19:16:01.333138Z","title":"Adaptive keyframe sampling for long video understanding","venue":null,"work_id":"36648ec4-5543-4719-bedd-4b4c88c7ce48","year":2025},"citing_paper":{"arxiv_id":"2605.27318","last_updated":"2026-07-06T17:18:57Z","snapshot_observed_at":"2026-07-12T15:54:07.137141Z","submitted_at":"2026-05-26T17:26:29Z","title":"Q-GeoMem: Question-Guided Geometric Memory for Video Spatial Reasoning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-29T18:15:28.261185Z"},"links":{"cited_paper":"/paper/2502.21271","citing_paper":"/paper/2605.27318"},"observation_digest":"sha256:65bbba7a5f7e5e8660a3d4266531a47ea92f0e471a665d72e60cf3fdefbc8286","observation_id":"4dfe50cf-dc96-4921-b60b-be19ca401a1b","resolution":{"observed_at":"2026-06-29T18:23:50.956663Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.21271","last_updated":"2025-02-28T17:46:29Z","snapshot_observed_at":"2026-08-07T17:39:04.434684Z","submitted_at":"2025-02-28T17:46:29Z","title":"Adaptive Keyframe Sampling for Long Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.21271","snapshot_observed_at":"2026-07-12T15:54:12.909974Z","title":"Adaptive Keyframe Sampling for Long Video Understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.27318","last_updated":"2026-07-06T17:18:57Z","snapshot_observed_at":"2026-07-12T15:54:07.137141Z","submitted_at":"2026-05-26T17:26:29Z","title":"Q-GeoMem: Question-Guided Geometric Memory for Video Spatial Reasoning","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-07-12T15:54:12.909974Z"},"links":{"cited_paper":"/paper/2502.21271","citing_paper":"/paper/2605.27318"},"observation_digest":"sha256:e93a213715a16d3d8003681e1565973b22a922f93974a68ed7c24b574c4bf896","observation_id":"330df6f8-1c78-4022-b323-0fb6cdf2b1ed","resolution":{"observed_at":"2026-07-12T15:54:12.909974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.21271","last_updated":"2025-02-28T17:46:29Z","snapshot_observed_at":"2026-08-07T17:39:04.434684Z","submitted_at":"2025-02-28T17:46:29Z","title":"Adaptive Keyframe Sampling for Long Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.21271","snapshot_observed_at":"2026-07-12T15:34:37.002001Z","title":"Adaptive Keyframe Sampling for Long Video Understanding, February 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.31027","last_updated":"2026-07-11T04:14:11Z","snapshot_observed_at":"2026-08-02T10:01:28.608360Z","submitted_at":"2026-05-29T08:58:39Z","title":"Multi-Scale Separable Fourier Neural Networks for Solving High-Frequency PDEs","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-12T15:34:37.002001Z"},"links":{"cited_paper":"/paper/2502.21271","citing_paper":"/paper/2605.31027"},"observation_digest":"sha256:b1b118152636135e866c979781d9e270ffdb3f315c98eb5d18330217a87b0c17","observation_id":"ee821844-32b4-469b-9792-2844de2a1265","resolution":{"observed_at":"2026-07-12T15:34:37.002001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.21271","last_updated":"2025-02-28T17:46:29Z","snapshot_observed_at":"2026-08-07T17:39:04.434684Z","submitted_at":"2025-02-28T17:46:29Z","title":"Adaptive Keyframe Sampling for Long Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.21271","snapshot_observed_at":"2026-07-14T18:39:24.915547Z","title":"Adaptive Keyframe Sampling for Long Video Understanding, February 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.31027","last_updated":"2026-07-11T04:14:11Z","snapshot_observed_at":"2026-08-02T10:01:28.608360Z","submitted_at":"2026-05-29T08:58:39Z","title":"Multi-Scale Separable Fourier Neural Networks for Solving High-Frequency PDEs","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-14T18:39:24.915547Z"},"links":{"cited_paper":"/paper/2502.21271","citing_paper":"/paper/2605.31027"},"observation_digest":"sha256:4c6fcfb9279418425de293b7029765c1247453a9ae1b70c4e6219e1aec908247","observation_id":"fc0e7d17-ec2d-4cdd-9b5e-3d7b1b8e264e","resolution":{"observed_at":"2026-07-14T18:39:24.915547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.21271","last_updated":"2025-02-28T17:46:29Z","snapshot_observed_at":"2026-08-07T17:39:04.434684Z","submitted_at":"2025-02-28T17:46:29Z","title":"Adaptive Keyframe Sampling for Long Video Understanding","version":1},"cited_work":{"arxiv_id":"2502.21271","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.21271","snapshot_observed_at":"2026-07-01T19:16:01.333138Z","title":"Adaptive keyframe sampling for long video understanding","venue":null,"work_id":"36648ec4-5543-4719-bedd-4b4c88c7ce48","year":2025},"citing_paper":{"arxiv_id":"2605.31029","last_updated":"2026-05-29T09:01:56Z","snapshot_observed_at":"2026-07-06T23:40:12.939143Z","submitted_at":"2026-05-29T09:01:56Z","title":"PEEK: Picking Essential frames via Efficient Knowledge distillation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-28T22:46:53.704892Z"},"links":{"cited_paper":"/paper/2502.21271","citing_paper":"/paper/2605.31029"},"observation_digest":"sha256:9c2c74266e5fa66a11c0ad6c90896c56d010f90c9ee68d293243f182f16ab84d","observation_id":"b8cf0f28-bf73-4a21-aa0d-5d8c0131bc4c","resolution":{"observed_at":"2026-07-01T19:16:01.334887Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.21271","last_updated":"2025-02-28T17:46:29Z","snapshot_observed_at":"2026-08-07T17:39:04.434684Z","submitted_at":"2025-02-28T17:46:29Z","title":"Adaptive Keyframe Sampling for Long Video Understanding","version":1},"cited_work":{"arxiv_id":"2502.21271","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.21271","snapshot_observed_at":"2026-07-01T19:16:01.333138Z","title":"Adaptive keyframe sampling for long video understanding","venue":null,"work_id":"36648ec4-5543-4719-bedd-4b4c88c7ce48","year":2025},"citing_paper":{"arxiv_id":"2606.29472","last_updated":"2026-06-28T15:59:31Z","snapshot_observed_at":"2026-08-01T16:45:40.105247Z","submitted_at":"2026-06-28T15:59:31Z","title":"Agent-Computer Observation Interfaces Enable Dynamic Computer Use","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-30T06:59:20.295818Z"},"links":{"cited_paper":"/paper/2502.21271","citing_paper":"/paper/2606.29472"},"observation_digest":"sha256:1a9705154cca8f99b95ac248e65a0584e316fe411bab1484cf03a178e766a11b","observation_id":"c6a83721-15f9-4a6d-bcd5-146ea0611902","resolution":{"observed_at":"2026-06-30T07:04:21.259945Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.21271","last_updated":"2025-02-28T17:46:29Z","snapshot_observed_at":"2026-08-07T17:39:04.434684Z","submitted_at":"2025-02-28T17:46:29Z","title":"Adaptive Keyframe Sampling for Long Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.21271","snapshot_observed_at":"2026-08-02T06:34:29.611393Z","title":"Adaptive keyframe sampling for long video understanding.arXiv preprint arXiv:2502.21271, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.12503","last_updated":"2026-07-15T03:49:06Z","snapshot_observed_at":"2026-08-06T20:14:51.309947Z","submitted_at":"2026-07-14T08:35:07Z","title":"DynTrace: Tracking Dynamic Object Evidence for 4D Spatio-Temporal Reasoning in MLLMs","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T06:34:29.611393Z"},"links":{"cited_paper":"/paper/2502.21271","citing_paper":"/paper/2607.12503"},"observation_digest":"sha256:da755c36af5708cb517437d100fc476e5aa440d07b2771ac454692ceeb49c570","observation_id":"6a7e20e5-6fe1-49cf-b008-2c2004a582a9","resolution":{"observed_at":"2026-08-02T06:34:29.611393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.21271","last_updated":"2025-02-28T17:46:29Z","snapshot_observed_at":"2026-08-07T17:39:04.434684Z","submitted_at":"2025-02-28T17:46:29Z","title":"Adaptive Keyframe Sampling for Long Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.21271","snapshot_observed_at":"2026-07-31T23:10:26.849086Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:26.849086Z"},"links":{"cited_paper":"/paper/2502.21271","citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:6ed90dba902ecadace495c806b51fd5740af6d3f9453897cf289d83d87539e25","observation_id":"af7d562b-05a6-4f33-bbc3-475a9f2a52a7","resolution":{"observed_at":"2026-07-31T23:10:26.849086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2502.21271/citation-record","integrity":"/paper/2502.21271/integrity","json":"/paper/2502.21271/citation-record.json","paper":"/paper/2502.21271"},"outbound":[],"paper":{"arxiv_id":"2502.21271","last_updated":"2025-02-28T17:46:29Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T17:39:04.434684Z","submitted_at":"2025-02-28T17:46:29Z","title":"Adaptive Keyframe Sampling for Long Video Understanding"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 17 inbound Pith citation observations for arXiv:2502.21271."}