{"as_of":"2026-08-10T19:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4a02acec3fa0d2f62f8c4726c37776ec29015b82e4dd5d4da79deb5b177d1b68","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":10,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":10,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":10,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":10,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:56:05.308899Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-18T18:36:44.180127Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.01986","last_updated":"2025-07-24T18:44:26Z","snapshot_observed_at":"2026-07-06T20:16:18.023949Z","submitted_at":"2024-12-30T17:31:37Z","title":"FrameFusion: Combining Similarity and Importance for Video Token Reduction on Large Vision Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01986","snapshot_observed_at":"2026-08-07T10:56:05.308899Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.308899Z"},"links":{"cited_paper":"/paper/2501.01986","citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:cf40b5e68f95ea5d673598b95b34f1e27420f838266d718a04512d910d0c2812","observation_id":"a916a4f9-d205-473b-b4f7-13df30d1a489","resolution":{"observed_at":"2026-08-07T10:56:05.308899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01986","last_updated":"2025-07-24T18:44:26Z","snapshot_observed_at":"2026-07-06T20:16:18.023949Z","submitted_at":"2024-12-30T17:31:37Z","title":"FrameFusion: Combining Similarity and Importance for Video Token Reduction on Large Vision Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01986","snapshot_observed_at":"2026-08-06T23:51:05.316975Z","title":"Framefusion: Combining similarity and importance for video token reduction on large visual language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16054","last_updated":"2025-06-19T06:25:02Z","snapshot_observed_at":"2026-08-07T13:41:59.610268Z","submitted_at":"2025-06-19T06:25:02Z","title":"PAROAttention: Pattern-Aware ReOrdering for Efficient Sparse and Quantized Attention in Visual Generation Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.316975Z"},"links":{"cited_paper":"/paper/2501.01986","citing_paper":"/paper/2506.16054"},"observation_digest":"sha256:d2e0cd57928e8d14af034d8fecc7154665524aa2d78022c005632e815df1800e","observation_id":"ca7d1ebe-c8c2-49ed-9433-75b741fd4dc1","resolution":{"observed_at":"2026-08-06T23:51:05.316975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01986","last_updated":"2025-07-24T18:44:26Z","snapshot_observed_at":"2026-07-06T20:16:18.023949Z","submitted_at":"2024-12-30T17:31:37Z","title":"FrameFusion: Combining Similarity and Importance for Video Token Reduction on Large Vision Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01986","snapshot_observed_at":"2026-08-06T18:32:46.455680Z","title":"Framefusion: Combining similarity and importance for video token reduction on large visual language models.arXiv preprint arXiv:2501.01986, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-09T00:35:41.482303Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:46.455680Z"},"links":{"cited_paper":"/paper/2501.01986","citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:587cf79070d813f2c3c49d2928b32e57c8d24d34453cea968954cc54882de3aa","observation_id":"e842939a-c212-4e01-b7fd-dfc93bcc6dee","resolution":{"observed_at":"2026-08-06T18:32:46.455680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01986","last_updated":"2025-07-24T18:44:26Z","snapshot_observed_at":"2026-07-06T20:16:18.023949Z","submitted_at":"2024-12-30T17:31:37Z","title":"FrameFusion: Combining Similarity and Importance for Video Token Reduction on Large Vision Language Models","version":2},"cited_work":{"arxiv_id":"2501.01986","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.01986","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Framefusion: Combining similarity and importance for video token reduction on large visual language models.arXiv preprint arXiv:2501.01986","venue":null,"work_id":"c9a8af6e-4f98-4562-bdf8-7662216de04b","year":2024},"citing_paper":{"arxiv_id":"2509.08016","last_updated":"2026-04-09T01:22:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-09T00:55:04Z","title":"Video Parallel Scaling: Aggregating Diverse Frame Subsets for VideoLLMs","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-18T18:35:01.328250Z"},"links":{"cited_paper":"/paper/2501.01986","citing_paper":"/paper/2509.08016"},"observation_digest":"sha256:d46cb30e415ee68ef675474cec86ed770e285439dc006c0a5cfc2590246b3c91","observation_id":"6c4cd2ce-78b2-4a17-a86d-c31cafcbcdc1","resolution":{"observed_at":"2026-05-18T18:36:44.182879Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01986","last_updated":"2025-07-24T18:44:26Z","snapshot_observed_at":"2026-07-06T20:16:18.023949Z","submitted_at":"2024-12-30T17:31:37Z","title":"FrameFusion: Combining Similarity and Importance for Video Token Reduction on Large Vision Language Models","version":2},"cited_work":{"arxiv_id":"2501.01986","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.01986","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Framefusion: Combining similarity and importance for video token reduction on large visual language models.arXiv preprint arXiv:2501.01986","venue":null,"work_id":"c9a8af6e-4f98-4562-bdf8-7662216de04b","year":2024},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-07T14:16:18.120869Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"cited_paper":"/paper/2501.01986","citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:b9592bcb3dfe31ab96363670c4d01015c4a8b17988f9a2406836b44d57dbd439","observation_id":"f2b099df-6088-4428-8865-d4a635427214","resolution":{"observed_at":"2026-05-15T18:26:26.952439Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01986","last_updated":"2025-07-24T18:44:26Z","snapshot_observed_at":"2026-07-06T20:16:18.023949Z","submitted_at":"2024-12-30T17:31:37Z","title":"FrameFusion: Combining Similarity and Importance for Video Token Reduction on Large Vision Language Models","version":2},"cited_work":{"arxiv_id":"2501.01986","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.01986","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Framefusion: Combining similarity and importance for video token reduction on large visual language models.arXiv preprint arXiv:2501.01986","venue":null,"work_id":"c9a8af6e-4f98-4562-bdf8-7662216de04b","year":2024},"citing_paper":{"arxiv_id":"2603.22911","last_updated":"2026-04-12T14:01:49Z","snapshot_observed_at":"2026-08-03T01:43:21.251112Z","submitted_at":"2026-03-24T08:01:16Z","title":"ForestPrune: High-ratio Visual Token Compression for Video Multimodal Large Language Models via Spatial-Temporal Forest Modeling","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-15T00:56:47.841355Z"},"links":{"cited_paper":"/paper/2501.01986","citing_paper":"/paper/2603.22911"},"observation_digest":"sha256:ffea031612c38a49cac1e0b863211926e0759b9a37ed7be8ad927bd130a16a6a","observation_id":"f1fb8254-03a9-498b-8f29-a67fafa8698c","resolution":{"observed_at":"2026-05-15T00:58:25.578048Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01986","last_updated":"2025-07-24T18:44:26Z","snapshot_observed_at":"2026-07-06T20:16:18.023949Z","submitted_at":"2024-12-30T17:31:37Z","title":"FrameFusion: Combining Similarity and Importance for Video Token Reduction on Large Vision Language Models","version":2},"cited_work":{"arxiv_id":"2501.01986","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.01986","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Framefusion: Combining similarity and importance for video token reduction on large visual language models.arXiv preprint arXiv:2501.01986","venue":null,"work_id":"c9a8af6e-4f98-4562-bdf8-7662216de04b","year":2024},"citing_paper":{"arxiv_id":"2604.08077","last_updated":"2026-04-09T10:48:32Z","snapshot_observed_at":"2026-07-06T22:57:13.745326Z","submitted_at":"2026-04-09T10:48:32Z","title":"AdaSpark: Adaptive Sparsity for Efficient Long-Video Understanding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T17:21:47.439019Z"},"links":{"cited_paper":"/paper/2501.01986","citing_paper":"/paper/2604.08077"},"observation_digest":"sha256:c879aa1c32280c1dcf790d5f7d23178abd564302967bea4f36080b72ce32d652","observation_id":"e751a35f-1465-4842-b509-70896a92690c","resolution":{"observed_at":"2026-05-11T06:56:04.303398Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01986","last_updated":"2025-07-24T18:44:26Z","snapshot_observed_at":"2026-07-06T20:16:18.023949Z","submitted_at":"2024-12-30T17:31:37Z","title":"FrameFusion: Combining Similarity and Importance for Video Token Reduction on Large Vision Language Models","version":2},"cited_work":{"arxiv_id":"2501.01986","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.01986","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Framefusion: Combining similarity and importance for video token reduction on large visual language models.arXiv preprint arXiv:2501.01986","venue":null,"work_id":"c9a8af6e-4f98-4562-bdf8-7662216de04b","year":2024},"citing_paper":{"arxiv_id":"2605.03351","last_updated":"2026-05-05T04:13:32Z","snapshot_observed_at":"2026-07-06T23:16:15.509235Z","submitted_at":"2026-05-05T04:13:32Z","title":"VLMaxxing through FrameMogging Training-Free Anti-Recomputation for Video Vision-Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-08T01:30:15.463051Z"},"links":{"cited_paper":"/paper/2501.01986","citing_paper":"/paper/2605.03351"},"observation_digest":"sha256:b8726711895c969ed6dc98fcf0c4a317851a52545af04ad33cec98fa162d42cc","observation_id":"283bf54e-4e36-456a-8fb0-281b24c26d04","resolution":{"observed_at":"2026-05-11T23:11:13.939144Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01986","last_updated":"2025-07-24T18:44:26Z","snapshot_observed_at":"2026-07-06T20:16:18.023949Z","submitted_at":"2024-12-30T17:31:37Z","title":"FrameFusion: Combining Similarity and Importance for Video Token Reduction on Large Vision Language Models","version":2},"cited_work":{"arxiv_id":"2501.01986","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.01986","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Framefusion: Combining similarity and importance for video token reduction on large visual language models.arXiv preprint arXiv:2501.01986","venue":null,"work_id":"c9a8af6e-4f98-4562-bdf8-7662216de04b","year":2024},"citing_paper":{"arxiv_id":"2605.11803","last_updated":"2026-05-12T08:58:49Z","snapshot_observed_at":"2026-07-06T23:23:34.924221Z","submitted_at":"2026-05-12T08:58:49Z","title":"OTT-Vid: Optimal Transport Temporal Token Compression for Video Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-13T05:49:36.807884Z"},"links":{"cited_paper":"/paper/2501.01986","citing_paper":"/paper/2605.11803"},"observation_digest":"sha256:32250db113fd108a1d33b28e600503b609f2188c4fbef4a2fe385a3254c07584","observation_id":"d7ea209d-850e-41a8-a95d-ce6317404937","resolution":{"observed_at":"2026-05-13T05:52:22.314857Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01986","last_updated":"2025-07-24T18:44:26Z","snapshot_observed_at":"2026-07-06T20:16:18.023949Z","submitted_at":"2024-12-30T17:31:37Z","title":"FrameFusion: Combining Similarity and Importance for Video Token Reduction on Large Vision Language Models","version":2},"cited_work":{"arxiv_id":"2501.01986","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.01986","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Framefusion: Combining similarity and importance for video token reduction on large visual language models.arXiv preprint arXiv:2501.01986","venue":null,"work_id":"c9a8af6e-4f98-4562-bdf8-7662216de04b","year":2024},"citing_paper":{"arxiv_id":"2605.12056","last_updated":"2026-05-12T12:42:44Z","snapshot_observed_at":"2026-07-06T23:23:48.960874Z","submitted_at":"2026-05-12T12:42:44Z","title":"OmniRefine: Alignment-Aware Cooperative Compression for Efficient Omnimodal Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-13T04:52:03.076788Z"},"links":{"cited_paper":"/paper/2501.01986","citing_paper":"/paper/2605.12056"},"observation_digest":"sha256:e1b4bfd20c8978936027f33bae80cfa7277347910e45983bf423b9044ac92c4b","observation_id":"e387f156-1e65-4a9d-a278-1fd740ff47d1","resolution":{"observed_at":"2026-05-13T04:52:16.246111Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.01986/citation-record","integrity":"/paper/2501.01986/integrity","json":"/paper/2501.01986/citation-record.json","paper":"/paper/2501.01986"},"outbound":[],"paper":{"arxiv_id":"2501.01986","last_updated":"2025-07-24T18:44:26Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T20:16:18.023949Z","submitted_at":"2024-12-30T17:31:37Z","title":"FrameFusion: Combining Similarity and Importance for Video Token Reduction on Large Vision Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 10 inbound Pith citation observations for arXiv:2501.01986."}