{"as_of":"2026-08-10T09:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7c6d2765e492cf7f411b8e706354ab64dad2051c38919885384de582ce167c86","coverage":[{"denominator":63,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":63,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:32:50.801112Z","state":"measured"},{"denominator":67,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":67,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T23:46:51.654336Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-20T06:58:05.988167Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-09T00:35:41.482303Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"cited_work":{"arxiv_id":"2507.07990","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.07990","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multi-granular spatio-temporal token merging for training-free acceleration of video llms","venue":null,"work_id":"df9eee6f-b132-4c65-982c-e300a0c9dd8c","year":2025},"citing_paper":{"arxiv_id":"2509.08016","last_updated":"2026-04-09T01:22:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-09T00:55:04Z","title":"Video Parallel Scaling: Aggregating Diverse Frame Subsets for VideoLLMs","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-18T18:35:01.328250Z"},"links":{"cited_paper":"/paper/2507.07990","citing_paper":"/paper/2509.08016"},"observation_digest":"sha256:528d85e56ed0fc5f4dc4552352ab0286e6a5a52e7659af76e75d584a3a984296","observation_id":"e99a8d45-4dcb-453b-80d4-725afbba76f0","resolution":{"observed_at":"2026-05-18T18:36:44.191878Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-09T00:35:41.482303Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"cited_work":{"arxiv_id":"2507.07990","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.07990","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multi-granular spatio-temporal token merging for training-free acceleration of video llms","venue":null,"work_id":"df9eee6f-b132-4c65-982c-e300a0c9dd8c","year":2025},"citing_paper":{"arxiv_id":"2605.03351","last_updated":"2026-05-05T04:13:32Z","snapshot_observed_at":"2026-07-06T23:16:15.509235Z","submitted_at":"2026-05-05T04:13:32Z","title":"VLMaxxing through FrameMogging Training-Free Anti-Recomputation for Video Vision-Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-08T01:30:15.463051Z"},"links":{"cited_paper":"/paper/2507.07990","citing_paper":"/paper/2605.03351"},"observation_digest":"sha256:213d01ab5cc8d0d6430763c4fde0b78b64ceae4c085a680f9d7662c3837d234e","observation_id":"8cb5c6ec-fea4-4edd-8ed6-17874b0c7018","resolution":{"observed_at":"2026-05-11T23:11:13.772797Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-09T00:35:41.482303Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"cited_work":{"arxiv_id":"2507.07990","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.07990","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multi-granular spatio-temporal token merging for training-free acceleration of video llms","venue":null,"work_id":"df9eee6f-b132-4c65-982c-e300a0c9dd8c","year":2025},"citing_paper":{"arxiv_id":"2605.19322","last_updated":"2026-05-19T04:02:01Z","snapshot_observed_at":"2026-08-02T06:11:11.606278Z","submitted_at":"2026-05-19T04:02:01Z","title":"DynaTok: Temporally Adaptive and Positional Bias-Aware Token Compression for Video-LLMs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-20T06:55:01.619441Z"},"links":{"cited_paper":"/paper/2507.07990","citing_paper":"/paper/2605.19322"},"observation_digest":"sha256:a0b9060adc0cb6fd507032e48b843b1987b9b8f28a7738bc66acf9369311a3e6","observation_id":"27a489f0-2b34-46c3-b16b-76908f60e426","resolution":{"observed_at":"2026-05-20T06:58:05.989905Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-09T00:35:41.482303Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.07990","snapshot_observed_at":"2026-08-04T23:46:51.654336Z","title":"IEEE/CVF International Conference on Computer Vision (ICCV) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01644","last_updated":"2026-08-03T03:27:46Z","snapshot_observed_at":"2026-08-08T16:21:27.207921Z","submitted_at":"2026-08-03T03:27:46Z","title":"CRAFT: Compression via Recursive Adaptive Fusion of Video Tokens for Vision-Language Models","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-04T23:46:51.654336Z"},"links":{"cited_paper":"/paper/2507.07990","citing_paper":"/paper/2608.01644"},"observation_digest":"sha256:38c64678496a80dfa01a692d8737639944dac5614373ad4a862a39a1b9457bd1","observation_id":"d890eb34-3b8c-4d7c-8973-4ab572bb59d4","resolution":{"observed_at":"2026-08-04T23:46:51.654336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.07990/citation-record","integrity":"/paper/2507.07990/integrity","json":"/paper/2507.07990/citation-record.json","paper":"/paper/2507.07990"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-06T18:32:44.920094Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-09T00:35:41.482303Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:44.920094Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:169a1c3fafdc5417bbb791b530271cefcdcf61fe9f79cc13e2abb9afec87ff8f","observation_id":"246b891c-bda5-48f4-b44b-df2299f204f7","resolution":{"observed_at":"2026-08-06T18:32:44.920094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:53.429946Z","title":"Token merging: Your vit but faster","venue":null,"work_id":"a269a57a-8cb1-40b8-8d73-3d04eaa34ed2","year":2023},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-09T00:35:41.482303Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:45.007491Z"},"links":{"citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:8170f52fa978cf266d55ffc2ca920f4634aad049c8503c025ebd384244c760ee","observation_id":"7d0f0eb4-1003-46b9-83f2-6d8fd01db424","resolution":{"observed_at":"2026-08-06T18:32:53.444166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02069","last_updated":"2025-05-15T17:18:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T07:51:30Z","title":"PyramidKV: Dynamic KV Cache Compression based on Pyramidal Information Funneling","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02069","snapshot_observed_at":"2026-08-06T18:32:45.136591Z","title":"Pyramidkv: Dynamic kv cache compression based on pyramidal information funneling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-09T00:35:41.482303Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:45.136591Z"},"links":{"cited_paper":"/paper/2406.02069","citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:8fe724718af08b6d8cc99640993d77bf450b72c457dd42fbe746947922b4ba3a","observation_id":"1d098822-e46e-43ba-98be-c0a9f7a2e67f","resolution":{"observed_at":"2026-08-06T18:32:45.136591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:53.406154Z","title":"Quo vadis, action recognition? a new model and the kinetics dataset","venue":null,"work_id":"73e163c6-627a-422d-8085-691304a6dc14","year":2017},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-09T00:35:41.482303Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:45.252215Z"},"links":{"citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:1e3c3d0b28b2dc933f9d85fae98d84967de29e75a43246b024fcca7cc15842db","observation_id":"0670cd7b-274a-459c-8110-fa130e3564d1","resolution":{"observed_at":"2026-08-06T18:32:53.411633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:53.386511Z","title":"Honeybee: Locality-enhanced projector for multimodal llm","venue":null,"work_id":"31fd9ad9-4c77-4f53-9781-46c01b275f41","year":2024},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-09T00:35:41.482303Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:45.386772Z"},"links":{"citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:f3890c976d5c4a721f077654c8297e2c6e0f3a320768fc55aef810dc943772aa","observation_id":"19b8f3b1-b4e2-4330-b2cc-7d25e356367c","resolution":{"observed_at":"2026-08-06T18:32:53.392591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:53.366721Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference acceleration for large vision-language models","venue":null,"work_id":"4617d82b-e914-4ee6-8d28-ad46fc6a95c5","year":2024},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-09T00:35:41.482303Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:45.517307Z"},"links":{"citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:b546645224a88892923291da3b425cabde2f456b195b0918900ce17e758ee6b8","observation_id":"37f2bc3d-cab8-4313-b194-437375aacf32","resolution":{"observed_at":"2026-08-06T18:32:53.374669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:53.345478Z","title":"Longvila: Scaling long-context visual language models for long videos","venue":null,"work_id":"3d48c1f2-b708-431e-afc7-dc947159e5a7","year":2025},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-09T00:35:41.482303Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:45.618165Z"},"links":{"citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:3bbd5e8e1c65e98508d495639892a3948143ecdb121064d043853f1735c82d2d","observation_id":"b7c8df05-599c-413e-b4df-e5ea529487ce","resolution":{"observed_at":"2026-08-06T18:32:53.352568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:53.324351Z","title":"vid-tldr: Training free token merging for light-weight video transformer","venue":null,"work_id":"84cd3fb1-e2a6-40b2-849f-2197f31cff7a","year":2024},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-09T00:35:41.482303Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:45.710034Z"},"links":{"citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:aaa0c5fdd3a2e8c0b81d86d5d58dcc6bac5322d5d08d2a9bd0c92a90cafd564b","observation_id":"e62eee1b-61e5-463a-9b3c-2e7f17199433","resolution":{"observed_at":"2026-08-06T18:32:53.331836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:53.298647Z","title":"FlashAttention-2: Faster attention with better par- allelism and work partitioning","venue":null,"work_id":"59bf344a-772d-4e34-b485-8de499c8ec22","year":2024},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-09T00:35:41.482303Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:45.804392Z"},"links":{"citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:22688c6dcb586f9ca575d0a430a266520fb57c3810d08ee7f140f4c86bf60a49","observation_id":"5e573a74-dfd0-4e4c-b898-554117a8c69a","resolution":{"observed_at":"2026-08-06T18:32:53.306539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:53.278570Z","title":"Fu, Stefano Ermon, Atri Rudra, and Christopher R´e","venue":null,"work_id":"de72764b-2401-4fd8-9a9b-053e84975f0b","year":2022},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-09T00:35:41.482303Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:45.866227Z"},"links":{"citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:1c9bf01a1ec395855e59276f8ad0d2677c646907034a35b4911603c790b1e125","observation_id":"be0085a3-55d6-4f57-a88d-a988eef926be","resolution":{"observed_at":"2026-08-06T18:32:53.284441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T18:32:45.999654Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-09T00:35:41.482303Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:45.999654Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:15acb97480e5e81ed784e4ece3988eab37a187fb34d5e3c3ce292210289df048","observation_id":"ec769102-d618-4f13-a71a-79fbae6b2218","resolution":{"observed_at":"2026-08-06T18:32:45.999654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:53.259589Z","title":"Masked autoencoders as spatiotemporal learners","venue":null,"work_id":"c8352a11-55e4-4d1d-9009-b60335c09a5a","year":2022},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-09T00:35:41.482303Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:46.168771Z"},"links":{"citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:7a07ccdc13c90e3738100479f0d88d1da846c34b0e2214ea671d666e651473ee","observation_id":"2f038acb-cd79-4778-b467-fe202eed1361","resolution":{"observed_at":"2026-08-06T18:32:53.265252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:53.238261Z","title":"Quad trees a data structure for retrieval on composite keys","venue":null,"work_id":"d41a98cf-cc84-42e4-980e-d7613965f872","year":1974},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-09T00:35:41.482303Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:46.273906Z"},"links":{"citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:d8efabe7ef99675a2254c56a60ec89f2752fd27fc7c1b00170ca66550b88c1e0","observation_id":"77307511-04a3-486b-80c8-5018115eb2da","resolution":{"observed_at":"2026-08-06T18:32:53.245530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:53.216414Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis","venue":null,"work_id":"45d99bae-64ba-4bd9-92fc-061a08f872f1","year":2025},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-09T00:35:41.482303Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:46.372576Z"},"links":{"citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:39c6febc4f79c7cf559d1bdf14b8fc0f3a2c1c73e017217a5b4f98a208415247","observation_id":"86f94159-5ea6-41b5-a195-dcd31f95a052","resolution":{"observed_at":"2026-08-06T18:32:53.222087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01986","last_updated":"2025-07-24T18:44:26Z","snapshot_observed_at":"2026-07-06T20:16:18.023949Z","submitted_at":"2024-12-30T17:31:37Z","title":"FrameFusion: Combining Similarity and Importance for Video Token Reduction on Large Vision Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01986","snapshot_observed_at":"2026-08-06T18:32:46.455680Z","title":"Framefusion: Combining similarity and importance for video token reduction on large visual language models.arXiv preprint arXiv:2501.01986, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-09T00:35:41.482303Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:46.455680Z"},"links":{"cited_paper":"/paper/2501.01986","citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:587cf79070d813f2c3c49d2928b32e57c8d24d34453cea968954cc54882de3aa","observation_id":"e842939a-c212-4e01-b7fd-dfc93bcc6dee","resolution":{"observed_at":"2026-08-06T18:32:46.455680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:53.198827Z","title":"Caching — google ai, 2024","venue":null,"work_id":"32db795f-f245-4cc3-86d5-b6fe7ad8632b","year":2024},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-09T00:35:41.482303Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:46.509746Z"},"links":{"citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:2b5409fc899c3a41cb0f9a3f97a91b74f4f16602a3b00d739f13e2445f0e64e1","observation_id":"f045812b-d2eb-4998-a0d9-76435809e32a","resolution":{"observed_at":"2026-08-06T18:32:53.204484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-06T18:32:46.642984Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-09T00:35:41.482303Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:46.642984Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:02735f0a885c87df9880c5e083320052d377fb7c639648b659249617ca8cfe68","observation_id":"dcec1c7b-82b6-43cc-bda6-1910dc2673e5","resolution":{"observed_at":"2026-08-06T18:32:46.642984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:46.759667Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-09T00:35:41.482303Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:46.759667Z"},"links":{"citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:500bcbbb14b8ab78d98955bc0d79583b58af31975ac1bf09defd633ea7710715","observation_id":"e5902d98-fde2-470b-9f0e-c750d81456e5","resolution":{"observed_at":"2026-08-06T18:32:46.759667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:53.165769Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":"3420807f-474b-4754-bc0f-c9a3551c1d34","year":2022},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-09T00:35:41.482303Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:46.855039Z"},"links":{"citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:838af3cccd1216b128ef085e34bd90af26d87f912ceedf090b9afdc92363684c","observation_id":"0d4efc77-4d15-4bd9-85ff-deabb6392d3a","resolution":{"observed_at":"2026-08-06T18:32:53.171666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16117","last_updated":"2024-12-20T18:01:58Z","snapshot_observed_at":"2026-08-10T02:13:56.094339Z","submitted_at":"2024-12-20T18:01:58Z","title":"PruneVid: Visual Token Pruning for Efficient Video Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16117","snapshot_observed_at":"2026-08-06T18:32:46.995554Z","title":"Prunevid: Visual to- ken pruning for efficient video large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-09T00:35:41.482303Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:46.995554Z"},"links":{"cited_paper":"/paper/2412.16117","citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:ff2b8fc874b472c1077468e747fd7639fa02d3542c3a0ee02daee6fed4bf10e0","observation_id":"d544c777-c601-45fb-a23e-d49639e58b38","resolution":{"observed_at":"2026-08-06T18:32:46.995554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:53.142684Z","title":"Chat-univi: Unified visual representation em- powers large language models with image and video under- standing","venue":null,"work_id":"da43fc5d-95eb-4b34-876d-dd202b4e18d1","year":2024},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-09T00:35:41.482303Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:47.097387Z"},"links":{"citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:c361d605805c746129a9acff34e25291c7f134ee0aea32e962964cf1fdced7b2","observation_id":"39e5f196-45bd-42c2-a28a-cb5acb60cc83","resolution":{"observed_at":"2026-08-06T18:32:53.148978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:53.125378Z","title":"Needle in a haystack – pressure testing llms","venue":null,"work_id":"cd206bc2-d579-4bf5-95af-10449b6ede46","year":2023},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-09T00:35:41.482303Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:47.206402Z"},"links":{"citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:f36dff202278d0a784ba3b791c5e0b381c10176a22a2441f66876160e99babef","observation_id":"8d0fd6b9-ffdf-4105-9e21-fbf443daf535","resolution":{"observed_at":"2026-08-06T18:32:53.130345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:53.107926Z","title":"Handwritten digit recognition with a back- propagation network","venue":null,"work_id":"55e8a3d0-fe87-4596-bca0-45320bc8b80f","year":1989},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-09T00:35:41.482303Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:47.301474Z"},"links":{"citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:b481b28653dec3c95efd1b8ec2285dc6a684c9048f0764eec18c334f9c427041","observation_id":"e7b38e68-d904-4f5a-b31d-54e76909e05b","resolution":{"observed_at":"2026-08-06T18:32:53.113062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:47.367536Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-09T00:35:41.482303Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:47.367536Z"},"links":{"citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:2ed33e7a16840bfc42b2ec0cda8ce828992c0ecaeb21f21349f0ea6d68a281d9","observation_id":"85685f60-2fb4-4cc9-86df-c99a101a9a0c","resolution":{"observed_at":"2026-08-06T18:32:47.367536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:53.076392Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"5cc0cebe-e676-441b-8980-4d19dc4a306a","year":2023},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-09T00:35:41.482303Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:47.470093Z"},"links":{"citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:9bc850ef1dd7cd52f622620149c54e2d031ffe1b368d22d8e5b108b6e5a6c93e","observation_id":"8b0f4a29-485c-4221-ac3b-4e0064bc0f6f","resolution":{"observed_at":"2026-08-06T18:32:53.081714Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-06T18:32:47.575406Z","title":"Videochat: Chat-centric video understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-09T00:35:41.482303Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:47.575406Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:e94b0fedc7b125e3de54795ed8de6e7609d3c583a7792173dcff27a8d90c7b89","observation_id":"3c22a84a-1f9d-4894-bd7a-ddec8a09b6be","resolution":{"observed_at":"2026-08-06T18:32:47.575406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:53.055838Z","title":"Mvbench: A comprehensive multi- modal video understanding benchmark","venue":null,"work_id":"c88c5ccb-2605-42c4-9aa8-acabb1aff596","year":2024},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-09T00:35:41.482303Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:47.618941Z"},"links":{"citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:9098051e7b7c554ef7e4c8c4be06c67bd6bd438539031539d131e5e8808b6f57","observation_id":"e2e21bf8-0ea7-422d-92da-9f74675e0312","resolution":{"observed_at":"2026-08-06T18:32:53.063042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:53.034399Z","title":"Video-llava: Learning united visual repre- sentation by alignment before projection","venue":null,"work_id":"d5ba58fb-92d8-4af2-adef-4a12404d8145","year":2024},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-09T00:35:41.482303Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:47.732124Z"},"links":{"citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:c621ea0cd1434fba6e41ecd73fa3c756fee9550fca792b5f31781fab94bd4390","observation_id":"77420b45-60dd-4a2a-ae06-5c850c902b2e","resolution":{"observed_at":"2026-08-06T18:32:53.042764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:53.008722Z","title":"Visual instruction tuning","venue":null,"work_id":"54d94179-a22d-4786-b13b-131d98316cff","year":2023},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-09T00:35:41.482303Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:47.844102Z"},"links":{"citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:1b0eddcadfda28781b0ac79597f4d66b2e51c52bd6c381a8664392fd7bc468eb","observation_id":"bf4da92a-b536-4555-9aed-2d58320ef6c8","resolution":{"observed_at":"2026-08-06T18:32:53.017634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08268","last_updated":"2025-02-03T21:47:31Z","snapshot_observed_at":"2026-08-05T16:01:06.026395Z","submitted_at":"2024-02-13T07:47:36Z","title":"World Model on Million-Length Video And Language With Blockwise RingAttention","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08268","snapshot_observed_at":"2026-08-06T18:32:47.962155Z","title":"World model on million-length video and language with blockwise ringattention","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-09T00:35:41.482303Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:47.962155Z"},"links":{"cited_paper":"/paper/2402.08268","citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:f96c93fb77b689b8730247fe8db6af254a5dc04c6d05e6e693b4eef748647f06","observation_id":"1e5324cc-5866-4d60-a22a-132504cbcc9d","resolution":{"observed_at":"2026-08-06T18:32:47.962155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:52.983122Z","title":"Ring atten- tion with blockwise transformers for near-infinite context","venue":null,"work_id":"80a6f59f-f35c-4f41-aea6-4276c1a52811","year":2024},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-09T00:35:41.482303Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:48.093263Z"},"links":{"citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:50eeae1bdddf8960900792d381e736d2baa6e0ef628e70749d359b3014358064","observation_id":"caeac0d6-d89a-49eb-b1f9-09ba2d3d5223","resolution":{"observed_at":"2026-08-06T18:32:52.989405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:48.187988Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-09T00:35:41.482303Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:48.187988Z"},"links":{"citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:baa38515dac2a2977042e7cadcedb3fc3547aa019cad5029e5e7881d23f80848","observation_id":"ed03f2a1-23f5-4a19-b587-574980db0d02","resolution":{"observed_at":"2026-08-06T18:32:48.187988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:52.940785Z","title":"Egoschema: A diagnostic benchmark for very long- form video language understanding","venue":null,"work_id":"a5c9fc17-477f-4fb3-8204-7a5455ce1a71","year":2023},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-09T00:35:41.482303Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:48.260745Z"},"links":{"citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:b2f107a749311a5b53cd9cfd376750c97640d22c4612307f52d6f7f0f36df39a","observation_id":"16437856-d4e5-4593-8847-7fa463692fc7","resolution":{"observed_at":"2026-08-06T18:32:52.947353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:52.907193Z","title":"Efficiently scaling transformer inference","venue":null,"work_id":"10f9fbce-f1a2-47c4-856d-f70f4c56cedd","year":2023},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-09T00:35:41.482303Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:48.312111Z"},"links":{"citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:8ab8a164e25ef61ce9c7e3c11bbea0ea022a62376a316ae34b5061a768b55298","observation_id":"4b8f8318-4e79-4561-9f1e-926a1142560c","resolution":{"observed_at":"2026-08-06T18:32:52.915585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:52.876184Z","title":"Timechat: A time-sensitive multimodal large language model for long video understanding","venue":null,"work_id":"74840a0b-f025-4bcb-bba5-5833bccdff32","year":2024},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-09T00:35:41.482303Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:48.362612Z"},"links":{"citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:21d58841a60058f8e1b2a57140c14869108c47ca67d71be26c024dfad4c9d9c9","observation_id":"687cec00-dd84-4cf7-ad26-d5f4fadf6b97","resolution":{"observed_at":"2026-08-06T18:32:52.887336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16267","last_updated":"2025-06-09T19:33:32Z","snapshot_observed_at":"2026-07-06T19:37:16.203681Z","submitted_at":"2024-10-21T17:59:11Z","title":"xGen-MM-Vid (BLIP-3-Video): You Only Need 32 Tokens to Represent a Video Even in VLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16267","snapshot_observed_at":"2026-08-06T18:32:48.415433Z","title":"xgen-mm-vid (blip-3- video): You only need 32 tokens to represent a video even in vlms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-09T00:35:41.482303Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:48.415433Z"},"links":{"cited_paper":"/paper/2410.16267","citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:9828e603e84ed549853c7d6a3db05fe4276cf174429b9df19886330164330213","observation_id":"83a72fcd-4822-4217-91f4-a59a1769c279","resolution":{"observed_at":"2026-08-06T18:32:48.415433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:52.851752Z","title":"The quadtree and related hierarchical data structures","venue":null,"work_id":"e1695e9d-404f-4a71-8a61-6f33ab53f5d1","year":1984},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-09T00:35:41.482303Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:48.491626Z"},"links":{"citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:f6143969b6a5d65eb0186f29ef6461ff33030cc11059d8f4ddd26836847b7eed","observation_id":"88fcb5da-9be6-487d-b531-a752d5631b86","resolution":{"observed_at":"2026-08-06T18:32:52.860677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:48.573421Z","title":"Llava-prumerge: Adaptive token reduction for efficient large multimodal models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-09T00:35:41.482303Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:48.573421Z"},"links":{"citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:2aabc2f01e882c53185c6daeadf3efc20a9cea45d8cc2b73b1f3b89ed44b346d","observation_id":"bbe2353b-5f2b-47e9-b11b-23ed357065d0","resolution":{"observed_at":"2026-08-06T18:32:48.573421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:52.820880Z","title":"Moviechat: From dense token to sparse memory for long video understanding","venue":null,"work_id":"6243f248-01bb-4bfd-afdf-010e9213840c","year":2024},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-09T00:35:41.482303Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:48.647081Z"},"links":{"citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:71f6e3bb2a875b9093a6045f5e941106a5f0b1450959ca09f84b9482429ba7eb","observation_id":"7ee7ef49-1ddd-424c-848b-70815a92fcd9","resolution":{"observed_at":"2026-08-06T18:32:52.830881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:48.725013Z","title":"Roformer: Enhanced transformer with rotary position embedding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-09T00:35:41.482303Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:48.725013Z"},"links":{"citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:00da253a69613c428be156528bb72d9a4acf48fbf00d7ea048356dee529f1244","observation_id":"afe23cbc-779d-4373-be94-3f1a48a468b9","resolution":{"observed_at":"2026-08-06T18:32:48.725013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:52.779401Z","title":"Efficient quadtree cod- ing of images and video","venue":null,"work_id":"a0715b88-6593-4843-bfd8-5228480be607","year":1994},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-09T00:35:41.482303Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:48.768904Z"},"links":{"citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:11382390ee5a5ae35fa78cc65c749796559674f42e6abc8d32a295eaf90cde51","observation_id":"1026ae0b-c4e0-46ae-a06a-306d747fec8e","resolution":{"observed_at":"2026-08-06T18:32:52.786169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:52.760693Z","title":"Overview of the high efficiency video coding (hevc) standard","venue":null,"work_id":"b4ab9d59-2143-435b-bbee-dadd1ecf3cd0","year":2012},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-09T00:35:41.482303Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:48.839547Z"},"links":{"citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:607cfa4b4f7b2723a2285556205d8b54e10aeca8ccbb656746e54e8cab028cda","observation_id":"827c1b70-8999-44b3-845f-e9a464a8003c","resolution":{"observed_at":"2026-08-06T18:32:52.766030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:52.686756Z","title":"Dycoke: Dynamic compression of tokens for fast video large language models","venue":null,"work_id":"a51251ff-9dfc-4aa2-b50d-714ae804ad57","year":2025},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-09T00:35:41.482303Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:48.887333Z"},"links":{"citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:d1f03787e5a848299dd5a9b50f5c11c6e2c340aeb19838330f22cf7d0ea05063","observation_id":"1e0ee72e-7428-48f7-b981-87a41aa44524","resolution":{"observed_at":"2026-08-06T18:32:52.739311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:52.587752Z","title":"Efficiency of a good but not linear set union algorithm","venue":null,"work_id":"f2f4620d-6a2a-470a-8b61-f7f1f9f7e7a0","year":1975},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-09T00:35:41.482303Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:48.958480Z"},"links":{"citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:593777b21e582bf9dc3e1fbacb29cfdcb916e2290b262fff766183385a52aee7","observation_id":"1928e642-4168-443d-9c79-469fbc97316f","resolution":{"observed_at":"2026-08-06T18:32:52.619484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-06T18:32:49.021249Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-09T00:35:41.482303Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:49.021249Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:1f2f3da0e8035f711b8b4bbdcb684f1a680091d49294f3abc08ec080cd121cc1","observation_id":"b26d5fc4-c105-4f25-9614-c9a0da4e329b","resolution":{"observed_at":"2026-08-06T18:32:49.021249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:52.446473Z","title":"Videomae: Masked autoencoders are data-efficient learners for self-supervised video pre-training","venue":null,"work_id":"33334c95-7ec8-478d-9955-20ed6f9fbb66","year":2022},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-09T00:35:41.482303Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:49.081969Z"},"links":{"citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:b45eb0fe55cf704ba3fa28184c00ea9c9200aca42cd856c8ce93cd54d7d00dfd","observation_id":"c7ba62c1-f17b-40e1-b81c-0cf3e1fadad7","resolution":{"observed_at":"2026-08-06T18:32:52.511623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-06T18:32:49.147349Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-09T00:35:41.482303Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:49.147349Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:88d23e6ca33e99196d1800fd31cca2619490a50e4b4a3e46eb40be1d17204628","observation_id":"f213867e-cd85-461f-836d-1cc6c5668753","resolution":{"observed_at":"2026-08-06T18:32:49.147349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:52.326362Z","title":"Learning spatiotemporal features with 3d convolutional networks","venue":null,"work_id":"c2495b60-5c31-4cfc-82b6-c21c7a83a8ef","year":null},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-09T00:35:41.482303Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:49.185062Z"},"links":{"citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:68c40bd45358bd0953eb294f5e2b60360f84655bbcc3c4f6e8058549786668d6","observation_id":"56b383c2-f3a5-4120-99e2-96f1213e87d4","resolution":{"observed_at":"2026-08-06T18:32:52.371957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18139","last_updated":"2024-06-26T07:44:24Z","snapshot_observed_at":"2026-08-04T06:27:25.663339Z","submitted_at":"2024-06-26T07:44:24Z","title":"LOOK-M: Look-Once Optimization in KV Cache for Efficient Multimodal Long-Context Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18139","snapshot_observed_at":"2026-08-06T18:32:49.280218Z","title":"Look-m: Look- once optimization in kv cache for efficient multimodal long- context inference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-09T00:35:41.482303Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:49.280218Z"},"links":{"cited_paper":"/paper/2406.18139","citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:c7c8689cb63798952e577ff7c2c19e058851f0d04516ea2d1f78e1f6db13a644","observation_id":"50d62950-433e-436a-9662-4ce9c855f577","resolution":{"observed_at":"2026-08-06T18:32:49.280218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-06T18:32:49.345961Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-09T00:35:41.482303Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:49.345961Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:482f307823a38b969cdabc9192fd4935347dd213e15df30c42fd267c523a11bc","observation_id":"c5a0000c-cdb7-4c5a-8f89-03803715ded6","resolution":{"observed_at":"2026-08-06T18:32:49.345961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01071","last_updated":"2025-08-02T13:32:09Z","snapshot_observed_at":"2026-07-06T19:09:10.244642Z","submitted_at":"2024-09-02T08:52:58Z","title":"VideoLLaMB: Long Streaming Video Understanding with Recurrent Memory Bridges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.01071","snapshot_observed_at":"2026-08-06T18:32:49.423515Z","title":"Videollamb: Long-context video understanding with recur- rent memory bridges","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-09T00:35:41.482303Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:49.423515Z"},"links":{"cited_paper":"/paper/2409.01071","citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:0542459e0c569716170196063754825e4e398ef03ba733b9910e3508e9382c79","observation_id":"0778abac-b905-4d0b-ab9a-8dd7e3b71467","resolution":{"observed_at":"2026-08-06T18:32:49.423515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:52.185879Z","title":"Sullivan, Gisle Bjontegaard, and Ajay Luthra","venue":null,"work_id":"0e9fedb7-f93f-488a-9b43-f319baabfcf1","year":2003},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-09T00:35:41.482303Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:49.484414Z"},"links":{"citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:2acfa186fbecd42391017c50fdc22f7bcef408b31a272ce4ba547a2b91bf7f32","observation_id":"8884aa8f-17de-46c5-99ab-cd1704ee6913","resolution":{"observed_at":"2026-08-06T18:32:52.254156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:52.036983Z","title":"Longvideobench: A benchmark for long-context interleaved video-language understanding","venue":null,"work_id":"fe5c3af7-d764-4408-baa0-bbdbb6609df6","year":null},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-09T00:35:41.482303Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:49.577022Z"},"links":{"citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:6948002421c2fdd41a6ee178e03b7abf79719cbe79c9d6d809a0d58ee44f0599","observation_id":"abe2f266-b145-441e-9c51-376e10e9557d","resolution":{"observed_at":"2026-08-06T18:32:52.120020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:49.636803Z","title":"Next-qa: Next phase of question-answering to explaining temporal actions","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-09T00:35:41.482303Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:49.636803Z"},"links":{"citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:27410179639037c5e5cf6296990e9d5a07d43ae5362d68811f56c2e2bf39f566","observation_id":"94cc60c0-1937-4263-a654-9ed27861d065","resolution":{"observed_at":"2026-08-06T18:32:49.636803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:51.888266Z","title":"Pyramiddrop: Accelerating your large vision-language models via pyramid visual redundancy re- duction","venue":null,"work_id":"742a3e9c-db65-4bfb-96d5-701ced8848a2","year":2025},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-09T00:35:41.482303Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:49.707972Z"},"links":{"citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:fd49aa8c76f8af8553ee28ef83bef82e6516bfdf78ce53ae12b17cc70636b169","observation_id":"7560d55b-5148-499d-92b8-ca763da865a8","resolution":{"observed_at":"2026-08-06T18:32:51.945416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-06T18:32:49.783006Z","title":"Qwen2 technical report.arXiv preprint arXiv:2407.10671, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-09T00:35:41.482303Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:49.783006Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:7a946d670fcceea366de7bb4530cadd15ce40efe47c256cc110822ebe07bcbaa","observation_id":"45a6af3d-703e-4459-8708-f0a4d375049e","resolution":{"observed_at":"2026-08-06T18:32:49.783006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12532","last_updated":"2024-06-05T09:01:24Z","snapshot_observed_at":"2026-07-06T18:17:08.160308Z","submitted_at":"2024-05-21T06:46:37Z","title":"PyramidInfer: Pyramid KV Cache Compression for High-throughput LLM Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12532","snapshot_observed_at":"2026-08-06T18:32:49.863938Z","title":"Pyramidinfer: Pyramid kv cache com- pression for high-throughput llm inference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-09T00:35:41.482303Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:49.863938Z"},"links":{"cited_paper":"/paper/2405.12532","citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:aa263ee6012f19b036a3b9c58b71cc0cabb0c04d2e22cd3219240dd25fc28a0e","observation_id":"5c385049-5d20-4389-bb81-fc98a8695fd0","resolution":{"observed_at":"2026-08-06T18:32:49.863938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:51.738137Z","title":"Video-llama: An instruction-tuned audio-visual language model for video un- derstanding","venue":null,"work_id":"719122f4-5c98-4de6-b81c-414378da7cd2","year":2023},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-09T00:35:41.482303Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:50.034259Z"},"links":{"citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:7cc5bff69c4b93f152613424060440b31590bbf3c6f2d3e1153d3c99c0ed28d3","observation_id":"e182b257-b922-4262-ad32-3d431f68bda0","resolution":{"observed_at":"2026-08-06T18:32:51.847754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-06T18:32:50.185274Z","title":"Long context transfer from language to vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-09T00:35:41.482303Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:50.185274Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:ddee5d22538b6de87a96065d9f9d0fedcc82e9e22612cf1a5c20bbef1031a55a","observation_id":"602199ed-14c7-4fbf-9815-939352dc8fa4","resolution":{"observed_at":"2026-08-06T18:32:50.185274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-06T18:32:50.312891Z","title":"Video instruction tuning with synthetic data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-09T00:35:41.482303Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:50.312891Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:a01dc08eac5dddfbc1304fd9a1a8a901523762b2958ddc2434f64f272f6758a6","observation_id":"dd7c2631-a2ca-43c3-be08-e90da971380a","resolution":{"observed_at":"2026-08-06T18:32:50.312891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09367","last_updated":"2025-03-07T09:40:34Z","snapshot_observed_at":"2026-08-03T15:46:09.775614Z","submitted_at":"2024-06-13T17:50:05Z","title":"Needle In A Video Haystack: A Scalable Synthetic Evaluator for Video MLLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09367","snapshot_observed_at":"2026-08-06T18:32:50.442322Z","title":"Needle in a video haystack: A scalable synthetic evalua- tor for video mllms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-09T00:35:41.482303Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:50.442322Z"},"links":{"cited_paper":"/paper/2406.09367","citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:8140258689cebd441b3ba69f0e7f1b255c78ee98591e8a060657245315fc604b","observation_id":"f3fd2480-95fc-42f5-8e71-53514a96b734","resolution":{"observed_at":"2026-08-06T18:32:50.442322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:51.595904Z","title":"Mlvu: Benchmarking multi-task long video understanding","venue":null,"work_id":"89bb41e6-91df-4436-9d23-24f08d394927","year":null},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-09T00:35:41.482303Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:50.667041Z"},"links":{"citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:384916a42066046f30e2ec87275830822128ebd14277716282bf7ccfb60a9a01","observation_id":"a7e64a4e-366b-4623-9790-6ec1045e116f","resolution":{"observed_at":"2026-08-06T18:32:51.646767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:51.526312Z","title":"11 to 14 show the absolute values for the main comparison results","venue":null,"work_id":"a78ef21c-7866-4c02-af40-3195dddf5a04","year":null},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-09T00:35:41.482303Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:50.801112Z"},"links":{"citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:1cfd5798cbfdbd32a4f1f0551a3e69530bdeeee6f59b455dfc88cd17c3cb2125","observation_id":"d05ef8e8-af0a-4b5f-8c80-030feee8b836","resolution":{"observed_at":"2026-08-06T18:32:51.576968Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T00:35:41.482303Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs"},"reference_resolution":{"displayed":63,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":0,"verified_fuzzy":37},"total_outbound_references":63},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 63 of 63 outbound references and 4 inbound Pith citation observations for arXiv:2507.07990."}