{"as_of":"2026-08-16T03:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b24f387603a7398444383601b21068a14539d148fd9e32c66cfe2a352fbd1c3f","coverage":[{"denominator":56,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T14:40:23.771906Z","state":"measured"},{"denominator":66,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":66,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":10,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":10,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:08:09.432264Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-22T14:31:40.739574Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.15024","last_updated":"2025-03-28T14:11:37Z","snapshot_observed_at":"2026-08-13T20:06:52.909920Z","submitted_at":"2024-11-22T15:55:19Z","title":"DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models","version":3},"cited_work":{"arxiv_id":"2411.15024","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.15024","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dycoke: Dynamic compression of tokens for fast video large language models","venue":null,"work_id":"746ed7dd-7dd8-4f43-8853-1a30cd36ed9b","year":2025},"citing_paper":{"arxiv_id":"2505.15269","last_updated":"2026-04-23T12:54:38Z","snapshot_observed_at":"2026-08-12T15:58:40.311449Z","submitted_at":"2025-05-21T08:47:15Z","title":"LiveVLM: Efficient Online Video Understanding via Streaming-Oriented KV Cache and Retrieval","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-22T14:26:59.015559Z"},"links":{"cited_paper":"/paper/2411.15024","citing_paper":"/paper/2505.15269"},"observation_digest":"sha256:a92c015fa0f17ce0bacc591c8f8c44e39eeedea88fa19e472a4bd603c903b2a7","observation_id":"07f9dd78-b7ea-4ce0-afbc-03b2027df9ca","resolution":{"observed_at":"2026-05-22T14:31:40.742289Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15024","last_updated":"2025-03-28T14:11:37Z","snapshot_observed_at":"2026-08-13T20:06:52.909920Z","submitted_at":"2024-11-22T15:55:19Z","title":"DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15024","snapshot_observed_at":"2026-08-07T14:08:09.432264Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20100","last_updated":"2025-05-26T15:08:37Z","snapshot_observed_at":"2026-08-15T00:34:08.333930Z","submitted_at":"2025-05-26T15:08:37Z","title":"AdaTP: Attention-Debiased Token Pruning for Video Large Language Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T14:08:09.432264Z"},"links":{"cited_paper":"/paper/2411.15024","citing_paper":"/paper/2505.20100"},"observation_digest":"sha256:eda1f97d9b32f1ba1678e2a148111d867d56cd826bb44eecfcbd11a4ea261240","observation_id":"3f1acf08-3f3e-4d4d-bf9c-889c2570e0ce","resolution":{"observed_at":"2026-08-07T14:08:09.432264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15024","last_updated":"2025-03-28T14:11:37Z","snapshot_observed_at":"2026-08-13T20:06:52.909920Z","submitted_at":"2024-11-22T15:55:19Z","title":"DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15024","snapshot_observed_at":"2026-08-07T10:56:05.362186Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-14T19:51:34.087413Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.362186Z"},"links":{"cited_paper":"/paper/2411.15024","citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:7ee0a23fc5b3d72dbc6ac8c0766af65b2a5ac0fd3ff8d1732833b15e01fd369f","observation_id":"f2792e61-63a5-472a-8d51-e05cbbedfa04","resolution":{"observed_at":"2026-08-07T10:56:05.362186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15024","last_updated":"2025-03-28T14:11:37Z","snapshot_observed_at":"2026-08-13T20:06:52.909920Z","submitted_at":"2024-11-22T15:55:19Z","title":"DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15024","snapshot_observed_at":"2026-08-06T22:24:32.266783Z","title":"Dycoke: Dynamic compression of tokens for fast video large language models.arXiv preprint arXiv:2411.15024, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21862","last_updated":"2025-06-27T02:29:58Z","snapshot_observed_at":"2026-08-13T09:08:08.645501Z","submitted_at":"2025-06-27T02:29:58Z","title":"LLaVA-Scissor: Token Compression with Semantic Connected Components for Video LLMs","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T22:24:32.266783Z"},"links":{"cited_paper":"/paper/2411.15024","citing_paper":"/paper/2506.21862"},"observation_digest":"sha256:5b7adbb58cab74036f1d3405a035a75bf55dcf0fdd792cd11fe8cd9dbb7fbb91","observation_id":"23f69557-35b7-43b7-9b7c-2d0d26d6a526","resolution":{"observed_at":"2026-08-06T22:24:32.266783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15024","last_updated":"2025-03-28T14:11:37Z","snapshot_observed_at":"2026-08-13T20:06:52.909920Z","submitted_at":"2024-11-22T15:55:19Z","title":"DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15024","snapshot_observed_at":"2026-08-06T20:29:54.595717Z","title":"Dycoke: Dynamic compression of tokens for fast video large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:54.595717Z"},"links":{"cited_paper":"/paper/2411.15024","citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:50324b0f91fe3381ae7e8aae6e59674465179d405302010f3e9b6ceb1a809c96","observation_id":"9fdda23a-e379-4a88-8fda-78e5a5fba147","resolution":{"observed_at":"2026-08-06T20:29:54.595717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15024","last_updated":"2025-03-28T14:11:37Z","snapshot_observed_at":"2026-08-13T20:06:52.909920Z","submitted_at":"2024-11-22T15:55:19Z","title":"DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models","version":3},"cited_work":{"arxiv_id":"2411.15024","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.15024","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dycoke: Dynamic compression of tokens for fast video large language models","venue":null,"work_id":"746ed7dd-7dd8-4f43-8853-1a30cd36ed9b","year":2025},"citing_paper":{"arxiv_id":"2507.21420","last_updated":"2026-04-28T19:54:45Z","snapshot_observed_at":"2026-08-13T06:15:37.784587Z","submitted_at":"2025-07-29T01:07:09Z","title":"ReGATE: Learning Faster and Better with Fewer Tokens in MLLMs","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-05-19T03:18:11.993413Z"},"links":{"cited_paper":"/paper/2411.15024","citing_paper":"/paper/2507.21420"},"observation_digest":"sha256:de4c314d9c7b20fedd357de6162fc270e4a25fd82d468418bf652469600a256b","observation_id":"09cc8165-9107-402e-b976-e1c701189c49","resolution":{"observed_at":"2026-05-19T03:22:01.139852Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15024","last_updated":"2025-03-28T14:11:37Z","snapshot_observed_at":"2026-08-13T20:06:52.909920Z","submitted_at":"2024-11-22T15:55:19Z","title":"DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models","version":3},"cited_work":{"arxiv_id":"2411.15024","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.15024","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dycoke: Dynamic compression of tokens for fast video large language models","venue":null,"work_id":"746ed7dd-7dd8-4f43-8853-1a30cd36ed9b","year":2025},"citing_paper":{"arxiv_id":"2601.14724","last_updated":"2026-05-07T12:10:26Z","snapshot_observed_at":"2026-08-15T23:51:43.902710Z","submitted_at":"2026-01-21T07:26:15Z","title":"HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding","version":4},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:04.564442Z"},"links":{"cited_paper":"/paper/2411.15024","citing_paper":"/paper/2601.14724"},"observation_digest":"sha256:539f6a67957fba79d62c7dc0cb39da0c7ac122ba973c8030d5e952c628250034","observation_id":"2b08a16f-941a-4a64-8f19-744306d50b72","resolution":{"observed_at":"2026-05-16T12:57:53.927169Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15024","last_updated":"2025-03-28T14:11:37Z","snapshot_observed_at":"2026-08-13T20:06:52.909920Z","submitted_at":"2024-11-22T15:55:19Z","title":"DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models","version":3},"cited_work":{"arxiv_id":"2411.15024","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.15024","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dycoke: Dynamic compression of tokens for fast video large language models","venue":null,"work_id":"746ed7dd-7dd8-4f43-8853-1a30cd36ed9b","year":2025},"citing_paper":{"arxiv_id":"2604.12358","last_updated":"2026-04-15T17:43:53Z","snapshot_observed_at":"2026-08-11T10:41:47.822598Z","submitted_at":"2026-04-14T06:48:31Z","title":"Why and When Visual Token Pruning Fails? A Study on Relevant Visual Information Shift in MLLMs Decoding","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-10T14:50:37.022338Z"},"links":{"cited_paper":"/paper/2411.15024","citing_paper":"/paper/2604.12358"},"observation_digest":"sha256:64645b9b44daa7245dedcd9abde6b0acb59fd9ac34e21e73ec626a457e4d5104","observation_id":"6c70ceb7-65d6-46d6-a34a-39eabd1dee2e","resolution":{"observed_at":"2026-05-11T11:31:01.468199Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15024","last_updated":"2025-03-28T14:11:37Z","snapshot_observed_at":"2026-08-13T20:06:52.909920Z","submitted_at":"2024-11-22T15:55:19Z","title":"DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models","version":3},"cited_work":{"arxiv_id":"2411.15024","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.15024","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dycoke: Dynamic compression of tokens for fast video large language models","venue":null,"work_id":"746ed7dd-7dd8-4f43-8853-1a30cd36ed9b","year":2025},"citing_paper":{"arxiv_id":"2605.07355","last_updated":"2026-05-08T07:08:54Z","snapshot_observed_at":"2026-08-14T03:29:57.547808Z","submitted_at":"2026-05-08T07:08:54Z","title":"TTF: Temporal Token Fusion for Efficient Video-Language Model","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-11T01:55:32.319344Z"},"links":{"cited_paper":"/paper/2411.15024","citing_paper":"/paper/2605.07355"},"observation_digest":"sha256:b418cfa21576a7a4a8f77bc9170319bb940c7df5406255b603150ebd04b1790f","observation_id":"e3d60966-5cf6-41f8-a06f-eb0f69c2434f","resolution":{"observed_at":"2026-05-11T04:06:00.550627Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15024","last_updated":"2025-03-28T14:11:37Z","snapshot_observed_at":"2026-08-13T20:06:52.909920Z","submitted_at":"2024-11-22T15:55:19Z","title":"DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15024","snapshot_observed_at":"2026-08-04T23:46:51.549583Z","title":"IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01644","last_updated":"2026-08-03T03:27:46Z","snapshot_observed_at":"2026-08-15T14:21:17.838676Z","submitted_at":"2026-08-03T03:27:46Z","title":"CRAFT: Compression via Recursive Adaptive Fusion of Video Tokens for Vision-Language Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-04T23:46:51.549583Z"},"links":{"cited_paper":"/paper/2411.15024","citing_paper":"/paper/2608.01644"},"observation_digest":"sha256:b8323392c0df333d62a20a652f475ce5fd99aa5b6ef857b01f5d0b2287f5c0de","observation_id":"2dad76de-74ca-4d25-993a-6a3554dad9ed","resolution":{"observed_at":"2026-08-04T23:46:51.549583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2411.15024/citation-record","integrity":"/paper/2411.15024/integrity","json":"/paper/2411.15024/citation-record.json","paper":"/paper/2411.15024"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2210.09461","last_updated":"2023-03-01T19:45:11Z","snapshot_observed_at":"2026-08-13T04:00:22.647615Z","submitted_at":"2022-10-17T22:23:40Z","title":"Token Merging: Your ViT But Faster","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.09461","snapshot_observed_at":"2026-08-12T14:40:23.606124Z","title":"Token merging: Your vit but faster","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15024","last_updated":"2025-03-28T14:11:37Z","snapshot_observed_at":"2026-08-13T20:06:52.909920Z","submitted_at":"2024-11-22T15:55:19Z","title":"DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T14:40:23.606124Z"},"links":{"cited_paper":"/paper/2210.09461","citing_paper":"/paper/2411.15024"},"observation_digest":"sha256:df97812bdf8bc7f7933d9e397e669e6212d1233b9e1d973bb61c9425a3dcccf7","observation_id":"530f79c1-4e59-4f8a-8606-9bd9662b71ca","resolution":{"observed_at":"2026-08-12T14:40:23.606124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06764","last_updated":"2024-09-02T05:48:54Z","snapshot_observed_at":"2026-08-14T09:58:22.897108Z","submitted_at":"2024-03-11T14:35:32Z","title":"An Image is Worth 1/2 Tokens After Layer 2: Plug-and-Play Inference Acceleration for Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06764","snapshot_observed_at":"2026-08-12T14:40:23.613617Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference ac- celeration for large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15024","last_updated":"2025-03-28T14:11:37Z","snapshot_observed_at":"2026-08-13T20:06:52.909920Z","submitted_at":"2024-11-22T15:55:19Z","title":"DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T14:40:23.613617Z"},"links":{"cited_paper":"/paper/2403.06764","citing_paper":"/paper/2411.15024"},"observation_digest":"sha256:662254123de9d8a2ed84b1d5eeb8a950f6d5460d2a5a42b4de832447f40acc57","observation_id":"7cd564c9-5191-458a-aedd-52c0215a2c01","resolution":{"observed_at":"2026-08-12T14:40:23.613617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-08-14T16:25:22.654846Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-12T14:40:23.616706Z","title":"Videollama 2: Advancing spatial- temporal modeling and audio understanding in video-llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15024","last_updated":"2025-03-28T14:11:37Z","snapshot_observed_at":"2026-08-13T20:06:52.909920Z","submitted_at":"2024-11-22T15:55:19Z","title":"DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T14:40:23.616706Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2411.15024"},"observation_digest":"sha256:8ea4671f0d5e8f6da9d7a31403e1a80c23998254a5768c176ed7a8026fac375d","observation_id":"a2a99899-602b-4928-917b-a694295f98bc","resolution":{"observed_at":"2026-08-12T14:40:23.616706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.16886","snapshot_observed_at":"2026-08-12T14:40:23.620060Z","title":"Mobilevlm: A fast, reproducible and strong vision language assistant for mobile devices","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15024","last_updated":"2025-03-28T14:11:37Z","snapshot_observed_at":"2026-08-13T20:06:52.909920Z","submitted_at":"2024-11-22T15:55:19Z","title":"DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T14:40:23.620060Z"},"links":{"cited_paper":"/paper/2312.16886","citing_paper":"/paper/2411.15024"},"observation_digest":"sha256:c90765d4ab05df9e825efd3fbc22c95192a8b55f10b97f01c026e323f0727ad4","observation_id":"df522aa3-0ead-41ab-be2a-79ddb14ba327","resolution":{"observed_at":"2026-08-12T14:40:23.620060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-08-09T19:28:34.281681Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03766","snapshot_observed_at":"2026-08-12T14:40:23.623746Z","title":"Mobilevlm v2: Faster and stronger baseline for vision language model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15024","last_updated":"2025-03-28T14:11:37Z","snapshot_observed_at":"2026-08-13T20:06:52.909920Z","submitted_at":"2024-11-22T15:55:19Z","title":"DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T14:40:23.623746Z"},"links":{"cited_paper":"/paper/2402.03766","citing_paper":"/paper/2411.15024"},"observation_digest":"sha256:7b393f12df27f36efa7e178bfdd0e4ccbdf4260f5491ebd74750c376e38000ac","observation_id":"95365fbd-939e-4e5a-a890-886f386ae174","resolution":{"observed_at":"2026-08-12T14:40:23.623746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:40:24.198700Z","title":null,"venue":null,"work_id":"c9d655b9-7a7c-4bb5-918f-be759a6f27df","year":2022},"citing_paper":{"arxiv_id":"2411.15024","last_updated":"2025-03-28T14:11:37Z","snapshot_observed_at":"2026-08-13T20:06:52.909920Z","submitted_at":"2024-11-22T15:55:19Z","title":"DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T14:40:23.627431Z"},"links":{"citing_paper":"/paper/2411.15024"},"observation_digest":"sha256:d71eaf60876ba851ce9fd212e3ff1b33c712059075153cb99944dc952041f60c","observation_id":"662dffc3-0195-443e-ad69-8d197f7c7c51","resolution":{"observed_at":"2026-08-12T14:40:24.201372Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-12T14:40:23.629903Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15024","last_updated":"2025-03-28T14:11:37Z","snapshot_observed_at":"2026-08-13T20:06:52.909920Z","submitted_at":"2024-11-22T15:55:19Z","title":"DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T14:40:23.629903Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2411.15024"},"observation_digest":"sha256:ae91a6dc7f1c66d3c5138364e65b8356ab56ffb75698b048ee592535b129afbf","observation_id":"e3850772-27f2-49c4-a1e0-a3a152f19c32","resolution":{"observed_at":"2026-08-12T14:40:23.629903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14057","last_updated":"2024-07-19T06:34:45Z","snapshot_observed_at":"2026-08-14T16:48:56.338904Z","submitted_at":"2024-07-19T06:34:45Z","title":"LazyLLM: Dynamic Token Pruning for Efficient Long Context LLM Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14057","snapshot_observed_at":"2026-08-12T14:40:23.633017Z","title":"Lazyllm: Dynamic token pruning for efficient long context llm inference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15024","last_updated":"2025-03-28T14:11:37Z","snapshot_observed_at":"2026-08-13T20:06:52.909920Z","submitted_at":"2024-11-22T15:55:19Z","title":"DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T14:40:23.633017Z"},"links":{"cited_paper":"/paper/2407.14057","citing_paper":"/paper/2411.15024"},"observation_digest":"sha256:9177b151afaed15da8a9c339075fd14b7966ca0684491ba3fde1acc0ad36e558","observation_id":"e8b7dab3-7667-4bb2-91bf-6d44d6c44b0b","resolution":{"observed_at":"2026-08-12T14:40:23.633017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:40:24.191600Z","title":"Mini-internvl: a flexible-transfer pocket multi-modal model with 5% parameters and 90% perfor- mance","venue":null,"work_id":"573dfa42-b2d7-48c2-96a0-4681465848ac","year":2024},"citing_paper":{"arxiv_id":"2411.15024","last_updated":"2025-03-28T14:11:37Z","snapshot_observed_at":"2026-08-13T20:06:52.909920Z","submitted_at":"2024-11-22T15:55:19Z","title":"DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T14:40:23.636820Z"},"links":{"citing_paper":"/paper/2411.15024"},"observation_digest":"sha256:b50d46dd9f8c9e21cb696a909ab0aeb46454faef9b1a28370e32a1734977a5a0","observation_id":"b194b244-12ef-4680-adde-3143b57ddb2f","resolution":{"observed_at":"2026-08-12T14:40:24.194332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:40:24.183673Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":"ee1c4ad7-6839-4b5b-a50e-687a74a7b151","year":2022},"citing_paper":{"arxiv_id":"2411.15024","last_updated":"2025-03-28T14:11:37Z","snapshot_observed_at":"2026-08-13T20:06:52.909920Z","submitted_at":"2024-11-22T15:55:19Z","title":"DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T14:40:23.639827Z"},"links":{"citing_paper":"/paper/2411.15024"},"observation_digest":"sha256:1cc399c48f20ce9559ddcdf1ea4d433defd4b96460f3e377c9de1aa60dd78513","observation_id":"bbf33c42-8533-40eb-b11c-1c4948d21924","resolution":{"observed_at":"2026-08-12T14:40:24.186675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:40:24.176394Z","title":"Lita: Language instructed temporal-localization assistant","venue":null,"work_id":"f129cbd6-3c2f-4d66-ab82-5aff34ec8b29","year":2024},"citing_paper":{"arxiv_id":"2411.15024","last_updated":"2025-03-28T14:11:37Z","snapshot_observed_at":"2026-08-13T20:06:52.909920Z","submitted_at":"2024-11-22T15:55:19Z","title":"DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T14:40:23.642664Z"},"links":{"citing_paper":"/paper/2411.15024"},"observation_digest":"sha256:a137885ef295550353f6a88131c12f45c9ab8f5403f3fe6e221b2be8968f9d43","observation_id":"56211308-d450-46b8-92cd-3d234d3530b8","resolution":{"observed_at":"2026-08-12T14:40:24.178893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:40:24.167641Z","title":"An empirical study of llama3 quan- tization: From llms to mllms","venue":null,"work_id":"c8f20746-6b40-444c-b31b-e68d443d1fdf","year":null},"citing_paper":{"arxiv_id":"2411.15024","last_updated":"2025-03-28T14:11:37Z","snapshot_observed_at":"2026-08-13T20:06:52.909920Z","submitted_at":"2024-11-22T15:55:19Z","title":"DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T14:40:23.645458Z"},"links":{"citing_paper":"/paper/2411.15024"},"observation_digest":"sha256:8976ef6078205b2e02ba8971151e2d391ad926b7a013e5d56ad91391ef0bc319","observation_id":"6bf8a6d5-43ad-4ec1-b6b1-ed857fabb90f","resolution":{"observed_at":"2026-08-12T14:40:24.170570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:40:24.159946Z","title":"Phi-2: The surprising power of small language models","venue":null,"work_id":"28a21e67-aa59-41b2-9103-0af71090a39d","year":2023},"citing_paper":{"arxiv_id":"2411.15024","last_updated":"2025-03-28T14:11:37Z","snapshot_observed_at":"2026-08-13T20:06:52.909920Z","submitted_at":"2024-11-22T15:55:19Z","title":"DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T14:40:23.648110Z"},"links":{"citing_paper":"/paper/2411.15024"},"observation_digest":"sha256:c37d223e2afe72cb16552fff36afaf7f333930196279e56aac7ea572fa672689","observation_id":"0d8fc5da-66ec-44b0-9c2a-62c868714354","resolution":{"observed_at":"2026-08-12T14:40:24.162483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:40:24.153001Z","title":"Effec- tiveness assessment of recent large vision-language models","venue":null,"work_id":"fa0b71db-d4cf-4477-84db-2ded2ba40a9c","year":2024},"citing_paper":{"arxiv_id":"2411.15024","last_updated":"2025-03-28T14:11:37Z","snapshot_observed_at":"2026-08-13T20:06:52.909920Z","submitted_at":"2024-11-22T15:55:19Z","title":"DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T14:40:23.650708Z"},"links":{"citing_paper":"/paper/2411.15024"},"observation_digest":"sha256:8f05eae80a2d7fe2596678559068cd5ef9d41b8c615a0b5334ddd6ff9dbadd66","observation_id":"8c8faeba-6d76-4ed4-aa97-f43027f3e992","resolution":{"observed_at":"2026-08-12T14:40:24.155676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:40:24.145042Z","title":"Chat-univi: Unified visual representation em- powers large language models with image and video under- standing","venue":null,"work_id":"50be7120-c6af-443b-ac92-e8c2340cb00b","year":2024},"citing_paper":{"arxiv_id":"2411.15024","last_updated":"2025-03-28T14:11:37Z","snapshot_observed_at":"2026-08-13T20:06:52.909920Z","submitted_at":"2024-11-22T15:55:19Z","title":"DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T14:40:23.652977Z"},"links":{"citing_paper":"/paper/2411.15024"},"observation_digest":"sha256:8831d424861b094f3908cf0fa59e9fd8feee931421f8dc8ab2b5f4d833b3a928","observation_id":"890ac9fe-8c70-4b02-8a4b-12d0d1fe1eac","resolution":{"observed_at":"2026-08-12T14:40:24.148286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:40:23.656184Z","title":"Lmms-eval: Accelerating the development of large multimodal models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15024","last_updated":"2025-03-28T14:11:37Z","snapshot_observed_at":"2026-08-13T20:06:52.909920Z","submitted_at":"2024-11-22T15:55:19Z","title":"DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T14:40:23.656184Z"},"links":{"citing_paper":"/paper/2411.15024"},"observation_digest":"sha256:2ee1394f643104d7ed605618eb80a69466be313dc7ba7bcbcae7a775aafc2913","observation_id":"80b32cc2-0d2b-4c0f-8c76-96ca4d5939a0","resolution":{"observed_at":"2026-08-12T14:40:23.656184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-12T14:40:23.659409Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15024","last_updated":"2025-03-28T14:11:37Z","snapshot_observed_at":"2026-08-13T20:06:52.909920Z","submitted_at":"2024-11-22T15:55:19Z","title":"DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T14:40:23.659409Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2411.15024"},"observation_digest":"sha256:582ca8f4b1f066b1b324a547889007ba638e293d34a3be88b6eaf62fabc0dc94","observation_id":"444d4a0e-ab21-4579-958c-ccb442e8d808","resolution":{"observed_at":"2026-08-12T14:40:23.659409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-08-13T00:09:23.835117Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-12T14:40:23.662070Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15024","last_updated":"2025-03-28T14:11:37Z","snapshot_observed_at":"2026-08-13T20:06:52.909920Z","submitted_at":"2024-11-22T15:55:19Z","title":"DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T14:40:23.662070Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2411.15024"},"observation_digest":"sha256:241ff47024c79c11fc129c91f103e96db6f654e1ba71945de0aefd5d70f9823f","observation_id":"aeb20722-42e1-4cb7-b13f-c73494ca640e","resolution":{"observed_at":"2026-08-12T14:40:23.662070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:40:24.133644Z","title":"Blip- 2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"dde27b0a-d26f-4b96-bbad-193b613620d6","year":2023},"citing_paper":{"arxiv_id":"2411.15024","last_updated":"2025-03-28T14:11:37Z","snapshot_observed_at":"2026-08-13T20:06:52.909920Z","submitted_at":"2024-11-22T15:55:19Z","title":"DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T14:40:23.665109Z"},"links":{"citing_paper":"/paper/2411.15024"},"observation_digest":"sha256:bc0d3f2938e88e44bd63585cae936ec1535015d742578f1eaa25b832d1e16650","observation_id":"4ca789b6-071b-4145-ba0d-ae457bde8cca","resolution":{"observed_at":"2026-08-12T14:40:24.137189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:40:24.125617Z","title":"Tp2o: Creative text pair-to-object generation using balance swap-sampling","venue":null,"work_id":"82af13f8-3484-4df7-aee2-a087fc2de358","year":2024},"citing_paper":{"arxiv_id":"2411.15024","last_updated":"2025-03-28T14:11:37Z","snapshot_observed_at":"2026-08-13T20:06:52.909920Z","submitted_at":"2024-11-22T15:55:19Z","title":"DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T14:40:23.667682Z"},"links":{"citing_paper":"/paper/2411.15024"},"observation_digest":"sha256:ab4be9136c025b990cfeda34c442116055e26dddfec2cb0a1e475f5dbd42cca7","observation_id":"cca5709e-d411-4a1c-baff-a9270c33971d","resolution":{"observed_at":"2026-08-12T14:40:24.128620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-12T14:40:23.670848Z","title":"Videochat: Chat-centric video understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15024","last_updated":"2025-03-28T14:11:37Z","snapshot_observed_at":"2026-08-13T20:06:52.909920Z","submitted_at":"2024-11-22T15:55:19Z","title":"DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T14:40:23.670848Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2411.15024"},"observation_digest":"sha256:530b3c773817ab16d6581e5f176b6da2b5b3de13d1c43825d527e9e38f82343d","observation_id":"ad9317d3-9ab5-4df5-877d-82cced281e69","resolution":{"observed_at":"2026-08-12T14:40:23.670848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:40:24.118625Z","title":"Mvbench: A comprehensive multi-modal video understand- ing benchmark","venue":null,"work_id":"c9a33c3a-e7b3-49fa-942d-ce260078f06b","year":2024},"citing_paper":{"arxiv_id":"2411.15024","last_updated":"2025-03-28T14:11:37Z","snapshot_observed_at":"2026-08-13T20:06:52.909920Z","submitted_at":"2024-11-22T15:55:19Z","title":"DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T14:40:23.674434Z"},"links":{"citing_paper":"/paper/2411.15024"},"observation_digest":"sha256:61ddf823a6553757c7a09faf5b3285089cd26843df688671a8cae49d33ba03d1","observation_id":"3ac6aed7-a5d3-4faa-b167-7b296074fdfe","resolution":{"observed_at":"2026-08-12T14:40:24.121356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:40:24.110566Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":"0ea712e4-3376-4ce0-a815-9a78348c072a","year":2024},"citing_paper":{"arxiv_id":"2411.15024","last_updated":"2025-03-28T14:11:37Z","snapshot_observed_at":"2026-08-13T20:06:52.909920Z","submitted_at":"2024-11-22T15:55:19Z","title":"DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T14:40:23.677559Z"},"links":{"citing_paper":"/paper/2411.15024"},"observation_digest":"sha256:f95cd908a2efe3fb03bfd58631a713f799b49a8fc707993c75ff0673384a3af4","observation_id":"98ff61bf-30bd-421d-8bda-b5463da11204","resolution":{"observed_at":"2026-08-12T14:40:24.114221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-12T14:40:23.680826Z","title":"Video-llava: Learning united visual rep- resentation by alignment before projection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15024","last_updated":"2025-03-28T14:11:37Z","snapshot_observed_at":"2026-08-13T20:06:52.909920Z","submitted_at":"2024-11-22T15:55:19Z","title":"DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T14:40:23.680826Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2411.15024"},"observation_digest":"sha256:541abc1b9e35fbf641761839a6ff1caa3e27b1bda01432edc7bca85aa36cc870","observation_id":"686683fb-6050-47cf-a523-1f7a04717388","resolution":{"observed_at":"2026-08-12T14:40:23.680826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.15947","last_updated":"2024-12-23T08:05:14Z","snapshot_observed_at":"2026-08-06T02:31:58.372974Z","submitted_at":"2024-01-29T08:13:40Z","title":"MoE-LLaVA: Mixture of Experts for Large Vision-Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.15947","snapshot_observed_at":"2026-08-12T14:40:23.684059Z","title":"Moe-llava: Mixture of experts for large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15024","last_updated":"2025-03-28T14:11:37Z","snapshot_observed_at":"2026-08-13T20:06:52.909920Z","submitted_at":"2024-11-22T15:55:19Z","title":"DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T14:40:23.684059Z"},"links":{"cited_paper":"/paper/2401.15947","citing_paper":"/paper/2411.15024"},"observation_digest":"sha256:d809b0a1fd2423b14124b6a59ce9b1c4128a850192882899144c308e2902f0c5","observation_id":"40330da5-7f79-4122-a3dc-ed1e6da79230","resolution":{"observed_at":"2026-08-12T14:40:23.684059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:40:24.102928Z","title":"Vila: On pre-training for visual language models","venue":null,"work_id":"d385f587-7758-4321-a2d6-b3e98d9284a4","year":2024},"citing_paper":{"arxiv_id":"2411.15024","last_updated":"2025-03-28T14:11:37Z","snapshot_observed_at":"2026-08-13T20:06:52.909920Z","submitted_at":"2024-11-22T15:55:19Z","title":"DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T14:40:23.687112Z"},"links":{"citing_paper":"/paper/2411.15024"},"observation_digest":"sha256:57526fcd4b0387bb0228221e1fcde34e8f98cc1ae74a159fd5cbc15d2e3ac3b4","observation_id":"1d988134-9f0d-49c4-acc3-8016818a5067","resolution":{"observed_at":"2026-08-12T14:40:24.105739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04991","last_updated":"2023-10-11T07:20:32Z","snapshot_observed_at":"2026-08-13T05:54:42.378546Z","submitted_at":"2023-10-08T03:35:27Z","title":"Video-Teller: Enhancing Cross-Modal Generation with Fusion and Decoupling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04991","snapshot_observed_at":"2026-08-12T14:40:23.689402Z","title":"Video- teller: Enhancing cross-modal generation with fusion and decoupling","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15024","last_updated":"2025-03-28T14:11:37Z","snapshot_observed_at":"2026-08-13T20:06:52.909920Z","submitted_at":"2024-11-22T15:55:19Z","title":"DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T14:40:23.689402Z"},"links":{"cited_paper":"/paper/2310.04991","citing_paper":"/paper/2411.15024"},"observation_digest":"sha256:fa307c9df44fedd400200dfac0d7f2ace42e43f8948e04cab33b01fdf7ceb209","observation_id":"a101bd37-0ac1-417c-baa6-8b59d8bce438","resolution":{"observed_at":"2026-08-12T14:40:23.689402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:40:23.692236Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15024","last_updated":"2025-03-28T14:11:37Z","snapshot_observed_at":"2026-08-13T20:06:52.909920Z","submitted_at":"2024-11-22T15:55:19Z","title":"DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T14:40:23.692236Z"},"links":{"citing_paper":"/paper/2411.15024"},"observation_digest":"sha256:bf2630cd01884b171529e8a0dce5aa18a16bba5741d4424b09e3ff85c7d9d897","observation_id":"80057844-2fee-4228-a585-4e8065661293","resolution":{"observed_at":"2026-08-12T14:40:23.692236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:40:23.696074Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15024","last_updated":"2025-03-28T14:11:37Z","snapshot_observed_at":"2026-08-13T20:06:52.909920Z","submitted_at":"2024-11-22T15:55:19Z","title":"DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T14:40:23.696074Z"},"links":{"citing_paper":"/paper/2411.15024"},"observation_digest":"sha256:fd1738c34661a53f18ce52713066cb3a1297f6b2e75918b2a9329428d733ffb4","observation_id":"c5f046d1-4fe9-479b-858f-621ffe97f0e4","resolution":{"observed_at":"2026-08-12T14:40:23.696074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:40:24.089338Z","title":"Video detail caption, 2024","venue":null,"work_id":"17aa2fe7-ef0b-4fea-9a4b-db623bdb75b3","year":2024},"citing_paper":{"arxiv_id":"2411.15024","last_updated":"2025-03-28T14:11:37Z","snapshot_observed_at":"2026-08-13T20:06:52.909920Z","submitted_at":"2024-11-22T15:55:19Z","title":"DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T14:40:23.698977Z"},"links":{"citing_paper":"/paper/2411.15024"},"observation_digest":"sha256:ee38baa63686598b961de71a9ec2107497c0fa007e5c8970f671f699fa79c048","observation_id":"0e7c4b62-9d33-4e80-aea7-1a1b8a3af018","resolution":{"observed_at":"2026-08-12T14:40:24.092122Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","snapshot_observed_at":"2026-08-15T17:59:50.568702Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07207","snapshot_observed_at":"2026-08-12T14:40:23.701759Z","title":"Valley: Video assistant with large language model enhanced ability","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15024","last_updated":"2025-03-28T14:11:37Z","snapshot_observed_at":"2026-08-13T20:06:52.909920Z","submitted_at":"2024-11-22T15:55:19Z","title":"DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T14:40:23.701759Z"},"links":{"cited_paper":"/paper/2306.07207","citing_paper":"/paper/2411.15024"},"observation_digest":"sha256:b0f998d93d3963c385789f271679be6d7893ccf11f15d7aad239a07a124ae834","observation_id":"c073fbc5-43d2-4f94-954e-6da67bfaee97","resolution":{"observed_at":"2026-08-12T14:40:23.701759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:40:24.081856Z","title":"Gpt-4 model, 2023","venue":null,"work_id":"f5a408ea-5a73-4135-b5c6-7d7be216139e","year":2023},"citing_paper":{"arxiv_id":"2411.15024","last_updated":"2025-03-28T14:11:37Z","snapshot_observed_at":"2026-08-13T20:06:52.909920Z","submitted_at":"2024-11-22T15:55:19Z","title":"DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T14:40:23.704662Z"},"links":{"citing_paper":"/paper/2411.15024"},"observation_digest":"sha256:2710e45f4fce9e1ca879e250cbd1dab7217c848b4a0959ca65359aca5fa9e98f","observation_id":"b75e6fbb-1254-4b8a-8ca3-76666289f524","resolution":{"observed_at":"2026-08-12T14:40:24.085000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:40:23.706916Z","title":"Per- ception test: A diagnostic benchmark for multimodal video models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15024","last_updated":"2025-03-28T14:11:37Z","snapshot_observed_at":"2026-08-13T20:06:52.909920Z","submitted_at":"2024-11-22T15:55:19Z","title":"DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T14:40:23.706916Z"},"links":{"citing_paper":"/paper/2411.15024"},"observation_digest":"sha256:6794ce7075117312eb6274d80819c1c0aacc17cc3fb00e990a8692d546e1432d","observation_id":"0aba2f3e-02b9-43dc-856b-01242661eed0","resolution":{"observed_at":"2026-08-12T14:40:23.706916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:40:24.070608Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"33bb3517-f0a0-4bbd-8e3c-8ca4e6987985","year":2021},"citing_paper":{"arxiv_id":"2411.15024","last_updated":"2025-03-28T14:11:37Z","snapshot_observed_at":"2026-08-13T20:06:52.909920Z","submitted_at":"2024-11-22T15:55:19Z","title":"DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T14:40:23.710276Z"},"links":{"citing_paper":"/paper/2411.15024"},"observation_digest":"sha256:b33742b79aa0a18376c309428c38e541af77b5bf4622aaf6a4d46034e1646fc1","observation_id":"f0499b5c-2f5d-412a-875a-3c0fa62174d0","resolution":{"observed_at":"2026-08-12T14:40:24.073626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19060","last_updated":"2023-10-29T16:25:32Z","snapshot_observed_at":"2026-08-13T05:38:06.938376Z","submitted_at":"2023-10-29T16:25:32Z","title":"TESTA: Temporal-Spatial Token Aggregation for Long-form Video-Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19060","snapshot_observed_at":"2026-08-12T14:40:23.713555Z","title":"Testa: Temporal-spatial token aggregation for long-form video-language understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15024","last_updated":"2025-03-28T14:11:37Z","snapshot_observed_at":"2026-08-13T20:06:52.909920Z","submitted_at":"2024-11-22T15:55:19Z","title":"DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T14:40:23.713555Z"},"links":{"cited_paper":"/paper/2310.19060","citing_paper":"/paper/2411.15024"},"observation_digest":"sha256:dbdc24367af897aa06ebba292f9c4bb5189850060bdbfd81a1a6c113e1fcaa0a","observation_id":"03bae0ac-1fbe-4342-b3e4-9420f2fece5d","resolution":{"observed_at":"2026-08-12T14:40:23.713555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16267","last_updated":"2025-06-09T19:33:32Z","snapshot_observed_at":"2026-08-13T01:33:21.194051Z","submitted_at":"2024-10-21T17:59:11Z","title":"xGen-MM-Vid (BLIP-3-Video): You Only Need 32 Tokens to Represent a Video Even in VLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16267","snapshot_observed_at":"2026-08-12T14:40:23.716671Z","title":"xgen-mm-vid (blip-3-video): You only need 32 tokens to represent a video even in vlms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15024","last_updated":"2025-03-28T14:11:37Z","snapshot_observed_at":"2026-08-13T20:06:52.909920Z","submitted_at":"2024-11-22T15:55:19Z","title":"DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T14:40:23.716671Z"},"links":{"cited_paper":"/paper/2410.16267","citing_paper":"/paper/2411.15024"},"observation_digest":"sha256:14280707bca179e8b3143b9f191d2d02f319112447610bdd19538bfdd00095f1","observation_id":"cd0dbfeb-3365-4a3a-a75e-4a19c42f8261","resolution":{"observed_at":"2026-08-12T14:40:23.716671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00034","last_updated":"2023-11-07T20:41:22Z","snapshot_observed_at":"2026-08-13T10:02:10.987700Z","submitted_at":"2023-09-29T14:35:27Z","title":"PB-LLM: Partially Binarized Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00034","snapshot_observed_at":"2026-08-12T14:40:23.719444Z","title":"Pb-llm: Partially binarized large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15024","last_updated":"2025-03-28T14:11:37Z","snapshot_observed_at":"2026-08-13T20:06:52.909920Z","submitted_at":"2024-11-22T15:55:19Z","title":"DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T14:40:23.719444Z"},"links":{"cited_paper":"/paper/2310.00034","citing_paper":"/paper/2411.15024"},"observation_digest":"sha256:6f8158aac26e17268e457951d660ca9e19dcfcd43739e8c5b83e985bb47a0b4c","observation_id":"7118a95f-454d-4822-be9c-bf4500cacae8","resolution":{"observed_at":"2026-08-12T14:40:23.719444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:40:23.721994Z","title":"Llava-prumerge: Adaptive token reduction for efficient large multimodal models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15024","last_updated":"2025-03-28T14:11:37Z","snapshot_observed_at":"2026-08-13T20:06:52.909920Z","submitted_at":"2024-11-22T15:55:19Z","title":"DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T14:40:23.721994Z"},"links":{"citing_paper":"/paper/2411.15024"},"observation_digest":"sha256:2f7f7c622363cd9e13abb476dfacce41966f058c9c69405267251f0fc0cb9c90","observation_id":"aea40c27-f9b4-47bc-8ff4-03947e4ffb37","resolution":{"observed_at":"2026-08-12T14:40:23.721994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01156","last_updated":"2025-03-12T09:11:37Z","snapshot_observed_at":"2026-08-12T22:53:08.708305Z","submitted_at":"2024-09-02T10:42:30Z","title":"TempMe: Video Temporal Token Merging for Efficient Text-Video Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.01156","snapshot_observed_at":"2026-08-12T14:40:23.724449Z","title":"Tempme: Video temporal token merging for efficient text-video retrieval","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15024","last_updated":"2025-03-28T14:11:37Z","snapshot_observed_at":"2026-08-13T20:06:52.909920Z","submitted_at":"2024-11-22T15:55:19Z","title":"DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T14:40:23.724449Z"},"links":{"cited_paper":"/paper/2409.01156","citing_paper":"/paper/2411.15024"},"observation_digest":"sha256:7a3e78574f6a4e79b89467c678de0f751990005aec9109ab9d4d2a398832dc4b","observation_id":"3b10fefc-2f69-4e0c-ab17-c914a975ecb5","resolution":{"observed_at":"2026-08-12T14:40:23.724449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:40:24.062929Z","title":"Video- mae: Masked autoencoders are data-efficient learners for self-supervised video pre-training","venue":null,"work_id":"38e33ab0-635e-43ce-8fe2-7455c0580313","year":2022},"citing_paper":{"arxiv_id":"2411.15024","last_updated":"2025-03-28T14:11:37Z","snapshot_observed_at":"2026-08-13T20:06:52.909920Z","submitted_at":"2024-11-22T15:55:19Z","title":"DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T14:40:23.727702Z"},"links":{"citing_paper":"/paper/2411.15024"},"observation_digest":"sha256:93c58e993b6452d48b6a39a4be4151f5386b32e98503540441c2416e5bc9b301","observation_id":"2a70519a-1c22-4609-9647-d7ff754b9db5","resolution":{"observed_at":"2026-08-12T14:40:24.065685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18139","last_updated":"2024-06-26T07:44:24Z","snapshot_observed_at":"2026-08-12T23:34:43.030881Z","submitted_at":"2024-06-26T07:44:24Z","title":"LOOK-M: Look-Once Optimization in KV Cache for Efficient Multimodal Long-Context Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18139","snapshot_observed_at":"2026-08-12T14:40:23.730593Z","title":"Look-m: Look- once optimization in kv cache for efficient multimodal long- context inference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15024","last_updated":"2025-03-28T14:11:37Z","snapshot_observed_at":"2026-08-13T20:06:52.909920Z","submitted_at":"2024-11-22T15:55:19Z","title":"DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T14:40:23.730593Z"},"links":{"cited_paper":"/paper/2406.18139","citing_paper":"/paper/2411.15024"},"observation_digest":"sha256:9d52b942aa6b5755a0e57f792611368539e5cf1679ac585015ca0d02d6d614f0","observation_id":"0a677e7e-f101-400f-b5ad-a44a2a77e18c","resolution":{"observed_at":"2026-08-12T14:40:23.730593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00634","last_updated":"2024-09-24T04:41:08Z","snapshot_observed_at":"2026-08-15T02:19:40.902712Z","submitted_at":"2024-06-30T09:21:01Z","title":"Tarsier: Recipes for Training and Evaluating Large Video Description Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00634","snapshot_observed_at":"2026-08-12T14:40:23.734088Z","title":"Tarsier: Recipes for training and evaluating large video description models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15024","last_updated":"2025-03-28T14:11:37Z","snapshot_observed_at":"2026-08-13T20:06:52.909920Z","submitted_at":"2024-11-22T15:55:19Z","title":"DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T14:40:23.734088Z"},"links":{"cited_paper":"/paper/2407.00634","citing_paper":"/paper/2411.15024"},"observation_digest":"sha256:57256741b0648a245dc62dde1e3b53dcad19f89bac4c7b50eb8469ef808449be","observation_id":"f6822db5-7cbd-4ebd-8023-6aa5e8df054d","resolution":{"observed_at":"2026-08-12T14:40:23.734088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12503","last_updated":"2024-01-23T05:55:26Z","snapshot_observed_at":"2026-08-13T04:37:14.503427Z","submitted_at":"2024-01-23T05:55:26Z","title":"Small Language Model Meets with Reinforced Vision Vocabulary","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12503","snapshot_observed_at":"2026-08-12T14:40:23.737431Z","title":"Small language model meets with reinforced vision vocabu- lary","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15024","last_updated":"2025-03-28T14:11:37Z","snapshot_observed_at":"2026-08-13T20:06:52.909920Z","submitted_at":"2024-11-22T15:55:19Z","title":"DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T14:40:23.737431Z"},"links":{"cited_paper":"/paper/2401.12503","citing_paper":"/paper/2411.15024"},"observation_digest":"sha256:1464ddccaf982ccf216c4992b819a203109edf326a32e71b6aebd8424c2074a5","observation_id":"a3bac1f9-6d6d-4692-8fc9-d665278ec2a2","resolution":{"observed_at":"2026-08-12T14:40:23.737431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:40:24.055560Z","title":"Mamballie: Implicit retinex-aware low light enhancement with global-then-local state space","venue":null,"work_id":"22da3009-d426-40af-ba39-305263673952","year":null},"citing_paper":{"arxiv_id":"2411.15024","last_updated":"2025-03-28T14:11:37Z","snapshot_observed_at":"2026-08-13T20:06:52.909920Z","submitted_at":"2024-11-22T15:55:19Z","title":"DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T14:40:23.740286Z"},"links":{"citing_paper":"/paper/2411.15024"},"observation_digest":"sha256:0ad0e95370176d8f19a6cbb4efde8968f989a5423c7279b81d6a9e4649cc0690","observation_id":"badc2f20-4a8f-473c-a9a0-017195bb0e1f","resolution":{"observed_at":"2026-08-12T14:40:24.058338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:40:24.046688Z","title":"Next-qa: Next phase of question-answering to explaining temporal actions","venue":null,"work_id":"cffa5ede-791a-435f-bc76-1c6051288639","year":2021},"citing_paper":{"arxiv_id":"2411.15024","last_updated":"2025-03-28T14:11:37Z","snapshot_observed_at":"2026-08-13T20:06:52.909920Z","submitted_at":"2024-11-22T15:55:19Z","title":"DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T14:40:23.742620Z"},"links":{"citing_paper":"/paper/2411.15024"},"observation_digest":"sha256:efe62e49eabb06ee9bb6f24d8c3078686da5029daf98d7347849a8f6b1406675","observation_id":"134df1f3-fcb4-491a-adcc-9379af1190e9","resolution":{"observed_at":"2026-08-12T14:40:24.049933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:40:24.036845Z","title":"Robustmq: benchmarking robustness of quantized models","venue":null,"work_id":"fed414f7-0327-4e20-9d2d-50f96eda24e4","year":null},"citing_paper":{"arxiv_id":"2411.15024","last_updated":"2025-03-28T14:11:37Z","snapshot_observed_at":"2026-08-13T20:06:52.909920Z","submitted_at":"2024-11-22T15:55:19Z","title":"DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T14:40:23.745037Z"},"links":{"citing_paper":"/paper/2411.15024"},"observation_digest":"sha256:9cc4532d2c7f8bf19ef5317bc8a507a6f64fc8be818cd522cac0fe41d7c4a20d","observation_id":"d607b380-1909-462d-9095-53da1f0b70c4","resolution":{"observed_at":"2026-08-12T14:40:24.040207Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:40:24.027211Z","title":"Novel object synthesis via adaptive text-image harmony","venue":null,"work_id":"1ace8b56-c9ce-41fa-a7fb-668ff046f679","year":2024},"citing_paper":{"arxiv_id":"2411.15024","last_updated":"2025-03-28T14:11:37Z","snapshot_observed_at":"2026-08-13T20:06:52.909920Z","submitted_at":"2024-11-22T15:55:19Z","title":"DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T14:40:23.747558Z"},"links":{"citing_paper":"/paper/2411.15024"},"observation_digest":"sha256:2810dd87d89243c74e9a39a9252cedb8116e243b5528dbafe7e20043e6f1bbcc","observation_id":"be08aeb6-a7ee-4f92-bbee-39f6c09fb38e","resolution":{"observed_at":"2026-08-12T14:40:24.030420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16994","last_updated":"2024-04-29T14:52:02Z","snapshot_observed_at":"2026-08-13T20:40:43.794560Z","submitted_at":"2024-04-25T19:29:55Z","title":"PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16994","snapshot_observed_at":"2026-08-12T14:40:23.749972Z","title":"Pllava: Parameter-free llava extension from images to videos for video dense captioning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15024","last_updated":"2025-03-28T14:11:37Z","snapshot_observed_at":"2026-08-13T20:06:52.909920Z","submitted_at":"2024-11-22T15:55:19Z","title":"DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T14:40:23.749972Z"},"links":{"cited_paper":"/paper/2404.16994","citing_paper":"/paper/2411.15024"},"observation_digest":"sha256:353f118d5b8046d54c7bbe17d4a008b4d65fd85f43451c087e7e19265713726d","observation_id":"a3ae0252-04b4-478c-b369-08b8ebd2b89b","resolution":{"observed_at":"2026-08-12T14:40:23.749972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:40:24.016951Z","title":"Activitynet-qa: A dataset for understanding complex web videos via question answering","venue":null,"work_id":"3fc01a14-e73a-4aad-9207-72cb7ac63ac4","year":2019},"citing_paper":{"arxiv_id":"2411.15024","last_updated":"2025-03-28T14:11:37Z","snapshot_observed_at":"2026-08-13T20:06:52.909920Z","submitted_at":"2024-11-22T15:55:19Z","title":"DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T14:40:23.752672Z"},"links":{"citing_paper":"/paper/2411.15024"},"observation_digest":"sha256:6742d8e38dcbbe6e016976be2e0a4d3c032db54b4922aa18b765bfb54c447d13","observation_id":"ae70fbcb-4bca-4025-b71c-330e23fd0387","resolution":{"observed_at":"2026-08-12T14:40:24.020310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16862","last_updated":"2024-06-21T07:08:59Z","snapshot_observed_at":"2026-08-14T15:08:05.705067Z","submitted_at":"2023-12-28T07:11:41Z","title":"TinyGPT-V: Efficient Multimodal Large Language Model via Small Backbones","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.16862","snapshot_observed_at":"2026-08-12T14:40:23.755161Z","title":"Tinygpt-v: Efficient multimodal large language model via small backbones","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15024","last_updated":"2025-03-28T14:11:37Z","snapshot_observed_at":"2026-08-13T20:06:52.909920Z","submitted_at":"2024-11-22T15:55:19Z","title":"DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T14:40:23.755161Z"},"links":{"cited_paper":"/paper/2312.16862","citing_paper":"/paper/2411.15024"},"observation_digest":"sha256:bb9e1555387ee07214c9ee6f48bdd5bfd14e03c2712be3a7a0ba4e3e327472f7","observation_id":"fef99eab-0e7f-4355-80be-4bc14eb44e66","resolution":{"observed_at":"2026-08-12T14:40:23.755161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-08-13T15:50:38.254753Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-12T14:40:23.757857Z","title":"Video-llama: An instruction-tuned audio-visual language model for video un- derstanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15024","last_updated":"2025-03-28T14:11:37Z","snapshot_observed_at":"2026-08-13T20:06:52.909920Z","submitted_at":"2024-11-22T15:55:19Z","title":"DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T14:40:23.757857Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2411.15024"},"observation_digest":"sha256:f870830eb6a11f1821b7334f7243f3cdef0ec01d8e856ff609788f352b5222c4","observation_id":"4d754c0a-2b72-492c-9eec-8d3682e7244c","resolution":{"observed_at":"2026-08-12T14:40:23.757857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:40:23.761430Z","title":"Lmms- eval: Reality check on the evaluation of large multimodal models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15024","last_updated":"2025-03-28T14:11:37Z","snapshot_observed_at":"2026-08-13T20:06:52.909920Z","submitted_at":"2024-11-22T15:55:19Z","title":"DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T14:40:23.761430Z"},"links":{"citing_paper":"/paper/2411.15024"},"observation_digest":"sha256:7611fd928618e01fc77742a5f481d9b6b2dbd6c92c4228297239cc2085e4ad4a","observation_id":"1c2d8b2c-e692-45ed-96e0-d939d4fe532c","resolution":{"observed_at":"2026-08-12T14:40:23.761430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14289","last_updated":"2024-02-22T05:05:30Z","snapshot_observed_at":"2026-08-13T04:13:12.046147Z","submitted_at":"2024-02-22T05:05:30Z","title":"TinyLLaVA: A Framework of Small-scale Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14289","snapshot_observed_at":"2026-08-12T14:40:23.763783Z","title":"Tinyllava: A framework of small-scale large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15024","last_updated":"2025-03-28T14:11:37Z","snapshot_observed_at":"2026-08-13T20:06:52.909920Z","submitted_at":"2024-11-22T15:55:19Z","title":"DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T14:40:23.763783Z"},"links":{"cited_paper":"/paper/2402.14289","citing_paper":"/paper/2411.15024"},"observation_digest":"sha256:28600102b6789f9936a53806b0aba634d8218c2314b72c443d526f0d58fbb137","observation_id":"096daa0b-aece-40b1-b582-65cb437d3be2","resolution":{"observed_at":"2026-08-12T14:40:23.763783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-12T14:40:23.766777Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15024","last_updated":"2025-03-28T14:11:37Z","snapshot_observed_at":"2026-08-13T20:06:52.909920Z","submitted_at":"2024-11-22T15:55:19Z","title":"DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T14:40:23.766777Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2411.15024"},"observation_digest":"sha256:afb8365d82f859b7eeb3412369fa7aaf1ba80af4aed0103da8fcd699cbf5c2ad","observation_id":"cc4c9fcd-7491-4696-ace4-b1513a46cc7c","resolution":{"observed_at":"2026-08-12T14:40:23.766777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:40:24.003535Z","title":"Llava-phi: Efficient multi-modal assistant with small language model","venue":null,"work_id":"33b245f5-6245-4aa5-b800-52ac16fa97e5","year":2024},"citing_paper":{"arxiv_id":"2411.15024","last_updated":"2025-03-28T14:11:37Z","snapshot_observed_at":"2026-08-13T20:06:52.909920Z","submitted_at":"2024-11-22T15:55:19Z","title":"DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T14:40:23.769618Z"},"links":{"citing_paper":"/paper/2411.15024"},"observation_digest":"sha256:d603a8b9afbe39ffc80264fab950534ba6b1e9a35ee868af01889fd2045e122d","observation_id":"1056b463-59c5-4538-8142-48d35f621a2f","resolution":{"observed_at":"2026-08-12T14:40:24.007353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:40:23.994572Z","title":"counterfactual reasoning","venue":null,"work_id":"309c501a-c426-451b-8a0d-52405db91543","year":2025},"citing_paper":{"arxiv_id":"2411.15024","last_updated":"2025-03-28T14:11:37Z","snapshot_observed_at":"2026-08-13T20:06:52.909920Z","submitted_at":"2024-11-22T15:55:19Z","title":"DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T14:40:23.771906Z"},"links":{"citing_paper":"/paper/2411.15024"},"observation_digest":"sha256:f004810294b36ac77febeed992189a687fcaaf5b00110642f7c8ab9d5edf9c8f","observation_id":"542b4934-4004-4159-bff7-cf40f1ae2ebb","resolution":{"observed_at":"2026-08-12T14:40:23.998181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.15024","last_updated":"2025-03-28T14:11:37Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T20:06:52.909920Z","submitted_at":"2024-11-22T15:55:19Z","title":"DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models"},"reference_resolution":{"displayed":56,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":33,"verified_exact":0,"verified_fuzzy":23},"total_outbound_references":56},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 10 inbound Pith citation observations for arXiv:2411.15024."}