{"as_of":"2026-08-18T23:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1c641443a7db231288e9b002c9b3d9ff1eb8af2cc7952708658ed52a8bba7c63","coverage":[{"denominator":102,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T22:42:35.606021Z","state":"measured"},{"denominator":110,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":110,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":10,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":10,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:46:40.890317Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T10:41:03.999598Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03248","snapshot_observed_at":"2026-08-11T00:38:47.668642Z","title":"Aim: Adaptive inference of multi-modal llms via token merging and pruning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19442","last_updated":"2025-07-30T05:24:46Z","snapshot_observed_at":"2026-08-15T13:24:51.697670Z","submitted_at":"2024-12-27T04:17:57Z","title":"A Survey on Large Language Model Acceleration based on KV Cache Management","version":3},"reference_index":109,"source":"pdf_text","source_observed_at":"2026-08-11T00:38:47.668642Z"},"links":{"cited_paper":"/paper/2412.03248","citing_paper":"/paper/2412.19442"},"observation_digest":"sha256:08fd785b87a279f7ea158c08919eb09cc4c6dbaee2d62a923a146108892c4bf8","observation_id":"7cf09e0b-8c67-4d98-8be8-2fb881ea285f","resolution":{"observed_at":"2026-08-11T00:38:47.668642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03248","snapshot_observed_at":"2026-08-10T23:09:25.185790Z","title":"Aim: Adaptive inference of multi-modal llms via token merging and pruning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01986","last_updated":"2025-07-24T18:44:26Z","snapshot_observed_at":"2026-08-17T22:17:18.822354Z","submitted_at":"2024-12-30T17:31:37Z","title":"FrameFusion: Combining Similarity and Importance for Video Token Reduction on Large Vision Language Models","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T23:09:25.185790Z"},"links":{"cited_paper":"/paper/2412.03248","citing_paper":"/paper/2501.01986"},"observation_digest":"sha256:e60c815eac36234370b32c7b4a4a9e1dba4e4aa4caf29fa8482e76fa1bf8a9a8","observation_id":"ebd6af17-6836-4c4e-bfc1-b15169f0b67c","resolution":{"observed_at":"2026-08-10T23:09:25.185790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03248","snapshot_observed_at":"2026-08-16T11:46:40.890317Z","title":"Aim: Adaptive inference of multi-modal llms via token merging and pruning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14693","last_updated":"2025-05-02T22:30:26Z","snapshot_observed_at":"2026-08-18T02:26:00.733954Z","submitted_at":"2025-04-20T17:58:46Z","title":"Video-MMLU: A Massive Multi-Discipline Lecture Understanding Benchmark","version":2},"reference_index":174,"source":"pdf_text","source_observed_at":"2026-08-16T11:46:40.890317Z"},"links":{"cited_paper":"/paper/2412.03248","citing_paper":"/paper/2504.14693"},"observation_digest":"sha256:92ce3c2dae90a187750b5e6ae4ce2fa7705af3b76a43c2389f6c0ae5753a8378","observation_id":"77e2f337-f90d-448d-b986-cf87959df91b","resolution":{"observed_at":"2026-08-16T11:46:40.890317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03248","snapshot_observed_at":"2026-08-07T15:15:12.434364Z","title":"Aim: Adaptive inference of multi-modal llms via token merging and pruning.arXiv preprint arXiv:2412.03248,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15816","last_updated":"2025-05-21T17:59:52Z","snapshot_observed_at":"2026-08-17T02:48:27.986929Z","submitted_at":"2025-05-21T17:59:52Z","title":"Streamline Without Sacrifice -- Squeeze out Computation Redundancy in LMM","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:12.434364Z"},"links":{"cited_paper":"/paper/2412.03248","citing_paper":"/paper/2505.15816"},"observation_digest":"sha256:1f5b4c95e12e5f483da57a3cafc91675a4894fb4ef9bcdc614288d4d9f010089","observation_id":"f61d0b3a-33cc-4d09-9490-858863c934ec","resolution":{"observed_at":"2026-08-07T15:15:12.434364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03248","snapshot_observed_at":"2026-08-07T14:08:10.915558Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20100","last_updated":"2025-05-26T15:08:37Z","snapshot_observed_at":"2026-08-15T00:34:08.333930Z","submitted_at":"2025-05-26T15:08:37Z","title":"AdaTP: Attention-Debiased Token Pruning for Video Large Language Models","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T14:08:10.915558Z"},"links":{"cited_paper":"/paper/2412.03248","citing_paper":"/paper/2505.20100"},"observation_digest":"sha256:9a7d990ba4d9a2f71591c1a76e26eb6ddae36392ff9d06ccc16b807220eb8050","observation_id":"4ed619fe-2182-414b-afff-bd1a1ca8dd69","resolution":{"observed_at":"2026-08-07T14:08:10.915558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03248","snapshot_observed_at":"2026-08-06T18:03:03.555597Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-15T18:44:58.192236Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.555597Z"},"links":{"cited_paper":"/paper/2412.03248","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:74e6767423834847f78917c8d724b1988675e6b8019f79f6e13fcb6a7f7fe157","observation_id":"b344fd13-b7d1-46a2-af72-80b526c10748","resolution":{"observed_at":"2026-08-06T18:03:03.555597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03248","snapshot_observed_at":"2026-08-06T13:18:06.370053Z","title":"AIM: Adaptive inference of multi-modal LLMs via token merging and pruning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-13T17:48:59.129542Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:06.370053Z"},"links":{"cited_paper":"/paper/2412.03248","citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:1f4b6dd30f78f658aed0ae2eb5307fac5a1206da9c76695a774f5ae62c66591c","observation_id":"7d65a803-0200-4e6b-aa91-044e0e65175b","resolution":{"observed_at":"2026-08-06T13:18:06.370053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"cited_work":{"arxiv_id":"2412.03248","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.03248","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Aim: Adaptive inference of multi-modal llms via token merging and pruning","venue":null,"work_id":"f0b1842e-966e-4968-9e88-a72cae8b430e","year":2024},"citing_paper":{"arxiv_id":"2604.05546","last_updated":"2026-04-14T01:04:46Z","snapshot_observed_at":"2026-08-15T05:20:03.302508Z","submitted_at":"2026-04-07T07:44:11Z","title":"Efficient Inference for Large Vision-Language Models: Bottlenecks, Techniques, and Prospects","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T18:54:04.104227Z"},"links":{"cited_paper":"/paper/2412.03248","citing_paper":"/paper/2604.05546"},"observation_digest":"sha256:85af8b60c5afdc914ecf7c7a3c6b1c12febb9b7378faef975d1dc4c0fb1ae0d8","observation_id":"6074cee1-1481-471e-9de5-4e6c03422122","resolution":{"observed_at":"2026-05-10T23:45:50.915833Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"cited_work":{"arxiv_id":"2412.03248","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.03248","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Aim: Adaptive inference of multi-modal llms via token merging and pruning","venue":null,"work_id":"f0b1842e-966e-4968-9e88-a72cae8b430e","year":2024},"citing_paper":{"arxiv_id":"2604.11627","last_updated":"2026-04-13T15:38:22Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-13T15:38:22Z","title":"POINTS-Long: Adaptive Dual-Mode Visual Reasoning in MLLMs","version":1},"reference_index":122,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:08.671342Z"},"links":{"cited_paper":"/paper/2412.03248","citing_paper":"/paper/2604.11627"},"observation_digest":"sha256:777461951ba2e0a38a34700ce74e967ee1bda775b9d4457bd3feba8c528d1778","observation_id":"1228267b-abf2-44b3-99d4-d9c23b22df29","resolution":{"observed_at":"2026-05-11T10:41:04.005982Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03248","snapshot_observed_at":"2026-08-10T16:42:44.443670Z","title":"Junjie Zhou, Yan Shu, Bo Zhao, Boya Wu, Zhengyang Liang, Shitao Xiao, Minghao Qin, Xi Yang, Yongping Xiong, Bo Zhang, Tiejun Huang, and Zheng Liu","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07014","last_updated":"2026-08-07T09:25:20Z","snapshot_observed_at":"2026-08-17T19:09:28.173681Z","submitted_at":"2026-08-07T09:25:20Z","title":"Stable Curves, Unstable Items: Item-Level Scaling Heterogeneity in Video LLMs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T16:42:44.443670Z"},"links":{"cited_paper":"/paper/2412.03248","citing_paper":"/paper/2608.07014"},"observation_digest":"sha256:2e4417fcfd77f225f9f537c363e97f54bb33a00f88c1b179c1cbfd72b7f21679","observation_id":"6db44e5d-2150-469d-81d6-7bd821c2662a","resolution":{"observed_at":"2026-08-10T16:42:44.443670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2412.03248/citation-record","integrity":"/paper/2412.03248/integrity","json":"/paper/2412.03248/citation-record.json","paper":"/paper/2412.03248"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-11T22:42:32.441164Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:32.441164Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:2a0daad2141b6d54932974ad501bac82c31fb71b588e18123c95447bdd9f37c7","observation_id":"b0029a0e-2d85-4f64-bf21-3b59605dedd3","resolution":{"observed_at":"2026-08-11T22:42:32.441164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1511.06297","last_updated":"2016-01-07T22:41:10Z","snapshot_observed_at":"2026-08-14T22:22:10.782232Z","submitted_at":"2015-11-19T18:40:22Z","title":"Conditional Computation in Neural Networks for faster models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.06297","snapshot_observed_at":"2026-08-11T22:42:32.450087Z","title":"Conditional computation in neural networks for faster models","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:32.450087Z"},"links":{"cited_paper":"/paper/1511.06297","citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:6c53cbfd9cc0b2202583a648ffc4e44d91055cc04a0003e8582b1d1f56776eeb","observation_id":"4a517098-19be-47ea-967d-9a3c809b86a4","resolution":{"observed_at":"2026-08-11T22:42:32.450087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:32.457746Z","title":"Token merging: Your ViT but faster","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:32.457746Z"},"links":{"citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:5791dc05a4e820e3c618128b955e5470660d7feb85b7b24d98967f46f0c701ee","observation_id":"66289086-3f93-4906-8a59-72f723f4ab3c","resolution":{"observed_at":"2026-08-11T22:42:32.457746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15195","last_updated":"2023-07-03T16:08:00Z","snapshot_observed_at":"2026-08-13T14:42:26.982679Z","submitted_at":"2023-06-27T04:31:52Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15195","snapshot_observed_at":"2026-08-11T22:42:32.466118Z","title":"Shikra: Unleashing multi- modal llm’s referential dialogue magic","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:32.466118Z"},"links":{"cited_paper":"/paper/2306.15195","citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:77685ed98e4a7b90cac52b14fff77ecd5c2b4b95e5f6fcdafcb2035a1325728a","observation_id":"fd99e16d-42e9-4d6b-8619-f97814eb7df5","resolution":{"observed_at":"2026-08-11T22:42:32.466118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:32.474254Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference accelera- tion for large vision-language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:32.474254Z"},"links":{"citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:ff9c61dcc6dd9bcd18e12aa1a4299c775c2e5460d4c0a9997bf4c146a1812da2","observation_id":"2f07c04b-41a2-471e-a262-8a5c6b562efb","resolution":{"observed_at":"2026-08-11T22:42:32.474254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:32.492269Z","title":"Gonzalez, Ion Stoica, and Eric P","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:32.492269Z"},"links":{"citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:cef614f97e0da46a43145183fefd4545f4a674a44ed3758d4efb3ef7cd5bd565","observation_id":"97c3365e-a694-4982-956c-8e52125de695","resolution":{"observed_at":"2026-08-11T22:42:32.492269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.10509","last_updated":"2019-04-23T19:29:47Z","snapshot_observed_at":"2026-08-16T10:03:03.268538Z","submitted_at":"2019-04-23T19:29:47Z","title":"Generating Long Sequences with Sparse Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.10509","snapshot_observed_at":"2026-08-11T22:42:32.508061Z","title":"Generating long sequences with sparse transformers","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:32.508061Z"},"links":{"cited_paper":"/paper/1904.10509","citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:35983cc9714e2bb0a16ad15df18b8caf371a329d27f199d843ced8414290d665","observation_id":"d6522194-ca2d-4132-b55a-6df2d3c786b4","resolution":{"observed_at":"2026-08-11T22:42:32.508061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06500","last_updated":"2023-06-15T08:00:18Z","snapshot_observed_at":"2026-08-13T18:58:34.541884Z","submitted_at":"2023-05-11T00:38:10Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06500","snapshot_observed_at":"2026-08-11T22:42:32.522544Z","title":"Instructblip: Towards general- purpose vision-language models with instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:32.522544Z"},"links":{"cited_paper":"/paper/2305.06500","citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:8cd944c9966feedfc33cd3d461231af56298e8ca54ed1a477c812eda0c1383b8","observation_id":"dbc93ba2-a3bf-4978-8744-ed063811f16d","resolution":{"observed_at":"2026-08-11T22:42:32.522544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08691","last_updated":"2023-07-17T17:50:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-17T17:50:36Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08691","snapshot_observed_at":"2026-08-11T22:42:32.531047Z","title":"Flashattention-2: Faster attention with bet- ter parallelism and work partitioning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:32.531047Z"},"links":{"cited_paper":"/paper/2307.08691","citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:aa645fbe95c3717cc9d7d99e1f048c3f9711c50e72df293945b18686157c1c8d","observation_id":"72f6d86b-a88b-4be4-a8fb-fc4c955b7f61","resolution":{"observed_at":"2026-08-11T22:42:32.531047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:32.537975Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:32.537975Z"},"links":{"citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:34b905eef0b81b90bfeea6a7eb07ee9c8f923d5d5723ddb005cfb2c864e50525","observation_id":"e36d8d08-4439-4c6c-8880-2dfe9a25e92c","resolution":{"observed_at":"2026-08-11T22:42:32.537975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:32.547798Z","title":"HeatViT: Hardware-Efficient Adap- tive Token Pruning for Vision Transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:32.547798Z"},"links":{"citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:e1d74c81282cc809b4cc38a46b9620cfe54aa8b5e0ee35cbb03f3df502bae740","observation_id":"4bca0f33-9232-44b1-8c62-abfb515c7a90","resolution":{"observed_at":"2026-08-11T22:42:32.547798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:32.559597Z","title":"Glam: Efficient scaling of language models with mixture-of-experts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:32.559597Z"},"links":{"citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:d78f05fced1a6b263770791f360c9c40679aa327ae64e73b545bcff4929b8e6f","observation_id":"b394b5fd-0e4c-410a-83ad-899aa9c32586","resolution":{"observed_at":"2026-08-11T22:42:32.559597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:32.568230Z","title":"Hsu, and Shang-Hong Lai","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:32.568230Z"},"links":{"citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:96c07fea3aac965f31e1b2f3637f23ee8bb67401fe290065bddaf479c398f7ee","observation_id":"be2ceb51-bacf-459b-9560-690a844a44ab","resolution":{"observed_at":"2026-08-11T22:42:32.568230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:32.628752Z","title":"Adaptive Token Sampling for Efficient Vision Transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:32.628752Z"},"links":{"citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:3de33b8412be377110ee49b34e54293977b1915bf0d46e0b2c67d892bbdb14ad","observation_id":"1c4a36c6-2fe0-4eeb-b36b-2734fda1b327","resolution":{"observed_at":"2026-08-11T22:42:32.628752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:32.720208Z","title":"Spatially adaptive computation time for residual networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:32.720208Z"},"links":{"citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:c793a19a24857e05eb098aa31983a1835fba086d81d653eb6e134485836f9381","observation_id":"9b902260-180f-45a8-9d41-51803814a93a","resolution":{"observed_at":"2026-08-11T22:42:32.720208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:32.813015Z","title":"Mme: A comprehensive evaluation benchmark for multimodal large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:32.813015Z"},"links":{"citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:b6dfddf207da09b39b50ce5efabccdf22ebeea36a769f8fed940d205e122d8d1","observation_id":"37316ee7-8a7b-4b70-8305-4fb2a3363bd7","resolution":{"observed_at":"2026-08-11T22:42:32.813015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-11T22:42:32.928121Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:32.928121Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:24b0db7a6d7237f67ac8dc0c9daec5761dab8fa15759de207217788a777fa6e8","observation_id":"94e89941-f4ea-47ea-abe5-7ebd81815d09","resolution":{"observed_at":"2026-08-11T22:42:32.928121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:33.027600Z","title":"PoWER-BERT: Accelerating BERT Inference via Progressive Word-Vector Elimination","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:33.027600Z"},"links":{"citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:5c9a263c655f3bd0396b46ae0ca6ac6e0ac6c3e62967bcc71331e8e59c15b38c","observation_id":"3e51cbe8-edf1-435c-96f1-073d904d239d","resolution":{"observed_at":"2026-08-11T22:42:33.027600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:33.040285Z","title":"Making the v in vqa matter: El- evating the role of image understanding in visual question answering, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:33.040285Z"},"links":{"citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:c92233155ce3a8271b484dec4d3f70ec213e708a72837521482fb24c167918d3","observation_id":"35e73f7a-154d-4448-bfa4-a893656e4d6b","resolution":{"observed_at":"2026-08-11T22:42:33.040285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:33.048908Z","title":"Speedboost: Anytime pre- diction with uniform near-optimality","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:33.048908Z"},"links":{"citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:bcbea27a2c3b1c34c527e7e368d5a2a00d96d22019519101d591ab050adc8c30","observation_id":"f38655c9-030c-4e82-a64c-71a71c8d5e58","resolution":{"observed_at":"2026-08-11T22:42:33.048908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:33.054914Z","title":"Mamba: Linear-time sequence modeling with selective state spaces, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:33.054914Z"},"links":{"citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:b6a26f33248c6798f277f986962ef41fb06e023ff4bcaeea5be67ea0e0d6eb33","observation_id":"be8f9fa3-87c4-4a3b-96ef-f32f91eac3f2","resolution":{"observed_at":"2026-08-11T22:42:33.054914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:33.060957Z","title":"Dynamic neural networks: A sur- vey","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:33.060957Z"},"links":{"citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:45baa5b8c5a9757b5c09fbff927e17220b11b7fa8e8cf213460bb9293af7d4fc","observation_id":"14e87409-3aef-4da1-93ee-bcf6254b8109","resolution":{"observed_at":"2026-08-11T22:42:33.060957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:33.067491Z","title":"Learning anytime predictions in neural net- works via adaptive loss balancing","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:33.067491Z"},"links":{"citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:fb45b92bab82fddd37a4759f54d3f922d3d96f4b42df96536a51dac70bc5c8ed","observation_id":"df0600ee-3fd0-4408-9720-d7210b29bac3","resolution":{"observed_at":"2026-08-11T22:42:33.067491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:33.079353Z","title":"Longrecipe: Recipe for efficient long context generalization in large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:33.079353Z"},"links":{"citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:782249a2188cda879e065d56105f0a368d22596ccf460838bd1912571ddf8a24","observation_id":"14db3d63-a0d8-47ed-932d-dde1e2027987","resolution":{"observed_at":"2026-08-11T22:42:33.079353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:33.088729Z","title":"Language is not all you need: Aligning perception with language mod- els","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:33.088729Z"},"links":{"citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:c284682cee07078a722fee350c76b99917dad35a7fc7ee07e3b1d7d142bd94ec","observation_id":"31e093b3-e80b-421d-8892-b1679769d893","resolution":{"observed_at":"2026-08-11T22:42:33.088729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:33.096469Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:33.096469Z"},"links":{"citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:17ff5cc9b29323463a017e7429be4a144088b703afdea7dc590d16860dc14aee","observation_id":"362ebd48-17f1-4b06-8dc4-1fd2086584d4","resolution":{"observed_at":"2026-08-11T22:42:33.096469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:33.101574Z","title":"Anytime recognition with routing convolutional networks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:33.101574Z"},"links":{"citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:8a5018b1bb2359919698a413afb5cbd94464c9f41bf6c82dd447930da7c369df","observation_id":"14874ec9-b7bb-47fb-8efa-37e38cf72d37","resolution":{"observed_at":"2026-08-11T22:42:33.101574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:33.107004Z","title":"Anytime recognition of objects and scenes","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:33.107004Z"},"links":{"citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:4230c431ea27119f0d1494c67da77488ce05d435aed4fb8686b5ef8d0481c20e","observation_id":"2bf2311f-1c4e-4b38-a586-8aefa9dec776","resolution":{"observed_at":"2026-08-11T22:42:33.107004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.07003","last_updated":"2021-06-11T20:00:20Z","snapshot_observed_at":"2026-08-16T19:13:35.030119Z","submitted_at":"2020-10-14T12:28:08Z","title":"Length-Adaptive Transformer: Train Once with Length Drop, Use Anytime with Search","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.07003","snapshot_observed_at":"2026-08-11T22:42:33.113003Z","title":"Length-Adaptive Transformer: Train Once with Length Drop, Use Anytime with Search","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:33.113003Z"},"links":{"cited_paper":"/paper/2010.07003","citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:b06a12b43ea5ab9729b743c5e70c961128aec8ac0767a0893cafbe54fe9cea01","observation_id":"a7c55cd4-6d31-4ac9-8cb4-4f394139b434","resolution":{"observed_at":"2026-08-11T22:42:33.113003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:33.119961Z","title":"Learned Token Pruning for Transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:33.119961Z"},"links":{"citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:b9334960f82f72556560825fc1ed16bb2720ab1ebc8dd5aaa04c7d4043e3803d","observation_id":"8500cadb-5d0b-45a9-b01d-ff4130395d82","resolution":{"observed_at":"2026-08-11T22:42:33.119961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:40.112419Z","title":"SPViT: Enabling Faster Vision Transform- ers Latency-Aware Soft Token Pruning","venue":null,"work_id":"ad06996c-e13c-4756-a8c6-967a182805f4","year":null},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:33.126479Z"},"links":{"citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:c464b4e46496d15a87af5fd1b372d3969be45eecba534e35fe46c16c573b03d6","observation_id":"b730ae6a-7ada-49ba-8c56-6820884d089d","resolution":{"observed_at":"2026-08-11T22:42:40.139405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:40.079533Z","title":"Text-conditioned resampler for long form video understanding, 2024","venue":null,"work_id":"4006558d-843c-420e-983b-483d7715c7dd","year":2024},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:33.137605Z"},"links":{"citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:514cedcdadbfe132b8d1a5cf6d9d3732175c4b4b510a0a2bec72311d486f888d","observation_id":"d118ceed-a1ec-48ea-9f7c-790a8a5b2c11","resolution":{"observed_at":"2026-08-11T22:42:40.097815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-08-18T11:56:50.710310Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-11T22:42:33.145410Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:33.145410Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:5cffb4d1627d48a43ecbdd9bc6704818924de7a7dee74fdb87e1747f14c0577b","observation_id":"49b89833-6f25-43fd-88c9-fb5def88c31e","resolution":{"observed_at":"2026-08-11T22:42:33.145410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:40.016527Z","title":"2d or not 2d? adaptive 3d convolution selec- tion for efficient video recognition","venue":null,"work_id":"8f1be09d-ef4e-4f57-b888-81c26d690e1a","year":2021},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:33.158147Z"},"links":{"citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:0e76dcaaeb449800f9bf19d8bd272af1a26d1feed1e58d729049e8d626afa7a8","observation_id":"b5837c2c-d2bc-42ad-b801-f47ec19ea465","resolution":{"observed_at":"2026-08-11T22:42:40.044840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-08-12T12:01:54.105712Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-08-11T22:42:33.163460Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:33.163460Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:563a3e32f3ebc593e7a9a80edb3c673592267d02c82a4b2cd0cbdb770d85d629","observation_id":"240bd5a9-c36f-4a23-9933-a287b6d98e0f","resolution":{"observed_at":"2026-08-11T22:42:33.163460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:39.982677Z","title":"Mvbench: A comprehensive multi- modal video understanding benchmark, 2023","venue":null,"work_id":"d63a7483-f4de-4cad-a01d-773e9fa1ec77","year":2023},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:33.227811Z"},"links":{"citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:c0e4d85dbf96e2a4306e163c8daacb37b855b3d6beec517d82ee69f64571869a","observation_id":"450e9e6a-6069-4479-a81b-3a6d5b58cd4c","resolution":{"observed_at":"2026-08-11T22:42:39.992675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:39.864853Z","title":"Mvbench: A comprehensive multi- modal video understanding benchmark, 2024","venue":null,"work_id":"0e3f73a0-308b-441a-ac22-61bc66072dce","year":2024},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:33.350463Z"},"links":{"citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:59417f337d262ba1ead906345cf815af8090c90630f4185864b4bc9822ad0feb","observation_id":"880428ec-814b-47b5-978f-618641a884b9","resolution":{"observed_at":"2026-08-11T22:42:39.915018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:39.799460Z","title":"Evaluating object hallucination in large vision-language models, 2023","venue":null,"work_id":"3d9d1437-16f3-4ceb-8049-7cef09073bbc","year":2023},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:33.486802Z"},"links":{"citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:4d5ee92ae7efa18c8b2234b8a6de125c6521cf0197c38065246e8be0dadf9f68","observation_id":"fa7bce63-e9cf-4fab-bb1a-08ed492d2570","resolution":{"observed_at":"2026-08-11T22:42:39.830333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-11T22:42:33.499475Z","title":"Video-llava: Learning united visual represen- tation by alignment before projection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:33.499475Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:b58d305ce45af78182d118e204e0e913e116121c195c82292d85f0b0ec4ca7de","observation_id":"03390d55-db6f-45ac-b385-58661ceaa3a4","resolution":{"observed_at":"2026-08-11T22:42:33.499475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:39.686625Z","title":"Boosting multimodal large language models with visual to- kens withdrawal for rapid inference","venue":null,"work_id":"bc6bbef2-0c19-42a9-a0e7-6dc448c35c21","year":2025},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:33.510751Z"},"links":{"citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:59a8e1904145e409a4bee368425f0656eeb32d6c1ea648ad290079e0e3ac081e","observation_id":"c29085ce-8130-491a-9e3e-94c02e51fc3a","resolution":{"observed_at":"2026-08-11T22:42:39.710130Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:39.599567Z","title":"Improved baselines with visual instruction tuning, 2023","venue":null,"work_id":"6251d272-536f-46c2-8847-717786451bec","year":2023},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:33.524516Z"},"links":{"citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:113374be31b0a5c155795008f9933f8ee06d92d67ae5f702f1f05d8b84947a92","observation_id":"6b146270-361b-468b-95f7-99f9db001ecc","resolution":{"observed_at":"2026-08-11T22:42:39.611242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.13802","last_updated":"2023-07-06T10:49:33Z","snapshot_observed_at":"2026-08-17T22:02:57.835110Z","submitted_at":"2022-09-28T03:07:32Z","title":"Adaptive Sparse ViT: Towards Learnable Adaptive Token Pruning by Fully Exploiting Self-Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.13802","snapshot_observed_at":"2026-08-11T22:42:33.536591Z","title":"Adap- tive Sparse ViT: Towards Learnable Adaptive Token Prun- ing by Fully Exploiting Self-Attention","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:33.536591Z"},"links":{"cited_paper":"/paper/2209.13802","citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:77d4ddba81d8d696dd3a177c3dca19739b18ef387f8a144279700d0b41a16f9d","observation_id":"040a0f2b-e501-42b1-85f5-12aa6a7fb64c","resolution":{"observed_at":"2026-08-11T22:42:33.536591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:39.506835Z","title":"Mm- bench: Is your multi-modal model an all-around player?,","venue":null,"work_id":"f036ed3a-4bfa-4ad3-88e4-86a9e68f5ea5","year":null},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:33.547736Z"},"links":{"citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:7a65f3127bf7bbcec2eca2c644fd18c683175cf9dd745726f1ad9e44ea130d35","observation_id":"2cd49640-e815-4fd6-9613-86b83b60705e","resolution":{"observed_at":"2026-08-11T22:42:39.524869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:39.474361Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering, 2022","venue":null,"work_id":"1992160b-c14e-42af-a2e1-ca72893e33fd","year":2022},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:33.556286Z"},"links":{"citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:a0a047a8e80c23ae709d7e2f2bc4bd4991e35235e468391cc0afac0445dd0e72","observation_id":"8258f6ad-9655-464a-9a08-a25085257104","resolution":{"observed_at":"2026-08-11T22:42:39.488095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:33.565798Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:33.565798Z"},"links":{"citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:b3cd77effdc582377251638bdc6b5efaf703b8dc7dcc1400c6cf2fe2144e2833","observation_id":"7005e5a2-b4fd-4291-996b-c573d4e492d6","resolution":{"observed_at":"2026-08-11T22:42:33.565798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:39.325103Z","title":"Egoschema: A diagnostic benchmark for very long- form video language understanding, 2023","venue":null,"work_id":"fefc838f-8d4f-4761-a820-99d0a363fff1","year":2023},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:33.575589Z"},"links":{"citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:507b1a6895caaee6b257c84b3fea71b509b210bb867a22e855155b62d6db9878","observation_id":"86a0b85c-9408-4b25-b55b-2cf851f878f8","resolution":{"observed_at":"2026-08-11T22:42:39.384758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:39.185086Z","title":"Llama3.2","venue":null,"work_id":"2243704e-2d77-46eb-a0cf-c5e23a251df8","year":2024},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:33.585461Z"},"links":{"citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:f01637884bec5af12b73c885e7e72ee4e6535dff5b879aa72bc4890e58047e43","observation_id":"d8e3a40c-93ca-4ac9-8563-51d4dc79cede","resolution":{"observed_at":"2026-08-11T22:42:39.235114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:39.044746Z","title":"Adavit: Adaptive vision transformers for efficient image recogni- tion","venue":null,"work_id":"55431149-4b28-4dd9-95b2-22bd5b56255d","year":null},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:33.598813Z"},"links":{"citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:90cad48c8b3f5980d83c209d430782cf49a1fb819891f40ca1e93a512383055f","observation_id":"457fb89c-8351-4a77-b0ad-bbda2d801f59","resolution":{"observed_at":"2026-08-11T22:42:39.061038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:38.941783Z","title":"Ar-net: Adaptive frame resolution for effi- cient action recognition","venue":null,"work_id":"2f2259df-f62e-4223-a74c-97686eeb0e21","year":2020},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:33.616022Z"},"links":{"citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:5a087082efc6d29ac6eaf686bac87d8013755a93bbe50ae15bdabdf3143c7be7","observation_id":"d18a5a18-d1d9-49d0-bd2d-9e07a68b1f16","resolution":{"observed_at":"2026-08-11T22:42:38.958217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:38.873852Z","title":"Compositional chain of thought prompting for large multimodal models","venue":null,"work_id":"398c3bc8-efd2-4b0f-ad8f-c39d55b3ed8a","year":2024},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:33.624337Z"},"links":{"citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:04931aee8c63921d45796eb8354067ff88d1ac6ecb68ab48537d87bab8ff4dea","observation_id":"4ac4217a-9349-4990-8340-b75bfc0a5d3f","resolution":{"observed_at":"2026-08-11T22:42:38.887809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:38.785918Z","title":"Encod- ing and controlling global semantics for long-form video question answering, 2024","venue":null,"work_id":"9b72b372-0b29-4621-b753-ce4af733d88c","year":2024},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:33.630775Z"},"links":{"citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:33cd79b5892b51057ddf1251d8a11db2173d84280a61d115b9e7af48ad33323c","observation_id":"5c6b7c86-c7ae-4b2c-8ef6-895367126778","resolution":{"observed_at":"2026-08-11T22:42:38.804751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:38.724801Z","title":null,"venue":null,"work_id":"0cabf89e-c2d1-4236-a280-f9fb052e5b4e","year":2023},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:33.637576Z"},"links":{"citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:efebe85a409a72bcf359be610e3aa25233770543977d1446f99da9491e45e8dc","observation_id":"9a3428c4-d063-4309-b640-4bb0824975d0","resolution":{"observed_at":"2026-08-11T22:42:38.754751Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:33.655655Z","title":"Gpt-4 technical report, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:33.655655Z"},"links":{"citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:54b37787a01591b2575c073881dc2e0d9d2ef91768b33cb4714a6995a70ebb6c","observation_id":"d97414c5-bacb-4d04-b009-efc026c23638","resolution":{"observed_at":"2026-08-11T22:42:33.655655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:38.574850Z","title":"Training lan- guage models to follow instructions with human feedback","venue":null,"work_id":"c0150676-6c05-44e5-969c-82971e2037ff","year":2022},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:33.668797Z"},"links":{"citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:50e6bc9189f5e3605a6f2e173473689d68d2f5e0b95ea04624dadcb3712ff5d6","observation_id":"ff77bf7b-c85c-4bfa-a91f-64abccbfbcf1","resolution":{"observed_at":"2026-08-11T22:42:38.590187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:38.484639Z","title":"The pagerank citation ranking: Bringing order to the web","venue":null,"work_id":"7d40d253-123a-4ced-9bf5-8c40af5fca2a","year":1999},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:33.762151Z"},"links":{"citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:7d1e837b23372a92937d688884cebe1d3700cb185e07a5cde29ef0aba0835495","observation_id":"dd422b71-84c5-4a32-aaa8-3cf4bbcc2929","resolution":{"observed_at":"2026-08-11T22:42:38.507077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:38.447361Z","title":"Ia-red2: Interpretability-aware redundancy reduction for vision transformers","venue":null,"work_id":"0fd6d083-cace-4352-ba04-fd3f5d5114f0","year":2021},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:33.849543Z"},"links":{"citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:65b002dd09e4086340bdb069bbc569c8d3438472746d43d3e3d806ab2bb9102b","observation_id":"0e6327bc-7b09-4b33-8b10-550cec56181b","resolution":{"observed_at":"2026-08-11T22:42:38.454239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:38.420582Z","title":"Perception test: A diagnostic benchmark for multimodal video models","venue":null,"work_id":"1297c457-952b-4ddf-be1c-cb6047a090c9","year":2023},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:33.975137Z"},"links":{"citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:307787512bea7b59775643e1633f05955a51ed3ee87c2382866b2f7aff127451","observation_id":"f83faf88-c2f2-4738-ad7d-08674c4912e0","resolution":{"observed_at":"2026-08-11T22:42:38.428599Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:38.361170Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":"367b5d34-3381-4040-88d5-fd8c53f6ccfc","year":2021},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:34.063231Z"},"links":{"citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:c5fc20cd97fab163e941e296e1e87f90773035efd348da52cb29de67d0d91770","observation_id":"5accbd04-bbae-4721-9691-191243fa9763","resolution":{"observed_at":"2026-08-11T22:42:38.380154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:38.325412Z","title":"DynamicViT: Efficient Vision Transformers with Dynamic Token Sparsification","venue":null,"work_id":"af282a8a-9e0e-4213-8cbc-ec27d4fa7e3d","year":2021},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:34.158807Z"},"links":{"citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:56f35c1be6f2a743f834d8b4120c6712ec357a327776a20207ce5422da181db0","observation_id":"1a0956f3-402a-4f0d-a575-423db1e20a99","resolution":{"observed_at":"2026-08-11T22:42:38.333199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:38.300141Z","title":"Finding the sweet spot: Analysis and improve- ment of adaptive inference in low resource settings","venue":null,"work_id":"b3bb889b-0673-4f68-924d-aae3767da7cf","year":2023},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:34.168279Z"},"links":{"citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:3e8630a0f0fe176769934ceab236a1fc6005266dcd900d9c3cc01453279ee173","observation_id":"7c80718b-24b9-47fe-b54e-1dbce6f47b46","resolution":{"observed_at":"2026-08-11T22:42:38.309827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:38.274939Z","title":"Interpolating video-llms: Toward longer- sequence lmms in a training-free manner, 2024","venue":null,"work_id":"d36a23bf-740e-4ee5-8e2f-333ae8b85476","year":2024},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:34.174000Z"},"links":{"citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:788521e87ed4eab9018fa03bcd3eea531a2611e3f748ba57d80a30a16726816c","observation_id":"ec62986d-32f0-4ecf-8b81-fb2b003c378f","resolution":{"observed_at":"2026-08-11T22:42:38.284187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:38.142711Z","title":"Llava-prumerge: Adaptive token reduction for efficient large multimodal models","venue":null,"work_id":"63d2413f-fa8c-4311-8867-5bb67684749d","year":2025},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:34.180714Z"},"links":{"citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:56688b19861081c8c2c1bd3c3d4f06ca6656bb2f0d0ef5f9b7eb9c87e3cbc801","observation_id":"1edc9274-79e0-4e84-911f-923a55456b2f","resolution":{"observed_at":"2026-08-11T22:42:38.201277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:38.105575Z","title":"Towards vqa models that can read, 2019","venue":null,"work_id":"fe153f9d-b99b-47a0-97e2-893d01a47aef","year":2019},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:34.194341Z"},"links":{"citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:8dcf9809e7542574d7207a8fc0548e31d63f270dff1320f6d8c7318c7b82b89d","observation_id":"6ede8a3c-8eca-4565-a815-9aaf4d00261e","resolution":{"observed_at":"2026-08-11T22:42:38.115737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:38.047995Z","title":"Dynamic Token Pruning in Plain Vision Trans- formers for Semantic Segmentation","venue":null,"work_id":"50723dd7-ce86-49fa-aba0-798e0269f574","year":2023},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:34.214748Z"},"links":{"citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:75cce27752c8765e0bb57ef85c58cf464a9d7e53b5e2df8756f4b7594210c60f","observation_id":"0b4c81a8-7082-49f3-b23d-8aed28fd2fb5","resolution":{"observed_at":"2026-08-11T22:42:38.073037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:37.966713Z","title":"Dycoke: Dynamic compression of tokens for fast video large language models","venue":null,"work_id":"f6c9e8c8-c4ef-4ac6-a972-970d06db5e58","year":2025},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:34.225942Z"},"links":{"citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:07d35174fae3ba458fdf43d10108ab6992ea3cfb291c1276fc3098ab37fef15c","observation_id":"1d22d025-eb75-4db5-886f-97daac3cb8c9","resolution":{"observed_at":"2026-08-11T22:42:37.973209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-11T22:42:34.245840Z","title":"Llama: Open and efficient foundation language mod- els","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:34.245840Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:108d60a35e604ca701af795d17e217de1271fe6c6f3cf0b220a2102c01034103","observation_id":"038999bd-7622-49e7-b053-8cc33e73319c","resolution":{"observed_at":"2026-08-11T22:42:34.245840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:37.934070Z","title":"SpAtten: Ef- ficient Sparse Attention Architecture with Cascade Token and Head Pruning","venue":null,"work_id":"4a68e2fc-3456-477d-ac26-c2a52caf14d1","year":2021},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:34.254738Z"},"links":{"citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:fdd189450a56769fe67ec622e345bc7a713eb1be152946aad8335771c0b55343","observation_id":"0789ecf3-c8ce-494a-95d9-7643ad399a1d","resolution":{"observed_at":"2026-08-11T22:42:37.945733Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:37.904746Z","title":"Zero- tprune: Zero-shot token pruning through leveraging of the attention graph in pre-trained transformers","venue":null,"work_id":"41798025-34ad-46fc-855e-5433bebf24d1","year":2024},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:34.294829Z"},"links":{"citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:8256be2bd49dc221867fc059464e51f474079a3171fcc89da9c67249e61c2b59","observation_id":"47e67a27-d0a6-4fcb-a93f-35500c172fb7","resolution":{"observed_at":"2026-08-11T22:42:37.918130Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-11T22:42:34.320401Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:34.320401Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:27c8b876ea7da7edbec1c175d82c4362b6a48a7220baa8ad92440ecf7e1880a7","observation_id":"1227f3ed-7a15-4a42-9eee-8cf8e7d7434e","resolution":{"observed_at":"2026-08-11T22:42:34.320401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:37.871802Z","title":"Skipnet: Learning dynamic routing in convolutional networks","venue":null,"work_id":"8276c0fd-5315-41c3-9b1e-b701d26e8d3c","year":2018},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:34.400690Z"},"links":{"citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:17bbb20fb4a5d1a7c991b61a19853b25ccfdf6d9fcc5958bdb386239601fd65c","observation_id":"6e4b5ed8-9e99-4eab-9beb-bbdf5ef19fd1","resolution":{"observed_at":"2026-08-11T22:42:37.882126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:37.816599Z","title":"Longllava: Scaling multi-modal llms to 1000 images efficiently via a hybrid architecture, 2024","venue":null,"work_id":"332754db-0531-4b25-9a07-ff122f836f16","year":2024},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:34.534876Z"},"links":{"citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:98b201ecafa48144870ea4773823f05ec491a7c918e50b8beb5ac2898cd918e8","observation_id":"0e2bba78-430d-4540-965f-c24aea22fe1a","resolution":{"observed_at":"2026-08-11T22:42:37.836613Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:37.783194Z","title":"Not all images are worth 16x16 words: Dynamic transformers for efficient image recognition","venue":null,"work_id":"0f0931db-c3e9-4302-b581-a505564eea93","year":2021},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:34.655401Z"},"links":{"citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:b9b79efd6860dab6190bb067de192ecdbab2c89fe053fd601204fd71942944b9","observation_id":"f5a96be5-5d41-47b8-9b50-2bcdbbba7819","resolution":{"observed_at":"2026-08-11T22:42:37.792671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:37.761011Z","title":"Videollamb: Long-context video understanding with recur- rent memory bridges, 2024","venue":null,"work_id":"6ffb2cdc-2d7a-4395-bd63-00b9c46f2d4e","year":2024},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:34.718307Z"},"links":{"citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:b4e6a0d23c883182101f412d08ea295046f5d3e5cba5318ed7a0f7c3c47843a8","observation_id":"c638345b-7acb-4397-a2b1-5bfe2aea6aa0","resolution":{"observed_at":"2026-08-11T22:42:37.768762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:37.723110Z","title":"Visual context win- dow extension: A new perspective for long video under- standing, 2024","venue":null,"work_id":"4fc4b03a-a55d-43b4-b0f0-f229e476fe6b","year":2024},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:34.731408Z"},"links":{"citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:bf96e983fe5fbdcad72b072d9be803f8b422d5243dcf66d13aff0e04c9fcafe5","observation_id":"a4c1ce93-90a4-4ac0-802e-7c8f7fd582cd","resolution":{"observed_at":"2026-08-11T22:42:37.744662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:37.670829Z","title":"Joint Token Pruning and Squeezing Towards More Aggressive Compression of Vision Transformers","venue":null,"work_id":"9495fd17-15a8-4b04-a6f1-4d2896a4583b","year":2023},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:34.740948Z"},"links":{"citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:bd2584a55090232b19aff1fe1fa2691a7c6f2e0c4c955a950ff87a795d4394e7","observation_id":"23241af9-9f4e-43c9-9542-b371537fe413","resolution":{"observed_at":"2026-08-11T22:42:37.679928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:37.642365Z","title":"Longvlm: Efficient long video under- standing via large language models, 2024","venue":null,"work_id":"c8a5f8f0-4691-42a6-9852-1674fa92cd1d","year":2024},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:34.751404Z"},"links":{"citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:2f8f9f18ec12b5ebc3fa6d26b3a29cc51b7b77862d9f2c66d04d52b51ddf69e4","observation_id":"cfcc0320-87b6-4b8f-8565-bd8a1bdad02c","resolution":{"observed_at":"2026-08-11T22:42:37.656283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:37.613454Z","title":"Blockdrop: Dynamic inference paths in residual net- works","venue":null,"work_id":"38f961af-3353-4efc-ab7c-f726267d23c0","year":2018},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:34.759486Z"},"links":{"citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:c3afe35fd9be1ca53ff00fdcf039c976dafc7b0710f6482af5112358757661c1","observation_id":"47846cea-a78b-4d35-8e4d-85e9b8e37c97","resolution":{"observed_at":"2026-08-11T22:42:37.624531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:37.558719Z","title":"Next-qa:next phase of question-answering to explaining temporal actions, 2021","venue":null,"work_id":"8c9fabd0-33a0-49ce-8d3c-c0d640e8005c","year":2021},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:34.770470Z"},"links":{"citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:0d2dd9ea62f92dfcb5295a9f5dde9084bd031f8687168b3c173e92234a5807c9","observation_id":"4648a01f-e97b-44bc-b8d3-aa462314bc7a","resolution":{"observed_at":"2026-08-11T22:42:37.570100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:37.523485Z","title":"Conical visual concen- tration for efficient large vision-language models","venue":null,"work_id":"e9a1ddf0-a9ca-4835-94a1-8305564429c6","year":2025},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:34.783913Z"},"links":{"citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:7633e17b7d2349c0b37a8634acf1f064e0bf46739f9a56146ae6abc1af576786","observation_id":"69b0ac4a-7df3-4171-a32e-707d0c6a62bf","resolution":{"observed_at":"2026-08-11T22:42:37.531799Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16994","last_updated":"2024-04-29T14:52:02Z","snapshot_observed_at":"2026-08-13T20:40:43.794560Z","submitted_at":"2024-04-25T19:29:55Z","title":"PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16994","snapshot_observed_at":"2026-08-11T22:42:34.808922Z","title":"Pllava: Parameter-free llava extension from images to videos for video dense captioning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:34.808922Z"},"links":{"cited_paper":"/paper/2404.16994","citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:b0d38c6a6d7443c90ea98c41c979dcb98bbaa1e598a6ea422a315692b4caec5d","observation_id":"e2cfcd85-85d0-4b5c-a3e2-d397f22d1590","resolution":{"observed_at":"2026-08-11T22:42:34.808922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:37.417263Z","title":"Smartadapt: Multi-branch object detection framework for videos on mo- biles","venue":null,"work_id":"4aca0fc7-d6b9-4191-9cf8-216ef0bf1420","year":null},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:34.822061Z"},"links":{"citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:67243e5e68cb60efe744e0c83a057ee7c47d94d46c4b99d4af69dd3f260ba794","observation_id":"c679c919-d041-4e74-ad92-17cc044aa0bf","resolution":{"observed_at":"2026-08-11T22:42:37.454749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:37.375630Z","title":"The greedy miser: learning under test-time budgets","venue":null,"work_id":"ef8ff34f-2d40-42ef-94a5-bf6fb532dd9a","year":null},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:34.832500Z"},"links":{"citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:b5638e1f01f50c42b4562b930ac24db4bddfc5220994270a9d4b38b1689d1423","observation_id":"2e149b68-1f3c-4aba-b4ea-299c66d8b911","resolution":{"observed_at":"2026-08-11T22:42:37.386268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:37.320892Z","title":"Learning to inference adaptively for multimodal large language models","venue":null,"work_id":"a1e27bff-5078-479e-ac74-b98342c8eab5","year":2025},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:34.842779Z"},"links":{"citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:d604ac9992532b85ba4d123fae2fc481f538be90adda7dfd2eb4181c27ab321c","observation_id":"2b42e201-f2c7-4aa2-a3ea-52167ea5b291","resolution":{"observed_at":"2026-08-11T22:42:37.337698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-16T04:27:36.181491Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-08-11T22:42:34.850695Z","title":"Longvila: Scaling long-context visual language models for long videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:34.850695Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:62d04b7c782c7d85f218ac7aea4132f61edab382698ac9b023cddf1c1c4f8528","observation_id":"071fcb59-3f8e-4437-acd7-d53341c590dc","resolution":{"observed_at":"2026-08-11T22:42:34.850695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-08-17T11:08:48.802438Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-11T22:42:34.856995Z","title":"Qwen2 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:34.856995Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:ff00bb8c7564b3d8b9a0fb36e2c7fd3d83d0eb85217fa4f3a595bec7fb784899","observation_id":"d2a1cada-6559-4c95-85e3-a887118f5636","resolution":{"observed_at":"2026-08-11T22:42:34.856995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.11618","last_updated":"2021-05-25T02:28:51Z","snapshot_observed_at":"2026-08-16T18:22:31.349867Z","submitted_at":"2021-05-25T02:28:51Z","title":"TR-BERT: Dynamic Token Reduction for Accelerating BERT Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.11618","snapshot_observed_at":"2026-08-11T22:42:34.872462Z","title":"Tr-BERT: Dynamic Token Reduction for Accelerating BERT Inference","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:34.872462Z"},"links":{"cited_paper":"/paper/2105.11618","citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:62cb793d9447cf6f8c1fb1285d4f32c95d6b6a8568dc015279adfda485f38040","observation_id":"33c82efb-326a-4499-83ab-a3caa6c57001","resolution":{"observed_at":"2026-08-11T22:42:34.872462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:37.242813Z","title":"mplug-owl3: Towards long image-sequence understanding in multi-modal large language models, 2024","venue":null,"work_id":"cc808fcc-0e66-445c-a03c-4b8ac58f2ecc","year":2024},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:34.954224Z"},"links":{"citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:7026eaa91c4d832e437787e76c52cc71ec892a59a183e54784901575bd1e6940","observation_id":"2a7689da-4d9d-4c25-8847-cc9589d1b9b4","resolution":{"observed_at":"2026-08-11T22:42:37.274750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:37.198287Z","title":"Fit and prune: Fast and training-free visual token pruning for multi-modal large language models","venue":null,"work_id":"22033838-fcb7-4f93-86bc-9dad7d480860","year":2025},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:35.098347Z"},"links":{"citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:ae9bf697cf8355791bbf30236274daf638fcc290b2404ece5cfe0d94a4a6af7d","observation_id":"d628cffe-e20e-45bf-ad9f-5f37ede00a6d","resolution":{"observed_at":"2026-08-11T22:42:37.208625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:37.151863Z","title":"Alvarez, Arun Mallya, Jan Kautz, and Pavlo Molchanov","venue":null,"work_id":"127d6007-6b16-448d-b127-991e2451c137","year":2022},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:35.204596Z"},"links":{"citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:5eaeff05250addebe60589aba789766089f62df44b23ee84cef4144e7315a183","observation_id":"2b0bff02-7148-49f2-b7bc-6a5c1ea8452b","resolution":{"observed_at":"2026-08-11T22:42:37.163076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:37.122372Z","title":"Llm inference unveiled: Survey and roofline model in- sights, 2024","venue":null,"work_id":"bc337b26-b8d2-415a-9a3b-4301a21d8846","year":2024},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:35.309467Z"},"links":{"citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:000a70470336a619126b7d1a6e3bc4d413e34dddc7fefc54f7618580558219e3","observation_id":"0f37e1d6-9c72-451e-9a23-fd816d9d0a07","resolution":{"observed_at":"2026-08-11T22:42:37.130770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:35.411927Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:35.411927Z"},"links":{"citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:472c1a6ff741fdd8a42128ba8e2e8585cfcecbe5d1b3533268ee1988ea9cb2ed","observation_id":"9c8afaca-8878-42c6-9f66-921e155a77d1","resolution":{"observed_at":"2026-08-11T22:42:35.411927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-11T22:42:35.454216Z","title":"Long context transfer from language to vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:35.454216Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:27e0c9104f217c2a7de96bbf7896fa16cd8e57b873fc3b8a5a6154e24928c5cf","observation_id":"30ce5201-7e5d-4032-bfee-955a1cec7fbe","resolution":{"observed_at":"2026-08-11T22:42:35.454216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-11T22:42:35.470309Z","title":"Opt: Open pre-trained transformer language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:35.470309Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:670cf35a3889d9ae91e4ac73a1792cdd276682623b99d3edb2614c9599b1d504","observation_id":"3cc18f74-ef5e-440c-8bf0-04d87bcdaf89","resolution":{"observed_at":"2026-08-11T22:42:35.470309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:35.480309Z","title":"Llava-next: A strong zero-shot video understanding model,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:35.480309Z"},"links":{"citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:f4f4e1c7139aaf28c0793b988bcc589664cc099c0c568577cca8afb206b9fa63","observation_id":"bf704827-ccb7-4c18-976d-ddc899f90bf2","resolution":{"observed_at":"2026-08-11T22:42:35.480309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:37.040547Z","title":"Video instruction tuning with synthetic data, 2024","venue":null,"work_id":"f4129c21-cae4-4f26-a47d-1d960fc80d18","year":2024},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:35.493317Z"},"links":{"citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:2b8bbf3b82af4732416c17d0f82f3bc47be32efb94abdba6b67b9464bc62fa71","observation_id":"e8c2bfff-7ab0-49dd-a3b8-863289b432fc","resolution":{"observed_at":"2026-08-11T22:42:37.049515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:36.954463Z","title":"Sparsevlm: Vi- sual token sparsification for efficient vision-language model inference","venue":null,"work_id":"7e1835fc-494e-49b8-b226-bcda3012a7e0","year":2025},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:35.501667Z"},"links":{"citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:946b9dc26bd9982fdbdc764a1ba9416b2bb54b204a20197c6b17978997ef648c","observation_id":"e38301fb-a2b6-444d-83cd-7ae159be5830","resolution":{"observed_at":"2026-08-11T22:42:36.961412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-08-11T00:52:12.225793Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-11T22:42:35.510876Z","title":"Multimodal chain-of- thought reasoning in language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:35.510876Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:8fd996e0ce6af88652da6dad69abf906ec9eda9964d74d7e0fd47ec312638527","observation_id":"f041d933-1902-412a-9ac3-1acf2b510799","resolution":{"observed_at":"2026-08-11T22:42:35.510876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06169","last_updated":"2024-11-30T05:32:51Z","snapshot_observed_at":"2026-08-18T10:00:04.391461Z","submitted_at":"2024-10-08T16:13:24Z","title":"Treat Visual Tokens as Text? But Your MLLM Only Needs Fewer Efforts to See","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06169","snapshot_observed_at":"2026-08-11T22:42:35.570387Z","title":"Treat visual tokens as text? but your mllm only needs fewer efforts to see","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:35.570387Z"},"links":{"cited_paper":"/paper/2410.06169","citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:995517c0d9218e9b6028b1dbbd28ed6bfb4ce36fbc920ce44f43bc6cab70f85b","observation_id":"0e68b2d4-546a-4dd0-8c91-07175928aee8","resolution":{"observed_at":"2026-08-11T22:42:35.570387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:36.904766Z","title":"Beyond embeddings: The promise of visual table in vi- sual reasoning","venue":null,"work_id":"f3ec1f2e-a11f-437f-ac42-2840b76108cb","year":2024},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:35.595613Z"},"links":{"citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:a1141309470ac9fca254567dfc21bbd79aa5fe1edf377c4474f66f1df0bab529","observation_id":"8ae94114-09fb-465c-b2fb-d5ca5bed3427","resolution":{"observed_at":"2026-08-11T22:42:36.926701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:36.664053Z","title":"Mlvu: A comprehensive benchmark for multi- task long video understanding, 2024","venue":null,"work_id":"4ad922d6-3e4f-4188-a437-53ae32cf1a01","year":2024},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:35.606021Z"},"links":{"citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:e6054d151ad5a7b86bd2afb4ec30ccb74ae03bfcad136bd54c682c4cd6fd2093","observation_id":"a9a29163-bbce-4992-842b-e601b02006ff","resolution":{"observed_at":"2026-08-11T22:42:36.681732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T05:19:24.769228Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":49,"verified_exact":0,"verified_fuzzy":51},"total_outbound_references":102},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 100 of 102 outbound references and 10 inbound Pith citation observations for arXiv:2412.03248."}