{"as_of":"2026-08-16T05:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b044180d8ed7d41bebd6e4b004db0c79ec3dc98b0eae85af2f978bc40e59be75","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":35,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T18:49:24.114689Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":2,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2407.18003","last_updated":"2024-11-20T02:04:10Z","snapshot_observed_at":"2026-08-12T23:14:54.561199Z","submitted_at":"2024-07-25T12:56:22Z","title":"Keep the Cost Down: A Review on Methods to Optimize LLM' s KV-Cache Consumption","version":4},"cited_work":{"arxiv_id":"2407.18003","doi":"10.48550/arxiv.2407.18003","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.18003","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Keep the cost down: A review on methods to optimize llm’s kv-cache consumption","venue":"arXiv (Cornell University)","work_id":"45195b7c-36a4-4e3e-8f9e-db76070aec96","year":2024},"citing_paper":{"arxiv_id":"2410.13846","last_updated":"2026-05-18T05:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-17T17:58:14Z","title":"LightTransfer: Your Long-Context LLM is Secretly a Hybrid Model with Effortless Adaptation","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-23T18:31:35.391674Z"},"links":{"cited_paper":"/paper/2407.18003","citing_paper":"/paper/2410.13846"},"observation_digest":"sha256:34922b5c5203068bfbed7b732e7e802b9cb90b39ebc3bcd048f23f106b669b63","observation_id":"5219d9de-e731-44a0-90d5-02d903ff308e","resolution":{"observed_at":"2026-05-23T18:33:19.467156Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.18003","last_updated":"2024-11-20T02:04:10Z","snapshot_observed_at":"2026-08-12T23:14:54.561199Z","submitted_at":"2024-07-25T12:56:22Z","title":"Keep the Cost Down: A Review on Methods to Optimize LLM' s KV-Cache Consumption","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.18003","snapshot_observed_at":"2026-08-12T17:22:47.127086Z","title":"arXiv preprint arXiv:2407.18003 (2024) 2","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12663","last_updated":"2024-11-19T17:16:31Z","snapshot_observed_at":"2026-08-16T01:22:08.279658Z","submitted_at":"2024-11-19T17:16:31Z","title":"PoM: Efficient Image and Video Generation with the Polynomial Mixer","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:47.127086Z"},"links":{"cited_paper":"/paper/2407.18003","citing_paper":"/paper/2411.12663"},"observation_digest":"sha256:3fa275b49a855cd5686f803214e4ca5cc393b98f7a29c43e42cc69003c236353","observation_id":"d5b3f2d9-d1dd-4bdf-a1ed-cc660c9f4577","resolution":{"observed_at":"2026-08-12T17:22:47.127086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.18003","last_updated":"2024-11-20T02:04:10Z","snapshot_observed_at":"2026-08-12T23:14:54.561199Z","submitted_at":"2024-07-25T12:56:22Z","title":"Keep the Cost Down: A Review on Methods to Optimize LLM' s KV-Cache Consumption","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.18003","snapshot_observed_at":"2026-08-12T05:01:00.325854Z","title":"Keep the cost down: A review on methods to optimize llm’s kv-cache consumption","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00876","last_updated":"2025-03-21T13:30:33Z","snapshot_observed_at":"2026-08-15T10:20:00.553225Z","submitted_at":"2024-12-01T16:32:31Z","title":"Dynamic-LLaVA: Efficient Multimodal Large Language Models via Dynamic Vision-language Context Sparsification","version":4},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-12T05:01:00.325854Z"},"links":{"cited_paper":"/paper/2407.18003","citing_paper":"/paper/2412.00876"},"observation_digest":"sha256:1c10d8dfd24e374432ddfeb54d163e44e32cff8baa8efd819a39ce879a8d4939","observation_id":"85aaef17-8091-466c-b1e5-1ef66ac6ee03","resolution":{"observed_at":"2026-08-12T05:01:00.325854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.18003","last_updated":"2024-11-20T02:04:10Z","snapshot_observed_at":"2026-08-12T23:14:54.561199Z","submitted_at":"2024-07-25T12:56:22Z","title":"Keep the Cost Down: A Review on Methods to Optimize LLM' s KV-Cache Consumption","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.18003","snapshot_observed_at":"2026-08-11T00:38:46.742080Z","title":"Keep the cost down: A review on methods to optimize llm’s kv-cache consumption,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19442","last_updated":"2025-07-30T05:24:46Z","snapshot_observed_at":"2026-08-15T13:24:51.697670Z","submitted_at":"2024-12-27T04:17:57Z","title":"A Survey on Large Language Model Acceleration based on KV Cache Management","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T00:38:46.742080Z"},"links":{"cited_paper":"/paper/2407.18003","citing_paper":"/paper/2412.19442"},"observation_digest":"sha256:73b4a1e957072a32b2c648fb42f83c5bc639c558e4e9286b929cda280c14a954","observation_id":"b8c53615-97bd-437a-8068-f3f255f0c4e4","resolution":{"observed_at":"2026-08-11T00:38:46.742080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.18003","last_updated":"2024-11-20T02:04:10Z","snapshot_observed_at":"2026-08-12T23:14:54.561199Z","submitted_at":"2024-07-25T12:56:22Z","title":"Keep the Cost Down: A Review on Methods to Optimize LLM' s KV-Cache Consumption","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.18003","snapshot_observed_at":"2026-08-08T05:29:16.660204Z","title":"Keep the cost down: A review on methods to optimize LLM’s KV-cache consumption, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08363","last_updated":"2026-06-16T14:51:28Z","snapshot_observed_at":"2026-08-15T01:00:38.203259Z","submitted_at":"2025-02-12T12:50:15Z","title":"Top-Theta Attention: Sparsifying Transformers by Compensated Thresholding","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T05:29:16.660204Z"},"links":{"cited_paper":"/paper/2407.18003","citing_paper":"/paper/2502.08363"},"observation_digest":"sha256:431fdbcb19ca4901f49681b28632e763f8515434fbf8c5396daefa6151509c6e","observation_id":"b92d5962-84f4-4bbe-a72c-02ea9c1698b1","resolution":{"observed_at":"2026-08-08T05:29:16.660204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.18003","last_updated":"2024-11-20T02:04:10Z","snapshot_observed_at":"2026-08-12T23:14:54.561199Z","submitted_at":"2024-07-25T12:56:22Z","title":"Keep the Cost Down: A Review on Methods to Optimize LLM' s KV-Cache Consumption","version":4},"cited_work":{"arxiv_id":"2407.18003","doi":"10.48550/arxiv.2407.18003","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.18003","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Keep the cost down: A review on methods to optimize llm’s kv-cache consumption","venue":"arXiv (Cornell University)","work_id":"45195b7c-36a4-4e3e-8f9e-db76070aec96","year":2024},"citing_paper":{"arxiv_id":"2502.20295","last_updated":"2026-08-07T06:58:25Z","snapshot_observed_at":"2026-08-12T23:09:06.107617Z","submitted_at":"2025-02-27T17:21:18Z","title":"Judge a Book by its Cover: Investigating Multi-Modal LLMs for Multi-Page Handwritten Document Transcription","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-23T02:23:22.682357Z"},"links":{"cited_paper":"/paper/2407.18003","citing_paper":"/paper/2502.20295"},"observation_digest":"sha256:a1995772b6bc6b095548c24525a4902b15960061e2240800f659146f345a9676","observation_id":"d9d6c010-c1f2-4d1a-ad8e-4885cbdcba68","resolution":{"observed_at":"2026-05-23T02:25:19.420768Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.18003","last_updated":"2024-11-20T02:04:10Z","snapshot_observed_at":"2026-08-12T23:14:54.561199Z","submitted_at":"2024-07-25T12:56:22Z","title":"Keep the Cost Down: A Review on Methods to Optimize LLM' s KV-Cache Consumption","version":4},"cited_work":{"arxiv_id":"2407.18003","doi":"10.48550/arxiv.2407.18003","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.18003","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Keep the cost down: A review on methods to optimize llm’s kv-cache consumption","venue":"arXiv (Cornell University)","work_id":"45195b7c-36a4-4e3e-8f9e-db76070aec96","year":2024},"citing_paper":{"arxiv_id":"2503.16419","last_updated":"2025-08-21T19:14:40Z","snapshot_observed_at":"2026-08-11T13:10:23.709172Z","submitted_at":"2025-03-20T17:59:38Z","title":"Stop Overthinking: A Survey on Efficient Reasoning for Large Language Models","version":4},"reference_index":156,"source":"pdf_text","source_observed_at":"2026-05-14T01:29:56.480020Z"},"links":{"cited_paper":"/paper/2407.18003","citing_paper":"/paper/2503.16419"},"observation_digest":"sha256:ad4e675042c4c060ab91e52e353bcaa97e2249b251548c872b5e72c8c2423c2c","observation_id":"a6650d7d-366e-4a5c-96bd-68c48e7e7dc7","resolution":{"observed_at":"2026-05-14T01:29:56.798694Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.18003","last_updated":"2024-11-20T02:04:10Z","snapshot_observed_at":"2026-08-12T23:14:54.561199Z","submitted_at":"2024-07-25T12:56:22Z","title":"Keep the Cost Down: A Review on Methods to Optimize LLM' s KV-Cache Consumption","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.18003","snapshot_observed_at":"2026-08-07T15:29:15.745107Z","title":"ArXiv, abs/2407.18003","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.14992","last_updated":"2025-05-21T00:40:05Z","snapshot_observed_at":"2026-08-13T13:00:35.500541Z","submitted_at":"2025-05-21T00:40:05Z","title":"Effective and Efficient Schema-aware Information Extraction Using On-Device Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:15.745107Z"},"links":{"cited_paper":"/paper/2407.18003","citing_paper":"/paper/2505.14992"},"observation_digest":"sha256:7ebf40ffcd21c4cd3f63134b47939fb4b6f1e87d61c230bc62ad97d22b9669ce","observation_id":"a27890fd-b34e-4647-ad95-b4702abfd465","resolution":{"observed_at":"2026-08-07T15:29:15.745107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.18003","last_updated":"2024-11-20T02:04:10Z","snapshot_observed_at":"2026-08-12T23:14:54.561199Z","submitted_at":"2024-07-25T12:56:22Z","title":"Keep the Cost Down: A Review on Methods to Optimize LLM' s KV-Cache Consumption","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.18003","snapshot_observed_at":"2026-08-07T01:09:21.238031Z","title":"Keep the cost down: A review on methods to optimize llm’s kv-cache consumption.arXiv preprint arXiv:2407.18003,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.12204","last_updated":"2025-06-13T20:15:58Z","snapshot_observed_at":"2026-08-09T07:59:09.687258Z","submitted_at":"2025-06-13T20:15:58Z","title":"Semantic Scheduling for LLM Inference","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T01:09:21.238031Z"},"links":{"cited_paper":"/paper/2407.18003","citing_paper":"/paper/2506.12204"},"observation_digest":"sha256:06ca7aec352e1a68f41d9d39457a8d521401df2fb63bd98ba27c9a15bac15755","observation_id":"4897a087-dd91-41dd-a307-597c18fc83a6","resolution":{"observed_at":"2026-08-07T01:09:21.238031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.18003","last_updated":"2024-11-20T02:04:10Z","snapshot_observed_at":"2026-08-12T23:14:54.561199Z","submitted_at":"2024-07-25T12:56:22Z","title":"Keep the Cost Down: A Review on Methods to Optimize LLM' s KV-Cache Consumption","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.18003","snapshot_observed_at":"2026-08-07T10:20:42.997865Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15724","last_updated":"2025-06-06T01:51:24Z","snapshot_observed_at":"2026-08-10T14:12:07.012882Z","submitted_at":"2025-06-06T01:51:24Z","title":"MadaKV: Adaptive Modality-Perception KV Cache Eviction for Efficient Multimodal Long-Context Inference","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T10:20:42.997865Z"},"links":{"cited_paper":"/paper/2407.18003","citing_paper":"/paper/2506.15724"},"observation_digest":"sha256:b4f5bb4b1fc21fcda561d3732770878b9618aad7ce0f595b9f3ebae919621e88","observation_id":"788f684c-688f-4c76-a0d2-c0d1d8010cba","resolution":{"observed_at":"2026-08-07T10:20:42.997865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.18003","last_updated":"2024-11-20T02:04:10Z","snapshot_observed_at":"2026-08-12T23:14:54.561199Z","submitted_at":"2024-07-25T12:56:22Z","title":"Keep the Cost Down: A Review on Methods to Optimize LLM' s KV-Cache Consumption","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.18003","snapshot_observed_at":"2026-08-15T18:49:24.114689Z","title":"Shi, L., Zhang, H., Yao, Y ., Li, Z., and Zhao, H","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18879","last_updated":"2025-06-23T17:50:11Z","snapshot_observed_at":"2026-08-16T01:51:29.045572Z","submitted_at":"2025-06-23T17:50:11Z","title":"CommVQ: Commutative Vector Quantization for KV Cache Compression","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T18:49:24.114689Z"},"links":{"cited_paper":"/paper/2407.18003","citing_paper":"/paper/2506.18879"},"observation_digest":"sha256:e507a67b68f97b2fd0983f6bfbde3dac388b30a8bc05f3a6662a737ea8d0ee61","observation_id":"93a778ed-c57c-4e7a-ad1c-0000ebe9a475","resolution":{"observed_at":"2026-08-15T18:49:24.114689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.18003","last_updated":"2024-11-20T02:04:10Z","snapshot_observed_at":"2026-08-12T23:14:54.561199Z","submitted_at":"2024-07-25T12:56:22Z","title":"Keep the Cost Down: A Review on Methods to Optimize LLM' s KV-Cache Consumption","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.18003","snapshot_observed_at":"2026-08-06T22:01:23.768568Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22950","last_updated":"2025-06-28T16:52:29Z","snapshot_observed_at":"2026-08-15T22:58:22.406432Z","submitted_at":"2025-06-28T16:52:29Z","title":"Infinite Sampling: Efficient and Stable Grouped RL Training for Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:23.768568Z"},"links":{"cited_paper":"/paper/2407.18003","citing_paper":"/paper/2506.22950"},"observation_digest":"sha256:0e1b9dd1f1411b77b20e794d728b2987115000a81f7960cbde419f61cf4151d6","observation_id":"461a5b00-b6bf-454a-900d-d65b113bee91","resolution":{"observed_at":"2026-08-06T22:01:23.768568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.18003","last_updated":"2024-11-20T02:04:10Z","snapshot_observed_at":"2026-08-12T23:14:54.561199Z","submitted_at":"2024-07-25T12:56:22Z","title":"Keep the Cost Down: A Review on Methods to Optimize LLM' s KV-Cache Consumption","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.18003","snapshot_observed_at":"2026-08-06T19:10:01.272177Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06517","last_updated":"2025-07-09T03:33:44Z","snapshot_observed_at":"2026-08-10T09:11:28.813559Z","submitted_at":"2025-07-09T03:33:44Z","title":"SpindleKV: A Novel KV Cache Reduction Method Balancing Both Shallow and Deep Layers","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T19:10:01.272177Z"},"links":{"cited_paper":"/paper/2407.18003","citing_paper":"/paper/2507.06517"},"observation_digest":"sha256:918db91214930e08a195b2d3ea9728bb3604638e0b0ac9cf0556d9d2bee35fc8","observation_id":"34f513a7-45ee-4117-9607-8b2ff82b929e","resolution":{"observed_at":"2026-08-06T19:10:01.272177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.18003","last_updated":"2024-11-20T02:04:10Z","snapshot_observed_at":"2026-08-12T23:14:54.561199Z","submitted_at":"2024-07-25T12:56:22Z","title":"Keep the Cost Down: A Review on Methods to Optimize LLM' s KV-Cache Consumption","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.18003","snapshot_observed_at":"2026-08-06T17:47:40.255004Z","title":"Keep the cost down: A review on methods to optimize LLM’s KV-cache consumption,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-12T22:06:32.894649Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:40.255004Z"},"links":{"cited_paper":"/paper/2407.18003","citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:4d43e9670c2b11a780794a453cb516d4db5d1d39f820d42caafc4746120d35c0","observation_id":"f37ec339-0b23-4a03-bf5b-9a5ccd011380","resolution":{"observed_at":"2026-08-06T17:47:40.255004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.18003","last_updated":"2024-11-20T02:04:10Z","snapshot_observed_at":"2026-08-12T23:14:54.561199Z","submitted_at":"2024-07-25T12:56:22Z","title":"Keep the Cost Down: A Review on Methods to Optimize LLM' s KV-Cache Consumption","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.18003","snapshot_observed_at":"2026-08-06T17:05:37.229366Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11942","last_updated":"2025-07-16T06:16:06Z","snapshot_observed_at":"2026-08-15T18:06:38.441026Z","submitted_at":"2025-07-16T06:16:06Z","title":"DAC: A Dynamic Attention-aware Approach for Task-Agnostic Prompt Compression","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T17:05:37.229366Z"},"links":{"cited_paper":"/paper/2407.18003","citing_paper":"/paper/2507.11942"},"observation_digest":"sha256:825ddf10f46b1b803d893f7d894414f84e11c559f0bc45e458da5bbcb96c8b0b","observation_id":"2932188b-feb0-4505-b425-00706e65caa3","resolution":{"observed_at":"2026-08-06T17:05:37.229366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.18003","last_updated":"2024-11-20T02:04:10Z","snapshot_observed_at":"2026-08-12T23:14:54.561199Z","submitted_at":"2024-07-25T12:56:22Z","title":"Keep the Cost Down: A Review on Methods to Optimize LLM' s KV-Cache Consumption","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.18003","snapshot_observed_at":"2026-08-06T15:38:43.886353Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15428","last_updated":"2025-07-21T09:27:45Z","snapshot_observed_at":"2026-08-15T02:35:16.298968Z","submitted_at":"2025-07-21T09:27:45Z","title":"EgoPrune: Efficient Token Pruning for Egomotion Video Reasoning in Embodied Agent","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T15:38:43.886353Z"},"links":{"cited_paper":"/paper/2407.18003","citing_paper":"/paper/2507.15428"},"observation_digest":"sha256:bb859b072be2c28de3c1830dcc221c998886b93ba1330e7002e13dfbddb67506","observation_id":"a39092e4-3a0b-44e8-ade1-6d67846053ab","resolution":{"observed_at":"2026-08-06T15:38:43.886353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.18003","last_updated":"2024-11-20T02:04:10Z","snapshot_observed_at":"2026-08-12T23:14:54.561199Z","submitted_at":"2024-07-25T12:56:22Z","title":"Keep the Cost Down: A Review on Methods to Optimize LLM' s KV-Cache Consumption","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.18003","snapshot_observed_at":"2026-08-06T15:19:40.748817Z","title":"Keep the cost down: A review on methods to optimize llm’s kv-cache consumption,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16229","last_updated":"2025-07-22T05:01:06Z","snapshot_observed_at":"2026-08-12T01:24:15.971499Z","submitted_at":"2025-07-22T05:01:06Z","title":"Voice-based AI Agents: Filling the Economic Gaps in Digital Health Delivery","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:40.748817Z"},"links":{"cited_paper":"/paper/2407.18003","citing_paper":"/paper/2507.16229"},"observation_digest":"sha256:af5a1df87bb66c6c2000fb8495c5c674119a3fe04a5d46e77e96dbf99c6c6f85","observation_id":"94b1b7e0-2608-4c71-b194-af0574f455d9","resolution":{"observed_at":"2026-08-06T15:19:40.748817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.18003","last_updated":"2024-11-20T02:04:10Z","snapshot_observed_at":"2026-08-12T23:14:54.561199Z","submitted_at":"2024-07-25T12:56:22Z","title":"Keep the Cost Down: A Review on Methods to Optimize LLM' s KV-Cache Consumption","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.18003","snapshot_observed_at":"2026-08-05T18:46:59.019444Z","title":"Keep the cost down: A review on methods to optimize llm’s kv-cache consumption,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.14239","last_updated":"2025-08-19T19:57:34Z","snapshot_observed_at":"2026-08-15T00:18:28.514752Z","submitted_at":"2025-08-19T19:57:34Z","title":"A Distributed Learned Hash Table","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-05T18:46:59.019444Z"},"links":{"cited_paper":"/paper/2407.18003","citing_paper":"/paper/2508.14239"},"observation_digest":"sha256:2d5e38fb840234e26181ab371b58add3dd618c90ce55ffeae264e59607465f10","observation_id":"eafe9d99-b0e2-4280-91ad-76196c72b741","resolution":{"observed_at":"2026-08-05T18:46:59.019444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.18003","last_updated":"2024-11-20T02:04:10Z","snapshot_observed_at":"2026-08-12T23:14:54.561199Z","submitted_at":"2024-07-25T12:56:22Z","title":"Keep the Cost Down: A Review on Methods to Optimize LLM' s KV-Cache Consumption","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.18003","snapshot_observed_at":"2026-08-05T11:10:56.981798Z","title":"Keep the cost down: A review on methods to optimize llm’s kv-cache consumption","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.03136","last_updated":"2025-09-03T08:38:40Z","snapshot_observed_at":"2026-08-15T18:04:12.196163Z","submitted_at":"2025-09-03T08:38:40Z","title":"Adaptive KV-Cache Compression without Manually Setting Budget","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T11:10:56.981798Z"},"links":{"cited_paper":"/paper/2407.18003","citing_paper":"/paper/2509.03136"},"observation_digest":"sha256:c365e827c8dc8ab7376fc82827de7c206407aa515bbcc80660e0ffb8c3d06c2e","observation_id":"491957c2-5a6c-460d-9d6c-9cc99aeca3ed","resolution":{"observed_at":"2026-08-05T11:10:56.981798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.18003","last_updated":"2024-11-20T02:04:10Z","snapshot_observed_at":"2026-08-12T23:14:54.561199Z","submitted_at":"2024-07-25T12:56:22Z","title":"Keep the Cost Down: A Review on Methods to Optimize LLM' s KV-Cache Consumption","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.18003","snapshot_observed_at":"2026-08-05T10:16:13.096313Z","title":"arXiv preprint arXiv:2407.18003","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.04377","last_updated":"2025-09-04T16:40:01Z","snapshot_observed_at":"2026-08-15T06:44:06.974630Z","submitted_at":"2025-09-04T16:40:01Z","title":"PagedEviction: Structured Block-wise KV Cache Pruning for Efficient Large Language Model Inference","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T10:16:13.096313Z"},"links":{"cited_paper":"/paper/2407.18003","citing_paper":"/paper/2509.04377"},"observation_digest":"sha256:a556db702a1416b532f89c2ddc67f6d3fe3e3ddd916282713fe39491c70d4910","observation_id":"d25a45b9-ab71-462e-8b35-d99d6b246da4","resolution":{"observed_at":"2026-08-05T10:16:13.096313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.18003","last_updated":"2024-11-20T02:04:10Z","snapshot_observed_at":"2026-08-12T23:14:54.561199Z","submitted_at":"2024-07-25T12:56:22Z","title":"Keep the Cost Down: A Review on Methods to Optimize LLM' s KV-Cache Consumption","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.18003","snapshot_observed_at":"2026-08-04T20:53:30.115688Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08315","last_updated":"2025-09-10T06:32:49Z","snapshot_observed_at":"2026-08-15T18:17:20.123085Z","submitted_at":"2025-09-10T06:32:49Z","title":"EvolKV: Evolutionary KV Cache Compression for LLM Inference","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-04T20:53:30.115688Z"},"links":{"cited_paper":"/paper/2407.18003","citing_paper":"/paper/2509.08315"},"observation_digest":"sha256:cbc641b0b0f39f3ef122af46b8d4cafb8bba856a44773260349d1c3567b66498","observation_id":"64453fe3-4c28-4191-8b70-bc5a7136d4cb","resolution":{"observed_at":"2026-08-04T20:53:30.115688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.18003","last_updated":"2024-11-20T02:04:10Z","snapshot_observed_at":"2026-08-12T23:14:54.561199Z","submitted_at":"2024-07-25T12:56:22Z","title":"Keep the Cost Down: A Review on Methods to Optimize LLM' s KV-Cache Consumption","version":4},"cited_work":{"arxiv_id":"2407.18003","doi":"10.48550/arxiv.2407.18003","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.18003","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Keep the cost down: A review on methods to optimize llm’s kv-cache consumption","venue":"arXiv (Cornell University)","work_id":"45195b7c-36a4-4e3e-8f9e-db76070aec96","year":2024},"citing_paper":{"arxiv_id":"2509.21623","last_updated":"2026-04-16T21:29:54Z","snapshot_observed_at":"2026-08-14T12:21:00.182138Z","submitted_at":"2025-09-25T21:42:27Z","title":"OjaKV: Context-Aware Online Low-Rank KV Cache Compression","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-18T13:26:02.980973Z"},"links":{"cited_paper":"/paper/2407.18003","citing_paper":"/paper/2509.21623"},"observation_digest":"sha256:8823b2964904e6e61f66449b1416496831d65ff72d42fc2a4804246a8ac3f0a0","observation_id":"2eb1b009-0208-437c-85a3-eaf280a9a3db","resolution":{"observed_at":"2026-05-18T13:26:24.702813Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.18003","last_updated":"2024-11-20T02:04:10Z","snapshot_observed_at":"2026-08-12T23:14:54.561199Z","submitted_at":"2024-07-25T12:56:22Z","title":"Keep the Cost Down: A Review on Methods to Optimize LLM' s KV-Cache Consumption","version":4},"cited_work":{"arxiv_id":"2407.18003","doi":"10.48550/arxiv.2407.18003","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.18003","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Keep the cost down: A review on methods to optimize llm’s kv-cache consumption","venue":"arXiv (Cornell University)","work_id":"45195b7c-36a4-4e3e-8f9e-db76070aec96","year":2024},"citing_paper":{"arxiv_id":"2602.10718","last_updated":"2026-04-28T04:57:29Z","snapshot_observed_at":"2026-08-13T05:11:10.404748Z","submitted_at":"2026-02-11T10:24:42Z","title":"SnapMLA: Efficient Long-Context MLA Decoding via Hardware-Aware FP8 Quantized Pipelining","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-16T05:58:03.113220Z"},"links":{"cited_paper":"/paper/2407.18003","citing_paper":"/paper/2602.10718"},"observation_digest":"sha256:ca48f0185c5e4422ad14b30a10c063b83e63fd63e124adc276960487436b3f56","observation_id":"b21af5fd-a71a-4e57-a297-453a0d1f8cd8","resolution":{"observed_at":"2026-05-16T06:00:40.765255Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.18003","last_updated":"2024-11-20T02:04:10Z","snapshot_observed_at":"2026-08-12T23:14:54.561199Z","submitted_at":"2024-07-25T12:56:22Z","title":"Keep the Cost Down: A Review on Methods to Optimize LLM' s KV-Cache Consumption","version":4},"cited_work":{"arxiv_id":"2407.18003","doi":"10.48550/arxiv.2407.18003","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.18003","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Keep the cost down: A review on methods to optimize llm’s kv-cache consumption","venue":"arXiv (Cornell University)","work_id":"45195b7c-36a4-4e3e-8f9e-db76070aec96","year":2024},"citing_paper":{"arxiv_id":"2603.22910","last_updated":"2026-05-13T05:25:05Z","snapshot_observed_at":"2026-08-13T08:00:34.413924Z","submitted_at":"2026-03-24T07:58:42Z","title":"EchoKV: Efficient KV Cache Compression via Similarity-Based Reconstruction","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-15T01:09:07.983785Z"},"links":{"cited_paper":"/paper/2407.18003","citing_paper":"/paper/2603.22910"},"observation_digest":"sha256:eccb3d35ec392d7d16a0318624f11163c0f00c53f885f5be6724ee33bacd55e1","observation_id":"ef827935-40c0-4108-87f3-cef628ce9116","resolution":{"observed_at":"2026-05-15T01:09:36.990898Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.18003","last_updated":"2024-11-20T02:04:10Z","snapshot_observed_at":"2026-08-12T23:14:54.561199Z","submitted_at":"2024-07-25T12:56:22Z","title":"Keep the Cost Down: A Review on Methods to Optimize LLM' s KV-Cache Consumption","version":4},"cited_work":{"arxiv_id":"2407.18003","doi":"10.48550/arxiv.2407.18003","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.18003","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Keep the cost down: A review on methods to optimize llm’s kv-cache consumption","venue":"arXiv (Cornell University)","work_id":"45195b7c-36a4-4e3e-8f9e-db76070aec96","year":2024},"citing_paper":{"arxiv_id":"2604.04500","last_updated":"2026-04-06T07:51:59Z","snapshot_observed_at":"2026-08-13T02:16:47.977396Z","submitted_at":"2026-04-06T07:51:59Z","title":"Saliency-R1: Enforcing Interpretable and Faithful Vision-language Reasoning via Saliency-map Alignment Reward","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-10T19:59:19.379119Z"},"links":{"cited_paper":"/paper/2407.18003","citing_paper":"/paper/2604.04500"},"observation_digest":"sha256:0b87f803f6144ca6ef94f51847e99e6f03f4ce9cd3ab17735f94b0e75c40b2b3","observation_id":"f78f4f86-0f53-4092-a17d-fcd360ec2729","resolution":{"observed_at":"2026-05-10T22:20:47.770772Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.18003","last_updated":"2024-11-20T02:04:10Z","snapshot_observed_at":"2026-08-12T23:14:54.561199Z","submitted_at":"2024-07-25T12:56:22Z","title":"Keep the Cost Down: A Review on Methods to Optimize LLM' s KV-Cache Consumption","version":4},"cited_work":{"arxiv_id":"2407.18003","doi":"10.48550/arxiv.2407.18003","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.18003","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Keep the cost down: A review on methods to optimize llm’s kv-cache consumption","venue":"arXiv (Cornell University)","work_id":"45195b7c-36a4-4e3e-8f9e-db76070aec96","year":2024},"citing_paper":{"arxiv_id":"2604.04921","last_updated":"2026-04-06T17:58:42Z","snapshot_observed_at":"2026-08-12T23:14:44.419087Z","submitted_at":"2026-04-06T17:58:42Z","title":"TriAttention: Efficient Long Reasoning with Trigonometric KV Compression","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T19:55:45.739280Z"},"links":{"cited_paper":"/paper/2407.18003","citing_paper":"/paper/2604.04921"},"observation_digest":"sha256:e0d2e5335cb3a1500210cc398c77fe4d4faad4aceef7700da3cea2c09bf1bb7b","observation_id":"842f3199-2da6-41b7-be1e-3e9db7153cfb","resolution":{"observed_at":"2026-05-10T22:20:49.203487Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.18003","last_updated":"2024-11-20T02:04:10Z","snapshot_observed_at":"2026-08-12T23:14:54.561199Z","submitted_at":"2024-07-25T12:56:22Z","title":"Keep the Cost Down: A Review on Methods to Optimize LLM' s KV-Cache Consumption","version":4},"cited_work":{"arxiv_id":"2407.18003","doi":"10.48550/arxiv.2407.18003","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.18003","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Keep the cost down: A review on methods to optimize llm’s kv-cache consumption","venue":"arXiv (Cornell University)","work_id":"45195b7c-36a4-4e3e-8f9e-db76070aec96","year":2024},"citing_paper":{"arxiv_id":"2604.17935","last_updated":"2026-04-20T08:15:17Z","snapshot_observed_at":"2026-08-13T10:31:32.476266Z","submitted_at":"2026-04-20T08:15:17Z","title":"How Much Cache Does Reasoning Need? Depth-Cache Tradeoffs in KV-Compressed Transformers","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T05:17:52.344313Z"},"links":{"cited_paper":"/paper/2407.18003","citing_paper":"/paper/2604.17935"},"observation_digest":"sha256:64c4aa687593b973c8c7678951227138f1a1d605f80e6419c2344a720d2cabf3","observation_id":"5da7ee58-3e80-436a-8159-41aac99f4f6c","resolution":{"observed_at":"2026-05-10T09:28:39.191396Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.18003","last_updated":"2024-11-20T02:04:10Z","snapshot_observed_at":"2026-08-12T23:14:54.561199Z","submitted_at":"2024-07-25T12:56:22Z","title":"Keep the Cost Down: A Review on Methods to Optimize LLM' s KV-Cache Consumption","version":4},"cited_work":{"arxiv_id":"2407.18003","doi":"10.48550/arxiv.2407.18003","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.18003","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Keep the cost down: A review on methods to optimize llm’s kv-cache consumption","venue":"arXiv (Cornell University)","work_id":"45195b7c-36a4-4e3e-8f9e-db76070aec96","year":2024},"citing_paper":{"arxiv_id":"2604.25975","last_updated":"2026-08-10T08:59:48Z","snapshot_observed_at":"2026-08-13T23:39:00.094820Z","submitted_at":"2026-04-28T12:28:04Z","title":"Rethinking KV Cache Eviction via a Unified Information-Theoretic Objective","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-07T16:41:23.234607Z"},"links":{"cited_paper":"/paper/2407.18003","citing_paper":"/paper/2604.25975"},"observation_digest":"sha256:1ca47e8904e3f91ab5ca89f3361e2c307b150d67de689f90cba5429a6ab932c6","observation_id":"8dce6e59-b5f3-4860-ba32-eb1112d25229","resolution":{"observed_at":"2026-05-09T01:54:34.032488Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.18003","last_updated":"2024-11-20T02:04:10Z","snapshot_observed_at":"2026-08-12T23:14:54.561199Z","submitted_at":"2024-07-25T12:56:22Z","title":"Keep the Cost Down: A Review on Methods to Optimize LLM' s KV-Cache Consumption","version":4},"cited_work":{"arxiv_id":"2407.18003","doi":"10.48550/arxiv.2407.18003","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.18003","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Keep the cost down: A review on methods to optimize llm’s kv-cache consumption","venue":"arXiv (Cornell University)","work_id":"45195b7c-36a4-4e3e-8f9e-db76070aec96","year":2024},"citing_paper":{"arxiv_id":"2605.04901","last_updated":"2026-05-06T13:31:15Z","snapshot_observed_at":"2026-08-13T01:01:31.154592Z","submitted_at":"2026-05-06T13:31:15Z","title":"On the (In-)Security of the Shuffling Defense in the Transformer Secure Inference","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-08T17:24:04.123827Z"},"links":{"cited_paper":"/paper/2407.18003","citing_paper":"/paper/2605.04901"},"observation_digest":"sha256:06ef5b20aac51fd8ef35ef382b05e58af22411761275a97956bb3170ffd140bc","observation_id":"2b58e1d1-177a-4766-91d7-f114ac55f69b","resolution":{"observed_at":"2026-05-11T17:36:06.555949Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.18003","last_updated":"2024-11-20T02:04:10Z","snapshot_observed_at":"2026-08-12T23:14:54.561199Z","submitted_at":"2024-07-25T12:56:22Z","title":"Keep the Cost Down: A Review on Methods to Optimize LLM' s KV-Cache Consumption","version":4},"cited_work":{"arxiv_id":"2407.18003","doi":"10.48550/arxiv.2407.18003","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.18003","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Keep the cost down: A review on methods to optimize llm’s kv-cache consumption","venue":"arXiv (Cornell University)","work_id":"45195b7c-36a4-4e3e-8f9e-db76070aec96","year":2024},"citing_paper":{"arxiv_id":"2605.06165","last_updated":"2026-05-07T12:51:49Z","snapshot_observed_at":"2026-07-06T23:18:41.400741Z","submitted_at":"2026-05-07T12:51:49Z","title":"Post Reasoning: Improving the Performance of Non-Thinking Models at No Cost","version":1},"reference_index":168,"source":"arxiv_source","source_observed_at":"2026-05-08T10:19:08.451445Z"},"links":{"cited_paper":"/paper/2407.18003","citing_paper":"/paper/2605.06165"},"observation_digest":"sha256:7360decfd8cd34b5b5514550de6e460eae68b46c31fd71a6e313e8b5bb81e7da","observation_id":"2d31888f-da9b-495c-a3fa-7b03b3942266","resolution":{"observed_at":"2026-05-11T20:06:09.876717Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.18003","last_updated":"2024-11-20T02:04:10Z","snapshot_observed_at":"2026-08-12T23:14:54.561199Z","submitted_at":"2024-07-25T12:56:22Z","title":"Keep the Cost Down: A Review on Methods to Optimize LLM' s KV-Cache Consumption","version":4},"cited_work":{"arxiv_id":"2407.18003","doi":"10.48550/arxiv.2407.18003","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.18003","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Keep the cost down: A review on methods to optimize llm’s kv-cache consumption","venue":"arXiv (Cornell University)","work_id":"45195b7c-36a4-4e3e-8f9e-db76070aec96","year":2024},"citing_paper":{"arxiv_id":"2605.11516","last_updated":"2026-05-12T04:39:34Z","snapshot_observed_at":"2026-08-09T05:02:16.835456Z","submitted_at":"2026-05-12T04:39:34Z","title":"Agents Should Replace Narrow Predictive AI as the Orchestrator in 6G AI-RAN","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-13T02:12:21.409833Z"},"links":{"cited_paper":"/paper/2407.18003","citing_paper":"/paper/2605.11516"},"observation_digest":"sha256:a3675e494d2614e8a6007b8db26cf35b1a24d81c1694308ed0356cfb3bc968b1","observation_id":"7804a3b1-2b9e-4312-924b-2cf77aa08c07","resolution":{"observed_at":"2026-05-13T02:17:06.969873Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.18003","last_updated":"2024-11-20T02:04:10Z","snapshot_observed_at":"2026-08-12T23:14:54.561199Z","submitted_at":"2024-07-25T12:56:22Z","title":"Keep the Cost Down: A Review on Methods to Optimize LLM' s KV-Cache Consumption","version":4},"cited_work":{"arxiv_id":"2407.18003","doi":"10.48550/arxiv.2407.18003","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.18003","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Keep the cost down: A review on methods to optimize llm’s kv-cache consumption","venue":"arXiv (Cornell University)","work_id":"45195b7c-36a4-4e3e-8f9e-db76070aec96","year":2024},"citing_paper":{"arxiv_id":"2606.00620","last_updated":"2026-05-30T08:51:28Z","snapshot_observed_at":"2026-07-06T23:41:19.955034Z","submitted_at":"2026-05-30T08:51:28Z","title":"FlowNar: Scalable Streaming Narration for Long-Form Videos","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-28T19:08:36.655886Z"},"links":{"cited_paper":"/paper/2407.18003","citing_paper":"/paper/2606.00620"},"observation_digest":"sha256:20889342e64acfad862c71da299c5f6211920b36ed388e6935601b4f10f470a1","observation_id":"444c5df5-e6c5-478e-b03c-62bc57f60cfa","resolution":{"observed_at":"2026-06-28T19:12:34.742615Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.18003","last_updated":"2024-11-20T02:04:10Z","snapshot_observed_at":"2026-08-12T23:14:54.561199Z","submitted_at":"2024-07-25T12:56:22Z","title":"Keep the Cost Down: A Review on Methods to Optimize LLM' s KV-Cache Consumption","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.18003","snapshot_observed_at":"2026-07-14T06:16:09.070414Z","title":"arXiv preprint arXiv:2407.18003 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11211","last_updated":"2026-07-13T08:02:26Z","snapshot_observed_at":"2026-08-14T15:47:03.358754Z","submitted_at":"2026-07-13T08:02:26Z","title":"FastTPS: An Optimized Method for LLM Token Phase for AI accelerators","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-07-14T06:16:09.070414Z"},"links":{"cited_paper":"/paper/2407.18003","citing_paper":"/paper/2607.11211"},"observation_digest":"sha256:01f413249ebf50878d2314eb76777dc32e211172c1db2e839cd6a7648ae2133b","observation_id":"95bdb966-0c58-4681-837b-d792a80376a8","resolution":{"observed_at":"2026-07-14T06:16:09.070414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.18003","last_updated":"2024-11-20T02:04:10Z","snapshot_observed_at":"2026-08-12T23:14:54.561199Z","submitted_at":"2024-07-25T12:56:22Z","title":"Keep the Cost Down: A Review on Methods to Optimize LLM' s KV-Cache Consumption","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.18003","snapshot_observed_at":"2026-08-12T00:50:51.051073Z","title":"arXiv preprint arXiv:2407.18003 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07855","last_updated":"2026-08-08T01:50:55Z","snapshot_observed_at":"2026-08-13T23:21:37.017678Z","submitted_at":"2026-08-08T01:50:55Z","title":"CommitKV: Lifecycle-Aware KV Cache Compression via Commit Transitions for Multi-Turn Agents","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-12T00:50:51.051073Z"},"links":{"cited_paper":"/paper/2407.18003","citing_paper":"/paper/2608.07855"},"observation_digest":"sha256:2b718635ba4eea98a65a0af4a2a90446bfb102bd59110a77167b1125b6fc68e6","observation_id":"6c6b5074-bdbc-4779-8613-04ebeaf226a6","resolution":{"observed_at":"2026-08-12T00:50:51.051073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.18003","last_updated":"2024-11-20T02:04:10Z","snapshot_observed_at":"2026-08-12T23:14:54.561199Z","submitted_at":"2024-07-25T12:56:22Z","title":"Keep the Cost Down: A Review on Methods to Optimize LLM' s KV-Cache Consumption","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.18003","snapshot_observed_at":"2026-08-11T17:52:00.794462Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09412","last_updated":"2026-08-10T10:38:05Z","snapshot_observed_at":"2026-08-16T00:24:02.355443Z","submitted_at":"2026-08-10T10:38:05Z","title":"KVDiagnosis: A Diagnostic Benchmark for KV-Cache Compression in Long-Context Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T17:52:00.794462Z"},"links":{"cited_paper":"/paper/2407.18003","citing_paper":"/paper/2608.09412"},"observation_digest":"sha256:2cb22e7182ea6109d99672eaa0b18bf2214cda11ac7432f5cf8b13de408271ca","observation_id":"7f9d27ab-a6ec-4cb4-b4e3-a59308de6cc1","resolution":{"observed_at":"2026-08-11T17:52:00.794462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2407.18003/citation-record","integrity":"/paper/2407.18003/integrity","json":"/paper/2407.18003/citation-record.json","paper":"/paper/2407.18003"},"outbound":[],"paper":{"arxiv_id":"2407.18003","last_updated":"2024-11-20T02:04:10Z","latest_version":4,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-12T23:14:54.561199Z","submitted_at":"2024-07-25T12:56:22Z","title":"Keep the Cost Down: A Review on Methods to Optimize LLM' s KV-Cache Consumption"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 35 inbound Pith citation observations for arXiv:2407.18003."}