{"as_of":"2026-08-22T08:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:aff580f7fd0ff861befdd76aead85a121058cdede3e2fb9899689c181cd889b7","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":91,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":91,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":91,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":91,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T23:01:20.089202Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":9,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":"2401.18079","doi":"10.48550/arxiv.2401.18079","metadata_source":"pith","pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mahoney, Yakun Sophia Shao, Kurt Keutzer, and Amir Gholami","venue":"cs.LG","work_id":"f8884df2-70de-43af-832d-ca9ba2eab327","year":2024},"citing_paper":{"arxiv_id":"2312.05821","last_updated":"2025-08-28T03:57:52Z","snapshot_observed_at":"2026-08-16T15:03:40.750477Z","submitted_at":"2023-12-10T08:41:24Z","title":"ASVD: Activation-aware Singular Value Decomposition for Compressing Large Language Models","version":5},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-20T13:49:33.747672Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2312.05821"},"observation_digest":"sha256:63b207c2327f792112810c4ed45b1c0d6a5bb1c3633d46fdc189f4fa18bbe337","observation_id":"49358396-5a24-42bf-a26e-8110a97c2a08","resolution":{"observed_at":"2026-05-20T13:49:33.837276Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":"2401.18079","doi":"10.48550/arxiv.2401.18079","metadata_source":"pith","pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mahoney, Yakun Sophia Shao, Kurt Keutzer, and Amir Gholami","venue":"cs.LG","work_id":"f8884df2-70de-43af-832d-ca9ba2eab327","year":2024},"citing_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-08-18T16:18:58.765617Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-12T08:20:01.011625Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2312.07104"},"observation_digest":"sha256:93d951ae1a6320a2c21a404c585401207d16a82ba1928ad5dc92a02f758313a4","observation_id":"f0ce2c05-fd48-4cd7-8700-7480987707f1","resolution":{"observed_at":"2026-05-12T08:20:01.106533Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":"2401.18079","doi":"10.48550/arxiv.2401.18079","metadata_source":"pith","pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mahoney, Yakun Sophia Shao, Kurt Keutzer, and Amir Gholami","venue":"cs.LG","work_id":"f8884df2-70de-43af-832d-ca9ba2eab327","year":2024},"citing_paper":{"arxiv_id":"2402.02750","last_updated":"2024-07-25T09:16:05Z","snapshot_observed_at":"2026-08-12T17:03:50.984887Z","submitted_at":"2024-02-05T06:06:47Z","title":"KIVI: A Tuning-Free Asymmetric 2bit Quantization for KV Cache","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-12T08:53:12.253243Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2402.02750"},"observation_digest":"sha256:29a79ee3ed7a26577850e37e937c1c8c5d320e0925e0ed7bd6c0a1d4566b3f96","observation_id":"1d83d1f5-4133-4531-ba96-1b93e15fbeb0","resolution":{"observed_at":"2026-05-12T08:53:12.320304Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":"2401.18079","doi":"10.48550/arxiv.2401.18079","metadata_source":"pith","pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mahoney, Yakun Sophia Shao, Kurt Keutzer, and Amir Gholami","venue":"cs.LG","work_id":"f8884df2-70de-43af-832d-ca9ba2eab327","year":2024},"citing_paper":{"arxiv_id":"2404.14294","last_updated":"2024-07-19T04:47:36Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T15:53:08Z","title":"A Survey on Efficient Inference for Large Language Models","version":3},"reference_index":219,"source":"pdf_text","source_observed_at":"2026-05-15T02:39:33.007894Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2404.14294"},"observation_digest":"sha256:7c4cec07d0c6f050772cf443c77d723885663c00cb4a5f82a72dd328e30f1ad1","observation_id":"8d622d52-b7d1-44e9-8a56-00fc999812ca","resolution":{"observed_at":"2026-05-15T02:39:33.280738Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":"2401.18079","doi":"10.48550/arxiv.2401.18079","metadata_source":"pith","pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mahoney, Yakun Sophia Shao, Kurt Keutzer, and Amir Gholami","venue":"cs.LG","work_id":"f8884df2-70de-43af-832d-ca9ba2eab327","year":2024},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:0220304a5a78a9a4f5200c36572c64b2768e99d954283265c328051cbc6d300b","observation_id":"b6d19c84-6bc0-4145-8471-c17e03e40217","resolution":{"observed_at":"2026-05-11T05:36:26.480168Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":"2401.18079","doi":"10.48550/arxiv.2401.18079","metadata_source":"pith","pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mahoney, Yakun Sophia Shao, Kurt Keutzer, and Amir Gholami","venue":"cs.LG","work_id":"f8884df2-70de-43af-832d-ca9ba2eab327","year":2024},"citing_paper":{"arxiv_id":"2407.08608","last_updated":"2024-07-12T22:15:02Z","snapshot_observed_at":"2026-08-21T17:06:41.051723Z","submitted_at":"2024-07-11T15:44:48Z","title":"FlashAttention-3: Fast and Accurate Attention with Asynchrony and Low-precision","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-20T19:45:36.337956Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2407.08608"},"observation_digest":"sha256:93a317f0169f881ba675e499cfa00badb2ee8b81fcfdb902e49f9d13e735ea51","observation_id":"b8ca3e16-9a01-4171-917a-ef22f8c98e96","resolution":{"observed_at":"2026-05-20T19:45:36.452789Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-12T13:46:01.037498Z","title":"Kvquant: Towards 10 million context length llm inference with kv cache quantization,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15982","last_updated":"2024-11-24T20:59:39Z","snapshot_observed_at":"2026-08-17T16:14:51.641279Z","submitted_at":"2024-11-24T20:59:39Z","title":"Anda: Unlocking Efficient LLM Inference with a Variable-Length Grouped Activation Data Format","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T13:46:01.037498Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2411.15982"},"observation_digest":"sha256:f2693c9f477c1bb074d1594cdb10864921e267faabc3d4d1d59d90ea209e6bff","observation_id":"e31e43a2-f16c-464b-a096-57ffd31fb592","resolution":{"observed_at":"2026-08-12T13:46:01.037498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-12T12:13:55.213100Z","title":"W., Shao, Y","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17426","last_updated":"2025-01-31T14:13:49Z","snapshot_observed_at":"2026-08-19T07:19:32.477239Z","submitted_at":"2024-11-26T13:34:02Z","title":"CLOVER: Cross-Layer Orthogonal Vectors Pruning and Fine-Tuning","version":3},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:55.213100Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2411.17426"},"observation_digest":"sha256:98c46fb6c4f0790249b6f822a47e8fe96c63cd790335ab50e6b1800e69086896","observation_id":"6070763a-9f62-4b58-96cd-0a12f6c51a35","resolution":{"observed_at":"2026-08-12T12:13:55.213100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-12T11:57:23.547196Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17651","last_updated":"2025-04-29T20:48:45Z","snapshot_observed_at":"2026-08-22T05:36:58.624199Z","submitted_at":"2024-11-26T18:16:56Z","title":"APEX: An Extensible and Dynamism-Aware Simulator for Automated Parallel Execution in LLM Serving","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:23.547196Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2411.17651"},"observation_digest":"sha256:8eb98695f462360e724daf3479979a873a5dc186ff55b2176cb93c7f9d2b7228","observation_id":"2960792d-8304-48a2-8529-904342be526d","resolution":{"observed_at":"2026-08-12T11:57:23.547196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-12T11:37:07.577744Z","title":"Mahoney, Yakun Sophia Shao, Kurt Keutzer, and Amir Gholami","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18077","last_updated":"2025-06-08T21:23:22Z","snapshot_observed_at":"2026-08-15T19:30:15.609643Z","submitted_at":"2024-11-27T06:10:49Z","title":"MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-12T11:37:07.577744Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2411.18077"},"observation_digest":"sha256:d53e0862151f57420e2c2d9c94ae6d54b0ac94db662801cb593023c51d8bce60","observation_id":"4cf2ff58-02f5-4c4c-91b4-2c10cc73130d","resolution":{"observed_at":"2026-08-12T11:37:07.577744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-12T05:10:44.300444Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00714","last_updated":"2024-12-01T07:27:20Z","snapshot_observed_at":"2026-08-19T12:40:18.769960Z","submitted_at":"2024-12-01T07:27:20Z","title":"Scaling New Frontiers: Insights into Large Recommendation Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T05:10:44.300444Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2412.00714"},"observation_digest":"sha256:c319f68d656fc4f2d6fd70ea71345a5a83f8bd58118261834e0ed09225b0c035","observation_id":"9b52e2c3-d4b1-4afa-9cdf-4999171ba5d8","resolution":{"observed_at":"2026-08-12T05:10:44.300444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-11T22:51:12.078529Z","title":"W., SHAO, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03131","last_updated":"2025-08-30T09:35:22Z","snapshot_observed_at":"2026-08-19T07:15:48.973648Z","submitted_at":"2024-12-04T08:51:23Z","title":"DiffKV: Differentiated Memory Management for Large Language Models with Parallel KV Compaction","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T22:51:12.078529Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2412.03131"},"observation_digest":"sha256:9e1deb976added72abc6a76e90b4f01cf2f18ffbf5f08eba2757dfd24ceb0e7e","observation_id":"c18c02e2-eb94-4759-aa0c-59bbb2876a97","resolution":{"observed_at":"2026-08-11T22:51:12.078529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-11T20:18:18.267468Z","title":"Kvquant: Towards 10 million context length llm inference with kv cache quantization,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.05896","last_updated":"2024-12-08T11:32:08Z","snapshot_observed_at":"2026-08-14T18:25:06.915616Z","submitted_at":"2024-12-08T11:32:08Z","title":"XKV: Personalized KV Cache Memory Reduction for Long-Context LLM Inference","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T20:18:18.267468Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2412.05896"},"observation_digest":"sha256:acd1ed4f967162121f6e28d25a72c2782286916fbbc9f968d711445c3295be4d","observation_id":"f1f659a8-005c-48d9-b736-fb859617fdb4","resolution":{"observed_at":"2026-08-11T20:18:18.267468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-11T17:32:39.947554Z","title":"Coleman Hooper, Sehoon Kim, Hiva Mohammadzadeh, Michael W Mahoney, Yakun Sophia Shao, Kurt Keutzer, and Amir Gholami","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08890","last_updated":"2024-12-12T03:00:29Z","snapshot_observed_at":"2026-08-14T16:44:06.126162Z","submitted_at":"2024-12-12T03:00:29Z","title":"Lexico: Extreme KV Cache Compression via Sparse Coding over Universal Dictionaries","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T17:32:39.947554Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2412.08890"},"observation_digest":"sha256:3510d05c4c8c4b21ae9410c398077578e6ed4a6bb7c0d675da50ff064555c198","observation_id":"ad012494-5137-4507-bdda-9643a54b41c4","resolution":{"observed_at":"2026-08-11T17:32:39.947554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-11T14:43:53.736238Z","title":"ArXiv, abs/2401.18079","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11741","last_updated":"2024-12-16T13:01:53Z","snapshot_observed_at":"2026-08-16T10:05:25.610271Z","submitted_at":"2024-12-16T13:01:53Z","title":"CSR:Achieving 1 Bit Key-Value Cache via Sparse Representation","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-11T14:43:53.736238Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2412.11741"},"observation_digest":"sha256:5a5fef0342ed647bd62ec338e494d3bdd8395d66860275ce13e050dbf3c5f110","observation_id":"c0a4b25d-8ab6-4d48-a875-382b2a14a53b","resolution":{"observed_at":"2026-08-11T14:43:53.736238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-11T13:52:48.686945Z","title":"Mahoney, Yakun Sophia Shao, Kurt Keutzer, and Amir Gholami","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12706","last_updated":"2025-02-20T12:14:49Z","snapshot_observed_at":"2026-08-13T11:09:26.001382Z","submitted_at":"2024-12-17T09:20:31Z","title":"More Tokens, Lower Precision: Towards the Optimal Token-Precision Trade-off in KV Cache Compression","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T13:52:48.686945Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2412.12706"},"observation_digest":"sha256:35aea86f152344d725335c47e0043ab74be8edaffcddb211f8868f69ad4f4ad0","observation_id":"3535e96e-a105-4684-b7c5-8b957cf300b8","resolution":{"observed_at":"2026-08-11T13:52:48.686945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-11T12:22:38.838579Z","title":"W., Shao, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-19T18:32:49.529736Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.838579Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:5e97d7fd0d9c7ca7247ccd151ccd4efa1d7662b0e10e43b479564ebb1eb02d68","observation_id":"6aab0856-dddc-441b-bce0-76553e2988e1","resolution":{"observed_at":"2026-08-11T12:22:38.838579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-11T11:57:17.920808Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14838","last_updated":"2025-05-27T03:08:57Z","snapshot_observed_at":"2026-08-21T02:11:05.377768Z","submitted_at":"2024-12-19T13:28:42Z","title":"DynamicKV: Task-Aware Adaptive KV Cache Compression for Long Context LLMs","version":4},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T11:57:17.920808Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2412.14838"},"observation_digest":"sha256:f0c780d46bd8ba9d8e21b60e990286dbcbcff33133e2afc06ee49776194e919f","observation_id":"dcde423f-c079-4156-aff8-96a24c3c45aa","resolution":{"observed_at":"2026-08-11T11:57:17.920808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-11T16:43:44.162332Z","title":"Kvquant: Towards 10 million context length llm inference with kv cache quantization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16187","last_updated":"2025-06-04T22:37:29Z","snapshot_observed_at":"2026-08-17T10:50:44.790763Z","submitted_at":"2024-12-13T06:00:27Z","title":"HashEvict: A Pre-Attention KV Cache Eviction Strategy using Locality-Sensitive Hashing","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T16:43:44.162332Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2412.16187"},"observation_digest":"sha256:4f81cf3b3baa74c881a7db3db79636f5c9427f36f0946057a7d07368ca8d2c97","observation_id":"66bd7130-778b-4b9b-b5f9-bb1cb30f5782","resolution":{"observed_at":"2026-08-11T16:43:44.162332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-11T00:38:47.289879Z","title":"Kvquant: Towards 10 million context length llm inference with kv cache quantization,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19442","last_updated":"2025-07-30T05:24:46Z","snapshot_observed_at":"2026-08-20T14:01:46.841630Z","submitted_at":"2024-12-27T04:17:57Z","title":"A Survey on Large Language Model Acceleration based on KV Cache Management","version":3},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-11T00:38:47.289879Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2412.19442"},"observation_digest":"sha256:7eb37ce54f25322af8fc8b5c541929ebb4bdd50ac9a3773f00985bf7898574e0","observation_id":"cd871bcf-fddd-495a-a514-daf8f60c2f4b","resolution":{"observed_at":"2026-08-11T00:38:47.289879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-10T22:44:30.120356Z","title":"W., Shao, Y","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01144","last_updated":"2025-07-24T03:46:03Z","snapshot_observed_at":"2026-08-18T02:48:06.805374Z","submitted_at":"2025-01-02T08:57:00Z","title":"BlockDialect: Block-wise Fine-grained Mixed Format Quantization for Energy-Efficient LLM Inference","version":5},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.120356Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2501.01144"},"observation_digest":"sha256:3cc6a45ecda24be25310c9f1fbddda461f8edcacc0b6ffd7f5bb608126744b10","observation_id":"e256fefb-690f-4ec1-9063-af310016def5","resolution":{"observed_at":"2026-08-10T22:44:30.120356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-10T16:19:57.440237Z","title":"W., Shao, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13331","last_updated":"2025-02-05T08:10:45Z","snapshot_observed_at":"2026-08-11T03:03:57.665652Z","submitted_at":"2025-01-23T02:20:08Z","title":"Qrazor: Reliable and Effortless 4-bit LLM Quantization by Significant Data Razoring","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-10T16:19:57.440237Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2501.13331"},"observation_digest":"sha256:bd984e190540ec27b9070b7f8fe56c53059e675ac3e90930a20eecd4284fd1cf","observation_id":"bc330e45-6dd7-4f4d-b307-5b56cc54e84d","resolution":{"observed_at":"2026-08-10T16:19:57.440237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-11T15:56:14.581366Z","title":"Kvquant: Towards 10 million context length llm inference with kv cache quantization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.14743","last_updated":"2024-12-13T21:54:16Z","snapshot_observed_at":"2026-08-15T04:43:16.853454Z","submitted_at":"2024-12-13T21:54:16Z","title":"KVDirect: Distributed Disaggregated LLM Inference","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:14.581366Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2501.14743"},"observation_digest":"sha256:7d3bad19dd872c2d5075e924328ddc67802a848114c68c2509b04050666d2da2","observation_id":"75a3079e-0cc1-4050-8109-c0aa5f96f701","resolution":{"observed_at":"2026-08-11T15:56:14.581366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-10T14:46:02.636154Z","title":"Kvquant: Towards 10 million context length llm inference with kv cache quantization,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15021","last_updated":"2025-01-25T02:01:56Z","snapshot_observed_at":"2026-08-20T08:47:06.313589Z","submitted_at":"2025-01-25T02:01:56Z","title":"AKVQ-VL: Attention-Aware KV Cache Adaptive 2-Bit Quantization for Vision-Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T14:46:02.636154Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2501.15021"},"observation_digest":"sha256:59534476df1b24b4d485e43561f10c4e1362148a159ce78a3d6b7e194fd67e00","observation_id":"e98dbfdb-7b16-4efd-8aca-1176e80b66db","resolution":{"observed_at":"2026-08-10T14:46:02.636154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-10T14:54:22.656654Z","title":"Kvquant: To- wards 10 million context length llm inference with kv cache quantization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.16383","last_updated":"2025-02-02T03:04:54Z","snapshot_observed_at":"2026-08-18T23:10:12.488042Z","submitted_at":"2025-01-25T01:45:29Z","title":"RotateKV: Accurate and Robust 2-Bit KV Cache Quantization for LLMs via Outlier-Aware Adaptive Rotations","version":2},"reference_index":1978,"source":"pdf_text","source_observed_at":"2026-08-10T14:54:22.656654Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2501.16383"},"observation_digest":"sha256:affee5f3fa7dddfad7d6f711c3fbc06f9ead7f3b13e8c7b1d1314ede4d0d4821","observation_id":"f0bef686-892a-42fb-bace-ec0f75292a9d","resolution":{"observed_at":"2026-08-10T14:54:22.656654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-09T20:34:01.238595Z","title":"W., Shao, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.19392","last_updated":"2025-02-28T18:04:52Z","snapshot_observed_at":"2026-08-18T16:52:20.903874Z","submitted_at":"2025-01-31T18:47:42Z","title":"Cache Me If You Must: Adaptive Key-Value Quantization for Large Language Models","version":4},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.238595Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2501.19392"},"observation_digest":"sha256:d9de7a03588af9805f4e8442f0129910d5ef91e8b6d9f398bb52a4a92d07883c","observation_id":"63704b6d-d0da-4d2f-9966-e36b374e5998","resolution":{"observed_at":"2026-08-09T20:34:01.238595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-09T18:46:51.063278Z","title":"Mahoney, Yakun Sophia Shao, Kurt Keutzer, and Amir Gholami","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00527","last_updated":"2026-06-05T09:55:33Z","snapshot_observed_at":"2026-08-15T03:05:40.898471Z","submitted_at":"2025-02-01T18:59:03Z","title":"PolarQuant: Leveraging Polar Transformation for Efficient Key Cache Quantization and Decoding Acceleration","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-09T18:46:51.063278Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2502.00527"},"observation_digest":"sha256:1b7a53defbf5be5a49678ccd2fc346da753d63510985d1c619cc7a9d90c44155","observation_id":"0e95d2d7-7b5f-448a-98e9-7cc2b1147221","resolution":{"observed_at":"2026-08-09T18:46:51.063278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-09T13:26:55.377329Z","title":"W., Shao, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02617","last_updated":"2025-02-04T08:52:13Z","snapshot_observed_at":"2026-08-15T21:58:34.589761Z","submitted_at":"2025-02-04T08:52:13Z","title":"PolarQuant: Quantizing KV Caches with Polar Transformation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-09T13:26:55.377329Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2502.02617"},"observation_digest":"sha256:35c1c08fef393a736311ad509562ce5ff0ce217e796a5ba145ae63c8eefe37a4","observation_id":"0d86c255-4a62-48c3-adae-804db6dd5993","resolution":{"observed_at":"2026-08-09T13:26:55.377329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-09T00:45:56.852280Z","title":"W., Shao, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.03805","last_updated":"2026-05-28T09:11:35Z","snapshot_observed_at":"2026-08-17T23:09:00.351462Z","submitted_at":"2025-02-06T06:31:47Z","title":"CriticalKV: Optimizing KV Cache Eviction from an Output Perturbation Perspective","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-09T00:45:56.852280Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2502.03805"},"observation_digest":"sha256:10bfb3650782879edd16c8e981658682fb736977e93539054f0003f74d1fd2bf","observation_id":"457f745f-79a5-4965-b2cb-17a66955aeb7","resolution":{"observed_at":"2026-08-09T00:45:56.852280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-08T15:37:37.470136Z","title":"Kvquant: Towards 10 million context length llm inference with kv cache quantization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06415","last_updated":"2025-02-26T01:59:40Z","snapshot_observed_at":"2026-08-21T00:01:44.532342Z","submitted_at":"2025-02-10T12:54:17Z","title":"Systematic Outliers in Large Language Models","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-08T15:37:37.470136Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2502.06415"},"observation_digest":"sha256:bffa91dab654fa319ec36264fcb8f8c1b83039b7f3ffde26b9890e1207840422","observation_id":"9fe47305-c1fb-4cdd-a013-2f6bdd13060f","resolution":{"observed_at":"2026-08-08T15:37:37.470136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-08T14:48:53.780997Z","title":"W., Shao, Y","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06663","last_updated":"2025-02-11T19:01:39Z","snapshot_observed_at":"2026-08-19T01:12:28.922658Z","submitted_at":"2025-02-10T16:51:03Z","title":"EfficientLLM: Scalable Pruning-Aware Pretraining for Architecture-Agnostic Edge Language Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T14:48:53.780997Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2502.06663"},"observation_digest":"sha256:9d653b499c22f0d784a2b68126be931fbc7dd721646ece5c0e943c4b705ab5a9","observation_id":"ecda896b-6e75-443b-8092-fc93d81d32bc","resolution":{"observed_at":"2026-08-08T14:48:53.780997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-08T14:13:38.095954Z","title":"W., Shao, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06975","last_updated":"2025-02-10T19:14:51Z","snapshot_observed_at":"2026-08-14T08:32:12.525435Z","submitted_at":"2025-02-10T19:14:51Z","title":"Position: Episodic Memory is the Missing Piece for Long-Term LLM Agents","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-08T14:13:38.095954Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2502.06975"},"observation_digest":"sha256:2f7a6027ab23f1dfe1d93d2fffd59fe20e4f9803b0e272c52d5ce6b9291081ab","observation_id":"2dbfab0e-01dd-4f32-8e8e-538cd0110b33","resolution":{"observed_at":"2026-08-08T14:13:38.095954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-07T23:19:37.838100Z","title":"W., Shao, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08910","last_updated":"2025-02-13T02:52:01Z","snapshot_observed_at":"2026-08-17T18:25:45.737890Z","submitted_at":"2025-02-13T02:52:01Z","title":"InfiniteHiP: Extending Language Model Context Up to 3 Million Tokens on a Single GPU","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T23:19:37.838100Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2502.08910"},"observation_digest":"sha256:f5673e8160debc570fea5d3c66d0f920fa7d9fa4b777736d850ba25b4ef9bf68","observation_id":"238d4a53-ec19-4a44-95f3-f91b2843baa0","resolution":{"observed_at":"2026-08-07T23:19:37.838100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-09T05:40:21.484068Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.15734","last_updated":"2025-02-05T14:12:33Z","snapshot_observed_at":"2026-08-16T23:34:31.397891Z","submitted_at":"2025-02-05T14:12:33Z","title":"Cache-Craft: Managing Chunk-Caches for Efficient Retrieval-Augmented Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-09T05:40:21.484068Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2502.15734"},"observation_digest":"sha256:ad3447f8f058813df4862df50fac84a443e2b55f909ec004a8bc526fa74c2fce","observation_id":"e846879e-f25e-4d65-aa78-a5774b046e17","resolution":{"observed_at":"2026-08-09T05:40:21.484068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":"2401.18079","doi":"10.48550/arxiv.2401.18079","metadata_source":"pith","pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mahoney, Yakun Sophia Shao, Kurt Keutzer, and Amir Gholami","venue":"cs.LG","work_id":"f8884df2-70de-43af-832d-ca9ba2eab327","year":2024},"citing_paper":{"arxiv_id":"2504.19874","last_updated":"2025-04-28T15:05:35Z","snapshot_observed_at":"2026-08-21T15:16:21.985758Z","submitted_at":"2025-04-28T15:05:35Z","title":"TurboQuant: Online Vector Quantization with Near-optimal Distortion Rate","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-20T08:09:22.226608Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2504.19874"},"observation_digest":"sha256:48da4b25d2b21a5f4782587946cdf9bb562d51af94949e472098504a8da2e21a","observation_id":"7b6d9095-11a4-4ee2-aac3-bd77a67b6b77","resolution":{"observed_at":"2026-05-20T08:09:22.397439Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-15T23:01:20.089202Z","title":"W., Shao, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05799","last_updated":"2025-05-09T05:32:21Z","snapshot_observed_at":"2026-08-22T01:16:41.956202Z","submitted_at":"2025-05-09T05:32:21Z","title":"MxMoE: Mixed-precision Quantization for MoE with Accuracy and Performance Co-Design","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T23:01:20.089202Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2505.05799"},"observation_digest":"sha256:fe3a4385aa213b551ed92a264d926defb58f7045788f840df86b073e9e203c79","observation_id":"e648adde-0231-4344-914a-9972409ac979","resolution":{"observed_at":"2026-08-15T23:01:20.089202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-15T22:36:42.257055Z","title":"Mahoney, Yakun Sophia Shao, Kurt Keutzer, and Amir Gholami","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.06901","last_updated":"2025-05-11T08:44:31Z","snapshot_observed_at":"2026-08-20T10:11:43.716668Z","submitted_at":"2025-05-11T08:44:31Z","title":"Ecco: Improving Memory Bandwidth and Capacity for LLMs via Entropy-aware Cache Compression","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T22:36:42.257055Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2505.06901"},"observation_digest":"sha256:708b2ee8366c9f2b3fffb06d81cddecb19579cbeaa86a31b240695340f9bb952","observation_id":"1bc47a00-7d92-4512-be9c-e6aea921184b","resolution":{"observed_at":"2026-08-15T22:36:42.257055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-15T22:27:53.540334Z","title":"Kvquant: Towards 10 million context length llm inference with kv cache quanti- zation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07203","last_updated":"2025-05-12T03:22:29Z","snapshot_observed_at":"2026-08-15T22:20:20.959357Z","submitted_at":"2025-05-12T03:22:29Z","title":"PrefillOnly: An Inference Engine for Prefill-only Workloads in Large Language Model Applications","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T22:27:53.540334Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2505.07203"},"observation_digest":"sha256:05062f25a89bafa77c13049cf6d688f9f73c7de725d7ad309d69b2cc2ea25ee2","observation_id":"070ec353-da31-46bf-9097-ec604a14edf7","resolution":{"observed_at":"2026-08-15T22:27:53.540334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-15T20:54:59.293772Z","title":"Kvquant: Towards 10 million context length llm inference with kv cache quantization.arXiv preprint arXiv:2401.18079, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14709","last_updated":"2025-05-17T05:00:39Z","snapshot_observed_at":"2026-08-16T16:46:07.745831Z","submitted_at":"2025-05-17T05:00:39Z","title":"FastCar: Cache Attentive Replay for Fast Auto-Regressive Video Generation on the Edge","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T20:54:59.293772Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2505.14709"},"observation_digest":"sha256:726383e41c20fe17113e6ad6bc549a082460855c5e2dcc95c3376c7f37bb713c","observation_id":"a833d507-3149-4d46-84b6-22eb6fd5b50f","resolution":{"observed_at":"2026-08-15T20:54:59.293772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-07T14:43:24.481761Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17787","last_updated":"2025-05-23T12:00:09Z","snapshot_observed_at":"2026-08-17T12:17:50.468576Z","submitted_at":"2025-05-23T12:00:09Z","title":"Titanus: Enabling KV Cache Pruning and Quantization On-the-Fly for LLM Acceleration","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:43:24.481761Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2505.17787"},"observation_digest":"sha256:a6caec96ba377715c467c5cddc9755f5583186dd1dd4941b77dee999c9ac3407","observation_id":"626ad239-cb82-4223-92e2-612a9d4ef34a","resolution":{"observed_at":"2026-08-07T14:43:24.481761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-07T14:16:45.310548Z","title":"W .,Shao, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19481","last_updated":"2025-05-26T04:03:48Z","snapshot_observed_at":"2026-08-19T20:13:30.852895Z","submitted_at":"2025-05-26T04:03:48Z","title":"Win Fast or Lose Slow: Balancing Speed and Accuracy in Latency-Sensitive Decisions of LLMs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:45.310548Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2505.19481"},"observation_digest":"sha256:856bc5550e7731b511db315ae9ae76d3a5db62e78b354972169aaa762cadc164","observation_id":"061c7b6a-8acf-416f-8cd8-aeb6b27e50cf","resolution":{"observed_at":"2026-08-07T14:16:45.310548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-07T13:32:30.954664Z","title":"Mahoney, Yakun Sophia Shao, Kurt Keutzer, and Amir Gholami","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T13:32:30.954664Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2505.21487"},"observation_digest":"sha256:2b3a140733689f9d574190f2f981641d68d73c34daa1006b400d289f3f32cb48","observation_id":"b846c7a3-8c26-4820-9f30-fd34b7596dbf","resolution":{"observed_at":"2026-08-07T13:32:30.954664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-07T11:25:59.316579Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02572","last_updated":"2025-06-03T07:53:32Z","snapshot_observed_at":"2026-08-22T01:58:19.972521Z","submitted_at":"2025-06-03T07:53:32Z","title":"HATA: Trainable and Hardware-Efficient Hash-Aware Top-k Attention for Scalable Large Model Inference","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T11:25:59.316579Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2506.02572"},"observation_digest":"sha256:6f03701f5851f998954fa19e937ea34ca4ab51caf53d7ecfc751032a5051fe1b","observation_id":"19c23bce-5875-44f6-92fb-259f5d75ee64","resolution":{"observed_at":"2026-08-07T11:25:59.316579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-07T10:45:09.862820Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04642","last_updated":"2025-06-05T05:23:38Z","snapshot_observed_at":"2026-08-21T17:02:01.721977Z","submitted_at":"2025-06-05T05:23:38Z","title":"TaDA: Training-free recipe for Decoding with Adaptive KV Cache Compression and Mean-centering","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T10:45:09.862820Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2506.04642"},"observation_digest":"sha256:23c0ff24556c6b066098bac7801712e716be878da9242be1e02e83a901f38c2a","observation_id":"dec87567-bce7-4b01-9448-54d41b907068","resolution":{"observed_at":"2026-08-07T10:45:09.862820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-07T06:02:32.875169Z","title":"Kvquant: Towards 10 million context length llm inference with kv cache quantization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-13T17:30:05.303052Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:32.875169Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2506.06122"},"observation_digest":"sha256:e8d082cb7e25f17d3725780489239b1b7b21431c2de74e39d90998352e2ca24b","observation_id":"683195ac-343c-4526-8a60-3fb774b83e18","resolution":{"observed_at":"2026-08-07T06:02:32.875169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-07T01:10:38.223015Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11886","last_updated":"2025-06-13T15:35:54Z","snapshot_observed_at":"2026-08-18T03:15:24.625839Z","submitted_at":"2025-06-13T15:35:54Z","title":"Beyond Homogeneous Attention: Memory-Efficient LLMs via Fourier-Approximated KV Cache","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T01:10:38.223015Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2506.11886"},"observation_digest":"sha256:df590cfad50fbd4c2c62e832fe4114dfae2b5b0cef8491bbd8b694ecd6048fe9","observation_id":"f8f7e5ad-7493-4c4b-bf6d-c01e6c2334aa","resolution":{"observed_at":"2026-08-07T01:10:38.223015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-07T10:20:41.660846Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15724","last_updated":"2025-06-06T01:51:24Z","snapshot_observed_at":"2026-08-10T14:12:07.012882Z","submitted_at":"2025-06-06T01:51:24Z","title":"MadaKV: Adaptive Modality-Perception KV Cache Eviction for Efficient Multimodal Long-Context Inference","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T10:20:41.660846Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2506.15724"},"observation_digest":"sha256:7f643572a013cd09395d1dd319fffbb02783dabc28ad018b9d3a61548629cee3","observation_id":"40c2c40e-455f-493a-aec0-348b59a97461","resolution":{"observed_at":"2026-08-07T10:20:41.660846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-15T18:49:24.074952Z","title":"W., Shao, Y","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18879","last_updated":"2025-06-23T17:50:11Z","snapshot_observed_at":"2026-08-16T01:51:29.045572Z","submitted_at":"2025-06-23T17:50:11Z","title":"CommVQ: Commutative Vector Quantization for KV Cache Compression","version":1},"reference_index":1984,"source":"pdf_text","source_observed_at":"2026-08-15T18:49:24.074952Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2506.18879"},"observation_digest":"sha256:447ad88e77da2717ab21d6f0529d67ec1c280fe27b1a492cf2c1c57426f1f4ec","observation_id":"2baeb153-49e3-4b37-908b-b498371ecb17","resolution":{"observed_at":"2026-08-15T18:49:24.074952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-06T23:00:11.077208Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20187","last_updated":"2025-07-02T05:12:29Z","snapshot_observed_at":"2026-08-18T03:21:35.999027Z","submitted_at":"2025-06-25T07:26:42Z","title":"Breaking the Boundaries of Long-Context LLM Inference: Adaptive KV Management on a Single Commodity GPU","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T23:00:11.077208Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2506.20187"},"observation_digest":"sha256:4df5908c36b9996cd1deebb4879ce1c8c07907fd141f47f6d90e62d3091f5591","observation_id":"19c85dd1-eaf2-46ec-b9ce-a79b014b1e82","resolution":{"observed_at":"2026-08-06T23:00:11.077208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-06T17:06:33.153280Z","title":"Mahoney, Yakun Sophia Shao, Kurt Keutzer, and Amir Gholami","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11953","last_updated":"2025-07-16T06:39:11Z","snapshot_observed_at":"2026-08-20T22:31:18.067061Z","submitted_at":"2025-07-16T06:39:11Z","title":"IAM: Efficient Inference through Attention Mapping between Different-scale LLMs","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T17:06:33.153280Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2507.11953"},"observation_digest":"sha256:104e76f0bcc99e57bbb7ed052a4a47d5344785d257711bf6f511303c6710bee0","observation_id":"53b5b577-79bb-4a38-8752-585dbd12bc91","resolution":{"observed_at":"2026-08-06T17:06:33.153280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-06T13:57:15.710581Z","title":"Mahoney, Yakun Sophia Shao, Kurt Keutzer, and Amir Gholami","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19906","last_updated":"2025-08-04T08:19:26Z","snapshot_observed_at":"2026-08-19T22:54:51.852475Z","submitted_at":"2025-07-26T10:34:53Z","title":"CaliDrop: KV Cache Compression with Calibration","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T13:57:15.710581Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2507.19906"},"observation_digest":"sha256:e85423e63e52df93986b439472173a38c9a92a4e637fff4718f8cfebe6b7ece8","observation_id":"ffc9ce03-1f66-45f5-a56c-51d090804ebd","resolution":{"observed_at":"2026-08-06T13:57:15.710581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-06T11:15:33.951900Z","title":"Kvquant: Towards 10 million context length llm inference with kv cache quantization,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.23035","last_updated":"2026-06-02T03:48:06Z","snapshot_observed_at":"2026-08-15T09:38:35.594651Z","submitted_at":"2025-07-30T19:01:25Z","title":"OASIS: Outlier-Aware LUT-Based GEMM with Dual-Side Quantization for LLM Inference Acceleration","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T11:15:33.951900Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2507.23035"},"observation_digest":"sha256:f57379c605a8b02e6e6399c7ae1ababcae257a1a35c878dc4fa25025cfe8d91f","observation_id":"b78e0d83-6f47-466f-8038-3a25652de897","resolution":{"observed_at":"2026-08-06T11:15:33.951900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-05T17:55:10.035877Z","title":"Kvquant: Towards 10 million context length llm inference with kv cache quantization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-19T17:54:54.763717Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:10.035877Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:4d13bd7839a5be488adf72988031ea7bb26d357c31d344bc7d68f9198ccecefc","observation_id":"30df9cd3-da21-4b66-94cc-6e529e1f16c4","resolution":{"observed_at":"2026-08-05T17:55:10.035877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-05T10:16:13.074677Z","title":"arXiv preprint arXiv:2401.18079","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.04377","last_updated":"2025-09-04T16:40:01Z","snapshot_observed_at":"2026-08-15T06:44:06.974630Z","submitted_at":"2025-09-04T16:40:01Z","title":"PagedEviction: Structured Block-wise KV Cache Pruning for Efficient Large Language Model Inference","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T10:16:13.074677Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2509.04377"},"observation_digest":"sha256:eea8fc9dd20bf97c1140090e7f01d3a2731363e141449650a02ab8cc45a7c7e0","observation_id":"692dbdfc-6c73-4425-9967-499b6355cf2b","resolution":{"observed_at":"2026-08-05T10:16:13.074677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-04T17:05:54.973004Z","title":"Mahoney, Yakun Sophia Shao, Kurt Keutzer, and Amir Gholami","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.11155","last_updated":"2025-09-14T08:20:48Z","snapshot_observed_at":"2026-08-14T10:39:27.256598Z","submitted_at":"2025-09-14T08:20:48Z","title":"AQUA: Attention via QUery mAgnitudes for Memory and Compute Efficient Inference in LLMs","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-04T17:05:54.973004Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2509.11155"},"observation_digest":"sha256:99d4b35d1b9fee79e943977ec0c33b7af0fe8fc240400bc4a59d0c41ba9801f1","observation_id":"ed0ab0ff-6081-457f-8c89-c47ef52b9221","resolution":{"observed_at":"2026-08-04T17:05:54.973004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":"2401.18079","doi":"10.48550/arxiv.2401.18079","metadata_source":"pith","pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mahoney, Yakun Sophia Shao, Kurt Keutzer, and Amir Gholami","venue":"cs.LG","work_id":"f8884df2-70de-43af-832d-ca9ba2eab327","year":2024},"citing_paper":{"arxiv_id":"2509.17396","last_updated":"2026-05-19T20:55:44Z","snapshot_observed_at":"2026-08-18T11:54:44.429119Z","submitted_at":"2025-09-22T06:56:35Z","title":"EpiCache: Episodic KV Cache Management for Long-Term Conversation on Resource-Constrained Environments","version":4},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-21T21:54:05.442769Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2509.17396"},"observation_digest":"sha256:02c9b2807c31cb1aa24148efe4e768fedc75653c6d49024200320653664f0608","observation_id":"983a32bc-107b-44c9-a3e0-41e1c4621837","resolution":{"observed_at":"2026-05-21T21:54:22.821265Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-03T17:10:08.496622Z","title":"Mahoney, Yakun Sophia Shao, Kurt Keutzer, and Amir Gholami","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.10656","last_updated":"2026-06-08T08:57:35Z","snapshot_observed_at":"2026-08-16T08:59:30.354294Z","submitted_at":"2025-12-11T14:02:34Z","title":"Token Sample Complexity of Attention","version":3},"reference_index":1963,"source":"pdf_text","source_observed_at":"2026-08-03T17:10:08.496622Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2512.10656"},"observation_digest":"sha256:896474be84434d6c9fca56f200333d00d40404356dca76e336c64c7ac15dd157","observation_id":"15760c83-790d-4e7a-b65e-b4d4e8dcae70","resolution":{"observed_at":"2026-08-03T17:10:08.496622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-02T20:43:37.256381Z","title":"(2024).KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantiza- tion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.06642","last_updated":"2026-07-22T21:06:43Z","snapshot_observed_at":"2026-08-16T10:45:58.164948Z","submitted_at":"2026-02-26T01:54:24Z","title":"SR-TTT Does Not Learn Retrieval: A Correction and Mechanistic Post-Mortem of Surprisal-Aware Residual Test-Time Training","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T20:43:37.256381Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2603.06642"},"observation_digest":"sha256:eb2522a817bff2774e383e2bc9ec0dacad1f2181f1e9ef0c1238adb82b62221b","observation_id":"d8e2c0b5-458f-4baf-b766-d3d418fc5841","resolution":{"observed_at":"2026-08-02T20:43:37.256381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":"2401.18079","doi":"10.48550/arxiv.2401.18079","metadata_source":"pith","pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mahoney, Yakun Sophia Shao, Kurt Keutzer, and Amir Gholami","venue":"cs.LG","work_id":"f8884df2-70de-43af-832d-ca9ba2eab327","year":2024},"citing_paper":{"arxiv_id":"2604.15356","last_updated":"2026-04-10T22:48:19Z","snapshot_observed_at":"2026-08-12T23:42:18.669704Z","submitted_at":"2026-04-10T22:48:19Z","title":"Sequential KV Cache Compression via Probabilistic Language Tries: Beyond the Per-Vector Shannon Limit","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T16:46:14.866351Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2604.15356"},"observation_digest":"sha256:e8d707ee5356bbf499c345e9b9af09159d9804289747232ef5657257007dd392","observation_id":"d5d4f3d5-68a8-4f87-9c2e-6f24aedf0a2d","resolution":{"observed_at":"2026-05-11T08:11:05.119893Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":"2401.18079","doi":"10.48550/arxiv.2401.18079","metadata_source":"pith","pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mahoney, Yakun Sophia Shao, Kurt Keutzer, and Amir Gholami","venue":"cs.LG","work_id":"f8884df2-70de-43af-832d-ca9ba2eab327","year":2024},"citing_paper":{"arxiv_id":"2604.24971","last_updated":"2026-04-27T20:10:21Z","snapshot_observed_at":"2026-07-06T23:10:52.763251Z","submitted_at":"2026-04-27T20:10:21Z","title":"PolyKV: A Shared Asymmetrically-Compressed KV Cache Pool for Multi-Agent LLM Inference","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-08T03:55:32.585495Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2604.24971"},"observation_digest":"sha256:05151bd1028519e9c063e69a07bc167ea7bb0fe000b8327a889c20dd72cf794f","observation_id":"cde0251b-0d4b-4c31-bb72-819a7691390c","resolution":{"observed_at":"2026-05-11T21:51:34.356303Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":"2401.18079","doi":"10.48550/arxiv.2401.18079","metadata_source":"pith","pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mahoney, Yakun Sophia Shao, Kurt Keutzer, and Amir Gholami","venue":"cs.LG","work_id":"f8884df2-70de-43af-832d-ca9ba2eab327","year":2024},"citing_paper":{"arxiv_id":"2605.02262","last_updated":"2026-05-04T06:17:13Z","snapshot_observed_at":"2026-08-16T20:41:27.554520Z","submitted_at":"2026-05-04T06:17:13Z","title":"WindowQuant: Mixed-Precision KV Cache Quantization based on Window-Level Similarity for VLMs Inference Optimization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-09T16:06:26.450483Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2605.02262"},"observation_digest":"sha256:628bcd147b5d34e8788fcc2f9dbe4d93f6e7e4d9468f05bb3d3f938ba0e63122","observation_id":"c7fc36aa-0ad4-44f9-93ab-ccb34322ac62","resolution":{"observed_at":"2026-05-11T16:36:08.002040Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":"2401.18079","doi":"10.48550/arxiv.2401.18079","metadata_source":"pith","pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mahoney, Yakun Sophia Shao, Kurt Keutzer, and Amir Gholami","venue":"cs.LG","work_id":"f8884df2-70de-43af-832d-ca9ba2eab327","year":2024},"citing_paper":{"arxiv_id":"2605.03562","last_updated":"2026-05-19T17:40:13Z","snapshot_observed_at":"2026-07-06T23:16:30.147006Z","submitted_at":"2026-05-05T09:34:51Z","title":"HeadQ: Model-Visible Distortion and Score-Space Correction for KV-Cache Quantization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-07T17:07:28.163304Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2605.03562"},"observation_digest":"sha256:376b5c38f8bd983c81ad5b84538ad270bca7f0224c1038e854560be6909b77ae","observation_id":"d57de22e-4e01-405f-8866-348250b34b03","resolution":{"observed_at":"2026-05-12T11:01:29.776641Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":"2401.18079","doi":"10.48550/arxiv.2401.18079","metadata_source":"pith","pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mahoney, Yakun Sophia Shao, Kurt Keutzer, and Amir Gholami","venue":"cs.LG","work_id":"f8884df2-70de-43af-832d-ca9ba2eab327","year":2024},"citing_paper":{"arxiv_id":"2605.03562","last_updated":"2026-05-19T17:40:13Z","snapshot_observed_at":"2026-07-06T23:16:30.147006Z","submitted_at":"2026-05-05T09:34:51Z","title":"HeadQ: Model-Visible Distortion and Score-Space Correction for KV-Cache Quantization","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-08T18:33:19.999707Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2605.03562"},"observation_digest":"sha256:3514d6f6a03457841f94bb97dc7d31230f6230b66b5742e06b379de5095d342b","observation_id":"0cd80202-ee07-453b-b303-5406d11e96aa","resolution":{"observed_at":"2026-05-09T06:20:42.515117Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":"2401.18079","doi":"10.48550/arxiv.2401.18079","metadata_source":"pith","pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mahoney, Yakun Sophia Shao, Kurt Keutzer, and Amir Gholami","venue":"cs.LG","work_id":"f8884df2-70de-43af-832d-ca9ba2eab327","year":2024},"citing_paper":{"arxiv_id":"2605.08966","last_updated":"2026-05-09T14:20:17Z","snapshot_observed_at":"2026-08-18T15:44:12.190505Z","submitted_at":"2026-05-09T14:20:17Z","title":"VORT: Adaptive Power-Law Memory for NLP Transformers","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-12T02:01:53.000938Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2605.08966"},"observation_digest":"sha256:a3ed35b0c3e05179cbcdd116ebd9b3bffdeb8a8721f96b1f353548d68d609f06","observation_id":"6413a979-1151-4d0a-b089-2bb3db893e42","resolution":{"observed_at":"2026-05-12T07:46:26.259266Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":"2401.18079","doi":"10.48550/arxiv.2401.18079","metadata_source":"pith","pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mahoney, Yakun Sophia Shao, Kurt Keutzer, and Amir Gholami","venue":"cs.LG","work_id":"f8884df2-70de-43af-832d-ca9ba2eab327","year":2024},"citing_paper":{"arxiv_id":"2605.18053","last_updated":"2026-05-18T08:41:34Z","snapshot_observed_at":"2026-08-16T15:00:20.515962Z","submitted_at":"2026-05-18T08:41:34Z","title":"Protection Is (Nearly) All You Need: Structural Protection Dominates Scoring in Globally Capped KV Eviction","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-20T12:13:14.295659Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2605.18053"},"observation_digest":"sha256:1c75fd84efdeea1276bf1bb55652589da81c7c54338e83a23bdf393a1b65fc70","observation_id":"e94c01d3-5644-4303-8353-e0656cc4ef32","resolution":{"observed_at":"2026-05-20T12:13:15.987749Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":"2401.18079","doi":"10.48550/arxiv.2401.18079","metadata_source":"pith","pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mahoney, Yakun Sophia Shao, Kurt Keutzer, and Amir Gholami","venue":"cs.LG","work_id":"f8884df2-70de-43af-832d-ca9ba2eab327","year":2024},"citing_paper":{"arxiv_id":"2605.18856","last_updated":"2026-06-07T06:58:25Z","snapshot_observed_at":"2026-08-13T07:42:13.614209Z","submitted_at":"2026-05-13T18:48:48Z","title":"SPHERICAL KV: Angle-Domain Attention and Rate-Distortion Retention for Efficient Long-Context Inference","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-20T20:30:33.208386Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2605.18856"},"observation_digest":"sha256:2d7b3ed0c38d533cc435bc1c6d2f2561c5f7abe7cf6ab7d7b971256e5218fb5e","observation_id":"f06e10bb-9277-48af-bb23-f84e9d816afa","resolution":{"observed_at":"2026-05-20T20:33:43.345093Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":"2401.18079","doi":"10.48550/arxiv.2401.18079","metadata_source":"pith","pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mahoney, Yakun Sophia Shao, Kurt Keutzer, and Amir Gholami","venue":"cs.LG","work_id":"f8884df2-70de-43af-832d-ca9ba2eab327","year":2024},"citing_paper":{"arxiv_id":"2605.20868","last_updated":"2026-05-20T08:04:40Z","snapshot_observed_at":"2026-08-12T22:16:32.837291Z","submitted_at":"2026-05-20T08:04:40Z","title":"Runtime-Certified Bounded-Error Quantized Attention","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-21T05:45:42.295527Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2605.20868"},"observation_digest":"sha256:88fc7eff50e6732f7de20150a74f99de575a694debcee6674f5e4ff44ee0adeb","observation_id":"cf1e2c40-e430-4817-aeb3-4d4d392feff0","resolution":{"observed_at":"2026-05-21T05:49:41.109858Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":"2401.18079","doi":"10.48550/arxiv.2401.18079","metadata_source":"pith","pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mahoney, Yakun Sophia Shao, Kurt Keutzer, and Amir Gholami","venue":"cs.LG","work_id":"f8884df2-70de-43af-832d-ca9ba2eab327","year":2024},"citing_paper":{"arxiv_id":"2605.23200","last_updated":"2026-05-22T03:32:52Z","snapshot_observed_at":"2026-08-17T12:58:20.920773Z","submitted_at":"2026-05-22T03:32:52Z","title":"Adaptive Mass-Segmented KV Compression for Long-Context Reasoning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-25T05:22:47.198185Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2605.23200"},"observation_digest":"sha256:9085362e94d5a25bedd31edc955de825d31b8ae0f8cc7d199d259af1394b4ede","observation_id":"4bfb4e11-c9c5-404c-906c-7a5c0666f1d5","resolution":{"observed_at":"2026-05-25T05:25:23.488548Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":"2401.18079","doi":"10.48550/arxiv.2401.18079","metadata_source":"pith","pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mahoney, Yakun Sophia Shao, Kurt Keutzer, and Amir Gholami","venue":"cs.LG","work_id":"f8884df2-70de-43af-832d-ca9ba2eab327","year":2024},"citing_paper":{"arxiv_id":"2605.25203","last_updated":"2026-05-24T18:05:37Z","snapshot_observed_at":"2026-08-17T11:47:53.953300Z","submitted_at":"2026-05-24T18:05:37Z","title":"Influence-Inspired Spectral Rotations for Extreme Low-Bit LLM Quantization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-30T12:13:18.805668Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2605.25203"},"observation_digest":"sha256:8e4b8152f1acd147e1dabb0290919dd0d91a8d36e6924865f56b3ff4b8fe4291","observation_id":"e1012cfb-6667-488f-bf37-162f4e42edaf","resolution":{"observed_at":"2026-06-30T12:14:39.072739Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":"2401.18079","doi":"10.48550/arxiv.2401.18079","metadata_source":"pith","pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mahoney, Yakun Sophia Shao, Kurt Keutzer, and Amir Gholami","venue":"cs.LG","work_id":"f8884df2-70de-43af-832d-ca9ba2eab327","year":2024},"citing_paper":{"arxiv_id":"2606.02780","last_updated":"2026-08-16T03:22:25Z","snapshot_observed_at":"2026-08-20T23:12:32.926034Z","submitted_at":"2026-06-01T18:43:34Z","title":"Do Value Vectors in Deep Layers Need Context from the Residual Stream?","version":2},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-06-28T14:35:48.292081Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2606.02780"},"observation_digest":"sha256:f0c40fe563767e766c0e2c7999c1f20e16f5baf6b976ade423d4fd1d5a0e8e00","observation_id":"e4e72868-c583-4321-a84e-da0be5a57f9e","resolution":{"observed_at":"2026-07-01T23:16:23.448886Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-02T12:41:20.552739Z","title":"Mahoney, Yakun Sophia Shao, Kurt Keutzer, and Amir Gholami","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.02780","last_updated":"2026-08-16T03:22:25Z","snapshot_observed_at":"2026-08-20T23:12:32.926034Z","submitted_at":"2026-06-01T18:43:34Z","title":"Do Value Vectors in Deep Layers Need Context from the Residual Stream?","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-02T12:41:20.552739Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2606.02780"},"observation_digest":"sha256:1909383cc43ab2c87f7c3810e6999bdc07c62256176188c867cc070b557c006c","observation_id":"2c5b01e8-7ed2-4d15-b55c-7efbd6e447c3","resolution":{"observed_at":"2026-08-02T12:41:20.552739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":"2401.18079","doi":"10.48550/arxiv.2401.18079","metadata_source":"pith","pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mahoney, Yakun Sophia Shao, Kurt Keutzer, and Amir Gholami","venue":"cs.LG","work_id":"f8884df2-70de-43af-832d-ca9ba2eab327","year":2024},"citing_paper":{"arxiv_id":"2606.08382","last_updated":"2026-06-07T00:24:02Z","snapshot_observed_at":"2026-08-18T15:18:09.430726Z","submitted_at":"2026-06-07T00:24:02Z","title":"STAR-KV: Low-Rank KV Cache Compression via Soft Thresholding for Adaptive Rank Control","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-27T18:34:20.645677Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2606.08382"},"observation_digest":"sha256:8a1e7be1b6f7560b9d21965189e0e1ed43f9f80c92660aaa197bfeafe4551c2f","observation_id":"66f98172-5a50-4385-9606-d3916ec2c9c9","resolution":{"observed_at":"2026-07-02T22:57:26.297219Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":"2401.18079","doi":"10.48550/arxiv.2401.18079","metadata_source":"pith","pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mahoney, Yakun Sophia Shao, Kurt Keutzer, and Amir Gholami","venue":"cs.LG","work_id":"f8884df2-70de-43af-832d-ca9ba2eab327","year":2024},"citing_paper":{"arxiv_id":"2606.09508","last_updated":"2026-06-08T14:02:18Z","snapshot_observed_at":"2026-08-09T20:49:20.503961Z","submitted_at":"2026-06-08T14:02:18Z","title":"From Rigid to Dynamic: Entropy-Guided Adaptive Inference for Long-Context LLMs","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-06-27T16:57:02.709967Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2606.09508"},"observation_digest":"sha256:28019adce8648327742631a1901b1cf07a5e22ddd704cd4b9a2155b9fd297242","observation_id":"0d00ab5b-bcb2-46ef-b136-993c3c1a8dbf","resolution":{"observed_at":"2026-06-27T17:01:07.733642Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":"2401.18079","doi":"10.48550/arxiv.2401.18079","metadata_source":"pith","pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mahoney, Yakun Sophia Shao, Kurt Keutzer, and Amir Gholami","venue":"cs.LG","work_id":"f8884df2-70de-43af-832d-ca9ba2eab327","year":2024},"citing_paper":{"arxiv_id":"2606.09864","last_updated":"2026-08-08T15:57:15Z","snapshot_observed_at":"2026-08-13T23:16:44.695369Z","submitted_at":"2026-06-01T02:02:20Z","title":"Alignment Collapse Under KV Cache Quantization: Diagnosis and Mitigation","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-06-28T15:37:34.129339Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2606.09864"},"observation_digest":"sha256:ecd8b362fde57c4441153a13549129b7b792d01e621ecd04deaa90748e30bb7d","observation_id":"19ab3f4d-16ff-4062-b6f0-4af4d02abc83","resolution":{"observed_at":"2026-07-01T22:16:16.033365Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":"2401.18079","doi":"10.48550/arxiv.2401.18079","metadata_source":"pith","pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mahoney, Yakun Sophia Shao, Kurt Keutzer, and Amir Gholami","venue":"cs.LG","work_id":"f8884df2-70de-43af-832d-ca9ba2eab327","year":2024},"citing_paper":{"arxiv_id":"2607.01065","last_updated":"2026-07-01T15:25:21Z","snapshot_observed_at":"2026-08-17T14:19:48.046773Z","submitted_at":"2026-07-01T15:25:21Z","title":"GSRQ: Gain-Shape Residual Quantization for Sub-1-bit KV Cache","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-07-02T15:55:40.177742Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2607.01065"},"observation_digest":"sha256:c58aebad4fb2af2c115c982d985a15d5c2395017f96793d36477f14ee0a8aff9","observation_id":"2bd10106-03ec-442b-b763-c59f9b220815","resolution":{"observed_at":"2026-07-02T15:57:06.412465Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-07-12T17:31:15.972423Z","title":"KVQuant: Towards 10M Context Length LLM Inference,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02523","last_updated":"2026-05-06T17:03:24Z","snapshot_observed_at":"2026-08-14T01:39:54.079191Z","submitted_at":"2026-05-06T17:03:24Z","title":"Edge-Deployable LLM Fine-Tuning on a Single GPU for Telecom Network Troubleshooting","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-12T17:31:15.972423Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2607.02523"},"observation_digest":"sha256:ed419bbb1f9cceba0d04bc7b80403c918c839abb7b62621f5a98b4b7459809d8","observation_id":"8e5f9032-d7cd-4df2-aa58-ef1b88649739","resolution":{"observed_at":"2026-07-12T17:31:15.972423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":"2401.18079","doi":"10.48550/arxiv.2401.18079","metadata_source":"pith","pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mahoney, Yakun Sophia Shao, Kurt Keutzer, and Amir Gholami","venue":"cs.LG","work_id":"f8884df2-70de-43af-832d-ca9ba2eab327","year":2024},"citing_paper":{"arxiv_id":"2607.07144","last_updated":"2026-08-05T19:23:53Z","snapshot_observed_at":"2026-08-14T02:25:56.888061Z","submitted_at":"2026-07-08T08:37:49Z","title":"Fractal KV-Cache Archives: Lossless Symbolic Storage with In-Place Retrieval for Long-Context LLM Inference","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-09T19:13:15.765652Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2607.07144"},"observation_digest":"sha256:f90de18c74fefc39d7b80186a3f04ccaf9d4ad12cf2e894fbb8ae01c51b344f9","observation_id":"318bfd26-f9f5-4a53-a10a-d232fb84b2f9","resolution":{"observed_at":"2026-07-09T19:16:27.748453Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":"2401.18079","doi":"10.48550/arxiv.2401.18079","metadata_source":"pith","pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mahoney, Yakun Sophia Shao, Kurt Keutzer, and Amir Gholami","venue":"cs.LG","work_id":"f8884df2-70de-43af-832d-ca9ba2eab327","year":2024},"citing_paper":{"arxiv_id":"2607.08032","last_updated":"2026-07-09T01:15:03Z","snapshot_observed_at":"2026-08-18T23:35:57.173534Z","submitted_at":"2026-07-09T01:15:03Z","title":"What to Keep, What to Forget: A Rate--Distortion View of Memory Compaction in LLMs and Agents","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-10T01:26:59.421158Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2607.08032"},"observation_digest":"sha256:4b1ac5d86b2802d27efdba5bd4b2b43da177223331ec102caae953ed994c9cd4","observation_id":"21137c33-95f5-443c-af0c-65450a67d571","resolution":{"observed_at":"2026-07-10T01:36:44.040808Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-07-14T12:07:13.700787Z","title":"Hooper, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10389","last_updated":"2026-07-11T16:36:47Z","snapshot_observed_at":"2026-08-16T08:48:38.573538Z","submitted_at":"2026-07-11T16:36:47Z","title":"Stateful Worlds, Stateless Elasticity: Exact-State Serving for Interactive World Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-14T12:07:13.700787Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2607.10389"},"observation_digest":"sha256:127b0f01c20a70a4f6695f5eff74424b7bc94a75ad74d336094519f03317f217","observation_id":"079a02e3-8f49-4470-85f5-7c3e64a2be09","resolution":{"observed_at":"2026-07-14T12:07:13.700787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-02T03:55:40.433775Z","title":"Kvquant: Towards 10 million context length llm inference with kv cache quantization.arXiv preprint arXiv:2401.18079,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13735","last_updated":"2026-07-17T08:40:24Z","snapshot_observed_at":"2026-08-16T11:40:37.184094Z","submitted_at":"2026-07-15T11:47:24Z","title":"Constraint-Driven Model Optimization: An Industry Framework for Selecting Compression and Acceleration Techniques in Modern Machine Learning Systems","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T03:55:40.433775Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2607.13735"},"observation_digest":"sha256:1379776afd53633a09eca3bce5b350fa2853b7d4fc482f9596286b156a9fc4d3","observation_id":"370400af-5b24-4d45-9b3e-a0fe5069a658","resolution":{"observed_at":"2026-08-02T03:55:40.433775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-01T23:22:30.957456Z","title":"Kvquant: Towards 10 million context length llm inference with kv cache quantization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15456","last_updated":"2026-07-24T02:15:23Z","snapshot_observed_at":"2026-08-19T07:38:18.295541Z","submitted_at":"2026-07-16T20:58:16Z","title":"Looped Latent Attention: Cross-Loop KV Compression for Looped Transformers","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-01T23:22:30.957456Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2607.15456"},"observation_digest":"sha256:3e0f8cd8253295df33cba571fddd2477c3e7f4ad945e8329d17dee56a4e35a38","observation_id":"c399909b-00ee-449b-aa0e-cdb766908015","resolution":{"observed_at":"2026-08-01T23:22:30.957456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-02T09:50:32.327649Z","title":"arXiv:2401.18079","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16248","last_updated":"2026-06-27T01:22:47Z","snapshot_observed_at":"2026-08-15T15:36:55.264153Z","submitted_at":"2026-06-27T01:22:47Z","title":"High-accuracy Low-Bit KV-Cache Quantization via Local Distribution Restoration","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-02T09:50:32.327649Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2607.16248"},"observation_digest":"sha256:e98f265b4dbd2d997ca01d8f2b8a5e30d65b72ecac42fad419220d77c3496cca","observation_id":"ad5553b7-0e5a-4377-b8c2-422f584943ce","resolution":{"observed_at":"2026-08-02T09:50:32.327649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-02T09:51:03.359796Z","title":"arXiv preprint arXiv:2401.18079 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16252","last_updated":"2026-06-27T03:25:36Z","snapshot_observed_at":"2026-08-16T23:14:00.224337Z","submitted_at":"2026-06-27T03:25:36Z","title":"SOS-LoRA: Static Orthogonal-Subspace Low-Rank Adaptation with Fixed Multi-Scale Scaling","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-02T09:51:03.359796Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2607.16252"},"observation_digest":"sha256:2ea9923798696ddbae2bd3e0f14055cd820f797445fc192db47ed52c9a640d18","observation_id":"27aab2f4-0d4c-4593-9b3e-55914237ada8","resolution":{"observed_at":"2026-08-02T09:51:03.359796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-01T04:48:25.926385Z","title":"arXiv:2401.18079","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22448","last_updated":"2026-08-19T18:01:42Z","snapshot_observed_at":"2026-08-22T08:14:07.474732Z","submitted_at":"2026-07-24T16:10:21Z","title":"Where Facts Go Missing: A Layerwise Taxonomy and Per-Layer Attribution of Information Omission in Air-Gapped LLMAgent Pipelines","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-01T04:48:25.926385Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2607.22448"},"observation_digest":"sha256:7f7ea6489aae9281ef85b9af57596498c3aeebdcaaf0349c49c8995d29b15887","observation_id":"6ac5d3aa-ed7d-4947-bbca-b783de3c136c","resolution":{"observed_at":"2026-08-01T04:48:25.926385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-07-30T11:12:05.608333Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27187","last_updated":"2026-07-29T17:55:38Z","snapshot_observed_at":"2026-08-15T18:59:25.574700Z","submitted_at":"2026-07-29T17:55:38Z","title":"A Photonic-CXL Memory Appliance for Scalable KV Cache Management in LLM Inference","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-30T11:12:05.608333Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2607.27187"},"observation_digest":"sha256:ea0f9c2e6d7a7c06ef840f7d35f6ebecdfb7e979d532bd2009ff97c2025e37df","observation_id":"270ca459-9ac7-4564-81ca-0a1b40cfb920","resolution":{"observed_at":"2026-07-30T11:12:05.608333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-03T00:43:49.304692Z","title":"Mahoney, Yakun Sophia Shao, Kurt Keutzer, and Amir Gholami","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28699","last_updated":"2026-08-16T15:41:57Z","snapshot_observed_at":"2026-08-20T23:12:42.345292Z","submitted_at":"2026-07-30T11:04:45Z","title":"WitCert: Sound Runtime Risk Observability and Gating for KV-Cache Quantization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T00:43:49.304692Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2607.28699"},"observation_digest":"sha256:d54c4b10f79e0580fbc3210fc82e9f31fc739bfbb19064c8f3934e0f29b1c387","observation_id":"4c113f63-5339-43b9-95e9-a9b797220e11","resolution":{"observed_at":"2026-08-03T00:43:49.304692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-05T23:10:35.719156Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03228","last_updated":"2026-08-05T20:50:42Z","snapshot_observed_at":"2026-08-14T09:50:26.014755Z","submitted_at":"2026-08-04T06:59:29Z","title":"SAKI: Score-Aware Low-Rank Key Indexing with Random-Matrix Noise Correction for KV Retrieval","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:35.719156Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2608.03228"},"observation_digest":"sha256:5372931d533c8277a0c229864332d430abf604806bd27f38a42bbe6b9d79448d","observation_id":"60c500bb-4bef-4e45-af9e-d8f47a319e9c","resolution":{"observed_at":"2026-08-05T23:10:35.719156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-08T00:54:42.716534Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03228","last_updated":"2026-08-05T20:50:42Z","snapshot_observed_at":"2026-08-14T09:50:26.014755Z","submitted_at":"2026-08-04T06:59:29Z","title":"SAKI: Score-Aware Low-Rank Key Indexing with Random-Matrix Noise Correction for KV Retrieval","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T00:54:42.716534Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2608.03228"},"observation_digest":"sha256:341e64335e884a2d2fc7b94c1e942bb1c7f0172212bc1768b68a871b3d9d4947","observation_id":"7d9282e2-7c49-456f-967f-e3304a2e1eac","resolution":{"observed_at":"2026-08-08T00:54:42.716534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-15T14:46:03.997449Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04428","last_updated":"2026-08-05T04:17:03Z","snapshot_observed_at":"2026-08-16T01:42:08.131327Z","submitted_at":"2026-08-05T04:17:03Z","title":"Deltoris: Enabling Real-time VLA Inference in Embodied AI via Bit-level Sparsity and Speculative Inference","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T14:46:03.997449Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2608.04428"},"observation_digest":"sha256:ccd7d25d84b35fea02131f0364327b1c1d9b621503fa23188beee82628716337","observation_id":"b01ebdca-cafa-45f6-b606-579db731137f","resolution":{"observed_at":"2026-08-15T14:46:03.997449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-14T04:40:10.093000Z","title":"arXiv preprint arXiv:2401.18079 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08447","last_updated":"2026-08-09T03:30:14Z","snapshot_observed_at":"2026-08-17T06:02:48.187688Z","submitted_at":"2026-08-09T03:30:14Z","title":"Hidden Language Consistency Phenomena in Reasoning LLMs","version":1},"reference_index":226,"source":"arxiv_source","source_observed_at":"2026-08-14T04:40:10.093000Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2608.08447"},"observation_digest":"sha256:c6eefd8e8ba47a5aa953f6f38ae36a471cf847ee2104bf2388467b6454644b0d","observation_id":"e887a3ac-789a-4f76-9b4f-c99892a87403","resolution":{"observed_at":"2026-08-14T04:40:10.093000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-14T12:54:26.504222Z","title":"Mahoney, Yakun Sophia Shao, Kurt Keutzer, and Amir Gholami","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.13365","last_updated":"2026-08-13T15:31:01Z","snapshot_observed_at":"2026-08-17T17:08:33.314163Z","submitted_at":"2026-08-13T15:31:01Z","title":"When Local Variance Optimality Is Not Enough: RoPE-Aligned Q/K Rotations for Dynamic 4-Bit Quantisation","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-14T12:54:26.504222Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2608.13365"},"observation_digest":"sha256:ccc87958d33030cf47c27e6bdbf39f44c3dfb400d604e4bb6709bd39061b9f69","observation_id":"f8271b02-afab-4e8d-b0b4-d7e3fd4ce051","resolution":{"observed_at":"2026-08-14T12:54:26.504222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2401.18079/citation-record","integrity":"/paper/2401.18079/integrity","json":"/paper/2401.18079/citation-record.json","paper":"/paper/2401.18079"},"outbound":[],"paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","latest_version":6,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 91 inbound Pith citation observations for arXiv:2401.18079."}