{"as_of":"2026-08-18T15:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b5d614fc907834def8774027d54b7620c37005deda6b20bcb3605a4de4d6dac6","coverage":[{"denominator":33,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":33,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T04:28:04.009153Z","state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:18:31.708860Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T16:49:57.974789Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.10424","last_updated":"2025-02-05T20:43:48Z","snapshot_observed_at":"2026-08-12T17:56:12.735965Z","submitted_at":"2025-02-05T20:43:48Z","title":"QuantSpec: Self-Speculative Decoding with Hierarchical Quantized KV Cache","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10424","snapshot_observed_at":"2026-08-07T13:18:31.708860Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22179","last_updated":"2025-05-29T04:07:33Z","snapshot_observed_at":"2026-08-13T22:38:08.304751Z","submitted_at":"2025-05-28T09:55:08Z","title":"Speculative Decoding Meets Quantization: Compatibility Evaluation and Hierarchical Framework Design","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T13:18:31.708860Z"},"links":{"cited_paper":"/paper/2502.10424","citing_paper":"/paper/2505.22179"},"observation_digest":"sha256:7c8f8474f4c2264b7c37512f277c6e0c1455296d2069aa5d2e403fdafe574160","observation_id":"13708c35-1129-4200-9f60-9ec760260725","resolution":{"observed_at":"2026-08-07T13:18:31.708860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10424","last_updated":"2025-02-05T20:43:48Z","snapshot_observed_at":"2026-08-12T17:56:12.735965Z","submitted_at":"2025-02-05T20:43:48Z","title":"QuantSpec: Self-Speculative Decoding with Hierarchical Quantized KV Cache","version":1},"cited_work":{"arxiv_id":"2502.10424","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.10424","snapshot_observed_at":"2026-07-04T16:49:57.974789Z","title":"W., Keutzer, K., and Gholami, A","venue":null,"work_id":"03281b08-c928-4af2-8a63-2f71457faf9f","year":2025},"citing_paper":{"arxiv_id":"2605.26558","last_updated":"2026-05-26T05:12:44Z","snapshot_observed_at":"2026-08-12T18:15:32.484112Z","submitted_at":"2026-05-26T05:12:44Z","title":"Cassandra: Enabling Reasoning LLMs at Edge via Self-Speculative Decoding","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-01T16:19:54.910430Z"},"links":{"cited_paper":"/paper/2502.10424","citing_paper":"/paper/2605.26558"},"observation_digest":"sha256:62f643f6e6a1af4d87a950d1dec89d8167e850cf3a99279c588ac50614eac218","observation_id":"c0656267-ad41-4e6f-87a4-232f400ca9a7","resolution":{"observed_at":"2026-07-01T16:25:49.796335Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10424","last_updated":"2025-02-05T20:43:48Z","snapshot_observed_at":"2026-08-12T17:56:12.735965Z","submitted_at":"2025-02-05T20:43:48Z","title":"QuantSpec: Self-Speculative Decoding with Hierarchical Quantized KV Cache","version":1},"cited_work":{"arxiv_id":"2502.10424","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.10424","snapshot_observed_at":"2026-07-04T16:49:57.974789Z","title":"W., Keutzer, K., and Gholami, A","venue":null,"work_id":"03281b08-c928-4af2-8a63-2f71457faf9f","year":2025},"citing_paper":{"arxiv_id":"2606.24957","last_updated":"2026-06-23T08:51:20Z","snapshot_observed_at":"2026-08-13T07:44:57.029356Z","submitted_at":"2026-06-23T08:51:20Z","title":"Dustin: Draft-Augmented Sparse Verification for Efficient Long-Context Generation with Speculative Decoding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-26T00:11:58.636939Z"},"links":{"cited_paper":"/paper/2502.10424","citing_paper":"/paper/2606.24957"},"observation_digest":"sha256:5b9d17fd25718efa62b4ef4a0e0a9221fcc7b02eea4ab1ac587162fe0a2bac90","observation_id":"0ab90f20-25c1-40fd-806a-42174a472642","resolution":{"observed_at":"2026-07-04T16:49:57.977064Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10424","last_updated":"2025-02-05T20:43:48Z","snapshot_observed_at":"2026-08-12T17:56:12.735965Z","submitted_at":"2025-02-05T20:43:48Z","title":"QuantSpec: Self-Speculative Decoding with Hierarchical Quantized KV Cache","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10424","snapshot_observed_at":"2026-08-02T09:50:33.435680Z","title":"arXiv:2502.10424","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16248","last_updated":"2026-06-27T01:22:47Z","snapshot_observed_at":"2026-08-15T15:36:55.264153Z","submitted_at":"2026-06-27T01:22:47Z","title":"High-accuracy Low-Bit KV-Cache Quantization via Local Distribution Restoration","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T09:50:33.435680Z"},"links":{"cited_paper":"/paper/2502.10424","citing_paper":"/paper/2607.16248"},"observation_digest":"sha256:e4d285002dd4bef610596976b4acf7fdace7f7c6d173a208d5341f0931507d42","observation_id":"eae26172-954a-4608-af4f-ba240ae149de","resolution":{"observed_at":"2026-08-02T09:50:33.435680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2502.10424/citation-record","integrity":"/paper/2502.10424/integrity","json":"/paper/2502.10424/citation-record.json","paper":"/paper/2502.10424"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2401.10774","last_updated":"2024-06-14T23:32:32Z","snapshot_observed_at":"2026-08-17T10:13:54.763177Z","submitted_at":"2024-01-19T15:48:40Z","title":"Medusa: Simple LLM Inference Acceleration Framework with Multiple Decoding Heads","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10774","snapshot_observed_at":"2026-08-09T04:28:03.907233Z","title":"D., Chen, D., and Dao, T","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.10424","last_updated":"2025-02-05T20:43:48Z","snapshot_observed_at":"2026-08-12T17:56:12.735965Z","submitted_at":"2025-02-05T20:43:48Z","title":"QuantSpec: Self-Speculative Decoding with Hierarchical Quantized KV Cache","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-09T04:28:03.907233Z"},"links":{"cited_paper":"/paper/2401.10774","citing_paper":"/paper/2502.10424"},"observation_digest":"sha256:a9199a68348526671ead215aa7607226545b043c5b26267fc3dd6427be6533bd","observation_id":"b5834700-2e79-42ba-b437-8b043f26406b","resolution":{"observed_at":"2026-08-09T04:28:03.907233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.01318","last_updated":"2023-02-02T18:44:11Z","snapshot_observed_at":"2026-08-13T23:55:57.074762Z","submitted_at":"2023-02-02T18:44:11Z","title":"Accelerating Large Language Model Decoding with Speculative Sampling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.01318","snapshot_observed_at":"2026-08-09T04:28:03.911019Z","title":"Accelerating large language model decoding with speculative sampling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.10424","last_updated":"2025-02-05T20:43:48Z","snapshot_observed_at":"2026-08-12T17:56:12.735965Z","submitted_at":"2025-02-05T20:43:48Z","title":"QuantSpec: Self-Speculative Decoding with Hierarchical Quantized KV Cache","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-09T04:28:03.911019Z"},"links":{"cited_paper":"/paper/2302.01318","citing_paper":"/paper/2502.10424"},"observation_digest":"sha256:dad3839671731531019bb02dfe05bb7c723c209b81928d4f32da2ccc8f25b728","observation_id":"2f0c95a0-b988-40f2-a1c1-9201997f59d9","resolution":{"observed_at":"2026-08-09T04:28:03.911019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12517","last_updated":"2025-02-10T09:37:59Z","snapshot_observed_at":"2026-08-16T13:17:16.331916Z","submitted_at":"2024-09-19T07:15:58Z","title":"Scaling FP8 training to trillion-token LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12517","snapshot_observed_at":"2026-08-09T04:28:03.922252Z","title":"Scal- ing fp8 training to trillion-token llms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.10424","last_updated":"2025-02-05T20:43:48Z","snapshot_observed_at":"2026-08-12T17:56:12.735965Z","submitted_at":"2025-02-05T20:43:48Z","title":"QuantSpec: Self-Speculative Decoding with Hierarchical Quantized KV Cache","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-09T04:28:03.922252Z"},"links":{"cited_paper":"/paper/2409.12517","citing_paper":"/paper/2502.10424"},"observation_digest":"sha256:378466534ee7688b296b02800571a25c3e0110c29fd50d212083d2937fb17ee3","observation_id":"67aba63f-2798-4df1-9f36-1e7f316667f5","resolution":{"observed_at":"2026-08-09T04:28:03.922252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14057","last_updated":"2024-07-19T06:34:45Z","snapshot_observed_at":"2026-08-16T13:32:50.272482Z","submitted_at":"2024-07-19T06:34:45Z","title":"LazyLLM: Dynamic Token Pruning for Efficient Long Context LLM Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14057","snapshot_observed_at":"2026-08-09T04:28:03.925945Z","title":"Lazyllm: Dynamic token pruning for efficient long context llm inference","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.10424","last_updated":"2025-02-05T20:43:48Z","snapshot_observed_at":"2026-08-12T17:56:12.735965Z","submitted_at":"2025-02-05T20:43:48Z","title":"QuantSpec: Self-Speculative Decoding with Hierarchical Quantized KV Cache","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-09T04:28:03.925945Z"},"links":{"cited_paper":"/paper/2407.14057","citing_paper":"/paper/2502.10424"},"observation_digest":"sha256:5b967201fd62cb66dc7838e7bdc65a741520e617f125ece1446aee63e6a72cc2","observation_id":"7a42e937-f4c5-4818-95b8-56574eddf90d","resolution":{"observed_at":"2026-08-09T04:28:03.925945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01801","last_updated":"2024-10-29T18:26:09Z","snapshot_observed_at":"2026-08-14T11:45:47.400186Z","submitted_at":"2023-10-03T05:17:08Z","title":"Model Tells You What to Discard: Adaptive KV Cache Compression for LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01801","snapshot_observed_at":"2026-08-09T04:28:03.929459Z","title":"Model tells you what to discard: Adaptive kv cache compression for llms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.10424","last_updated":"2025-02-05T20:43:48Z","snapshot_observed_at":"2026-08-12T17:56:12.735965Z","submitted_at":"2025-02-05T20:43:48Z","title":"QuantSpec: Self-Speculative Decoding with Hierarchical Quantized KV Cache","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-09T04:28:03.929459Z"},"links":{"cited_paper":"/paper/2310.01801","citing_paper":"/paper/2502.10424"},"observation_digest":"sha256:af1d6baaab456b99573c97ffaa78e4a9a9d5c626a58843200e6a52b9bdfb59a8","observation_id":"586eed45-5c2f-4321-9e0c-ee9322a13662","resolution":{"observed_at":"2026-08-09T04:28:03.929459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08391","last_updated":"2024-10-10T21:55:11Z","snapshot_observed_at":"2026-08-16T13:10:31.587934Z","submitted_at":"2024-10-10T21:55:11Z","title":"KV Prediction for Improved Time to First Token","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08391","snapshot_observed_at":"2026-08-09T04:28:03.932733Z","title":"Jiang, H., Li, Y ., Zhang, C., Wu, Q., Luo, X., Ahn, S., Han, Z., Abdi, A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.10424","last_updated":"2025-02-05T20:43:48Z","snapshot_observed_at":"2026-08-12T17:56:12.735965Z","submitted_at":"2025-02-05T20:43:48Z","title":"QuantSpec: Self-Speculative Decoding with Hierarchical Quantized KV Cache","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-09T04:28:03.932733Z"},"links":{"cited_paper":"/paper/2410.08391","citing_paper":"/paper/2502.10424"},"observation_digest":"sha256:1a93d6eeee82b6967b35eda32e2b3f59817e9772c600f34104c6909029078628","observation_id":"91b679b5-cb6e-4dbc-b430-5e0872a62807","resolution":{"observed_at":"2026-08-09T04:28:03.932733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05527","last_updated":"2024-09-30T22:44:58Z","snapshot_observed_at":"2026-08-16T14:11:31.440997Z","submitted_at":"2024-03-08T18:48:30Z","title":"GEAR: An Efficient KV Cache Compression Recipe for Near-Lossless Generative Inference of LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05527","snapshot_observed_at":"2026-08-09T04:28:03.935822Z","title":"Gear: An efficient kv cache compression recipefor near-lossless generative inference of llm","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.10424","last_updated":"2025-02-05T20:43:48Z","snapshot_observed_at":"2026-08-12T17:56:12.735965Z","submitted_at":"2025-02-05T20:43:48Z","title":"QuantSpec: Self-Speculative Decoding with Hierarchical Quantized KV Cache","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-09T04:28:03.935822Z"},"links":{"cited_paper":"/paper/2403.05527","citing_paper":"/paper/2502.10424"},"observation_digest":"sha256:2ba46f9a6ab96505cae050b6c10ecbae07593138425a174a79e264b3cbb168af","observation_id":"d31dcdd4-0ac6-4064-8f01-5ef9ccc71d1c","resolution":{"observed_at":"2026-08-09T04:28:03.935822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07629","last_updated":"2024-06-05T03:57:41Z","snapshot_observed_at":"2026-08-16T15:24:21.726803Z","submitted_at":"2023-06-13T08:57:54Z","title":"SqueezeLLM: Dense-and-Sparse Quantization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07629","snapshot_observed_at":"2026-08-09T04:28:03.938479Z","title":"W., and Keutzer, K","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.10424","last_updated":"2025-02-05T20:43:48Z","snapshot_observed_at":"2026-08-12T17:56:12.735965Z","submitted_at":"2025-02-05T20:43:48Z","title":"QuantSpec: Self-Speculative Decoding with Hierarchical Quantized KV Cache","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-09T04:28:03.938479Z"},"links":{"cited_paper":"/paper/2306.07629","citing_paper":"/paper/2502.10424"},"observation_digest":"sha256:bceeddd6c750edc1a0bc481aa0132fe1c48f66ea78dac799aa154eae92bcfacb","observation_id":"9949b154-5c0b-4936-8e4c-06b655bb5173","resolution":{"observed_at":"2026-08-09T04:28:03.938479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14469","last_updated":"2024-06-17T03:01:58Z","snapshot_observed_at":"2026-08-14T12:21:04.886717Z","submitted_at":"2024-04-22T17:42:58Z","title":"SnapKV: LLM Knows What You are Looking for Before Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14469","snapshot_observed_at":"2026-08-09T04:28:03.941074Z","title":"Snapkv: Llm knows what you are looking for before generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.10424","last_updated":"2025-02-05T20:43:48Z","snapshot_observed_at":"2026-08-12T17:56:12.735965Z","submitted_at":"2025-02-05T20:43:48Z","title":"QuantSpec: Self-Speculative Decoding with Hierarchical Quantized KV Cache","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-09T04:28:03.941074Z"},"links":{"cited_paper":"/paper/2404.14469","citing_paper":"/paper/2502.10424"},"observation_digest":"sha256:e6da5601734c4385a0cc95246d962717adf48759ac55cf46bf44a1681cb1c702","observation_id":"fc780161-7c62-47b6-be59-14fe62cf56ee","resolution":{"observed_at":"2026-08-09T04:28:03.941074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-08-17T15:34:12.654681Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10516","snapshot_observed_at":"2026-08-09T04:28:03.943737Z","title":"Re- trievalattention: Accelerating long-context llm inference via vector retrieval","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.10424","last_updated":"2025-02-05T20:43:48Z","snapshot_observed_at":"2026-08-12T17:56:12.735965Z","submitted_at":"2025-02-05T20:43:48Z","title":"QuantSpec: Self-Speculative Decoding with Hierarchical Quantized KV Cache","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-09T04:28:03.943737Z"},"links":{"cited_paper":"/paper/2409.10516","citing_paper":"/paper/2502.10424"},"observation_digest":"sha256:855807a4e8fa4d012046d8a1504abd6e8d1f5a095268c243703a34dbcc60237c","observation_id":"5fa6e5d2-454d-439a-86e6-6b7b7b112699","resolution":{"observed_at":"2026-08-09T04:28:03.943737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10517","last_updated":"2024-06-21T05:20:56Z","snapshot_observed_at":"2026-08-16T14:18:04.510991Z","submitted_at":"2024-02-16T09:06:06Z","title":"Any-Precision LLM: Low-Cost Deployment of Multiple, Different-Sized LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10517","snapshot_observed_at":"2026-08-09T04:28:03.953718Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.10424","last_updated":"2025-02-05T20:43:48Z","snapshot_observed_at":"2026-08-12T17:56:12.735965Z","submitted_at":"2025-02-05T20:43:48Z","title":"QuantSpec: Self-Speculative Decoding with Hierarchical Quantized KV Cache","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-09T04:28:03.953718Z"},"links":{"cited_paper":"/paper/2402.10517","citing_paper":"/paper/2502.10424"},"observation_digest":"sha256:cc5497af70b7adb2b2f06e9e61a5551ad8c473fd6331c00a83bc36382ebb80d5","observation_id":"7345ea2b-2c4f-431d-9eca-c27c29b848ff","resolution":{"observed_at":"2026-08-09T04:28:03.953718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.18313","last_updated":"2023-12-19T12:27:58Z","snapshot_observed_at":"2026-08-16T14:48:11.655051Z","submitted_at":"2023-10-27T17:59:51Z","title":"FP8-LM: Training FP8 Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.18313","snapshot_observed_at":"2026-08-09T04:28:03.957098Z","title":"Fp8-lm: Training fp8 large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.10424","last_updated":"2025-02-05T20:43:48Z","snapshot_observed_at":"2026-08-12T17:56:12.735965Z","submitted_at":"2025-02-05T20:43:48Z","title":"QuantSpec: Self-Speculative Decoding with Hierarchical Quantized KV Cache","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-09T04:28:03.957098Z"},"links":{"cited_paper":"/paper/2310.18313","citing_paper":"/paper/2502.10424"},"observation_digest":"sha256:c45dbe2d0ce5a88f360d536a06faa978b9d3690a76d02d443499f7c459687702","observation_id":"15b4d8c2-04c8-4e6c-92e6-dc57740d77a2","resolution":{"observed_at":"2026-08-09T04:28:03.957098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13137","last_updated":"2024-03-18T05:33:22Z","snapshot_observed_at":"2026-08-16T15:05:54.961547Z","submitted_at":"2023-08-25T02:28:35Z","title":"OmniQuant: Omnidirectionally Calibrated Quantization for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.13137","snapshot_observed_at":"2026-08-09T04:28:03.967798Z","title":"Omniquant: Omnidirectionally calibrated quantization for large lan- guage models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.10424","last_updated":"2025-02-05T20:43:48Z","snapshot_observed_at":"2026-08-12T17:56:12.735965Z","submitted_at":"2025-02-05T20:43:48Z","title":"QuantSpec: Self-Speculative Decoding with Hierarchical Quantized KV Cache","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-09T04:28:03.967798Z"},"links":{"cited_paper":"/paper/2308.13137","citing_paper":"/paper/2502.10424"},"observation_digest":"sha256:18d7c50b1fd415fdbf2e659e7dfc29fda93989323b68b04fb3831a3eee29bae9","observation_id":"35e1fb73-74f7-40d1-b9c5-c379f6b87548","resolution":{"observed_at":"2026-08-09T04:28:03.967798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.11912","last_updated":"2024-08-04T00:58:04Z","snapshot_observed_at":"2026-08-18T14:19:11.066807Z","submitted_at":"2024-04-18T05:25:54Z","title":"TriForce: Lossless Acceleration of Long Sequence Generation with Hierarchical Speculative Decoding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.11912","snapshot_observed_at":"2026-08-09T04:28:03.971156Z","title":"Sun, H., Chen, Z., Yang, X., Tian, Y ., and Chen, B","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.10424","last_updated":"2025-02-05T20:43:48Z","snapshot_observed_at":"2026-08-12T17:56:12.735965Z","submitted_at":"2025-02-05T20:43:48Z","title":"QuantSpec: Self-Speculative Decoding with Hierarchical Quantized KV Cache","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-09T04:28:03.971156Z"},"links":{"cited_paper":"/paper/2404.11912","citing_paper":"/paper/2502.10424"},"observation_digest":"sha256:8827f97cf494c23c1b89ea634091cb160c51072f1d25d30101c71c97ba37c4d3","observation_id":"9ad286d0-5105-4022-8ddd-c8bd2ec549bd","resolution":{"observed_at":"2026-08-09T04:28:03.971156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07979","last_updated":"2024-10-17T08:54:37Z","snapshot_observed_at":"2026-08-16T14:01:38.468398Z","submitted_at":"2024-04-11T17:57:22Z","title":"LLoCO: Learning Long Contexts Offline","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07979","snapshot_observed_at":"2026-08-09T04:28:03.974790Z","title":"E., and Popa, R","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.10424","last_updated":"2025-02-05T20:43:48Z","snapshot_observed_at":"2026-08-12T17:56:12.735965Z","submitted_at":"2025-02-05T20:43:48Z","title":"QuantSpec: Self-Speculative Decoding with Hierarchical Quantized KV Cache","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-09T04:28:03.974790Z"},"links":{"cited_paper":"/paper/2404.07979","citing_paper":"/paper/2502.10424"},"observation_digest":"sha256:8dc49a35bc1ba98b07414a19c5818b282b2f6952308a0d064c1614671aee978e","observation_id":"08e0a6d4-7da1-4fa0-8e17-c8c2fd0ae098","resolution":{"observed_at":"2026-08-09T04:28:03.974790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10774","last_updated":"2024-08-26T21:01:02Z","snapshot_observed_at":"2026-08-14T18:53:06.624928Z","submitted_at":"2024-06-16T01:33:02Z","title":"Quest: Query-Aware Sparsity for Efficient Long-Context LLM Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10774","snapshot_observed_at":"2026-08-09T04:28:03.978380Z","title":"Quest: Query-aware sparsity for efficient long-context llm inference","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.10424","last_updated":"2025-02-05T20:43:48Z","snapshot_observed_at":"2026-08-12T17:56:12.735965Z","submitted_at":"2025-02-05T20:43:48Z","title":"QuantSpec: Self-Speculative Decoding with Hierarchical Quantized KV Cache","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-09T04:28:03.978380Z"},"links":{"cited_paper":"/paper/2406.10774","citing_paper":"/paper/2502.10424"},"observation_digest":"sha256:a71e60f04ba52894b12dcbe35031f0960dcf49dc443f1a6bd7074786570bba9c","observation_id":"86de0b1e-cb5a-4131-9d4c-b24c85177233","resolution":{"observed_at":"2026-08-09T04:28:03.978380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12528","last_updated":"2024-05-21T06:37:03Z","snapshot_observed_at":"2026-08-16T13:51:05.505928Z","submitted_at":"2024-05-21T06:37:03Z","title":"SirLLM: Streaming Infinite Retentive LLM","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12528","snapshot_observed_at":"2026-08-09T04:28:03.985750Z","title":"Sirllm: Streaming infinite retentive llm","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.10424","last_updated":"2025-02-05T20:43:48Z","snapshot_observed_at":"2026-08-12T17:56:12.735965Z","submitted_at":"2025-02-05T20:43:48Z","title":"QuantSpec: Self-Speculative Decoding with Hierarchical Quantized KV Cache","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-09T04:28:03.985750Z"},"links":{"cited_paper":"/paper/2405.12528","citing_paper":"/paper/2502.10424"},"observation_digest":"sha256:a7acff513d6ca9af3654dc0f19022e1497cf9385dbc0cd24c738f9c3643bbfa4","observation_id":"a1038716-a5c5-420a-ab12-29e19053edf9","resolution":{"observed_at":"2026-08-09T04:28:03.985750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02694","last_updated":"2025-03-06T18:41:54Z","snapshot_observed_at":"2026-08-16T21:34:35.394829Z","submitted_at":"2024-10-03T17:20:11Z","title":"HELMET: How to Evaluate Long-Context Language Models Effectively and Thoroughly","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02694","snapshot_observed_at":"2026-08-09T04:28:03.989883Z","title":"Helmet: How to evaluate long-context language models effectively and thoroughly","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.10424","last_updated":"2025-02-05T20:43:48Z","snapshot_observed_at":"2026-08-12T17:56:12.735965Z","submitted_at":"2025-02-05T20:43:48Z","title":"QuantSpec: Self-Speculative Decoding with Hierarchical Quantized KV Cache","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-09T04:28:03.989883Z"},"links":{"cited_paper":"/paper/2410.02694","citing_paper":"/paper/2502.10424"},"observation_digest":"sha256:c0abf4d7b13e4f8ed48cded3239034e9aec0d972dd34542a6a57ca5ea8e8de60","observation_id":"d1a313e2-e6e0-47ca-99dd-de52c3fe93f1","resolution":{"observed_at":"2026-08-09T04:28:03.989883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:28:03.993674Z","title":"Sageatten- tion: Accurate 8-bit attention for plug-and-play inference acceleration","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.10424","last_updated":"2025-02-05T20:43:48Z","snapshot_observed_at":"2026-08-12T17:56:12.735965Z","submitted_at":"2025-02-05T20:43:48Z","title":"QuantSpec: Self-Speculative Decoding with Hierarchical Quantized KV Cache","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-09T04:28:03.993674Z"},"links":{"citing_paper":"/paper/2502.10424"},"observation_digest":"sha256:46d02cde349305436b0834133bd0e223b3f97d1d9280ec885dcd81e494d07e8f","observation_id":"15dcf886-47a0-46b8-9aec-886205754ddd","resolution":{"observed_at":"2026-08-09T04:28:03.993674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03856","last_updated":"2024-09-05T18:38:07Z","snapshot_observed_at":"2026-08-16T13:20:56.666456Z","submitted_at":"2024-09-05T18:38:07Z","title":"Sirius: Contextual Sparsity with Correction for Efficient LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03856","snapshot_observed_at":"2026-08-09T04:28:03.997075Z","title":"Sir- ius: Contextual sparsity with correction for efficient llms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.10424","last_updated":"2025-02-05T20:43:48Z","snapshot_observed_at":"2026-08-12T17:56:12.735965Z","submitted_at":"2025-02-05T20:43:48Z","title":"QuantSpec: Self-Speculative Decoding with Hierarchical Quantized KV Cache","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-09T04:28:03.997075Z"},"links":{"cited_paper":"/paper/2409.03856","citing_paper":"/paper/2502.10424"},"observation_digest":"sha256:01ed5319854c2461f98afb928ccf585d22bb1591fc6cda8e9326ab58e3a6a3ae","observation_id":"89c69067-4879-4461-a393-8a3255bd9f70","resolution":{"observed_at":"2026-08-09T04:28:03.997075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:28:04.545867Z","title":"Attention Module’s Inference Workflow The inference of LLMs can be divided into 2 parts: the prefill stage and the decoding stage","venue":null,"work_id":"dfbaa1fb-58a9-43e8-8dba-a60289db03e4","year":2024},"citing_paper":{"arxiv_id":"2502.10424","last_updated":"2025-02-05T20:43:48Z","snapshot_observed_at":"2026-08-12T17:56:12.735965Z","submitted_at":"2025-02-05T20:43:48Z","title":"QuantSpec: Self-Speculative Decoding with Hierarchical Quantized KV Cache","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-09T04:28:04.000604Z"},"links":{"citing_paper":"/paper/2502.10424"},"observation_digest":"sha256:4a6a4d50a28c434c6d3cf411af5495904ec9ea04acfedcdf85f7e5176ceee278","observation_id":"45ba0280-3b35-4efc-94af-26e76cb50cbd","resolution":{"observed_at":"2026-08-09T04:28:04.550039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:28:04.535404Z","title":null,"venue":null,"work_id":"28ed5f8d-d9f4-42f9-ad5d-07e1c2a43a01","year":2023},"citing_paper":{"arxiv_id":"2502.10424","last_updated":"2025-02-05T20:43:48Z","snapshot_observed_at":"2026-08-12T17:56:12.735965Z","submitted_at":"2025-02-05T20:43:48Z","title":"QuantSpec: Self-Speculative Decoding with Hierarchical Quantized KV Cache","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-09T04:28:04.003607Z"},"links":{"citing_paper":"/paper/2502.10424"},"observation_digest":"sha256:2361aa9c46c5d7c0602b5196a2fae00fe495617a85e79f05eaee2a4d9ba3a338","observation_id":"381e4955-fb7f-41b2-8a31-e7cd894694d5","resolution":{"observed_at":"2026-08-09T04:28:04.538751Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:28:04.512829Z","title":"• C4 (Raffel et al., 2020): C4 is a large scale web-crawled language modelling dataset mostly used for pretraining LLMs","venue":null,"work_id":"a80c2193-040f-4288-871b-abe68f2780a3","year":2020},"citing_paper":{"arxiv_id":"2502.10424","last_updated":"2025-02-05T20:43:48Z","snapshot_observed_at":"2026-08-12T17:56:12.735965Z","submitted_at":"2025-02-05T20:43:48Z","title":"QuantSpec: Self-Speculative Decoding with Hierarchical Quantized KV Cache","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-09T04:28:04.009153Z"},"links":{"citing_paper":"/paper/2502.10424"},"observation_digest":"sha256:10d2a7659c7d36fee5bcf14b6785acc4eec046e03b97e1f1a4ab50c56034ba7e","observation_id":"a9fa495e-ab32-4716-8992-60667af416e6","resolution":{"observed_at":"2026-08-09T04:28:04.518602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:28:04.525447Z","title":null,"venue":null,"work_id":"d429d3f8-c47e-4621-ac12-736b32332f73","year":2023},"citing_paper":{"arxiv_id":"2502.10424","last_updated":"2025-02-05T20:43:48Z","snapshot_observed_at":"2026-08-12T17:56:12.735965Z","submitted_at":"2025-02-05T20:43:48Z","title":"QuantSpec: Self-Speculative Decoding with Hierarchical Quantized KV Cache","version":1},"reference_index":128,"source":"pdf_text","source_observed_at":"2026-08-09T04:28:04.006424Z"},"links":{"citing_paper":"/paper/2502.10424"},"observation_digest":"sha256:fa31db2d3e01bed3ecffc4bcaa4c68ac341414ee4cceb71a19f84d19e871a2ad","observation_id":"8178b162-b3f3-46b6-a433-7affa2923587","resolution":{"observed_at":"2026-08-09T04:28:04.528773Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19313","last_updated":"2025-02-12T23:37:50Z","snapshot_observed_at":"2026-08-16T13:06:02.836373Z","submitted_at":"2024-10-25T05:59:30Z","title":"COAT: Compressing Optimizer states and Activation for Memory-Efficient FP8 Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.19313","snapshot_observed_at":"2026-08-09T04:28:03.982110Z","title":"Coat: Compressing optimizer states and activation for memory-efficient fp8 training, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.10424","last_updated":"2025-02-05T20:43:48Z","snapshot_observed_at":"2026-08-12T17:56:12.735965Z","submitted_at":"2025-02-05T20:43:48Z","title":"QuantSpec: Self-Speculative Decoding with Hierarchical Quantized KV Cache","version":1},"reference_index":2009,"source":"pdf_text","source_observed_at":"2026-08-09T04:28:03.982110Z"},"links":{"cited_paper":"/paper/2410.19313","citing_paper":"/paper/2502.10424"},"observation_digest":"sha256:0a5ef4fb40ca38c242b5f0e97b7750fd254aaa8947a922d49dd993dd32dc1dbb","observation_id":"22feb461-c743-4065-9d5a-f9a8fd9ae6d4","resolution":{"observed_at":"2026-08-09T04:28:03.982110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09636","last_updated":"2024-07-23T17:55:30Z","snapshot_observed_at":"2026-08-18T11:14:41.086889Z","submitted_at":"2024-03-14T17:59:26Z","title":"Dynamic Memory Compression: Retrofitting LLMs for Accelerated Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09636","snapshot_observed_at":"2026-08-09T04:28:03.950468Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.10424","last_updated":"2025-02-05T20:43:48Z","snapshot_observed_at":"2026-08-12T17:56:12.735965Z","submitted_at":"2025-02-05T20:43:48Z","title":"QuantSpec: Self-Speculative Decoding with Hierarchical Quantized KV Cache","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-09T04:28:03.950468Z"},"links":{"cited_paper":"/paper/2403.09636","citing_paper":"/paper/2502.10424"},"observation_digest":"sha256:9cc40ae11ce9a3c536dff6a19b7289978113d15f281ff646d1201ee4aa89db28","observation_id":"9058b287-13a9-472f-8692-f8d0b39a65b5","resolution":{"observed_at":"2026-08-09T04:28:03.950468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-08-10T02:15:37.272323Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.05507","snapshot_observed_at":"2026-08-09T04:28:03.960513Z","title":"Raffel, C., Shazeer, N., Roberts, A., Lee, K., Narang, S., Matena, M., Zhou, Y ., Li, W., Liu, P","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2502.10424","last_updated":"2025-02-05T20:43:48Z","snapshot_observed_at":"2026-08-12T17:56:12.735965Z","submitted_at":"2025-02-05T20:43:48Z","title":"QuantSpec: Self-Speculative Decoding with Hierarchical Quantized KV Cache","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-09T04:28:03.960513Z"},"links":{"cited_paper":"/paper/1911.05507","citing_paper":"/paper/2502.10424"},"observation_digest":"sha256:8d38cded3f87e088e12035dd4a0c55e8d280aebd6fc9c5d996fa36d7e2c8eb3f","observation_id":"2e6ab705-b51c-407f-82c4-17636565bcfb","resolution":{"observed_at":"2026-08-09T04:28:03.960513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08608","last_updated":"2024-07-12T22:15:02Z","snapshot_observed_at":"2026-08-16T11:15:38.109255Z","submitted_at":"2024-07-11T15:44:48Z","title":"FlashAttention-3: Fast and Accurate Attention with Asynchrony and Low-precision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08608","snapshot_observed_at":"2026-08-09T04:28:03.964126Z","title":"Flashattention-3: Fast and accurate atten- tion with asynchrony and low-precision","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.10424","last_updated":"2025-02-05T20:43:48Z","snapshot_observed_at":"2026-08-12T17:56:12.735965Z","submitted_at":"2025-02-05T20:43:48Z","title":"QuantSpec: Self-Speculative Decoding with Hierarchical Quantized KV Cache","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-09T04:28:03.964126Z"},"links":{"cited_paper":"/paper/2407.08608","citing_paper":"/paper/2502.10424"},"observation_digest":"sha256:c9966174128a1250f4221b5feb9c4c78e2b90e8bb8ea6689230fbc9a2c829f5c","observation_id":"335e973b-de6e-4ba3-92bf-c5d1b97644c2","resolution":{"observed_at":"2026-08-09T04:28:03.964126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02750","last_updated":"2024-07-25T09:16:05Z","snapshot_observed_at":"2026-08-12T17:03:50.984887Z","submitted_at":"2024-02-05T06:06:47Z","title":"KIVI: A Tuning-Free Asymmetric 2bit Quantization for KV Cache","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02750","snapshot_observed_at":"2026-08-09T04:28:03.946924Z","title":"Scissorhands: Exploiting the persistence of importance hypothesis for llm kv cache compression at test time","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.10424","last_updated":"2025-02-05T20:43:48Z","snapshot_observed_at":"2026-08-12T17:56:12.735965Z","submitted_at":"2025-02-05T20:43:48Z","title":"QuantSpec: Self-Speculative Decoding with Hierarchical Quantized KV Cache","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-09T04:28:03.946924Z"},"links":{"cited_paper":"/paper/2402.02750","citing_paper":"/paper/2502.10424"},"observation_digest":"sha256:f171693047c30b83f9df607baa6de2b8e5a99cd7ce5355666dac46b4792556c5","observation_id":"65a207b7-39fa-4add-ac92-47e2d62c9e33","resolution":{"observed_at":"2026-08-09T04:28:03.946924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.14135","last_updated":"2022-06-23T17:53:32Z","snapshot_observed_at":"2026-07-06T13:14:48.753329Z","submitted_at":"2022-05-27T17:53:09Z","title":"FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.14135","snapshot_observed_at":"2026-08-09T04:28:03.918605Z","title":"Dao, T., Haziza, D., Massa, F., and Sisov, G","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10424","last_updated":"2025-02-05T20:43:48Z","snapshot_observed_at":"2026-08-12T17:56:12.735965Z","submitted_at":"2025-02-05T20:43:48Z","title":"QuantSpec: Self-Speculative Decoding with Hierarchical Quantized KV Cache","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-09T04:28:03.918605Z"},"links":{"cited_paper":"/paper/2205.14135","citing_paper":"/paper/2502.10424"},"observation_digest":"sha256:f981889a783374b070632123ac0822be6a3e8a9067e39d951efc13422d008499","observation_id":"7bd10325-3177-4fc1-ba60-2ea109fdaa68","resolution":{"observed_at":"2026-08-09T04:28:03.918605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16997","last_updated":"2024-09-26T06:13:04Z","snapshot_observed_at":"2026-08-16T13:15:28.163038Z","submitted_at":"2024-09-25T15:02:25Z","title":"INT-FlashAttention: Enabling Flash Attention for INT8 Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.16997","snapshot_observed_at":"2026-08-09T04:28:03.914857Z","title":"Int-flashattention: Enabling flash attention for int8 quantization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.10424","last_updated":"2025-02-05T20:43:48Z","snapshot_observed_at":"2026-08-12T17:56:12.735965Z","submitted_at":"2025-02-05T20:43:48Z","title":"QuantSpec: Self-Speculative Decoding with Hierarchical Quantized KV Cache","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-09T04:28:03.914857Z"},"links":{"cited_paper":"/paper/2409.16997","citing_paper":"/paper/2502.10424"},"observation_digest":"sha256:eef10915a44c52d2047a79b152c06fdd71dc321081c6c63f5b20c59dde90aeac","observation_id":"08105f62-3cb3-4c3d-94e8-4f4c00371321","resolution":{"observed_at":"2026-08-09T04:28:03.914857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12981","last_updated":"2024-05-21T17:59:29Z","snapshot_observed_at":"2026-08-16T13:50:52.495994Z","submitted_at":"2024-05-21T17:59:29Z","title":"Reducing Transformer Key-Value Cache Size with Cross-Layer Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12981","snapshot_observed_at":"2026-08-09T04:28:03.903083Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.10424","last_updated":"2025-02-05T20:43:48Z","snapshot_observed_at":"2026-08-12T17:56:12.735965Z","submitted_at":"2025-02-05T20:43:48Z","title":"QuantSpec: Self-Speculative Decoding with Hierarchical Quantized KV Cache","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-09T04:28:03.903083Z"},"links":{"cited_paper":"/paper/2405.12981","citing_paper":"/paper/2502.10424"},"observation_digest":"sha256:f0b4d07138fccc074f0b7695e72ae080a469c2922b9fe266ead230d751f10437","observation_id":"30d4b816-ebab-44fb-b757-ee0633875c68","resolution":{"observed_at":"2026-08-09T04:28:03.903083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11131","last_updated":"2024-02-16T23:36:43Z","snapshot_observed_at":"2026-08-16T14:17:49.569062Z","submitted_at":"2024-02-16T23:36:43Z","title":"Speculative Streaming: Fast LLM Inference without Auxiliary Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11131","snapshot_observed_at":"2026-08-09T04:28:03.898221Z","title":"Bhendawade, N., Belousova, I., Fu, Q., Mason, H., Raste- gari, M., and Najibi, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.10424","last_updated":"2025-02-05T20:43:48Z","snapshot_observed_at":"2026-08-12T17:56:12.735965Z","submitted_at":"2025-02-05T20:43:48Z","title":"QuantSpec: Self-Speculative Decoding with Hierarchical Quantized KV Cache","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-09T04:28:03.898221Z"},"links":{"cited_paper":"/paper/2402.11131","citing_paper":"/paper/2502.10424"},"observation_digest":"sha256:a35f6b625d4691f796e26105a201365b189213ceab4659916a49a4907b834021","observation_id":"4c04e46d-7b85-4a4a-89a6-1e6ba3cd289f","resolution":{"observed_at":"2026-08-09T04:28:03.898221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.10424","last_updated":"2025-02-05T20:43:48Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-12T17:56:12.735965Z","submitted_at":"2025-02-05T20:43:48Z","title":"QuantSpec: Self-Speculative Decoding with Hierarchical Quantized KV Cache"},"reference_resolution":{"displayed":33,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":0,"verified_fuzzy":2},"total_outbound_references":33},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 33 of 33 outbound references and 4 inbound Pith citation observations for arXiv:2502.10424."}