{"as_of":"2026-08-16T06:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f2a64a6ed5250fead5f94c41008075035e6a26fa572f29d39880ea207692f9b3","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T11:37:07.697300Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T00:38:47.483457Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-20T20:59:01.556666Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.18077","last_updated":"2025-06-08T21:23:22Z","snapshot_observed_at":"2026-08-15T19:30:15.609643Z","submitted_at":"2024-11-27T06:10:49Z","title":"MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18077","snapshot_observed_at":"2026-08-11T00:38:47.483457Z","title":"Minikv: Pushing the limits of llm inference via 2-bit layer-discriminative kv cache,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19442","last_updated":"2025-07-30T05:24:46Z","snapshot_observed_at":"2026-08-15T13:24:51.697670Z","submitted_at":"2024-12-27T04:17:57Z","title":"A Survey on Large Language Model Acceleration based on KV Cache Management","version":3},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-11T00:38:47.483457Z"},"links":{"cited_paper":"/paper/2411.18077","citing_paper":"/paper/2412.19442"},"observation_digest":"sha256:af1e48944a09f42832cc17ad01e14a311b85ff93482b044e52dc3760f8d784be","observation_id":"b1956160-20f3-4901-b2c6-5b51d48b213a","resolution":{"observed_at":"2026-08-11T00:38:47.483457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18077","last_updated":"2025-06-08T21:23:22Z","snapshot_observed_at":"2026-08-15T19:30:15.609643Z","submitted_at":"2024-11-27T06:10:49Z","title":"MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache","version":3},"cited_work":{"arxiv_id":"2411.18077","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.18077","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2411.18077 , archivePrefix=","venue":null,"work_id":"8b96ab00-6f39-497d-b161-17221f0b82ac","year":2024},"citing_paper":{"arxiv_id":"2605.14292","last_updated":"2026-05-17T02:21:29Z","snapshot_observed_at":"2026-08-07T18:13:26.175518Z","submitted_at":"2026-05-14T02:50:20Z","title":"Minimal-Intervention KV Retention via Set-Conditioned Diversity","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-20T20:58:07.403912Z"},"links":{"cited_paper":"/paper/2411.18077","citing_paper":"/paper/2605.14292"},"observation_digest":"sha256:c1557a2ffb4968df5338dd833fcc9f7443c404b0cfa84e28f2ab7360958ea349","observation_id":"c752e517-becb-4267-8201-5ca35c10a045","resolution":{"observed_at":"2026-05-20T20:59:01.558729Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18077","last_updated":"2025-06-08T21:23:22Z","snapshot_observed_at":"2026-08-15T19:30:15.609643Z","submitted_at":"2024-11-27T06:10:49Z","title":"MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache","version":3},"cited_work":{"arxiv_id":"2411.18077","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.18077","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2411.18077 , archivePrefix=","venue":null,"work_id":"8b96ab00-6f39-497d-b161-17221f0b82ac","year":2024},"citing_paper":{"arxiv_id":"2605.17757","last_updated":"2026-05-18T02:24:29Z","snapshot_observed_at":"2026-08-15T00:39:44.412521Z","submitted_at":"2026-05-18T02:24:29Z","title":"OSCAR: Offline Spectral Covariance-Aware Rotation for 2-bit KV Cache Quantization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-20T12:16:07.797702Z"},"links":{"cited_paper":"/paper/2411.18077","citing_paper":"/paper/2605.17757"},"observation_digest":"sha256:c9e718f796779aed68975a2fb7c6bb33cae81e83a310976c92bd128ad7c243e5","observation_id":"bbcf9321-28d6-400b-946f-c5dddb42a72e","resolution":{"observed_at":"2026-05-20T12:18:16.562435Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2411.18077/citation-record","integrity":"/paper/2411.18077/integrity","json":"/paper/2411.18077/citation-record.json","paper":"/paper/2411.18077"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:37:08.110511Z","title":null,"venue":null,"work_id":"6e12ee54-8c5f-4a3f-af22-fc986832c506","year":2024},"citing_paper":{"arxiv_id":"2411.18077","last_updated":"2025-06-08T21:23:22Z","snapshot_observed_at":"2026-08-15T19:30:15.609643Z","submitted_at":"2024-11-27T06:10:49Z","title":"MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-12T11:37:07.544023Z"},"links":{"citing_paper":"/paper/2411.18077"},"observation_digest":"sha256:d7894cbd486a6500cd441fb7222df2cf3bb86243c754c23ec274bd570f436561","observation_id":"e7ad4eaf-d1d5-4d47-a479-334cd7017ad5","resolution":{"observed_at":"2026-08-12T11:37:08.114579Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.14508","last_updated":"2024-06-19T04:00:32Z","snapshot_observed_at":"2026-08-08T03:49:18.086396Z","submitted_at":"2023-08-28T11:53:40Z","title":"LongBench: A Bilingual, Multitask Benchmark for Long Context Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.14508","snapshot_observed_at":"2026-08-12T11:37:07.548481Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18077","last_updated":"2025-06-08T21:23:22Z","snapshot_observed_at":"2026-08-15T19:30:15.609643Z","submitted_at":"2024-11-27T06:10:49Z","title":"MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-12T11:37:07.548481Z"},"links":{"cited_paper":"/paper/2308.14508","citing_paper":"/paper/2411.18077"},"observation_digest":"sha256:4c5afc1762c41f4136c3ec629af02cebea082c346c17150354024565d56d122b","observation_id":"5af67f7f-5cea-4d68-bef3-4751fcbf1add","resolution":{"observed_at":"2026-08-12T11:37:07.548481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12981","last_updated":"2024-05-21T17:59:29Z","snapshot_observed_at":"2026-08-14T05:37:38.971220Z","submitted_at":"2024-05-21T17:59:29Z","title":"Reducing Transformer Key-Value Cache Size with Cross-Layer Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12981","snapshot_observed_at":"2026-08-12T11:37:07.553067Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18077","last_updated":"2025-06-08T21:23:22Z","snapshot_observed_at":"2026-08-15T19:30:15.609643Z","submitted_at":"2024-11-27T06:10:49Z","title":"MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-12T11:37:07.553067Z"},"links":{"cited_paper":"/paper/2405.12981","citing_paper":"/paper/2411.18077"},"observation_digest":"sha256:379e9616bdac247edd8741aa5275a74f68450b2227d480282bcadf9be6b178b6","observation_id":"592c3a29-2acc-4656-848d-50800257f37c","resolution":{"observed_at":"2026-08-12T11:37:07.553067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02069","last_updated":"2025-05-15T17:18:12Z","snapshot_observed_at":"2026-08-13T04:39:30.300015Z","submitted_at":"2024-06-04T07:51:30Z","title":"PyramidKV: Dynamic KV Cache Compression based on Pyramidal Information Funneling","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02069","snapshot_observed_at":"2026-08-12T11:37:07.557293Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18077","last_updated":"2025-06-08T21:23:22Z","snapshot_observed_at":"2026-08-15T19:30:15.609643Z","submitted_at":"2024-11-27T06:10:49Z","title":"MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-12T11:37:07.557293Z"},"links":{"cited_paper":"/paper/2406.02069","citing_paper":"/paper/2411.18077"},"observation_digest":"sha256:aa0d3c3c02116f3ed60103d2486aa296aca14a37adfc342ab3e6c275a56b0603","observation_id":"7d456d26-f44c-45d2-870e-b89f54a6f0c5","resolution":{"observed_at":"2026-08-12T11:37:07.557293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:37:07.561541Z","title":"Fu, Stefano Ermon, Atri Rudra, and Christopher R \\' e","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.18077","last_updated":"2025-06-08T21:23:22Z","snapshot_observed_at":"2026-08-15T19:30:15.609643Z","submitted_at":"2024-11-27T06:10:49Z","title":"MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-12T11:37:07.561541Z"},"links":{"citing_paper":"/paper/2411.18077"},"observation_digest":"sha256:31128b5a0874ef515e1273f97aa1f75cca66335ca9bc3bfc6c3354a54ee0b646","observation_id":"03199717-1dcd-425a-9376-503a74745195","resolution":{"observed_at":"2026-08-12T11:37:07.561541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-12T11:37:07.565472Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2411.18077","last_updated":"2025-06-08T21:23:22Z","snapshot_observed_at":"2026-08-15T19:30:15.609643Z","submitted_at":"2024-11-27T06:10:49Z","title":"MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-12T11:37:07.565472Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2411.18077"},"observation_digest":"sha256:04652ab4251b969b1dbd001ec6f320deba6b369eebc6866c1e7259e8c6efd415","observation_id":"199d81b7-0328-4935-ada3-998fede18f89","resolution":{"observed_at":"2026-08-12T11:37:07.565472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17323","last_updated":"2023-03-22T13:10:47Z","snapshot_observed_at":"2026-08-11T21:19:33.078277Z","submitted_at":"2022-10-31T13:42:40Z","title":"GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.17323","snapshot_observed_at":"2026-08-12T11:37:07.570007Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.18077","last_updated":"2025-06-08T21:23:22Z","snapshot_observed_at":"2026-08-15T19:30:15.609643Z","submitted_at":"2024-11-27T06:10:49Z","title":"MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-12T11:37:07.570007Z"},"links":{"cited_paper":"/paper/2210.17323","citing_paper":"/paper/2411.18077"},"observation_digest":"sha256:96052afe35fd109e380ae6b7151c8fc03ce53bab340f1714381b0d77eb3c663c","observation_id":"e8433fc1-ed3c-4e87-9e95-4dd9418229ce","resolution":{"observed_at":"2026-08-12T11:37:07.570007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01801","last_updated":"2024-10-29T18:26:09Z","snapshot_observed_at":"2026-08-14T11:45:47.400186Z","submitted_at":"2023-10-03T05:17:08Z","title":"Model Tells You What to Discard: Adaptive KV Cache Compression for LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01801","snapshot_observed_at":"2026-08-12T11:37:07.573793Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18077","last_updated":"2025-06-08T21:23:22Z","snapshot_observed_at":"2026-08-15T19:30:15.609643Z","submitted_at":"2024-11-27T06:10:49Z","title":"MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-12T11:37:07.573793Z"},"links":{"cited_paper":"/paper/2310.01801","citing_paper":"/paper/2411.18077"},"observation_digest":"sha256:1b8595481b6786422256f529cdd1b282397af69b7a06354931b70b18ca1b905f","observation_id":"32394cf1-ad8c-4554-8e12-3cdc54a95116","resolution":{"observed_at":"2026-08-12T11:37:07.573793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-13T04:29:50.330115Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-12T11:37:07.577744Z","title":"Mahoney, Yakun Sophia Shao, Kurt Keutzer, and Amir Gholami","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18077","last_updated":"2025-06-08T21:23:22Z","snapshot_observed_at":"2026-08-15T19:30:15.609643Z","submitted_at":"2024-11-27T06:10:49Z","title":"MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-12T11:37:07.577744Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2411.18077"},"observation_digest":"sha256:9033cc7bfa7bd82d2478b8f49761e2454d272eb00937c5ceafcbc0e5a4daf15a","observation_id":"4cf2ff58-02f5-4c4c-91b4-2c10cc73130d","resolution":{"observed_at":"2026-08-12T11:37:07.577744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-12T11:37:07.581390Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18077","last_updated":"2025-06-08T21:23:22Z","snapshot_observed_at":"2026-08-15T19:30:15.609643Z","submitted_at":"2024-11-27T06:10:49Z","title":"MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-12T11:37:07.581390Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2411.18077"},"observation_digest":"sha256:72362a57853a9501785d9e05e53124a8eb4433a2d018e85b46233fe837902b81","observation_id":"c6ce3c48-7d7e-4ca0-840a-3a7eb8132d43","resolution":{"observed_at":"2026-08-12T11:37:07.581390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:37:08.093030Z","title":null,"venue":null,"work_id":"a4379367-9b87-46b1-8bdf-16e9c40ea82c","year":2016},"citing_paper":{"arxiv_id":"2411.18077","last_updated":"2025-06-08T21:23:22Z","snapshot_observed_at":"2026-08-15T19:30:15.609643Z","submitted_at":"2024-11-27T06:10:49Z","title":"MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-12T11:37:07.585359Z"},"links":{"citing_paper":"/paper/2411.18077"},"observation_digest":"sha256:f68654f328a4a50c8b560dc82afe6e2f758e666f9513241efd6df2e0dc20d0bc","observation_id":"95b0495f-cc05-4fd9-b454-a6d9643c4add","resolution":{"observed_at":"2026-08-12T11:37:08.096814Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14469","last_updated":"2024-06-17T03:01:58Z","snapshot_observed_at":"2026-08-14T12:21:04.886717Z","submitted_at":"2024-04-22T17:42:58Z","title":"SnapKV: LLM Knows What You are Looking for Before Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14469","snapshot_observed_at":"2026-08-12T11:37:07.588847Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18077","last_updated":"2025-06-08T21:23:22Z","snapshot_observed_at":"2026-08-15T19:30:15.609643Z","submitted_at":"2024-11-27T06:10:49Z","title":"MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-12T11:37:07.588847Z"},"links":{"cited_paper":"/paper/2404.14469","citing_paper":"/paper/2411.18077"},"observation_digest":"sha256:41800c38be07b091894d324c2451f0a7372da42368475d8896421a72e72b4d72","observation_id":"904d9b76-48d9-40e5-8e95-fd183426b773","resolution":{"observed_at":"2026-08-12T11:37:07.588847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:37:07.592449Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18077","last_updated":"2025-06-08T21:23:22Z","snapshot_observed_at":"2026-08-15T19:30:15.609643Z","submitted_at":"2024-11-27T06:10:49Z","title":"MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-12T11:37:07.592449Z"},"links":{"citing_paper":"/paper/2411.18077"},"observation_digest":"sha256:b21cb66ba0b6ab8681f01e5032793bdbd80e679db2a042f138bfe09f8261c3ac","observation_id":"adbad6c2-b9d1-468a-b410-838668088066","resolution":{"observed_at":"2026-08-12T11:37:07.592449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14366","last_updated":"2024-09-07T02:52:29Z","snapshot_observed_at":"2026-08-13T00:00:46.126397Z","submitted_at":"2024-05-23T09:43:52Z","title":"MiniCache: KV Cache Compression in Depth Dimension for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14366","snapshot_observed_at":"2026-08-12T11:37:07.595756Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18077","last_updated":"2025-06-08T21:23:22Z","snapshot_observed_at":"2026-08-15T19:30:15.609643Z","submitted_at":"2024-11-27T06:10:49Z","title":"MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-12T11:37:07.595756Z"},"links":{"cited_paper":"/paper/2405.14366","citing_paper":"/paper/2411.18077"},"observation_digest":"sha256:3a9d3d2453abe70d84f315f968890ecc413fae5f069e6152267964e7ba377a51","observation_id":"39ffc95a-dca4-42ef-829d-d6bc784359bd","resolution":{"observed_at":"2026-08-12T11:37:07.595756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09650","last_updated":"2021-06-17T16:53:22Z","snapshot_observed_at":"2026-08-15T09:59:29.156934Z","submitted_at":"2021-06-17T16:53:22Z","title":"Multi-head or Single-head? An Empirical Comparison for Transformer Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09650","snapshot_observed_at":"2026-08-12T11:37:07.599724Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.18077","last_updated":"2025-06-08T21:23:22Z","snapshot_observed_at":"2026-08-15T19:30:15.609643Z","submitted_at":"2024-11-27T06:10:49Z","title":"MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-12T11:37:07.599724Z"},"links":{"cited_paper":"/paper/2106.09650","citing_paper":"/paper/2411.18077"},"observation_digest":"sha256:f4f3a7d9c92044a9e69d18f75598cf3c7747cbbe519d5fe817a31ee387649ea5","observation_id":"4f7676d9-5061-4d50-a2a4-ea539a3a263e","resolution":{"observed_at":"2026-08-12T11:37:07.599724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.17888","last_updated":"2023-05-29T05:22:11Z","snapshot_observed_at":"2026-08-13T11:30:33.812255Z","submitted_at":"2023-05-29T05:22:11Z","title":"LLM-QAT: Data-Free Quantization Aware Training for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.17888","snapshot_observed_at":"2026-08-12T11:37:07.603254Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18077","last_updated":"2025-06-08T21:23:22Z","snapshot_observed_at":"2026-08-15T19:30:15.609643Z","submitted_at":"2024-11-27T06:10:49Z","title":"MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-12T11:37:07.603254Z"},"links":{"cited_paper":"/paper/2305.17888","citing_paper":"/paper/2411.18077"},"observation_digest":"sha256:a607d6bfd20654e25b84fdec71976ef19d75e897e9b41c892ae67c0037d293b3","observation_id":"e1734be7-5d10-467c-9a4d-755149e86b5a","resolution":{"observed_at":"2026-08-12T11:37:07.603254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:37:08.074652Z","title":null,"venue":null,"work_id":"57c10a12-a081-4eb5-a260-ff6c93a4e44a","year":2023},"citing_paper":{"arxiv_id":"2411.18077","last_updated":"2025-06-08T21:23:22Z","snapshot_observed_at":"2026-08-15T19:30:15.609643Z","submitted_at":"2024-11-27T06:10:49Z","title":"MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-12T11:37:07.607108Z"},"links":{"citing_paper":"/paper/2411.18077"},"observation_digest":"sha256:04ea29fed020567489c5e67790e30574c8eb710304cd3f61a032d88ff0069f25","observation_id":"7ae1c708-e961-4a3a-b887-930d580ce0d4","resolution":{"observed_at":"2026-08-12T11:37:08.078454Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02750","last_updated":"2024-07-25T09:16:05Z","snapshot_observed_at":"2026-08-12T17:03:50.984887Z","submitted_at":"2024-02-05T06:06:47Z","title":"KIVI: A Tuning-Free Asymmetric 2bit Quantization for KV Cache","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02750","snapshot_observed_at":"2026-08-12T11:37:07.610637Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18077","last_updated":"2025-06-08T21:23:22Z","snapshot_observed_at":"2026-08-15T19:30:15.609643Z","submitted_at":"2024-11-27T06:10:49Z","title":"MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-12T11:37:07.610637Z"},"links":{"cited_paper":"/paper/2402.02750","citing_paper":"/paper/2411.18077"},"observation_digest":"sha256:eec2ae0f2e520be6817e5623fda8fa9fb7b8f26360e74f6add72761ce494a608","observation_id":"1f830ab9-1b00-4ec0-95da-5b50c75c7476","resolution":{"observed_at":"2026-08-12T11:37:07.610637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09636","last_updated":"2024-07-23T17:55:30Z","snapshot_observed_at":"2026-08-15T14:07:44.298551Z","submitted_at":"2024-03-14T17:59:26Z","title":"Dynamic Memory Compression: Retrofitting LLMs for Accelerated Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09636","snapshot_observed_at":"2026-08-12T11:37:07.614689Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18077","last_updated":"2025-06-08T21:23:22Z","snapshot_observed_at":"2026-08-15T19:30:15.609643Z","submitted_at":"2024-11-27T06:10:49Z","title":"MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-12T11:37:07.614689Z"},"links":{"cited_paper":"/paper/2403.09636","citing_paper":"/paper/2411.18077"},"observation_digest":"sha256:801cc123d109290888593c5104d114d060335556bfd22606337998b65624c05a","observation_id":"e45af902-9bf3-44bc-bf9b-cd7f903b4e55","resolution":{"observed_at":"2026-08-12T11:37:07.614689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:37:08.063759Z","title":null,"venue":null,"work_id":"1bd66f24-1a22-4a5e-a8b6-6fb727500fdd","year":2025},"citing_paper":{"arxiv_id":"2411.18077","last_updated":"2025-06-08T21:23:22Z","snapshot_observed_at":"2026-08-15T19:30:15.609643Z","submitted_at":"2024-11-27T06:10:49Z","title":"MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-12T11:37:07.618605Z"},"links":{"citing_paper":"/paper/2411.18077"},"observation_digest":"sha256:c2ea5866f91ade7728fee71669028125ef7e753f05ca85badb48c50d598fd45f","observation_id":"a8b8127c-4618-4611-bc2b-9dbea5525753","resolution":{"observed_at":"2026-08-12T11:37:08.067490Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:37:07.622246Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18077","last_updated":"2025-06-08T21:23:22Z","snapshot_observed_at":"2026-08-15T19:30:15.609643Z","submitted_at":"2024-11-27T06:10:49Z","title":"MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-12T11:37:07.622246Z"},"links":{"citing_paper":"/paper/2411.18077"},"observation_digest":"sha256:e7a71686e81af1d812bfaffd435a1e390746c976958f9e5dc5b18285d561f622","observation_id":"7057606f-fac1-4ad3-aeb0-15f972b7e1ae","resolution":{"observed_at":"2026-08-12T11:37:07.622246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:37:08.045486Z","title":null,"venue":null,"work_id":"68083b77-0251-4dff-aff4-fd84f6a73097","year":2023},"citing_paper":{"arxiv_id":"2411.18077","last_updated":"2025-06-08T21:23:22Z","snapshot_observed_at":"2026-08-15T19:30:15.609643Z","submitted_at":"2024-11-27T06:10:49Z","title":"MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-12T11:37:07.625766Z"},"links":{"citing_paper":"/paper/2411.18077"},"observation_digest":"sha256:dc0d439569a721a2b4f7506c1f726a9dcc7db9e14cc66fb9cc4329fa8884d5b4","observation_id":"57c805ba-a686-4df7-9460-27b12a7190c3","resolution":{"observed_at":"2026-08-12T11:37:08.049427Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10774","last_updated":"2024-08-26T21:01:02Z","snapshot_observed_at":"2026-08-14T18:53:06.624928Z","submitted_at":"2024-06-16T01:33:02Z","title":"Quest: Query-Aware Sparsity for Efficient Long-Context LLM Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10774","snapshot_observed_at":"2026-08-12T11:37:07.629296Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18077","last_updated":"2025-06-08T21:23:22Z","snapshot_observed_at":"2026-08-15T19:30:15.609643Z","submitted_at":"2024-11-27T06:10:49Z","title":"MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-12T11:37:07.629296Z"},"links":{"cited_paper":"/paper/2406.10774","citing_paper":"/paper/2411.18077"},"observation_digest":"sha256:725fd7e0b2947cbc314cfcd1fa3e6e16fe9f20511973d8e9b2aeca700eb8f9af","observation_id":"3fa7a7c7-6b28-4d72-bb1f-86ea6ca9b1c5","resolution":{"observed_at":"2026-08-12T11:37:07.629296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:37:08.033829Z","title":null,"venue":null,"work_id":"94cf1923-99ac-41c1-bbcc-7de65fe70371","year":2019},"citing_paper":{"arxiv_id":"2411.18077","last_updated":"2025-06-08T21:23:22Z","snapshot_observed_at":"2026-08-15T19:30:15.609643Z","submitted_at":"2024-11-27T06:10:49Z","title":"MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-12T11:37:07.633190Z"},"links":{"citing_paper":"/paper/2411.18077"},"observation_digest":"sha256:c390530aa88f89b1273c4444cb88c45c174a5950609712300f6ddaea947003c2","observation_id":"bd394d09-30f7-4f6c-bfe9-99f30fa42aff","resolution":{"observed_at":"2026-08-12T11:37:08.037753Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-12T11:37:07.636669Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18077","last_updated":"2025-06-08T21:23:22Z","snapshot_observed_at":"2026-08-15T19:30:15.609643Z","submitted_at":"2024-11-27T06:10:49Z","title":"MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-12T11:37:07.636669Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2411.18077"},"observation_digest":"sha256:6de2edc227740ce417e31aeeb2ad9233689c79e0859859968b3fe90ef118f9a7","observation_id":"80ae3419-7cf7-48bd-860e-22fbb5e45893","resolution":{"observed_at":"2026-08-12T11:37:07.636669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:37:08.022398Z","title":null,"venue":null,"work_id":"e514598a-62dc-45f6-a473-bc87b7681c80","year":2024},"citing_paper":{"arxiv_id":"2411.18077","last_updated":"2025-06-08T21:23:22Z","snapshot_observed_at":"2026-08-15T19:30:15.609643Z","submitted_at":"2024-11-27T06:10:49Z","title":"MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-12T11:37:07.640473Z"},"links":{"citing_paper":"/paper/2411.18077"},"observation_digest":"sha256:d22f165fe6342f5393b02b9434b19f2b29f98583a671a89b6b619433f470207f","observation_id":"3788dc32-33fe-4100-9964-5c88c6e2a9c1","resolution":{"observed_at":"2026-08-12T11:37:08.026080Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03461","last_updated":"2025-02-05T18:58:19Z","snapshot_observed_at":"2026-08-10T16:22:07.766175Z","submitted_at":"2025-02-05T18:58:19Z","title":"Do Large Language Model Benchmarks Test Reliability?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03461","snapshot_observed_at":"2026-08-12T11:37:07.644899Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2411.18077","last_updated":"2025-06-08T21:23:22Z","snapshot_observed_at":"2026-08-15T19:30:15.609643Z","submitted_at":"2024-11-27T06:10:49Z","title":"MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-12T11:37:07.644899Z"},"links":{"cited_paper":"/paper/2502.03461","citing_paper":"/paper/2411.18077"},"observation_digest":"sha256:76a559c24a2b5d9b59514af71d9da70da8e146948250a90506baddc3f1f20595","observation_id":"97a6cc9b-743d-4e2d-8581-1a9877b43c1f","resolution":{"observed_at":"2026-08-12T11:37:07.644899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:37:08.011112Z","title":null,"venue":null,"work_id":"08f1d3c8-ed2b-47de-b47b-6b938a54ee80","year":2025},"citing_paper":{"arxiv_id":"2411.18077","last_updated":"2025-06-08T21:23:22Z","snapshot_observed_at":"2026-08-15T19:30:15.609643Z","submitted_at":"2024-11-27T06:10:49Z","title":"MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-12T11:37:07.648882Z"},"links":{"citing_paper":"/paper/2411.18077"},"observation_digest":"sha256:2a4666a8d87321cbdc9f19a478554535291be8557c2a8fb67ea00051fd3161a4","observation_id":"7e18dec0-c176-4357-b125-3a597f77447c","resolution":{"observed_at":"2026-08-12T11:37:08.014635Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:37:07.999886Z","title":null,"venue":null,"work_id":"5aec292c-6d6c-49ee-8368-e864512b766d","year":2019},"citing_paper":{"arxiv_id":"2411.18077","last_updated":"2025-06-08T21:23:22Z","snapshot_observed_at":"2026-08-15T19:30:15.609643Z","submitted_at":"2024-11-27T06:10:49Z","title":"MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-12T11:37:07.652446Z"},"links":{"citing_paper":"/paper/2411.18077"},"observation_digest":"sha256:9de6e3421698d1e7f329e61917dbaf55e37565cc8edb4cbf00181534405a4267","observation_id":"04249263-2fab-41bd-a950-dabe643a7754","resolution":{"observed_at":"2026-08-12T11:37:08.003790Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.13035","last_updated":"2025-03-13T03:16:43Z","snapshot_observed_at":"2026-08-13T08:49:48.714090Z","submitted_at":"2024-06-18T20:01:51Z","title":"D2O: Dynamic Discriminative Operations for Efficient Long-Context Inference of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.13035","snapshot_observed_at":"2026-08-12T11:37:07.655879Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18077","last_updated":"2025-06-08T21:23:22Z","snapshot_observed_at":"2026-08-15T19:30:15.609643Z","submitted_at":"2024-11-27T06:10:49Z","title":"MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-12T11:37:07.655879Z"},"links":{"cited_paper":"/paper/2406.13035","citing_paper":"/paper/2411.18077"},"observation_digest":"sha256:dfda30edce4bc4701809c6cb05a26d89966d09503d3899bddaad3765875b737b","observation_id":"c5ca8fff-152a-451d-aea9-2bebe4f1518c","resolution":{"observed_at":"2026-08-12T11:37:07.655879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.15574","last_updated":"2024-04-24T00:24:03Z","snapshot_observed_at":"2026-08-13T00:23:22.242528Z","submitted_at":"2024-04-24T00:24:03Z","title":"Retrieval Head Mechanistically Explains Long-Context Factuality","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.15574","snapshot_observed_at":"2026-08-12T11:37:07.659393Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18077","last_updated":"2025-06-08T21:23:22Z","snapshot_observed_at":"2026-08-15T19:30:15.609643Z","submitted_at":"2024-11-27T06:10:49Z","title":"MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-12T11:37:07.659393Z"},"links":{"cited_paper":"/paper/2404.15574","citing_paper":"/paper/2411.18077"},"observation_digest":"sha256:2e3253420c6b295840b8fadec7212e77fc66b043984843828a7b2c00006b71f2","observation_id":"e6564002-5de1-46ec-94b7-1698ddbae20a","resolution":{"observed_at":"2026-08-12T11:37:07.659393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:37:07.987439Z","title":null,"venue":null,"work_id":"156bc782-90e0-44a3-98c7-24a58484deb4","year":2023},"citing_paper":{"arxiv_id":"2411.18077","last_updated":"2025-06-08T21:23:22Z","snapshot_observed_at":"2026-08-15T19:30:15.609643Z","submitted_at":"2024-11-27T06:10:49Z","title":"MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-12T11:37:07.663004Z"},"links":{"citing_paper":"/paper/2411.18077"},"observation_digest":"sha256:de8be95fb38789403289cf1a67b05746d2acc8afa8b551124a6548b6298611f6","observation_id":"cd0916af-31f0-4431-ac51-2fc67cc52b04","resolution":{"observed_at":"2026-08-12T11:37:07.992453Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10819","last_updated":"2024-10-14T17:59:58Z","snapshot_observed_at":"2026-08-16T03:51:26.346422Z","submitted_at":"2024-10-14T17:59:58Z","title":"DuoAttention: Efficient Long-Context LLM Inference with Retrieval and Streaming Heads","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10819","snapshot_observed_at":"2026-08-12T11:37:07.666624Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18077","last_updated":"2025-06-08T21:23:22Z","snapshot_observed_at":"2026-08-15T19:30:15.609643Z","submitted_at":"2024-11-27T06:10:49Z","title":"MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-12T11:37:07.666624Z"},"links":{"cited_paper":"/paper/2410.10819","citing_paper":"/paper/2411.18077"},"observation_digest":"sha256:cdf108ae022d03883e8a56c8db27f274c963c55d288994f0e66cbc6f3157e42d","observation_id":"20e63b59-4d5b-4e35-bafc-1cbcebf0873c","resolution":{"observed_at":"2026-08-12T11:37:07.666624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17453","last_updated":"2024-04-07T00:56:53Z","snapshot_observed_at":"2026-08-14T06:01:54.549199Z","submitted_at":"2023-09-29T17:59:56Z","title":"Efficient Streaming Language Models with Attention Sinks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17453","snapshot_observed_at":"2026-08-12T11:37:07.670319Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18077","last_updated":"2025-06-08T21:23:22Z","snapshot_observed_at":"2026-08-15T19:30:15.609643Z","submitted_at":"2024-11-27T06:10:49Z","title":"MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-12T11:37:07.670319Z"},"links":{"cited_paper":"/paper/2309.17453","citing_paper":"/paper/2411.18077"},"observation_digest":"sha256:a4ccc2bf71600a1921fa312899b7a6d7c713553ed66403f7586248a40a31a6f9","observation_id":"6c22d63e-a693-4633-bfd8-eb0c8e03e13b","resolution":{"observed_at":"2026-08-12T11:37:07.670319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12532","last_updated":"2024-06-05T09:01:24Z","snapshot_observed_at":"2026-08-16T01:03:36.529853Z","submitted_at":"2024-05-21T06:46:37Z","title":"PyramidInfer: Pyramid KV Cache Compression for High-throughput LLM Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12532","snapshot_observed_at":"2026-08-12T11:37:07.674267Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18077","last_updated":"2025-06-08T21:23:22Z","snapshot_observed_at":"2026-08-15T19:30:15.609643Z","submitted_at":"2024-11-27T06:10:49Z","title":"MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-12T11:37:07.674267Z"},"links":{"cited_paper":"/paper/2405.12532","citing_paper":"/paper/2411.18077"},"observation_digest":"sha256:4e4ab8cec0512bf4cb147bd7c2b1c329c8109fa5255950d16eedde5c5059d9ca","observation_id":"7ced9945-c15e-4e04-939c-711b8dbb8902","resolution":{"observed_at":"2026-08-12T11:37:07.674267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18096","last_updated":"2024-02-28T06:34:54Z","snapshot_observed_at":"2026-08-13T07:57:52.161268Z","submitted_at":"2024-02-28T06:34:54Z","title":"No Token Left Behind: Reliable KV Cache Compression via Importance-Aware Mixed Precision Quantization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18096","snapshot_observed_at":"2026-08-12T11:37:07.678061Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18077","last_updated":"2025-06-08T21:23:22Z","snapshot_observed_at":"2026-08-15T19:30:15.609643Z","submitted_at":"2024-11-27T06:10:49Z","title":"MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-12T11:37:07.678061Z"},"links":{"cited_paper":"/paper/2402.18096","citing_paper":"/paper/2411.18077"},"observation_digest":"sha256:e37e2fbd9227eca9f50e5482a53ecd40dd256da2243237ba082bc9f712ee7f94","observation_id":"c9d88fdc-0c2f-4b57-87f3-7a4dfaadb303","resolution":{"observed_at":"2026-08-12T11:37:07.678061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13718","last_updated":"2024-02-24T15:07:55Z","snapshot_observed_at":"2026-08-13T04:13:48.028514Z","submitted_at":"2024-02-21T11:30:29Z","title":"$\\infty$Bench: Extending Long Context Evaluation Beyond 100K Tokens","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13718","snapshot_observed_at":"2026-08-12T11:37:07.681788Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18077","last_updated":"2025-06-08T21:23:22Z","snapshot_observed_at":"2026-08-15T19:30:15.609643Z","submitted_at":"2024-11-27T06:10:49Z","title":"MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-12T11:37:07.681788Z"},"links":{"cited_paper":"/paper/2402.13718","citing_paper":"/paper/2411.18077"},"observation_digest":"sha256:3b0cb6d1a2425358c62a4b074e19155cbf5e86ef81e9031796d924025add21f0","observation_id":"7267b29a-8ed7-424e-b943-25a38825d5d3","resolution":{"observed_at":"2026-08-12T11:37:07.681788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:37:07.685940Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18077","last_updated":"2025-06-08T21:23:22Z","snapshot_observed_at":"2026-08-15T19:30:15.609643Z","submitted_at":"2024-11-27T06:10:49Z","title":"MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-12T11:37:07.685940Z"},"links":{"citing_paper":"/paper/2411.18077"},"observation_digest":"sha256:2c6013d26e7b64e796ef4e586e173494695de229a87b893c3bfe95019abb5218","observation_id":"9340b39b-65a6-4abf-adff-3f0066468f2c","resolution":{"observed_at":"2026-08-12T11:37:07.685940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:37:07.689428Z","title":"Barrett, Zhangyang Wang, and Beidi Chen","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18077","last_updated":"2025-06-08T21:23:22Z","snapshot_observed_at":"2026-08-15T19:30:15.609643Z","submitted_at":"2024-11-27T06:10:49Z","title":"MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-12T11:37:07.689428Z"},"links":{"citing_paper":"/paper/2411.18077"},"observation_digest":"sha256:902481628b6566146b7af0beaca40789fe407ef13a86331597c395c94bcf4052","observation_id":"248e51a3-32a2-4a0c-b655-ab701a21bfa8","resolution":{"observed_at":"2026-08-12T11:37:07.689428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:37:07.693059Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.18077","last_updated":"2025-06-08T21:23:22Z","snapshot_observed_at":"2026-08-15T19:30:15.609643Z","submitted_at":"2024-11-27T06:10:49Z","title":"MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-12T11:37:07.693059Z"},"links":{"citing_paper":"/paper/2411.18077"},"observation_digest":"sha256:5cf5f86c48baaede8f5c9053e38eb6ca6471479ee1a6ad56c36d1026791abecf","observation_id":"93f5e1f6-0042-405c-9339-19fa85f70aa3","resolution":{"observed_at":"2026-08-12T11:37:07.693059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:37:07.697300Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.18077","last_updated":"2025-06-08T21:23:22Z","snapshot_observed_at":"2026-08-15T19:30:15.609643Z","submitted_at":"2024-11-27T06:10:49Z","title":"MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-12T11:37:07.697300Z"},"links":{"citing_paper":"/paper/2411.18077"},"observation_digest":"sha256:d0c0c07936b9ec63543248ffb6faf9c24b76b94c47472a41ef637ab3d0aca5e9","observation_id":"b66d035f-d673-4e4c-92c0-6329e84a19c7","resolution":{"observed_at":"2026-08-12T11:37:07.697300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2411.18077","last_updated":"2025-06-08T21:23:22Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-15T19:30:15.609643Z","submitted_at":"2024-11-27T06:10:49Z","title":"MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":41,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 3 inbound Pith citation observations for arXiv:2411.18077."}