{"as_of":"2026-08-10T06:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4de9193e6e8e47b8d347953b3367c9d63b9743b674fa0c8e8e03606bc71fd153","coverage":[{"denominator":59,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T20:34:01.382301Z","state":"measured"},{"denominator":65,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":65,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-25T04:51:04.068354Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-25T04:55:24.203465Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.19392","last_updated":"2025-02-28T18:04:52Z","snapshot_observed_at":"2026-08-09T20:48:28.727060Z","submitted_at":"2025-01-31T18:47:42Z","title":"Cache Me If You Must: Adaptive Key-Value Quantization for Large Language Models","version":4},"cited_work":{"arxiv_id":"2501.19392","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.19392","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cache me if you must: Adaptive key-value quantization for large language models","venue":null,"work_id":"77a30adb-96a6-4c3e-8506-266346796ea5","year":2025},"citing_paper":{"arxiv_id":"2604.08426","last_updated":"2026-05-15T16:23:48Z","snapshot_observed_at":"2026-08-03T00:42:33.853267Z","submitted_at":"2026-04-09T16:30:44Z","title":"KV Cache Offloading for Context-Intensive Tasks","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-10T16:49:13.353700Z"},"links":{"cited_paper":"/paper/2501.19392","citing_paper":"/paper/2604.08426"},"observation_digest":"sha256:36b153ed4a4f086c02b5b8b8960aaf0ba6736e95ac26f2e8a48f882cfdfad2fa","observation_id":"0c036e79-b643-41f2-aef1-56bf2295a7f7","resolution":{"observed_at":"2026-05-11T08:06:01.037853Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19392","last_updated":"2025-02-28T18:04:52Z","snapshot_observed_at":"2026-08-09T20:48:28.727060Z","submitted_at":"2025-01-31T18:47:42Z","title":"Cache Me If You Must: Adaptive Key-Value Quantization for Large Language Models","version":4},"cited_work":{"arxiv_id":"2501.19392","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.19392","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cache me if you must: Adaptive key-value quantization for large language models","venue":null,"work_id":"77a30adb-96a6-4c3e-8506-266346796ea5","year":2025},"citing_paper":{"arxiv_id":"2604.08426","last_updated":"2026-05-15T16:23:48Z","snapshot_observed_at":"2026-08-03T00:42:33.853267Z","submitted_at":"2026-04-09T16:30:44Z","title":"KV Cache Offloading for Context-Intensive Tasks","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-11T01:48:21.341462Z"},"links":{"cited_paper":"/paper/2501.19392","citing_paper":"/paper/2604.08426"},"observation_digest":"sha256:4d67f6323c0f937c0fea7d547faf465f2f4eb061da71f65328b6196e01e7b3f2","observation_id":"1c7f9c93-c852-478e-a569-06591cefc921","resolution":{"observed_at":"2026-05-11T04:20:56.308454Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19392","last_updated":"2025-02-28T18:04:52Z","snapshot_observed_at":"2026-08-09T20:48:28.727060Z","submitted_at":"2025-01-31T18:47:42Z","title":"Cache Me If You Must: Adaptive Key-Value Quantization for Large Language Models","version":4},"cited_work":{"arxiv_id":"2501.19392","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.19392","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cache me if you must: Adaptive key-value quantization for large language models","venue":null,"work_id":"77a30adb-96a6-4c3e-8506-266346796ea5","year":2025},"citing_paper":{"arxiv_id":"2604.08426","last_updated":"2026-05-15T16:23:48Z","snapshot_observed_at":"2026-08-03T00:42:33.853267Z","submitted_at":"2026-04-09T16:30:44Z","title":"KV Cache Offloading for Context-Intensive Tasks","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-13T07:35:30.155592Z"},"links":{"cited_paper":"/paper/2501.19392","citing_paper":"/paper/2604.08426"},"observation_digest":"sha256:ac4653fe026dfb67c1f43a5c8c1fdf3fda2f9f24fec1556367591dd658aa133b","observation_id":"7779274f-0729-4706-a7d2-54b82190afe9","resolution":{"observed_at":"2026-05-13T07:37:29.392954Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19392","last_updated":"2025-02-28T18:04:52Z","snapshot_observed_at":"2026-08-09T20:48:28.727060Z","submitted_at":"2025-01-31T18:47:42Z","title":"Cache Me If You Must: Adaptive Key-Value Quantization for Large Language Models","version":4},"cited_work":{"arxiv_id":"2501.19392","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.19392","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cache me if you must: Adaptive key-value quantization for large language models","venue":null,"work_id":"77a30adb-96a6-4c3e-8506-266346796ea5","year":2025},"citing_paper":{"arxiv_id":"2604.08426","last_updated":"2026-05-15T16:23:48Z","snapshot_observed_at":"2026-08-03T00:42:33.853267Z","submitted_at":"2026-04-09T16:30:44Z","title":"KV Cache Offloading for Context-Intensive Tasks","version":4},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-19T16:41:30.021302Z"},"links":{"cited_paper":"/paper/2501.19392","citing_paper":"/paper/2604.08426"},"observation_digest":"sha256:554e2bda89293fef44a6a26bbd6cff56c33bf5b048d76db90ea318159130044f","observation_id":"34b564f1-c187-439d-8388-da7bf1f7fea5","resolution":{"observed_at":"2026-05-19T16:42:39.675232Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19392","last_updated":"2025-02-28T18:04:52Z","snapshot_observed_at":"2026-08-09T20:48:28.727060Z","submitted_at":"2025-01-31T18:47:42Z","title":"Cache Me If You Must: Adaptive Key-Value Quantization for Large Language Models","version":4},"cited_work":{"arxiv_id":"2501.19392","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.19392","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cache me if you must: Adaptive key-value quantization for large language models","venue":null,"work_id":"77a30adb-96a6-4c3e-8506-266346796ea5","year":2025},"citing_paper":{"arxiv_id":"2605.08317","last_updated":"2026-05-08T15:15:06Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T15:15:06Z","title":"RDKV: Rate-Distortion Bit Allocation for Joint Eviction and Quantization of the KV Cache","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-12T01:16:15.869198Z"},"links":{"cited_paper":"/paper/2501.19392","citing_paper":"/paper/2605.08317"},"observation_digest":"sha256:678823436dd84da47e278dde0b5f2644052b24f742bdcf14537e2fac47ef4c10","observation_id":"37f7136f-56d8-40a3-b40a-157028fe8598","resolution":{"observed_at":"2026-05-12T08:06:33.526717Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19392","last_updated":"2025-02-28T18:04:52Z","snapshot_observed_at":"2026-08-09T20:48:28.727060Z","submitted_at":"2025-01-31T18:47:42Z","title":"Cache Me If You Must: Adaptive Key-Value Quantization for Large Language Models","version":4},"cited_work":{"arxiv_id":"2501.19392","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.19392","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cache me if you must: Adaptive key-value quantization for large language models","venue":null,"work_id":"77a30adb-96a6-4c3e-8506-266346796ea5","year":2025},"citing_paper":{"arxiv_id":"2605.23258","last_updated":"2026-05-22T06:00:15Z","snapshot_observed_at":"2026-08-03T03:36:58.256274Z","submitted_at":"2026-05-22T06:00:15Z","title":"A Simple Plug-in for Improving Eviction-Based KV Cache Compression","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-25T04:51:04.068354Z"},"links":{"cited_paper":"/paper/2501.19392","citing_paper":"/paper/2605.23258"},"observation_digest":"sha256:80bda88b3993b44152be24ff251c02fd1b73959ad5a5022e5088a1298bcdba80","observation_id":"074dd5fb-7213-4fb4-8bac-8cce632be527","resolution":{"observed_at":"2026-05-25T04:55:24.206757Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.19392/citation-record","integrity":"/paper/2501.19392/integrity","json":"/paper/2501.19392/citation-record.json","paper":"/paper/2501.19392"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:34:01.163378Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.19392","last_updated":"2025-02-28T18:04:52Z","snapshot_observed_at":"2026-08-09T20:48:28.727060Z","submitted_at":"2025-01-31T18:47:42Z","title":"Cache Me If You Must: Adaptive Key-Value Quantization for Large Language Models","version":4},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.163378Z"},"links":{"citing_paper":"/paper/2501.19392"},"observation_digest":"sha256:f547054b08ae88abd3202326d8f9a6a38c896c29ce00b4799f081808478fc5c3","observation_id":"9ad5d31d-d34d-4027-8f5b-c90498d5144b","resolution":{"observed_at":"2026-08-09T20:34:01.163378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13245","last_updated":"2023-12-23T17:55:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-22T17:16:38Z","title":"GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13245","snapshot_observed_at":"2026-08-09T20:34:01.168712Z","title":"Gqa: Training generalized multi-query transformer models from multi-head checkpoints","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.19392","last_updated":"2025-02-28T18:04:52Z","snapshot_observed_at":"2026-08-09T20:48:28.727060Z","submitted_at":"2025-01-31T18:47:42Z","title":"Cache Me If You Must: Adaptive Key-Value Quantization for Large Language Models","version":4},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.168712Z"},"links":{"cited_paper":"/paper/2305.13245","citing_paper":"/paper/2501.19392"},"observation_digest":"sha256:0482fdd43f0d3bf52bbe387f0c33d42191384f9e1097c7559fc86aaee4376784","observation_id":"251e4d38-cb7c-48ca-8464-a9042a9ff396","resolution":{"observed_at":"2026-08-09T20:34:01.168712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1610.01644","last_updated":"2018-11-22T23:40:00Z","snapshot_observed_at":"2026-08-09T22:50:03.459615Z","submitted_at":"2016-10-05T20:59:01Z","title":"Understanding intermediate layers using linear classifier probes","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1610.01644","snapshot_observed_at":"2026-08-09T20:34:01.172410Z","title":"and Bengio, Y","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.19392","last_updated":"2025-02-28T18:04:52Z","snapshot_observed_at":"2026-08-09T20:48:28.727060Z","submitted_at":"2025-01-31T18:47:42Z","title":"Cache Me If You Must: Adaptive Key-Value Quantization for Large Language Models","version":4},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.172410Z"},"links":{"cited_paper":"/paper/1610.01644","citing_paper":"/paper/2501.19392"},"observation_digest":"sha256:0c17ea026d176453e0dc83b7cb5056f0e1a112de01b637ac20bfe4a0214c31fc","observation_id":"af7d1eb7-9eae-4398-a32d-2dc231825daa","resolution":{"observed_at":"2026-08-09T20:34:01.172410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00456","last_updated":"2024-10-29T11:09:12Z","snapshot_observed_at":"2026-08-09T17:23:32.399243Z","submitted_at":"2024-03-30T19:20:06Z","title":"QuaRot: Outlier-Free 4-Bit Inference in Rotated LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00456","snapshot_observed_at":"2026-08-09T20:34:01.176784Z","title":"L., Li, B., Jaggi, M., Alistarh, D., Hoefler, T., and Hensman, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.19392","last_updated":"2025-02-28T18:04:52Z","snapshot_observed_at":"2026-08-09T20:48:28.727060Z","submitted_at":"2025-01-31T18:47:42Z","title":"Cache Me If You Must: Adaptive Key-Value Quantization for Large Language Models","version":4},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.176784Z"},"links":{"cited_paper":"/paper/2404.00456","citing_paper":"/paper/2501.19392"},"observation_digest":"sha256:80de8e772ae2968b906ae5a8d8b52f81bbe7dbebd6a171755d9f5234aa45e513","observation_id":"3d464322-1ec4-4d62-add5-38a920dc34e3","resolution":{"observed_at":"2026-08-09T20:34:01.176784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.14508","last_updated":"2024-06-19T04:00:32Z","snapshot_observed_at":"2026-08-08T03:49:18.086396Z","submitted_at":"2023-08-28T11:53:40Z","title":"LongBench: A Bilingual, Multitask Benchmark for Long Context Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.14508","snapshot_observed_at":"2026-08-09T20:34:01.181193Z","title":"Longbench: A bilingual, multitask benchmark for long context understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.19392","last_updated":"2025-02-28T18:04:52Z","snapshot_observed_at":"2026-08-09T20:48:28.727060Z","submitted_at":"2025-01-31T18:47:42Z","title":"Cache Me If You Must: Adaptive Key-Value Quantization for Large Language Models","version":4},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.181193Z"},"links":{"cited_paper":"/paper/2308.14508","citing_paper":"/paper/2501.19392"},"observation_digest":"sha256:3626ffd44fffc213de0a306c69058c906646ff79f7cf93e1cb6247c9af6fc36b","observation_id":"3ab4ce44-4aa3-45d0-8dbf-615a79164ca4","resolution":{"observed_at":"2026-08-09T20:34:01.181193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:34:02.071952Z","title":"M., Gebru, T., McMillan-Major, A., and Shmitchell, S","venue":null,"work_id":"949cbb0b-0417-4862-86b1-793aa619114a","year":2021},"citing_paper":{"arxiv_id":"2501.19392","last_updated":"2025-02-28T18:04:52Z","snapshot_observed_at":"2026-08-09T20:48:28.727060Z","submitted_at":"2025-01-31T18:47:42Z","title":"Cache Me If You Must: Adaptive Key-Value Quantization for Large Language Models","version":4},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.185806Z"},"links":{"citing_paper":"/paper/2501.19392"},"observation_digest":"sha256:3f3eea8228705b6d61a54e3a0c0e00e91215395dd6e64d1d3a3411210b6f85c1","observation_id":"4fae5ebc-01a5-44ce-8995-db483bb3304d","resolution":{"observed_at":"2026-08-09T20:34:02.075389Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21118","last_updated":"2024-11-04T02:08:55Z","snapshot_observed_at":"2026-07-06T18:54:41.705593Z","submitted_at":"2024-07-30T18:19:38Z","title":"Palu: Compressing KV-Cache with Low-Rank Projection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21118","snapshot_observed_at":"2026-08-09T20:34:01.189891Z","title":"Palu: Compressing kv-cache with low-rank projection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.19392","last_updated":"2025-02-28T18:04:52Z","snapshot_observed_at":"2026-08-09T20:48:28.727060Z","submitted_at":"2025-01-31T18:47:42Z","title":"Cache Me If You Must: Adaptive Key-Value Quantization for Large Language Models","version":4},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.189891Z"},"links":{"cited_paper":"/paper/2407.21118","citing_paper":"/paper/2501.19392"},"observation_digest":"sha256:03d2017702d8e7905f098c3a408f96c36458ed2a25795ea8f6749c30a3a56e13","observation_id":"9e72fe70-0f02-408e-ad53-19ad07a7a089","resolution":{"observed_at":"2026-08-09T20:34:01.189891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05265","last_updated":"2025-01-27T13:39:25Z","snapshot_observed_at":"2026-07-06T19:29:09.714725Z","submitted_at":"2024-10-07T17:59:35Z","title":"PrefixQuant: Eliminating Outliers by Prefixed Tokens for Large Language Models Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05265","snapshot_observed_at":"2026-08-09T20:34:01.194069Z","title":"Prefixquant: Eliminating outliers by prefixed tokens for large language models quantization, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2501.19392","last_updated":"2025-02-28T18:04:52Z","snapshot_observed_at":"2026-08-09T20:48:28.727060Z","submitted_at":"2025-01-31T18:47:42Z","title":"Cache Me If You Must: Adaptive Key-Value Quantization for Large Language Models","version":4},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.194069Z"},"links":{"cited_paper":"/paper/2410.05265","citing_paper":"/paper/2501.19392"},"observation_digest":"sha256:604bd47421d74ecd07b4a782c60e9b9a7335fee61411bf160577a03f3f1ab21a","observation_id":"db045350-6224-45c4-a0ee-2771b8660ea2","resolution":{"observed_at":"2026-08-09T20:34:01.194069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.05778","last_updated":"2024-01-11T09:29:56Z","snapshot_observed_at":"2026-08-05T00:16:01.594011Z","submitted_at":"2024-01-11T09:29:56Z","title":"Risk Taxonomy, Mitigation, and Assessment Benchmarks of Large Language Model Systems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.05778","snapshot_observed_at":"2026-08-09T20:34:01.197891Z","title":"Risk taxonomy, mitigation, and assessment benchmarks of large language model systems","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.19392","last_updated":"2025-02-28T18:04:52Z","snapshot_observed_at":"2026-08-09T20:48:28.727060Z","submitted_at":"2025-01-31T18:47:42Z","title":"Cache Me If You Must: Adaptive Key-Value Quantization for Large Language Models","version":4},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.197891Z"},"links":{"cited_paper":"/paper/2401.05778","citing_paper":"/paper/2501.19392"},"observation_digest":"sha256:2565e4e049813939ec127f75d4ffe737eabd0392707f3b2d67b179cc2b45f3c4","observation_id":"ed214d9c-c945-4b69-b3b3-c80e9c68c2e9","resolution":{"observed_at":"2026-08-09T20:34:01.197891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04643","last_updated":"2024-04-12T13:00:25Z","snapshot_observed_at":"2026-08-04T07:21:43.170218Z","submitted_at":"2024-03-07T16:42:37Z","title":"QAQ: Quality Adaptive Quantization for LLM KV Cache","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04643","snapshot_observed_at":"2026-08-09T20:34:01.201633Z","title":"Qaq: Quality-adaptive quantization for llm kv cache","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.19392","last_updated":"2025-02-28T18:04:52Z","snapshot_observed_at":"2026-08-09T20:48:28.727060Z","submitted_at":"2025-01-31T18:47:42Z","title":"Cache Me If You Must: Adaptive Key-Value Quantization for Large Language Models","version":4},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.201633Z"},"links":{"cited_paper":"/paper/2403.04643","citing_paper":"/paper/2501.19392"},"observation_digest":"sha256:86e859c7be54deccca5e6bef80e6d1b78e9568b8c17444eafe73c45f8d7fd68d","observation_id":"7230ed0d-e4f3-4763-8368-4242e1735827","resolution":{"observed_at":"2026-08-09T20:34:01.201633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.06219","last_updated":"2024-11-12T08:18:45Z","snapshot_observed_at":"2026-08-04T21:43:58.550650Z","submitted_at":"2024-05-10T03:06:24Z","title":"SKVQ: Sliding-window Key and Value Cache Quantization for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.06219","snapshot_observed_at":"2026-08-09T20:34:01.205850Z","title":"Skvq: Sliding-window key and value cache quantization for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.19392","last_updated":"2025-02-28T18:04:52Z","snapshot_observed_at":"2026-08-09T20:48:28.727060Z","submitted_at":"2025-01-31T18:47:42Z","title":"Cache Me If You Must: Adaptive Key-Value Quantization for Large Language Models","version":4},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.205850Z"},"links":{"cited_paper":"/paper/2405.06219","citing_paper":"/paper/2501.19392"},"observation_digest":"sha256:229dc59287d9baa95f70f824e0dd46b2d294b51fbe37408ecf30a66c264deede","observation_id":"9ed2fe7f-cb97-493d-871f-444192003f39","resolution":{"observed_at":"2026-08-09T20:34:01.205850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-09T20:34:01.209552Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.19392","last_updated":"2025-02-28T18:04:52Z","snapshot_observed_at":"2026-08-09T20:48:28.727060Z","submitted_at":"2025-01-31T18:47:42Z","title":"Cache Me If You Must: Adaptive Key-Value Quantization for Large Language Models","version":4},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.209552Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2501.19392"},"observation_digest":"sha256:b3f42d9951b0046ee61ed6c71610cfe4251df7f7c0283fb44fe5db796d3db681","observation_id":"4a74aea1-516b-4ebb-8de6-e9e59c0f7091","resolution":{"observed_at":"2026-08-09T20:34:01.209552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.16388","last_updated":"2024-04-12T00:05:53Z","snapshot_observed_at":"2026-07-30T00:01:16.818092Z","submitted_at":"2023-06-28T17:31:53Z","title":"Towards Measuring the Representation of Subjective Global Opinions in Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.16388","snapshot_observed_at":"2026-08-09T20:34:01.212965Z","title":"Towards measuring the representation of subjective global opinions in language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.19392","last_updated":"2025-02-28T18:04:52Z","snapshot_observed_at":"2026-08-09T20:48:28.727060Z","submitted_at":"2025-01-31T18:47:42Z","title":"Cache Me If You Must: Adaptive Key-Value Quantization for Large Language Models","version":4},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.212965Z"},"links":{"cited_paper":"/paper/2306.16388","citing_paper":"/paper/2501.19392"},"observation_digest":"sha256:1b72818e4c32f85e8d05eeb289d3b861cac97571a89535e7751d881405a5d895","observation_id":"d792f3f2-6b06-45a3-a052-5d75ce161ae3","resolution":{"observed_at":"2026-08-09T20:34:01.212965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06118","last_updated":"2024-09-11T07:48:26Z","snapshot_observed_at":"2026-08-06T11:31:16.355778Z","submitted_at":"2024-01-11T18:54:44Z","title":"Extreme Compression of Large Language Models via Additive Quantization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06118","snapshot_observed_at":"2026-08-09T20:34:01.216140Z","title":"Extreme compression of large language models via additive quantization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.19392","last_updated":"2025-02-28T18:04:52Z","snapshot_observed_at":"2026-08-09T20:48:28.727060Z","submitted_at":"2025-01-31T18:47:42Z","title":"Cache Me If You Must: Adaptive Key-Value Quantization for Large Language Models","version":4},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.216140Z"},"links":{"cited_paper":"/paper/2401.06118","citing_paper":"/paper/2501.19392"},"observation_digest":"sha256:0e49ebc2df8e9957de2b177c272332b959150d48c9d0a8dc4fa76fa2f85f851d","observation_id":"43925cb0-b1e0-4fa5-9897-df956ab7e938","resolution":{"observed_at":"2026-08-09T20:34:01.216140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17323","last_updated":"2023-03-22T13:10:47Z","snapshot_observed_at":"2026-08-07T08:38:54.025062Z","submitted_at":"2022-10-31T13:42:40Z","title":"GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.17323","snapshot_observed_at":"2026-08-09T20:34:01.220117Z","title":"Gptq: Accurate post-training quantization for generative pre-trained transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.19392","last_updated":"2025-02-28T18:04:52Z","snapshot_observed_at":"2026-08-09T20:48:28.727060Z","submitted_at":"2025-01-31T18:47:42Z","title":"Cache Me If You Must: Adaptive Key-Value Quantization for Large Language Models","version":4},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.220117Z"},"links":{"cited_paper":"/paper/2210.17323","citing_paper":"/paper/2501.19392"},"observation_digest":"sha256:9b8f2b06987361ed05a57fdebaea334f64ff36f9d4b72e09bacdc635db58e529","observation_id":"8a374d1a-a87f-403a-b8ae-0f658c2b9086","resolution":{"observed_at":"2026-08-09T20:34:01.220117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01801","last_updated":"2024-10-29T18:26:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-03T05:17:08Z","title":"Model Tells You What to Discard: Adaptive KV Cache Compression for LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01801","snapshot_observed_at":"2026-08-09T20:34:01.224437Z","title":"Model tells you what to discard: Adaptive kv cache compression for llms","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.19392","last_updated":"2025-02-28T18:04:52Z","snapshot_observed_at":"2026-08-09T20:48:28.727060Z","submitted_at":"2025-01-31T18:47:42Z","title":"Cache Me If You Must: Adaptive Key-Value Quantization for Large Language Models","version":4},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.224437Z"},"links":{"cited_paper":"/paper/2310.01801","citing_paper":"/paper/2501.19392"},"observation_digest":"sha256:6a69a08f6acbe7cbfe0d80febb2dafaa0d5e31a6d086d1a75ab828af0f9f9fae","observation_id":"8c7041fe-7771-41b7-8d3c-ab6a53ac0f1e","resolution":{"observed_at":"2026-08-09T20:34:01.224437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:34:02.217031Z","title":null,"venue":null,"work_id":"551ae75e-897b-47b4-8747-70b37803185d","year":1998},"citing_paper":{"arxiv_id":"2501.19392","last_updated":"2025-02-28T18:04:52Z","snapshot_observed_at":"2026-08-09T20:48:28.727060Z","submitted_at":"2025-01-31T18:47:42Z","title":"Cache Me If You Must: Adaptive Key-Value Quantization for Large Language Models","version":4},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.228274Z"},"links":{"citing_paper":"/paper/2501.19392"},"observation_digest":"sha256:bcfc7b4ebef3006706e65ff012391fd5c1b05cdd9affce570ca934184543a3f2","observation_id":"a2276e2c-5d4c-46cc-81dd-afd48dae68ad","resolution":{"observed_at":"2026-08-09T20:34:02.220412Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:34:02.208203Z","title":"Fast matrix multiplications for lookup table-quantized llms","venue":null,"work_id":"47442c57-3f16-4659-a324-c307fb2a2abd","year":2024},"citing_paper":{"arxiv_id":"2501.19392","last_updated":"2025-02-28T18:04:52Z","snapshot_observed_at":"2026-08-09T20:48:28.727060Z","submitted_at":"2025-01-31T18:47:42Z","title":"Cache Me If You Must: Adaptive Key-Value Quantization for Large Language Models","version":4},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.231283Z"},"links":{"citing_paper":"/paper/2501.19392"},"observation_digest":"sha256:cc2526ebabbe0327b5df443e61de73012d19312a7cca8b648bef0faf3b159b9a","observation_id":"95a1ce10-7f8c-4dca-8d26-f4291b42853f","resolution":{"observed_at":"2026-08-09T20:34:02.211651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14256","last_updated":"2024-05-23T07:37:16Z","snapshot_observed_at":"2026-07-06T18:18:21.334080Z","submitted_at":"2024-05-23T07:37:16Z","title":"ZipCache: Accurate and Efficient KV Cache Quantization with Salient Token Identification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14256","snapshot_observed_at":"2026-08-09T20:34:01.234695Z","title":"Zipcache: Accurate and efficient kv cache quantization with salient token identification","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.19392","last_updated":"2025-02-28T18:04:52Z","snapshot_observed_at":"2026-08-09T20:48:28.727060Z","submitted_at":"2025-01-31T18:47:42Z","title":"Cache Me If You Must: Adaptive Key-Value Quantization for Large Language Models","version":4},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.234695Z"},"links":{"cited_paper":"/paper/2405.14256","citing_paper":"/paper/2501.19392"},"observation_digest":"sha256:7f488e9ca26d57e06ad6b883a678497d14662c2d5401ebe173797ad694e682bc","observation_id":"b8b6f30e-69ab-4186-804d-ceb69798c826","resolution":{"observed_at":"2026-08-09T20:34:01.234695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-09T08:05:16.511956Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-09T20:34:01.238595Z","title":"W., Shao, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.19392","last_updated":"2025-02-28T18:04:52Z","snapshot_observed_at":"2026-08-09T20:48:28.727060Z","submitted_at":"2025-01-31T18:47:42Z","title":"Cache Me If You Must: Adaptive Key-Value Quantization for Large Language Models","version":4},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.238595Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2501.19392"},"observation_digest":"sha256:695d4321fdb159b9a1728d21f7a2c4be9d391d878c48103bf37b0cfccbfd3b6f","observation_id":"63704b6d-d0da-4d2f-9966-e36b374e5998","resolution":{"observed_at":"2026-08-09T20:34:01.238595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:34:01.242633Z","title":"Stochastic distributed learning with gradient quantization and double-variance reduction","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.19392","last_updated":"2025-02-28T18:04:52Z","snapshot_observed_at":"2026-08-09T20:48:28.727060Z","submitted_at":"2025-01-31T18:47:42Z","title":"Cache Me If You Must: Adaptive Key-Value Quantization for Large Language Models","version":4},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.242633Z"},"links":{"citing_paper":"/paper/2501.19392"},"observation_digest":"sha256:a8cd0f2daadf68809d8f4d2b7692cb188e305c66d5eed9361bea929cd155c1c3","observation_id":"82fe702c-a446-44c3-8773-9407f9878293","resolution":{"observed_at":"2026-08-09T20:34:01.242633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:34:02.192904Z","title":"Optimum-quanto: A pytorch quantization backend for optimum","venue":null,"work_id":"f887ce29-bfd0-4db8-a941-2ae827e21b40","year":2024},"citing_paper":{"arxiv_id":"2501.19392","last_updated":"2025-02-28T18:04:52Z","snapshot_observed_at":"2026-08-09T20:48:28.727060Z","submitted_at":"2025-01-31T18:47:42Z","title":"Cache Me If You Must: Adaptive Key-Value Quantization for Large Language Models","version":4},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.246441Z"},"links":{"citing_paper":"/paper/2501.19392"},"observation_digest":"sha256:39db8183606ec04b3ea49118d8cd0c9ae1397d4f31a4e67dfd77b8449c9e85fc","observation_id":"4fa84ad4-54f3-4f07-8dc1-78f7ea39e1a7","resolution":{"observed_at":"2026-08-09T20:34:02.196286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05527","last_updated":"2024-09-30T22:44:58Z","snapshot_observed_at":"2026-08-07T12:20:18.370756Z","submitted_at":"2024-03-08T18:48:30Z","title":"GEAR: An Efficient KV Cache Compression Recipe for Near-Lossless Generative Inference of LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05527","snapshot_observed_at":"2026-08-09T20:34:01.250786Z","title":"Gear: An efficient kv cache compression recipe for near-lossless generative inference of llm","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.19392","last_updated":"2025-02-28T18:04:52Z","snapshot_observed_at":"2026-08-09T20:48:28.727060Z","submitted_at":"2025-01-31T18:47:42Z","title":"Cache Me If You Must: Adaptive Key-Value Quantization for Large Language Models","version":4},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.250786Z"},"links":{"cited_paper":"/paper/2403.05527","citing_paper":"/paper/2501.19392"},"observation_digest":"sha256:7dd39753672532bf11a51290c11990f38500fbd23119f74ca7d4fb4751262884","observation_id":"d80ec495-591c-4b2b-98d8-d3be9eca364f","resolution":{"observed_at":"2026-08-09T20:34:01.250786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:34:01.254750Z","title":"H., Gonzalez, J., Zhang, H., and Stoica, I","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.19392","last_updated":"2025-02-28T18:04:52Z","snapshot_observed_at":"2026-08-09T20:48:28.727060Z","submitted_at":"2025-01-31T18:47:42Z","title":"Cache Me If You Must: Adaptive Key-Value Quantization for Large Language Models","version":4},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.254750Z"},"links":{"citing_paper":"/paper/2501.19392"},"observation_digest":"sha256:04a4561dbbb7e2536fed3220c650f9dc43b3341cf405b3826a4fd61ae711cfa3","observation_id":"ddf7a799-c6fc-4f2c-95bb-f12f480a8f7f","resolution":{"observed_at":"2026-08-09T20:34:01.254750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19442","last_updated":"2025-07-30T05:24:46Z","snapshot_observed_at":"2026-08-07T06:25:14.802049Z","submitted_at":"2024-12-27T04:17:57Z","title":"A Survey on Large Language Model Acceleration based on KV Cache Management","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19442","snapshot_observed_at":"2026-08-09T20:34:01.257427Z","title":"A survey on large language model acceleration based on kv cache management","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.19392","last_updated":"2025-02-28T18:04:52Z","snapshot_observed_at":"2026-08-09T20:48:28.727060Z","submitted_at":"2025-01-31T18:47:42Z","title":"Cache Me If You Must: Adaptive Key-Value Quantization for Large Language Models","version":4},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.257427Z"},"links":{"cited_paper":"/paper/2412.19442","citing_paper":"/paper/2501.19392"},"observation_digest":"sha256:e044582adc4bda00b856f90474cf9e400c76d365b24559b0cc6019685964effe","observation_id":"363d5d4e-f8ef-4346-a9f0-3e4ee7b35342","resolution":{"observed_at":"2026-08-09T20:34:01.257427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14469","last_updated":"2024-06-17T03:01:58Z","snapshot_observed_at":"2026-08-07T22:57:56.263839Z","submitted_at":"2024-04-22T17:42:58Z","title":"SnapKV: LLM Knows What You are Looking for Before Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14469","snapshot_observed_at":"2026-08-09T20:34:01.261682Z","title":"Snapkv: Llm knows what you are looking for before generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.19392","last_updated":"2025-02-28T18:04:52Z","snapshot_observed_at":"2026-08-09T20:48:28.727060Z","submitted_at":"2025-01-31T18:47:42Z","title":"Cache Me If You Must: Adaptive Key-Value Quantization for Large Language Models","version":4},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.261682Z"},"links":{"cited_paper":"/paper/2404.14469","citing_paper":"/paper/2501.19392"},"observation_digest":"sha256:0b2e1f556a84f6663490072816c589b468e11c7c71815a28daa9462b9f50662a","observation_id":"3bf02429-cf6d-4568-9e3c-7552eecc6d51","resolution":{"observed_at":"2026-08-09T20:34:01.261682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-06T07:50:40.568356Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10319","snapshot_observed_at":"2026-08-09T20:34:01.265626Z","title":"H., Li, D., Gao, J., Yang, Y., et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.19392","last_updated":"2025-02-28T18:04:52Z","snapshot_observed_at":"2026-08-09T20:48:28.727060Z","submitted_at":"2025-01-31T18:47:42Z","title":"Cache Me If You Must: Adaptive Key-Value Quantization for Large Language Models","version":4},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.265626Z"},"links":{"cited_paper":"/paper/2412.10319","citing_paper":"/paper/2501.19392"},"observation_digest":"sha256:a52e2da37efe30bcc70ddaf36cb5d02af344f1e0543530171ffcfa0a9c235185","observation_id":"ef36e9a9-22d8-4947-a948-1d7fb234a758","resolution":{"observed_at":"2026-08-09T20:34:01.265626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00978","last_updated":"2026-04-25T06:58:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-01T17:59:10Z","title":"AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00978","snapshot_observed_at":"2026-08-09T20:34:01.269681Z","title":"Awq: Activation-aware weight quantization for llm compression and acceleration","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.19392","last_updated":"2025-02-28T18:04:52Z","snapshot_observed_at":"2026-08-09T20:48:28.727060Z","submitted_at":"2025-01-31T18:47:42Z","title":"Cache Me If You Must: Adaptive Key-Value Quantization for Large Language Models","version":4},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.269681Z"},"links":{"cited_paper":"/paper/2306.00978","citing_paper":"/paper/2501.19392"},"observation_digest":"sha256:e3c1fbbf912deea55ed7cd42fb6d50d7076f983722aab588a14b6c1b59c68f2e","observation_id":"f4d0dc2c-42d4-46ac-9b48-cf2b1d6fb4cd","resolution":{"observed_at":"2026-08-09T20:34:01.269681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14366","last_updated":"2024-09-07T02:52:29Z","snapshot_observed_at":"2026-08-04T12:08:53.387357Z","submitted_at":"2024-05-23T09:43:52Z","title":"MiniCache: KV Cache Compression in Depth Dimension for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14366","snapshot_observed_at":"2026-08-09T20:34:01.274336Z","title":"Minicache: Kv cache compression in depth dimension for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.19392","last_updated":"2025-02-28T18:04:52Z","snapshot_observed_at":"2026-08-09T20:48:28.727060Z","submitted_at":"2025-01-31T18:47:42Z","title":"Cache Me If You Must: Adaptive Key-Value Quantization for Large Language Models","version":4},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.274336Z"},"links":{"cited_paper":"/paper/2405.14366","citing_paper":"/paper/2501.19392"},"observation_digest":"sha256:2611c2c5d27457a19be03e2ad45c0c098eacf8699249531001892b72d4f8f61d","observation_id":"8100fd37-f4e5-42b6-8a23-f126bcce6ec9","resolution":{"observed_at":"2026-08-09T20:34:01.274336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.01241","last_updated":"2024-05-25T10:33:03Z","snapshot_observed_at":"2026-07-06T17:38:38.108579Z","submitted_at":"2024-03-02T16:05:26Z","title":"IntactKV: Improving Large Language Model Quantization by Keeping Pivot Tokens Intact","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.01241","snapshot_observed_at":"2026-08-09T20:34:01.278582Z","title":"Intactkv: Improving large language model quantization by keeping pivot tokens intact","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.19392","last_updated":"2025-02-28T18:04:52Z","snapshot_observed_at":"2026-08-09T20:48:28.727060Z","submitted_at":"2025-01-31T18:47:42Z","title":"Cache Me If You Must: Adaptive Key-Value Quantization for Large Language Models","version":4},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.278582Z"},"links":{"cited_paper":"/paper/2403.01241","citing_paper":"/paper/2501.19392"},"observation_digest":"sha256:1001062be47d1debd5b257489a702f1e18e8bbe2cb45fa1095ce03e9be5a4f3d","observation_id":"a3c491b0-3ab9-45ff-a0f2-11633560713e","resolution":{"observed_at":"2026-08-09T20:34:01.278582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02750","last_updated":"2024-07-25T09:16:05Z","snapshot_observed_at":"2026-07-06T17:25:18.238343Z","submitted_at":"2024-02-05T06:06:47Z","title":"KIVI: A Tuning-Free Asymmetric 2bit Quantization for KV Cache","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02750","snapshot_observed_at":"2026-08-09T20:34:01.281832Z","title":"Kivi: A tuning-free asymmetric 2bit quantization for kv cache","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.19392","last_updated":"2025-02-28T18:04:52Z","snapshot_observed_at":"2026-08-09T20:48:28.727060Z","submitted_at":"2025-01-31T18:47:42Z","title":"Cache Me If You Must: Adaptive Key-Value Quantization for Large Language Models","version":4},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.281832Z"},"links":{"cited_paper":"/paper/2402.02750","citing_paper":"/paper/2501.19392"},"observation_digest":"sha256:f3b4659a14bc3d3b3ddeb038204849e160eee7ca3379f1c8010d52b110b29953","observation_id":"70c22dd8-2852-4c04-93f9-ee6de6058fd1","resolution":{"observed_at":"2026-08-09T20:34:01.281832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14852","last_updated":"2024-05-30T15:01:49Z","snapshot_observed_at":"2026-07-06T18:18:51.814306Z","submitted_at":"2024-05-23T17:57:04Z","title":"PV-Tuning: Beyond Straight-Through Estimation for Extreme LLM Compression","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14852","snapshot_observed_at":"2026-08-09T20:34:01.285840Z","title":"Pv-tuning: Beyond straight-through estimation for extreme llm compression","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.19392","last_updated":"2025-02-28T18:04:52Z","snapshot_observed_at":"2026-08-09T20:48:28.727060Z","submitted_at":"2025-01-31T18:47:42Z","title":"Cache Me If You Must: Adaptive Key-Value Quantization for Large Language Models","version":4},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.285840Z"},"links":{"cited_paper":"/paper/2405.14852","citing_paper":"/paper/2501.19392"},"observation_digest":"sha256:580df6d705db96e2f9d8e315c65a611ba55f5ca2f5fc15edcb2d46dbbf2077f3","observation_id":"be5b2b39-17d7-4e12-baa0-d2ac0ad6d211","resolution":{"observed_at":"2026-08-09T20:34:01.285840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17525","last_updated":"2024-11-26T15:35:44Z","snapshot_observed_at":"2026-07-06T19:57:18.481261Z","submitted_at":"2024-11-26T15:35:44Z","title":"Pushing the Limits of Large Language Model Quantization via the Linearity Theorem","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17525","snapshot_observed_at":"2026-08-09T20:34:01.289119Z","title":"Pushing the limits of large language model quantization via the linearity theorem","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.19392","last_updated":"2025-02-28T18:04:52Z","snapshot_observed_at":"2026-08-09T20:48:28.727060Z","submitted_at":"2025-01-31T18:47:42Z","title":"Cache Me If You Must: Adaptive Key-Value Quantization for Large Language Models","version":4},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.289119Z"},"links":{"cited_paper":"/paper/2411.17525","citing_paper":"/paper/2501.19392"},"observation_digest":"sha256:fb16161b732bb8dfab8818e5fb3119a57fb850586099130a40ba685432da85fb","observation_id":"f0f3d9b0-5619-4ccf-a814-6d412e9edcfc","resolution":{"observed_at":"2026-08-09T20:34:01.289119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.07843","last_updated":"2016-09-26T04:06:13Z","snapshot_observed_at":"2026-07-06T05:12:10.387914Z","submitted_at":"2016-09-26T04:06:13Z","title":"Pointer Sentinel Mixture Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.07843","snapshot_observed_at":"2026-08-09T20:34:01.293602Z","title":"Pointer sentinel mixture models","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.19392","last_updated":"2025-02-28T18:04:52Z","snapshot_observed_at":"2026-08-09T20:48:28.727060Z","submitted_at":"2025-01-31T18:47:42Z","title":"Cache Me If You Must: Adaptive Key-Value Quantization for Large Language Models","version":4},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.293602Z"},"links":{"cited_paper":"/paper/1609.07843","citing_paper":"/paper/2501.19392"},"observation_digest":"sha256:341290153b1f73b533bcc5008f236cb543708ab9f7fc5f8bed54f5ab0552f6a9","observation_id":"ec4bf091-6217-4858-9150-f8330403e6bc","resolution":{"observed_at":"2026-08-09T20:34:01.293602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:34:02.177485Z","title":"PyTorch : An imperative style, high-performance deep learning library","venue":null,"work_id":"16826c58-2d55-4227-8d7d-a0364f7bbfed","year":2019},"citing_paper":{"arxiv_id":"2501.19392","last_updated":"2025-02-28T18:04:52Z","snapshot_observed_at":"2026-08-09T20:48:28.727060Z","submitted_at":"2025-01-31T18:47:42Z","title":"Cache Me If You Must: Adaptive Key-Value Quantization for Large Language Models","version":4},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.297355Z"},"links":{"citing_paper":"/paper/2501.19392"},"observation_digest":"sha256:27c08019dde602cee64dc1f3c10102e9f3f387aaaa0c5e63380b557666144dfb","observation_id":"d05ec6d2-877e-4df3-a98f-56f099406ef1","resolution":{"observed_at":"2026-08-09T20:34:02.180789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12250","last_updated":"2024-05-19T22:44:00Z","snapshot_observed_at":"2026-08-03T15:02:24.801842Z","submitted_at":"2024-05-19T22:44:00Z","title":"Your Transformer is Secretly Linear","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12250","snapshot_observed_at":"2026-08-09T20:34:01.300035Z","title":"Your transformer is secretly linear","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.19392","last_updated":"2025-02-28T18:04:52Z","snapshot_observed_at":"2026-08-09T20:48:28.727060Z","submitted_at":"2025-01-31T18:47:42Z","title":"Cache Me If You Must: Adaptive Key-Value Quantization for Large Language Models","version":4},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.300035Z"},"links":{"cited_paper":"/paper/2405.12250","citing_paper":"/paper/2501.19392"},"observation_digest":"sha256:73fa1b457a0281d240d13b13458b085ea97c79d949a2c04594e084f331edb4e1","observation_id":"d5100856-34e6-483f-8383-9210abf52b3d","resolution":{"observed_at":"2026-08-09T20:34:01.300035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:34:01.303327Z","title":null,"venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2501.19392","last_updated":"2025-02-28T18:04:52Z","snapshot_observed_at":"2026-08-09T20:48:28.727060Z","submitted_at":"2025-01-31T18:47:42Z","title":"Cache Me If You Must: Adaptive Key-Value Quantization for Large Language Models","version":4},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.303327Z"},"links":{"citing_paper":"/paper/2501.19392"},"observation_digest":"sha256:6f834bee92d9547d1b5f11cf60516ff78c3f5a8536727cea3b6115a3803d1170","observation_id":"f446cae9-71a6-4b8b-99eb-2b2ff23675c6","resolution":{"observed_at":"2026-08-09T20:34:01.303327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.04054","last_updated":"2021-06-22T20:44:49Z","snapshot_observed_at":"2026-07-06T11:07:47.792836Z","submitted_at":"2021-05-10T00:17:33Z","title":"Societal Biases in Language Generation: Progress and Challenges","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.04054","snapshot_observed_at":"2026-08-09T20:34:01.306566Z","title":"Societal biases in language generation: Progress and challenges","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.19392","last_updated":"2025-02-28T18:04:52Z","snapshot_observed_at":"2026-08-09T20:48:28.727060Z","submitted_at":"2025-01-31T18:47:42Z","title":"Cache Me If You Must: Adaptive Key-Value Quantization for Large Language Models","version":4},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.306566Z"},"links":{"cited_paper":"/paper/2105.04054","citing_paper":"/paper/2501.19392"},"observation_digest":"sha256:da7e7e4ccba85bb8797c8222b5641d319de4d525034011c0a6b2a36ece0c7434","observation_id":"e5ecc08a-e6ac-4eec-84ef-bda8409605dc","resolution":{"observed_at":"2026-08-09T20:34:01.306566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09864","last_updated":"2023-11-08T13:36:32Z","snapshot_observed_at":"2026-07-06T11:01:58.137141Z","submitted_at":"2021-04-20T09:54:06Z","title":"RoFormer: Enhanced Transformer with Rotary Position Embedding","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.09864","snapshot_observed_at":"2026-08-09T20:34:01.309979Z","title":"Roformer: Enhanced transformer with rotary position embedding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.19392","last_updated":"2025-02-28T18:04:52Z","snapshot_observed_at":"2026-08-09T20:48:28.727060Z","submitted_at":"2025-01-31T18:47:42Z","title":"Cache Me If You Must: Adaptive Key-Value Quantization for Large Language Models","version":4},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.309979Z"},"links":{"cited_paper":"/paper/2104.09864","citing_paper":"/paper/2501.19392"},"observation_digest":"sha256:b9133464d375b7b208b10ee328b371d24c78dd1a4755e17c3822abfaa18ffd30","observation_id":"a73bffc1-c291-4e1b-b4cc-510722dcd859","resolution":{"observed_at":"2026-08-09T20:34:01.309979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:34:01.313944Z","title":"Qwen2.5: A party of foundation models, September 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.19392","last_updated":"2025-02-28T18:04:52Z","snapshot_observed_at":"2026-08-09T20:48:28.727060Z","submitted_at":"2025-01-31T18:47:42Z","title":"Cache Me If You Must: Adaptive Key-Value Quantization for Large Language Models","version":4},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.313944Z"},"links":{"citing_paper":"/paper/2501.19392"},"observation_digest":"sha256:0850448a431ab27aab1c030e31ea0a26064da36179ea4c08a72ddc3449984cec","observation_id":"a9b5555b-cc54-48a1-87a2-84fa96ffc1e3","resolution":{"observed_at":"2026-08-09T20:34:01.313944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-09T20:34:01.316831Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.19392","last_updated":"2025-02-28T18:04:52Z","snapshot_observed_at":"2026-08-09T20:48:28.727060Z","submitted_at":"2025-01-31T18:47:42Z","title":"Cache Me If You Must: Adaptive Key-Value Quantization for Large Language Models","version":4},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.316831Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2501.19392"},"observation_digest":"sha256:5ad2b4392218c761afbeaac7a6f7dea9f9406a37ccb55c5854c5b67bf3c897f4","observation_id":"fd55ea0e-1543-4e06-87e7-f2ab5767f297","resolution":{"observed_at":"2026-08-09T20:34:01.316831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04396","last_updated":"2024-06-04T04:51:52Z","snapshot_observed_at":"2026-08-09T13:06:16.631036Z","submitted_at":"2024-02-06T20:52:12Z","title":"QuIP#: Even Better LLM Quantization with Hadamard Incoherence and Lattice Codebooks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04396","snapshot_observed_at":"2026-08-09T20:34:01.320318Z","title":"Quip\\#: Even better llm quantization with hadamard incoherence and lattice codebooks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.19392","last_updated":"2025-02-28T18:04:52Z","snapshot_observed_at":"2026-08-09T20:48:28.727060Z","submitted_at":"2025-01-31T18:47:42Z","title":"Cache Me If You Must: Adaptive Key-Value Quantization for Large Language Models","version":4},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.320318Z"},"links":{"cited_paper":"/paper/2402.04396","citing_paper":"/paper/2501.19392"},"observation_digest":"sha256:883d83893c8327da52ca569a86fbbf8a6f7291e7f535ab48daa0daf4568fdfc2","observation_id":"9926d273-81d8-46b8-9d2d-605d88f75458","resolution":{"observed_at":"2026-08-09T20:34:01.320318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:34:02.158098Z","title":null,"venue":null,"work_id":"66e4a3d4-7ac0-4aae-9554-97cb5bf95bef","year":2024},"citing_paper":{"arxiv_id":"2501.19392","last_updated":"2025-02-28T18:04:52Z","snapshot_observed_at":"2026-08-09T20:48:28.727060Z","submitted_at":"2025-01-31T18:47:42Z","title":"Cache Me If You Must: Adaptive Key-Value Quantization for Large Language Models","version":4},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.323403Z"},"links":{"citing_paper":"/paper/2501.19392"},"observation_digest":"sha256:6258088bc1c610711e3f3a5ec2497ef930ad479fdcc87be641742568b2a89b90","observation_id":"5c3e592f-d489-49e3-825a-8c282473eae6","resolution":{"observed_at":"2026-08-09T20:34:02.162672Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:34:02.147099Z","title":null,"venue":null,"work_id":"bede7c0c-bf0c-4e34-bf7d-cf3d160251f1","year":2024},"citing_paper":{"arxiv_id":"2501.19392","last_updated":"2025-02-28T18:04:52Z","snapshot_observed_at":"2026-08-09T20:48:28.727060Z","submitted_at":"2025-01-31T18:47:42Z","title":"Cache Me If You Must: Adaptive Key-Value Quantization for Large Language Models","version":4},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.326506Z"},"links":{"citing_paper":"/paper/2501.19392"},"observation_digest":"sha256:1b45b4f067b7953c80f6e377f98b7d8c858441828660615b947c12b26d5b8a14","observation_id":"f89d223d-34de-4a17-bc3c-b7f9018f125b","resolution":{"observed_at":"2026-08-09T20:34:02.150601Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15319","last_updated":"2025-06-03T09:22:07Z","snapshot_observed_at":"2026-07-06T17:34:32.617468Z","submitted_at":"2024-02-23T13:39:16Z","title":"GPTVQ: The Blessing of Dimensionality for LLM Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15319","snapshot_observed_at":"2026-08-09T20:34:01.330531Z","title":"Gptvq: The blessing of dimensionality for llm quantization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.19392","last_updated":"2025-02-28T18:04:52Z","snapshot_observed_at":"2026-08-09T20:48:28.727060Z","submitted_at":"2025-01-31T18:47:42Z","title":"Cache Me If You Must: Adaptive Key-Value Quantization for Large Language Models","version":4},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.330531Z"},"links":{"cited_paper":"/paper/2402.15319","citing_paper":"/paper/2501.19392"},"observation_digest":"sha256:a71820fc392a5004cf2fc445a27d04f4d1d0d931fd8715f0506caa9b1fa39b50","observation_id":"9cefe2c7-1865-4dcd-b5e4-bdf3cb2700a8","resolution":{"observed_at":"2026-08-09T20:34:01.330531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:34:01.335869Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.19392","last_updated":"2025-02-28T18:04:52Z","snapshot_observed_at":"2026-08-09T20:48:28.727060Z","submitted_at":"2025-01-31T18:47:42Z","title":"Cache Me If You Must: Adaptive Key-Value Quantization for Large Language Models","version":4},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.335869Z"},"links":{"citing_paper":"/paper/2501.19392"},"observation_digest":"sha256:2795897f6ecb5da91d286f914a41ac6e95f993c2c135f623961d6c26fd418f3f","observation_id":"b1a1c0d2-a727-469b-95c0-61804011d507","resolution":{"observed_at":"2026-08-09T20:34:01.335869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:34:01.339571Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.19392","last_updated":"2025-02-28T18:04:52Z","snapshot_observed_at":"2026-08-09T20:48:28.727060Z","submitted_at":"2025-01-31T18:47:42Z","title":"Cache Me If You Must: Adaptive Key-Value Quantization for Large Language Models","version":4},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.339571Z"},"links":{"citing_paper":"/paper/2501.19392"},"observation_digest":"sha256:b0d0749d3e076ebed00eeadc1285733f05b3ffb3d3163998d2f02d894ddbb9c1","observation_id":"c20bd02e-0937-454f-a476-5e06d12ab2bd","resolution":{"observed_at":"2026-08-09T20:34:01.339571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04359","last_updated":"2021-12-08T16:09:48Z","snapshot_observed_at":"2026-08-09T15:17:43.394064Z","submitted_at":"2021-12-08T16:09:48Z","title":"Ethical and social risks of harm from Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.04359","snapshot_observed_at":"2026-08-09T20:34:01.342390Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.19392","last_updated":"2025-02-28T18:04:52Z","snapshot_observed_at":"2026-08-09T20:48:28.727060Z","submitted_at":"2025-01-31T18:47:42Z","title":"Cache Me If You Must: Adaptive Key-Value Quantization for Large Language Models","version":4},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.342390Z"},"links":{"cited_paper":"/paper/2112.04359","citing_paper":"/paper/2501.19392"},"observation_digest":"sha256:7cde701046394c531e9fff7ae5461d2153386fd7592a49970b60a55fd2ddf9d8","observation_id":"35ce49bf-5326-4b1f-8bab-7cc0fa564058","resolution":{"observed_at":"2026-08-09T20:34:01.342390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:34:02.125641Z","title":null,"venue":null,"work_id":"54e0a163-2053-4733-827d-958f456e7b3c","year":2022},"citing_paper":{"arxiv_id":"2501.19392","last_updated":"2025-02-28T18:04:52Z","snapshot_observed_at":"2026-08-09T20:48:28.727060Z","submitted_at":"2025-01-31T18:47:42Z","title":"Cache Me If You Must: Adaptive Key-Value Quantization for Large Language Models","version":4},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.346803Z"},"links":{"citing_paper":"/paper/2501.19392"},"observation_digest":"sha256:fd8109b147a444bc7116912429ab201bdee0baeeba433af8664d4e603a2ae986","observation_id":"27820dda-1aaa-41e4-b023-1620dc7e8ae4","resolution":{"observed_at":"2026-08-09T20:34:02.128852Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.03771","last_updated":"2020-07-14T03:42:34Z","snapshot_observed_at":"2026-07-06T08:27:58.343233Z","submitted_at":"2019-10-09T03:23:22Z","title":"HuggingFace's Transformers: State-of-the-art Natural Language Processing","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.03771","snapshot_observed_at":"2026-08-09T20:34:01.350988Z","title":"Huggingface's transformers: State-of-the-art natural language processing","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2501.19392","last_updated":"2025-02-28T18:04:52Z","snapshot_observed_at":"2026-08-09T20:48:28.727060Z","submitted_at":"2025-01-31T18:47:42Z","title":"Cache Me If You Must: Adaptive Key-Value Quantization for Large Language Models","version":4},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.350988Z"},"links":{"cited_paper":"/paper/1910.03771","citing_paper":"/paper/2501.19392"},"observation_digest":"sha256:2e413d1aab91ccc5e7f291792f2a336cc227fb4df1efb7af558804dea86df2ef","observation_id":"f5ec474a-361b-46dd-98f6-707024ab02b4","resolution":{"observed_at":"2026-08-09T20:34:01.350988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17453","last_updated":"2024-04-07T00:56:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:59:56Z","title":"Efficient Streaming Language Models with Attention Sinks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17453","snapshot_observed_at":"2026-08-09T20:34:01.355022Z","title":"Efficient streaming language models with attention sinks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.19392","last_updated":"2025-02-28T18:04:52Z","snapshot_observed_at":"2026-08-09T20:48:28.727060Z","submitted_at":"2025-01-31T18:47:42Z","title":"Cache Me If You Must: Adaptive Key-Value Quantization for Large Language Models","version":4},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.355022Z"},"links":{"cited_paper":"/paper/2309.17453","citing_paper":"/paper/2501.19392"},"observation_digest":"sha256:305dc53220b8facc1b73b46b09663ac304342ae42fc9da5ead65b69c31cd2de8","observation_id":"2645100c-35ab-44b7-a89d-6b2d880f895f","resolution":{"observed_at":"2026-08-09T20:34:01.355022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-09T20:34:01.358141Z","title":"Qwen2 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.19392","last_updated":"2025-02-28T18:04:52Z","snapshot_observed_at":"2026-08-09T20:48:28.727060Z","submitted_at":"2025-01-31T18:47:42Z","title":"Cache Me If You Must: Adaptive Key-Value Quantization for Large Language Models","version":4},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.358141Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2501.19392"},"observation_digest":"sha256:dfeee848d5e743718f9ffee40dce2083becfcec542f85a54bc11a3564460ebc1","observation_id":"685d429d-b916-4c2d-b21e-3e38f7f79ca4","resolution":{"observed_at":"2026-08-09T20:34:01.358141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18096","last_updated":"2024-02-28T06:34:54Z","snapshot_observed_at":"2026-07-06T17:36:40.933805Z","submitted_at":"2024-02-28T06:34:54Z","title":"No Token Left Behind: Reliable KV Cache Compression via Importance-Aware Mixed Precision Quantization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18096","snapshot_observed_at":"2026-08-09T20:34:01.361362Z","title":"Y., Kim, B., Bae, J., Kwon, B., Park, G., Yang, E., Kwon, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.19392","last_updated":"2025-02-28T18:04:52Z","snapshot_observed_at":"2026-08-09T20:48:28.727060Z","submitted_at":"2025-01-31T18:47:42Z","title":"Cache Me If You Must: Adaptive Key-Value Quantization for Large Language Models","version":4},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.361362Z"},"links":{"cited_paper":"/paper/2402.18096","citing_paper":"/paper/2501.19392"},"observation_digest":"sha256:500add6f06f25c4775ddcfcf197e074423a12050c74f9faccf04d8aaa6e43cc2","observation_id":"e36af4c4-b7d4-4940-8b8d-a614cfbfadfe","resolution":{"observed_at":"2026-08-09T20:34:01.361362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18517","last_updated":"2024-10-24T08:06:41Z","snapshot_observed_at":"2026-08-06T20:05:52.541270Z","submitted_at":"2024-10-24T08:06:41Z","title":"KVSharer: Efficient Inference via Layer-Wise Dissimilar KV Cache Sharing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18517","snapshot_observed_at":"2026-08-09T20:34:01.364320Z","title":"Kvsharer: Efficient inference via layer-wise dissimilar kv cache sharing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.19392","last_updated":"2025-02-28T18:04:52Z","snapshot_observed_at":"2026-08-09T20:48:28.727060Z","submitted_at":"2025-01-31T18:47:42Z","title":"Cache Me If You Must: Adaptive Key-Value Quantization for Large Language Models","version":4},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.364320Z"},"links":{"cited_paper":"/paper/2410.18517","citing_paper":"/paper/2501.19392"},"observation_digest":"sha256:b0bf0eaed43317dbf063d3f027af48abb6b6d55db049dd419cd5f9d67f0a7888","observation_id":"e75cced3-0e74-4d9b-a114-f262531871d2","resolution":{"observed_at":"2026-08-09T20:34:01.364320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12065","last_updated":"2024-02-20T08:48:24Z","snapshot_observed_at":"2026-07-06T17:32:10.828230Z","submitted_at":"2024-02-19T11:33:21Z","title":"WKVQuant: Quantizing Weight and Key/Value Cache for Large Language Models Gains More","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12065","snapshot_observed_at":"2026-08-09T20:34:01.368235Z","title":"Wkvquant: Quantizing weight and key/value cache for large language models gains more","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.19392","last_updated":"2025-02-28T18:04:52Z","snapshot_observed_at":"2026-08-09T20:48:28.727060Z","submitted_at":"2025-01-31T18:47:42Z","title":"Cache Me If You Must: Adaptive Key-Value Quantization for Large Language Models","version":4},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.368235Z"},"links":{"cited_paper":"/paper/2402.12065","citing_paper":"/paper/2501.19392"},"observation_digest":"sha256:d9f7af4f4083e895a965be2a1a22318c585b84f35f74e759c2d7df90b33d4a75","observation_id":"7761c196-453c-4558-84f1-8e046a244107","resolution":{"observed_at":"2026-08-09T20:34:01.368235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03482","last_updated":"2024-07-18T16:31:29Z","snapshot_observed_at":"2026-08-09T20:48:09.484854Z","submitted_at":"2024-06-05T17:42:05Z","title":"QJL: 1-Bit Quantized JL Transform for KV Cache Quantization with Zero Overhead","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03482","snapshot_observed_at":"2026-08-09T20:34:01.371452Z","title":"Qjl: 1-bit quantized jl transform for kv cache quantization with zero overhead","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.19392","last_updated":"2025-02-28T18:04:52Z","snapshot_observed_at":"2026-08-09T20:48:28.727060Z","submitted_at":"2025-01-31T18:47:42Z","title":"Cache Me If You Must: Adaptive Key-Value Quantization for Large Language Models","version":4},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.371452Z"},"links":{"cited_paper":"/paper/2406.03482","citing_paper":"/paper/2501.19392"},"observation_digest":"sha256:40dfa96087254a68982977f0a51a5f01ddf82a331cdec38e2fc808643c5e493c","observation_id":"09da41e6-ac57-436c-8e5e-4482df3496cc","resolution":{"observed_at":"2026-08-09T20:34:01.371452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04107","last_updated":"2025-06-08T20:04:17Z","snapshot_observed_at":"2026-08-03T21:46:42.316650Z","submitted_at":"2024-08-07T22:10:26Z","title":"FDC: Fast KV Dimensionality Compression for Efficient LLM Inference","version":3},"cited_work":{"arxiv_id":"2408.04107","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.04107","snapshot_observed_at":"2026-08-09T20:34:01.420371Z","title":"FDC: Fast KV Dimensionality Compression for Efficient LLM Inference","venue":"cs.LG","work_id":"653288af-81c3-4510-abd4-ea1a624eb59e","year":2024},"citing_paper":{"arxiv_id":"2501.19392","last_updated":"2025-02-28T18:04:52Z","snapshot_observed_at":"2026-08-09T20:48:28.727060Z","submitted_at":"2025-01-31T18:47:42Z","title":"Cache Me If You Must: Adaptive Key-Value Quantization for Large Language Models","version":4},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.375678Z"},"links":{"cited_paper":"/paper/2408.04107","citing_paper":"/paper/2501.19392"},"observation_digest":"sha256:3bbaab17c13991f2d5fd7f622c1dfa117c6bc2215c487aafbd76891986ce228c","observation_id":"e6291d10-d012-4508-af3a-b78590459ccf","resolution":{"observed_at":"2026-08-09T20:34:01.426422Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:34:01.379174Z","title":"H2o: Heavy-hitter oracle for efficient generative inference of large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.19392","last_updated":"2025-02-28T18:04:52Z","snapshot_observed_at":"2026-08-09T20:48:28.727060Z","submitted_at":"2025-01-31T18:47:42Z","title":"Cache Me If You Must: Adaptive Key-Value Quantization for Large Language Models","version":4},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.379174Z"},"links":{"citing_paper":"/paper/2501.19392"},"observation_digest":"sha256:22659caa383436f1beffd53f59ac2d8605dac62ae6a54042f5c13dc352b9c31c","observation_id":"b458603b-e590-4201-bbfc-0d58d785b0d5","resolution":{"observed_at":"2026-08-09T20:34:01.379174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12867","last_updated":"2023-05-29T17:46:54Z","snapshot_observed_at":"2026-08-10T02:40:14.785930Z","submitted_at":"2023-01-30T13:20:48Z","title":"Red teaming ChatGPT via Jailbreaking: Bias, Robustness, Reliability and Toxicity","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12867","snapshot_observed_at":"2026-08-09T20:34:01.382301Z","title":"Y., Huang, Y., Chen, C., and Xing, Z","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.19392","last_updated":"2025-02-28T18:04:52Z","snapshot_observed_at":"2026-08-09T20:48:28.727060Z","submitted_at":"2025-01-31T18:47:42Z","title":"Cache Me If You Must: Adaptive Key-Value Quantization for Large Language Models","version":4},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.382301Z"},"links":{"cited_paper":"/paper/2301.12867","citing_paper":"/paper/2501.19392"},"observation_digest":"sha256:09a6815e50ebcec248cf24818cd36f7ce6a8e281a89513808e1c56567fec8718","observation_id":"b11442c7-e928-4a77-9eee-1621558020bd","resolution":{"observed_at":"2026-08-09T20:34:01.382301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.19392","last_updated":"2025-02-28T18:04:52Z","latest_version":4,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T20:48:28.727060Z","submitted_at":"2025-01-31T18:47:42Z","title":"Cache Me If You Must: Adaptive Key-Value Quantization for Large Language Models"},"reference_resolution":{"displayed":59,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":54,"verified_exact":2,"verified_fuzzy":3},"total_outbound_references":59},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 6 inbound Pith citation observations for arXiv:2501.19392."}