{"as_of":"2026-08-12T14:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4d4e982fc0818268428cca4986deb025d468d96321493015044ba187b71e6f5e","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T14:06:38.022879Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.19823/citation-record","integrity":"/paper/2507.19823/integrity","json":"/paper/2507.19823/citation-record.json","paper":"/paper/2507.19823"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:41.029720Z","title":"2 In the approximate attention score computation, the computation is performed group-wise","venue":null,"work_id":"8b34c2f0-b947-41dc-8667-3dc137041e4d","year":null},"citing_paper":{"arxiv_id":"2507.19823","last_updated":"2025-07-26T06:43:14Z","snapshot_observed_at":"2026-08-10T11:33:20.339897Z","submitted_at":"2025-07-26T06:43:14Z","title":"HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:37.876858Z"},"links":{"citing_paper":"/paper/2507.19823"},"observation_digest":"sha256:98e151a743b4af9e5b62a2cc2f85141eec990021dcc545df4c36a181364fc8b2","observation_id":"ee6a794a-a478-4d69-b76b-a1f91e63179e","resolution":{"observed_at":"2026-08-06T14:06:41.183917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:40.870508Z","title":"needles\" on the task performance. We take “The best thing to do in Paris is buy a fresh croissant and lounge by the Seine at twilight","venue":null,"work_id":"c4e426bd-a892-44a2-b74d-b04d17158d0b","year":null},"citing_paper":{"arxiv_id":"2507.19823","last_updated":"2025-07-26T06:43:14Z","snapshot_observed_at":"2026-08-10T11:33:20.339897Z","submitted_at":"2025-07-26T06:43:14Z","title":"HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:37.880928Z"},"links":{"citing_paper":"/paper/2507.19823"},"observation_digest":"sha256:a5d45b7c0cc359414b95ba3e00ed878df2c036a497914594f89f6381da78635a","observation_id":"0414ced1-bf2c-4593-b73d-89948ed9b6be","resolution":{"observed_at":"2026-08-06T14:06:40.923973Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T14:06:37.884942Z","title":"GPT-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19823","last_updated":"2025-07-26T06:43:14Z","snapshot_observed_at":"2026-08-10T11:33:20.339897Z","submitted_at":"2025-07-26T06:43:14Z","title":"HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:37.884942Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.19823"},"observation_digest":"sha256:36f6cd4a877bad3054850c9c846a6c694f4ae83ad07b639c3541401f3f824914","observation_id":"96117a3d-8e7e-4b5d-ae64-ca5412b25625","resolution":{"observed_at":"2026-08-06T14:06:37.884942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:40.599377Z","title":"Keyformer: Kv cache reduction through key tokens selection for efficient generative inference","venue":null,"work_id":"4e44fbcf-7b1d-4a20-aa79-19574b5090f4","year":2024},"citing_paper":{"arxiv_id":"2507.19823","last_updated":"2025-07-26T06:43:14Z","snapshot_observed_at":"2026-08-10T11:33:20.339897Z","submitted_at":"2025-07-26T06:43:14Z","title":"HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:37.887582Z"},"links":{"citing_paper":"/paper/2507.19823"},"observation_digest":"sha256:f5b2f69757e3f9501a8309d45d1deed51e66bfeb50e0bd3f7e9d4b6d601cac06","observation_id":"fdebe3d6-067d-43c2-837a-d187f24ae57a","resolution":{"observed_at":"2026-08-06T14:06:40.739676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-06T14:06:37.890090Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19823","last_updated":"2025-07-26T06:43:14Z","snapshot_observed_at":"2026-08-10T11:33:20.339897Z","submitted_at":"2025-07-26T06:43:14Z","title":"HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:37.890090Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2507.19823"},"observation_digest":"sha256:c44527af2bcb698a246d904175f9053b6dcee1409257dc3b5bec170321e908c8","observation_id":"606dceea-355c-4ae0-bf69-50c93b47d171","resolution":{"observed_at":"2026-08-06T14:06:37.890090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:40.352060Z","title":"LongBench: A Bilingual, Multitask Benchmark for Long Context Under- standing","venue":null,"work_id":"e594e97a-ef87-422f-994f-941cab1a4001","year":2024},"citing_paper":{"arxiv_id":"2507.19823","last_updated":"2025-07-26T06:43:14Z","snapshot_observed_at":"2026-08-10T11:33:20.339897Z","submitted_at":"2025-07-26T06:43:14Z","title":"HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:37.892704Z"},"links":{"citing_paper":"/paper/2507.19823"},"observation_digest":"sha256:2eed1eb6719673d334051f13bf80e23db1a0252dcc1635dcf9850f842cb6ef98","observation_id":"ecfac449-9f5c-462e-a6f0-a0adf0e10d7e","resolution":{"observed_at":"2026-08-06T14:06:40.465957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-06T14:06:37.895942Z","title":"Longformer: The long-document transformer","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.19823","last_updated":"2025-07-26T06:43:14Z","snapshot_observed_at":"2026-08-10T11:33:20.339897Z","submitted_at":"2025-07-26T06:43:14Z","title":"HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:37.895942Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2507.19823"},"observation_digest":"sha256:2660b94b715c7552a0f9174ed8cfc33fa39d57404fc9a90a02f8f7ec9678125f","observation_id":"8130c8ad-6e46-4174-b1ca-29ef63735ca7","resolution":{"observed_at":"2026-08-06T14:06:37.895942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:40.115978Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","venue":null,"work_id":"cba95efd-5b82-4f3c-9bc1-f6c57e41721d","year":2024},"citing_paper":{"arxiv_id":"2507.19823","last_updated":"2025-07-26T06:43:14Z","snapshot_observed_at":"2026-08-10T11:33:20.339897Z","submitted_at":"2025-07-26T06:43:14Z","title":"HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:37.898719Z"},"links":{"citing_paper":"/paper/2507.19823"},"observation_digest":"sha256:dd10b3d4c8a27ba28fecec5a0750fa28845b2d600e2ea47afaaa2bdc96b2e213","observation_id":"389002f8-0351-49b5-8c60-8f50422b2ee5","resolution":{"observed_at":"2026-08-06T14:06:40.235668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01801","last_updated":"2024-10-29T18:26:09Z","snapshot_observed_at":"2026-08-12T07:32:52.500307Z","submitted_at":"2023-10-03T05:17:08Z","title":"Model Tells You What to Discard: Adaptive KV Cache Compression for LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01801","snapshot_observed_at":"2026-08-06T14:06:37.901469Z","title":"Model tells you what to discard: Adaptive kv cache compression for llms","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19823","last_updated":"2025-07-26T06:43:14Z","snapshot_observed_at":"2026-08-10T11:33:20.339897Z","submitted_at":"2025-07-26T06:43:14Z","title":"HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:37.901469Z"},"links":{"cited_paper":"/paper/2310.01801","citing_paper":"/paper/2507.19823"},"observation_digest":"sha256:28cc1c1b01e1b7d1c07e8c47bc47f3af6b998eef6348706cead2a020f3c88558","observation_id":"1a40cc01-238f-4c1e-9b65-cfe96b455c10","resolution":{"observed_at":"2026-08-06T14:06:37.901469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T14:06:37.904247Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19823","last_updated":"2025-07-26T06:43:14Z","snapshot_observed_at":"2026-08-10T11:33:20.339897Z","submitted_at":"2025-07-26T06:43:14Z","title":"HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:37.904247Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2507.19823"},"observation_digest":"sha256:b79510d64c8ee914390d653553b2c275a3cb0f1ec2b63336494fefb59e3e7c08","observation_id":"adfc8e26-5816-431e-8d23-388877f32cbe","resolution":{"observed_at":"2026-08-06T14:06:37.904247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11421","last_updated":"2024-03-18T02:30:23Z","snapshot_observed_at":"2026-08-09T07:19:27.126976Z","submitted_at":"2024-03-18T02:30:23Z","title":"FastDecode: High-Throughput GPU-Efficient LLM Serving using Heterogeneous Pipelines","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11421","snapshot_observed_at":"2026-08-06T14:06:37.907873Z","title":"Fastdecode: High-throughput gpu-efficient llm serving using heterogeneous pipelines","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19823","last_updated":"2025-07-26T06:43:14Z","snapshot_observed_at":"2026-08-10T11:33:20.339897Z","submitted_at":"2025-07-26T06:43:14Z","title":"HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:37.907873Z"},"links":{"cited_paper":"/paper/2403.11421","citing_paper":"/paper/2507.19823"},"observation_digest":"sha256:4f66d7649ade21027a21d9e045f5a05e202c4d9bf90a2d39262fcbcabaaf14e6","observation_id":"950360d6-18a2-4927-9922-c48f3179ece1","resolution":{"observed_at":"2026-08-06T14:06:37.907873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:39.962193Z","title":"ZipCache: Accurate and Efficient KV Cache Quantization with Salient Token Identification","venue":null,"work_id":"bb4a7e0a-10f5-4bc7-aa47-5ffdd2765f0e","year":null},"citing_paper":{"arxiv_id":"2507.19823","last_updated":"2025-07-26T06:43:14Z","snapshot_observed_at":"2026-08-10T11:33:20.339897Z","submitted_at":"2025-07-26T06:43:14Z","title":"HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:37.910383Z"},"links":{"citing_paper":"/paper/2507.19823"},"observation_digest":"sha256:4bc39070057b401ce3f3d23f70b261f35e47c3eabb29f9fa5020c8dda89bc2a4","observation_id":"cca51106-df38-4722-a13a-e74117eb2f5a","resolution":{"observed_at":"2026-08-06T14:06:40.051532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-08T06:16:25.839566Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-06T14:06:37.917505Z","title":"Mixtral of experts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19823","last_updated":"2025-07-26T06:43:14Z","snapshot_observed_at":"2026-08-10T11:33:20.339897Z","submitted_at":"2025-07-26T06:43:14Z","title":"HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:37.917505Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2507.19823"},"observation_digest":"sha256:101fa5897c658215a0e1fe2de8eeb2837da8481a496fc731f0636b6b3c6196e1","observation_id":"4e7b22e9-2adb-4006-a7d2-5f6170baf825","resolution":{"observed_at":"2026-08-06T14:06:37.917505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01142","last_updated":"2024-11-02T05:15:44Z","snapshot_observed_at":"2026-08-11T03:21:58.328111Z","submitted_at":"2024-11-02T05:15:44Z","title":"NEO: Saving GPU Memory Crisis with CPU Offloading for Online LLM Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01142","snapshot_observed_at":"2026-08-06T14:06:37.921530Z","title":"Neo: Saving gpu memory crisis with cpu offloading for online llm inference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19823","last_updated":"2025-07-26T06:43:14Z","snapshot_observed_at":"2026-08-10T11:33:20.339897Z","submitted_at":"2025-07-26T06:43:14Z","title":"HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:37.921530Z"},"links":{"cited_paper":"/paper/2411.01142","citing_paper":"/paper/2507.19823"},"observation_digest":"sha256:137a406530ae38e705ae572088a9c48973e64ae0b43ab98add9c34ada0f8ec5d","observation_id":"5fc44e7c-d87c-46d0-83a0-a26cfd1a7dce","resolution":{"observed_at":"2026-08-06T14:06:37.921530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:39.831016Z","title":"Kamradt.Llmtest_needleinahaystack: Doing simple retrieval from llm models at vari- ous context lengths to measure accuracy","venue":null,"work_id":"4458ecfd-d61f-4d67-884d-a3c4bbf6c443","year":2024},"citing_paper":{"arxiv_id":"2507.19823","last_updated":"2025-07-26T06:43:14Z","snapshot_observed_at":"2026-08-10T11:33:20.339897Z","submitted_at":"2025-07-26T06:43:14Z","title":"HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:37.924853Z"},"links":{"citing_paper":"/paper/2507.19823"},"observation_digest":"sha256:9284e60b514471281427363ca01cfcb4625f3a364681e6445272b4ff44ea5bf8","observation_id":"615aef19-ece2-4278-b6c8-72c8a1b22de4","resolution":{"observed_at":"2026-08-06T14:06:39.903944Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04717","last_updated":"2026-04-20T02:55:07Z","snapshot_observed_at":"2026-07-06T21:05:11.303685Z","submitted_at":"2025-04-07T04:00:08Z","title":"Beyond Single-Turn: A Survey on Multi-Turn Interactions with Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.04717","snapshot_observed_at":"2026-08-06T14:06:37.929141Z","title":"Beyond Single- Turn: A Survey on Multi-Turn Interactions with Large Language Models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.19823","last_updated":"2025-07-26T06:43:14Z","snapshot_observed_at":"2026-08-10T11:33:20.339897Z","submitted_at":"2025-07-26T06:43:14Z","title":"HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:37.929141Z"},"links":{"cited_paper":"/paper/2504.04717","citing_paper":"/paper/2507.19823"},"observation_digest":"sha256:b638380c8769b445b0ab990e34dd4b1366a12237d7a5dcd2d23066e8ec36fac5","observation_id":"c4c7c256-85e4-49b5-bfb6-54a9f96df94b","resolution":{"observed_at":"2026-08-06T14:06:37.929141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11745","last_updated":"2024-12-23T15:36:32Z","snapshot_observed_at":"2026-08-12T05:08:45.991342Z","submitted_at":"2024-08-21T16:11:59Z","title":"FocusLLM: Precise Understanding of Long Context by Dynamic Condensing","version":2},"cited_work":{"arxiv_id":"2408.11745","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.11745","snapshot_observed_at":"2026-08-06T14:06:38.185510Z","title":"FocusLLM: Precise Understanding of Long Context by Dynamic Condensing","venue":"cs.CL","work_id":"4ef26d44-0cfa-438b-9334-8f23fd7bd96d","year":2024},"citing_paper":{"arxiv_id":"2507.19823","last_updated":"2025-07-26T06:43:14Z","snapshot_observed_at":"2026-08-10T11:33:20.339897Z","submitted_at":"2025-07-26T06:43:14Z","title":"HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:37.933299Z"},"links":{"cited_paper":"/paper/2408.11745","citing_paper":"/paper/2507.19823"},"observation_digest":"sha256:0e266b8632c1148200d654c3fb3a7ba9becb3d2c4be05f95569312f5733fb634","observation_id":"540ef15f-0219-466f-b0bd-cb6a60457dd6","resolution":{"observed_at":"2026-08-06T14:06:38.215398Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-06T14:06:37.937463Z","title":"Deepseek-v2: A strong, economical, and efficient mixture-of-experts language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19823","last_updated":"2025-07-26T06:43:14Z","snapshot_observed_at":"2026-08-10T11:33:20.339897Z","submitted_at":"2025-07-26T06:43:14Z","title":"HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:37.937463Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2507.19823"},"observation_digest":"sha256:fcd2e39ddccfd0e8b34dd8371833d47d2a4bb8c9ee0d2b3a18e0569a7f0642a4","observation_id":"b1537645-a823-4aaf-aae9-821058aae735","resolution":{"observed_at":"2026-08-06T14:06:37.937463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:39.677567Z","title":"KIVI: a tuning- free asymmetric 2bit quantization for KV cache","venue":null,"work_id":"e9d6e0a4-26be-4117-adc0-0a33a96d807b","year":2024},"citing_paper":{"arxiv_id":"2507.19823","last_updated":"2025-07-26T06:43:14Z","snapshot_observed_at":"2026-08-10T11:33:20.339897Z","submitted_at":"2025-07-26T06:43:14Z","title":"HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:37.941514Z"},"links":{"citing_paper":"/paper/2507.19823"},"observation_digest":"sha256:e1e161febc91dc13f648e3b9a12067b4debb84e9f40581f1ffa54ab2f730d160","observation_id":"2f1c78db-f234-4b0d-b048-757ca3fc22ec","resolution":{"observed_at":"2026-08-06T14:06:39.751585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13626","last_updated":"2024-12-18T09:04:55Z","snapshot_observed_at":"2026-08-11T12:54:38.730106Z","submitted_at":"2024-12-18T09:04:55Z","title":"LIFT: Improving Long Context Understanding Through Long Input Fine-Tuning","version":1},"cited_work":{"arxiv_id":"2412.13626","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.13626","snapshot_observed_at":"2026-08-06T14:06:38.107747Z","title":"LIFT: Improving Long Context Understanding Through Long Input Fine-Tuning","venue":"cs.CL","work_id":"9127f03d-7af2-417a-aead-21057c76c149","year":2024},"citing_paper":{"arxiv_id":"2507.19823","last_updated":"2025-07-26T06:43:14Z","snapshot_observed_at":"2026-08-10T11:33:20.339897Z","submitted_at":"2025-07-26T06:43:14Z","title":"HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:37.947046Z"},"links":{"cited_paper":"/paper/2412.13626","citing_paper":"/paper/2507.19823"},"observation_digest":"sha256:be0a22679ffec8ea05e860c594caae919eb78c693a86f1fd0324bad88c305736","observation_id":"288d86ab-58a8-495f-a228-5b9ee5ec114d","resolution":{"observed_at":"2026-08-06T14:06:38.123954Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.08877","last_updated":"2021-12-14T06:19:33Z","snapshot_observed_at":"2026-08-06T08:28:54.662531Z","submitted_at":"2021-08-19T18:58:02Z","title":"Sentence-T5: Scalable Sentence Encoders from Pre-trained Text-to-Text Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.08877","snapshot_observed_at":"2026-08-06T14:06:37.951435Z","title":"Sentence-t5: Scalable sentence encoders from pre-trained text-to-text models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.19823","last_updated":"2025-07-26T06:43:14Z","snapshot_observed_at":"2026-08-10T11:33:20.339897Z","submitted_at":"2025-07-26T06:43:14Z","title":"HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:37.951435Z"},"links":{"cited_paper":"/paper/2108.08877","citing_paper":"/paper/2507.19823"},"observation_digest":"sha256:336ae4238fd2635b1f788151549674e06fd98395f00d549cca9cb6abb270a6d6","observation_id":"db751f23-2830-4e43-b0c2-665b4dc94514","resolution":{"observed_at":"2026-08-06T14:06:37.951435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:39.569420Z","title":"Transformers are Multi-State RNNs","venue":null,"work_id":"8128b4fa-fe84-4c2f-b016-026e8c749e7e","year":2024},"citing_paper":{"arxiv_id":"2507.19823","last_updated":"2025-07-26T06:43:14Z","snapshot_observed_at":"2026-08-10T11:33:20.339897Z","submitted_at":"2025-07-26T06:43:14Z","title":"HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:37.954862Z"},"links":{"citing_paper":"/paper/2507.19823"},"observation_digest":"sha256:4345f7cdaa87637174021b6f7ec16dd0161ca7f3c20af00ddaa65cb36163b432","observation_id":"e5083c6d-33ab-49cf-825d-b81d20220c1c","resolution":{"observed_at":"2026-08-06T14:06:39.609049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:39.468337Z","title":"Scikit-learn: Machine learning in Python","venue":null,"work_id":"3b304252-5405-4b42-8967-4c58f1c8dc65","year":2011},"citing_paper":{"arxiv_id":"2507.19823","last_updated":"2025-07-26T06:43:14Z","snapshot_observed_at":"2026-08-10T11:33:20.339897Z","submitted_at":"2025-07-26T06:43:14Z","title":"HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:37.958718Z"},"links":{"citing_paper":"/paper/2507.19823"},"observation_digest":"sha256:c8fb9ad35a6b39e126090cf4c985c6a5a6c1bb067a852e8b00a1e5b934a17dc3","observation_id":"cf1c9358-62f9-4a64-bdc7-b1ac7d5880f6","resolution":{"observed_at":"2026-08-06T14:06:39.500139Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:39.375609Z","title":"Web-scale k-means clustering","venue":null,"work_id":"8e2da9a7-44b2-414b-91cf-d3f924badb6b","year":2010},"citing_paper":{"arxiv_id":"2507.19823","last_updated":"2025-07-26T06:43:14Z","snapshot_observed_at":"2026-08-10T11:33:20.339897Z","submitted_at":"2025-07-26T06:43:14Z","title":"HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:37.961351Z"},"links":{"citing_paper":"/paper/2507.19823"},"observation_digest":"sha256:9b4662aed174b48fa15017c1986cfdc6a3a77b3e1c51582fa9bf4495b5f014b3","observation_id":"93f5acea-eed0-44a1-a7f2-d3b38187eb1b","resolution":{"observed_at":"2026-08-06T14:06:39.418351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:39.279976Z","title":"Adafactor: Adaptive learning rates with sublinear memory cost","venue":null,"work_id":"93f4644c-534a-4e45-b6c4-de0abf988cc7","year":2018},"citing_paper":{"arxiv_id":"2507.19823","last_updated":"2025-07-26T06:43:14Z","snapshot_observed_at":"2026-08-10T11:33:20.339897Z","submitted_at":"2025-07-26T06:43:14Z","title":"HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:37.963935Z"},"links":{"citing_paper":"/paper/2507.19823"},"observation_digest":"sha256:1613d8ae92dbbaac5f94ffb4ee7e7fef2f3c1dc2a669eb79aab26b7d70e82ba3","observation_id":"acf8426f-15ab-4ec1-bc9f-acf90e0f47f7","resolution":{"observed_at":"2026-08-06T14:06:39.338961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:39.166244Z","title":"QUEST: Query-Aware Sparsity for Efficient Long-Context LLM Inference","venue":null,"work_id":"7caf6d34-575b-46da-93c4-f1ec909b1734","year":2024},"citing_paper":{"arxiv_id":"2507.19823","last_updated":"2025-07-26T06:43:14Z","snapshot_observed_at":"2026-08-10T11:33:20.339897Z","submitted_at":"2025-07-26T06:43:14Z","title":"HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:37.966289Z"},"links":{"citing_paper":"/paper/2507.19823"},"observation_digest":"sha256:f2c4f221ee4a9ed07d994f0598d1bd65e40b3ff0ad1b5e6f7cf863cdc3f23f36","observation_id":"d8d2ff7a-a944-4ac6-88d1-a65a44d82955","resolution":{"observed_at":"2026-08-06T14:06:39.207679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:39.029566Z","title":"AsymKV: Enabling 1-Bit Quantization of KV Cache with Layer- Wise Asymmetric Quantization Configurations","venue":null,"work_id":"2faab054-16f2-4740-8cf8-55046cf68764","year":2025},"citing_paper":{"arxiv_id":"2507.19823","last_updated":"2025-07-26T06:43:14Z","snapshot_observed_at":"2026-08-10T11:33:20.339897Z","submitted_at":"2025-07-26T06:43:14Z","title":"HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:37.970390Z"},"links":{"citing_paper":"/paper/2507.19823"},"observation_digest":"sha256:ccbb6c6206861207df0dbddb12886e2e549b07c8eaeb99f96fcb651075b7ad10","observation_id":"9b79bf44-ecb7-4a4f-b923-8ee1d1742da8","resolution":{"observed_at":"2026-08-06T14:06:39.135861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-06T14:06:37.974660Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19823","last_updated":"2025-07-26T06:43:14Z","snapshot_observed_at":"2026-08-10T11:33:20.339897Z","submitted_at":"2025-07-26T06:43:14Z","title":"HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:37.974660Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2507.19823"},"observation_digest":"sha256:9e0c3faed82d8807fafc651432fe2d10876c8ea861fd45287d67a4e30856773c","observation_id":"4a804256-821c-4af7-941a-011ea97cf392","resolution":{"observed_at":"2026-08-06T14:06:37.974660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-06T14:06:37.978694Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19823","last_updated":"2025-07-26T06:43:14Z","snapshot_observed_at":"2026-08-10T11:33:20.339897Z","submitted_at":"2025-07-26T06:43:14Z","title":"HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:37.978694Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2507.19823"},"observation_digest":"sha256:0c310223d5cbe89fb71fb8a968678c3d0c71817a2e3e93ac1b9c7b34f7329474","observation_id":"4b2a5842-f14a-4cf0-827c-9eb9dfbe3fb6","resolution":{"observed_at":"2026-08-06T14:06:37.978694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:38.803907Z","title":"Attention is all you need","venue":null,"work_id":"45ac30c4-b92b-4447-91ed-cc47a918ace2","year":2017},"citing_paper":{"arxiv_id":"2507.19823","last_updated":"2025-07-26T06:43:14Z","snapshot_observed_at":"2026-08-10T11:33:20.339897Z","submitted_at":"2025-07-26T06:43:14Z","title":"HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:37.981698Z"},"links":{"citing_paper":"/paper/2507.19823"},"observation_digest":"sha256:66af31f62261c25d181c263f270c68b5c99f6dd20e2ac7b1dd720d2d6e598053","observation_id":"11c6413d-c09a-4c77-9d51-63c2b6c1ab0a","resolution":{"observed_at":"2026-08-06T14:06:38.904377Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:38.716214Z","title":"Fast transformers with clustered attention","venue":null,"work_id":"1f16cd15-7ba6-48ae-a1ab-af29e5967ba7","year":2020},"citing_paper":{"arxiv_id":"2507.19823","last_updated":"2025-07-26T06:43:14Z","snapshot_observed_at":"2026-08-10T11:33:20.339897Z","submitted_at":"2025-07-26T06:43:14Z","title":"HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:37.984746Z"},"links":{"citing_paper":"/paper/2507.19823"},"observation_digest":"sha256:a0b185842f9ad9e156f840cfd067a006e5cc2afc64d2b07426dc005532589290","observation_id":"98f37da9-ea15-4352-a0a8-bdd8e46ac2f7","resolution":{"observed_at":"2026-08-06T14:06:38.751720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:38.589244Z","title":"SqueezeAttention: 2D Management of KV-Cache in LLM Inference via Layer-wise Optimal Budget","venue":null,"work_id":"e27108e7-2570-4762-9c23-15dea2f06efe","year":null},"citing_paper":{"arxiv_id":"2507.19823","last_updated":"2025-07-26T06:43:14Z","snapshot_observed_at":"2026-08-10T11:33:20.339897Z","submitted_at":"2025-07-26T06:43:14Z","title":"HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:37.988527Z"},"links":{"citing_paper":"/paper/2507.19823"},"observation_digest":"sha256:3a7e209080414aae0d12f03f02659e6fa2eea0d3b9fe626aa5a564c87b8aaf1e","observation_id":"0f0aea8d-7a86-400a-859c-ac0a51eaf6ae","resolution":{"observed_at":"2026-08-06T14:06:38.630982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10819","last_updated":"2024-10-14T17:59:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-14T17:59:58Z","title":"DuoAttention: Efficient Long-Context LLM Inference with Retrieval and Streaming Heads","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10819","snapshot_observed_at":"2026-08-06T14:06:37.990797Z","title":"Duoattention: Ef- ficient long-context llm inference with retrieval and streaming heads","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19823","last_updated":"2025-07-26T06:43:14Z","snapshot_observed_at":"2026-08-10T11:33:20.339897Z","submitted_at":"2025-07-26T06:43:14Z","title":"HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:37.990797Z"},"links":{"cited_paper":"/paper/2410.10819","citing_paper":"/paper/2507.19823"},"observation_digest":"sha256:89de8ed122e82848e080f737ac96f658ce770fe874350f688f96531e73f0436e","observation_id":"1c1e24bb-8c80-462b-a0a0-6e64696e4b37","resolution":{"observed_at":"2026-08-06T14:06:37.990797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:38.532898Z","title":"Efficient Streaming Language Models with Attention Sinks","venue":null,"work_id":"b857dbae-d792-48e6-afb9-b296e4b60487","year":null},"citing_paper":{"arxiv_id":"2507.19823","last_updated":"2025-07-26T06:43:14Z","snapshot_observed_at":"2026-08-10T11:33:20.339897Z","submitted_at":"2025-07-26T06:43:14Z","title":"HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:37.993929Z"},"links":{"citing_paper":"/paper/2507.19823"},"observation_digest":"sha256:51f0a3de2d6572f522a20716a34693796aa22bdd106a70754b1687305b6683c9","observation_id":"a73e0ec4-c5a0-47a7-8d9a-0825d23228ff","resolution":{"observed_at":"2026-08-06T14:06:38.560300Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15309","last_updated":"2024-07-22T14:37:58Z","snapshot_observed_at":"2026-07-06T18:49:46.992782Z","submitted_at":"2024-07-22T14:37:58Z","title":"vTensor: Flexible Virtual Tensor Management for Efficient LLM Serving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15309","snapshot_observed_at":"2026-08-06T14:06:37.998948Z","title":"vtensor: Flexible virtual tensor management for efficient llm serving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19823","last_updated":"2025-07-26T06:43:14Z","snapshot_observed_at":"2026-08-10T11:33:20.339897Z","submitted_at":"2025-07-26T06:43:14Z","title":"HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:37.998948Z"},"links":{"cited_paper":"/paper/2407.15309","citing_paper":"/paper/2507.19823"},"observation_digest":"sha256:01457665876a62303ee08e13ae1c552f7446f17cd9e51df23f548a1a3b153285","observation_id":"58d002b9-2bf8-478d-9a61-9193fcab74e8","resolution":{"observed_at":"2026-08-06T14:06:37.998948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21018","last_updated":"2025-02-27T12:30:43Z","snapshot_observed_at":"2026-08-09T12:45:38.058315Z","submitted_at":"2024-07-30T17:59:08Z","title":"ThinK: Thinner Key Cache by Query-Driven Pruning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21018","snapshot_observed_at":"2026-08-06T14:06:38.003459Z","title":"Think: Thinner key cache by query-driven pruning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19823","last_updated":"2025-07-26T06:43:14Z","snapshot_observed_at":"2026-08-10T11:33:20.339897Z","submitted_at":"2025-07-26T06:43:14Z","title":"HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:38.003459Z"},"links":{"cited_paper":"/paper/2407.21018","citing_paper":"/paper/2507.19823"},"observation_digest":"sha256:26c701e8971a4182496db33cef8f486ea7c8208ba7f55b863e0627e5a55ad5ff","observation_id":"5e20b226-1612-4e36-adc7-a2a165d53f6b","resolution":{"observed_at":"2026-08-06T14:06:38.003459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09959","last_updated":"2025-01-17T05:21:49Z","snapshot_observed_at":"2026-08-10T19:27:34.306445Z","submitted_at":"2025-01-17T05:21:49Z","title":"A Survey on Multi-Turn Interaction Capabilities of Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09959","snapshot_observed_at":"2026-08-06T14:06:38.007767Z","title":"A Survey on Multi-Turn Interaction Capabilities of Large Language Models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.19823","last_updated":"2025-07-26T06:43:14Z","snapshot_observed_at":"2026-08-10T11:33:20.339897Z","submitted_at":"2025-07-26T06:43:14Z","title":"HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:38.007767Z"},"links":{"cited_paper":"/paper/2501.09959","citing_paper":"/paper/2507.19823"},"observation_digest":"sha256:0bf0cadd4026727b73da25491cd5d44a3fbdfb97d3098b259686ac114407f5fc","observation_id":"c31314c2-8d44-479e-893e-6badf21f3034","resolution":{"observed_at":"2026-08-06T14:06:38.007767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03462","last_updated":"2024-10-11T02:18:24Z","snapshot_observed_at":"2026-08-12T01:27:39.996569Z","submitted_at":"2024-01-07T11:57:40Z","title":"Long Context Compression with Activation Beacon","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.03462","snapshot_observed_at":"2026-08-06T14:06:38.011516Z","title":"Soaring from 4k to 400k: Extending llm’s context with activation beacon","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19823","last_updated":"2025-07-26T06:43:14Z","snapshot_observed_at":"2026-08-10T11:33:20.339897Z","submitted_at":"2025-07-26T06:43:14Z","title":"HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:38.011516Z"},"links":{"cited_paper":"/paper/2401.03462","citing_paper":"/paper/2507.19823"},"observation_digest":"sha256:bf00ebf8986c25aec83baab1189012b5ef40bfa0975db5144ff015aa031c42a7","observation_id":"4fe2a94b-3a14-4169-a780-0272201307f5","resolution":{"observed_at":"2026-08-06T14:06:38.011516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-06T14:06:38.014118Z","title":"Opt: Open pre-trained transformer language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.19823","last_updated":"2025-07-26T06:43:14Z","snapshot_observed_at":"2026-08-10T11:33:20.339897Z","submitted_at":"2025-07-26T06:43:14Z","title":"HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:38.014118Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2507.19823"},"observation_digest":"sha256:ab1df91989b60a22fba8b035a84f1fa9e36ddc0fcf842b29cc74ccb54884067f","observation_id":"f2ae781a-3c43-4df4-9adf-74184f70c325","resolution":{"observed_at":"2026-08-06T14:06:38.014118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:38.435701Z","title":"KV cache is 1 bit per channel: Efficient large language model inference with coupled quantization","venue":null,"work_id":"6786b75b-2d9f-4b39-9d03-70dd5141940f","year":2024},"citing_paper":{"arxiv_id":"2507.19823","last_updated":"2025-07-26T06:43:14Z","snapshot_observed_at":"2026-08-10T11:33:20.339897Z","submitted_at":"2025-07-26T06:43:14Z","title":"HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:38.017818Z"},"links":{"citing_paper":"/paper/2507.19823"},"observation_digest":"sha256:a73e2a7af8e6af3135f7073ec7b1980b666e4bd793b0f88f2b095590f76526da","observation_id":"31fd5540-f7d2-41fc-9bd2-b3a1764fdc57","resolution":{"observed_at":"2026-08-06T14:06:38.481242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:38.357604Z","title":"Chain of agents: Large language models collaborating on long-context tasks","venue":null,"work_id":"7062bdb1-838c-4088-87fa-ef66b46483a9","year":2024},"citing_paper":{"arxiv_id":"2507.19823","last_updated":"2025-07-26T06:43:14Z","snapshot_observed_at":"2026-08-10T11:33:20.339897Z","submitted_at":"2025-07-26T06:43:14Z","title":"HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:38.020684Z"},"links":{"citing_paper":"/paper/2507.19823"},"observation_digest":"sha256:d2fc1eb0c2a1f13c0c4cfb07627ab44091d336c931bbb9a9a4c9769ff35b7565","observation_id":"7cb6c8ec-a7bd-4690-8ba2-937a9b53679a","resolution":{"observed_at":"2026-08-06T14:06:38.392823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:38.319634Z","title":"H2O: Heavy-hitter oracle for efficient generative inference of large language models","venue":null,"work_id":"8b7b2c51-2c2d-47c8-b34b-59cce18b3a5b","year":2023},"citing_paper":{"arxiv_id":"2507.19823","last_updated":"2025-07-26T06:43:14Z","snapshot_observed_at":"2026-08-10T11:33:20.339897Z","submitted_at":"2025-07-26T06:43:14Z","title":"HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:38.022879Z"},"links":{"citing_paper":"/paper/2507.19823"},"observation_digest":"sha256:aff5c119ae70e83a1f73a1e266086ef6988be17b0c420a637adf6cd89dd47e1a","observation_id":"03539e17-272c-4263-9570-932b78338fe3","resolution":{"observed_at":"2026-08-06T14:06:38.330399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.19823","last_updated":"2025-07-26T06:43:14Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-10T11:33:20.339897Z","submitted_at":"2025-07-26T06:43:14Z","title":"HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":2,"verified_fuzzy":20},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 0 inbound Pith citation observations for arXiv:2507.19823."}