{"as_of":"2026-08-13T08:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ebf04dc82fe14700b0736aa83ed9d223b1218fb35119a72002b4072a805d8ed4","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T23:46:02.187649Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.02252/citation-record","integrity":"/paper/2412.02252/integrity","json":"/paper/2412.02252/citation-record.json","paper":"/paper/2412.02252"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-11T23:46:01.946174Z","title":"L., Almeida, D., Altenschmidt, J., Altman, S., Anadkat, S., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02252","last_updated":"2025-08-04T02:17:56Z","snapshot_observed_at":"2026-08-12T00:30:41.714356Z","submitted_at":"2024-12-03T08:29:27Z","title":"Compressing KV Cache for Long-Context LLM Inference with Inter-Layer Attention Similarity","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T23:46:01.946174Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2412.02252"},"observation_digest":"sha256:3efb1006e696dc273f8cd3cd368a11e5eb9197ab993f21bb73d5358cf779355c","observation_id":"e527d8e1-16c0-4cf5-8462-f8d1a65b1883","resolution":{"observed_at":"2026-08-11T23:46:01.946174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:01.951909Z","title":"GQA : Training generalized multi-query transformer models from multi-head checkpoints","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02252","last_updated":"2025-08-04T02:17:56Z","snapshot_observed_at":"2026-08-12T00:30:41.714356Z","submitted_at":"2024-12-03T08:29:27Z","title":"Compressing KV Cache for Long-Context LLM Inference with Inter-Layer Attention Similarity","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T23:46:01.951909Z"},"links":{"citing_paper":"/paper/2412.02252"},"observation_digest":"sha256:c6275c5a675980c8cb2e337e3d7ff2adfc27283ba315ed7a457f0369d5875b6b","observation_id":"1dffe21b-8859-475d-94c4-5c36025c6c9a","resolution":{"observed_at":"2026-08-11T23:46:01.951909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:01.957532Z","title":"L -eval: Instituting standardized evaluation for long context language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02252","last_updated":"2025-08-04T02:17:56Z","snapshot_observed_at":"2026-08-12T00:30:41.714356Z","submitted_at":"2024-12-03T08:29:27Z","title":"Compressing KV Cache for Long-Context LLM Inference with Inter-Layer Attention Similarity","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T23:46:01.957532Z"},"links":{"citing_paper":"/paper/2412.02252"},"observation_digest":"sha256:16e79cf3d62b8e52863b7805e974e81296c1a18626a27fde403966108a917153","observation_id":"af388563-0fd1-4914-b83f-c64befbb3d96","resolution":{"observed_at":"2026-08-11T23:46:01.957532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:01.962711Z","title":"L ong B ench: A bilingual, multitask benchmark for long context understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02252","last_updated":"2025-08-04T02:17:56Z","snapshot_observed_at":"2026-08-12T00:30:41.714356Z","submitted_at":"2024-12-03T08:29:27Z","title":"Compressing KV Cache for Long-Context LLM Inference with Inter-Layer Attention Similarity","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T23:46:01.962711Z"},"links":{"citing_paper":"/paper/2412.02252"},"observation_digest":"sha256:6619033eb088c17ffc05d65ba560bbc25d792e55109a7a1821630734c31096e9","observation_id":"94bc9141-ae7c-4e15-8733-7cca1e4f12b0","resolution":{"observed_at":"2026-08-11T23:46:01.962711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:02.964748Z","title":"Codeplan: Repository-level coding using llms and planning","venue":null,"work_id":"6f04f438-dee0-4fd8-9361-1d87bcf1e36e","year":2024},"citing_paper":{"arxiv_id":"2412.02252","last_updated":"2025-08-04T02:17:56Z","snapshot_observed_at":"2026-08-12T00:30:41.714356Z","submitted_at":"2024-12-03T08:29:27Z","title":"Compressing KV Cache for Long-Context LLM Inference with Inter-Layer Attention Similarity","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T23:46:01.967701Z"},"links":{"citing_paper":"/paper/2412.02252"},"observation_digest":"sha256:f64a885dc0027afbf71c7ed0de3e3b7b9911a5e8509577144a2d1ceb26b6437f","observation_id":"a6855b94-fefa-4307-8602-bd8b7a9b0790","resolution":{"observed_at":"2026-08-11T23:46:02.969363Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-11T23:46:01.972899Z","title":"E., and Cohan, A","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2412.02252","last_updated":"2025-08-04T02:17:56Z","snapshot_observed_at":"2026-08-12T00:30:41.714356Z","submitted_at":"2024-12-03T08:29:27Z","title":"Compressing KV Cache for Long-Context LLM Inference with Inter-Layer Attention Similarity","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T23:46:01.972899Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2412.02252"},"observation_digest":"sha256:0e7dec1ab54d182ed692089a9f1bb2574dbf656f9bded573fa0721c44079e309","observation_id":"b3fd7210-7bd1-4343-a18b-21d1373c918e","resolution":{"observed_at":"2026-08-11T23:46:01.972899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.06821","last_updated":"2021-10-13T16:08:02Z","snapshot_observed_at":"2026-08-10T02:23:16.913491Z","submitted_at":"2021-10-13T16:08:02Z","title":"Leveraging redundancy in attention with Reuse Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.06821","snapshot_observed_at":"2026-08-11T23:46:01.978654Z","title":"Leveraging redundancy in attention with reuse transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.02252","last_updated":"2025-08-04T02:17:56Z","snapshot_observed_at":"2026-08-12T00:30:41.714356Z","submitted_at":"2024-12-03T08:29:27Z","title":"Compressing KV Cache for Long-Context LLM Inference with Inter-Layer Attention Similarity","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T23:46:01.978654Z"},"links":{"cited_paper":"/paper/2110.06821","citing_paper":"/paper/2412.02252"},"observation_digest":"sha256:3ae3d80399cafd82d521eb09da1c5a9163704d1e1e284b8ce543d281f424507a","observation_id":"8604c5cb-b478-4d7a-9a74-16ea1eda6e5c","resolution":{"observed_at":"2026-08-11T23:46:01.978654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12981","last_updated":"2024-05-21T17:59:29Z","snapshot_observed_at":"2026-08-13T00:02:45.706237Z","submitted_at":"2024-05-21T17:59:29Z","title":"Reducing Transformer Key-Value Cache Size with Cross-Layer Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12981","snapshot_observed_at":"2026-08-11T23:46:01.984234Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02252","last_updated":"2025-08-04T02:17:56Z","snapshot_observed_at":"2026-08-12T00:30:41.714356Z","submitted_at":"2024-12-03T08:29:27Z","title":"Compressing KV Cache for Long-Context LLM Inference with Inter-Layer Attention Similarity","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T23:46:01.984234Z"},"links":{"cited_paper":"/paper/2405.12981","citing_paper":"/paper/2412.02252"},"observation_digest":"sha256:8b605e2f34cc64d81e56f2604cdd65dc02463e76a3e37f6da7b94926d01ccc93","observation_id":"87ff2fb3-099b-47c4-8c1a-56e45b31dc06","resolution":{"observed_at":"2026-08-11T23:46:01.984234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:01.989136Z","title":null,"venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2412.02252","last_updated":"2025-08-04T02:17:56Z","snapshot_observed_at":"2026-08-12T00:30:41.714356Z","submitted_at":"2024-12-03T08:29:27Z","title":"Compressing KV Cache for Long-Context LLM Inference with Inter-Layer Attention Similarity","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T23:46:01.989136Z"},"links":{"citing_paper":"/paper/2412.02252"},"observation_digest":"sha256:7a4a431361b327dad9406cb09be8575975b932131be8d65289d1bb8e0ca790cd","observation_id":"98db3a0e-e6b3-4768-b801-d984748f683a","resolution":{"observed_at":"2026-08-11T23:46:01.989136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-11T23:46:01.993734Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02252","last_updated":"2025-08-04T02:17:56Z","snapshot_observed_at":"2026-08-12T00:30:41.714356Z","submitted_at":"2024-12-03T08:29:27Z","title":"Compressing KV Cache for Long-Context LLM Inference with Inter-Layer Attention Similarity","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T23:46:01.993734Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2412.02252"},"observation_digest":"sha256:c27e62b4147ca365d4b39a3665e9283f7e618849f46da0d5bf1d42942ca487c4","observation_id":"648e1687-64f3-42c1-9dd0-29fe3dfb6c8e","resolution":{"observed_at":"2026-08-11T23:46:01.993734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14057","last_updated":"2024-07-19T06:34:45Z","snapshot_observed_at":"2026-08-13T08:28:47.857551Z","submitted_at":"2024-07-19T06:34:45Z","title":"LazyLLM: Dynamic Token Pruning for Efficient Long Context LLM Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14057","snapshot_observed_at":"2026-08-11T23:46:01.998574Z","title":"Lazyllm: Dynamic token pruning for efficient long context llm inference, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02252","last_updated":"2025-08-04T02:17:56Z","snapshot_observed_at":"2026-08-12T00:30:41.714356Z","submitted_at":"2024-12-03T08:29:27Z","title":"Compressing KV Cache for Long-Context LLM Inference with Inter-Layer Attention Similarity","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T23:46:01.998574Z"},"links":{"cited_paper":"/paper/2407.14057","citing_paper":"/paper/2412.02252"},"observation_digest":"sha256:41c3adce6291d9ae4db344afa38437e5d3b8d618317e2e07e01f654078b90606","observation_id":"d6cf978e-0eb9-44c4-9592-8fb91282da87","resolution":{"observed_at":"2026-08-11T23:46:01.998574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08944","last_updated":"2024-05-14T20:17:22Z","snapshot_observed_at":"2026-08-13T00:07:39.901086Z","submitted_at":"2024-05-14T20:17:22Z","title":"Challenges in Deploying Long-Context Transformers: A Theoretical Peak Performance Analysis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08944","snapshot_observed_at":"2026-08-11T23:46:02.003540Z","title":"Challenges in deploying long-context transformers: A theoretical peak performance analysis, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02252","last_updated":"2025-08-04T02:17:56Z","snapshot_observed_at":"2026-08-12T00:30:41.714356Z","submitted_at":"2024-12-03T08:29:27Z","title":"Compressing KV Cache for Long-Context LLM Inference with Inter-Layer Attention Similarity","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T23:46:02.003540Z"},"links":{"cited_paper":"/paper/2405.08944","citing_paper":"/paper/2412.02252"},"observation_digest":"sha256:6300ed8479d186995e0c3e19af2d5e2c7da08d82a81efc6d6167d570f7949689","observation_id":"e9bd01b4-c9c0-4188-846e-c488d9910d89","resolution":{"observed_at":"2026-08-11T23:46:02.003540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:02.008707Z","title":"How to train long-context language models (effectively), 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02252","last_updated":"2025-08-04T02:17:56Z","snapshot_observed_at":"2026-08-12T00:30:41.714356Z","submitted_at":"2024-12-03T08:29:27Z","title":"Compressing KV Cache for Long-Context LLM Inference with Inter-Layer Attention Similarity","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T23:46:02.008707Z"},"links":{"citing_paper":"/paper/2412.02252"},"observation_digest":"sha256:b1be0710d1f2f3ef0883c57f1058016bb7eac941657eb586181e289963bd0493","observation_id":"97576a13-ca55-44f5-8fa1-338fa89e2dd6","resolution":{"observed_at":"2026-08-11T23:46:02.008707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12793","last_updated":"2024-07-30T03:58:11Z","snapshot_observed_at":"2026-08-07T13:56:34.167869Z","submitted_at":"2024-06-18T16:58:21Z","title":"ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12793","snapshot_observed_at":"2026-08-11T23:46:02.014246Z","title":"Chatglm: A family of large language models from glm-130b to glm-4 all tools","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02252","last_updated":"2025-08-04T02:17:56Z","snapshot_observed_at":"2026-08-12T00:30:41.714356Z","submitted_at":"2024-12-03T08:29:27Z","title":"Compressing KV Cache for Long-Context LLM Inference with Inter-Layer Attention Similarity","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T23:46:02.014246Z"},"links":{"cited_paper":"/paper/2406.12793","citing_paper":"/paper/2412.02252"},"observation_digest":"sha256:1c60f1bbbf5f956a29cac9404a4ae1b56711a30ff248e47305b32f99030e655a","observation_id":"6d91c8be-ec2f-49e7-a0dc-09b627cdd68e","resolution":{"observed_at":"2026-08-11T23:46:02.014246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:02.019172Z","title":"LM -infinite: Zero-shot extreme length generalization for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02252","last_updated":"2025-08-04T02:17:56Z","snapshot_observed_at":"2026-08-12T00:30:41.714356Z","submitted_at":"2024-12-03T08:29:27Z","title":"Compressing KV Cache for Long-Context LLM Inference with Inter-Layer Attention Similarity","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T23:46:02.019172Z"},"links":{"citing_paper":"/paper/2412.02252"},"observation_digest":"sha256:83e59111be8406e5a687c9ea54340983635310e8c190f21b07235a39fbe6e3f2","observation_id":"c8416f7e-c70d-404e-8e23-107bbe694135","resolution":{"observed_at":"2026-08-11T23:46:02.019172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14509","last_updated":"2023-10-04T16:51:13Z","snapshot_observed_at":"2026-08-04T19:27:31.715261Z","submitted_at":"2023-09-25T20:15:57Z","title":"DeepSpeed Ulysses: System Optimizations for Enabling Training of Extreme Long Sequence Transformer Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14509","snapshot_observed_at":"2026-08-11T23:46:02.023498Z","title":"A., Tanaka, M., Zhang, C., Zhang, M., Song, S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02252","last_updated":"2025-08-04T02:17:56Z","snapshot_observed_at":"2026-08-12T00:30:41.714356Z","submitted_at":"2024-12-03T08:29:27Z","title":"Compressing KV Cache for Long-Context LLM Inference with Inter-Layer Attention Similarity","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T23:46:02.023498Z"},"links":{"cited_paper":"/paper/2309.14509","citing_paper":"/paper/2412.02252"},"observation_digest":"sha256:d6f36955e8c560f7c9496aa97c4a4f50d100f4459992ff62fe0a28abebbb6b70","observation_id":"9ba4f3af-5ff8-430e-ba6d-531a423b4017","resolution":{"observed_at":"2026-08-11T23:46:02.023498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02490","last_updated":"2024-10-30T14:53:22Z","snapshot_observed_at":"2026-08-12T23:30:11.201041Z","submitted_at":"2024-07-02T17:59:56Z","title":"MInference 1.0: Accelerating Pre-filling for Long-Context LLMs via Dynamic Sparse Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02490","snapshot_observed_at":"2026-08-11T23:46:02.028093Z","title":"H., Li, D., Lin, C.-Y., Yang, Y., and Qiu, L","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02252","last_updated":"2025-08-04T02:17:56Z","snapshot_observed_at":"2026-08-12T00:30:41.714356Z","submitted_at":"2024-12-03T08:29:27Z","title":"Compressing KV Cache for Long-Context LLM Inference with Inter-Layer Attention Similarity","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T23:46:02.028093Z"},"links":{"cited_paper":"/paper/2407.02490","citing_paper":"/paper/2412.02252"},"observation_digest":"sha256:4d73517d4a6ef7bd3fa19b0d0886bd48de273fc0751845b119ca32df2d38b27b","observation_id":"726bed92-0016-47fd-bf64-5646b9ccce34","resolution":{"observed_at":"2026-08-11T23:46:02.028093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:02.032467Z","title":"L ong LLML ingua: Accelerating and enhancing LLM s in long context scenarios via prompt compression","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02252","last_updated":"2025-08-04T02:17:56Z","snapshot_observed_at":"2026-08-12T00:30:41.714356Z","submitted_at":"2024-12-03T08:29:27Z","title":"Compressing KV Cache for Long-Context LLM Inference with Inter-Layer Attention Similarity","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T23:46:02.032467Z"},"links":{"citing_paper":"/paper/2412.02252"},"observation_digest":"sha256:08adf0386187c561e67f0c4a30618e6940e6dc8a7e60b31c3c2d5b45b49a800d","observation_id":"8abda245-0878-4b14-a047-106a40160817","resolution":{"observed_at":"2026-08-11T23:46:02.032467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:02.037136Z","title":"Compressing context to enhance inference efficiency of large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02252","last_updated":"2025-08-04T02:17:56Z","snapshot_observed_at":"2026-08-12T00:30:41.714356Z","submitted_at":"2024-12-03T08:29:27Z","title":"Compressing KV Cache for Long-Context LLM Inference with Inter-Layer Attention Similarity","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T23:46:02.037136Z"},"links":{"citing_paper":"/paper/2412.02252"},"observation_digest":"sha256:e923f84f53867042eb5de54fc2db1f71a50d637ce8c7158d8aa477c30df25d3f","observation_id":"2c712d5a-b9bc-4d6b-910d-28e376a5e614","resolution":{"observed_at":"2026-08-11T23:46:02.037136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14469","last_updated":"2024-06-17T03:01:58Z","snapshot_observed_at":"2026-08-07T22:57:56.263839Z","submitted_at":"2024-04-22T17:42:58Z","title":"SnapKV: LLM Knows What You are Looking for Before Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14469","snapshot_observed_at":"2026-08-11T23:46:02.041282Z","title":"Snapkv: Llm knows what you are looking for before generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02252","last_updated":"2025-08-04T02:17:56Z","snapshot_observed_at":"2026-08-12T00:30:41.714356Z","submitted_at":"2024-12-03T08:29:27Z","title":"Compressing KV Cache for Long-Context LLM Inference with Inter-Layer Attention Similarity","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T23:46:02.041282Z"},"links":{"cited_paper":"/paper/2404.14469","citing_paper":"/paper/2412.02252"},"observation_digest":"sha256:cc9c146d591299da2f1a399d65aca2a0ec6880976a8c330e71b509e286d2de6c","observation_id":"d53162a3-2441-42cc-b969-463bd21dfebe","resolution":{"observed_at":"2026-08-11T23:46:02.041282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:02.939308Z","title":"Awq: Activation-aware weight quantization for on-device llm compression and acceleration","venue":null,"work_id":"916d00c6-7a17-45d0-aa1e-a6f1a1cdf06c","year":2024},"citing_paper":{"arxiv_id":"2412.02252","last_updated":"2025-08-04T02:17:56Z","snapshot_observed_at":"2026-08-12T00:30:41.714356Z","submitted_at":"2024-12-03T08:29:27Z","title":"Compressing KV Cache for Long-Context LLM Inference with Inter-Layer Attention Similarity","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T23:46:02.046056Z"},"links":{"citing_paper":"/paper/2412.02252"},"observation_digest":"sha256:22ce5a0c255c1dae666d9cf713fcc585565523996b3d62790be542d5f62b67b6","observation_id":"d3c1ed64-65ff-48c9-b87f-ccf31b814ee6","resolution":{"observed_at":"2026-08-11T23:46:02.945100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-11T23:46:02.050262Z","title":"Deepseek-v2: A strong, economical, and efficient mixture-of-experts language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02252","last_updated":"2025-08-04T02:17:56Z","snapshot_observed_at":"2026-08-12T00:30:41.714356Z","submitted_at":"2024-12-03T08:29:27Z","title":"Compressing KV Cache for Long-Context LLM Inference with Inter-Layer Attention Similarity","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T23:46:02.050262Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2412.02252"},"observation_digest":"sha256:5b2b0d48b5ebc145b5e2effcdf2c6eb11c99170e726bf3bd8889b372de0f5580","observation_id":"f33968a4-7f52-4a65-8c53-7783935bb369","resolution":{"observed_at":"2026-08-11T23:46:02.050262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14366","last_updated":"2024-09-07T02:52:29Z","snapshot_observed_at":"2026-08-13T00:00:46.126397Z","submitted_at":"2024-05-23T09:43:52Z","title":"MiniCache: KV Cache Compression in Depth Dimension for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14366","snapshot_observed_at":"2026-08-11T23:46:02.056231Z","title":"Minicache: Kv cache compression in depth dimension for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02252","last_updated":"2025-08-04T02:17:56Z","snapshot_observed_at":"2026-08-12T00:30:41.714356Z","submitted_at":"2024-12-03T08:29:27Z","title":"Compressing KV Cache for Long-Context LLM Inference with Inter-Layer Attention Similarity","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T23:46:02.056231Z"},"links":{"cited_paper":"/paper/2405.14366","citing_paper":"/paper/2412.02252"},"observation_digest":"sha256:408e8c48d892bca58e7885d9c2bf6a4b7f5325bb0bc2323983cf73d4bdf3ff1d","observation_id":"ab5fa997-8eea-4f97-b365-6962333cce6e","resolution":{"observed_at":"2026-08-11T23:46:02.056231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-08-07T09:13:28.333702Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10516","snapshot_observed_at":"2026-08-11T23:46:02.061116Z","title":"Retrievalattention: Accelerating long-context llm inference via vector retrieval, 2024 c","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02252","last_updated":"2025-08-04T02:17:56Z","snapshot_observed_at":"2026-08-12T00:30:41.714356Z","submitted_at":"2024-12-03T08:29:27Z","title":"Compressing KV Cache for Long-Context LLM Inference with Inter-Layer Attention Similarity","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T23:46:02.061116Z"},"links":{"cited_paper":"/paper/2409.10516","citing_paper":"/paper/2412.02252"},"observation_digest":"sha256:d71feb9a7c0a99f8f7a4947f1b2e483cb31298ce14304030c4d5eea9977d9c2a","observation_id":"93b7599b-0ce8-460a-9224-ba235a9dcbb1","resolution":{"observed_at":"2026-08-11T23:46:02.061116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:02.924016Z","title":"QLLM : Accurate and efficient low-bitwidth quantization for large language models","venue":null,"work_id":"e1dc7af6-db7a-4c92-a8ee-205479ce6f73","year":2024},"citing_paper":{"arxiv_id":"2412.02252","last_updated":"2025-08-04T02:17:56Z","snapshot_observed_at":"2026-08-12T00:30:41.714356Z","submitted_at":"2024-12-03T08:29:27Z","title":"Compressing KV Cache for Long-Context LLM Inference with Inter-Layer Attention Similarity","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T23:46:02.066259Z"},"links":{"citing_paper":"/paper/2412.02252"},"observation_digest":"sha256:3617420535053af4a94683e1a4a7d0d2fa519ac2c0c474432212af937e4a34cc","observation_id":"b59d75df-2bc9-45be-ba7a-312c438fabb4","resolution":{"observed_at":"2026-08-11T23:46:02.928658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:02.909917Z","title":"and Liu, B","venue":null,"work_id":"6a6596f8-1f30-4305-afdb-0ff3728e47b5","year":2024},"citing_paper":{"arxiv_id":"2412.02252","last_updated":"2025-08-04T02:17:56Z","snapshot_observed_at":"2026-08-12T00:30:41.714356Z","submitted_at":"2024-12-03T08:29:27Z","title":"Compressing KV Cache for Long-Context LLM Inference with Inter-Layer Attention Similarity","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T23:46:02.071944Z"},"links":{"citing_paper":"/paper/2412.02252"},"observation_digest":"sha256:bd0eb35d7bdfcdb176aa5fadfe6d4bf22d76c85aced1e414211828f46862c006","observation_id":"c89effdd-193b-4566-b17e-66c90c46a7be","resolution":{"observed_at":"2026-08-11T23:46:02.914397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:02.077749Z","title":"The jensen-shannon divergence","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2412.02252","last_updated":"2025-08-04T02:17:56Z","snapshot_observed_at":"2026-08-12T00:30:41.714356Z","submitted_at":"2024-12-03T08:29:27Z","title":"Compressing KV Cache for Long-Context LLM Inference with Inter-Layer Attention Similarity","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T23:46:02.077749Z"},"links":{"citing_paper":"/paper/2412.02252"},"observation_digest":"sha256:5cff75a0a08d5acb5985ed5246a1d2e73bc73256fcc34fd6d360c8b82bbff976","observation_id":"0b4de720-5d2c-4470-9e81-52b027644318","resolution":{"observed_at":"2026-08-11T23:46:02.077749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:02.082175Z","title":"V., Qiu, L., and Zhang, D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02252","last_updated":"2025-08-04T02:17:56Z","snapshot_observed_at":"2026-08-12T00:30:41.714356Z","submitted_at":"2024-12-03T08:29:27Z","title":"Compressing KV Cache for Long-Context LLM Inference with Inter-Layer Attention Similarity","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T23:46:02.082175Z"},"links":{"citing_paper":"/paper/2412.02252"},"observation_digest":"sha256:0a382fe06d544150168dc7f35c5ddc72e841bd6743153eefcdf1450eb1dbfb36","observation_id":"3619e8c9-1702-46f2-b142-ebb2aedf3158","resolution":{"observed_at":"2026-08-11T23:46:02.082175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:02.086882Z","title":"Pytorch: An imperative style, high-performance deep learning library","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.02252","last_updated":"2025-08-04T02:17:56Z","snapshot_observed_at":"2026-08-12T00:30:41.714356Z","submitted_at":"2024-12-03T08:29:27Z","title":"Compressing KV Cache for Long-Context LLM Inference with Inter-Layer Attention Similarity","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-11T23:46:02.086882Z"},"links":{"citing_paper":"/paper/2412.02252"},"observation_digest":"sha256:1e00351b6fd495dd8011c70a85e640952e855061f0f07faea32a4ebaa5b60b9d","observation_id":"81d264c3-548c-4428-b888-beaf6af0b3d0","resolution":{"observed_at":"2026-08-11T23:46:02.086882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:02.091264Z","title":"Efficiently scaling transformer inference","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02252","last_updated":"2025-08-04T02:17:56Z","snapshot_observed_at":"2026-08-12T00:30:41.714356Z","submitted_at":"2024-12-03T08:29:27Z","title":"Compressing KV Cache for Long-Context LLM Inference with Inter-Layer Attention Similarity","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T23:46:02.091264Z"},"links":{"citing_paper":"/paper/2412.02252"},"observation_digest":"sha256:4a3882c0e17318a93256e90894cc0df5664aad1fc360dd9f5ad910798bc140da","observation_id":"b050983d-e7b2-410d-9863-633e7927f744","resolution":{"observed_at":"2026-08-11T23:46:02.091264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:02.095682Z","title":"Zero: memory optimizations toward training trillion parameter models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.02252","last_updated":"2025-08-04T02:17:56Z","snapshot_observed_at":"2026-08-12T00:30:41.714356Z","submitted_at":"2024-12-03T08:29:27Z","title":"Compressing KV Cache for Long-Context LLM Inference with Inter-Layer Attention Similarity","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T23:46:02.095682Z"},"links":{"citing_paper":"/paper/2412.02252"},"observation_digest":"sha256:b0bb3ea1afc4b4ac687cfd16667dc1b6b26e9637c7bd830cc1b6d49e0811af62","observation_id":"3e497bba-cdb3-4c0f-91b4-4d73d0e00615","resolution":{"observed_at":"2026-08-11T23:46:02.095682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:02.100260Z","title":"Deepspeed: System optimizations enable training deep learning models with over 100 billion parameters","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.02252","last_updated":"2025-08-04T02:17:56Z","snapshot_observed_at":"2026-08-12T00:30:41.714356Z","submitted_at":"2024-12-03T08:29:27Z","title":"Compressing KV Cache for Long-Context LLM Inference with Inter-Layer Attention Similarity","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-11T23:46:02.100260Z"},"links":{"citing_paper":"/paper/2412.02252"},"observation_digest":"sha256:0094d65f8b91460f3bc0c8842cd8b8b85fab4105ec99581b9fe3f7e8d2a202fd","observation_id":"45c9968c-51dc-4ab1-86fc-214c971c4686","resolution":{"observed_at":"2026-08-11T23:46:02.100260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-11T23:46:02.104917Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02252","last_updated":"2025-08-04T02:17:56Z","snapshot_observed_at":"2026-08-12T00:30:41.714356Z","submitted_at":"2024-12-03T08:29:27Z","title":"Compressing KV Cache for Long-Context LLM Inference with Inter-Layer Attention Similarity","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-11T23:46:02.104917Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2412.02252"},"observation_digest":"sha256:b94726faa2b9833e1ecf6eab22f7f42bf4f04bc23487097e523ec675f09ba01a","observation_id":"35ded138-c09d-4515-9700-f63b0c235c4a","resolution":{"observed_at":"2026-08-11T23:46:02.104917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.02150","last_updated":"2019-11-06T00:19:05Z","snapshot_observed_at":"2026-07-06T08:35:01.386074Z","submitted_at":"2019-11-06T00:19:05Z","title":"Fast Transformer Decoding: One Write-Head is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.02150","snapshot_observed_at":"2026-08-11T23:46:02.109644Z","title":"Fast transformer decoding: One write-head is all you need","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2412.02252","last_updated":"2025-08-04T02:17:56Z","snapshot_observed_at":"2026-08-12T00:30:41.714356Z","submitted_at":"2024-12-03T08:29:27Z","title":"Compressing KV Cache for Long-Context LLM Inference with Inter-Layer Attention Similarity","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-11T23:46:02.109644Z"},"links":{"cited_paper":"/paper/1911.02150","citing_paper":"/paper/2412.02252"},"observation_digest":"sha256:8d0b623eb7e342a8039aee40aa306ba38fc374242a804ec8ff7de0acd4fb5117","observation_id":"158d2ced-a283-4de7-8ea4-2364c600a9f8","resolution":{"observed_at":"2026-08-11T23:46:02.109644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:02.114792Z","title":"Flexgen: high-throughput generative inference of large language models with a single gpu","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02252","last_updated":"2025-08-04T02:17:56Z","snapshot_observed_at":"2026-08-12T00:30:41.714356Z","submitted_at":"2024-12-03T08:29:27Z","title":"Compressing KV Cache for Long-Context LLM Inference with Inter-Layer Attention Similarity","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-11T23:46:02.114792Z"},"links":{"citing_paper":"/paper/2412.02252"},"observation_digest":"sha256:8aac544e3a061fb99dd55274f4d7a938027ed1180be77e6541a95d8252afec98","observation_id":"f5459b65-f3c2-4d98-bd24-5c01e8d3d8cf","resolution":{"observed_at":"2026-08-11T23:46:02.114792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:02.119255Z","title":"Dolma: an open corpus of three trillion tokens for language model pretraining research","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02252","last_updated":"2025-08-04T02:17:56Z","snapshot_observed_at":"2026-08-12T00:30:41.714356Z","submitted_at":"2024-12-03T08:29:27Z","title":"Compressing KV Cache for Long-Context LLM Inference with Inter-Layer Attention Similarity","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-11T23:46:02.119255Z"},"links":{"citing_paper":"/paper/2412.02252"},"observation_digest":"sha256:37624e3e33dfe8da13718bdda14421d9406066b674622675fdd4f7d6322e718d","observation_id":"d672a08f-02e0-405a-9bc9-9f60643d96df","resolution":{"observed_at":"2026-08-11T23:46:02.119255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09864","last_updated":"2023-11-08T13:36:32Z","snapshot_observed_at":"2026-08-12T04:55:58.532015Z","submitted_at":"2021-04-20T09:54:06Z","title":"RoFormer: Enhanced Transformer with Rotary Position Embedding","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.09864","snapshot_observed_at":"2026-08-11T23:46:02.123980Z","title":"Roformer: Enhanced transformer with rotary position embedding, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02252","last_updated":"2025-08-04T02:17:56Z","snapshot_observed_at":"2026-08-12T00:30:41.714356Z","submitted_at":"2024-12-03T08:29:27Z","title":"Compressing KV Cache for Long-Context LLM Inference with Inter-Layer Attention Similarity","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-11T23:46:02.123980Z"},"links":{"cited_paper":"/paper/2104.09864","citing_paper":"/paper/2412.02252"},"observation_digest":"sha256:2880ceb6546db7a317f363c1250d41f8265e8a69e171522888d470fe970b3735","observation_id":"ecaf3672-7514-4d70-8c26-d46b392151e2","resolution":{"observed_at":"2026-08-11T23:46:02.123980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:02.847160Z","title":"QUEST : Query-aware sparsity for efficient long-context LLM inference","venue":null,"work_id":"04e10876-4cd1-4159-ab43-53d289057983","year":2024},"citing_paper":{"arxiv_id":"2412.02252","last_updated":"2025-08-04T02:17:56Z","snapshot_observed_at":"2026-08-12T00:30:41.714356Z","submitted_at":"2024-12-03T08:29:27Z","title":"Compressing KV Cache for Long-Context LLM Inference with Inter-Layer Attention Similarity","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-11T23:46:02.129198Z"},"links":{"citing_paper":"/paper/2412.02252"},"observation_digest":"sha256:b40cdd900f543f63b1198ae411856f10c8bc798d6d820c1ee9d9eb625d8de773","observation_id":"39cb8619-c1c9-4898-9287-a94f10a8ec0a","resolution":{"observed_at":"2026-08-11T23:46:02.852007Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-11T23:46:02.133622Z","title":"M., Hauth, A., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02252","last_updated":"2025-08-04T02:17:56Z","snapshot_observed_at":"2026-08-12T00:30:41.714356Z","submitted_at":"2024-12-03T08:29:27Z","title":"Compressing KV Cache for Long-Context LLM Inference with Inter-Layer Attention Similarity","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-11T23:46:02.133622Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2412.02252"},"observation_digest":"sha256:e91370bd6b90434db905489ded52219c674d9a74b61895fc66d1254cd9958df3","observation_id":"8bd4e694-b592-4ecf-84b5-5cef6d10d38e","resolution":{"observed_at":"2026-08-11T23:46:02.133622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-11T23:46:02.139083Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02252","last_updated":"2025-08-04T02:17:56Z","snapshot_observed_at":"2026-08-12T00:30:41.714356Z","submitted_at":"2024-12-03T08:29:27Z","title":"Compressing KV Cache for Long-Context LLM Inference with Inter-Layer Attention Similarity","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-11T23:46:02.139083Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2412.02252"},"observation_digest":"sha256:4bfc66aecf5f00ec8b197f3ffcd1ed1389808cff827d93e274b021a3ade28f87","observation_id":"9abecf7b-6a21-4e70-9c1e-f0a740fd5e5f","resolution":{"observed_at":"2026-08-11T23:46:02.139083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-11T23:46:02.143383Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02252","last_updated":"2025-08-04T02:17:56Z","snapshot_observed_at":"2026-08-12T00:30:41.714356Z","submitted_at":"2024-12-03T08:29:27Z","title":"Compressing KV Cache for Long-Context LLM Inference with Inter-Layer Attention Similarity","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-11T23:46:02.143383Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2412.02252"},"observation_digest":"sha256:8a32627c3903b8261a80deb70c04a68c82206f19fb9b6899c67105b87eb3668b","observation_id":"eb66d2cf-2166-4468-b377-69189d136794","resolution":{"observed_at":"2026-08-11T23:46:02.143383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:02.147598Z","title":"N., Kaiser, L","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.02252","last_updated":"2025-08-04T02:17:56Z","snapshot_observed_at":"2026-08-12T00:30:41.714356Z","submitted_at":"2024-12-03T08:29:27Z","title":"Compressing KV Cache for Long-Context LLM Inference with Inter-Layer Attention Similarity","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-11T23:46:02.147598Z"},"links":{"citing_paper":"/paper/2412.02252"},"observation_digest":"sha256:181c112f2adf273649f4215a63d3931e3ab418b62c899f13abc569bce9dd2e5d","observation_id":"61f7bfbc-d96c-4484-86fb-599962c76105","resolution":{"observed_at":"2026-08-11T23:46:02.147598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:02.151899Z","title":"Transformers: State-of-the-art natural language processing","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.02252","last_updated":"2025-08-04T02:17:56Z","snapshot_observed_at":"2026-08-12T00:30:41.714356Z","submitted_at":"2024-12-03T08:29:27Z","title":"Compressing KV Cache for Long-Context LLM Inference with Inter-Layer Attention Similarity","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-11T23:46:02.151899Z"},"links":{"citing_paper":"/paper/2412.02252"},"observation_digest":"sha256:ef705949a6fad67ee03f19c58e7f21ddf763de4dabd66d059b7d0ebf8f42c99a","observation_id":"6599008c-d467-400c-8a03-864bac047884","resolution":{"observed_at":"2026-08-11T23:46:02.151899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:02.156015Z","title":"and Tu, K","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02252","last_updated":"2025-08-04T02:17:56Z","snapshot_observed_at":"2026-08-12T00:30:41.714356Z","submitted_at":"2024-12-03T08:29:27Z","title":"Compressing KV Cache for Long-Context LLM Inference with Inter-Layer Attention Similarity","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-11T23:46:02.156015Z"},"links":{"citing_paper":"/paper/2412.02252"},"observation_digest":"sha256:8935ce5b598a67b0159ad27de463977a8969b60c0aae61da29f1bac6da128f12","observation_id":"637c17ae-8609-4060-bd5e-ee9e6e7a49c8","resolution":{"observed_at":"2026-08-11T23:46:02.156015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:02.160318Z","title":"Efficient streaming language models with attention sinks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02252","last_updated":"2025-08-04T02:17:56Z","snapshot_observed_at":"2026-08-12T00:30:41.714356Z","submitted_at":"2024-12-03T08:29:27Z","title":"Compressing KV Cache for Long-Context LLM Inference with Inter-Layer Attention Similarity","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-11T23:46:02.160318Z"},"links":{"citing_paper":"/paper/2412.02252"},"observation_digest":"sha256:43d31993f4601619d86c1830ad0299973b8fdc3e5fdc25501f3ae09f46e7c24d","observation_id":"066b066f-a3f8-4d08-913b-dcc30296097c","resolution":{"observed_at":"2026-08-11T23:46:02.160318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:02.164871Z","title":"Sharing attention weights for fast transformer","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.02252","last_updated":"2025-08-04T02:17:56Z","snapshot_observed_at":"2026-08-12T00:30:41.714356Z","submitted_at":"2024-12-03T08:29:27Z","title":"Compressing KV Cache for Long-Context LLM Inference with Inter-Layer Attention Similarity","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-11T23:46:02.164871Z"},"links":{"citing_paper":"/paper/2412.02252"},"observation_digest":"sha256:4aafc2532315167b2e4d52981b0d9851b358ca04d14eaf94011c478e0ae77eae","observation_id":"bee1dc97-650a-4ec2-b3ee-320486b3b22d","resolution":{"observed_at":"2026-08-11T23:46:02.164871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:02.169436Z","title":"A., Oguz, B., Khabsa, M., Fang, H., Mehdad, Y., Narang, S., Malik, K., Fan, A., Bhosale, S., Edunov, S., Lewis, M., Wang, S., and Ma, H","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02252","last_updated":"2025-08-04T02:17:56Z","snapshot_observed_at":"2026-08-12T00:30:41.714356Z","submitted_at":"2024-12-03T08:29:27Z","title":"Compressing KV Cache for Long-Context LLM Inference with Inter-Layer Attention Similarity","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-11T23:46:02.169436Z"},"links":{"citing_paper":"/paper/2412.02252"},"observation_digest":"sha256:d239a490b38a00251c4b75829490bf67aa60dcbe578dc354b4b15f5225ab5c24","observation_id":"7d73e4f0-05ec-4fff-8adc-4ef91e667dfa","resolution":{"observed_at":"2026-08-11T23:46:02.169436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:02.174036Z","title":"B ench: Extending long context evaluation beyond 100 K tokens","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02252","last_updated":"2025-08-04T02:17:56Z","snapshot_observed_at":"2026-08-12T00:30:41.714356Z","submitted_at":"2024-12-03T08:29:27Z","title":"Compressing KV Cache for Long-Context LLM Inference with Inter-Layer Attention Similarity","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-11T23:46:02.174036Z"},"links":{"citing_paper":"/paper/2412.02252"},"observation_digest":"sha256:674478b5fac7d36af451fed75cc385562b04477531fd2300914bf12fbd4d0993","observation_id":"3547b98f-4cdc-4e26-9900-7e289f56daf2","resolution":{"observed_at":"2026-08-11T23:46:02.174036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02069","last_updated":"2025-05-15T17:18:12Z","snapshot_observed_at":"2026-08-13T04:39:30.300015Z","submitted_at":"2024-06-04T07:51:30Z","title":"PyramidKV: Dynamic KV Cache Compression based on Pyramidal Information Funneling","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02069","snapshot_observed_at":"2026-08-11T23:46:02.178568Z","title":"Pyramidkv: Dynamic kv cache compression based on pyramidal information funneling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02252","last_updated":"2025-08-04T02:17:56Z","snapshot_observed_at":"2026-08-12T00:30:41.714356Z","submitted_at":"2024-12-03T08:29:27Z","title":"Compressing KV Cache for Long-Context LLM Inference with Inter-Layer Attention Similarity","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-11T23:46:02.178568Z"},"links":{"cited_paper":"/paper/2406.02069","citing_paper":"/paper/2412.02252"},"observation_digest":"sha256:50108869c0a0c40c10fca685dc7c504783b62e149d7ad5a4052f9a3a932eab6b","observation_id":"3dd0b3a7-e200-4e85-8a80-b2346180c1a2","resolution":{"observed_at":"2026-08-11T23:46:02.178568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:02.791404Z","title":"H2o: Heavy-hitter oracle for efficient generative inference of large language models","venue":null,"work_id":"b7cd9060-7bf4-48b6-a2c9-46c01e406c49","year":2023},"citing_paper":{"arxiv_id":"2412.02252","last_updated":"2025-08-04T02:17:56Z","snapshot_observed_at":"2026-08-12T00:30:41.714356Z","submitted_at":"2024-12-03T08:29:27Z","title":"Compressing KV Cache for Long-Context LLM Inference with Inter-Layer Attention Similarity","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-11T23:46:02.183128Z"},"links":{"citing_paper":"/paper/2412.02252"},"observation_digest":"sha256:fa1fb7ae2ab64391e9f60612d5f6f84bfc5993c4dc682f46f8da788422d2a1d7","observation_id":"72a49ccc-cccd-4788-a785-97374f2dc53e","resolution":{"observed_at":"2026-08-11T23:46:02.798121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:46:02.187649Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.02252","last_updated":"2025-08-04T02:17:56Z","snapshot_observed_at":"2026-08-12T00:30:41.714356Z","submitted_at":"2024-12-03T08:29:27Z","title":"Compressing KV Cache for Long-Context LLM Inference with Inter-Layer Attention Similarity","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-11T23:46:02.187649Z"},"links":{"citing_paper":"/paper/2412.02252"},"observation_digest":"sha256:08bf364f2e7cab12a21e2c89c6059aeae45438221dd0d4007d3bac76b7c2a74d","observation_id":"1359955e-27e9-4492-9b9e-c2e319126b9c","resolution":{"observed_at":"2026-08-11T23:46:02.187649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.02252","last_updated":"2025-08-04T02:17:56Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-12T00:30:41.714356Z","submitted_at":"2024-12-03T08:29:27Z","title":"Compressing KV Cache for Long-Context LLM Inference with Inter-Layer Attention Similarity"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":45,"verified_exact":0,"verified_fuzzy":6},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 0 inbound Pith citation observations for arXiv:2412.02252."}