{"as_of":"2026-08-19T23:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b5060b55a924b486fe05c8476faef0b348e21366b12c6db53612785019fa80e2","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T14:41:05.147543Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T13:46:11.383126Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T09:05:58.128419Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.15113","last_updated":"2025-01-25T07:28:13Z","snapshot_observed_at":"2026-08-19T12:48:12.083052Z","submitted_at":"2025-01-25T07:28:13Z","title":"Task-KV: Task-aware KV Cache Optimization via Semantic Differentiation of Attention Heads","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15113","snapshot_observed_at":"2026-08-08T13:46:11.383126Z","title":"Task-kv: Task-aware kv cache optimization via semantic differentiation of attention heads","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09647","last_updated":"2025-03-05T16:14:16Z","snapshot_observed_at":"2026-08-15T21:43:38.379452Z","submitted_at":"2025-02-11T00:04:32Z","title":"Unveiling Simplicities of Attention: Adaptive Long-Context Head Identification","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T13:46:11.383126Z"},"links":{"cited_paper":"/paper/2501.15113","citing_paper":"/paper/2502.09647"},"observation_digest":"sha256:280cd3def9ab101009be2c0ea98dfd93c31a2b80c00c452578f3d26abf9b0b57","observation_id":"1b23ff28-9c93-44f8-b1d1-d7b36a38705d","resolution":{"observed_at":"2026-08-08T13:46:11.383126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15113","last_updated":"2025-01-25T07:28:13Z","snapshot_observed_at":"2026-08-19T12:48:12.083052Z","submitted_at":"2025-01-25T07:28:13Z","title":"Task-KV: Task-aware KV Cache Optimization via Semantic Differentiation of Attention Heads","version":1},"cited_work":{"arxiv_id":"2501.15113","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.15113","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Task-kv: Task-aware kv cache optimization via semantic differentiation of attention heads","venue":null,"work_id":"f8b543ba-91b3-46f2-b6fb-a018108940cf","year":2025},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"cited_paper":"/paper/2501.15113","citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:68f2379edab3e8551b6f1d9bedf88709b444b3ebd538f7788937d66b4388c06f","observation_id":"84eace44-4527-4779-9b34-87224001a7b8","resolution":{"observed_at":"2026-05-11T09:05:58.130976Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.15113/citation-record","integrity":"/paper/2501.15113/integrity","json":"/paper/2501.15113/citation-record.json","paper":"/paper/2501.15113"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2301.00234","last_updated":"2024-10-05T11:47:02Z","snapshot_observed_at":"2026-07-06T14:36:25.690733Z","submitted_at":"2022-12-31T15:57:09Z","title":"A Survey on In-context Learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00234","snapshot_observed_at":"2026-08-10T14:41:04.955353Z","title":"A survey on in-context learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.15113","last_updated":"2025-01-25T07:28:13Z","snapshot_observed_at":"2026-08-19T12:48:12.083052Z","submitted_at":"2025-01-25T07:28:13Z","title":"Task-KV: Task-aware KV Cache Optimization via Semantic Differentiation of Attention Heads","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T14:41:04.955353Z"},"links":{"cited_paper":"/paper/2301.00234","citing_paper":"/paper/2501.15113"},"observation_digest":"sha256:74c08a766aa31e736cec36c3300bafd09d51e1896bd70f9d42d25d3ed7294ba6","observation_id":"2f1ccdae-e7b5-4cef-8e8b-f67e4c96942d","resolution":{"observed_at":"2026-08-10T14:41:04.955353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08354","last_updated":"2024-08-06T15:14:36Z","snapshot_observed_at":"2026-08-15T21:51:52.440582Z","submitted_at":"2023-04-17T15:16:10Z","title":"Tool Learning with Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08354","snapshot_observed_at":"2026-08-10T14:41:04.960913Z","title":"Tool learning with foundation models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15113","last_updated":"2025-01-25T07:28:13Z","snapshot_observed_at":"2026-08-19T12:48:12.083052Z","submitted_at":"2025-01-25T07:28:13Z","title":"Task-KV: Task-aware KV Cache Optimization via Semantic Differentiation of Attention Heads","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T14:41:04.960913Z"},"links":{"cited_paper":"/paper/2304.08354","citing_paper":"/paper/2501.15113"},"observation_digest":"sha256:81dbb03180833240b70352c6526f2ad7416ff3da64326330ec7c6fc5ec2ee953","observation_id":"91d1ecf5-b8b0-4265-b4ed-29df5387584e","resolution":{"observed_at":"2026-08-10T14:41:04.960913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.01749","last_updated":"2019-06-19T20:26:03Z","snapshot_observed_at":"2026-08-16T03:02:48.146902Z","submitted_at":"2019-06-04T23:00:43Z","title":"Multi-News: a Large-Scale Multi-Document Summarization Dataset and Abstractive Hierarchical Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.01749","snapshot_observed_at":"2026-08-10T14:41:04.966169Z","title":"Multi-news: A large- scale multi-document summarization dataset and abstractive hierarchical model,","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2501.15113","last_updated":"2025-01-25T07:28:13Z","snapshot_observed_at":"2026-08-19T12:48:12.083052Z","submitted_at":"2025-01-25T07:28:13Z","title":"Task-KV: Task-aware KV Cache Optimization via Semantic Differentiation of Attention Heads","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T14:41:04.966169Z"},"links":{"cited_paper":"/paper/1906.01749","citing_paper":"/paper/2501.15113"},"observation_digest":"sha256:fc0b202ffa9bbcfbf2a299de0041329d315559146549465927a1bddef20eee4b","observation_id":"fdc862a5-ee84-42e3-912a-004898cd8962","resolution":{"observed_at":"2026-08-10T14:41:04.966169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08312","last_updated":"2024-11-04T09:17:45Z","snapshot_observed_at":"2026-08-16T14:10:18.070759Z","submitted_at":"2024-03-13T07:44:14Z","title":"StreamingDialogue: Prolonged Dialogue Learning via Long Context Compression with Minimal Losses","version":3},"cited_work":{"arxiv_id":"2403.08312","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.08312","snapshot_observed_at":"2026-08-10T14:41:05.749225Z","title":"StreamingDialogue: Prolonged Dialogue Learning via Long Context Compression with Minimal Losses","venue":"cs.CL","work_id":"7ca8e42d-7481-4204-a2a0-b96393ac4684","year":2024},"citing_paper":{"arxiv_id":"2501.15113","last_updated":"2025-01-25T07:28:13Z","snapshot_observed_at":"2026-08-19T12:48:12.083052Z","submitted_at":"2025-01-25T07:28:13Z","title":"Task-KV: Task-aware KV Cache Optimization via Semantic Differentiation of Attention Heads","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T14:41:04.971128Z"},"links":{"cited_paper":"/paper/2403.08312","citing_paper":"/paper/2501.15113"},"observation_digest":"sha256:ff680214e643d1a0ca30afa3ff5cd90662a30836bc8ca1a2b0ee3ec5d1248d28","observation_id":"14533b86-b51e-4d82-addf-15368f9c0ee1","resolution":{"observed_at":"2026-08-10T14:41:05.756449Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10997","last_updated":"2024-03-27T09:16:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-18T07:47:33Z","title":"Retrieval-Augmented Generation for Large Language Models: A Survey","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10997","snapshot_observed_at":"2026-08-10T14:41:04.975704Z","title":"Retrieval-augmented generation for large language models: A survey,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15113","last_updated":"2025-01-25T07:28:13Z","snapshot_observed_at":"2026-08-19T12:48:12.083052Z","submitted_at":"2025-01-25T07:28:13Z","title":"Task-KV: Task-aware KV Cache Optimization via Semantic Differentiation of Attention Heads","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T14:41:04.975704Z"},"links":{"cited_paper":"/paper/2312.10997","citing_paper":"/paper/2501.15113"},"observation_digest":"sha256:8b6a6997106209a2b683b1e454e3313dd546586d53c417b9d852c9c2a497de22","observation_id":"e6a7c9b2-2294-41b9-89ab-29a9ed5c17a6","resolution":{"observed_at":"2026-08-10T14:41:04.975704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01107","last_updated":"2024-08-14T09:54:24Z","snapshot_observed_at":"2026-08-16T13:29:01.062234Z","submitted_at":"2024-08-02T08:37:03Z","title":"BioRAG: A RAG-LLM Framework for Biological Question Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01107","snapshot_observed_at":"2026-08-10T14:41:04.980455Z","title":"Biorag: A rag-llm framework for biological question reasoning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15113","last_updated":"2025-01-25T07:28:13Z","snapshot_observed_at":"2026-08-19T12:48:12.083052Z","submitted_at":"2025-01-25T07:28:13Z","title":"Task-KV: Task-aware KV Cache Optimization via Semantic Differentiation of Attention Heads","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T14:41:04.980455Z"},"links":{"cited_paper":"/paper/2408.01107","citing_paper":"/paper/2501.15113"},"observation_digest":"sha256:427bf438f172f855d53b39fef468a99f4bcaced7730eba6d3bace5c837ab8270","observation_id":"270c1694-f7a4-4dfa-9034-7966d0d99f3f","resolution":{"observed_at":"2026-08-10T14:41:04.980455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:41:05.893068Z","title":"H2o: Heavy-hitter oracle for efficient generative inference of large language models,","venue":null,"work_id":"c61930dd-f09e-4e88-9722-ebae4c07ed6b","year":2024},"citing_paper":{"arxiv_id":"2501.15113","last_updated":"2025-01-25T07:28:13Z","snapshot_observed_at":"2026-08-19T12:48:12.083052Z","submitted_at":"2025-01-25T07:28:13Z","title":"Task-KV: Task-aware KV Cache Optimization via Semantic Differentiation of Attention Heads","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T14:41:04.985502Z"},"links":{"citing_paper":"/paper/2501.15113"},"observation_digest":"sha256:a9b888be545c90c3848ed76907bfce5fe625a0cac0149fe3103f7cf3b4c4408b","observation_id":"50930c29-0d24-495e-8bad-822699b412e0","resolution":{"observed_at":"2026-08-10T14:41:05.898375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10685","last_updated":"2024-03-25T11:50:32Z","snapshot_observed_at":"2026-08-16T18:41:56.650989Z","submitted_at":"2024-02-16T13:39:34Z","title":"LongHeads: Multi-Head Attention is Secretly a Long Context Processor","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10685","snapshot_observed_at":"2026-08-10T14:41:04.989763Z","title":"Longheads: Multi-head attention is secretly a long context processor,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15113","last_updated":"2025-01-25T07:28:13Z","snapshot_observed_at":"2026-08-19T12:48:12.083052Z","submitted_at":"2025-01-25T07:28:13Z","title":"Task-KV: Task-aware KV Cache Optimization via Semantic Differentiation of Attention Heads","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T14:41:04.989763Z"},"links":{"cited_paper":"/paper/2402.10685","citing_paper":"/paper/2501.15113"},"observation_digest":"sha256:251add314cff6173d2cb4dfe0e3bdd76e9efb5d0e6e33bd78f59f4c82cb7b19a","observation_id":"187e3ac1-45a8-4e0c-bf85-be68c19a8dea","resolution":{"observed_at":"2026-08-10T14:41:04.989763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17453","last_updated":"2024-04-07T00:56:53Z","snapshot_observed_at":"2026-08-14T06:01:54.549199Z","submitted_at":"2023-09-29T17:59:56Z","title":"Efficient Streaming Language Models with Attention Sinks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17453","snapshot_observed_at":"2026-08-10T14:41:04.994236Z","title":"Efficient streaming language models with attention sinks,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15113","last_updated":"2025-01-25T07:28:13Z","snapshot_observed_at":"2026-08-19T12:48:12.083052Z","submitted_at":"2025-01-25T07:28:13Z","title":"Task-KV: Task-aware KV Cache Optimization via Semantic Differentiation of Attention Heads","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T14:41:04.994236Z"},"links":{"cited_paper":"/paper/2309.17453","citing_paper":"/paper/2501.15113"},"observation_digest":"sha256:616fab726ef577a28b493fe198b97a1c753fb18211cc07f64486a61ecf6496a2","observation_id":"64b5f45f-4193-4d29-8e0b-0f620fa8a31a","resolution":{"observed_at":"2026-08-10T14:41:04.994236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02069","last_updated":"2025-05-15T17:18:12Z","snapshot_observed_at":"2026-08-13T04:39:30.300015Z","submitted_at":"2024-06-04T07:51:30Z","title":"PyramidKV: Dynamic KV Cache Compression based on Pyramidal Information Funneling","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02069","snapshot_observed_at":"2026-08-10T14:41:04.999148Z","title":"Pyramidkv: Dynamic kv cache compression based on pyramidal information funneling,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15113","last_updated":"2025-01-25T07:28:13Z","snapshot_observed_at":"2026-08-19T12:48:12.083052Z","submitted_at":"2025-01-25T07:28:13Z","title":"Task-KV: Task-aware KV Cache Optimization via Semantic Differentiation of Attention Heads","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T14:41:04.999148Z"},"links":{"cited_paper":"/paper/2406.02069","citing_paper":"/paper/2501.15113"},"observation_digest":"sha256:a7fd14b5693657e9ac54908babf6e451fa55ef41d40bdd7805138cd6c32f330c","observation_id":"57cdb415-6c07-429c-8499-23a0f071df84","resolution":{"observed_at":"2026-08-10T14:41:04.999148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12532","last_updated":"2024-06-05T09:01:24Z","snapshot_observed_at":"2026-08-16T13:51:05.375565Z","submitted_at":"2024-05-21T06:46:37Z","title":"PyramidInfer: Pyramid KV Cache Compression for High-throughput LLM Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12532","snapshot_observed_at":"2026-08-10T14:41:05.004324Z","title":"Pyramidinfer: Pyramid kv cache compression for high-throughput llm inference,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15113","last_updated":"2025-01-25T07:28:13Z","snapshot_observed_at":"2026-08-19T12:48:12.083052Z","submitted_at":"2025-01-25T07:28:13Z","title":"Task-KV: Task-aware KV Cache Optimization via Semantic Differentiation of Attention Heads","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T14:41:05.004324Z"},"links":{"cited_paper":"/paper/2405.12532","citing_paper":"/paper/2501.15113"},"observation_digest":"sha256:13fc8dd53e05c317d479d1d5e1ebcddaaaa351decf5582613db48a73aef98b19","observation_id":"46fdbb1a-83a3-4239-8abf-ed34e63c0914","resolution":{"observed_at":"2026-08-10T14:41:05.004324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14469","last_updated":"2024-06-17T03:01:58Z","snapshot_observed_at":"2026-08-14T12:21:04.886717Z","submitted_at":"2024-04-22T17:42:58Z","title":"SnapKV: LLM Knows What You are Looking for Before Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14469","snapshot_observed_at":"2026-08-10T14:41:05.009013Z","title":"Snapkv: Llm knows what you are looking for before generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15113","last_updated":"2025-01-25T07:28:13Z","snapshot_observed_at":"2026-08-19T12:48:12.083052Z","submitted_at":"2025-01-25T07:28:13Z","title":"Task-KV: Task-aware KV Cache Optimization via Semantic Differentiation of Attention Heads","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T14:41:05.009013Z"},"links":{"cited_paper":"/paper/2404.14469","citing_paper":"/paper/2501.15113"},"observation_digest":"sha256:e68f76818abf1819c07f24508bf917450cceb4b1de16622a6894e61538b3b850","observation_id":"01f823a4-458b-4548-ba99-01702a53a02d","resolution":{"observed_at":"2026-08-10T14:41:05.009013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14366","last_updated":"2024-09-07T02:52:29Z","snapshot_observed_at":"2026-08-18T11:14:01.928809Z","submitted_at":"2024-05-23T09:43:52Z","title":"MiniCache: KV Cache Compression in Depth Dimension for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14366","snapshot_observed_at":"2026-08-10T14:41:05.013818Z","title":"Minicache: Kv cache compression in depth dimension for large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15113","last_updated":"2025-01-25T07:28:13Z","snapshot_observed_at":"2026-08-19T12:48:12.083052Z","submitted_at":"2025-01-25T07:28:13Z","title":"Task-KV: Task-aware KV Cache Optimization via Semantic Differentiation of Attention Heads","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T14:41:05.013818Z"},"links":{"cited_paper":"/paper/2405.14366","citing_paper":"/paper/2501.15113"},"observation_digest":"sha256:50d6430c9b3101c0498a55b2e8f0ab125a3d9be019c38d5dbf3b730bad5b4e51","observation_id":"de681a8d-578e-4497-80dd-db5200ce5d35","resolution":{"observed_at":"2026-08-10T14:41:05.013818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15891","last_updated":"2024-07-22T01:12:23Z","snapshot_observed_at":"2026-08-16T13:32:18.250431Z","submitted_at":"2024-07-22T01:12:23Z","title":"RazorAttention: Efficient KV Cache Compression Through Retrieval Heads","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15891","snapshot_observed_at":"2026-08-10T14:41:05.018480Z","title":"Razorattention: Efficient kv cache compression through retrieval heads, 2024,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15113","last_updated":"2025-01-25T07:28:13Z","snapshot_observed_at":"2026-08-19T12:48:12.083052Z","submitted_at":"2025-01-25T07:28:13Z","title":"Task-KV: Task-aware KV Cache Optimization via Semantic Differentiation of Attention Heads","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T14:41:05.018480Z"},"links":{"cited_paper":"/paper/2407.15891","citing_paper":"/paper/2501.15113"},"observation_digest":"sha256:c7fc91e42b814f226bb97f3f66d4cca7643c59e117d25a69695beea90121e5d6","observation_id":"3ea337a1-1de8-4e1d-afe8-e223adcffd65","resolution":{"observed_at":"2026-08-10T14:41:05.018480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-08-12T20:32:53.188699Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.11550","snapshot_observed_at":"2026-08-10T14:41:05.023298Z","title":"Ada-kv: Optimizing kv cache eviction by adaptive budget allocation for efficient llm inference,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15113","last_updated":"2025-01-25T07:28:13Z","snapshot_observed_at":"2026-08-19T12:48:12.083052Z","submitted_at":"2025-01-25T07:28:13Z","title":"Task-KV: Task-aware KV Cache Optimization via Semantic Differentiation of Attention Heads","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T14:41:05.023298Z"},"links":{"cited_paper":"/paper/2407.11550","citing_paper":"/paper/2501.15113"},"observation_digest":"sha256:7f4a88bd295912cdf4d2f86b92886f5451f15b8c94dc44c40f04409e22a9eba6","observation_id":"1456b600-29f7-40ca-a27a-e6e4fdaa9894","resolution":{"observed_at":"2026-08-10T14:41:05.023298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10819","last_updated":"2024-10-14T17:59:58Z","snapshot_observed_at":"2026-08-16T03:51:26.346422Z","submitted_at":"2024-10-14T17:59:58Z","title":"DuoAttention: Efficient Long-Context LLM Inference with Retrieval and Streaming Heads","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10819","snapshot_observed_at":"2026-08-10T14:41:05.028215Z","title":"Duoattention: Efficient long-context llm inference with retrieval and streaming heads,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15113","last_updated":"2025-01-25T07:28:13Z","snapshot_observed_at":"2026-08-19T12:48:12.083052Z","submitted_at":"2025-01-25T07:28:13Z","title":"Task-KV: Task-aware KV Cache Optimization via Semantic Differentiation of Attention Heads","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T14:41:05.028215Z"},"links":{"cited_paper":"/paper/2410.10819","citing_paper":"/paper/2501.15113"},"observation_digest":"sha256:4b87d5d852b876c2f86841babb5ba8de951ac971534c4619cd0be4a0a14288bf","observation_id":"235de114-2b4d-43c0-abb4-a832ba9db4c8","resolution":{"observed_at":"2026-08-10T14:41:05.028215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:41:05.032990Z","title":"Not all heads matter: A head-level kv cache compression method with integrated retrieval and reasoning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15113","last_updated":"2025-01-25T07:28:13Z","snapshot_observed_at":"2026-08-19T12:48:12.083052Z","submitted_at":"2025-01-25T07:28:13Z","title":"Task-KV: Task-aware KV Cache Optimization via Semantic Differentiation of Attention Heads","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T14:41:05.032990Z"},"links":{"citing_paper":"/paper/2501.15113"},"observation_digest":"sha256:d006e9a9074bd7f9a3f9a59a74bf8c40fd66a9a58e027806929479dbbf04736c","observation_id":"607948dc-9359-4ae5-865f-3496095887fc","resolution":{"observed_at":"2026-08-10T14:41:05.032990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.15574","last_updated":"2024-04-24T00:24:03Z","snapshot_observed_at":"2026-08-16T13:58:20.510591Z","submitted_at":"2024-04-24T00:24:03Z","title":"Retrieval Head Mechanistically Explains Long-Context Factuality","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.15574","snapshot_observed_at":"2026-08-10T14:41:05.037675Z","title":"Retrieval head mechanistically explains long-context factuality,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15113","last_updated":"2025-01-25T07:28:13Z","snapshot_observed_at":"2026-08-19T12:48:12.083052Z","submitted_at":"2025-01-25T07:28:13Z","title":"Task-KV: Task-aware KV Cache Optimization via Semantic Differentiation of Attention Heads","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T14:41:05.037675Z"},"links":{"cited_paper":"/paper/2404.15574","citing_paper":"/paper/2501.15113"},"observation_digest":"sha256:da623e0d5a278af46f52090386e93b53ceb21b0c4aef8500c436f73c1b94cfbb","observation_id":"789e0f0c-50b4-4f78-83da-a4edb2d57cdc","resolution":{"observed_at":"2026-08-10T14:41:05.037675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.08375","last_updated":"2021-08-18T20:17:46Z","snapshot_observed_at":"2026-08-16T18:02:25.016277Z","submitted_at":"2021-08-18T20:17:46Z","title":"Contributions of Transformer Attention Heads in Multi- and Cross-lingual Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.08375","snapshot_observed_at":"2026-08-10T14:41:05.045154Z","title":"Contributions of transformer attention heads in multi-and cross-lingual tasks,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.15113","last_updated":"2025-01-25T07:28:13Z","snapshot_observed_at":"2026-08-19T12:48:12.083052Z","submitted_at":"2025-01-25T07:28:13Z","title":"Task-KV: Task-aware KV Cache Optimization via Semantic Differentiation of Attention Heads","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T14:41:05.045154Z"},"links":{"cited_paper":"/paper/2108.08375","citing_paper":"/paper/2501.15113"},"observation_digest":"sha256:8a5d0166ec9b93f6ca0f25899e85063f33733c8f6e6bcfb12732dcca93f97d41","observation_id":"2f11d050-6f92-435a-866d-782b30f4ade7","resolution":{"observed_at":"2026-08-10T14:41:05.045154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:41:05.877297Z","title":"A closer look at transformer attention for multilingual translation,","venue":null,"work_id":"01005101-6016-4d57-8234-b6ab8901f5ec","year":2023},"citing_paper":{"arxiv_id":"2501.15113","last_updated":"2025-01-25T07:28:13Z","snapshot_observed_at":"2026-08-19T12:48:12.083052Z","submitted_at":"2025-01-25T07:28:13Z","title":"Task-KV: Task-aware KV Cache Optimization via Semantic Differentiation of Attention Heads","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T14:41:05.053105Z"},"links":{"citing_paper":"/paper/2501.15113"},"observation_digest":"sha256:cd5f2037b4328c060295a2f3e672a038d0b68bf4f6a6dd254f12a26c8d73ee48","observation_id":"ed73b555-b77c-477f-b1a9-17c3bbea4cdd","resolution":{"observed_at":"2026-08-10T14:41:05.882178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.14508","last_updated":"2024-06-19T04:00:32Z","snapshot_observed_at":"2026-08-08T03:49:18.086396Z","submitted_at":"2023-08-28T11:53:40Z","title":"LongBench: A Bilingual, Multitask Benchmark for Long Context Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.14508","snapshot_observed_at":"2026-08-10T14:41:05.057591Z","title":"Longbench: A bilingual, multitask benchmark for long context understanding,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15113","last_updated":"2025-01-25T07:28:13Z","snapshot_observed_at":"2026-08-19T12:48:12.083052Z","submitted_at":"2025-01-25T07:28:13Z","title":"Task-KV: Task-aware KV Cache Optimization via Semantic Differentiation of Attention Heads","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T14:41:05.057591Z"},"links":{"cited_paper":"/paper/2308.14508","citing_paper":"/paper/2501.15113"},"observation_digest":"sha256:d41088c4a33828e3c82c9dcaf07b7e2c44666fbe032ab9c4fc7a55ba7daccfaf","observation_id":"ee253154-3d1c-4f8f-8b0e-8b4d4cb8fe7f","resolution":{"observed_at":"2026-08-10T14:41:05.057591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04939","last_updated":"2024-09-06T05:06:51Z","snapshot_observed_at":"2026-08-16T14:45:06.045654Z","submitted_at":"2023-11-08T01:45:37Z","title":"LooGLE: Can Long-Context Language Models Understand Long Contexts?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04939","snapshot_observed_at":"2026-08-10T14:41:05.062461Z","title":"Loogle: Can long- context language models understand long contexts?","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15113","last_updated":"2025-01-25T07:28:13Z","snapshot_observed_at":"2026-08-19T12:48:12.083052Z","submitted_at":"2025-01-25T07:28:13Z","title":"Task-KV: Task-aware KV Cache Optimization via Semantic Differentiation of Attention Heads","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T14:41:05.062461Z"},"links":{"cited_paper":"/paper/2311.04939","citing_paper":"/paper/2501.15113"},"observation_digest":"sha256:4a859bfb4176add11ace3c5b9d7e389949ceaf867cc2eee28ba3969b573da885","observation_id":"f0ba6493-e27c-406f-9d64-b46f41054683","resolution":{"observed_at":"2026-08-10T14:41:05.062461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13245","last_updated":"2023-12-23T17:55:11Z","snapshot_observed_at":"2026-08-15T06:28:09.529747Z","submitted_at":"2023-05-22T17:16:38Z","title":"GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13245","snapshot_observed_at":"2026-08-10T14:41:05.067310Z","title":"Gqa: Training generalized multi-query transformer models from multi-head checkpoints,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15113","last_updated":"2025-01-25T07:28:13Z","snapshot_observed_at":"2026-08-19T12:48:12.083052Z","submitted_at":"2025-01-25T07:28:13Z","title":"Task-KV: Task-aware KV Cache Optimization via Semantic Differentiation of Attention Heads","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T14:41:05.067310Z"},"links":{"cited_paper":"/paper/2305.13245","citing_paper":"/paper/2501.15113"},"observation_digest":"sha256:02184ea0b2ca4c19eaebc30eee3e68dccf58f87ee68331dc3bfba32f6946186a","observation_id":"99270b41-2d38-46ef-8d8b-74b50b6801f7","resolution":{"observed_at":"2026-08-10T14:41:05.067310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-10T14:41:05.072104Z","title":"Llama 2: Open foundation and fine-tuned chat models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15113","last_updated":"2025-01-25T07:28:13Z","snapshot_observed_at":"2026-08-19T12:48:12.083052Z","submitted_at":"2025-01-25T07:28:13Z","title":"Task-KV: Task-aware KV Cache Optimization via Semantic Differentiation of Attention Heads","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T14:41:05.072104Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2501.15113"},"observation_digest":"sha256:6dc7291bf404480fc78a6f967c814b41e560a9063787e64a613be334c3b055a8","observation_id":"6110563c-1c2d-486b-b5ed-1d8de218eb40","resolution":{"observed_at":"2026-08-10T14:41:05.072104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-08-17T20:30:34.016254Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-10T14:41:05.076675Z","title":"Mistral 7b,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15113","last_updated":"2025-01-25T07:28:13Z","snapshot_observed_at":"2026-08-19T12:48:12.083052Z","submitted_at":"2025-01-25T07:28:13Z","title":"Task-KV: Task-aware KV Cache Optimization via Semantic Differentiation of Attention Heads","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T14:41:05.076675Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2501.15113"},"observation_digest":"sha256:1ea93e4f05873eacb68ccc36c1d0fc322b7de68adb35edead67d0892d552407b","observation_id":"3b580b22-f8f7-4a8e-b9e6-df4079c13f8e","resolution":{"observed_at":"2026-08-10T14:41:05.076675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04617","last_updated":"2024-05-28T12:05:12Z","snapshot_observed_at":"2026-08-16T14:20:44.078187Z","submitted_at":"2024-02-07T06:50:42Z","title":"InfLLM: Training-Free Long-Context Extrapolation for LLMs with an Efficient Context Memory","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04617","snapshot_observed_at":"2026-08-10T14:41:05.081285Z","title":"Infllm: Unveiling the intrinsic capacity of llms for understanding extremely long sequences with training-free memory,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15113","last_updated":"2025-01-25T07:28:13Z","snapshot_observed_at":"2026-08-19T12:48:12.083052Z","submitted_at":"2025-01-25T07:28:13Z","title":"Task-KV: Task-aware KV Cache Optimization via Semantic Differentiation of Attention Heads","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T14:41:05.081285Z"},"links":{"cited_paper":"/paper/2402.04617","citing_paper":"/paper/2501.15113"},"observation_digest":"sha256:c39243c86b65761fb5c129ac208f818935d6738f30f2bb10c31124c767d9b679","observation_id":"bab3992c-02fc-4d60-9a6d-428c0c80f4a7","resolution":{"observed_at":"2026-08-10T14:41:05.081285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01801","last_updated":"2024-10-29T18:26:09Z","snapshot_observed_at":"2026-08-14T11:45:47.400186Z","submitted_at":"2023-10-03T05:17:08Z","title":"Model Tells You What to Discard: Adaptive KV Cache Compression for LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01801","snapshot_observed_at":"2026-08-10T14:41:05.086383Z","title":"Model tells you what to discard: Adaptive kv cache compression for llms,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15113","last_updated":"2025-01-25T07:28:13Z","snapshot_observed_at":"2026-08-19T12:48:12.083052Z","submitted_at":"2025-01-25T07:28:13Z","title":"Task-KV: Task-aware KV Cache Optimization via Semantic Differentiation of Attention Heads","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T14:41:05.086383Z"},"links":{"cited_paper":"/paper/2310.01801","citing_paper":"/paper/2501.15113"},"observation_digest":"sha256:a647dd144d320a682b6d13727e05c2f87d04c9508028c8e080e1ae43175ac61f","observation_id":"867bfa47-cabe-46a9-ba94-c207f0001ed8","resolution":{"observed_at":"2026-08-10T14:41:05.086383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:41:05.091154Z","title":"Principal components analysis (pca),","venue":null,"work_id":null,"year":1993},"citing_paper":{"arxiv_id":"2501.15113","last_updated":"2025-01-25T07:28:13Z","snapshot_observed_at":"2026-08-19T12:48:12.083052Z","submitted_at":"2025-01-25T07:28:13Z","title":"Task-KV: Task-aware KV Cache Optimization via Semantic Differentiation of Attention Heads","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T14:41:05.091154Z"},"links":{"citing_paper":"/paper/2501.15113"},"observation_digest":"sha256:9b9819f6bae11e2ac22019d3e4a0ebe5995f3f7ea165e9cb9ebfbd2f1b731b33","observation_id":"786dca31-1e67-458f-b3b7-48a54f0c473b","resolution":{"observed_at":"2026-08-10T14:41:05.091154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:41:05.095345Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.15113","last_updated":"2025-01-25T07:28:13Z","snapshot_observed_at":"2026-08-19T12:48:12.083052Z","submitted_at":"2025-01-25T07:28:13Z","title":"Task-KV: Task-aware KV Cache Optimization via Semantic Differentiation of Attention Heads","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T14:41:05.095345Z"},"links":{"citing_paper":"/paper/2501.15113"},"observation_digest":"sha256:10e64633033ef0c224713efeb8f6d4f1a20de0a70c28f346e320bbca886f9542","observation_id":"7c41285c-af47-4c36-b609-d3a2d7919af6","resolution":{"observed_at":"2026-08-10T14:41:05.095345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16137","last_updated":"2024-06-24T21:22:00Z","snapshot_observed_at":"2026-08-19T14:47:53.412946Z","submitted_at":"2023-08-30T16:47:51Z","title":"LM-Infinite: Zero-Shot Extreme Length Generalization for Large Language Models","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16137","snapshot_observed_at":"2026-08-10T14:41:05.099612Z","title":"Lm-infinite: Simple on-the-fly length generalization for large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15113","last_updated":"2025-01-25T07:28:13Z","snapshot_observed_at":"2026-08-19T12:48:12.083052Z","submitted_at":"2025-01-25T07:28:13Z","title":"Task-KV: Task-aware KV Cache Optimization via Semantic Differentiation of Attention Heads","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T14:41:05.099612Z"},"links":{"cited_paper":"/paper/2308.16137","citing_paper":"/paper/2501.15113"},"observation_digest":"sha256:9e42e8d9c7153d5f21e23439e330cbb00cac8b14af0aeb8b0007adb13aa1b6d7","observation_id":"29f70fda-990d-4de0-8647-57ce9d70a351","resolution":{"observed_at":"2026-08-10T14:41:05.099612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.03011","last_updated":"2021-05-07T00:12:34Z","snapshot_observed_at":"2026-08-18T08:41:55.901083Z","submitted_at":"2021-05-07T00:12:34Z","title":"A Dataset of Information-Seeking Questions and Answers Anchored in Research Papers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.03011","snapshot_observed_at":"2026-08-10T14:41:05.103927Z","title":"A dataset of information-seeking questions and answers anchored in research papers,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.15113","last_updated":"2025-01-25T07:28:13Z","snapshot_observed_at":"2026-08-19T12:48:12.083052Z","submitted_at":"2025-01-25T07:28:13Z","title":"Task-KV: Task-aware KV Cache Optimization via Semantic Differentiation of Attention Heads","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T14:41:05.103927Z"},"links":{"cited_paper":"/paper/2105.03011","citing_paper":"/paper/2501.15113"},"observation_digest":"sha256:ecc6e58f03113cb9f1ec5457258b78fe05751103c9157bbd03464caf1115f769","observation_id":"55e611ed-2dce-4163-ace3-02824524d6e8","resolution":{"observed_at":"2026-08-10T14:41:05.103927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.09600","last_updated":"2018-09-25T17:28:20Z","snapshot_observed_at":"2026-08-17T01:54:11.006899Z","submitted_at":"2018-09-25T17:28:20Z","title":"HotpotQA: A Dataset for Diverse, Explainable Multi-hop Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.09600","snapshot_observed_at":"2026-08-10T14:41:05.108203Z","title":"Hotpotqa: A dataset for diverse, explainable multi-hop question answering,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.15113","last_updated":"2025-01-25T07:28:13Z","snapshot_observed_at":"2026-08-19T12:48:12.083052Z","submitted_at":"2025-01-25T07:28:13Z","title":"Task-KV: Task-aware KV Cache Optimization via Semantic Differentiation of Attention Heads","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T14:41:05.108203Z"},"links":{"cited_paper":"/paper/1809.09600","citing_paper":"/paper/2501.15113"},"observation_digest":"sha256:69912d4111d5fcd9edeb5813cb98ccba374765859ffb0958ecfe036836f8e9fc","observation_id":"b405bba8-c603-490a-8238-e3786c687bc9","resolution":{"observed_at":"2026-08-10T14:41:05.108203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.01060","last_updated":"2020-11-12T07:47:48Z","snapshot_observed_at":"2026-08-14T05:50:17.249446Z","submitted_at":"2020-11-02T15:42:40Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.01060","snapshot_observed_at":"2026-08-10T14:41:05.112914Z","title":"Constructing a multi-hop qa dataset for comprehensive evaluation of reasoning steps,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2501.15113","last_updated":"2025-01-25T07:28:13Z","snapshot_observed_at":"2026-08-19T12:48:12.083052Z","submitted_at":"2025-01-25T07:28:13Z","title":"Task-KV: Task-aware KV Cache Optimization via Semantic Differentiation of Attention Heads","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T14:41:05.112914Z"},"links":{"cited_paper":"/paper/2011.01060","citing_paper":"/paper/2501.15113"},"observation_digest":"sha256:05cd4ce65cb8c9db687db64b3f5b6ee22173d1fb98a7ec939e29b47f06931589","observation_id":"e52b249a-740e-4685-9fd1-f4255a219cc3","resolution":{"observed_at":"2026-08-10T14:41:05.112914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.05938","last_updated":"2021-04-13T05:00:35Z","snapshot_observed_at":"2026-08-19T12:23:23.964064Z","submitted_at":"2021-04-13T05:00:35Z","title":"QMSum: A New Benchmark for Query-based Multi-domain Meeting Summarization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.05938","snapshot_observed_at":"2026-08-10T14:41:05.117333Z","title":"Qmsum: A new benchmark for query-based multi-domain meeting summarization,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.15113","last_updated":"2025-01-25T07:28:13Z","snapshot_observed_at":"2026-08-19T12:48:12.083052Z","submitted_at":"2025-01-25T07:28:13Z","title":"Task-KV: Task-aware KV Cache Optimization via Semantic Differentiation of Attention Heads","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T14:41:05.117333Z"},"links":{"cited_paper":"/paper/2104.05938","citing_paper":"/paper/2501.15113"},"observation_digest":"sha256:31e30e63599150e0d06b87b15321fbbf4a623ea4dc63be6be5d774e35667b7d4","observation_id":"82fa0b58-9acb-4d82-833b-baeb2cc29240","resolution":{"observed_at":"2026-08-10T14:41:05.117333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.02112","last_updated":"2021-04-11T21:04:26Z","snapshot_observed_at":"2026-08-16T18:33:45.535571Z","submitted_at":"2021-04-05T18:45:13Z","title":"Efficient Attentions for Long Document Summarization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.02112","snapshot_observed_at":"2026-08-10T14:41:05.122694Z","title":"Efficient attentions for long document summarization,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.15113","last_updated":"2025-01-25T07:28:13Z","snapshot_observed_at":"2026-08-19T12:48:12.083052Z","submitted_at":"2025-01-25T07:28:13Z","title":"Task-KV: Task-aware KV Cache Optimization via Semantic Differentiation of Attention Heads","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T14:41:05.122694Z"},"links":{"cited_paper":"/paper/2104.02112","citing_paper":"/paper/2501.15113"},"observation_digest":"sha256:c221af46f758bfe7933cc638d9b7edbc8cdc3be0032355fdb3caa0aa78d57f8f","observation_id":"895f4727-556e-4266-8a88-567002d11549","resolution":{"observed_at":"2026-08-10T14:41:05.122694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.03551","last_updated":"2017-05-13T21:12:37Z","snapshot_observed_at":"2026-08-13T08:58:47.096400Z","submitted_at":"2017-05-09T21:35:07Z","title":"TriviaQA: A Large Scale Distantly Supervised Challenge Dataset for Reading Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.03551","snapshot_observed_at":"2026-08-10T14:41:05.127858Z","title":"Triviaqa: A large scale distantly supervised challenge dataset for reading comprehension,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.15113","last_updated":"2025-01-25T07:28:13Z","snapshot_observed_at":"2026-08-19T12:48:12.083052Z","submitted_at":"2025-01-25T07:28:13Z","title":"Task-KV: Task-aware KV Cache Optimization via Semantic Differentiation of Attention Heads","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T14:41:05.127858Z"},"links":{"cited_paper":"/paper/1705.03551","citing_paper":"/paper/2501.15113"},"observation_digest":"sha256:61b1cd7a864430ad627fcf676aaf78151356f54b8883729d630d8c184fc6e89a","observation_id":"350bfaf1-8983-4426-912c-d06967c507ac","resolution":{"observed_at":"2026-08-10T14:41:05.127858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:41:05.841845Z","title":"Learning question classifiers,","venue":null,"work_id":"5a74b840-fe5f-44fd-8d25-8d839d2d65aa","year":2002},"citing_paper":{"arxiv_id":"2501.15113","last_updated":"2025-01-25T07:28:13Z","snapshot_observed_at":"2026-08-19T12:48:12.083052Z","submitted_at":"2025-01-25T07:28:13Z","title":"Task-KV: Task-aware KV Cache Optimization via Semantic Differentiation of Attention Heads","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T14:41:05.132863Z"},"links":{"citing_paper":"/paper/2501.15113"},"observation_digest":"sha256:930885ace8f10c130402517ffc0c824eea20a82f9198d9b85863d2e9a974ca43","observation_id":"1e7a16d4-c105-48c2-a9e3-28962695ed2d","resolution":{"observed_at":"2026-08-10T14:41:05.846991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:41:05.825494Z","title":"Exploiting semantic resources for large scale text categorization,","venue":null,"work_id":"b4df62aa-4184-4e39-bf9e-4a5eecde8efb","year":2012},"citing_paper":{"arxiv_id":"2501.15113","last_updated":"2025-01-25T07:28:13Z","snapshot_observed_at":"2026-08-19T12:48:12.083052Z","submitted_at":"2025-01-25T07:28:13Z","title":"Task-KV: Task-aware KV Cache Optimization via Semantic Differentiation of Attention Heads","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T14:41:05.137793Z"},"links":{"citing_paper":"/paper/2501.15113"},"observation_digest":"sha256:b0fe63b6ee337a1bec7762c5375516ac0208fb309d78b544b643762f41377f0c","observation_id":"ea4a1dda-b874-4ca7-9ea9-4d339c9e065f","resolution":{"observed_at":"2026-08-10T14:41:05.830603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03091","last_updated":"2023-10-04T01:13:49Z","snapshot_observed_at":"2026-08-17T22:17:19.637825Z","submitted_at":"2023-06-05T17:59:41Z","title":"RepoBench: Benchmarking Repository-Level Code Auto-Completion Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03091","snapshot_observed_at":"2026-08-10T14:41:05.142575Z","title":"Repobench: Benchmarking repository- level code auto-completion systems,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15113","last_updated":"2025-01-25T07:28:13Z","snapshot_observed_at":"2026-08-19T12:48:12.083052Z","submitted_at":"2025-01-25T07:28:13Z","title":"Task-KV: Task-aware KV Cache Optimization via Semantic Differentiation of Attention Heads","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T14:41:05.142575Z"},"links":{"cited_paper":"/paper/2306.03091","citing_paper":"/paper/2501.15113"},"observation_digest":"sha256:ba5ec046c9dbeaec02193517fab81f749afb18ff301f849b3b3ef704866ad2bd","observation_id":"7a138ed5-73a8-4825-976e-86791e37726a","resolution":{"observed_at":"2026-08-10T14:41:05.142575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:41:05.147543Z","title":"Longcoder: A long- range pre-trained language model for code completion,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15113","last_updated":"2025-01-25T07:28:13Z","snapshot_observed_at":"2026-08-19T12:48:12.083052Z","submitted_at":"2025-01-25T07:28:13Z","title":"Task-KV: Task-aware KV Cache Optimization via Semantic Differentiation of Attention Heads","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T14:41:05.147543Z"},"links":{"citing_paper":"/paper/2501.15113"},"observation_digest":"sha256:f3a14ca6178f3f0f1effcdeb818914aedc966bb01338289ed87197200f7cf0fa","observation_id":"c233d579-5980-4642-81ad-37da6ff46449","resolution":{"observed_at":"2026-08-10T14:41:05.147543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.15113","last_updated":"2025-01-25T07:28:13Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-19T12:48:12.083052Z","submitted_at":"2025-01-25T07:28:13Z","title":"Task-KV: Task-aware KV Cache Optimization via Semantic Differentiation of Attention Heads"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":35,"verified_exact":1,"verified_fuzzy":4},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 2 inbound Pith citation observations for arXiv:2501.15113."}