{"as_of":"2026-08-16T00:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cdf624f8aef66339fb5222289ff51d8d2bf154044415d3c213549b977128dd75","coverage":[{"denominator":26,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T19:52:42.384440Z","state":"measured"},{"denominator":26,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":26,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.24260/citation-record","integrity":"/paper/2607.24260/integrity","json":"/paper/2607.24260/citation-record.json","paper":"/paper/2607.24260"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.16130","last_updated":"2025-02-19T10:49:41Z","snapshot_observed_at":"2026-07-06T18:05:11.700127Z","submitted_at":"2024-04-24T18:38:11Z","title":"From Local to Global: A Graph RAG Approach to Query-Focused Summarization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16130","snapshot_observed_at":"2026-07-31T19:52:40.416031Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24260","last_updated":"2026-07-27T10:51:38Z","snapshot_observed_at":"2026-08-10T17:55:07.029281Z","submitted_at":"2026-07-27T10:51:38Z","title":"KAP: Bridging the Knowledge Selection-Runtime Consumption Gap in LLM Systems","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-31T19:52:40.416031Z"},"links":{"cited_paper":"/paper/2404.16130","citing_paper":"/paper/2607.24260"},"observation_digest":"sha256:3ea440a09149c36244e65ec2b0130045dbe9247c04836efb057a81dfa6a7c80f","observation_id":"4f0ae3fc-641e-4237-8f66-2e15b7e33d97","resolution":{"observed_at":"2026-07-31T19:52:40.416031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T19:52:40.492702Z","title":"Yichao Fu, Peter Bailis, Ion Stoica, and Hao Zhang","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24260","last_updated":"2026-07-27T10:51:38Z","snapshot_observed_at":"2026-08-10T17:55:07.029281Z","submitted_at":"2026-07-27T10:51:38Z","title":"KAP: Bridging the Knowledge Selection-Runtime Consumption Gap in LLM Systems","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-31T19:52:40.492702Z"},"links":{"citing_paper":"/paper/2607.24260"},"observation_digest":"sha256:1a4da2e974891195b9ad84399ab35bd328307a697acb2edbf8c2ae724f6c34c0","observation_id":"34347e60-cbd2-40fc-8644-63b2e00726cf","resolution":{"observed_at":"2026-07-31T19:52:40.492702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02057","last_updated":"2024-02-03T06:37:50Z","snapshot_observed_at":"2026-08-13T04:27:52.352114Z","submitted_at":"2024-02-03T06:37:50Z","title":"Break the Sequential Dependency of LLM Inference Using Lookahead Decoding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02057","snapshot_observed_at":"2026-07-31T19:52:40.513351Z","title":"Kelvin Guu, Kenton Lee, Zora Tung, Panupong Pasupat, and Ming-Wei Chang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24260","last_updated":"2026-07-27T10:51:38Z","snapshot_observed_at":"2026-08-10T17:55:07.029281Z","submitted_at":"2026-07-27T10:51:38Z","title":"KAP: Bridging the Knowledge Selection-Runtime Consumption Gap in LLM Systems","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-31T19:52:40.513351Z"},"links":{"cited_paper":"/paper/2402.02057","citing_paper":"/paper/2607.24260"},"observation_digest":"sha256:e454931b9f5054e2dad0f938b5aee90911ddc0081de391dc2cd757aba372e64a","observation_id":"cfb1070d-3e61-4d60-8d5d-1a763a6b9243","resolution":{"observed_at":"2026-07-31T19:52:40.513351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02490","last_updated":"2024-10-30T14:53:22Z","snapshot_observed_at":"2026-08-12T23:30:11.201041Z","submitted_at":"2024-07-02T17:59:56Z","title":"MInference 1.0: Accelerating Pre-filling for Long-Context LLMs via Dynamic Sparse Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02490","snapshot_observed_at":"2026-07-31T19:52:40.866676Z","title":"Huiqiang Jiang, Yucheng Li, Chengruidong Zhang, Qianhui Wu, Xufang Luo, Surin Ahn, Zhenhua Han, Amir H","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24260","last_updated":"2026-07-27T10:51:38Z","snapshot_observed_at":"2026-08-10T17:55:07.029281Z","submitted_at":"2026-07-27T10:51:38Z","title":"KAP: Bridging the Knowledge Selection-Runtime Consumption Gap in LLM Systems","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-31T19:52:40.866676Z"},"links":{"cited_paper":"/paper/2407.02490","citing_paper":"/paper/2607.24260"},"observation_digest":"sha256:945ba31f44ef37dc4d0bb22cfd7a0287157c97b02b1a72456f704e59f3ecd976","observation_id":"8f387e1f-e50b-47f9-88e7-abfa0bf8fff3","resolution":{"observed_at":"2026-07-31T19:52:40.866676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14649","last_updated":"2025-03-21T17:51:53Z","snapshot_observed_at":"2026-08-15T10:56:13.275235Z","submitted_at":"2025-03-18T18:58:13Z","title":"RAGO: Systematic Performance Optimization for Retrieval-Augmented Generation Serving","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14649","snapshot_observed_at":"2026-07-31T19:52:41.036453Z","title":"Bernal Jimenez Gutierrez, Yiheng Shu, Yu Gu, Michihiro Yasunaga, and Yu Su","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24260","last_updated":"2026-07-27T10:51:38Z","snapshot_observed_at":"2026-08-10T17:55:07.029281Z","submitted_at":"2026-07-27T10:51:38Z","title":"KAP: Bridging the Knowledge Selection-Runtime Consumption Gap in LLM Systems","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-31T19:52:41.036453Z"},"links":{"cited_paper":"/paper/2503.14649","citing_paper":"/paper/2607.24260"},"observation_digest":"sha256:a8ea61c0d8d70a505a82019b48a257fa05f969a0af61c3ab965e538653fee8c9","observation_id":"e0fba4fa-d97a-4697-8d0d-772e88700e21","resolution":{"observed_at":"2026-07-31T19:52:41.036453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14831","last_updated":"2025-01-14T16:17:49Z","snapshot_observed_at":"2026-08-14T10:34:03.225184Z","submitted_at":"2024-05-23T17:47:55Z","title":"HippoRAG: Neurobiologically Inspired Long-Term Memory for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14831","snapshot_observed_at":"2026-07-31T19:52:41.198924Z","title":"Chao Jin, Zili Zhang, Xuanlin Jiang, Fangyue Liu, Xin Liu, Xuanzhe Liu, and Xin Jin","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24260","last_updated":"2026-07-27T10:51:38Z","snapshot_observed_at":"2026-08-10T17:55:07.029281Z","submitted_at":"2026-07-27T10:51:38Z","title":"KAP: Bridging the Knowledge Selection-Runtime Consumption Gap in LLM Systems","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-31T19:52:41.198924Z"},"links":{"cited_paper":"/paper/2405.14831","citing_paper":"/paper/2607.24260"},"observation_digest":"sha256:902ec76097375de6c0bf7fb27104fd13be49e7397af50881a93beaf44575984f","observation_id":"b7ad40f3-f234-414a-9187-aa54b68363f6","resolution":{"observed_at":"2026-07-31T19:52:41.198924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12457","last_updated":"2024-04-25T06:47:57Z","snapshot_observed_at":"2026-08-14T10:51:23.584474Z","submitted_at":"2024-04-18T18:32:30Z","title":"RAGCache: Efficient Knowledge Caching for Retrieval-Augmented Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12457","snapshot_observed_at":"2026-07-31T19:52:41.311484Z","title":"Vladimir Karpukhin, Barlas O ˘guz, Sewon Min, Patrick Lewis, Ledell Wu, Sergey Edunov, Danqi Chen, and Wen-tau Yih","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.24260","last_updated":"2026-07-27T10:51:38Z","snapshot_observed_at":"2026-08-10T17:55:07.029281Z","submitted_at":"2026-07-27T10:51:38Z","title":"KAP: Bridging the Knowledge Selection-Runtime Consumption Gap in LLM Systems","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-31T19:52:41.311484Z"},"links":{"cited_paper":"/paper/2404.12457","citing_paper":"/paper/2607.24260"},"observation_digest":"sha256:d7720ca8c8e4057db185d5e6f5afce2111f7818cf917b9e83dde61a33ed877af","observation_id":"e82ca0f9-5e10-4282-8839-84d60ebae099","resolution":{"observed_at":"2026-07-31T19:52:41.311484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T19:52:41.581564Z","title":"Yaniv Leviathan, Matan Kalman, and Yossi Matias","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24260","last_updated":"2026-07-27T10:51:38Z","snapshot_observed_at":"2026-08-10T17:55:07.029281Z","submitted_at":"2026-07-27T10:51:38Z","title":"KAP: Bridging the Knowledge Selection-Runtime Consumption Gap in LLM Systems","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-31T19:52:41.581564Z"},"links":{"citing_paper":"/paper/2607.24260"},"observation_digest":"sha256:9c238baacde3fb2d4e9b63dad151bd97129d82515b7316e4223570977070c5ed","observation_id":"6c3693d2-6bc8-4e24-bd51-c0a684580705","resolution":{"observed_at":"2026-07-31T19:52:41.581564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11401","last_updated":"2021-04-12T15:42:18Z","snapshot_observed_at":"2026-08-07T05:44:30.677502Z","submitted_at":"2020-05-22T21:34:34Z","title":"Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.11401","snapshot_observed_at":"2026-07-31T19:52:41.696779Z","title":"Yucheng Li, Bo Dong, Frank Guerin, and Chenghua Lin","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2607.24260","last_updated":"2026-07-27T10:51:38Z","snapshot_observed_at":"2026-08-10T17:55:07.029281Z","submitted_at":"2026-07-27T10:51:38Z","title":"KAP: Bridging the Knowledge Selection-Runtime Consumption Gap in LLM Systems","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-31T19:52:41.696779Z"},"links":{"cited_paper":"/paper/2005.11401","citing_paper":"/paper/2607.24260"},"observation_digest":"sha256:21086cec12404f2a7afd4bfb1536352affac01f6e2571b06a419c53d3033ed61","observation_id":"0ec26a91-76f4-4783-adf2-ff458a971912","resolution":{"observed_at":"2026-07-31T19:52:41.696779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14469","last_updated":"2024-06-17T03:01:58Z","snapshot_observed_at":"2026-08-14T12:21:04.886717Z","submitted_at":"2024-04-22T17:42:58Z","title":"SnapKV: LLM Knows What You are Looking for Before Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14469","snapshot_observed_at":"2026-07-31T19:52:41.850581Z","title":"emnlp-main.391/","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24260","last_updated":"2026-07-27T10:51:38Z","snapshot_observed_at":"2026-08-10T17:55:07.029281Z","submitted_at":"2026-07-27T10:51:38Z","title":"KAP: Bridging the Knowledge Selection-Runtime Consumption Gap in LLM Systems","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-31T19:52:41.850581Z"},"links":{"cited_paper":"/paper/2404.14469","citing_paper":"/paper/2607.24260"},"observation_digest":"sha256:296f53c00ea526037ea86de6113f320e33696f926c1ca024dcaae3ac80353151","observation_id":"f74a3802-9cce-4e40-9636-bc42af1ea502","resolution":{"observed_at":"2026-07-31T19:52:41.850581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T19:52:42.016565Z","title":"Songshuo Lu, Hua Wang, Yutian Rong, Zhi Chen, and Yaohua Tang","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24260","last_updated":"2026-07-27T10:51:38Z","snapshot_observed_at":"2026-08-10T17:55:07.029281Z","submitted_at":"2026-07-27T10:51:38Z","title":"KAP: Bridging the Knowledge Selection-Runtime Consumption Gap in LLM Systems","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-31T19:52:42.016565Z"},"links":{"citing_paper":"/paper/2607.24260"},"observation_digest":"sha256:798731aff9636fc100a256e6e5496138829c93035df5950f3837022a0015b258","observation_id":"e18389ed-4d33-43e7-8afe-8a5b3dc9a772","resolution":{"observed_at":"2026-07-31T19:52:42.016565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T19:52:42.120942Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24260","last_updated":"2026-07-27T10:51:38Z","snapshot_observed_at":"2026-08-10T17:55:07.029281Z","submitted_at":"2026-07-27T10:51:38Z","title":"KAP: Bridging the Knowledge Selection-Runtime Consumption Gap in LLM Systems","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-31T19:52:42.120942Z"},"links":{"citing_paper":"/paper/2607.24260"},"observation_digest":"sha256:3cf4902525defccc13c5e6ac2461cbf8bbf55307636271d75dcb0a3d6c7fc581","observation_id":"62ef5918-1bb6-4586-933e-4da46e1d321c","resolution":{"observed_at":"2026-07-31T19:52:42.120942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T19:52:42.272398Z","title":"18 Reiner Pope, Sholto Douglas, Aakanksha Chowdhery, Jacob Devlin, James Bradbury, Anselm Levskaya, Jonathan Heek, Kefan Xiao, Shivani Agrawal, and Jeff Dean","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24260","last_updated":"2026-07-27T10:51:38Z","snapshot_observed_at":"2026-08-10T17:55:07.029281Z","submitted_at":"2026-07-27T10:51:38Z","title":"KAP: Bridging the Knowledge Selection-Runtime Consumption Gap in LLM Systems","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-31T19:52:42.272398Z"},"links":{"citing_paper":"/paper/2607.24260"},"observation_digest":"sha256:336432a952bfcd041af5b17fa803d76a5583eade8bf5e1c6f2b111d2cb14a362","observation_id":"6d5067ba-5810-409b-a479-a91571cfe6b7","resolution":{"observed_at":"2026-07-31T19:52:42.272398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05102","last_updated":"2022-11-09T18:50:38Z","snapshot_observed_at":"2026-08-14T10:12:46.907688Z","submitted_at":"2022-11-09T18:50:38Z","title":"Efficiently Scaling Transformer Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.05102","snapshot_observed_at":"2026-07-31T19:52:42.278984Z","title":"Ying Sheng, Lianmin Zheng, Binhang Yuan, Zhuohan Li, Max Ryabinin, Beidi Chen, Percy Liang, Christopher Re, Ion Stoica, and Ce Zhang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24260","last_updated":"2026-07-27T10:51:38Z","snapshot_observed_at":"2026-08-10T17:55:07.029281Z","submitted_at":"2026-07-27T10:51:38Z","title":"KAP: Bridging the Knowledge Selection-Runtime Consumption Gap in LLM Systems","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-31T19:52:42.278984Z"},"links":{"cited_paper":"/paper/2211.05102","citing_paper":"/paper/2607.24260"},"observation_digest":"sha256:bd5d80313a9a3e834a38a0dea3190c85c4481d93d440b2e8b87cf9e611253c81","observation_id":"9bcae3a8-d910-4835-b8d0-a087730dd323","resolution":{"observed_at":"2026-07-31T19:52:42.278984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T19:52:42.353442Z","title":"Hanshi Sun, Zhuoming Chen, Xinyu Yang, Yuandong Tian, and Beidi Chen","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24260","last_updated":"2026-07-27T10:51:38Z","snapshot_observed_at":"2026-08-10T17:55:07.029281Z","submitted_at":"2026-07-27T10:51:38Z","title":"KAP: Bridging the Knowledge Selection-Runtime Consumption Gap in LLM Systems","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-31T19:52:42.353442Z"},"links":{"citing_paper":"/paper/2607.24260"},"observation_digest":"sha256:fb022f8fb4adddca1ef0ad1dad710a528ac094c605f2cb41e17ba3c435903c9e","observation_id":"3619d673-6479-49fb-9d44-0689df73651f","resolution":{"observed_at":"2026-07-31T19:52:42.353442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.11912","last_updated":"2024-08-04T00:58:04Z","snapshot_observed_at":"2026-08-13T00:27:40.768040Z","submitted_at":"2024-04-18T05:25:54Z","title":"TriForce: Lossless Acceleration of Long Sequence Generation with Hierarchical Speculative Decoding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.11912","snapshot_observed_at":"2026-07-31T19:52:42.358155Z","title":"Jiaming Tang, Yilong Zhao, Kan Zhu, Guangxuan Xiao, Baris Kasikci, and Song Han","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24260","last_updated":"2026-07-27T10:51:38Z","snapshot_observed_at":"2026-08-10T17:55:07.029281Z","submitted_at":"2026-07-27T10:51:38Z","title":"KAP: Bridging the Knowledge Selection-Runtime Consumption Gap in LLM Systems","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-31T19:52:42.358155Z"},"links":{"cited_paper":"/paper/2404.11912","citing_paper":"/paper/2607.24260"},"observation_digest":"sha256:b2be6b90a600fbe6fd96ea7264e27761ffbe257eb65014ca4194bae4e778a522","observation_id":"a50d6cf9-b693-4e7b-91d3-d5727e8a9b0a","resolution":{"observed_at":"2026-07-31T19:52:42.358155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10774","last_updated":"2024-08-26T21:01:02Z","snapshot_observed_at":"2026-08-14T18:53:06.624928Z","submitted_at":"2024-06-16T01:33:02Z","title":"Quest: Query-Aware Sparsity for Efficient Long-Context LLM Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10774","snapshot_observed_at":"2026-07-31T19:52:42.362436Z","title":"Rishabh Tiwari, Haocheng Xi, Aditya Tomar, Coleman Richard Charles Hooper, Sehoon Kim, Maxwell Horton, Mahyar Najibi, Michael W","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24260","last_updated":"2026-07-27T10:51:38Z","snapshot_observed_at":"2026-08-10T17:55:07.029281Z","submitted_at":"2026-07-27T10:51:38Z","title":"KAP: Bridging the Knowledge Selection-Runtime Consumption Gap in LLM Systems","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-31T19:52:42.362436Z"},"links":{"cited_paper":"/paper/2406.10774","citing_paper":"/paper/2607.24260"},"observation_digest":"sha256:929cbac20ee98ac02f9ea052743eac61480e795465bcab3047b6b5e8a0eaa39d","observation_id":"16a525e8-1aba-45a8-af54-8183b70d9084","resolution":{"observed_at":"2026-07-31T19:52:42.362436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17453","last_updated":"2024-04-07T00:56:53Z","snapshot_observed_at":"2026-08-14T06:01:54.549199Z","submitted_at":"2023-09-29T17:59:56Z","title":"Efficient Streaming Language Models with Attention Sinks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17453","snapshot_observed_at":"2026-07-31T19:52:42.366932Z","title":"Wenhan Xiong, Xiang Li, Srini Iyer, Jingfei Du, Patrick Lewis, William Yang Wang, Yashar Mehdad, Scott Yih, Sebastian Riedel, Douwe Kiela, and Barlas Oguz","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24260","last_updated":"2026-07-27T10:51:38Z","snapshot_observed_at":"2026-08-10T17:55:07.029281Z","submitted_at":"2026-07-27T10:51:38Z","title":"KAP: Bridging the Knowledge Selection-Runtime Consumption Gap in LLM Systems","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-31T19:52:42.366932Z"},"links":{"cited_paper":"/paper/2309.17453","citing_paper":"/paper/2607.24260"},"observation_digest":"sha256:e61f950efc9e4f646743c9a534d39d8fc67d5f0cfa07908c10df77f064460df3","observation_id":"5497a91d-d0c0-4572-ae55-5b44db2e9162","resolution":{"observed_at":"2026-07-31T19:52:42.366932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16444","last_updated":"2025-04-03T22:49:22Z","snapshot_observed_at":"2026-08-12T23:57:54.290846Z","submitted_at":"2024-05-26T06:00:17Z","title":"CacheBlend: Fast Large Language Model Serving for RAG with Cached Knowledge Fusion","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16444","snapshot_observed_at":"2026-07-31T19:52:42.375553Z","title":"Gyeong-In Yu, Joo Seong Jeong, Geon-Woo Kim, Soojeong Kim, and Byung-Gon Chun","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24260","last_updated":"2026-07-27T10:51:38Z","snapshot_observed_at":"2026-08-10T17:55:07.029281Z","submitted_at":"2026-07-27T10:51:38Z","title":"KAP: Bridging the Knowledge Selection-Runtime Consumption Gap in LLM Systems","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-31T19:52:42.375553Z"},"links":{"cited_paper":"/paper/2405.16444","citing_paper":"/paper/2607.24260"},"observation_digest":"sha256:41384150eb56c6c6c267862915026423f1d5de37bfc4ec82ce142271e626ebb6","observation_id":"c5bce959-286f-43d6-9b94-cf8c4e1fa9b2","resolution":{"observed_at":"2026-07-31T19:52:42.375553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-08-06T19:19:02.165567Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14048","snapshot_observed_at":"2026-07-31T19:52:42.379821Z","title":"Lianmin Zheng, Liangsheng Yin, Zhiqiang Xie, Chuyue Sun, Jeff Huang, Cody Hao Yu, Shiyi Cao, Christos Kozyrakis, Ion Stoica, Joseph E","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24260","last_updated":"2026-07-27T10:51:38Z","snapshot_observed_at":"2026-08-10T17:55:07.029281Z","submitted_at":"2026-07-27T10:51:38Z","title":"KAP: Bridging the Knowledge Selection-Runtime Consumption Gap in LLM Systems","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-31T19:52:42.379821Z"},"links":{"cited_paper":"/paper/2306.14048","citing_paper":"/paper/2607.24260"},"observation_digest":"sha256:4efa129775aef2b87c5f4cddbc983a3ae40da2829cc14e249f95ab8de06cf1e1","observation_id":"e8c939d8-4bd1-4484-ab15-52c782c9758d","resolution":{"observed_at":"2026-07-31T19:52:42.379821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-08-11T10:42:54.633244Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-07-31T19:52:42.384440Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24260","last_updated":"2026-07-27T10:51:38Z","snapshot_observed_at":"2026-08-10T17:55:07.029281Z","submitted_at":"2026-07-27T10:51:38Z","title":"KAP: Bridging the Knowledge Selection-Runtime Consumption Gap in LLM Systems","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-31T19:52:42.384440Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2607.24260"},"observation_digest":"sha256:186f60af30b9b490838c664ad8a51830534b70d9bf34ffd302aa242fbcbb84b0","observation_id":"f73a46d3-3366-4c66-a6c8-93850b5d0c9a","resolution":{"observed_at":"2026-07-31T19:52:42.384440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T19:52:41.414223Z","title":"Woosuk Kwon, Zhuohan Li, Siyuan Zhuang, Ying Sheng, Lianmin Zheng, Cody Hao Yu, Joseph Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.24260","last_updated":"2026-07-27T10:51:38Z","snapshot_observed_at":"2026-08-10T17:55:07.029281Z","submitted_at":"2026-07-27T10:51:38Z","title":"KAP: Bridging the Knowledge Selection-Runtime Consumption Gap in LLM Systems","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-07-31T19:52:41.414223Z"},"links":{"citing_paper":"/paper/2607.24260"},"observation_digest":"sha256:9821870294bf783672d044d68e0afb43c08d077ded5562c6651fdb1849100347","observation_id":"f0325d77-2ceb-4a11-ad67-ed19ac16a81b","resolution":{"observed_at":"2026-07-31T19:52:41.414223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T19:52:40.623478Z","title":"Huiqiang Jiang, Qianhui Wu, Chin-Yew Lin, Yuqing Yang, and Lili Qiu","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.24260","last_updated":"2026-07-27T10:51:38Z","snapshot_observed_at":"2026-08-10T17:55:07.029281Z","submitted_at":"2026-07-27T10:51:38Z","title":"KAP: Bridging the Knowledge Selection-Runtime Consumption Gap in LLM Systems","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-07-31T19:52:40.623478Z"},"links":{"citing_paper":"/paper/2607.24260"},"observation_digest":"sha256:9083ce4804617c38df200ea50ae7bd8313673304c506f3d5ddbe18ef85dffc86","observation_id":"d1a744c7-5f3e-4852-a7eb-545009321d18","resolution":{"observed_at":"2026-07-31T19:52:40.623478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1404.2022","last_updated":"2014-04-08T06:50:36Z","snapshot_observed_at":"2026-08-14T23:38:18.454638Z","submitted_at":"2014-04-08T06:50:36Z","title":"Neutrino Production via $e^-e^+$ Collision at $Z$-boson Peak","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1404.2022","snapshot_observed_at":"2026-07-31T19:52:40.082832Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.24260","last_updated":"2026-07-27T10:51:38Z","snapshot_observed_at":"2026-08-10T17:55:07.029281Z","submitted_at":"2026-07-27T10:51:38Z","title":"KAP: Bridging the Knowledge Selection-Runtime Consumption Gap in LLM Systems","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-07-31T19:52:40.082832Z"},"links":{"cited_paper":"/paper/1404.2022","citing_paper":"/paper/2607.24260"},"observation_digest":"sha256:790413ff4a67962179d11e94e67c7684b337d19d385695f4a82b3caf4d393c0a","observation_id":"843ab9aa-e843-44b6-93ca-3270e81d077d","resolution":{"observed_at":"2026-07-31T19:52:40.082832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.01318","last_updated":"2023-02-02T18:44:11Z","snapshot_observed_at":"2026-08-13T23:55:57.074762Z","submitted_at":"2023-02-02T18:44:11Z","title":"Accelerating Large Language Model Decoding with Speculative Sampling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.01318","snapshot_observed_at":"2026-07-31T19:52:40.288142Z","title":"Guanzheng Chen, Qilong Feng, Jinjie Ni, Xin Li, and Michael Qizhe Shieh","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24260","last_updated":"2026-07-27T10:51:38Z","snapshot_observed_at":"2026-08-10T17:55:07.029281Z","submitted_at":"2026-07-27T10:51:38Z","title":"KAP: Bridging the Knowledge Selection-Runtime Consumption Gap in LLM Systems","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-07-31T19:52:40.288142Z"},"links":{"cited_paper":"/paper/2302.01318","citing_paper":"/paper/2607.24260"},"observation_digest":"sha256:f97bf6fea99ff3f3c509aa866929a97a40493fd844d6633574a6e4290287b6ba","observation_id":"4e223952-5305-451c-8b88-2c7a710f2c02","resolution":{"observed_at":"2026-07-31T19:52:40.288142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10774","last_updated":"2024-06-14T23:32:32Z","snapshot_observed_at":"2026-07-06T17:17:56.276857Z","submitted_at":"2024-01-19T15:48:40Z","title":"Medusa: Simple LLM Inference Acceleration Framework with Multiple Decoding Heads","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10774","snapshot_observed_at":"2026-07-31T19:52:40.163554Z","title":"16 Zefan Cai, Yichi Zhang, Bofei Gao, Yuliang Liu, Yucheng Li, Tianyu Liu, Keming Lu, Wayne Xiong, Yue Dong, Junjie Hu, and Wen Xiao","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24260","last_updated":"2026-07-27T10:51:38Z","snapshot_observed_at":"2026-08-10T17:55:07.029281Z","submitted_at":"2026-07-27T10:51:38Z","title":"KAP: Bridging the Knowledge Selection-Runtime Consumption Gap in LLM Systems","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-07-31T19:52:40.163554Z"},"links":{"cited_paper":"/paper/2401.10774","citing_paper":"/paper/2607.24260"},"observation_digest":"sha256:c1ce3cff18e971a2fde445ffa0754eca177c1ee436448dafef0963fa071cde07","observation_id":"0456cfa6-5983-491f-a644-272d4674dd63","resolution":{"observed_at":"2026-07-31T19:52:40.163554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.24260","last_updated":"2026-07-27T10:51:38Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-10T17:55:07.029281Z","submitted_at":"2026-07-27T10:51:38Z","title":"KAP: Bridging the Knowledge Selection-Runtime Consumption Gap in LLM Systems"},"reference_resolution":{"displayed":26,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":26},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 26 of 26 outbound references and 0 inbound Pith citation observations for arXiv:2607.24260."}