{"as_of":"2026-08-20T04:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6b4453fd625364d82b26f9ef15adf37cbf2dc3216b010bffdeb2fdcc5224bf7c","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":24,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":24,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":24,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T00:27:45.534694Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":12,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2311.04934","last_updated":"2024-04-25T15:45:19Z","snapshot_observed_at":"2026-08-18T21:38:48.895755Z","submitted_at":"2023-11-07T18:17:05Z","title":"Prompt Cache: Modular Attention Reuse for Low-Latency Inference","version":2},"cited_work":{"arxiv_id":"2311.04934","doi":"10.48550/arxiv.2311.04934","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.04934","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Prompt cache: Modular attention reuse for low-latency inference","venue":"arXiv (Cornell University)","work_id":"afbbfafd-6a60-4022-83bf-378314908161","year":2024},"citing_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-08-18T16:18:58.765617Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-12T08:20:01.011625Z"},"links":{"cited_paper":"/paper/2311.04934","citing_paper":"/paper/2312.07104"},"observation_digest":"sha256:84f3a183e206aff7355ae821eee18b5dbd675c094db91ab6b5d87501445bb996","observation_id":"dd159a32-1bc2-4141-8132-23950eee6907","resolution":{"observed_at":"2026-05-12T08:20:01.060678Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04934","last_updated":"2024-04-25T15:45:19Z","snapshot_observed_at":"2026-08-18T21:38:48.895755Z","submitted_at":"2023-11-07T18:17:05Z","title":"Prompt Cache: Modular Attention Reuse for Low-Latency Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04934","snapshot_observed_at":"2026-08-11T15:45:23.028887Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15246","last_updated":"2024-12-14T06:47:56Z","snapshot_observed_at":"2026-08-19T22:53:56.519598Z","submitted_at":"2024-12-14T06:47:56Z","title":"Accelerating Retrieval-Augmented Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T15:45:23.028887Z"},"links":{"cited_paper":"/paper/2311.04934","citing_paper":"/paper/2412.15246"},"observation_digest":"sha256:31b1d00b97b6ced7a4df9e9f777428cabd1bf47dc1084d67f73b832ee739bce6","observation_id":"faa06f4f-055a-4740-b990-f77bbe3509f4","resolution":{"observed_at":"2026-08-11T15:45:23.028887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04934","last_updated":"2024-04-25T15:45:19Z","snapshot_observed_at":"2026-08-18T21:38:48.895755Z","submitted_at":"2023-11-07T18:17:05Z","title":"Prompt Cache: Modular Attention Reuse for Low-Latency Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04934","snapshot_observed_at":"2026-08-09T20:45:51.269548Z","title":"org/CorpusID:54457299","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2501.19300","last_updated":"2025-05-29T03:11:10Z","snapshot_observed_at":"2026-08-17T15:18:52.232222Z","submitted_at":"2025-01-31T16:56:18Z","title":"Offline Learning for Combinatorial Multi-armed Bandits","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-09T20:45:51.269548Z"},"links":{"cited_paper":"/paper/2311.04934","citing_paper":"/paper/2501.19300"},"observation_digest":"sha256:04b9fa959d84fc0368f07c13e98ba9bc02755b6a19c3e600373ab6e53aaec3d0","observation_id":"f5c29039-d30e-42c7-8632-b2361c11eb78","resolution":{"observed_at":"2026-08-09T20:45:51.269548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04934","last_updated":"2024-04-25T15:45:19Z","snapshot_observed_at":"2026-08-18T21:38:48.895755Z","submitted_at":"2023-11-07T18:17:05Z","title":"Prompt Cache: Modular Attention Reuse for Low-Latency Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04934","snapshot_observed_at":"2026-08-15T21:10:19.864940Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.10640","last_updated":"2025-06-02T20:08:34Z","snapshot_observed_at":"2026-08-18T09:36:23.346739Z","submitted_at":"2025-05-15T18:22:45Z","title":"The Hitchhikers Guide to Production-ready Trustworthy Foundation Model powered Software (FMware)","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T21:10:19.864940Z"},"links":{"cited_paper":"/paper/2311.04934","citing_paper":"/paper/2505.10640"},"observation_digest":"sha256:8251c9837b19b84a444fcb31cb030d98c561bceb23eebace1c83e51e75459c16","observation_id":"e53a4bae-80f1-46c9-b5d3-d5a35ebd824d","resolution":{"observed_at":"2026-08-15T21:10:19.864940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04934","last_updated":"2024-04-25T15:45:19Z","snapshot_observed_at":"2026-08-18T21:38:48.895755Z","submitted_at":"2023-11-07T18:17:05Z","title":"Prompt Cache: Modular Attention Reuse for Low-Latency Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04934","snapshot_observed_at":"2026-08-15T20:58:47.904448Z","title":"Prompt cache: Modular attention reuse for low-latency inference","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11271","last_updated":"2025-05-16T14:04:31Z","snapshot_observed_at":"2026-08-18T17:14:31.943828Z","submitted_at":"2025-05-16T14:04:31Z","title":"Semantic Caching of Contextual Summaries for Efficient Question-Answering with Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T20:58:47.904448Z"},"links":{"cited_paper":"/paper/2311.04934","citing_paper":"/paper/2505.11271"},"observation_digest":"sha256:057b4d170807ed2884d3d14b61c50756c50debd8470116439ba5f1fd9e873135","observation_id":"16ed6f4d-bfae-4ca9-baa0-85949ef8450c","resolution":{"observed_at":"2026-08-15T20:58:47.904448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04934","last_updated":"2024-04-25T15:45:19Z","snapshot_observed_at":"2026-08-18T21:38:48.895755Z","submitted_at":"2023-11-07T18:17:05Z","title":"Prompt Cache: Modular Attention Reuse for Low-Latency Inference","version":2},"cited_work":{"arxiv_id":"2311.04934","doi":"10.48550/arxiv.2311.04934","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.04934","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Prompt cache: Modular attention reuse for low-latency inference","venue":"arXiv (Cornell University)","work_id":"afbbfafd-6a60-4022-83bf-378314908161","year":2024},"citing_paper":{"arxiv_id":"2602.09725","last_updated":"2026-05-12T14:12:11Z","snapshot_observed_at":"2026-08-11T13:19:39.209270Z","submitted_at":"2026-02-10T12:29:02Z","title":"Efficient Remote KV Cache Reuse with GPU-native Video Codec","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:04.555356Z"},"links":{"cited_paper":"/paper/2311.04934","citing_paper":"/paper/2602.09725"},"observation_digest":"sha256:6fe92421b083aa326ffdcbfcc9289175a4e43c4fa1465d3494c7d6e0df0910ed","observation_id":"0963909e-d08c-4d8d-a699-ec5caa12d701","resolution":{"observed_at":"2026-05-16T05:22:22.751793Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04934","last_updated":"2024-04-25T15:45:19Z","snapshot_observed_at":"2026-08-18T21:38:48.895755Z","submitted_at":"2023-11-07T18:17:05Z","title":"Prompt Cache: Modular Attention Reuse for Low-Latency Inference","version":2},"cited_work":{"arxiv_id":"2311.04934","doi":"10.48550/arxiv.2311.04934","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.04934","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Prompt cache: Modular attention reuse for low-latency inference","venue":"arXiv (Cornell University)","work_id":"afbbfafd-6a60-4022-83bf-378314908161","year":2024},"citing_paper":{"arxiv_id":"2603.10726","last_updated":"2026-05-20T10:27:28Z","snapshot_observed_at":"2026-08-16T00:06:10.598472Z","submitted_at":"2026-03-11T12:59:12Z","title":"PrefixWall: Mitigating Prefix Caching Side Channels in Shared LLM Systems","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-21T12:14:09.509302Z"},"links":{"cited_paper":"/paper/2311.04934","citing_paper":"/paper/2603.10726"},"observation_digest":"sha256:76934cbfc7b7f89a8b06d8aded25fccb34e2ce65e7e28620b69237dac5070f43","observation_id":"92fa110f-13f9-48be-b398-b59bb357c2cb","resolution":{"observed_at":"2026-05-21T12:15:06.759644Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04934","last_updated":"2024-04-25T15:45:19Z","snapshot_observed_at":"2026-08-18T21:38:48.895755Z","submitted_at":"2023-11-07T18:17:05Z","title":"Prompt Cache: Modular Attention Reuse for Low-Latency Inference","version":2},"cited_work":{"arxiv_id":"2311.04934","doi":"10.48550/arxiv.2311.04934","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.04934","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Prompt cache: Modular attention reuse for low-latency inference","venue":"arXiv (Cornell University)","work_id":"afbbfafd-6a60-4022-83bf-378314908161","year":2024},"citing_paper":{"arxiv_id":"2604.16864","last_updated":"2026-08-17T11:03:28Z","snapshot_observed_at":"2026-08-20T04:15:45.392233Z","submitted_at":"2026-04-18T06:28:21Z","title":"HieraSparse: Hierarchical Semi-Structured Sparse KV Attention","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-10T07:15:19.184970Z"},"links":{"cited_paper":"/paper/2311.04934","citing_paper":"/paper/2604.16864"},"observation_digest":"sha256:9070a67a704ba8579edbd22b02b88b880b3007bbd67b022070db1b821194a13b","observation_id":"2a2e0a21-0aea-4f25-ba68-87e6aa32af2d","resolution":{"observed_at":"2026-05-10T07:16:54.115010Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04934","last_updated":"2024-04-25T15:45:19Z","snapshot_observed_at":"2026-08-18T21:38:48.895755Z","submitted_at":"2023-11-07T18:17:05Z","title":"Prompt Cache: Modular Attention Reuse for Low-Latency Inference","version":2},"cited_work":{"arxiv_id":"2311.04934","doi":"10.48550/arxiv.2311.04934","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.04934","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Prompt cache: Modular attention reuse for low-latency inference","venue":"arXiv (Cornell University)","work_id":"afbbfafd-6a60-4022-83bf-378314908161","year":2024},"citing_paper":{"arxiv_id":"2604.20021","last_updated":"2026-04-21T21:56:43Z","snapshot_observed_at":"2026-08-15T06:44:58.110677Z","submitted_at":"2026-04-21T21:56:43Z","title":"Continuous Semantic Caching for Low-Cost LLM Serving","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T02:32:28.923367Z"},"links":{"cited_paper":"/paper/2311.04934","citing_paper":"/paper/2604.20021"},"observation_digest":"sha256:82d27cc5b4b596607815f69422fc40d27adb1a1dfe57e18a080233291c19cf75","observation_id":"bd4add9d-645e-4228-a9c8-d058c812b0d9","resolution":{"observed_at":"2026-05-11T13:01:03.329620Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04934","last_updated":"2024-04-25T15:45:19Z","snapshot_observed_at":"2026-08-18T21:38:48.895755Z","submitted_at":"2023-11-07T18:17:05Z","title":"Prompt Cache: Modular Attention Reuse for Low-Latency Inference","version":2},"cited_work":{"arxiv_id":"2311.04934","doi":"10.48550/arxiv.2311.04934","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.04934","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Prompt cache: Modular attention reuse for low-latency inference","venue":"arXiv (Cornell University)","work_id":"afbbfafd-6a60-4022-83bf-378314908161","year":2024},"citing_paper":{"arxiv_id":"2605.11232","last_updated":"2026-05-11T20:47:41Z","snapshot_observed_at":"2026-08-15T04:45:50.146323Z","submitted_at":"2026-05-11T20:47:41Z","title":"Rethinking LLMOps for Fraud and AML: Building a Compliance-Grade LLM Serving Stack","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-13T02:11:18.259161Z"},"links":{"cited_paper":"/paper/2311.04934","citing_paper":"/paper/2605.11232"},"observation_digest":"sha256:a117427b721c97fbcf4a6d0beae4d758ba1f44607fe1ba1a01dce7801a53f8f6","observation_id":"b3ac640f-1592-41ff-baf2-0a54928892e1","resolution":{"observed_at":"2026-05-13T02:12:07.117712Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04934","last_updated":"2024-04-25T15:45:19Z","snapshot_observed_at":"2026-08-18T21:38:48.895755Z","submitted_at":"2023-11-07T18:17:05Z","title":"Prompt Cache: Modular Attention Reuse for Low-Latency Inference","version":2},"cited_work":{"arxiv_id":"2311.04934","doi":"10.48550/arxiv.2311.04934","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.04934","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Prompt cache: Modular attention reuse for low-latency inference","venue":"arXiv (Cornell University)","work_id":"afbbfafd-6a60-4022-83bf-378314908161","year":2024},"citing_paper":{"arxiv_id":"2605.30613","last_updated":"2026-05-28T22:06:54Z","snapshot_observed_at":"2026-08-17T01:07:47.305172Z","submitted_at":"2026-05-28T22:06:54Z","title":"CacheProbe: Auditing Prompt Cache Isolation in Gateway APIs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T06:22:28.511930Z"},"links":{"cited_paper":"/paper/2311.04934","citing_paper":"/paper/2605.30613"},"observation_digest":"sha256:ae6efc23800c82956adbf6f5b633d6a49068db6fb84179a7489add18c87433c6","observation_id":"c60f87ed-cae7-406e-aecf-459bebd1366a","resolution":{"observed_at":"2026-06-29T06:23:08.727622Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04934","last_updated":"2024-04-25T15:45:19Z","snapshot_observed_at":"2026-08-18T21:38:48.895755Z","submitted_at":"2023-11-07T18:17:05Z","title":"Prompt Cache: Modular Attention Reuse for Low-Latency Inference","version":2},"cited_work":{"arxiv_id":"2311.04934","doi":"10.48550/arxiv.2311.04934","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.04934","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Prompt cache: Modular attention reuse for low-latency inference","venue":"arXiv (Cornell University)","work_id":"afbbfafd-6a60-4022-83bf-378314908161","year":2024},"citing_paper":{"arxiv_id":"2606.01502","last_updated":"2026-05-31T23:53:24Z","snapshot_observed_at":"2026-08-13T17:07:29.514916Z","submitted_at":"2026-05-31T23:53:24Z","title":"Move the Query, Not the Cache: Characterizing Cross-Instance Latent Attention Redistribution Across GPU Fabrics","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T16:02:53.294235Z"},"links":{"cited_paper":"/paper/2311.04934","citing_paper":"/paper/2606.01502"},"observation_digest":"sha256:e8c96d11e13f8f77273e8cb6907a6a135fa64d1b72ad47cbf940250e3fa71606","observation_id":"bfaf9d39-e4d1-4421-be0b-24ae52176da5","resolution":{"observed_at":"2026-07-01T21:56:15.724672Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04934","last_updated":"2024-04-25T15:45:19Z","snapshot_observed_at":"2026-08-18T21:38:48.895755Z","submitted_at":"2023-11-07T18:17:05Z","title":"Prompt Cache: Modular Attention Reuse for Low-Latency Inference","version":2},"cited_work":{"arxiv_id":"2311.04934","doi":"10.48550/arxiv.2311.04934","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.04934","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Prompt cache: Modular attention reuse for low-latency inference","venue":"arXiv (Cornell University)","work_id":"afbbfafd-6a60-4022-83bf-378314908161","year":2024},"citing_paper":{"arxiv_id":"2606.09441","last_updated":"2026-06-08T12:50:13Z","snapshot_observed_at":"2026-08-15T01:11:56.604097Z","submitted_at":"2026-06-08T12:50:13Z","title":"SIFT: Selective-Index For Fast Compute of RAG Prefill by Exploiting Attention Invariance","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-27T16:24:31.109508Z"},"links":{"cited_paper":"/paper/2311.04934","citing_paper":"/paper/2606.09441"},"observation_digest":"sha256:52ddb67b96e11f1034a12e191178274a1a7e3b4d9c12e8c8158e5e4c22728e9e","observation_id":"85dadf70-ad99-4a12-bbfd-c82eb014cff8","resolution":{"observed_at":"2026-07-03T01:37:31.262604Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04934","last_updated":"2024-04-25T15:45:19Z","snapshot_observed_at":"2026-08-18T21:38:48.895755Z","submitted_at":"2023-11-07T18:17:05Z","title":"Prompt Cache: Modular Attention Reuse for Low-Latency Inference","version":2},"cited_work":{"arxiv_id":"2311.04934","doi":"10.48550/arxiv.2311.04934","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.04934","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Prompt cache: Modular attention reuse for low-latency inference","venue":"arXiv (Cornell University)","work_id":"afbbfafd-6a60-4022-83bf-378314908161","year":2024},"citing_paper":{"arxiv_id":"2606.13126","last_updated":"2026-06-11T09:51:36Z","snapshot_observed_at":"2026-08-12T17:45:43.488699Z","submitted_at":"2026-06-11T09:51:36Z","title":"MiniPIC: Flexible Position-Independent Caching in <100LOC","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-27T07:12:45.449658Z"},"links":{"cited_paper":"/paper/2311.04934","citing_paper":"/paper/2606.13126"},"observation_digest":"sha256:ce3321bcd8f745780f91dd720534bbc16ef40ae40362f5e50ed3a44f37890061","observation_id":"37c68cb6-0a91-4c8a-87bd-31d350c349f0","resolution":{"observed_at":"2026-06-27T07:20:42.194167Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04934","last_updated":"2024-04-25T15:45:19Z","snapshot_observed_at":"2026-08-18T21:38:48.895755Z","submitted_at":"2023-11-07T18:17:05Z","title":"Prompt Cache: Modular Attention Reuse for Low-Latency Inference","version":2},"cited_work":{"arxiv_id":"2311.04934","doi":"10.48550/arxiv.2311.04934","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.04934","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Prompt cache: Modular attention reuse for low-latency inference","venue":"arXiv (Cornell University)","work_id":"afbbfafd-6a60-4022-83bf-378314908161","year":2024},"citing_paper":{"arxiv_id":"2606.20537","last_updated":"2026-06-18T17:49:36Z","snapshot_observed_at":"2026-08-13T13:46:08.665911Z","submitted_at":"2026-06-18T17:49:36Z","title":"Execution-State Capsules: Graph-Bound Execution-State Checkpoint and Restore for Low-Latency, Small-Batch, On-Device Physical-AI Serving","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-26T17:39:47.477338Z"},"links":{"cited_paper":"/paper/2311.04934","citing_paper":"/paper/2606.20537"},"observation_digest":"sha256:ac5e8884b0ef9ccbed38a4903c29972b245716b93c02fcd5a629d4b77cba5e0c","observation_id":"a4ce376b-a86c-4d18-8d68-2843cdf4baaa","resolution":{"observed_at":"2026-07-04T03:49:29.942545Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04934","last_updated":"2024-04-25T15:45:19Z","snapshot_observed_at":"2026-08-18T21:38:48.895755Z","submitted_at":"2023-11-07T18:17:05Z","title":"Prompt Cache: Modular Attention Reuse for Low-Latency Inference","version":2},"cited_work":{"arxiv_id":"2311.04934","doi":"10.48550/arxiv.2311.04934","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.04934","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Prompt cache: Modular attention reuse for low-latency inference","venue":"arXiv (Cornell University)","work_id":"afbbfafd-6a60-4022-83bf-378314908161","year":2024},"citing_paper":{"arxiv_id":"2606.21676","last_updated":"2026-06-19T18:32:44Z","snapshot_observed_at":"2026-08-12T17:46:36.292151Z","submitted_at":"2026-06-19T18:32:44Z","title":"CRAwLeR -- Cross-Reference Aware Legal Retrieval","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-26T12:37:33.877749Z"},"links":{"cited_paper":"/paper/2311.04934","citing_paper":"/paper/2606.21676"},"observation_digest":"sha256:9f2b7a6edd3a14631baabfa72731763c803ba006eb6f4c4154933539c8a76461","observation_id":"26caed26-3309-46d9-89ef-878ff58d3e8a","resolution":{"observed_at":"2026-07-04T07:49:39.642868Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04934","last_updated":"2024-04-25T15:45:19Z","snapshot_observed_at":"2026-08-18T21:38:48.895755Z","submitted_at":"2023-11-07T18:17:05Z","title":"Prompt Cache: Modular Attention Reuse for Low-Latency Inference","version":2},"cited_work":{"arxiv_id":"2311.04934","doi":"10.48550/arxiv.2311.04934","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.04934","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Prompt cache: Modular attention reuse for low-latency inference","venue":"arXiv (Cornell University)","work_id":"afbbfafd-6a60-4022-83bf-378314908161","year":2024},"citing_paper":{"arxiv_id":"2606.26924","last_updated":"2026-06-25T12:02:18Z","snapshot_observed_at":"2026-08-17T03:46:07.556473Z","submitted_at":"2026-06-25T12:02:18Z","title":"A Deterministic Control Plane for LLM Coding Agents","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-06-26T03:58:28.523545Z"},"links":{"cited_paper":"/paper/2311.04934","citing_paper":"/paper/2606.26924"},"observation_digest":"sha256:2bbd51e337e26d9a72fba1579746fec28df8cbf59f8be1a5ba2efb6cad0ebcd6","observation_id":"624a7fda-bf59-4d3b-ac12-10ace44a4d26","resolution":{"observed_at":"2026-06-26T03:58:57.012444Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04934","last_updated":"2024-04-25T15:45:19Z","snapshot_observed_at":"2026-08-18T21:38:48.895755Z","submitted_at":"2023-11-07T18:17:05Z","title":"Prompt Cache: Modular Attention Reuse for Low-Latency Inference","version":2},"cited_work":{"arxiv_id":"2311.04934","doi":"10.48550/arxiv.2311.04934","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.04934","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Prompt cache: Modular attention reuse for low-latency inference","venue":"arXiv (Cornell University)","work_id":"afbbfafd-6a60-4022-83bf-378314908161","year":2024},"citing_paper":{"arxiv_id":"2606.28565","last_updated":"2026-07-02T09:24:03Z","snapshot_observed_at":"2026-08-15T19:19:49.079754Z","submitted_at":"2026-06-26T19:43:38Z","title":"KernelSight-LM: A Kernel-Level LLM Inference Simulator","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-30T00:48:19.207465Z"},"links":{"cited_paper":"/paper/2311.04934","citing_paper":"/paper/2606.28565"},"observation_digest":"sha256:83824046344d9d4b2278956212aeb15d984fa1963c00d36774091e53cd9c534b","observation_id":"93d08a1b-9ecd-4804-b9fc-8f6a1bac1d30","resolution":{"observed_at":"2026-06-30T00:54:06.243600Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04934","last_updated":"2024-04-25T15:45:19Z","snapshot_observed_at":"2026-08-18T21:38:48.895755Z","submitted_at":"2023-11-07T18:17:05Z","title":"Prompt Cache: Modular Attention Reuse for Low-Latency Inference","version":2},"cited_work":{"arxiv_id":"2311.04934","doi":"10.48550/arxiv.2311.04934","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.04934","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Prompt cache: Modular attention reuse for low-latency inference","venue":"arXiv (Cornell University)","work_id":"afbbfafd-6a60-4022-83bf-378314908161","year":2024},"citing_paper":{"arxiv_id":"2606.28565","last_updated":"2026-07-02T09:24:03Z","snapshot_observed_at":"2026-08-15T19:19:49.079754Z","submitted_at":"2026-06-26T19:43:38Z","title":"KernelSight-LM: A Kernel-Level LLM Inference Simulator","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-03T23:09:38.092583Z"},"links":{"cited_paper":"/paper/2311.04934","citing_paper":"/paper/2606.28565"},"observation_digest":"sha256:23d08539ae5e5fe884950926e76d5092064702aff0e1d08f4231abb870293653","observation_id":"32144030-bfe6-4ae6-9006-c298a7780836","resolution":{"observed_at":"2026-07-03T23:19:02.214792Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04934","last_updated":"2024-04-25T15:45:19Z","snapshot_observed_at":"2026-08-18T21:38:48.895755Z","submitted_at":"2023-11-07T18:17:05Z","title":"Prompt Cache: Modular Attention Reuse for Low-Latency Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04934","snapshot_observed_at":"2026-08-02T02:10:49.354541Z","title":"Gemma 4 model card","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14431","last_updated":"2026-07-15T23:55:48Z","snapshot_observed_at":"2026-08-13T04:24:45.805856Z","submitted_at":"2026-07-15T23:55:48Z","title":"Smarter and Cheaper at Once: Byte-Exact KV-Cache Grafting Turns a Frozen Small Model into a Verified-Knowledge Flywheel","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-02T02:10:49.354541Z"},"links":{"cited_paper":"/paper/2311.04934","citing_paper":"/paper/2607.14431"},"observation_digest":"sha256:63424dec249873b418fa33671ac3b5193a2bfece0c8226ec98c38e0a1348ba78","observation_id":"a13ebabe-ba70-4929-aba6-63c486ffc31a","resolution":{"observed_at":"2026-08-02T02:10:49.354541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04934","last_updated":"2024-04-25T15:45:19Z","snapshot_observed_at":"2026-08-18T21:38:48.895755Z","submitted_at":"2023-11-07T18:17:05Z","title":"Prompt Cache: Modular Attention Reuse for Low-Latency Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04934","snapshot_observed_at":"2026-08-01T08:35:41.852997Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21672","last_updated":"2026-07-23T09:19:16Z","snapshot_observed_at":"2026-08-14T07:04:32.409803Z","submitted_at":"2026-07-23T09:19:16Z","title":"Pixels for Programs? A Cross-Provider Case Study of Input-Token Accounting for Source Code as Text and Images","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T08:35:41.852997Z"},"links":{"cited_paper":"/paper/2311.04934","citing_paper":"/paper/2607.21672"},"observation_digest":"sha256:71ab50e3c4a5b14de83682eccb4430396dcd008e402d33ef3d3a7f994cf03582","observation_id":"de1d7fba-23a8-4471-8cb9-b49677e9a0b0","resolution":{"observed_at":"2026-08-01T08:35:41.852997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04934","last_updated":"2024-04-25T15:45:19Z","snapshot_observed_at":"2026-08-18T21:38:48.895755Z","submitted_at":"2023-11-07T18:17:05Z","title":"Prompt Cache: Modular Attention Reuse for Low-Latency Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04934","snapshot_observed_at":"2026-07-30T23:47:57.858093Z","title":"Prompt cache: Modular attention reuse for low-latency inference,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-08-17T13:29:53Z","snapshot_observed_at":"2026-08-20T04:16:57.187649Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.858093Z"},"links":{"cited_paper":"/paper/2311.04934","citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:9d670f893dce8a01376084e590b5c4223fb8ed8d59a26a9f4a90825062742191","observation_id":"0be0343d-266a-43a5-9403-52a7359ec686","resolution":{"observed_at":"2026-07-30T23:47:57.858093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04934","last_updated":"2024-04-25T15:45:19Z","snapshot_observed_at":"2026-08-18T21:38:48.895755Z","submitted_at":"2023-11-07T18:17:05Z","title":"Prompt Cache: Modular Attention Reuse for Low-Latency Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04934","snapshot_observed_at":"2026-08-15T14:37:20.662090Z","title":"Available: https://arxiv.org/abs/2311.04934","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06557","last_updated":"2026-08-06T20:14:21Z","snapshot_observed_at":"2026-08-18T10:40:17.166341Z","submitted_at":"2026-08-06T20:14:21Z","title":"Cascade: Exploiting SLO-Aware latency budget for fair and high goodput LLM inference serving","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-15T14:37:20.662090Z"},"links":{"cited_paper":"/paper/2311.04934","citing_paper":"/paper/2608.06557"},"observation_digest":"sha256:363a8ec6d7d1453bea98fc8548af2440b43e30816fd38bbbe1311fd3f1e87ee3","observation_id":"5490f1a0-917e-4e28-9f39-e4d82775af4e","resolution":{"observed_at":"2026-08-15T14:37:20.662090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04934","last_updated":"2024-04-25T15:45:19Z","snapshot_observed_at":"2026-08-18T21:38:48.895755Z","submitted_at":"2023-11-07T18:17:05Z","title":"Prompt Cache: Modular Attention Reuse for Low-Latency Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04934","snapshot_observed_at":"2026-08-16T00:27:45.534694Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11879","last_updated":"2026-08-12T10:05:29Z","snapshot_observed_at":"2026-08-18T20:39:22.365603Z","submitted_at":"2026-08-12T10:05:29Z","title":"Total Recall at What Cost? Benchmarking the Serving Cost of Agentic Memory Systems","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:45.534694Z"},"links":{"cited_paper":"/paper/2311.04934","citing_paper":"/paper/2608.11879"},"observation_digest":"sha256:5ac15e09f8481b2ce5a1688eb3f73267f25b789e4b81e46039db16943c17f2fe","observation_id":"406282b1-80b3-4997-bf03-855d288ec60d","resolution":{"observed_at":"2026-08-16T00:27:45.534694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2311.04934/citation-record","integrity":"/paper/2311.04934/integrity","json":"/paper/2311.04934/citation-record.json","paper":"/paper/2311.04934"},"outbound":[],"paper":{"arxiv_id":"2311.04934","last_updated":"2024-04-25T15:45:19Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-18T21:38:48.895755Z","submitted_at":"2023-11-07T18:17:05Z","title":"Prompt Cache: Modular Attention Reuse for Low-Latency Inference"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 24 inbound Pith citation observations for arXiv:2311.04934."}