{"as_of":"2026-08-18T17:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b034f6dcda3e77ef05e9e08f5efeae3758881ce42d5cab5240b940d9057d4a5f","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":30,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T11:37:07.674267Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T01:36:44.048156Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2405.12532","last_updated":"2024-06-05T09:01:24Z","snapshot_observed_at":"2026-08-16T13:51:05.375565Z","submitted_at":"2024-05-21T06:46:37Z","title":"PyramidInfer: Pyramid KV Cache Compression for High-throughput LLM Inference","version":2},"cited_work":{"arxiv_id":"2405.12532","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.12532","snapshot_observed_at":"2026-07-10T01:36:44.048156Z","title":"Pyramidinfer: Pyramid kv cache compres- sion for high-throughput llm inference","venue":"cs.CL","work_id":"385e7040-ccf4-4ff5-87de-f50bb44b6374","year":2024},"citing_paper":{"arxiv_id":"2406.02069","last_updated":"2025-05-15T17:18:12Z","snapshot_observed_at":"2026-08-13T04:39:30.300015Z","submitted_at":"2024-06-04T07:51:30Z","title":"PyramidKV: Dynamic KV Cache Compression based on Pyramidal Information Funneling","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-12T09:58:29.057357Z"},"links":{"cited_paper":"/paper/2405.12532","citing_paper":"/paper/2406.02069"},"observation_digest":"sha256:71ca5bb7ea338b89c312f577a8e67811683788f0166e5736294019fc28ff7e08","observation_id":"1d273cea-bb4c-45d8-9942-948c028785f0","resolution":{"observed_at":"2026-05-12T09:58:29.224557Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12532","last_updated":"2024-06-05T09:01:24Z","snapshot_observed_at":"2026-08-16T13:51:05.375565Z","submitted_at":"2024-05-21T06:46:37Z","title":"PyramidInfer: Pyramid KV Cache Compression for High-throughput LLM Inference","version":2},"cited_work":{"arxiv_id":"2405.12532","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.12532","snapshot_observed_at":"2026-07-10T01:36:44.048156Z","title":"Pyramidinfer: Pyramid kv cache compres- sion for high-throughput llm inference","venue":"cs.CL","work_id":"385e7040-ccf4-4ff5-87de-f50bb44b6374","year":2024},"citing_paper":{"arxiv_id":"2410.13846","last_updated":"2026-05-18T05:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-17T17:58:14Z","title":"LightTransfer: Your Long-Context LLM is Secretly a Hybrid Model with Effortless Adaptation","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-23T18:31:35.391674Z"},"links":{"cited_paper":"/paper/2405.12532","citing_paper":"/paper/2410.13846"},"observation_digest":"sha256:f635488598c11df8d940ad2011da466fd17dd3616c8f42870c0c8b356f943771","observation_id":"b3e5f2d2-b669-4ca8-81eb-47de6ea97466","resolution":{"observed_at":"2026-05-23T18:33:19.489905Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12532","last_updated":"2024-06-05T09:01:24Z","snapshot_observed_at":"2026-08-16T13:51:05.375565Z","submitted_at":"2024-05-21T06:46:37Z","title":"PyramidInfer: Pyramid KV Cache Compression for High-throughput LLM Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12532","snapshot_observed_at":"2026-08-12T11:37:07.674267Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18077","last_updated":"2025-06-08T21:23:22Z","snapshot_observed_at":"2026-08-15T19:30:15.609643Z","submitted_at":"2024-11-27T06:10:49Z","title":"MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-12T11:37:07.674267Z"},"links":{"cited_paper":"/paper/2405.12532","citing_paper":"/paper/2411.18077"},"observation_digest":"sha256:cc70a29b2224e68c7d13bb9c72fd951d2179a1874db6a9d08517b055f3a8463d","observation_id":"7ced9945-c15e-4e04-939c-711b8dbb8902","resolution":{"observed_at":"2026-08-12T11:37:07.674267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12532","last_updated":"2024-06-05T09:01:24Z","snapshot_observed_at":"2026-08-16T13:51:05.375565Z","submitted_at":"2024-05-21T06:46:37Z","title":"PyramidInfer: Pyramid KV Cache Compression for High-throughput LLM Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12532","snapshot_observed_at":"2026-08-11T17:24:49.256708Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09036","last_updated":"2024-12-12T07:52:56Z","snapshot_observed_at":"2026-08-17T22:49:01.152893Z","submitted_at":"2024-12-12T07:52:56Z","title":"ZigZagkv: Dynamic KV Cache Compression for Long-context Modeling based on Layer Uncertainty","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T17:24:49.256708Z"},"links":{"cited_paper":"/paper/2405.12532","citing_paper":"/paper/2412.09036"},"observation_digest":"sha256:e449874196b5b7c2c60e4b64a550dcdc9b6b9060805d4c916b79ac54377044c5","observation_id":"06d812ad-d052-4c96-b8a5-43a226a96667","resolution":{"observed_at":"2026-08-11T17:24:49.256708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12532","last_updated":"2024-06-05T09:01:24Z","snapshot_observed_at":"2026-08-16T13:51:05.375565Z","submitted_at":"2024-05-21T06:46:37Z","title":"PyramidInfer: Pyramid KV Cache Compression for High-throughput LLM Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12532","snapshot_observed_at":"2026-08-11T14:25:06.072675Z","title":"InfLLM: Training-Free Long- Context Extrapolation for LLMs with an Efficient Context Memory","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12094","last_updated":"2025-06-02T11:46:43Z","snapshot_observed_at":"2026-08-16T20:57:29.174467Z","submitted_at":"2024-12-16T18:58:57Z","title":"SepLLM: Accelerate Large Language Models by Compressing One Segment into One Separator","version":6},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-11T14:25:06.072675Z"},"links":{"cited_paper":"/paper/2405.12532","citing_paper":"/paper/2412.12094"},"observation_digest":"sha256:766db1005421fd2ce33125b395eee1e0bcf321d872e85a7731c7a285b884d9c6","observation_id":"dcae64ab-e48c-4d7b-98f6-450c255989ef","resolution":{"observed_at":"2026-08-11T14:25:06.072675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12532","last_updated":"2024-06-05T09:01:24Z","snapshot_observed_at":"2026-08-16T13:51:05.375565Z","submitted_at":"2024-05-21T06:46:37Z","title":"PyramidInfer: Pyramid KV Cache Compression for High-throughput LLM Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12532","snapshot_observed_at":"2026-08-11T13:52:48.806959Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12706","last_updated":"2025-02-20T12:14:49Z","snapshot_observed_at":"2026-08-13T11:09:26.001382Z","submitted_at":"2024-12-17T09:20:31Z","title":"More Tokens, Lower Precision: Towards the Optimal Token-Precision Trade-off in KV Cache Compression","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-11T13:52:48.806959Z"},"links":{"cited_paper":"/paper/2405.12532","citing_paper":"/paper/2412.12706"},"observation_digest":"sha256:b92160669d1503d95f356dd43588a5bcee80e091148f319d0fb6f44ebef56e3f","observation_id":"f2ec4fe1-747a-4a2b-8a12-5f7720a90062","resolution":{"observed_at":"2026-08-11T13:52:48.806959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12532","last_updated":"2024-06-05T09:01:24Z","snapshot_observed_at":"2026-08-16T13:51:05.375565Z","submitted_at":"2024-05-21T06:46:37Z","title":"PyramidInfer: Pyramid KV Cache Compression for High-throughput LLM Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12532","snapshot_observed_at":"2026-08-10T21:25:41.251024Z","title":"Pyramidinfer: Pyra- mid kv cache compression for high-throughput llm infer- ence","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04987","last_updated":"2025-05-16T12:32:36Z","snapshot_observed_at":"2026-08-15T18:26:51.078891Z","submitted_at":"2025-01-09T06:00:27Z","title":"TreeKV: Smooth Key-Value Cache Compression with Tree Structures","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T21:25:41.251024Z"},"links":{"cited_paper":"/paper/2405.12532","citing_paper":"/paper/2501.04987"},"observation_digest":"sha256:556fa3705a888d17dd6660b40723592e71eb9eef1b71647b7baae1ad0451ea4b","observation_id":"f328f19a-bac3-4371-a5a2-5be7ba46d374","resolution":{"observed_at":"2026-08-10T21:25:41.251024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12532","last_updated":"2024-06-05T09:01:24Z","snapshot_observed_at":"2026-08-16T13:51:05.375565Z","submitted_at":"2024-05-21T06:46:37Z","title":"PyramidInfer: Pyramid KV Cache Compression for High-throughput LLM Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12532","snapshot_observed_at":"2026-08-10T14:41:05.004324Z","title":"Pyramidinfer: Pyramid kv cache compression for high-throughput llm inference,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15113","last_updated":"2025-01-25T07:28:13Z","snapshot_observed_at":"2026-08-17T15:19:34.445421Z","submitted_at":"2025-01-25T07:28:13Z","title":"Task-KV: Task-aware KV Cache Optimization via Semantic Differentiation of Attention Heads","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T14:41:05.004324Z"},"links":{"cited_paper":"/paper/2405.12532","citing_paper":"/paper/2501.15113"},"observation_digest":"sha256:683710d28458e386941b69744c7f76898a0b7f06dc36ccd7accf6c157c8dc929","observation_id":"46fdbb1a-83a3-4239-8abf-ed34e63c0914","resolution":{"observed_at":"2026-08-10T14:41:05.004324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12532","last_updated":"2024-06-05T09:01:24Z","snapshot_observed_at":"2026-08-16T13:51:05.375565Z","submitted_at":"2024-05-21T06:46:37Z","title":"PyramidInfer: Pyramid KV Cache Compression for High-throughput LLM Inference","version":2},"cited_work":{"arxiv_id":"2405.12532","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.12532","snapshot_observed_at":"2026-07-10T01:36:44.048156Z","title":"Pyramidinfer: Pyramid kv cache compres- sion for high-throughput llm inference","venue":"cs.CL","work_id":"385e7040-ccf4-4ff5-87de-f50bb44b6374","year":2024},"citing_paper":{"arxiv_id":"2502.01941","last_updated":"2026-05-12T08:04:27Z","snapshot_observed_at":"2026-08-14T08:23:35.104382Z","submitted_at":"2025-02-04T02:23:06Z","title":"Semantic Integrity Matters: Benchmarking and Preserving High-Density Reasoning in KV Cache Compression","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-23T04:15:36.906263Z"},"links":{"cited_paper":"/paper/2405.12532","citing_paper":"/paper/2502.01941"},"observation_digest":"sha256:ecc257923d6a21258d4c343d158735ed0971428b2f857024cfc0311fff49c9ad","observation_id":"35e38757-05ef-4846-815e-4eba4dbf94ba","resolution":{"observed_at":"2026-05-23T04:17:31.141533Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12532","last_updated":"2024-06-05T09:01:24Z","snapshot_observed_at":"2026-08-16T13:51:05.375565Z","submitted_at":"2024-05-21T06:46:37Z","title":"PyramidInfer: Pyramid KV Cache Compression for High-throughput LLM Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12532","snapshot_observed_at":"2026-08-09T04:32:01.408211Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.03589","last_updated":"2025-02-05T20:09:51Z","snapshot_observed_at":"2026-08-16T11:37:38.729964Z","submitted_at":"2025-02-05T20:09:51Z","title":"HACK: Homomorphic Acceleration via Compression of the Key-Value Cache for Disaggregated LLM Inference","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-09T04:32:01.408211Z"},"links":{"cited_paper":"/paper/2405.12532","citing_paper":"/paper/2502.03589"},"observation_digest":"sha256:ad4429a23e29675d6f352f21744a0a07ffb565026bb91a51d5173610b49fe772","observation_id":"cd6b8efe-e3fa-4474-a515-8ec7e9cc7aae","resolution":{"observed_at":"2026-08-09T04:32:01.408211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12532","last_updated":"2024-06-05T09:01:24Z","snapshot_observed_at":"2026-08-16T13:51:05.375565Z","submitted_at":"2024-05-21T06:46:37Z","title":"PyramidInfer: Pyramid KV Cache Compression for High-throughput LLM Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12532","snapshot_observed_at":"2026-08-08T16:36:00.827553Z","title":"Pyramidinfer: Pyramid kv cache compression for high-throughput llm inference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06155","last_updated":"2025-02-17T07:08:23Z","snapshot_observed_at":"2026-08-17T12:25:57.382548Z","submitted_at":"2025-02-10T05:00:56Z","title":"Efficient-vDiT: Efficient Video Diffusion Transformers With Attention Tile","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-08T16:36:00.827553Z"},"links":{"cited_paper":"/paper/2405.12532","citing_paper":"/paper/2502.06155"},"observation_digest":"sha256:79cd24c4f688f7437b958f3b01d8a8cb3d0aa1c671354f783430c6a74fe89cc9","observation_id":"2239970b-c879-4ee0-a22c-4c9f7a1fa120","resolution":{"observed_at":"2026-08-08T16:36:00.827553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12532","last_updated":"2024-06-05T09:01:24Z","snapshot_observed_at":"2026-08-16T13:51:05.375565Z","submitted_at":"2024-05-21T06:46:37Z","title":"PyramidInfer: Pyramid KV Cache Compression for High-throughput LLM Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12532","snapshot_observed_at":"2026-08-08T14:13:38.413409Z","title":"Pyramidinfer: Pyramid kv cache compression for high-throughput llm inference, 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06975","last_updated":"2025-02-10T19:14:51Z","snapshot_observed_at":"2026-08-14T08:32:12.525435Z","submitted_at":"2025-02-10T19:14:51Z","title":"Position: Episodic Memory is the Missing Piece for Long-Term LLM Agents","version":1},"reference_index":102,"source":"arxiv_source","source_observed_at":"2026-08-08T14:13:38.413409Z"},"links":{"cited_paper":"/paper/2405.12532","citing_paper":"/paper/2502.06975"},"observation_digest":"sha256:ab9c64766023ef4ec58de2e83f844332341b4bea9d923ee39b493eb1f0c8adef","observation_id":"d88e456d-ea6b-40d7-aaea-51187e3df623","resolution":{"observed_at":"2026-08-08T14:13:38.413409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12532","last_updated":"2024-06-05T09:01:24Z","snapshot_observed_at":"2026-08-16T13:51:05.375565Z","submitted_at":"2024-05-21T06:46:37Z","title":"PyramidInfer: Pyramid KV Cache Compression for High-throughput LLM Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12532","snapshot_observed_at":"2026-08-07T14:16:19.360068Z","title":"Pyramidinfer: Pyramid kv cache compression for high-throughput llm inference.arXiv preprint arXiv:2405.12532, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19602","last_updated":"2025-05-26T07:11:42Z","snapshot_observed_at":"2026-08-13T07:02:58.828486Z","submitted_at":"2025-05-26T07:11:42Z","title":"Memory-Efficient Visual Autoregressive Modeling with Scale-Aware KV Cache Compression","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:19.360068Z"},"links":{"cited_paper":"/paper/2405.12532","citing_paper":"/paper/2505.19602"},"observation_digest":"sha256:410f98b97c406f511a1e26d2130d10ba58c5f16c72c357f1755a4f764272d511","observation_id":"827a1ae8-2935-4ac9-96d7-895870c2b1be","resolution":{"observed_at":"2026-08-07T14:16:19.360068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12532","last_updated":"2024-06-05T09:01:24Z","snapshot_observed_at":"2026-08-16T13:51:05.375565Z","submitted_at":"2024-05-21T06:46:37Z","title":"PyramidInfer: Pyramid KV Cache Compression for High-throughput LLM Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12532","snapshot_observed_at":"2026-08-07T12:50:55.794210Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23520","last_updated":"2025-05-29T14:59:06Z","snapshot_observed_at":"2026-08-16T00:41:59.268159Z","submitted_at":"2025-05-29T14:59:06Z","title":"AnchorAttention: Difference-Aware Sparse Attention with Stripe Granularity","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:55.794210Z"},"links":{"cited_paper":"/paper/2405.12532","citing_paper":"/paper/2505.23520"},"observation_digest":"sha256:0c0af32f8dce7a8e1f8a0dbdd171d6ec963020d10176fa21156cb3e4e2ab9e5b","observation_id":"923033ba-0edb-4294-9ebd-9e6604817a56","resolution":{"observed_at":"2026-08-07T12:50:55.794210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12532","last_updated":"2024-06-05T09:01:24Z","snapshot_observed_at":"2026-08-16T13:51:05.375565Z","submitted_at":"2024-05-21T06:46:37Z","title":"PyramidInfer: Pyramid KV Cache Compression for High-throughput LLM Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12532","snapshot_observed_at":"2026-08-07T10:20:44.590087Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15724","last_updated":"2025-06-06T01:51:24Z","snapshot_observed_at":"2026-08-10T14:12:07.012882Z","submitted_at":"2025-06-06T01:51:24Z","title":"MadaKV: Adaptive Modality-Perception KV Cache Eviction for Efficient Multimodal Long-Context Inference","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T10:20:44.590087Z"},"links":{"cited_paper":"/paper/2405.12532","citing_paper":"/paper/2506.15724"},"observation_digest":"sha256:e28aa27ecd527706b2d720c221a16985d849280a1b3ccb3af5e7c9577642761c","observation_id":"58f35e4a-a465-400d-b3a3-ceb2549dc751","resolution":{"observed_at":"2026-08-07T10:20:44.590087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12532","last_updated":"2024-06-05T09:01:24Z","snapshot_observed_at":"2026-08-16T13:51:05.375565Z","submitted_at":"2024-05-21T06:46:37Z","title":"PyramidInfer: Pyramid KV Cache Compression for High-throughput LLM Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12532","snapshot_observed_at":"2026-08-06T23:00:11.211770Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20187","last_updated":"2025-07-02T05:12:29Z","snapshot_observed_at":"2026-08-18T03:21:35.999027Z","submitted_at":"2025-06-25T07:26:42Z","title":"Breaking the Boundaries of Long-Context LLM Inference: Adaptive KV Management on a Single Commodity GPU","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T23:00:11.211770Z"},"links":{"cited_paper":"/paper/2405.12532","citing_paper":"/paper/2506.20187"},"observation_digest":"sha256:8593f56d43f86557827189b40dbb0c262bd1e23a8c4a00546d868aa3ae4b90f4","observation_id":"72268e6b-f74b-4d8c-bf88-5a2f34360f62","resolution":{"observed_at":"2026-08-06T23:00:11.211770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12532","last_updated":"2024-06-05T09:01:24Z","snapshot_observed_at":"2026-08-16T13:51:05.375565Z","submitted_at":"2024-05-21T06:46:37Z","title":"PyramidInfer: Pyramid KV Cache Compression for High-throughput LLM Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12532","snapshot_observed_at":"2026-08-06T18:32:49.863938Z","title":"Pyramidinfer: Pyramid kv cache com- pression for high-throughput llm inference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-14T09:17:31.481989Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:49.863938Z"},"links":{"cited_paper":"/paper/2405.12532","citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:17f088c6c5c4480cc5d638603954a083d8f07aac620c9d7d101d803cbe0c9eea","observation_id":"5c385049-5d20-4389-bb81-fc98a8695fd0","resolution":{"observed_at":"2026-08-06T18:32:49.863938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12532","last_updated":"2024-06-05T09:01:24Z","snapshot_observed_at":"2026-08-16T13:51:05.375565Z","submitted_at":"2024-05-21T06:46:37Z","title":"PyramidInfer: Pyramid KV Cache Compression for High-throughput LLM Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12532","snapshot_observed_at":"2026-08-07T00:23:18.752863Z","title":"InAnnual Conference of the Association for Computational Lin- guistics","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.08806","last_updated":"2025-06-17T06:04:01Z","snapshot_observed_at":"2026-08-08T13:44:26.014435Z","submitted_at":"2025-06-17T06:04:01Z","title":"Think Clearly: Improving Reasoning via Redundant Token Pruning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:18.752863Z"},"links":{"cited_paper":"/paper/2405.12532","citing_paper":"/paper/2507.08806"},"observation_digest":"sha256:8025443abc6c1245e4d67dc4d4962079f243fa749faebe750cee2f7665398791","observation_id":"8c455c61-e622-48db-b715-3f0ab16003a7","resolution":{"observed_at":"2026-08-07T00:23:18.752863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12532","last_updated":"2024-06-05T09:01:24Z","snapshot_observed_at":"2026-08-16T13:51:05.375565Z","submitted_at":"2024-05-21T06:46:37Z","title":"PyramidInfer: Pyramid KV Cache Compression for High-throughput LLM Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12532","snapshot_observed_at":"2026-08-06T17:20:28.474622Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11273","last_updated":"2025-07-15T12:52:12Z","snapshot_observed_at":"2026-08-13T18:35:52.333072Z","submitted_at":"2025-07-15T12:52:12Z","title":"KV-Latent: Dimensional-level KV Cache Reduction with Frequency-aware Rotary Positional Embedding","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T17:20:28.474622Z"},"links":{"cited_paper":"/paper/2405.12532","citing_paper":"/paper/2507.11273"},"observation_digest":"sha256:44f40f411c84639171127f347a4b6ccad3e8b97e0524a28db010190fffa0bdb3","observation_id":"08f65a1c-9488-4181-974d-2413965dcaed","resolution":{"observed_at":"2026-08-06T17:20:28.474622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12532","last_updated":"2024-06-05T09:01:24Z","snapshot_observed_at":"2026-08-16T13:51:05.375565Z","submitted_at":"2024-05-21T06:46:37Z","title":"PyramidInfer: Pyramid KV Cache Compression for High-throughput LLM Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12532","snapshot_observed_at":"2026-08-06T13:57:15.807556Z","title":"Pyramidinfer: Pyramid kv cache compression for high-throughput llm inference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19906","last_updated":"2025-08-04T08:19:26Z","snapshot_observed_at":"2026-08-17T23:10:30.398943Z","submitted_at":"2025-07-26T10:34:53Z","title":"CaliDrop: KV Cache Compression with Calibration","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T13:57:15.807556Z"},"links":{"cited_paper":"/paper/2405.12532","citing_paper":"/paper/2507.19906"},"observation_digest":"sha256:d5e63bd9d8223d618844dab3695e2f87a92189dd733e01e183016bfb68b46aeb","observation_id":"1280fc6c-c0e7-48ed-90fa-0b80692b91d2","resolution":{"observed_at":"2026-08-06T13:57:15.807556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12532","last_updated":"2024-06-05T09:01:24Z","snapshot_observed_at":"2026-08-16T13:51:05.375565Z","submitted_at":"2024-05-21T06:46:37Z","title":"PyramidInfer: Pyramid KV Cache Compression for High-throughput LLM Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12532","snapshot_observed_at":"2026-08-05T13:44:18.879414Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00388","last_updated":"2025-08-30T06:56:28Z","snapshot_observed_at":"2026-08-15T00:06:30.018437Z","submitted_at":"2025-08-30T06:56:28Z","title":"GraphKV: Breaking the Static Selection Paradigm with Graph-Based KV Cache Eviction","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-05T13:44:18.879414Z"},"links":{"cited_paper":"/paper/2405.12532","citing_paper":"/paper/2509.00388"},"observation_digest":"sha256:7231a45c1576e44bbc404016583ebf4827cb756668767a802557d442fa9ee611","observation_id":"7a133e17-f04e-46f2-a209-9d66bbdc268e","resolution":{"observed_at":"2026-08-05T13:44:18.879414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12532","last_updated":"2024-06-05T09:01:24Z","snapshot_observed_at":"2026-08-16T13:51:05.375565Z","submitted_at":"2024-05-21T06:46:37Z","title":"PyramidInfer: Pyramid KV Cache Compression for High-throughput LLM Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12532","snapshot_observed_at":"2026-08-04T20:53:30.523155Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08315","last_updated":"2025-09-10T06:32:49Z","snapshot_observed_at":"2026-08-15T18:17:20.123085Z","submitted_at":"2025-09-10T06:32:49Z","title":"EvolKV: Evolutionary KV Cache Compression for LLM Inference","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-04T20:53:30.523155Z"},"links":{"cited_paper":"/paper/2405.12532","citing_paper":"/paper/2509.08315"},"observation_digest":"sha256:33e1b23604a3fda65d5375f589aceb4c39097cba4879c8856bd6736ce6b5d207","observation_id":"9ac1f9ac-caa9-43a1-85fd-33854434a692","resolution":{"observed_at":"2026-08-04T20:53:30.523155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12532","last_updated":"2024-06-05T09:01:24Z","snapshot_observed_at":"2026-08-16T13:51:05.375565Z","submitted_at":"2024-05-21T06:46:37Z","title":"PyramidInfer: Pyramid KV Cache Compression for High-throughput LLM Inference","version":2},"cited_work":{"arxiv_id":"2405.12532","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.12532","snapshot_observed_at":"2026-07-10T01:36:44.048156Z","title":"Pyramidinfer: Pyramid kv cache compres- sion for high-throughput llm inference","venue":"cs.CL","work_id":"385e7040-ccf4-4ff5-87de-f50bb44b6374","year":2024},"citing_paper":{"arxiv_id":"2604.23553","last_updated":"2026-04-26T06:25:48Z","snapshot_observed_at":"2026-08-12T13:37:22.111216Z","submitted_at":"2026-04-26T06:25:48Z","title":"ClusterFusion++: Expanding Cluster-Level Fusion to Full Transformer-Block Decoding","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-08T05:34:08.596351Z"},"links":{"cited_paper":"/paper/2405.12532","citing_paper":"/paper/2604.23553"},"observation_digest":"sha256:e6c0d9032d8d85cde7e26ed98e8f73c4b042e823bd67098a02364d531f0ec5d8","observation_id":"ec0782cc-b44f-435c-b9b1-4cb23cfdf3bd","resolution":{"observed_at":"2026-05-11T21:26:17.341241Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12532","last_updated":"2024-06-05T09:01:24Z","snapshot_observed_at":"2026-08-16T13:51:05.375565Z","submitted_at":"2024-05-21T06:46:37Z","title":"PyramidInfer: Pyramid KV Cache Compression for High-throughput LLM Inference","version":2},"cited_work":{"arxiv_id":"2405.12532","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.12532","snapshot_observed_at":"2026-07-10T01:36:44.048156Z","title":"Pyramidinfer: Pyramid kv cache compres- sion for high-throughput llm inference","venue":"cs.CL","work_id":"385e7040-ccf4-4ff5-87de-f50bb44b6374","year":2024},"citing_paper":{"arxiv_id":"2605.05219","last_updated":"2026-04-17T09:24:58Z","snapshot_observed_at":"2026-08-13T11:06:26.584785Z","submitted_at":"2026-04-17T09:24:58Z","title":"Sparse Prefix Caching for Hybrid and Recurrent LLM Serving","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T08:49:24.880528Z"},"links":{"cited_paper":"/paper/2405.12532","citing_paper":"/paper/2605.05219"},"observation_digest":"sha256:2d1f3d5bb47655d3887e666c04f1ffacc0d98959d70e0976ff2ded8ac836a4b6","observation_id":"7adfc9b3-a699-43a6-8f06-1303ddf5a6ee","resolution":{"observed_at":"2026-05-10T08:53:04.417631Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12532","last_updated":"2024-06-05T09:01:24Z","snapshot_observed_at":"2026-08-16T13:51:05.375565Z","submitted_at":"2024-05-21T06:46:37Z","title":"PyramidInfer: Pyramid KV Cache Compression for High-throughput LLM Inference","version":2},"cited_work":{"arxiv_id":"2405.12532","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.12532","snapshot_observed_at":"2026-07-10T01:36:44.048156Z","title":"Pyramidinfer: Pyramid kv cache compres- sion for high-throughput llm inference","venue":"cs.CL","work_id":"385e7040-ccf4-4ff5-87de-f50bb44b6374","year":2024},"citing_paper":{"arxiv_id":"2605.07234","last_updated":"2026-05-08T04:37:22Z","snapshot_observed_at":"2026-08-11T16:13:04.469297Z","submitted_at":"2026-05-08T04:37:22Z","title":"Reformulating KV Cache Eviction Problem for Long-Context LLM Inference","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-11T02:37:52.545943Z"},"links":{"cited_paper":"/paper/2405.12532","citing_paper":"/paper/2605.07234"},"observation_digest":"sha256:8b192242c98e6ce4a46f59900a3427eb5158058293dbfb79acf2bd172afd0eb1","observation_id":"0a7177e5-8175-4beb-8971-d857ab6ec030","resolution":{"observed_at":"2026-05-11T03:10:53.563323Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12532","last_updated":"2024-06-05T09:01:24Z","snapshot_observed_at":"2026-08-16T13:51:05.375565Z","submitted_at":"2024-05-21T06:46:37Z","title":"PyramidInfer: Pyramid KV Cache Compression for High-throughput LLM Inference","version":2},"cited_work":{"arxiv_id":"2405.12532","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.12532","snapshot_observed_at":"2026-07-10T01:36:44.048156Z","title":"Pyramidinfer: Pyramid kv cache compres- sion for high-throughput llm inference","venue":"cs.CL","work_id":"385e7040-ccf4-4ff5-87de-f50bb44b6374","year":2024},"citing_paper":{"arxiv_id":"2605.08840","last_updated":"2026-05-09T09:49:32Z","snapshot_observed_at":"2026-08-16T10:17:22.372650Z","submitted_at":"2026-05-09T09:49:32Z","title":"ReST-KV: Robust KV Cache Eviction with Layer-wise Output Reconstruction and Spatial-Temporal Smoothing","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-12T02:52:33.076123Z"},"links":{"cited_paper":"/paper/2405.12532","citing_paper":"/paper/2605.08840"},"observation_digest":"sha256:23f1535546c4b78066f556efd6661c65f619c9bf5a382bd0352f98396259d7fc","observation_id":"e3b5b830-d887-42bb-9dc9-50d00a1e4f32","resolution":{"observed_at":"2026-05-12T07:26:30.415977Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12532","last_updated":"2024-06-05T09:01:24Z","snapshot_observed_at":"2026-08-16T13:51:05.375565Z","submitted_at":"2024-05-21T06:46:37Z","title":"PyramidInfer: Pyramid KV Cache Compression for High-throughput LLM Inference","version":2},"cited_work":{"arxiv_id":"2405.12532","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.12532","snapshot_observed_at":"2026-07-10T01:36:44.048156Z","title":"Pyramidinfer: Pyramid kv cache compres- sion for high-throughput llm inference","venue":"cs.CL","work_id":"385e7040-ccf4-4ff5-87de-f50bb44b6374","year":2024},"citing_paper":{"arxiv_id":"2605.18053","last_updated":"2026-05-18T08:41:34Z","snapshot_observed_at":"2026-08-16T15:00:20.515962Z","submitted_at":"2026-05-18T08:41:34Z","title":"Protection Is (Nearly) All You Need: Structural Protection Dominates Scoring in Globally Capped KV Eviction","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-20T12:13:14.295659Z"},"links":{"cited_paper":"/paper/2405.12532","citing_paper":"/paper/2605.18053"},"observation_digest":"sha256:1ae6ad6f6d0a2422a4de9f8f8149c29114fbc63a5519546ecb973bb66967de4b","observation_id":"81b036f3-9b64-4a9b-93be-9e841b39eecb","resolution":{"observed_at":"2026-05-20T12:13:15.968577Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12532","last_updated":"2024-06-05T09:01:24Z","snapshot_observed_at":"2026-08-16T13:51:05.375565Z","submitted_at":"2024-05-21T06:46:37Z","title":"PyramidInfer: Pyramid KV Cache Compression for High-throughput LLM Inference","version":2},"cited_work":{"arxiv_id":"2405.12532","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.12532","snapshot_observed_at":"2026-07-10T01:36:44.048156Z","title":"Pyramidinfer: Pyramid kv cache compres- sion for high-throughput llm inference","venue":"cs.CL","work_id":"385e7040-ccf4-4ff5-87de-f50bb44b6374","year":2024},"citing_paper":{"arxiv_id":"2606.00523","last_updated":"2026-05-30T04:31:29Z","snapshot_observed_at":"2026-08-15T04:06:40.971012Z","submitted_at":"2026-05-30T04:31:29Z","title":"ProactiveLLM: Learning Active Interaction for Streaming Large Language Models","version":1},"reference_index":112,"source":"arxiv_source","source_observed_at":"2026-06-28T19:07:48.425181Z"},"links":{"cited_paper":"/paper/2405.12532","citing_paper":"/paper/2606.00523"},"observation_digest":"sha256:3e58c843f250619150dfd90971353b6056ab2753189149864bb3c2270ef8a572","observation_id":"102101e7-0036-4788-aa5f-aeec894e557d","resolution":{"observed_at":"2026-06-28T19:12:34.806502Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12532","last_updated":"2024-06-05T09:01:24Z","snapshot_observed_at":"2026-08-16T13:51:05.375565Z","submitted_at":"2024-05-21T06:46:37Z","title":"PyramidInfer: Pyramid KV Cache Compression for High-throughput LLM Inference","version":2},"cited_work":{"arxiv_id":"2405.12532","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.12532","snapshot_observed_at":"2026-07-10T01:36:44.048156Z","title":"Pyramidinfer: Pyramid kv cache compres- sion for high-throughput llm inference","venue":"cs.CL","work_id":"385e7040-ccf4-4ff5-87de-f50bb44b6374","year":2024},"citing_paper":{"arxiv_id":"2606.09508","last_updated":"2026-06-08T14:02:18Z","snapshot_observed_at":"2026-08-09T20:49:20.503961Z","submitted_at":"2026-06-08T14:02:18Z","title":"From Rigid to Dynamic: Entropy-Guided Adaptive Inference for Long-Context LLMs","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-06-27T16:57:02.709967Z"},"links":{"cited_paper":"/paper/2405.12532","citing_paper":"/paper/2606.09508"},"observation_digest":"sha256:16f7d26a2a204f39c4d8ca481ed9923e8b68b55983fe2fced5507451183e54f1","observation_id":"f4f64744-e14b-46f3-9e34-bc9bd6626770","resolution":{"observed_at":"2026-07-03T00:57:30.010828Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12532","last_updated":"2024-06-05T09:01:24Z","snapshot_observed_at":"2026-08-16T13:51:05.375565Z","submitted_at":"2024-05-21T06:46:37Z","title":"PyramidInfer: Pyramid KV Cache Compression for High-throughput LLM Inference","version":2},"cited_work":{"arxiv_id":"2405.12532","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.12532","snapshot_observed_at":"2026-07-10T01:36:44.048156Z","title":"Pyramidinfer: Pyramid kv cache compres- sion for high-throughput llm inference","venue":"cs.CL","work_id":"385e7040-ccf4-4ff5-87de-f50bb44b6374","year":2024},"citing_paper":{"arxiv_id":"2607.08032","last_updated":"2026-07-09T01:15:03Z","snapshot_observed_at":"2026-08-15T04:39:02.467469Z","submitted_at":"2026-07-09T01:15:03Z","title":"What to Keep, What to Forget: A Rate--Distortion View of Memory Compaction in LLMs and Agents","version":1},"reference_index":135,"source":"pdf_text","source_observed_at":"2026-07-10T01:26:59.421158Z"},"links":{"cited_paper":"/paper/2405.12532","citing_paper":"/paper/2607.08032"},"observation_digest":"sha256:dd5bce27576f71e789390b15312457d8fb43a42cd1b55d52b39a22f73f2d49fb","observation_id":"ec731856-38ec-41c6-b8ce-74bd7eec91d6","resolution":{"observed_at":"2026-07-10T01:36:44.049434Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2405.12532/citation-record","integrity":"/paper/2405.12532/integrity","json":"/paper/2405.12532/citation-record.json","paper":"/paper/2405.12532"},"outbound":[],"paper":{"arxiv_id":"2405.12532","last_updated":"2024-06-05T09:01:24Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-16T13:51:05.375565Z","submitted_at":"2024-05-21T06:46:37Z","title":"PyramidInfer: Pyramid KV Cache Compression for High-throughput LLM Inference"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 30 inbound Pith citation observations for arXiv:2405.12532."}