{"as_of":"2026-08-16T08:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d87d151e16c05818e034fe2091790659447fbc011c7bfb228d9eb8c520008f31","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":26,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":26,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":26,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T05:49:09.982040Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":3,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2405.14366","last_updated":"2024-09-07T02:52:29Z","snapshot_observed_at":"2026-08-13T00:00:46.126397Z","submitted_at":"2024-05-23T09:43:52Z","title":"MiniCache: KV Cache Compression in Depth Dimension for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14366","snapshot_observed_at":"2026-08-12T16:20:32.412901Z","title":"Minicache: Kv cache compression in depth dimension for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.412901Z"},"links":{"cited_paper":"/paper/2405.14366","citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:4c1fe3c176ed6a648ae7a36becd36f44fe1b45a4aae9a5ce904c9cef9e46e5a3","observation_id":"a54f002f-c183-4e53-88e0-19641b7e1091","resolution":{"observed_at":"2026-08-12T16:20:32.412901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14366","last_updated":"2024-09-07T02:52:29Z","snapshot_observed_at":"2026-08-13T00:00:46.126397Z","submitted_at":"2024-05-23T09:43:52Z","title":"MiniCache: KV Cache Compression in Depth Dimension for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14366","snapshot_observed_at":"2026-08-12T11:37:07.595756Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18077","last_updated":"2025-06-08T21:23:22Z","snapshot_observed_at":"2026-08-15T19:30:15.609643Z","submitted_at":"2024-11-27T06:10:49Z","title":"MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-12T11:37:07.595756Z"},"links":{"cited_paper":"/paper/2405.14366","citing_paper":"/paper/2411.18077"},"observation_digest":"sha256:3a9d3d2453abe70d84f315f968890ecc413fae5f069e6152267964e7ba377a51","observation_id":"39ffc95a-dca4-42ef-829d-d6bc784359bd","resolution":{"observed_at":"2026-08-12T11:37:07.595756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14366","last_updated":"2024-09-07T02:52:29Z","snapshot_observed_at":"2026-08-13T00:00:46.126397Z","submitted_at":"2024-05-23T09:43:52Z","title":"MiniCache: KV Cache Compression in Depth Dimension for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14366","snapshot_observed_at":"2026-08-11T23:46:02.056231Z","title":"Minicache: Kv cache compression in depth dimension for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02252","last_updated":"2025-08-04T02:17:56Z","snapshot_observed_at":"2026-08-12T00:30:41.714356Z","submitted_at":"2024-12-03T08:29:27Z","title":"Compressing KV Cache for Long-Context LLM Inference with Inter-Layer Attention Similarity","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T23:46:02.056231Z"},"links":{"cited_paper":"/paper/2405.14366","citing_paper":"/paper/2412.02252"},"observation_digest":"sha256:408e8c48d892bca58e7885d9c2bf6a4b7f5325bb0bc2323983cf73d4bdf3ff1d","observation_id":"ab5fa997-8eea-4f97-b365-6962333cce6e","resolution":{"observed_at":"2026-08-11T23:46:02.056231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14366","last_updated":"2024-09-07T02:52:29Z","snapshot_observed_at":"2026-08-13T00:00:46.126397Z","submitted_at":"2024-05-23T09:43:52Z","title":"MiniCache: KV Cache Compression in Depth Dimension for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14366","snapshot_observed_at":"2026-08-11T11:57:17.950846Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14838","last_updated":"2025-05-27T03:08:57Z","snapshot_observed_at":"2026-08-14T20:37:53.783757Z","submitted_at":"2024-12-19T13:28:42Z","title":"DynamicKV: Task-Aware Adaptive KV Cache Compression for Long Context LLMs","version":4},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-11T11:57:17.950846Z"},"links":{"cited_paper":"/paper/2405.14366","citing_paper":"/paper/2412.14838"},"observation_digest":"sha256:d44dfbbb74f3018f5c55995da94821a5ab4cd94fc875e0cdf79a71093f7fa131","observation_id":"b35376c6-1d3e-4277-9e74-9f3fa2bdc621","resolution":{"observed_at":"2026-08-11T11:57:17.950846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14366","last_updated":"2024-09-07T02:52:29Z","snapshot_observed_at":"2026-08-13T00:00:46.126397Z","submitted_at":"2024-05-23T09:43:52Z","title":"MiniCache: KV Cache Compression in Depth Dimension for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14366","snapshot_observed_at":"2026-08-11T16:43:44.131384Z","title":"Minicache: Kv cache compression in depth dimension for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16187","last_updated":"2025-06-04T22:37:29Z","snapshot_observed_at":"2026-08-14T11:46:16.870794Z","submitted_at":"2024-12-13T06:00:27Z","title":"HashEvict: A Pre-Attention KV Cache Eviction Strategy using Locality-Sensitive Hashing","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T16:43:44.131384Z"},"links":{"cited_paper":"/paper/2405.14366","citing_paper":"/paper/2412.16187"},"observation_digest":"sha256:1b39656198f5cd00936689216a45859fe6048ee5acec9c96ac2b46f35a7fbd63","observation_id":"a09a16a1-07cc-4ba0-a737-ae241f0805eb","resolution":{"observed_at":"2026-08-11T16:43:44.131384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14366","last_updated":"2024-09-07T02:52:29Z","snapshot_observed_at":"2026-08-13T00:00:46.126397Z","submitted_at":"2024-05-23T09:43:52Z","title":"MiniCache: KV Cache Compression in Depth Dimension for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14366","snapshot_observed_at":"2026-08-11T05:32:29.447672Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17483","last_updated":"2024-12-23T11:24:04Z","snapshot_observed_at":"2026-08-14T08:12:24.397125Z","submitted_at":"2024-12-23T11:24:04Z","title":"A Silver Bullet or a Compromise for Full Attention? A Comprehensive Study of Gist Token-based Context Compression","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T05:32:29.447672Z"},"links":{"cited_paper":"/paper/2405.14366","citing_paper":"/paper/2412.17483"},"observation_digest":"sha256:7db9483995173bd14fcc7666e753109f20c67b4e49bff5ac151a2fe88a949432","observation_id":"51faa30f-39bb-4c62-ba21-5637acb71c24","resolution":{"observed_at":"2026-08-11T05:32:29.447672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14366","last_updated":"2024-09-07T02:52:29Z","snapshot_observed_at":"2026-08-13T00:00:46.126397Z","submitted_at":"2024-05-23T09:43:52Z","title":"MiniCache: KV Cache Compression in Depth Dimension for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14366","snapshot_observed_at":"2026-08-11T00:38:47.643051Z","title":"Minicache: KV cache compression in depth dimension for large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19442","last_updated":"2025-07-30T05:24:46Z","snapshot_observed_at":"2026-08-15T13:24:51.697670Z","submitted_at":"2024-12-27T04:17:57Z","title":"A Survey on Large Language Model Acceleration based on KV Cache Management","version":3},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-08-11T00:38:47.643051Z"},"links":{"cited_paper":"/paper/2405.14366","citing_paper":"/paper/2412.19442"},"observation_digest":"sha256:2f57096ca9befc8d68fa794fcaac73d1b08a23fe0f5f2bc1da8c13b12765332e","observation_id":"437891ab-6e45-49eb-b1ab-69b9315df6f1","resolution":{"observed_at":"2026-08-11T00:38:47.643051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14366","last_updated":"2024-09-07T02:52:29Z","snapshot_observed_at":"2026-08-13T00:00:46.126397Z","submitted_at":"2024-05-23T09:43:52Z","title":"MiniCache: KV Cache Compression in Depth Dimension for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14366","snapshot_observed_at":"2026-08-10T14:41:05.013818Z","title":"Minicache: Kv cache compression in depth dimension for large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15113","last_updated":"2025-01-25T07:28:13Z","snapshot_observed_at":"2026-08-15T03:53:08.367392Z","submitted_at":"2025-01-25T07:28:13Z","title":"Task-KV: Task-aware KV Cache Optimization via Semantic Differentiation of Attention Heads","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T14:41:05.013818Z"},"links":{"cited_paper":"/paper/2405.14366","citing_paper":"/paper/2501.15113"},"observation_digest":"sha256:711febc3ec1a64c386face508806de044c42d87eb7e835317b8c12d328efd506","observation_id":"de681a8d-578e-4497-80dd-db5200ce5d35","resolution":{"observed_at":"2026-08-10T14:41:05.013818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14366","last_updated":"2024-09-07T02:52:29Z","snapshot_observed_at":"2026-08-13T00:00:46.126397Z","submitted_at":"2024-05-23T09:43:52Z","title":"MiniCache: KV Cache Compression in Depth Dimension for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14366","snapshot_observed_at":"2026-08-09T20:34:01.274336Z","title":"Minicache: Kv cache compression in depth dimension for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.19392","last_updated":"2025-02-28T18:04:52Z","snapshot_observed_at":"2026-08-12T17:04:32.510964Z","submitted_at":"2025-01-31T18:47:42Z","title":"Cache Me If You Must: Adaptive Key-Value Quantization for Large Language Models","version":4},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.274336Z"},"links":{"cited_paper":"/paper/2405.14366","citing_paper":"/paper/2501.19392"},"observation_digest":"sha256:3e8329f72c4c9a25e0e06b2ea3eda4454022191671d825cb355a2b650463c7cd","observation_id":"8100fd37-f4e5-42b6-8a23-f126bcce6ec9","resolution":{"observed_at":"2026-08-09T20:34:01.274336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14366","last_updated":"2024-09-07T02:52:29Z","snapshot_observed_at":"2026-08-13T00:00:46.126397Z","submitted_at":"2024-05-23T09:43:52Z","title":"MiniCache: KV Cache Compression in Depth Dimension for Large Language Models","version":2},"cited_work":{"arxiv_id":"2405.14366","doi":"10.48550/arxiv.2405.14366","metadata_source":"pith","pith_arxiv_id":"2405.14366","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mini- cache: Kv cache compression in depth dimension for large language models","venue":"cs.CL","work_id":"097b75b7-6841-48c4-be76-ef448c8fe83c","year":2024},"citing_paper":{"arxiv_id":"2502.01941","last_updated":"2026-05-12T08:04:27Z","snapshot_observed_at":"2026-08-14T08:23:35.104382Z","submitted_at":"2025-02-04T02:23:06Z","title":"Semantic Integrity Matters: Benchmarking and Preserving High-Density Reasoning in KV Cache Compression","version":4},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-23T04:15:36.906263Z"},"links":{"cited_paper":"/paper/2405.14366","citing_paper":"/paper/2502.01941"},"observation_digest":"sha256:9c8b71b386f322c2b621a8aea5b3ce44c6f9fb8a2f57cc0f02e5c6a3f0aebb16","observation_id":"0c27c169-0ae3-49b1-9f7d-caf7525136ff","resolution":{"observed_at":"2026-05-23T04:17:31.255973Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:20:06.369582+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:20:06.369582+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14366","last_updated":"2024-09-07T02:52:29Z","snapshot_observed_at":"2026-08-13T00:00:46.126397Z","submitted_at":"2024-05-23T09:43:52Z","title":"MiniCache: KV Cache Compression in Depth Dimension for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14366","snapshot_observed_at":"2026-08-08T14:13:38.173419Z","title":"Minicache: Kv cache compression in depth dimension for large language models, 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06975","last_updated":"2025-02-10T19:14:51Z","snapshot_observed_at":"2026-08-14T08:32:12.525435Z","submitted_at":"2025-02-10T19:14:51Z","title":"Position: Episodic Memory is the Missing Piece for Long-Term LLM Agents","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-08T14:13:38.173419Z"},"links":{"cited_paper":"/paper/2405.14366","citing_paper":"/paper/2502.06975"},"observation_digest":"sha256:b1ad232e1722b45e661b5c6cc77b50211bb91dde7de39d85790c9bc1c4a5d049","observation_id":"cff4f956-d691-4937-a2a9-a02e8aa7f41c","resolution":{"observed_at":"2026-08-08T14:13:38.173419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14366","last_updated":"2024-09-07T02:52:29Z","snapshot_observed_at":"2026-08-13T00:00:46.126397Z","submitted_at":"2024-05-23T09:43:52Z","title":"MiniCache: KV Cache Compression in Depth Dimension for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14366","snapshot_observed_at":"2026-08-08T11:48:01.204132Z","title":"Minicache: Kv cache compression in depth dimension for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07864","last_updated":"2025-06-12T11:45:57Z","snapshot_observed_at":"2026-08-10T11:58:20.177769Z","submitted_at":"2025-02-11T18:20:18Z","title":"TransMLA: Multi-Head Latent Attention Is All You Need","version":5},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-08T11:48:01.204132Z"},"links":{"cited_paper":"/paper/2405.14366","citing_paper":"/paper/2502.07864"},"observation_digest":"sha256:ffa28449c323a9ab45f08b08704c446cbb182dfc20d7010075d53e0c9c0e64f0","observation_id":"10b2764a-bae7-4d44-83c7-958a0cdd247b","resolution":{"observed_at":"2026-08-08T11:48:01.204132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14366","last_updated":"2024-09-07T02:52:29Z","snapshot_observed_at":"2026-08-13T00:00:46.126397Z","submitted_at":"2024-05-23T09:43:52Z","title":"MiniCache: KV Cache Compression in Depth Dimension for Large Language Models","version":2},"cited_work":{"arxiv_id":"2405.14366","doi":"10.48550/arxiv.2405.14366","metadata_source":"pith","pith_arxiv_id":"2405.14366","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mini- cache: Kv cache compression in depth dimension for large language models","venue":"cs.CL","work_id":"097b75b7-6841-48c4-be76-ef448c8fe83c","year":2024},"citing_paper":{"arxiv_id":"2503.19950","last_updated":"2025-03-25T16:24:45Z","snapshot_observed_at":"2026-08-02T05:11:13.500453Z","submitted_at":"2025-03-25T16:24:45Z","title":"LogQuant: Log-Distributed 2-Bit Quantization of KV Cache with Superior Accuracy Preservation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-22T22:07:37.906916Z"},"links":{"cited_paper":"/paper/2405.14366","citing_paper":"/paper/2503.19950"},"observation_digest":"sha256:88fce24db85ee4699d7da360637d3af4098f514ac4959d39857ce672e8936bcc","observation_id":"f5509a30-74a1-4411-b871-35b83934b4b2","resolution":{"observed_at":"2026-05-22T22:12:11.625691Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:20:06.369582+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:20:06.369582+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14366","last_updated":"2024-09-07T02:52:29Z","snapshot_observed_at":"2026-08-13T00:00:46.126397Z","submitted_at":"2024-05-23T09:43:52Z","title":"MiniCache: KV Cache Compression in Depth Dimension for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14366","snapshot_observed_at":"2026-08-16T05:49:09.982040Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19720","last_updated":"2025-04-28T12:14:02Z","snapshot_observed_at":"2026-08-16T07:43:12.291655Z","submitted_at":"2025-04-28T12:14:02Z","title":"Taming the Titans: A Survey of Efficient LLM Inference Serving","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-16T05:49:09.982040Z"},"links":{"cited_paper":"/paper/2405.14366","citing_paper":"/paper/2504.19720"},"observation_digest":"sha256:941ea99820ed1ab3ded7d2574ed823e19889f263971a68f6e3181d4b477411a3","observation_id":"2918161a-6afd-42d4-aa52-73d317bbfd8b","resolution":{"observed_at":"2026-08-16T05:49:09.982040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14366","last_updated":"2024-09-07T02:52:29Z","snapshot_observed_at":"2026-08-13T00:00:46.126397Z","submitted_at":"2024-05-23T09:43:52Z","title":"MiniCache: KV Cache Compression in Depth Dimension for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14366","snapshot_observed_at":"2026-08-15T20:54:59.303075Z","title":"Mini- cache: Kv cache compression in depth dimension for large language models.arXiv preprint arXiv:2405.14366, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14709","last_updated":"2025-05-17T05:00:39Z","snapshot_observed_at":"2026-08-15T20:44:25.087007Z","submitted_at":"2025-05-17T05:00:39Z","title":"FastCar: Cache Attentive Replay for Fast Auto-Regressive Video Generation on the Edge","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T20:54:59.303075Z"},"links":{"cited_paper":"/paper/2405.14366","citing_paper":"/paper/2505.14709"},"observation_digest":"sha256:d0e982d198ddb8817fd66de0e42f87f7ee3e76764c6a552cd3fca63be23efd3d","observation_id":"68ddbbb6-dba9-4b27-bf3c-20d21c95dfc3","resolution":{"observed_at":"2026-08-15T20:54:59.303075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14366","last_updated":"2024-09-07T02:52:29Z","snapshot_observed_at":"2026-08-13T00:00:46.126397Z","submitted_at":"2024-05-23T09:43:52Z","title":"MiniCache: KV Cache Compression in Depth Dimension for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14366","snapshot_observed_at":"2026-08-07T14:16:15.805734Z","title":"Minicache: Kv cache compression in depth dimension for large language models.arXiv preprint arXiv:2405.14366, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19602","last_updated":"2025-05-26T07:11:42Z","snapshot_observed_at":"2026-08-13T07:02:58.828486Z","submitted_at":"2025-05-26T07:11:42Z","title":"Memory-Efficient Visual Autoregressive Modeling with Scale-Aware KV Cache Compression","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:15.805734Z"},"links":{"cited_paper":"/paper/2405.14366","citing_paper":"/paper/2505.19602"},"observation_digest":"sha256:ed25f01d73b2e63cb155f14e5099d00e971948b8896cf0ce676e2dfeb7e1dd88","observation_id":"46aec037-8f7c-40db-bf10-3ec3a2194891","resolution":{"observed_at":"2026-08-07T14:16:15.805734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14366","last_updated":"2024-09-07T02:52:29Z","snapshot_observed_at":"2026-08-13T00:00:46.126397Z","submitted_at":"2024-05-23T09:43:52Z","title":"MiniCache: KV Cache Compression in Depth Dimension for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14366","snapshot_observed_at":"2026-08-07T01:09:20.984252Z","title":"Mini- cache: Kv cache compression in depth dimension for large language models.arXiv preprint arXiv:2405.14366, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.12204","last_updated":"2025-06-13T20:15:58Z","snapshot_observed_at":"2026-08-09T07:59:09.687258Z","submitted_at":"2025-06-13T20:15:58Z","title":"Semantic Scheduling for LLM Inference","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T01:09:20.984252Z"},"links":{"cited_paper":"/paper/2405.14366","citing_paper":"/paper/2506.12204"},"observation_digest":"sha256:0abf1ed9a71540790bf29b7244d6a17b307ae233289d917e3c75cc47aeabc8fc","observation_id":"efa4715b-447e-4500-b65e-e60faca4728b","resolution":{"observed_at":"2026-08-07T01:09:20.984252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14366","last_updated":"2024-09-07T02:52:29Z","snapshot_observed_at":"2026-08-13T00:00:46.126397Z","submitted_at":"2024-05-23T09:43:52Z","title":"MiniCache: KV Cache Compression in Depth Dimension for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14366","snapshot_observed_at":"2026-08-06T19:10:01.211946Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06517","last_updated":"2025-07-09T03:33:44Z","snapshot_observed_at":"2026-08-10T09:11:28.813559Z","submitted_at":"2025-07-09T03:33:44Z","title":"SpindleKV: A Novel KV Cache Reduction Method Balancing Both Shallow and Deep Layers","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T19:10:01.211946Z"},"links":{"cited_paper":"/paper/2405.14366","citing_paper":"/paper/2507.06517"},"observation_digest":"sha256:f45b457753ed67b000ba7756a1b55f84fb7c36fa3909abeb193f1f1c34978853","observation_id":"338b3950-8251-4c0f-99be-28abbd3377f5","resolution":{"observed_at":"2026-08-06T19:10:01.211946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14366","last_updated":"2024-09-07T02:52:29Z","snapshot_observed_at":"2026-08-13T00:00:46.126397Z","submitted_at":"2024-05-23T09:43:52Z","title":"MiniCache: KV Cache Compression in Depth Dimension for Large Language Models","version":2},"cited_work":{"arxiv_id":"2405.14366","doi":"10.48550/arxiv.2405.14366","metadata_source":"pith","pith_arxiv_id":"2405.14366","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mini- cache: Kv cache compression in depth dimension for large language models","venue":"cs.CL","work_id":"097b75b7-6841-48c4-be76-ef448c8fe83c","year":2024},"citing_paper":{"arxiv_id":"2602.22575","last_updated":"2026-05-05T13:29:50Z","snapshot_observed_at":"2026-08-13T13:45:48.461721Z","submitted_at":"2026-02-26T03:30:28Z","title":"S2O: Early Stopping for Sparse Attention via Online Permutation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-15T19:32:52.948154Z"},"links":{"cited_paper":"/paper/2405.14366","citing_paper":"/paper/2602.22575"},"observation_digest":"sha256:777a187935f6a8217454a2cf95b3f900587e2ce8d0d829b420244602dad36928","observation_id":"958f7d1e-9fa0-4a05-91c7-7d69f4b8c3dd","resolution":{"observed_at":"2026-05-15T19:36:32.930897Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:20:06.369582+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:20:06.369582+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14366","last_updated":"2024-09-07T02:52:29Z","snapshot_observed_at":"2026-08-13T00:00:46.126397Z","submitted_at":"2024-05-23T09:43:52Z","title":"MiniCache: KV Cache Compression in Depth Dimension for Large Language Models","version":2},"cited_work":{"arxiv_id":"2405.14366","doi":"10.48550/arxiv.2405.14366","metadata_source":"pith","pith_arxiv_id":"2405.14366","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mini- cache: Kv cache compression in depth dimension for large language models","venue":"cs.CL","work_id":"097b75b7-6841-48c4-be76-ef448c8fe83c","year":2024},"citing_paper":{"arxiv_id":"2606.08302","last_updated":"2026-06-06T18:58:26Z","snapshot_observed_at":"2026-08-06T09:32:24.096311Z","submitted_at":"2026-06-06T18:58:26Z","title":"HACK++: Towards More Effective Head-Aware Key-Value Compression for Efficient Visual Autoregressive Modeling","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-27T19:46:43.514413Z"},"links":{"cited_paper":"/paper/2405.14366","citing_paper":"/paper/2606.08302"},"observation_digest":"sha256:e327a9b0413276189133a383aaeea082f6d7878469303afa9fac1bef741d5f4f","observation_id":"20a2a60e-c8b6-45a4-b02f-46fc08f9e349","resolution":{"observed_at":"2026-07-02T21:27:24.426091Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:20:06.369582+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:20:06.369582+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14366","last_updated":"2024-09-07T02:52:29Z","snapshot_observed_at":"2026-08-13T00:00:46.126397Z","submitted_at":"2024-05-23T09:43:52Z","title":"MiniCache: KV Cache Compression in Depth Dimension for Large Language Models","version":2},"cited_work":{"arxiv_id":"2405.14366","doi":"10.48550/arxiv.2405.14366","metadata_source":"pith","pith_arxiv_id":"2405.14366","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mini- cache: Kv cache compression in depth dimension for large language models","venue":"cs.CL","work_id":"097b75b7-6841-48c4-be76-ef448c8fe83c","year":2024},"citing_paper":{"arxiv_id":"2606.24033","last_updated":"2026-06-23T00:17:48Z","snapshot_observed_at":"2026-08-13T08:08:50.228783Z","submitted_at":"2026-06-23T00:17:48Z","title":"RoPE-Aware Bit Allocation for KV-Cache Quantization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-26T01:05:13.790381Z"},"links":{"cited_paper":"/paper/2405.14366","citing_paper":"/paper/2606.24033"},"observation_digest":"sha256:0d2d9ee971edc23f972b04c083a27ef58b6dda65fb2477aa8543173494c48912","observation_id":"6aa01486-410a-4af5-afd6-ddaead8d8ea1","resolution":{"observed_at":"2026-07-04T15:59:57.378678Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:20:06.369582+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:20:06.369582+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14366","last_updated":"2024-09-07T02:52:29Z","snapshot_observed_at":"2026-08-13T00:00:46.126397Z","submitted_at":"2024-05-23T09:43:52Z","title":"MiniCache: KV Cache Compression in Depth Dimension for Large Language Models","version":2},"cited_work":{"arxiv_id":"2405.14366","doi":"10.48550/arxiv.2405.14366","metadata_source":"pith","pith_arxiv_id":"2405.14366","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mini- cache: Kv cache compression in depth dimension for large language models","venue":"cs.CL","work_id":"097b75b7-6841-48c4-be76-ef448c8fe83c","year":2024},"citing_paper":{"arxiv_id":"2607.06519","last_updated":"2026-07-07T17:26:28Z","snapshot_observed_at":"2026-08-09T16:13:17.651261Z","submitted_at":"2026-07-07T17:26:28Z","title":"FreqDepthKV: Frequency-Guided Depth Sharing for Robust KV Cache Compression in Long-Context LLM Inference","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-07-11T00:12:13.830917Z"},"links":{"cited_paper":"/paper/2405.14366","citing_paper":"/paper/2607.06519"},"observation_digest":"sha256:54afd424542e46dcff215b8fc8cbf34a0cd606d1a1a51d28283fae4e0bb9dfe3","observation_id":"90c45ba2-3c61-48ec-823f-22d5f61ed95d","resolution":{"observed_at":"2026-07-11T00:17:45.321384Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:20:06.369582+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:20:06.369582+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14366","last_updated":"2024-09-07T02:52:29Z","snapshot_observed_at":"2026-08-13T00:00:46.126397Z","submitted_at":"2024-05-23T09:43:52Z","title":"MiniCache: KV Cache Compression in Depth Dimension for Large Language Models","version":2},"cited_work":{"arxiv_id":"2405.14366","doi":"10.48550/arxiv.2405.14366","metadata_source":"pith","pith_arxiv_id":"2405.14366","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mini- cache: Kv cache compression in depth dimension for large language models","venue":"cs.CL","work_id":"097b75b7-6841-48c4-be76-ef448c8fe83c","year":2024},"citing_paper":{"arxiv_id":"2607.06523","last_updated":"2026-07-07T17:29:01Z","snapshot_observed_at":"2026-08-12T20:33:37.072668Z","submitted_at":"2026-07-07T17:29:01Z","title":"DepthWeave-KV: Token-Adaptive Cross-Layer Residual Factorization for Long-Context KV Cache Compression","version":1},"reference_index":103,"source":"arxiv_source","source_observed_at":"2026-07-08T03:07:23.648382Z"},"links":{"cited_paper":"/paper/2405.14366","citing_paper":"/paper/2607.06523"},"observation_digest":"sha256:3c1f2d1858ffc99e3c901cc6533cf601d13326ae9209c60821392456f8fb6509","observation_id":"1912ef61-47c5-439e-be22-b44e35444151","resolution":{"observed_at":"2026-07-08T03:14:31.504835Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:20:06.369582+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:20:06.369582+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14366","last_updated":"2024-09-07T02:52:29Z","snapshot_observed_at":"2026-08-13T00:00:46.126397Z","submitted_at":"2024-05-23T09:43:52Z","title":"MiniCache: KV Cache Compression in Depth Dimension for Large Language Models","version":2},"cited_work":{"arxiv_id":"2405.14366","doi":"10.48550/arxiv.2405.14366","metadata_source":"pith","pith_arxiv_id":"2405.14366","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mini- cache: Kv cache compression in depth dimension for large language models","venue":"cs.CL","work_id":"097b75b7-6841-48c4-be76-ef448c8fe83c","year":2024},"citing_paper":{"arxiv_id":"2607.08032","last_updated":"2026-07-09T01:15:03Z","snapshot_observed_at":"2026-08-15T04:39:02.467469Z","submitted_at":"2026-07-09T01:15:03Z","title":"What to Keep, What to Forget: A Rate--Distortion View of Memory Compaction in LLMs and Agents","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-07-10T01:26:59.421158Z"},"links":{"cited_paper":"/paper/2405.14366","citing_paper":"/paper/2607.08032"},"observation_digest":"sha256:e5c87dec2d6a338a5cb194c6b35f2631f7a6b31d506fc2180d67a9ed222e4165","observation_id":"8c1ab5a5-eceb-4b81-b1dc-7e73b170419a","resolution":{"observed_at":"2026-07-10T01:36:44.024412Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:20:06.369582+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:20:06.369582+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14366","last_updated":"2024-09-07T02:52:29Z","snapshot_observed_at":"2026-08-13T00:00:46.126397Z","submitted_at":"2024-05-23T09:43:52Z","title":"MiniCache: KV Cache Compression in Depth Dimension for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14366","snapshot_observed_at":"2026-08-01T23:22:31.121825Z","title":"Minicache: Kv cache compression in depth dimension for large language models.arXiv preprint arXiv:2405.14366,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15456","last_updated":"2026-07-24T02:15:23Z","snapshot_observed_at":"2026-08-15T23:22:38.930987Z","submitted_at":"2026-07-16T20:58:16Z","title":"Looped Latent Attention: Cross-Loop KV Compression for Looped Transformers","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-01T23:22:31.121825Z"},"links":{"cited_paper":"/paper/2405.14366","citing_paper":"/paper/2607.15456"},"observation_digest":"sha256:d6456f27260d9103e432383bc24286c858810d80932817e45a0f004c8a75fe02","observation_id":"9f43cf07-6576-47ee-b798-22ec9e9db6d5","resolution":{"observed_at":"2026-08-01T23:22:31.121825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14366","last_updated":"2024-09-07T02:52:29Z","snapshot_observed_at":"2026-08-13T00:00:46.126397Z","submitted_at":"2024-05-23T09:43:52Z","title":"MiniCache: KV Cache Compression in Depth Dimension for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14366","snapshot_observed_at":"2026-08-02T09:51:03.345462Z","title":"arXiv preprint arXiv:2405.14366 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16252","last_updated":"2026-06-27T03:25:36Z","snapshot_observed_at":"2026-08-16T03:57:24.561788Z","submitted_at":"2026-06-27T03:25:36Z","title":"SOS-LoRA: Static Orthogonal-Subspace Low-Rank Adaptation with Fixed Multi-Scale Scaling","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-02T09:51:03.345462Z"},"links":{"cited_paper":"/paper/2405.14366","citing_paper":"/paper/2607.16252"},"observation_digest":"sha256:4458bd32765c95fde04716363c9c06406eef4fd9005b88baaf6056a705be88c6","observation_id":"cb39eb81-8397-4bdb-985c-5218d34daf3d","resolution":{"observed_at":"2026-08-02T09:51:03.345462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2405.14366/citation-record","integrity":"/paper/2405.14366/integrity","json":"/paper/2405.14366/citation-record.json","paper":"/paper/2405.14366"},"outbound":[],"paper":{"arxiv_id":"2405.14366","last_updated":"2024-09-07T02:52:29Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-13T00:00:46.126397Z","submitted_at":"2024-05-23T09:43:52Z","title":"MiniCache: KV Cache Compression in Depth Dimension for Large Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 26 inbound Pith citation observations for arXiv:2405.14366."}