{"as_of":"2026-08-21T15:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:95518b8623615f5006528a02e663cd58e836fc5bafdfa9169999564132b60244","coverage":[{"denominator":33,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":33,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T10:41:08.967261Z","state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T00:50:51.344226Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-12T00:50:51.451312Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2607.10582","last_updated":"2026-07-12T05:35:26Z","snapshot_observed_at":"2026-08-21T08:29:21.515207Z","submitted_at":"2026-07-12T05:35:26Z","title":"MemDecay: Region-Aware KV Cache Eviction for Efficient LLM Agent Inference","version":1},"cited_work":{"arxiv_id":"2607.10582","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.10582","snapshot_observed_at":"2026-08-12T00:50:51.451312Z","title":"MemDecay: Region-Aware KV Cache Eviction for Efficient LLM Agent Inference","venue":"cs.LG","work_id":"6617da14-8199-4d0a-bb48-042b6ef5c49d","year":2026},"citing_paper":{"arxiv_id":"2608.07855","last_updated":"2026-08-08T01:50:55Z","snapshot_observed_at":"2026-08-20T06:01:34.741599Z","submitted_at":"2026-08-08T01:50:55Z","title":"CommitKV: Lifecycle-Aware KV Cache Compression via Commit Transitions for Multi-Turn Agents","version":1},"reference_index":183,"source":"arxiv_source","source_observed_at":"2026-08-12T00:50:51.344226Z"},"links":{"cited_paper":"/paper/2607.10582","citing_paper":"/paper/2608.07855"},"observation_digest":"sha256:abf1e6a708cf667bf7685d1c45c4aadd5e776234cb881556f4325fb0555e0f94","observation_id":"6f3c68d1-2b93-42c5-a5c9-389ce871a93b","resolution":{"observed_at":"2026-08-12T00:50:51.454835Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2607.10582/citation-record","integrity":"/paper/2607.10582/integrity","json":"/paper/2607.10582/citation-record.json","paper":"/paper/2607.10582"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T10:41:08.967261Z","title":"Efficient memory management for large language model serving with PagedAttention,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10582","last_updated":"2026-07-12T05:35:26Z","snapshot_observed_at":"2026-08-21T08:29:21.515207Z","submitted_at":"2026-07-12T05:35:26Z","title":"MemDecay: Region-Aware KV Cache Eviction for Efficient LLM Agent Inference","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-14T10:41:08.967261Z"},"links":{"citing_paper":"/paper/2607.10582"},"observation_digest":"sha256:24f8c83230f79c896031b0a2587f00ace53598cf202f931ad42bb48298b761d7","observation_id":"4f36011c-a7ce-48f4-803d-a4eea53f44fe","resolution":{"observed_at":"2026-07-14T10:41:08.967261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19442","last_updated":"2025-07-30T05:24:46Z","snapshot_observed_at":"2026-08-20T14:01:46.841630Z","submitted_at":"2024-12-27T04:17:57Z","title":"A Survey on Large Language Model Acceleration based on KV Cache Management","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19442","snapshot_observed_at":"2026-07-14T10:41:08.967261Z","title":"A survey on large language model acceleration based on KV cache management,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10582","last_updated":"2026-07-12T05:35:26Z","snapshot_observed_at":"2026-08-21T08:29:21.515207Z","submitted_at":"2026-07-12T05:35:26Z","title":"MemDecay: Region-Aware KV Cache Eviction for Efficient LLM Agent Inference","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-14T10:41:08.967261Z"},"links":{"cited_paper":"/paper/2412.19442","citing_paper":"/paper/2607.10582"},"observation_digest":"sha256:863edf2a8e82ca1d4579ab628cdcd857ad6a63dbc2d4d3564ec287101543eb85","observation_id":"5c92b6ea-b32b-4744-8896-2ca543c1da39","resolution":{"observed_at":"2026-07-14T10:41:08.967261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T10:41:08.967261Z","title":"Model tells you what to discard: Adaptive KV cache compression for LLMs,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10582","last_updated":"2026-07-12T05:35:26Z","snapshot_observed_at":"2026-08-21T08:29:21.515207Z","submitted_at":"2026-07-12T05:35:26Z","title":"MemDecay: Region-Aware KV Cache Eviction for Efficient LLM Agent Inference","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-14T10:41:08.967261Z"},"links":{"citing_paper":"/paper/2607.10582"},"observation_digest":"sha256:d9f1807067f51c543e10dd84ff3ce38fd15d582fd9c46aaa33f3f3b3237a5c34","observation_id":"350e4f42-fdfe-4fe7-9b88-21ae88e08b04","resolution":{"observed_at":"2026-07-14T10:41:08.967261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-08-12T20:32:53.188699Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.11550","snapshot_observed_at":"2026-07-14T10:41:08.967261Z","title":"Ada-KV: Optimizing KV cache eviction by adaptive budget allocation for efficient LLM inference,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10582","last_updated":"2026-07-12T05:35:26Z","snapshot_observed_at":"2026-08-21T08:29:21.515207Z","submitted_at":"2026-07-12T05:35:26Z","title":"MemDecay: Region-Aware KV Cache Eviction for Efficient LLM Agent Inference","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-14T10:41:08.967261Z"},"links":{"cited_paper":"/paper/2407.11550","citing_paper":"/paper/2607.10582"},"observation_digest":"sha256:44abc421140efe29b083ab51f8bb5e4883f77b6c20d6cd94130a3bde0925445a","observation_id":"fd1634c4-70f1-4929-ba94-e707d266f298","resolution":{"observed_at":"2026-07-14T10:41:08.967261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T10:41:08.967261Z","title":"H 2O: Heavy-hitter oracle for efficient generative inference of large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10582","last_updated":"2026-07-12T05:35:26Z","snapshot_observed_at":"2026-08-21T08:29:21.515207Z","submitted_at":"2026-07-12T05:35:26Z","title":"MemDecay: Region-Aware KV Cache Eviction for Efficient LLM Agent Inference","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-14T10:41:08.967261Z"},"links":{"citing_paper":"/paper/2607.10582"},"observation_digest":"sha256:7547e86e871d09c1d607770d29dbd86d3cabc71c751af8a07e519e3028ec75cc","observation_id":"9afaa519-d911-498c-8373-6776ba34ea27","resolution":{"observed_at":"2026-07-14T10:41:08.967261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T10:41:08.967261Z","title":"Efficient streaming language models with attention sinks,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10582","last_updated":"2026-07-12T05:35:26Z","snapshot_observed_at":"2026-08-21T08:29:21.515207Z","submitted_at":"2026-07-12T05:35:26Z","title":"MemDecay: Region-Aware KV Cache Eviction for Efficient LLM Agent Inference","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-14T10:41:08.967261Z"},"links":{"citing_paper":"/paper/2607.10582"},"observation_digest":"sha256:11100135867a5fb003b54d9c9f967db8607980557963b0a2806401708ffeefb8","observation_id":"0434c276-b9ab-4dcf-bb36-d9d944ae0d46","resolution":{"observed_at":"2026-07-14T10:41:08.967261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06104","last_updated":"2024-06-18T09:16:14Z","snapshot_observed_at":"2026-08-16T14:28:08.030037Z","submitted_at":"2024-01-11T18:35:26Z","title":"Transformers are Multi-State RNNs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06104","snapshot_observed_at":"2026-07-14T10:41:08.967261Z","title":"Transformers are multi-state RNNs,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10582","last_updated":"2026-07-12T05:35:26Z","snapshot_observed_at":"2026-08-21T08:29:21.515207Z","submitted_at":"2026-07-12T05:35:26Z","title":"MemDecay: Region-Aware KV Cache Eviction for Efficient LLM Agent Inference","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-14T10:41:08.967261Z"},"links":{"cited_paper":"/paper/2401.06104","citing_paper":"/paper/2607.10582"},"observation_digest":"sha256:8e45cdad5d3eae43916b0e4193466aaaeac68ebb8b69c5adaa1ae637a71ec16a","observation_id":"ea27f054-3853-440c-a141-84780c5d90fd","resolution":{"observed_at":"2026-07-14T10:41:08.967261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13501","last_updated":"2024-04-21T01:49:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-21T01:49:46Z","title":"A Survey on the Memory Mechanism of Large Language Model based Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13501","snapshot_observed_at":"2026-07-14T10:41:08.967261Z","title":"A survey on the memory mechanism of large language model based agents,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10582","last_updated":"2026-07-12T05:35:26Z","snapshot_observed_at":"2026-08-21T08:29:21.515207Z","submitted_at":"2026-07-12T05:35:26Z","title":"MemDecay: Region-Aware KV Cache Eviction for Efficient LLM Agent Inference","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-14T10:41:08.967261Z"},"links":{"cited_paper":"/paper/2404.13501","citing_paper":"/paper/2607.10582"},"observation_digest":"sha256:e4f1681fe039295e16521faebe0c3d81d8142a792085a4d22a39e080ac0d81b7","observation_id":"b25f484d-0b96-46b8-b283-fe320d042e79","resolution":{"observed_at":"2026-07-14T10:41:08.967261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.18825","last_updated":"2026-05-12T18:38:24Z","snapshot_observed_at":"2026-08-18T20:26:58.135553Z","submitted_at":"2026-05-12T18:38:24Z","title":"Not All Tokens Are Worth Caching: Learning Semantic-Aware Eviction for LLM Prefix Caches","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.18825","snapshot_observed_at":"2026-07-14T10:41:08.967261Z","title":"Not all tokens are worth caching: Learning semantic- aware eviction for LLM prefix caches,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10582","last_updated":"2026-07-12T05:35:26Z","snapshot_observed_at":"2026-08-21T08:29:21.515207Z","submitted_at":"2026-07-12T05:35:26Z","title":"MemDecay: Region-Aware KV Cache Eviction for Efficient LLM Agent Inference","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-14T10:41:08.967261Z"},"links":{"cited_paper":"/paper/2605.18825","citing_paper":"/paper/2607.10582"},"observation_digest":"sha256:83915a468eb780413725cb100fb41c99a00862e4b4d612c7fc45314c5d0ea5bb","observation_id":"cf72e7fd-b383-499b-a431-a20a9ebec4c2","resolution":{"observed_at":"2026-07-14T10:41:08.967261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T10:41:08.967261Z","title":"RoleKV: Role-aware KV cache management for the inverted age-importance of LLM agent context,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10582","last_updated":"2026-07-12T05:35:26Z","snapshot_observed_at":"2026-08-21T08:29:21.515207Z","submitted_at":"2026-07-12T05:35:26Z","title":"MemDecay: Region-Aware KV Cache Eviction for Efficient LLM Agent Inference","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-14T10:41:08.967261Z"},"links":{"citing_paper":"/paper/2607.10582"},"observation_digest":"sha256:eaf2968fb267698c921f5b71ba3a66da0562805156d09a9d7c0b754a8961bda7","observation_id":"b0f1d5fc-036e-4490-94a9-110c32705c81","resolution":{"observed_at":"2026-07-14T10:41:08.967261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15220","last_updated":"2024-08-01T07:51:25Z","snapshot_observed_at":"2026-08-16T14:15:57.940906Z","submitted_at":"2024-02-23T09:29:19Z","title":"ChunkAttention: Efficient Self-Attention with Prefix-Aware KV Cache and Two-Phase Partition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15220","snapshot_observed_at":"2026-07-14T10:41:08.967261Z","title":"ChunkAttention: Efficient self-attention with prefix-aware KV cache and two-phase partition,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10582","last_updated":"2026-07-12T05:35:26Z","snapshot_observed_at":"2026-08-21T08:29:21.515207Z","submitted_at":"2026-07-12T05:35:26Z","title":"MemDecay: Region-Aware KV Cache Eviction for Efficient LLM Agent Inference","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-14T10:41:08.967261Z"},"links":{"cited_paper":"/paper/2402.15220","citing_paper":"/paper/2607.10582"},"observation_digest":"sha256:ab107762d91f6f4f45e7c12e751bcbbaf84d81581c20b5f625255b39e8ba5239","observation_id":"08a7961a-011b-4b6f-b790-034d015d43d7","resolution":{"observed_at":"2026-07-14T10:41:08.967261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T10:41:08.967261Z","title":"CacheBlend: Fast large language model serving for RAG with cached knowledge fusion,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10582","last_updated":"2026-07-12T05:35:26Z","snapshot_observed_at":"2026-08-21T08:29:21.515207Z","submitted_at":"2026-07-12T05:35:26Z","title":"MemDecay: Region-Aware KV Cache Eviction for Efficient LLM Agent Inference","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-14T10:41:08.967261Z"},"links":{"citing_paper":"/paper/2607.10582"},"observation_digest":"sha256:6f132ec753db795fc3f8f17f8e1925bf898bb3de14b4b7a49fbcb91895263b9f","observation_id":"e0f38406-fbfb-4440-bd3d-c2159b5ba982","resolution":{"observed_at":"2026-07-14T10:41:08.967261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06297","last_updated":"2025-08-08T13:19:30Z","snapshot_observed_at":"2026-08-18T11:15:03.169582Z","submitted_at":"2025-08-08T13:19:30Z","title":"KV Cache Compression for Inference Efficiency in LLMs: A Review","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.06297","snapshot_observed_at":"2026-07-14T10:41:08.967261Z","title":"KV cache compression for inference efficiency in LLMs: A review,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10582","last_updated":"2026-07-12T05:35:26Z","snapshot_observed_at":"2026-08-21T08:29:21.515207Z","submitted_at":"2026-07-12T05:35:26Z","title":"MemDecay: Region-Aware KV Cache Eviction for Efficient LLM Agent Inference","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-14T10:41:08.967261Z"},"links":{"cited_paper":"/paper/2508.06297","citing_paper":"/paper/2607.10582"},"observation_digest":"sha256:f0df16a28f7e4f1b4b1bdd773e84b873e59e64da84dbf4b87031d75a21f591c7","observation_id":"0e4738c2-19df-4315-b1db-5f462903a60d","resolution":{"observed_at":"2026-07-14T10:41:08.967261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T10:41:08.967261Z","title":"Scissorhands: Exploiting the persistence of importance hypothesis for LLM KV cache compression at test time,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10582","last_updated":"2026-07-12T05:35:26Z","snapshot_observed_at":"2026-08-21T08:29:21.515207Z","submitted_at":"2026-07-12T05:35:26Z","title":"MemDecay: Region-Aware KV Cache Eviction for Efficient LLM Agent Inference","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-14T10:41:08.967261Z"},"links":{"citing_paper":"/paper/2607.10582"},"observation_digest":"sha256:3afe8364b91d34c04c2ab9319d51151856299c362217f89284191012536754fb","observation_id":"d8546e18-5f2d-4ccc-8860-07e5dbe81e06","resolution":{"observed_at":"2026-07-14T10:41:08.967261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14469","last_updated":"2024-06-17T03:01:58Z","snapshot_observed_at":"2026-08-14T12:21:04.886717Z","submitted_at":"2024-04-22T17:42:58Z","title":"SnapKV: LLM Knows What You are Looking for Before Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14469","snapshot_observed_at":"2026-07-14T10:41:08.967261Z","title":"SnapKV: LLM knows what you are looking for before generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10582","last_updated":"2026-07-12T05:35:26Z","snapshot_observed_at":"2026-08-21T08:29:21.515207Z","submitted_at":"2026-07-12T05:35:26Z","title":"MemDecay: Region-Aware KV Cache Eviction for Efficient LLM Agent Inference","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-14T10:41:08.967261Z"},"links":{"cited_paper":"/paper/2404.14469","citing_paper":"/paper/2607.10582"},"observation_digest":"sha256:a42a8816903260ab60bf6aee05ed71dd7580689e7af84b922c93d858cd01a30f","observation_id":"0340ab23-ea33-4827-9a37-e72c97a19b05","resolution":{"observed_at":"2026-07-14T10:41:08.967261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T10:41:08.967261Z","title":"NACL: A general and effective KV cache eviction framework for LLM at inference time,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10582","last_updated":"2026-07-12T05:35:26Z","snapshot_observed_at":"2026-08-21T08:29:21.515207Z","submitted_at":"2026-07-12T05:35:26Z","title":"MemDecay: Region-Aware KV Cache Eviction for Efficient LLM Agent Inference","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-14T10:41:08.967261Z"},"links":{"citing_paper":"/paper/2607.10582"},"observation_digest":"sha256:3fefcec57f985eab8ac625ea3bcbc3006033fc21a4c065cf2ef0cc8e16108527","observation_id":"f582c2a5-29ed-435d-ac7a-56ce24de0cb0","resolution":{"observed_at":"2026-07-14T10:41:08.967261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T10:41:08.967261Z","title":"Expected attention: KV cache compression by estimating attention from future queries distribution,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10582","last_updated":"2026-07-12T05:35:26Z","snapshot_observed_at":"2026-08-21T08:29:21.515207Z","submitted_at":"2026-07-12T05:35:26Z","title":"MemDecay: Region-Aware KV Cache Eviction for Efficient LLM Agent Inference","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-14T10:41:08.967261Z"},"links":{"citing_paper":"/paper/2607.10582"},"observation_digest":"sha256:9809b2d8270a0c886aac787799a34371b847820e360b9241e9e4718fc75bc340","observation_id":"79c7c93a-1b6c-4c10-b99a-32b14650c623","resolution":{"observed_at":"2026-07-14T10:41:08.967261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T10:41:08.967261Z","title":"Quest: Query-aware sparsity for efficient long-context LLM inference,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10582","last_updated":"2026-07-12T05:35:26Z","snapshot_observed_at":"2026-08-21T08:29:21.515207Z","submitted_at":"2026-07-12T05:35:26Z","title":"MemDecay: Region-Aware KV Cache Eviction for Efficient LLM Agent Inference","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-14T10:41:08.967261Z"},"links":{"citing_paper":"/paper/2607.10582"},"observation_digest":"sha256:ddba37b7586eda975166d6a402491625eedf76da57a28bc5b353277332171b5c","observation_id":"c0ad32f2-a22d-4f65-893a-82da3d67144b","resolution":{"observed_at":"2026-07-14T10:41:08.967261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03213","last_updated":"2025-06-14T06:17:33Z","snapshot_observed_at":"2026-08-14T21:26:50.903212Z","submitted_at":"2024-12-04T10:58:27Z","title":"ClusterKV: Manipulating LLM KV Cache in Semantic Space for Recallable Compression","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03213","snapshot_observed_at":"2026-07-14T10:41:08.967261Z","title":"ClusterKV: Manipu- lating LLM KV cache in semantic space for recallable compression,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10582","last_updated":"2026-07-12T05:35:26Z","snapshot_observed_at":"2026-08-21T08:29:21.515207Z","submitted_at":"2026-07-12T05:35:26Z","title":"MemDecay: Region-Aware KV Cache Eviction for Efficient LLM Agent Inference","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-14T10:41:08.967261Z"},"links":{"cited_paper":"/paper/2412.03213","citing_paper":"/paper/2607.10582"},"observation_digest":"sha256:350e40803beb720476bb2af6086f9fbade82f8769194db9338c1bf7e93a2c520","observation_id":"899d79c0-e253-414d-abfe-02877ba9f3c5","resolution":{"observed_at":"2026-07-14T10:41:08.967261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T10:41:08.967261Z","title":"ChunkKV: Semantic-preserving KV cache compression for efficient long-context LLM inference,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10582","last_updated":"2026-07-12T05:35:26Z","snapshot_observed_at":"2026-08-21T08:29:21.515207Z","submitted_at":"2026-07-12T05:35:26Z","title":"MemDecay: Region-Aware KV Cache Eviction for Efficient LLM Agent Inference","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-14T10:41:08.967261Z"},"links":{"citing_paper":"/paper/2607.10582"},"observation_digest":"sha256:31c022207a79aa280b8eaee3ef017ef040db902f1f7c9bb45175cccb9aa9c9cc","observation_id":"09a071a8-8537-47cb-a7d7-f81b57e9dd55","resolution":{"observed_at":"2026-07-14T10:41:08.967261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T10:41:08.967261Z","title":"KIVI: A tuning-free asymmetric 2bit quantization for KV cache,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10582","last_updated":"2026-07-12T05:35:26Z","snapshot_observed_at":"2026-08-21T08:29:21.515207Z","submitted_at":"2026-07-12T05:35:26Z","title":"MemDecay: Region-Aware KV Cache Eviction for Efficient LLM Agent Inference","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-14T10:41:08.967261Z"},"links":{"citing_paper":"/paper/2607.10582"},"observation_digest":"sha256:e77d3bbb46900ea0f290f3da6a5d083e540d19830d31e4635e791b80aa374d3a","observation_id":"ae54892c-c64d-41f2-bc24-d762eaa8d58e","resolution":{"observed_at":"2026-07-14T10:41:08.967261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.06676","last_updated":"2026-04-22T06:35:23Z","snapshot_observed_at":"2026-08-13T04:35:27.852720Z","submitted_at":"2026-04-22T06:35:23Z","title":"LKV: End-to-End Learning of Head-wise Budgets and Token Selection for LLM KV Cache Eviction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.06676","snapshot_observed_at":"2026-07-14T10:41:08.967261Z","title":"LKV: End-to-end learning of head-wise budgets and token selection for LLM KV cache eviction,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10582","last_updated":"2026-07-12T05:35:26Z","snapshot_observed_at":"2026-08-21T08:29:21.515207Z","submitted_at":"2026-07-12T05:35:26Z","title":"MemDecay: Region-Aware KV Cache Eviction for Efficient LLM Agent Inference","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-14T10:41:08.967261Z"},"links":{"cited_paper":"/paper/2605.06676","citing_paper":"/paper/2607.10582"},"observation_digest":"sha256:9169d557340bfd213627f0732eafec6eb42f8b24f474521a701fc5d43f7d436f","observation_id":"8ae4446e-6b58-4ce4-b870-3d85dd690c94","resolution":{"observed_at":"2026-07-14T10:41:08.967261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.02230","last_updated":"2026-05-25T23:34:23Z","snapshot_observed_at":"2026-08-20T02:29:27.571369Z","submitted_at":"2025-11-04T03:43:05Z","title":"Continuum: Efficient and Robust Multi-Turn LLM Agent Scheduling with KV Cache Time-to-Live","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.02230","snapshot_observed_at":"2026-07-14T10:41:08.967261Z","title":"Continuum: Efficient and robust multi-turn LLM agent scheduling with KV cache time-to-live,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10582","last_updated":"2026-07-12T05:35:26Z","snapshot_observed_at":"2026-08-21T08:29:21.515207Z","submitted_at":"2026-07-12T05:35:26Z","title":"MemDecay: Region-Aware KV Cache Eviction for Efficient LLM Agent Inference","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-14T10:41:08.967261Z"},"links":{"cited_paper":"/paper/2511.02230","citing_paper":"/paper/2607.10582"},"observation_digest":"sha256:323c4a4c983e8fc4b7dc1518fc252443f2b85f26b5055c827812d43d2adfc5af","observation_id":"ee8fa758-ca72-45e3-a305-147a6dec4270","resolution":{"observed_at":"2026-07-14T10:41:08.967261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T10:41:08.967261Z","title":"KVFlow: Efficient prefix caching for accelerating LLM- based multi-agent workflows,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10582","last_updated":"2026-07-12T05:35:26Z","snapshot_observed_at":"2026-08-21T08:29:21.515207Z","submitted_at":"2026-07-12T05:35:26Z","title":"MemDecay: Region-Aware KV Cache Eviction for Efficient LLM Agent Inference","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-14T10:41:08.967261Z"},"links":{"citing_paper":"/paper/2607.10582"},"observation_digest":"sha256:a1d08df0267173df6e467397a8d4c5fcb5c4a6794f16435f661a86c64b059b20","observation_id":"344ec41a-2574-4447-87ef-6a614fa5d03d","resolution":{"observed_at":"2026-07-14T10:41:08.967261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.09916","last_updated":"2026-06-06T15:54:48Z","snapshot_observed_at":"2026-08-01T16:04:11.631139Z","submitted_at":"2026-06-06T15:54:48Z","title":"IntentKV: Cross-Turn Intent-Aware KV Cache Pruning for Agent Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.09916","snapshot_observed_at":"2026-07-14T10:41:08.967261Z","title":"IntentKV: Cross-turn intent-aware KV cache pruning for agent inference,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10582","last_updated":"2026-07-12T05:35:26Z","snapshot_observed_at":"2026-08-21T08:29:21.515207Z","submitted_at":"2026-07-12T05:35:26Z","title":"MemDecay: Region-Aware KV Cache Eviction for Efficient LLM Agent Inference","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-14T10:41:08.967261Z"},"links":{"cited_paper":"/paper/2606.09916","citing_paper":"/paper/2607.10582"},"observation_digest":"sha256:d69c9a60c9ebf41c74e0da5cf463f6b95423fb26d921b9bfe56e4fed62210ee8","observation_id":"1e096443-a258-4b37-ba69-98679a8bdd40","resolution":{"observed_at":"2026-07-14T10:41:08.967261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T10:41:08.967261Z","title":"Cache what lasts: Token retention for memory-bounded KV cache in LLMs,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10582","last_updated":"2026-07-12T05:35:26Z","snapshot_observed_at":"2026-08-21T08:29:21.515207Z","submitted_at":"2026-07-12T05:35:26Z","title":"MemDecay: Region-Aware KV Cache Eviction for Efficient LLM Agent Inference","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-14T10:41:08.967261Z"},"links":{"citing_paper":"/paper/2607.10582"},"observation_digest":"sha256:57e68c103680bc381bb9b7a1648c44fa685b48fa226f0359ab6b92b5584a5971","observation_id":"3dacbf59-0cdd-4c13-8f8a-ce598e94aa5e","resolution":{"observed_at":"2026-07-14T10:41:08.967261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15965","last_updated":"2025-04-23T13:47:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T15:05:04Z","title":"From Human Memory to AI Memory: A Survey on Memory Mechanisms in the Era of LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.15965","snapshot_observed_at":"2026-07-14T10:41:08.967261Z","title":"From human memory to AI memory: A survey on memory mechanisms in the era of LLMs,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10582","last_updated":"2026-07-12T05:35:26Z","snapshot_observed_at":"2026-08-21T08:29:21.515207Z","submitted_at":"2026-07-12T05:35:26Z","title":"MemDecay: Region-Aware KV Cache Eviction for Efficient LLM Agent Inference","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-14T10:41:08.967261Z"},"links":{"cited_paper":"/paper/2504.15965","citing_paper":"/paper/2607.10582"},"observation_digest":"sha256:310c2e341f71a5b560562098bd9d7a4056d1ae3b3ee8c9119a42fa132b54022f","observation_id":"18a71781-cbfb-4810-94b8-2b628db851d9","resolution":{"observed_at":"2026-07-14T10:41:08.967261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.24786","last_updated":"2026-05-24T00:15:34Z","snapshot_observed_at":"2026-08-16T11:17:29.962837Z","submitted_at":"2026-05-24T00:15:34Z","title":"CONF-KV: Confidence-Aware KV Cache Eviction with Mixed-Precision Storage for Long-Horizon LLM","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.24786","snapshot_observed_at":"2026-07-14T10:41:08.967261Z","title":"CONF-KV: Confidence-aware KV cache eviction with mixed-precision storage for long-horizon LLM,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10582","last_updated":"2026-07-12T05:35:26Z","snapshot_observed_at":"2026-08-21T08:29:21.515207Z","submitted_at":"2026-07-12T05:35:26Z","title":"MemDecay: Region-Aware KV Cache Eviction for Efficient LLM Agent Inference","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-14T10:41:08.967261Z"},"links":{"cited_paper":"/paper/2605.24786","citing_paper":"/paper/2607.10582"},"observation_digest":"sha256:df15c0cb3d69a8b8fd55e068f4569159d06a36cf25296300e29ab0ba00615beb","observation_id":"9b41a0b9-8670-4a03-8d63-59bc1651e080","resolution":{"observed_at":"2026-07-14T10:41:08.967261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14838","last_updated":"2025-05-27T03:08:57Z","snapshot_observed_at":"2026-08-21T02:11:05.377768Z","submitted_at":"2024-12-19T13:28:42Z","title":"DynamicKV: Task-Aware Adaptive KV Cache Compression for Long Context LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14838","snapshot_observed_at":"2026-07-14T10:41:08.967261Z","title":"DynamicKV: Task-aware adaptive KV cache compres- sion for long context LLMs,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10582","last_updated":"2026-07-12T05:35:26Z","snapshot_observed_at":"2026-08-21T08:29:21.515207Z","submitted_at":"2026-07-12T05:35:26Z","title":"MemDecay: Region-Aware KV Cache Eviction for Efficient LLM Agent Inference","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-14T10:41:08.967261Z"},"links":{"cited_paper":"/paper/2412.14838","citing_paper":"/paper/2607.10582"},"observation_digest":"sha256:30308b95e973e41a599bf22e4f4ad8fc98c3699b1d3d07db135250d56b0983fd","observation_id":"a2b0cd05-6a7d-4054-aa8b-ca6dc843c250","resolution":{"observed_at":"2026-07-14T10:41:08.967261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T10:41:08.967261Z","title":"KVzip: Query-agnostic KV cache compression with context reconstruction,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10582","last_updated":"2026-07-12T05:35:26Z","snapshot_observed_at":"2026-08-21T08:29:21.515207Z","submitted_at":"2026-07-12T05:35:26Z","title":"MemDecay: Region-Aware KV Cache Eviction for Efficient LLM Agent Inference","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-14T10:41:08.967261Z"},"links":{"citing_paper":"/paper/2607.10582"},"observation_digest":"sha256:718492e0d3a103c43fce9c5899ed8229afb2a49c4b2ecae23b49cf2e27a7ebd2","observation_id":"c49b4022-9cd6-497f-9911-c2960239c642","resolution":{"observed_at":"2026-07-14T10:41:08.967261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T10:41:08.967261Z","title":"Improving WWW proxies performance with Greedy- Dual-Size-Frequency caching policy,","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2607.10582","last_updated":"2026-07-12T05:35:26Z","snapshot_observed_at":"2026-08-21T08:29:21.515207Z","submitted_at":"2026-07-12T05:35:26Z","title":"MemDecay: Region-Aware KV Cache Eviction for Efficient LLM Agent Inference","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-14T10:41:08.967261Z"},"links":{"citing_paper":"/paper/2607.10582"},"observation_digest":"sha256:8896b23c07b23c586fde65fcb8ca2181f224a8ea316e24dde163cccf23fe398f","observation_id":"8ca68255-496c-411d-bebb-3f3b27b86f9b","resolution":{"observed_at":"2026-07-14T10:41:08.967261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T10:41:08.967261Z","title":"RFC: Agent-aware KV cache phase 1 for agen- tic workloads,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10582","last_updated":"2026-07-12T05:35:26Z","snapshot_observed_at":"2026-08-21T08:29:21.515207Z","submitted_at":"2026-07-12T05:35:26Z","title":"MemDecay: Region-Aware KV Cache Eviction for Efficient LLM Agent Inference","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-14T10:41:08.967261Z"},"links":{"citing_paper":"/paper/2607.10582"},"observation_digest":"sha256:07d92d7701ab288535e876d54ded4106c4a5414380eddb2dd32667e93e63520f","observation_id":"613b8f58-3c3b-4404-815b-073f1d384a6b","resolution":{"observed_at":"2026-07-14T10:41:08.967261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T10:41:08.967261Z","title":"KV Cache Compression and Its Infra Problems,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10582","last_updated":"2026-07-12T05:35:26Z","snapshot_observed_at":"2026-08-21T08:29:21.515207Z","submitted_at":"2026-07-12T05:35:26Z","title":"MemDecay: Region-Aware KV Cache Eviction for Efficient LLM Agent Inference","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-14T10:41:08.967261Z"},"links":{"citing_paper":"/paper/2607.10582"},"observation_digest":"sha256:33db1de71afba9ae8314d2ac493b06b5891db0e1bc8b1821939f19a9ee58f166","observation_id":"f7aa01a4-b1d6-4c36-9653-ffaa9fa45421","resolution":{"observed_at":"2026-07-14T10:41:08.967261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.10582","last_updated":"2026-07-12T05:35:26Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-21T08:29:21.515207Z","submitted_at":"2026-07-12T05:35:26Z","title":"MemDecay: Region-Aware KV Cache Eviction for Efficient LLM Agent Inference"},"reference_resolution":{"displayed":33,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":33,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":33},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 33 of 33 outbound references and 1 inbound Pith citation observation for arXiv:2607.10582."}