{"as_of":"2026-08-09T22:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c220332954c7534d6454bd09822f0250a781cc36cb32dc4c5239dfa20dc5fb53","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T04:58:48.072701Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.22389/citation-record","integrity":"/paper/2607.22389/integrity","json":"/paper/2607.22389/citation-record.json","paper":"/paper/2607.22389"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-01T04:58:41.116950Z","title":"Mistral 7b,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-09T00:19:38.078824Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:41.116950Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:7effe1a4eab1446db70942d6647dcd6bb5ba534e00d44ed717f6529d24ee27fe","observation_id":"4a5eb13f-1a44-446a-a3a8-4ad8c73ae0c6","resolution":{"observed_at":"2026-08-01T04:58:41.116950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-01T04:58:41.221977Z","title":"Qwen2 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-09T00:19:38.078824Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:41.221977Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:89c3485172cedc202c0715fc550d781e7cae80f99f2c42c03d1e7e03c6f37ab9","observation_id":"d393a459-3d3a-45d5-8569-c0bd97478b75","resolution":{"observed_at":"2026-08-01T04:58:41.221977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:41.318115Z","title":"Llama 3 model card,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-09T00:19:38.078824Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:41.318115Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:9010334f3e3d4d5ad1cdc8070fbd4dbf815471e937004c47eaa5f283a0ebfcb1","observation_id":"b9b2bd9c-f749-42eb-9cb7-980212cc8ceb","resolution":{"observed_at":"2026-08-01T04:58:41.318115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:41.469197Z","title":"How long can context length of open-source llms truly promise?","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-09T00:19:38.078824Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:41.469197Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:87133f8725bdf20b3b57bfff016cc89f63ac6744d6c978f67c409d2277cbed9c","observation_id":"da7909b2-9490-49a6-86de-26876e8dbc64","resolution":{"observed_at":"2026-08-01T04:58:41.469197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:41.553081Z","title":"Language models are few-shot learners,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-09T00:19:38.078824Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:41.553081Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:f5cefedb2fcd133974f6ca9b8123608c13b2351cdce5b185116a3e5975ce0d56","observation_id":"aa6817ee-8830-46ac-a1cf-e0de2eed627d","resolution":{"observed_at":"2026-08-01T04:58:41.553081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:41.719217Z","title":"Mathcoder: Seamless code integration in llms for enhanced mathematical reasoning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-09T00:19:38.078824Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:41.719217Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:d21ce8b3f3864dc993ed401ba0dcefa2ed8106f54c2119fe2bd0150b9acea67f","observation_id":"a9d9bc7c-6939-467d-bd4f-49f6c3eb6c83","resolution":{"observed_at":"2026-08-01T04:58:41.719217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:41.837251Z","title":"Longbench: A bilingual, multitask benchmark for long context understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-09T00:19:38.078824Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:41.837251Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:42a597280dd478edf964ac2d0aa5ad3abb815c498fa9049f3ad4142d6c66a067","observation_id":"265aae74-fe63-4ce2-bff8-76c421346c67","resolution":{"observed_at":"2026-08-01T04:58:41.837251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:41.915830Z","title":"P3-llm: An integrated npu-pim accelerator for llm inference using hybrid numerical formats,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-09T00:19:38.078824Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:41.915830Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:e32a85891c94b1d45f9201a4cdee8294ff1f5b022909d06d6a357509a29bb308","observation_id":"b66a1dd3-0fe1-46a0-9064-8ec084fbd602","resolution":{"observed_at":"2026-08-01T04:58:41.915830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:42.060439Z","title":"A survey on large language model acceleration based on kv cache management,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-09T00:19:38.078824Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:42.060439Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:fda6c5058358843f8aaee88ed7e34e01cf7724697d85f5e665144f862e91762a","observation_id":"64458efa-d583-4833-b270-826b924a6558","resolution":{"observed_at":"2026-08-01T04:58:42.060439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:42.210027Z","title":"Codec: Prefix-shared decoding kernel for llms,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-09T00:19:38.078824Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:42.210027Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:fdc584eadab4adaa0f0c6511ee8457fee1eb41c0151845e77e4555e525ee24c7","observation_id":"1efbd9f7-260f-488c-b7d1-d0c26ae5ee0b","resolution":{"observed_at":"2026-08-01T04:58:42.210027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:42.300437Z","title":"Orca: A distributed serving system for transformer- based generative models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-09T00:19:38.078824Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:42.300437Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:ef71d866e353334d2ef843c903fad9c8cb8178052a9665e8db273a9099d004d2","observation_id":"d7ddd9b6-e43d-45d6-aeea-f49e8bbffe2f","resolution":{"observed_at":"2026-08-01T04:58:42.300437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:42.410203Z","title":"Splitwise: Efficient generative llm inference using phase splitting,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-09T00:19:38.078824Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:42.410203Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:66fa8d5310d144469db942e9260c3fe9a728da69589ca933481c41d28d95850d","observation_id":"f2bc9d2b-61b4-461b-8350-8052822ef91a","resolution":{"observed_at":"2026-08-01T04:58:42.410203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:42.511116Z","title":"Kivi: A tuning-free asymmetric 2bit quantization for kv cache,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-09T00:19:38.078824Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:42.511116Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:57bb4f5270a96b9ac2d163554d2880fdd402461114867eb8b856bb8efab86a80","observation_id":"91226077-408b-4a62-8895-c59e6dead0e7","resolution":{"observed_at":"2026-08-01T04:58:42.511116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:42.619086Z","title":"Efficient streaming language models with attention sinks,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-09T00:19:38.078824Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:42.619086Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:6c41f3c1c6c4f868258a9a9925efe32a09fd4471702cba4b2d670f95bb0c1a14","observation_id":"9444d6e0-37ff-4da2-b119-2d5ac9ffbcad","resolution":{"observed_at":"2026-08-01T04:58:42.619086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:42.712200Z","title":"Duoattention: Efficient long-context llm inference with retrieval and streaming heads,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-09T00:19:38.078824Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:42.712200Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:7839c1eabdebd3fbb9fe551da92700153bcab87c558bc51ea5ef09366c5f8891","observation_id":"64b35529-fa0f-45f7-9700-bc509221e412","resolution":{"observed_at":"2026-08-01T04:58:42.712200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:42.821069Z","title":"Snapkv: Llm knows what you are looking for before gener- ation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-09T00:19:38.078824Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:42.821069Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:02ba103b90ef7f582ce114f26bfe1d2907f25a4c617a7b0b72cb3916167e8233","observation_id":"17e9a2ab-f619-4ccc-8439-672908bf54cf","resolution":{"observed_at":"2026-08-01T04:58:42.821069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:42.925778Z","title":"Sepllm: Accelerate large language models by com- pressing one segment into one separator,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-09T00:19:38.078824Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:42.925778Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:9c98f7bd4a24f4feb2be19879b7fa67427b2979c5aad67dbe4b50c623518ddcb","observation_id":"f01aef9d-f544-4f9e-81b1-22137343fa9d","resolution":{"observed_at":"2026-08-01T04:58:42.925778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:42.999165Z","title":"Lm-infinite: Zero-shot extreme length generalization for large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-09T00:19:38.078824Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:42.999165Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:6b174f06687fd8b72c589cc2c29b6b6aff9bed2bbc2cb10f333e82fee39e91cb","observation_id":"71c03b91-62dc-4df3-88b6-452aaa2d9d7b","resolution":{"observed_at":"2026-08-01T04:58:42.999165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-01T04:58:43.070342Z","title":"Longformer: The long-document transformer,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-09T00:19:38.078824Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:43.070342Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:a41c0485b349c238045dd5f342c3a7088d1dd91ea318770c68d5a167e4bee5a9","observation_id":"9f39ce39-6cc0-495b-966b-d541fcf165f6","resolution":{"observed_at":"2026-08-01T04:58:43.070342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:43.182267Z","title":"H2o: Heavy-hitter oracle for efficient generative inference of large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-09T00:19:38.078824Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:43.182267Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:5151134c24ce90dfdf01e2c3f3af87d5c8c8e43553a4d4c74ac71bf89ed99635","observation_id":"23a69917-216f-40a3-b323-06d044da6719","resolution":{"observed_at":"2026-08-01T04:58:43.182267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:43.305148Z","title":"Scissorhands: Exploiting the persistence of importance hypothesis for llm kv cache compression at test time,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-09T00:19:38.078824Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:43.305148Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:df0432110875580bfec0623b80d23ad9b50487e5fd1e9eaae719402fce7c8a03","observation_id":"54487552-cbc4-45c4-a1d4-2f33166ce04a","resolution":{"observed_at":"2026-08-01T04:58:43.305148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:43.394240Z","title":"Kvo-llm: Boosting long-context generation throughput for batched llm inference,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-09T00:19:38.078824Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:43.394240Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:fe9556db8e651a0dca051708c895bcc4bc66f01150d2ceebd0036d59b26da4cb","observation_id":"318a4ef6-4f36-4e23-939a-687ecb7d8edd","resolution":{"observed_at":"2026-08-01T04:58:43.394240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:43.506772Z","title":"Keyformer: Kv cache reduction through key tokens selection for efficient generative inference,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-09T00:19:38.078824Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:43.506772Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:3f055425c946361cc09b71a2051255e0e2c7252556d7ff8d64e6ec985816ed3d","observation_id":"8e2cabfc-b120-4daf-86f8-207a0a322d8b","resolution":{"observed_at":"2026-08-01T04:58:43.506772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:43.606157Z","title":"Alisa: Accelerating large language model inference via sparsity-aware kv caching,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-09T00:19:38.078824Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:43.606157Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:1072b2c59bb00ee5e8099f55d468534fcbc4e95a720a21dd7b07a7ca440f0b5a","observation_id":"313f3b18-dce6-4810-b5ce-f1a393fa2957","resolution":{"observed_at":"2026-08-01T04:58:43.606157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:43.696933Z","title":"Mata: A memory-efficient attention accelerator for llms exploiting look-back kv cache pruning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-09T00:19:38.078824Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:43.696933Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:16e49425b07773c012765eeedcbc9057b2de649bf23be3dc64413de5ce203786","observation_id":"2d78b5e8-4f14-4873-93fa-b52b7a00c4d3","resolution":{"observed_at":"2026-08-01T04:58:43.696933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:43.829479Z","title":"Unicaim: A unified cam/cim architecture with static- dynamic kv cache pruning for efficient long-context llm inference,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-09T00:19:38.078824Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:43.829479Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:24f351be6712e6b016c89d3bf11e6c5427c4d55b51031cc5615173b5014c7ecc","observation_id":"88bcf029-6fc7-4492-8f9d-7280cd5933e4","resolution":{"observed_at":"2026-08-01T04:58:43.829479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:43.934750Z","title":"Token-picker: Accelerating attention in text generation with minimized memory transfer via probability estimation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-09T00:19:38.078824Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:43.934750Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:8fe371b60c651e4884cca9cc11dbfaed6ac8fd9a627d860c8cdf9fee00e0fa65","observation_id":"d746782c-237a-4ea6-850b-e105d2e2bfc5","resolution":{"observed_at":"2026-08-01T04:58:43.934750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:44.011211Z","title":"Dias: Distance-based attention sparsity for ultra-long- sequence transformer with tree-like processing-in-memory architecture,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-09T00:19:38.078824Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:44.011211Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:86c654422f6d59b20b45d5a4b233c40a04c3097793b1a7bb1af752c578b85a07","observation_id":"79c477fa-51e5-4b0a-8746-14a8ec912734","resolution":{"observed_at":"2026-08-01T04:58:44.011211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:44.075196Z","title":"Veda: Efficient llm generation through voting-based kv cache eviction and dataflow-flexible accelerator,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-09T00:19:38.078824Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:44.075196Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:cea0dc46c193d32adbb6ac9ed5033d36fde2fba5a6193bc4ade395c27d434dea","observation_id":"fd5d4989-9e38-45d6-93e6-795bbd388645","resolution":{"observed_at":"2026-08-01T04:58:44.075196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:44.170208Z","title":"Kv-cache oriented query-aware sparse attention accelerator with cross-stage precision-configurable digital cim,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-09T00:19:38.078824Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:44.170208Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:cf15d8eb074830c7d8317f0c28c170e5984da9d53581d901499eb0d40cf3e83d","observation_id":"20e531de-bec9-4f9a-b671-a9e308b1d187","resolution":{"observed_at":"2026-08-01T04:58:44.170208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:44.321904Z","title":"End-to-end acceleration of generative models with runtime regularized kv cache management,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-09T00:19:38.078824Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:44.321904Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:cccef5eb0999d9923e6e8cd596010f4b196564371f4bd10329aa91dd32b55481","observation_id":"fc0f6cc6-865f-4b67-af00-7818900e3b05","resolution":{"observed_at":"2026-08-01T04:58:44.321904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:44.430466Z","title":"Edgellm: A highly efficient cpu-fpga heterogeneous edge accelerator for large language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-09T00:19:38.078824Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:44.430466Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:a657e82dc2f02d9abe858e513d7cee94242977665483793d9a12e53b35d20c60","observation_id":"deeb2018-df6f-49d8-af1b-701c3b66cca0","resolution":{"observed_at":"2026-08-01T04:58:44.430466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:44.529874Z","title":"Distserve: Disaggregating prefill and decoding for goodput-optimized large language model serving,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-09T00:19:38.078824Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:44.529874Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:c0a73418180761d65bf61d611659f5759bca7930f1b9d1e8eacf7da36992c962","observation_id":"082819a2-cf6e-4748-b2e9-7663597bb079","resolution":{"observed_at":"2026-08-01T04:58:44.529874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:44.760684Z","title":"Flightllm: Efficient large language model inference with a complete mapping flow on fpgas,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-09T00:19:38.078824Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:44.760684Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:69d343d51053833a3f4dd800d86a509626af49bb78e58173e4180df729c43a04","observation_id":"63bd56cf-985d-4172-ba8b-b72d0e54149a","resolution":{"observed_at":"2026-08-01T04:58:44.760684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:44.943518Z","title":"Ofq-llm: Outlier-flexing quantization for efficient low- bit large language model acceleration,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-09T00:19:38.078824Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:44.943518Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:1dbdb690cbff3f5be55f80ff71f8abcb6b1c9084666bc80cfd10f9f0f41cfa4c","observation_id":"7f0df5c5-732d-48a8-902d-ee7f519581f4","resolution":{"observed_at":"2026-08-01T04:58:44.943518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:45.144166Z","title":"Kv cache compression, but what must we give in return? a comprehensive benchmark of long context capable approaches,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-09T00:19:38.078824Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:45.144166Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:63632077d0f01581d3a3d452b1e0b45ad565bba007b07751581720467c57079f","observation_id":"ca253343-8b28-448c-901b-7b5abf8a5582","resolution":{"observed_at":"2026-08-01T04:58:45.144166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:45.303812Z","title":"Apt-llm: Exploiting arbitrary-precision tensor core comput- ing for llm acceleration,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-09T00:19:38.078824Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:45.303812Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:23f5a29fb6c4d967871e576abe9c7523439f9a96cff4a201093630cb58f71a7a","observation_id":"e20f6a49-0c49-43c5-94ad-f2b9c415ab98","resolution":{"observed_at":"2026-08-01T04:58:45.303812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14294","last_updated":"2024-07-19T04:47:36Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T15:53:08Z","title":"A Survey on Efficient Inference for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14294","snapshot_observed_at":"2026-08-01T04:58:45.474492Z","title":"A survey on efficient inference for large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-09T00:19:38.078824Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:45.474492Z"},"links":{"cited_paper":"/paper/2404.14294","citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:ee976e548dacd15673d56cce870ce7a8ba470e08537727392ca216ed5789068f","observation_id":"abc3d7e8-46f9-48a6-b05e-c1b19e0be6fb","resolution":{"observed_at":"2026-08-01T04:58:45.474492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:45.605674Z","title":"When to stop? towards efficient code generation in llms with excess token prevention,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-09T00:19:38.078824Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:45.605674Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:329eb7659848556a8574707c2a11f1224f1bcba87819ae65bf6f3903d8edfe4c","observation_id":"b3a0208c-2ad0-46de-b0b8-7c0713d15844","resolution":{"observed_at":"2026-08-01T04:58:45.605674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:45.795483Z","title":"Llmcompass: Enabling efficient hardware design for large language model inference,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-09T00:19:38.078824Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:45.795483Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:77e5eaa85a7e3f285d9ce156397471007689661ae63e293fa3317ef57b5bc83c","observation_id":"d6ec201e-38ec-4d68-a31d-44fe07b3fea5","resolution":{"observed_at":"2026-08-01T04:58:45.795483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:46.038243Z","title":"Energy cost modelling for optimizing large language model inference on hardware accelerators,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-09T00:19:38.078824Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:46.038243Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:df44be2d9db793be57fb8ba4b01afe34b31cf061db7d5337bfeff3a3d5a76ce6","observation_id":"604e267d-01bf-49e1-805d-3ab2733c5df8","resolution":{"observed_at":"2026-08-01T04:58:46.038243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16363","last_updated":"2024-05-01T20:42:28Z","snapshot_observed_at":"2026-08-01T22:52:35.092898Z","submitted_at":"2024-02-26T07:33:05Z","title":"LLM Inference Unveiled: Survey and Roofline Model Insights","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16363","snapshot_observed_at":"2026-08-01T04:58:46.181845Z","title":"Llm inference unveiled: Survey and roofline model insights,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-09T00:19:38.078824Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:46.181845Z"},"links":{"cited_paper":"/paper/2402.16363","citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:9e98dfe006272f54865c773964a8d06a4ebb3db50503f3bae2340e4023357a52","observation_id":"9168e695-d063-4ad4-9634-4fa85f8a9393","resolution":{"observed_at":"2026-08-01T04:58:46.181845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:46.374845Z","title":"Skipkv: Selective skipping of kv generation and storage for efficient inference with large reasoning models,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-09T00:19:38.078824Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:46.374845Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:3f167cb6a15de9c27ada759373e2aec7b5e82fc065bcf702efc9f5e2a9ab2be3","observation_id":"89491f21-4613-47d2-8be2-e7c1ee4649b6","resolution":{"observed_at":"2026-08-01T04:58:46.374845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:46.548695Z","title":"Titanus: Enabling kv cache pruning and quantization on-the-fly for llm acceleration,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-09T00:19:38.078824Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:46.548695Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:3d34160378610f6930212cc1f31f146e416a998a6b0ac2b3aaed4878e5366519","observation_id":"9a0e496a-1570-4ff2-900b-8d6699310dce","resolution":{"observed_at":"2026-08-01T04:58:46.548695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:46.763518Z","title":"Infinigen: Efficient generative inference of large language models with dynamic kv cache management,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-09T00:19:38.078824Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:46.763518Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:5fc0ac3e514ab3de795119b1904b95b24b5189828e140a1e2d02716eef0c45c7","observation_id":"605bc04d-cf93-41d7-a727-1a6322b69f05","resolution":{"observed_at":"2026-08-01T04:58:46.763518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:47.016141Z","title":"Sparq attention: Bandwidth-efficient llm inference,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-09T00:19:38.078824Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:47.016141Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:541f686afaf4d8d6a3c03171091a08e4f181ef5203d984c40d44673b45c98fff","observation_id":"3fe095db-cf41-4bfe-b822-d71c0a6c13f6","resolution":{"observed_at":"2026-08-01T04:58:47.016141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:47.163798Z","title":"Algorithm 232: Heapsort,","venue":null,"work_id":null,"year":1964},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-09T00:19:38.078824Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:47.163798Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:b9a65064e427eb03e60f1a68c4091d5329ca211bb16130bfacac2b8554d387d6","observation_id":"610a51a3-5140-4cf8-873c-e171f7a54f2f","resolution":{"observed_at":"2026-08-01T04:58:47.163798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:47.269194Z","title":"Sorting networks and their applications,","venue":null,"work_id":null,"year":1968},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-09T00:19:38.078824Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:47.269194Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:c13a2125e318a1457b241765be3a07fe75f4757a4e545d24ef9224afca1a6644","observation_id":"f3832966-788f-4656-a365-4e0ff33f09a0","resolution":{"observed_at":"2026-08-01T04:58:47.269194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:47.421112Z","title":"Efficient memory management for large language model serving with PagedAttention,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-09T00:19:38.078824Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:47.421112Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:8eefb61976636dffd5f861e9c7e391455bba16f376bbf0958567b85bd38afffc","observation_id":"1da2e8d6-b1c9-4d46-ab3b-8d346b62474f","resolution":{"observed_at":"2026-08-01T04:58:47.421112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:47.516573Z","title":"Anda: Unlocking efficient llm inference with a variable- length grouped activation data format,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-09T00:19:38.078824Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:47.516573Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:5ca2e567bb06a402b6546b1ce2ecc75258098e78edeea17c3074a0f415cc9e3b","observation_id":"5bbae7ab-3070-43ee-8ecf-b4e80e042fe3","resolution":{"observed_at":"2026-08-01T04:58:47.516573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:47.631238Z","title":"Ten lessons from three generations shaped google’s tpuv4i: Industrial product,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-09T00:19:38.078824Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:47.631238Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:4b49d1c57a03d8e96b6eb46d70d186b3e778c3449d40c36e19c02ed83966d371","observation_id":"ef6216b1-3f70-4659-8ed8-230610832737","resolution":{"observed_at":"2026-08-01T04:58:47.631238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:47.771700Z","title":"Dramsim3: A cycle-accurate, thermal-capable dram sim- ulator,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-09T00:19:38.078824Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:47.771700Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:616aa98da17d2a13f84c91b8d9f0f2e8814b5505bd736a8134b883a71cbfe566","observation_id":"ab6c5676-5725-4df3-8714-ccfd8c9d5462","resolution":{"observed_at":"2026-08-01T04:58:47.771700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:47.864332Z","title":"Ada-kv: Optimizing kv cache eviction by adaptive budget allocation for efficient llm inference,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-09T00:19:38.078824Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:47.864332Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:2862d41271b1d0865badd2daa6640a8d5d616ee6ae32edaab1254cd24081ab81","observation_id":"6d45b6d6-2d5b-49e7-83f1-77b9cf4008f3","resolution":{"observed_at":"2026-08-01T04:58:47.864332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:47.969320Z","title":"Dynamickv: Task-aware adaptive kv cache compression for long context llms,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-09T00:19:38.078824Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:47.969320Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:f8eafbfc7c4ecd2b051d8e1d192a4903bc2ffc0a3f8cb3d7482a054fe498b70b","observation_id":"469204c9-e339-46d2-a2b8-a54f42bcba56","resolution":{"observed_at":"2026-08-01T04:58:47.969320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:48.072701Z","title":"DeepScaleTool: A tool for the accurate estimation of technology scaling in the deep-submicron era,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-09T00:19:38.078824Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:48.072701Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:60921dda9584aebf11f40090cff9d3b2f78d8bf1a730b4013363e782e287c657","observation_id":"9345b92f-f78d-4469-8e47-d447e96ef55d","resolution":{"observed_at":"2026-08-01T04:58:48.072701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","latest_version":1,"primary_category":"cs.AR","snapshot_observed_at":"2026-08-09T00:19:38.078824Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":55,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 0 inbound Pith citation observations for arXiv:2607.22389."}