{"as_of":"2026-08-16T19:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f81d737315009abbf610479af714a8711e056f11b28be6b7faed65fcc571a972","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":37,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T18:40:37.603820Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T01:36:44.121083Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2407.21118","last_updated":"2024-11-04T02:08:55Z","snapshot_observed_at":"2026-08-16T13:29:46.132956Z","submitted_at":"2024-07-30T18:19:38Z","title":"Palu: Compressing KV-Cache with Low-Rank Projection","version":2},"cited_work":{"arxiv_id":"2407.21118","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.21118","snapshot_observed_at":"2026-07-10T01:36:44.121083Z","title":"Palu: Compressing kv-cache with low-rank projection.arXiv preprint arXiv:2407.21118","venue":"cs.AI","work_id":"dc6247ce-a2da-431d-a935-3fb13543cb13","year":2024},"citing_paper":{"arxiv_id":"2312.05821","last_updated":"2025-08-28T03:57:52Z","snapshot_observed_at":"2026-08-16T15:03:40.750477Z","submitted_at":"2023-12-10T08:41:24Z","title":"ASVD: Activation-aware Singular Value Decomposition for Compressing Large Language Models","version":5},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-20T13:49:33.747672Z"},"links":{"cited_paper":"/paper/2407.21118","citing_paper":"/paper/2312.05821"},"observation_digest":"sha256:9f989f010d70d802a7ebea46d4ad5c58dcf9e3aaac4e47a4d9863a814a9b2cb5","observation_id":"f73c71fa-3690-4967-8845-19cad3674fec","resolution":{"observed_at":"2026-05-20T13:49:33.802941Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21118","last_updated":"2024-11-04T02:08:55Z","snapshot_observed_at":"2026-08-16T13:29:46.132956Z","submitted_at":"2024-07-30T18:19:38Z","title":"Palu: Compressing KV-Cache with Low-Rank Projection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21118","snapshot_observed_at":"2026-08-12T11:56:33.034655Z","title":"S., and Wu, K.-C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17685","last_updated":"2024-11-26T18:52:06Z","snapshot_observed_at":"2026-08-16T19:06:09.721923Z","submitted_at":"2024-11-26T18:52:06Z","title":"Attamba: Attending To Multi-Token States","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-12T11:56:33.034655Z"},"links":{"cited_paper":"/paper/2407.21118","citing_paper":"/paper/2411.17685"},"observation_digest":"sha256:ce94d441e145e4d580eac15094772e198a2d2ff812cc512edc3174ba06ddd47e","observation_id":"e3967fdd-1b7c-46d2-ac7e-5fb0b7207041","resolution":{"observed_at":"2026-08-12T11:56:33.034655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21118","last_updated":"2024-11-04T02:08:55Z","snapshot_observed_at":"2026-08-16T13:29:46.132956Z","submitted_at":"2024-07-30T18:19:38Z","title":"Palu: Compressing KV-Cache with Low-Rank Projection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21118","snapshot_observed_at":"2026-08-11T12:22:38.776013Z","title":"S., and Wu, K.-C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.776013Z"},"links":{"cited_paper":"/paper/2407.21118","citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:820390d9b1e03767dccdafcd4cd6c65e3634ec1467a9ce646c11a98418ceed80","observation_id":"323c0ab9-4f1b-4b74-ad4e-9bb33b0d543a","resolution":{"observed_at":"2026-08-11T12:22:38.776013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21118","last_updated":"2024-11-04T02:08:55Z","snapshot_observed_at":"2026-08-16T13:29:46.132956Z","submitted_at":"2024-07-30T18:19:38Z","title":"Palu: Compressing KV-Cache with Low-Rank Projection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21118","snapshot_observed_at":"2026-08-11T00:38:46.985213Z","title":"Palu: Compressing kv-cache with low-rank projection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19442","last_updated":"2025-07-30T05:24:46Z","snapshot_observed_at":"2026-08-15T13:24:51.697670Z","submitted_at":"2024-12-27T04:17:57Z","title":"A Survey on Large Language Model Acceleration based on KV Cache Management","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-11T00:38:46.985213Z"},"links":{"cited_paper":"/paper/2407.21118","citing_paper":"/paper/2412.19442"},"observation_digest":"sha256:b955f117b360f4390bb8d40e511066fee6f26f4fd43c87401337d856b72f8482","observation_id":"3ff7df90-6c6e-49d1-80ec-2aa6f8355212","resolution":{"observed_at":"2026-08-11T00:38:46.985213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21118","last_updated":"2024-11-04T02:08:55Z","snapshot_observed_at":"2026-08-16T13:29:46.132956Z","submitted_at":"2024-07-30T18:19:38Z","title":"Palu: Compressing KV-Cache with Low-Rank Projection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21118","snapshot_observed_at":"2026-08-09T20:34:01.189891Z","title":"Palu: Compressing kv-cache with low-rank projection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.19392","last_updated":"2025-02-28T18:04:52Z","snapshot_observed_at":"2026-08-12T17:04:32.510964Z","submitted_at":"2025-01-31T18:47:42Z","title":"Cache Me If You Must: Adaptive Key-Value Quantization for Large Language Models","version":4},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.189891Z"},"links":{"cited_paper":"/paper/2407.21118","citing_paper":"/paper/2501.19392"},"observation_digest":"sha256:837b4944ff68d9690bb3c4c2aacd7cb06297fe194acccf9571a2675d68c43ba4","observation_id":"9e72fe70-0f02-408e-ad53-19ad07a7a089","resolution":{"observed_at":"2026-08-09T20:34:01.189891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21118","last_updated":"2024-11-04T02:08:55Z","snapshot_observed_at":"2026-08-16T13:29:46.132956Z","submitted_at":"2024-07-30T18:19:38Z","title":"Palu: Compressing KV-Cache with Low-Rank Projection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21118","snapshot_observed_at":"2026-08-08T11:48:01.171526Z","title":"Palu: Compressing kv-cache with low-rank projection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07864","last_updated":"2025-06-12T11:45:57Z","snapshot_observed_at":"2026-08-10T11:58:20.177769Z","submitted_at":"2025-02-11T18:20:18Z","title":"TransMLA: Multi-Head Latent Attention Is All You Need","version":5},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-08T11:48:01.171526Z"},"links":{"cited_paper":"/paper/2407.21118","citing_paper":"/paper/2502.07864"},"observation_digest":"sha256:067f24b39cd476fc3e5fddf3df71913add3e5e90ba3a54b22fe3e50858f75f83","observation_id":"def58ec3-b6a0-4d23-a0ba-3f4148078342","resolution":{"observed_at":"2026-08-08T11:48:01.171526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21118","last_updated":"2024-11-04T02:08:55Z","snapshot_observed_at":"2026-08-16T13:29:46.132956Z","submitted_at":"2024-07-30T18:19:38Z","title":"Palu: Compressing KV-Cache with Low-Rank Projection","version":2},"cited_work":{"arxiv_id":"2407.21118","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.21118","snapshot_observed_at":"2026-07-10T01:36:44.121083Z","title":"Palu: Compressing kv-cache with low-rank projection.arXiv preprint arXiv:2407.21118","venue":"cs.AI","work_id":"dc6247ce-a2da-431d-a935-3fb13543cb13","year":2024},"citing_paper":{"arxiv_id":"2505.12942","last_updated":"2026-05-12T22:54:57Z","snapshot_observed_at":"2026-08-15T02:39:36.208018Z","submitted_at":"2025-05-19T10:29:32Z","title":"A3 : an Analytical Low-Rank Approximation Framework for Attention","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-22T15:02:33.864861Z"},"links":{"cited_paper":"/paper/2407.21118","citing_paper":"/paper/2505.12942"},"observation_digest":"sha256:d04dbcf6f6d60cfc115d815cdb00c402a52a6627ed04d7198da0c7a8a1f1a734","observation_id":"f857c088-56f1-40a0-b779-0614274d8b18","resolution":{"observed_at":"2026-05-22T15:04:57.131560Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21118","last_updated":"2024-11-04T02:08:55Z","snapshot_observed_at":"2026-08-16T13:29:46.132956Z","submitted_at":"2024-07-30T18:19:38Z","title":"Palu: Compressing KV-Cache with Low-Rank Projection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21118","snapshot_observed_at":"2026-08-07T14:36:25.552150Z","title":"Palu: Compressing KV-cache with low-rank projection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18413","last_updated":"2025-05-23T22:39:54Z","snapshot_observed_at":"2026-08-16T06:44:53.557703Z","submitted_at":"2025-05-23T22:39:54Z","title":"LatentLLM: Attention-Aware Joint Tensor Compression","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:36:25.552150Z"},"links":{"cited_paper":"/paper/2407.21118","citing_paper":"/paper/2505.18413"},"observation_digest":"sha256:03b2c5187c309fae542badb662039048eb8490a7929aca1ecf97224fada6ed9e","observation_id":"de377a09-f03b-457f-b1bd-0eb0dffa5fe3","resolution":{"observed_at":"2026-08-07T14:36:25.552150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21118","last_updated":"2024-11-04T02:08:55Z","snapshot_observed_at":"2026-08-16T13:29:46.132956Z","submitted_at":"2024-07-30T18:19:38Z","title":"Palu: Compressing KV-Cache with Low-Rank Projection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21118","snapshot_observed_at":"2026-08-07T13:32:30.031025Z","title":"Abdelfattah, and Kai-Chiang Wu","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T13:32:30.031025Z"},"links":{"cited_paper":"/paper/2407.21118","citing_paper":"/paper/2505.21487"},"observation_digest":"sha256:300c3eb079dfbb363306d584cd7bf657b1590065a8795b3977980fa030c0bf67","observation_id":"7e5ea5fb-a49e-40fb-b73a-2d4c9cb73d6a","resolution":{"observed_at":"2026-08-07T13:32:30.031025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21118","last_updated":"2024-11-04T02:08:55Z","snapshot_observed_at":"2026-08-16T13:29:46.132956Z","submitted_at":"2024-07-30T18:19:38Z","title":"Palu: Compressing KV-Cache with Low-Rank Projection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21118","snapshot_observed_at":"2026-08-07T10:45:09.825323Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04642","last_updated":"2025-06-05T05:23:38Z","snapshot_observed_at":"2026-08-11T12:22:25.485792Z","submitted_at":"2025-06-05T05:23:38Z","title":"TaDA: Training-free recipe for Decoding with Adaptive KV Cache Compression and Mean-centering","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T10:45:09.825323Z"},"links":{"cited_paper":"/paper/2407.21118","citing_paper":"/paper/2506.04642"},"observation_digest":"sha256:6df5d9543048d904a3e4ec566f424cfc26de0855f099f6e8c18f9ebd0ed8c382","observation_id":"484ef146-5291-4782-9dd0-fdc49ba24a4b","resolution":{"observed_at":"2026-08-07T10:45:09.825323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21118","last_updated":"2024-11-04T02:08:55Z","snapshot_observed_at":"2026-08-16T13:29:46.132956Z","submitted_at":"2024-07-30T18:19:38Z","title":"Palu: Compressing KV-Cache with Low-Rank Projection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21118","snapshot_observed_at":"2026-08-07T06:04:26.941477Z","title":"Palu: Compressing kv-cache with low-rank projection.arXiv preprint arXiv:2407.21118, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06266","last_updated":"2025-06-13T17:58:55Z","snapshot_observed_at":"2026-08-16T06:23:05.141323Z","submitted_at":"2025-06-06T17:48:23Z","title":"Cartridges: Lightweight and general-purpose long context representations via self-study","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T06:04:26.941477Z"},"links":{"cited_paper":"/paper/2407.21118","citing_paper":"/paper/2506.06266"},"observation_digest":"sha256:4d366eb7fc86a5b4ebdc94cc1ce99a1d4689628ea357d4a2eb422ab10382e845","observation_id":"6b808613-58d1-4cf3-b466-da47f926ab65","resolution":{"observed_at":"2026-08-07T06:04:26.941477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21118","last_updated":"2024-11-04T02:08:55Z","snapshot_observed_at":"2026-08-16T13:29:46.132956Z","submitted_at":"2024-07-30T18:19:38Z","title":"Palu: Compressing KV-Cache with Low-Rank Projection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21118","snapshot_observed_at":"2026-08-07T01:10:37.292088Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11886","last_updated":"2025-06-13T15:35:54Z","snapshot_observed_at":"2026-08-13T15:27:01.467148Z","submitted_at":"2025-06-13T15:35:54Z","title":"Beyond Homogeneous Attention: Memory-Efficient LLMs via Fourier-Approximated KV Cache","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T01:10:37.292088Z"},"links":{"cited_paper":"/paper/2407.21118","citing_paper":"/paper/2506.11886"},"observation_digest":"sha256:2d753fc79ba57e91fbd245b13e41c94e79b0f482c27e6ac1b5d0d8344e87993f","observation_id":"77689f63-3157-4247-bc97-f1a0c49a8c57","resolution":{"observed_at":"2026-08-07T01:10:37.292088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21118","last_updated":"2024-11-04T02:08:55Z","snapshot_observed_at":"2026-08-16T13:29:46.132956Z","submitted_at":"2024-07-30T18:19:38Z","title":"Palu: Compressing KV-Cache with Low-Rank Projection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21118","snapshot_observed_at":"2026-08-15T18:40:37.603820Z","title":"Palu: Compressing kv-cache with low-rank projection.arXiv preprint arXiv:2407.21118, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19549","last_updated":"2025-06-24T11:55:43Z","snapshot_observed_at":"2026-08-15T18:29:12.724199Z","submitted_at":"2025-06-24T11:55:43Z","title":"RCStat: A Statistical Framework for using Relative Contextualization in Transformers","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T18:40:37.603820Z"},"links":{"cited_paper":"/paper/2407.21118","citing_paper":"/paper/2506.19549"},"observation_digest":"sha256:4f01ef9f63a5d1102200f6503f364696f853eee405ea137c72aa0ecb1e5e82e3","observation_id":"11c2edea-ccd7-4683-aea8-76ea40ffa21c","resolution":{"observed_at":"2026-08-15T18:40:37.603820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21118","last_updated":"2024-11-04T02:08:55Z","snapshot_observed_at":"2026-08-16T13:29:46.132956Z","submitted_at":"2024-07-30T18:19:38Z","title":"Palu: Compressing KV-Cache with Low-Rank Projection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21118","snapshot_observed_at":"2026-08-06T13:57:15.670799Z","title":"Palu: Compressing kv-cache with low-rank projection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19906","last_updated":"2025-08-04T08:19:26Z","snapshot_observed_at":"2026-08-12T20:33:33.893453Z","submitted_at":"2025-07-26T10:34:53Z","title":"CaliDrop: KV Cache Compression with Calibration","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T13:57:15.670799Z"},"links":{"cited_paper":"/paper/2407.21118","citing_paper":"/paper/2507.19906"},"observation_digest":"sha256:90abd9916b92f88811334f78e0ccf5dbb71d91f87547da3b5ca4858df2d0f76d","observation_id":"72c9b27c-2c3b-4a5d-87d3-bc691b0d4124","resolution":{"observed_at":"2026-08-06T13:57:15.670799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21118","last_updated":"2024-11-04T02:08:55Z","snapshot_observed_at":"2026-08-16T13:29:46.132956Z","submitted_at":"2024-07-30T18:19:38Z","title":"Palu: Compressing KV-Cache with Low-Rank Projection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21118","snapshot_observed_at":"2026-08-05T17:55:06.348432Z","title":"Palu: Compressing kv-cache with low-rank projection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-05T17:55:04.790166Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:06.348432Z"},"links":{"cited_paper":"/paper/2407.21118","citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:15a24570a4a69b0b2a8a1b5083e05f0c33091bb2d4fdabba4f6ff992dfb30ae0","observation_id":"f929d593-9219-4713-9a8b-eef18834e01c","resolution":{"observed_at":"2026-08-05T17:55:06.348432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21118","last_updated":"2024-11-04T02:08:55Z","snapshot_observed_at":"2026-08-16T13:29:46.132956Z","submitted_at":"2024-07-30T18:19:38Z","title":"Palu: Compressing KV-Cache with Low-Rank Projection","version":2},"cited_work":{"arxiv_id":"2407.21118","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.21118","snapshot_observed_at":"2026-07-10T01:36:44.121083Z","title":"Palu: Compressing kv-cache with low-rank projection.arXiv preprint arXiv:2407.21118","venue":"cs.AI","work_id":"dc6247ce-a2da-431d-a935-3fb13543cb13","year":2024},"citing_paper":{"arxiv_id":"2509.21623","last_updated":"2026-04-16T21:29:54Z","snapshot_observed_at":"2026-08-14T12:21:00.182138Z","submitted_at":"2025-09-25T21:42:27Z","title":"OjaKV: Context-Aware Online Low-Rank KV Cache Compression","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-18T13:26:02.980973Z"},"links":{"cited_paper":"/paper/2407.21118","citing_paper":"/paper/2509.21623"},"observation_digest":"sha256:05ea3a7164e158884e48b3bbc00d4e7e941d6686aa1009c1d36eb5861c4112c9","observation_id":"98b382e6-6302-4125-9fce-9adea19682cf","resolution":{"observed_at":"2026-05-18T13:26:24.651969Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21118","last_updated":"2024-11-04T02:08:55Z","snapshot_observed_at":"2026-08-16T13:29:46.132956Z","submitted_at":"2024-07-30T18:19:38Z","title":"Palu: Compressing KV-Cache with Low-Rank Projection","version":2},"cited_work":{"arxiv_id":"2407.21118","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.21118","snapshot_observed_at":"2026-07-10T01:36:44.121083Z","title":"Palu: Compressing kv-cache with low-rank projection.arXiv preprint arXiv:2407.21118","venue":"cs.AI","work_id":"dc6247ce-a2da-431d-a935-3fb13543cb13","year":2024},"citing_paper":{"arxiv_id":"2603.22910","last_updated":"2026-05-13T05:25:05Z","snapshot_observed_at":"2026-08-13T08:00:34.413924Z","submitted_at":"2026-03-24T07:58:42Z","title":"EchoKV: Efficient KV Cache Compression via Similarity-Based Reconstruction","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-15T01:09:07.983785Z"},"links":{"cited_paper":"/paper/2407.21118","citing_paper":"/paper/2603.22910"},"observation_digest":"sha256:6c533e77b6fc78c68b8b04b051d9f19fecf73a6a6902fdbeecdfe5f88a4e8b25","observation_id":"57baefaa-2193-4053-b8d4-b8587bdf6c13","resolution":{"observed_at":"2026-05-15T01:09:36.971195Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21118","last_updated":"2024-11-04T02:08:55Z","snapshot_observed_at":"2026-08-16T13:29:46.132956Z","submitted_at":"2024-07-30T18:19:38Z","title":"Palu: Compressing KV-Cache with Low-Rank Projection","version":2},"cited_work":{"arxiv_id":"2407.21118","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.21118","snapshot_observed_at":"2026-07-10T01:36:44.121083Z","title":"Palu: Compressing kv-cache with low-rank projection.arXiv preprint arXiv:2407.21118","venue":"cs.AI","work_id":"dc6247ce-a2da-431d-a935-3fb13543cb13","year":2024},"citing_paper":{"arxiv_id":"2604.02570","last_updated":"2026-04-02T22:49:57Z","snapshot_observed_at":"2026-08-12T12:43:33.554905Z","submitted_at":"2026-04-02T22:49:57Z","title":"WSVD: Weighted Low-Rank Approximation for Fast and Efficient Execution of Low-Precision Vision-Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-13T21:05:09.254086Z"},"links":{"cited_paper":"/paper/2407.21118","citing_paper":"/paper/2604.02570"},"observation_digest":"sha256:6ebbc73555efdb78c256e5289f2b54699d7660e1957e872fc334ea6c43a8db25","observation_id":"7ea17c51-bd2f-45bc-9051-11e8fed10732","resolution":{"observed_at":"2026-05-13T21:08:18.020672Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21118","last_updated":"2024-11-04T02:08:55Z","snapshot_observed_at":"2026-08-16T13:29:46.132956Z","submitted_at":"2024-07-30T18:19:38Z","title":"Palu: Compressing KV-Cache with Low-Rank Projection","version":2},"cited_work":{"arxiv_id":"2407.21118","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.21118","snapshot_observed_at":"2026-07-10T01:36:44.121083Z","title":"Palu: Compressing kv-cache with low-rank projection.arXiv preprint arXiv:2407.21118","venue":"cs.AI","work_id":"dc6247ce-a2da-431d-a935-3fb13543cb13","year":2024},"citing_paper":{"arxiv_id":"2605.02905","last_updated":"2026-04-06T02:05:52Z","snapshot_observed_at":"2026-08-16T12:15:49.833921Z","submitted_at":"2026-04-06T02:05:52Z","title":"eOptShrinkQ: Near-Lossless KV Cache Compression Through Optimal Spectral Denoising and Quantization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T20:18:04.392331Z"},"links":{"cited_paper":"/paper/2407.21118","citing_paper":"/paper/2605.02905"},"observation_digest":"sha256:1dc0a3ee67ccedc1448ce995d2ca909ca07b49d1e3a550d5f330c88581ed406e","observation_id":"e152ac02-d2c4-459e-8575-17a5922a051c","resolution":{"observed_at":"2026-05-10T22:00:50.983412Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21118","last_updated":"2024-11-04T02:08:55Z","snapshot_observed_at":"2026-08-16T13:29:46.132956Z","submitted_at":"2024-07-30T18:19:38Z","title":"Palu: Compressing KV-Cache with Low-Rank Projection","version":2},"cited_work":{"arxiv_id":"2407.21118","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.21118","snapshot_observed_at":"2026-07-10T01:36:44.121083Z","title":"Palu: Compressing kv-cache with low-rank projection.arXiv preprint arXiv:2407.21118","venue":"cs.AI","work_id":"dc6247ce-a2da-431d-a935-3fb13543cb13","year":2024},"citing_paper":{"arxiv_id":"2605.17757","last_updated":"2026-05-18T02:24:29Z","snapshot_observed_at":"2026-08-15T00:39:44.412521Z","submitted_at":"2026-05-18T02:24:29Z","title":"OSCAR: Offline Spectral Covariance-Aware Rotation for 2-bit KV Cache Quantization","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-20T12:16:07.797702Z"},"links":{"cited_paper":"/paper/2407.21118","citing_paper":"/paper/2605.17757"},"observation_digest":"sha256:c41b2309a469b93335180492d076ab89e7e785f7067a5de7c07a21908dfd0dc5","observation_id":"f5475433-8212-4511-bf65-d1c982f6ba30","resolution":{"observed_at":"2026-05-20T12:18:16.527054Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21118","last_updated":"2024-11-04T02:08:55Z","snapshot_observed_at":"2026-08-16T13:29:46.132956Z","submitted_at":"2024-07-30T18:19:38Z","title":"Palu: Compressing KV-Cache with Low-Rank Projection","version":2},"cited_work":{"arxiv_id":"2407.21118","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.21118","snapshot_observed_at":"2026-07-10T01:36:44.121083Z","title":"Palu: Compressing kv-cache with low-rank projection.arXiv preprint arXiv:2407.21118","venue":"cs.AI","work_id":"dc6247ce-a2da-431d-a935-3fb13543cb13","year":2024},"citing_paper":{"arxiv_id":"2605.19218","last_updated":"2026-05-19T00:45:00Z","snapshot_observed_at":"2026-08-13T04:53:15.094121Z","submitted_at":"2026-05-19T00:45:00Z","title":"Rotation-Aligned Key Channel Pruning for Efficient Vision-Language Model Inference","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-20T07:43:18.828740Z"},"links":{"cited_paper":"/paper/2407.21118","citing_paper":"/paper/2605.19218"},"observation_digest":"sha256:3ef7dd4f3bbf2e2889002a6d38d319527a165a3d63babceaa9bafe75060a16f9","observation_id":"9ab8b0ee-4d6c-4b4b-b1ec-b4cf79efc620","resolution":{"observed_at":"2026-05-20T07:43:23.770713Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21118","last_updated":"2024-11-04T02:08:55Z","snapshot_observed_at":"2026-08-16T13:29:46.132956Z","submitted_at":"2024-07-30T18:19:38Z","title":"Palu: Compressing KV-Cache with Low-Rank Projection","version":2},"cited_work":{"arxiv_id":"2407.21118","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.21118","snapshot_observed_at":"2026-07-10T01:36:44.121083Z","title":"Palu: Compressing kv-cache with low-rank projection.arXiv preprint arXiv:2407.21118","venue":"cs.AI","work_id":"dc6247ce-a2da-431d-a935-3fb13543cb13","year":2024},"citing_paper":{"arxiv_id":"2605.31105","last_updated":"2026-05-29T10:16:30Z","snapshot_observed_at":"2026-08-15T17:36:31.606537Z","submitted_at":"2026-05-29T10:16:30Z","title":"GRKV: Global Regression for Training-Free KV Cache Compression in Long-Context LLMs","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-06-28T22:54:55.101568Z"},"links":{"cited_paper":"/paper/2407.21118","citing_paper":"/paper/2605.31105"},"observation_digest":"sha256:9d68dee2b25b963094767065bac4ab76192533f11f930bc8eedeff4c2e69fa65","observation_id":"554a9a90-546c-4240-a260-d11ac706e328","resolution":{"observed_at":"2026-07-01T19:16:00.774202Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21118","last_updated":"2024-11-04T02:08:55Z","snapshot_observed_at":"2026-08-16T13:29:46.132956Z","submitted_at":"2024-07-30T18:19:38Z","title":"Palu: Compressing KV-Cache with Low-Rank Projection","version":2},"cited_work":{"arxiv_id":"2407.21118","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.21118","snapshot_observed_at":"2026-07-10T01:36:44.121083Z","title":"Palu: Compressing kv-cache with low-rank projection.arXiv preprint arXiv:2407.21118","venue":"cs.AI","work_id":"dc6247ce-a2da-431d-a935-3fb13543cb13","year":2024},"citing_paper":{"arxiv_id":"2606.00535","last_updated":"2026-05-30T05:05:24Z","snapshot_observed_at":"2026-08-16T00:43:44.943332Z","submitted_at":"2026-05-30T05:05:24Z","title":"DREAM-S: Speculative Decoding with Searchable Drafting and Target-Aware Refinement for Multimodal Generation","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-06-28T18:55:51.474956Z"},"links":{"cited_paper":"/paper/2407.21118","citing_paper":"/paper/2606.00535"},"observation_digest":"sha256:d1943c7424a00b8361c8fe0cd5f2a8b3cbc225d3a0c00fd20eaf2ab200da5b9d","observation_id":"06d2376f-b0a2-4a6c-a291-d84b8421dc2c","resolution":{"observed_at":"2026-06-28T19:02:34.508413Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21118","last_updated":"2024-11-04T02:08:55Z","snapshot_observed_at":"2026-08-16T13:29:46.132956Z","submitted_at":"2024-07-30T18:19:38Z","title":"Palu: Compressing KV-Cache with Low-Rank Projection","version":2},"cited_work":{"arxiv_id":"2407.21118","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.21118","snapshot_observed_at":"2026-07-10T01:36:44.121083Z","title":"Palu: Compressing kv-cache with low-rank projection.arXiv preprint arXiv:2407.21118","venue":"cs.AI","work_id":"dc6247ce-a2da-431d-a935-3fb13543cb13","year":2024},"citing_paper":{"arxiv_id":"2606.00573","last_updated":"2026-05-30T06:53:23Z","snapshot_observed_at":"2026-08-16T03:38:46.307266Z","submitted_at":"2026-05-30T06:53:23Z","title":"LASER: Loss-Aware Singular-value Decomposition and Rank Allocation for Efficient Low-Precision Vision-Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T19:09:29.347284Z"},"links":{"cited_paper":"/paper/2407.21118","citing_paper":"/paper/2606.00573"},"observation_digest":"sha256:ae9fa614a14d4000cfef77d55f56a667307d5320da4a60d141491753e4f69454","observation_id":"90c87189-d919-4472-a996-0f980e90c98a","resolution":{"observed_at":"2026-06-28T19:12:34.707197Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21118","last_updated":"2024-11-04T02:08:55Z","snapshot_observed_at":"2026-08-16T13:29:46.132956Z","submitted_at":"2024-07-30T18:19:38Z","title":"Palu: Compressing KV-Cache with Low-Rank Projection","version":2},"cited_work":{"arxiv_id":"2407.21118","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.21118","snapshot_observed_at":"2026-07-10T01:36:44.121083Z","title":"Palu: Compressing kv-cache with low-rank projection.arXiv preprint arXiv:2407.21118","venue":"cs.AI","work_id":"dc6247ce-a2da-431d-a935-3fb13543cb13","year":2024},"citing_paper":{"arxiv_id":"2606.08565","last_updated":"2026-06-07T10:43:30Z","snapshot_observed_at":"2026-08-12T17:55:34.805021Z","submitted_at":"2026-06-07T10:43:30Z","title":"EinSort: Sorting is All We Need for Tensorizing LLM","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-06-27T18:31:01.804061Z"},"links":{"cited_paper":"/paper/2407.21118","citing_paper":"/paper/2606.08565"},"observation_digest":"sha256:a107d4a5722a5d2e2efd130d98acc7f9131c3384bc01afc4196e34e9c3095feb","observation_id":"af4941be-b6f9-4ab6-80a6-1de7e319cc81","resolution":{"observed_at":"2026-07-02T22:57:26.699258Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21118","last_updated":"2024-11-04T02:08:55Z","snapshot_observed_at":"2026-08-16T13:29:46.132956Z","submitted_at":"2024-07-30T18:19:38Z","title":"Palu: Compressing KV-Cache with Low-Rank Projection","version":2},"cited_work":{"arxiv_id":"2407.21118","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.21118","snapshot_observed_at":"2026-07-10T01:36:44.121083Z","title":"Palu: Compressing kv-cache with low-rank projection.arXiv preprint arXiv:2407.21118","venue":"cs.AI","work_id":"dc6247ce-a2da-431d-a935-3fb13543cb13","year":2024},"citing_paper":{"arxiv_id":"2606.11164","last_updated":"2026-06-09T17:44:23Z","snapshot_observed_at":"2026-08-14T09:16:22.038523Z","submitted_at":"2026-06-09T17:44:23Z","title":"ReasonAlloc: Hierarchical Decoding-Time KV Cache Budget Allocation for Reasoning Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-06-27T13:09:37.979051Z"},"links":{"cited_paper":"/paper/2407.21118","citing_paper":"/paper/2606.11164"},"observation_digest":"sha256:dec06704045d9c6622864985b3c2af8b8d13f78267cd0f2d434bfeea3f0b8b58","observation_id":"69977081-c482-4a04-864e-82f935153758","resolution":{"observed_at":"2026-07-03T05:37:40.348156Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21118","last_updated":"2024-11-04T02:08:55Z","snapshot_observed_at":"2026-08-16T13:29:46.132956Z","submitted_at":"2024-07-30T18:19:38Z","title":"Palu: Compressing KV-Cache with Low-Rank Projection","version":2},"cited_work":{"arxiv_id":"2407.21118","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.21118","snapshot_observed_at":"2026-07-10T01:36:44.121083Z","title":"Palu: Compressing kv-cache with low-rank projection.arXiv preprint arXiv:2407.21118","venue":"cs.AI","work_id":"dc6247ce-a2da-431d-a935-3fb13543cb13","year":2024},"citing_paper":{"arxiv_id":"2607.08032","last_updated":"2026-07-09T01:15:03Z","snapshot_observed_at":"2026-08-15T04:39:02.467469Z","submitted_at":"2026-07-09T01:15:03Z","title":"What to Keep, What to Forget: A Rate--Distortion View of Memory Compaction in LLMs and Agents","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-10T01:26:59.421158Z"},"links":{"cited_paper":"/paper/2407.21118","citing_paper":"/paper/2607.08032"},"observation_digest":"sha256:f1a0e5dd57ba86d32bd676920a5e9f7b5543d9cf22845f8c16e754ac0845c641","observation_id":"ec9e31b7-358a-4438-9a9a-195ca299eee0","resolution":{"observed_at":"2026-07-10T01:36:44.122209Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21118","last_updated":"2024-11-04T02:08:55Z","snapshot_observed_at":"2026-08-16T13:29:46.132956Z","submitted_at":"2024-07-30T18:19:38Z","title":"Palu: Compressing KV-Cache with Low-Rank Projection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21118","snapshot_observed_at":"2026-08-02T06:31:50.083575Z","title":"Abdelfattah, and Kai-Chiang Wu","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.12550","last_updated":"2026-07-17T17:45:07Z","snapshot_observed_at":"2026-08-07T16:25:57.752265Z","submitted_at":"2026-07-14T09:23:20Z","title":"A JoLT for the KV Cache: Near-Lossless KV Cache Compression via Joint Tucker and JL-Residual Allocation for LLMs","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T06:31:50.083575Z"},"links":{"cited_paper":"/paper/2407.21118","citing_paper":"/paper/2607.12550"},"observation_digest":"sha256:822c5d7f1499d550e620160a24a37c031972c76ef2e799dfd2b61587331d3c6d","observation_id":"3e2573aa-faa8-4189-b696-6d4092c86a7b","resolution":{"observed_at":"2026-08-02T06:31:50.083575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21118","last_updated":"2024-11-04T02:08:55Z","snapshot_observed_at":"2026-08-16T13:29:46.132956Z","submitted_at":"2024-07-30T18:19:38Z","title":"Palu: Compressing KV-Cache with Low-Rank Projection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21118","snapshot_observed_at":"2026-08-02T06:50:14.941014Z","title":"Palu: Compressing kv-cache with low-rank projection.arXiv preprint arXiv:2407.21118, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13088","last_updated":"2026-07-13T16:45:04Z","snapshot_observed_at":"2026-08-14T03:16:20.039338Z","submitted_at":"2026-07-13T16:45:04Z","title":"Securing LLMs in the Wild: Privacy and Security Challenges at the Edge","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T06:50:14.941014Z"},"links":{"cited_paper":"/paper/2407.21118","citing_paper":"/paper/2607.13088"},"observation_digest":"sha256:9f4c455117cfae8812105a02c6919f0d65a62d527273e827bd1dc6f2b217b499","observation_id":"7c90bfd3-a5db-4c70-8f38-0575b9e87fb7","resolution":{"observed_at":"2026-08-02T06:50:14.941014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21118","last_updated":"2024-11-04T02:08:55Z","snapshot_observed_at":"2026-08-16T13:29:46.132956Z","submitted_at":"2024-07-30T18:19:38Z","title":"Palu: Compressing KV-Cache with Low-Rank Projection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21118","snapshot_observed_at":"2026-07-31T18:02:37.410810Z","title":"Palu: Compressing kv-cache with low-rank projection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24331","last_updated":"2026-07-27T12:08:56Z","snapshot_observed_at":"2026-08-13T09:00:54.655111Z","submitted_at":"2026-07-27T12:08:56Z","title":"DynaCalKV: Key-Value Cache Compression via Head Grouping and Adaptive Rank Allocation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-31T18:02:37.410810Z"},"links":{"cited_paper":"/paper/2407.21118","citing_paper":"/paper/2607.24331"},"observation_digest":"sha256:c17fda9d58c8122efe13d482d5910a3762c55d4cb59023e98d7e021c0414c8a0","observation_id":"d4431f5f-d32c-4e5f-9a5b-6ed319e2395e","resolution":{"observed_at":"2026-07-31T18:02:37.410810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21118","last_updated":"2024-11-04T02:08:55Z","snapshot_observed_at":"2026-08-16T13:29:46.132956Z","submitted_at":"2024-07-30T18:19:38Z","title":"Palu: Compressing KV-Cache with Low-Rank Projection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21118","snapshot_observed_at":"2026-07-31T11:49:11.614843Z","title":"Palu: Compressing KV-cache with low-rank projection","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24555","last_updated":"2026-07-27T15:28:52Z","snapshot_observed_at":"2026-08-02T06:50:39.173138Z","submitted_at":"2026-07-27T15:28:52Z","title":"LOCKS: Page-Local Compact Key Summaries for Efficient Long-Context Decoding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-31T11:49:11.614843Z"},"links":{"cited_paper":"/paper/2407.21118","citing_paper":"/paper/2607.24555"},"observation_digest":"sha256:f3a4401483486ab989c2265ebf1e2d7bee424ca03222de0d5b6eace85f174a0b","observation_id":"9efb6cf7-0d03-46c7-bd1f-c19c47410427","resolution":{"observed_at":"2026-07-31T11:49:11.614843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21118","last_updated":"2024-11-04T02:08:55Z","snapshot_observed_at":"2026-08-16T13:29:46.132956Z","submitted_at":"2024-07-30T18:19:38Z","title":"Palu: Compressing KV-Cache with Low-Rank Projection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21118","snapshot_observed_at":"2026-08-03T00:43:48.033830Z","title":"Abdelfattah, and Kai-Chiang Wu","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28699","last_updated":"2026-08-06T10:44:15Z","snapshot_observed_at":"2026-08-14T06:51:28.858675Z","submitted_at":"2026-07-30T11:04:45Z","title":"WitCert: Sound Runtime Risk Observability and Gating for KV-Cache Quantization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T00:43:48.033830Z"},"links":{"cited_paper":"/paper/2407.21118","citing_paper":"/paper/2607.28699"},"observation_digest":"sha256:ec13ba027ccac80433ca0d3948daea86d4c81a5cbc2462f13897262670054544","observation_id":"0cefdd22-aad1-4e4c-80c1-cb14334d7f0d","resolution":{"observed_at":"2026-08-03T00:43:48.033830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21118","last_updated":"2024-11-04T02:08:55Z","snapshot_observed_at":"2026-08-16T13:29:46.132956Z","submitted_at":"2024-07-30T18:19:38Z","title":"Palu: Compressing KV-Cache with Low-Rank Projection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21118","snapshot_observed_at":"2026-08-04T07:49:39.405147Z","title":"arXiv preprint arXiv:2407.21118 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02415","last_updated":"2026-08-03T15:53:49Z","snapshot_observed_at":"2026-08-11T21:43:49.975246Z","submitted_at":"2026-08-03T15:53:49Z","title":"Training-Free versus Training-Based Intent Classification in LLMs: Accuracy, Robustness, and Failure Modes","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-04T07:49:39.405147Z"},"links":{"cited_paper":"/paper/2407.21118","citing_paper":"/paper/2608.02415"},"observation_digest":"sha256:a96ee37e21476e6791b5ef77f70eb856dea37dd1e005a9f0af1185b798450934","observation_id":"cfef5d0d-dce5-4308-b32a-06239cc816f5","resolution":{"observed_at":"2026-08-04T07:49:39.405147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21118","last_updated":"2024-11-04T02:08:55Z","snapshot_observed_at":"2026-08-16T13:29:46.132956Z","submitted_at":"2024-07-30T18:19:38Z","title":"Palu: Compressing KV-Cache with Low-Rank Projection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21118","snapshot_observed_at":"2026-08-15T15:02:52.922607Z","title":"Palu: Compressing KV-Cache with Low-Rank Projection , journal =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02901","last_updated":"2026-08-03T21:38:30Z","snapshot_observed_at":"2026-08-16T10:17:56.244478Z","submitted_at":"2026-08-03T21:38:30Z","title":"AnchorKV: Anchor-Residual KV Cache Compression","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T15:02:52.922607Z"},"links":{"cited_paper":"/paper/2407.21118","citing_paper":"/paper/2608.02901"},"observation_digest":"sha256:59b13f4392e50beddd22f07ed534aa61d822725677cbaa5911c477d1eb710f41","observation_id":"064a8211-11ca-45ae-b1ce-7bd7c3b7bc12","resolution":{"observed_at":"2026-08-15T15:02:52.922607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21118","last_updated":"2024-11-04T02:08:55Z","snapshot_observed_at":"2026-08-16T13:29:46.132956Z","submitted_at":"2024-07-30T18:19:38Z","title":"Palu: Compressing KV-Cache with Low-Rank Projection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21118","snapshot_observed_at":"2026-08-05T23:10:35.285100Z","title":"Palu: Compressing KV-Cache with Low-Rank Projection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03228","last_updated":"2026-08-05T20:50:42Z","snapshot_observed_at":"2026-08-14T09:50:26.014755Z","submitted_at":"2026-08-04T06:59:29Z","title":"SAKI: Score-Aware Low-Rank Key Indexing with Random-Matrix Noise Correction for KV Retrieval","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:35.285100Z"},"links":{"cited_paper":"/paper/2407.21118","citing_paper":"/paper/2608.03228"},"observation_digest":"sha256:5df3f7495bf6cb429c0fe8680154a1a1d28e2a1b68cf8f314e1430653ab46d05","observation_id":"d3be1814-e7c1-4d18-aa49-b2d1acf584b7","resolution":{"observed_at":"2026-08-05T23:10:35.285100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21118","last_updated":"2024-11-04T02:08:55Z","snapshot_observed_at":"2026-08-16T13:29:46.132956Z","submitted_at":"2024-07-30T18:19:38Z","title":"Palu: Compressing KV-Cache with Low-Rank Projection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21118","snapshot_observed_at":"2026-08-08T00:54:42.694725Z","title":"Palu: Compressing KV-Cache with Low-Rank Projection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03228","last_updated":"2026-08-05T20:50:42Z","snapshot_observed_at":"2026-08-14T09:50:26.014755Z","submitted_at":"2026-08-04T06:59:29Z","title":"SAKI: Score-Aware Low-Rank Key Indexing with Random-Matrix Noise Correction for KV Retrieval","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T00:54:42.694725Z"},"links":{"cited_paper":"/paper/2407.21118","citing_paper":"/paper/2608.03228"},"observation_digest":"sha256:44559bb868bbfcd38055169174ddf53bda633b8ce94bfa0d9f51d1e99061289a","observation_id":"b4baf7a2-63fd-442c-ba6c-a225c61f16dc","resolution":{"observed_at":"2026-08-08T00:54:42.694725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21118","last_updated":"2024-11-04T02:08:55Z","snapshot_observed_at":"2026-08-16T13:29:46.132956Z","submitted_at":"2024-07-30T18:19:38Z","title":"Palu: Compressing KV-Cache with Low-Rank Projection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21118","snapshot_observed_at":"2026-08-15T14:46:03.872365Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04428","last_updated":"2026-08-05T04:17:03Z","snapshot_observed_at":"2026-08-16T01:42:08.131327Z","submitted_at":"2026-08-05T04:17:03Z","title":"Deltoris: Enabling Real-time VLA Inference in Embodied AI via Bit-level Sparsity and Speculative Inference","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-15T14:46:03.872365Z"},"links":{"cited_paper":"/paper/2407.21118","citing_paper":"/paper/2608.04428"},"observation_digest":"sha256:77e42c88b8388a4812e0eca6452926c006b60c54b1a24aab21d9bacba9a6d8b9","observation_id":"ebec126e-da94-419a-a482-322eae95ddbb","resolution":{"observed_at":"2026-08-15T14:46:03.872365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2407.21118/citation-record","integrity":"/paper/2407.21118/integrity","json":"/paper/2407.21118/citation-record.json","paper":"/paper/2407.21118"},"outbound":[],"paper":{"arxiv_id":"2407.21118","last_updated":"2024-11-04T02:08:55Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-16T13:29:46.132956Z","submitted_at":"2024-07-30T18:19:38Z","title":"Palu: Compressing KV-Cache with Low-Rank Projection"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 37 inbound Pith citation observations for arXiv:2407.21118."}