{"as_of":"2026-08-10T11:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a945b4ac44a0d5f03cf9e92c8c92b1ca3382375a06dfb5f5d21889c5b4a408e8","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:45:09.969345Z","state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T00:47:31.653881Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-10T05:30:23.456663Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-10T05:30:23.456663Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.04642","last_updated":"2025-06-05T05:23:38Z","snapshot_observed_at":"2026-08-09T14:51:33.229436Z","submitted_at":"2025-06-05T05:23:38Z","title":"TaDA: Training-free recipe for Decoding with Adaptive KV Cache Compression and Mean-centering","version":1},"cited_work":{"arxiv_id":"2506.04642","doi":"10.48550/arxiv.2506.04642","metadata_source":"pith","pith_arxiv_id":"2506.04642","snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"TaDA: Training-free recipe for Decoding with Adaptive KV Cache Compression and Mean-centering","venue":"cs.CL","work_id":"dc013872-a0be-4445-96b3-75771b61b594","year":2025},"citing_paper":{"arxiv_id":"2608.00528","last_updated":"2026-08-01T08:41:29Z","snapshot_observed_at":"2026-08-09T21:01:08.462938Z","submitted_at":"2026-08-01T08:41:29Z","title":"S$^4$R: Selective Sampling, Subspaces, and Sparse Reconstruction for Compressed Long-Context KV Caching","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-05T00:47:31.653881Z"},"links":{"cited_paper":"/paper/2506.04642","citing_paper":"/paper/2608.00528"},"observation_digest":"sha256:a584ddfd20dd9295280ae90bf073cc34e1588ee9ee288d514dfa173d03d579cf","observation_id":"2d0a32dc-d528-42fe-83d6-2749609e6e03","resolution":{"observed_at":"2026-08-05T00:47:32.072537Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-07T23:38:13.098341+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-07T23:38:13.098341+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.04642/citation-record","integrity":"/paper/2506.04642/integrity","json":"/paper/2506.04642/citation-record.json","paper":"/paper/2506.04642"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2305.13245","last_updated":"2023-12-23T17:55:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-22T17:16:38Z","title":"GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13245","snapshot_observed_at":"2026-08-07T10:45:09.814940Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04642","last_updated":"2025-06-05T05:23:38Z","snapshot_observed_at":"2026-08-09T14:51:33.229436Z","submitted_at":"2025-06-05T05:23:38Z","title":"TaDA: Training-free recipe for Decoding with Adaptive KV Cache Compression and Mean-centering","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T10:45:09.814940Z"},"links":{"cited_paper":"/paper/2305.13245","citing_paper":"/paper/2506.04642"},"observation_digest":"sha256:2f89bccfb21facafe093d55f59eaf75f733a93216b58c9a7b5e9a1b1b28f761d","observation_id":"95ddf0a1-0c66-4313-9ee2-d46877579bad","resolution":{"observed_at":"2026-08-07T10:45:09.814940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:09.820633Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04642","last_updated":"2025-06-05T05:23:38Z","snapshot_observed_at":"2026-08-09T14:51:33.229436Z","submitted_at":"2025-06-05T05:23:38Z","title":"TaDA: Training-free recipe for Decoding with Adaptive KV Cache Compression and Mean-centering","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T10:45:09.820633Z"},"links":{"citing_paper":"/paper/2506.04642"},"observation_digest":"sha256:a96e638977ecbdcbda58b0185c0a0a3d42e97bec0f33e0e419d020ce026fb08e","observation_id":"269b8026-bb4a-49c8-85a8-2ccdac6e1ca7","resolution":{"observed_at":"2026-08-07T10:45:09.820633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21118","last_updated":"2024-11-04T02:08:55Z","snapshot_observed_at":"2026-07-06T18:54:41.705593Z","submitted_at":"2024-07-30T18:19:38Z","title":"Palu: Compressing KV-Cache with Low-Rank Projection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21118","snapshot_observed_at":"2026-08-07T10:45:09.825323Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04642","last_updated":"2025-06-05T05:23:38Z","snapshot_observed_at":"2026-08-09T14:51:33.229436Z","submitted_at":"2025-06-05T05:23:38Z","title":"TaDA: Training-free recipe for Decoding with Adaptive KV Cache Compression and Mean-centering","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T10:45:09.825323Z"},"links":{"cited_paper":"/paper/2407.21118","citing_paper":"/paper/2506.04642"},"observation_digest":"sha256:b2729e9f38302deca903dd8f68611862d70c261bfc68e717acb699a58d51b09f","observation_id":"484ef146-5291-4782-9dd0-fdc49ba24a4b","resolution":{"observed_at":"2026-08-07T10:45:09.825323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T10:45:09.832690Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.04642","last_updated":"2025-06-05T05:23:38Z","snapshot_observed_at":"2026-08-09T14:51:33.229436Z","submitted_at":"2025-06-05T05:23:38Z","title":"TaDA: Training-free recipe for Decoding with Adaptive KV Cache Compression and Mean-centering","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T10:45:09.832690Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2506.04642"},"observation_digest":"sha256:507f88c34578d889bd686d6bf06fd8db4f53ef5d049a71d88d6ac5a8145d4235","observation_id":"3ff40ad3-f55c-46db-926c-d51afbbd0020","resolution":{"observed_at":"2026-08-07T10:45:09.832690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08691","last_updated":"2023-07-17T17:50:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-17T17:50:36Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08691","snapshot_observed_at":"2026-08-07T10:45:09.837526Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04642","last_updated":"2025-06-05T05:23:38Z","snapshot_observed_at":"2026-08-09T14:51:33.229436Z","submitted_at":"2025-06-05T05:23:38Z","title":"TaDA: Training-free recipe for Decoding with Adaptive KV Cache Compression and Mean-centering","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T10:45:09.837526Z"},"links":{"cited_paper":"/paper/2307.08691","citing_paper":"/paper/2506.04642"},"observation_digest":"sha256:a0f6994be6a583bffe82b16d06e44047263ca7ba6e833bdf15e370a988167e2c","observation_id":"f11cb9aa-bcc5-4735-a342-3b24f0178fc2","resolution":{"observed_at":"2026-08-07T10:45:09.837526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-07T10:45:09.842117Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04642","last_updated":"2025-06-05T05:23:38Z","snapshot_observed_at":"2026-08-09T14:51:33.229436Z","submitted_at":"2025-06-05T05:23:38Z","title":"TaDA: Training-free recipe for Decoding with Adaptive KV Cache Compression and Mean-centering","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T10:45:09.842117Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2506.04642"},"observation_digest":"sha256:9a2815835b4b13611f8496252ba85ab811eed5bdcd6f412da9b2fb7acafdf25f","observation_id":"352a4bf6-f68e-4646-98a1-65937f420473","resolution":{"observed_at":"2026-08-07T10:45:09.842117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04643","last_updated":"2024-04-12T13:00:25Z","snapshot_observed_at":"2026-08-04T07:21:43.170218Z","submitted_at":"2024-03-07T16:42:37Z","title":"QAQ: Quality Adaptive Quantization for LLM KV Cache","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04643","snapshot_observed_at":"2026-08-07T10:45:09.847376Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04642","last_updated":"2025-06-05T05:23:38Z","snapshot_observed_at":"2026-08-09T14:51:33.229436Z","submitted_at":"2025-06-05T05:23:38Z","title":"TaDA: Training-free recipe for Decoding with Adaptive KV Cache Compression and Mean-centering","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T10:45:09.847376Z"},"links":{"cited_paper":"/paper/2403.04643","citing_paper":"/paper/2506.04642"},"observation_digest":"sha256:8d6def115f0484662aca7be446c3ab276c0f846740702347c560c6c94af35525","observation_id":"b3e9de94-c814-45eb-be2e-14625b18e067","resolution":{"observed_at":"2026-08-07T10:45:09.847376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T10:45:09.852555Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04642","last_updated":"2025-06-05T05:23:38Z","snapshot_observed_at":"2026-08-09T14:51:33.229436Z","submitted_at":"2025-06-05T05:23:38Z","title":"TaDA: Training-free recipe for Decoding with Adaptive KV Cache Compression and Mean-centering","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T10:45:09.852555Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.04642"},"observation_digest":"sha256:09eba2068051c15aa806d96b1b394ca73baf7764600d79cc66ed7cd9834a9360","observation_id":"5bd22f1a-af28-459a-9ec7-6ad28740fc42","resolution":{"observed_at":"2026-08-07T10:45:09.852555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01282","last_updated":"2024-01-05T12:41:13Z","snapshot_observed_at":"2026-08-10T04:01:40.158577Z","submitted_at":"2023-11-02T14:57:03Z","title":"FlashDecoding++: Faster Large Language Model Inference on GPUs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01282","snapshot_observed_at":"2026-08-07T10:45:09.857737Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04642","last_updated":"2025-06-05T05:23:38Z","snapshot_observed_at":"2026-08-09T14:51:33.229436Z","submitted_at":"2025-06-05T05:23:38Z","title":"TaDA: Training-free recipe for Decoding with Adaptive KV Cache Compression and Mean-centering","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T10:45:09.857737Z"},"links":{"cited_paper":"/paper/2311.01282","citing_paper":"/paper/2506.04642"},"observation_digest":"sha256:90d1f7ee2b0196dbc588970ebb57f62eb0008202ff0be07e4c9ffa70b960f45c","observation_id":"ac17d14e-2ccb-4c22-adc6-cccc746d29ca","resolution":{"observed_at":"2026-08-07T10:45:09.857737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-09T08:05:16.511956Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-07T10:45:09.862820Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04642","last_updated":"2025-06-05T05:23:38Z","snapshot_observed_at":"2026-08-09T14:51:33.229436Z","submitted_at":"2025-06-05T05:23:38Z","title":"TaDA: Training-free recipe for Decoding with Adaptive KV Cache Compression and Mean-centering","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T10:45:09.862820Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2506.04642"},"observation_digest":"sha256:7b9b3e26e7bc8aead2b72e2d81d207375d5f3d71f1c4042c9a77c9a24b4b05d3","observation_id":"dec87567-bce7-4b01-9448-54d41b907068","resolution":{"observed_at":"2026-08-07T10:45:09.862820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-07T10:45:09.868431Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04642","last_updated":"2025-06-05T05:23:38Z","snapshot_observed_at":"2026-08-09T14:51:33.229436Z","submitted_at":"2025-06-05T05:23:38Z","title":"TaDA: Training-free recipe for Decoding with Adaptive KV Cache Compression and Mean-centering","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T10:45:09.868431Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2506.04642"},"observation_digest":"sha256:05ea1c41ccb9dab942c86a2e734d66c088d0a19dbf7f941627b27cf2a8ba7ab0","observation_id":"2d192574-f02b-4608-8b1f-b3895ab9bcc1","resolution":{"observed_at":"2026-08-07T10:45:09.868431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10247","last_updated":"2024-06-08T07:49:55Z","snapshot_observed_at":"2026-07-06T18:31:13.039726Z","submitted_at":"2024-06-08T07:49:55Z","title":"QCQA: Quality and Capacity-aware grouped Query Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10247","snapshot_observed_at":"2026-08-07T10:45:09.873091Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04642","last_updated":"2025-06-05T05:23:38Z","snapshot_observed_at":"2026-08-09T14:51:33.229436Z","submitted_at":"2025-06-05T05:23:38Z","title":"TaDA: Training-free recipe for Decoding with Adaptive KV Cache Compression and Mean-centering","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T10:45:09.873091Z"},"links":{"cited_paper":"/paper/2406.10247","citing_paper":"/paper/2506.04642"},"observation_digest":"sha256:d72f2780382d65646c648689145abfa68a93d2f11ccc414a24ea61a4ee8e79f7","observation_id":"dac99d7f-cb4a-4bca-8a6d-92b8b0ae33c7","resolution":{"observed_at":"2026-08-07T10:45:09.873091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05527","last_updated":"2024-09-30T22:44:58Z","snapshot_observed_at":"2026-08-07T12:20:18.370756Z","submitted_at":"2024-03-08T18:48:30Z","title":"GEAR: An Efficient KV Cache Compression Recipe for Near-Lossless Generative Inference of LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05527","snapshot_observed_at":"2026-08-07T10:45:09.879572Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04642","last_updated":"2025-06-05T05:23:38Z","snapshot_observed_at":"2026-08-09T14:51:33.229436Z","submitted_at":"2025-06-05T05:23:38Z","title":"TaDA: Training-free recipe for Decoding with Adaptive KV Cache Compression and Mean-centering","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T10:45:09.879572Z"},"links":{"cited_paper":"/paper/2403.05527","citing_paper":"/paper/2506.04642"},"observation_digest":"sha256:e5894f1fac7ac20ccbb5db29fd46a4f63f5f804c75eebb5736aa6c6fbd11c9d8","observation_id":"d693ca11-8206-4880-b0da-41d86b5d3cf7","resolution":{"observed_at":"2026-08-07T10:45:09.879572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:10.750047Z","title":null,"venue":null,"work_id":"a1ff5091-0c24-4091-8b04-113546f5d844","year":2023},"citing_paper":{"arxiv_id":"2506.04642","last_updated":"2025-06-05T05:23:38Z","snapshot_observed_at":"2026-08-09T14:51:33.229436Z","submitted_at":"2025-06-05T05:23:38Z","title":"TaDA: Training-free recipe for Decoding with Adaptive KV Cache Compression and Mean-centering","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T10:45:09.884072Z"},"links":{"citing_paper":"/paper/2506.04642"},"observation_digest":"sha256:d9a84f506dfba78797ef9b945d708b2f3211c5cd02c9279b5e33ea25afb457f2","observation_id":"e40f040f-1e6d-45c2-ab28-b6db27918ed3","resolution":{"observed_at":"2026-08-07T10:45:10.757623Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:10.728253Z","title":null,"venue":null,"work_id":"a604a298-92fc-4991-aecc-dc0cd190d2e0","year":2024},"citing_paper":{"arxiv_id":"2506.04642","last_updated":"2025-06-05T05:23:38Z","snapshot_observed_at":"2026-08-09T14:51:33.229436Z","submitted_at":"2025-06-05T05:23:38Z","title":"TaDA: Training-free recipe for Decoding with Adaptive KV Cache Compression and Mean-centering","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T10:45:09.889818Z"},"links":{"citing_paper":"/paper/2506.04642"},"observation_digest":"sha256:87152c35421d25b1ba3c133b028aeff8b2cda6f1177f052c80b452791fec9f56","observation_id":"3b2606d6-5df9-419f-af99-9e6c5e097be2","resolution":{"observed_at":"2026-08-07T10:45:10.733674Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:10.709939Z","title":null,"venue":null,"work_id":"69610dcf-151a-4dc3-97cd-8a6da49b4c08","year":2024},"citing_paper":{"arxiv_id":"2506.04642","last_updated":"2025-06-05T05:23:38Z","snapshot_observed_at":"2026-08-09T14:51:33.229436Z","submitted_at":"2025-06-05T05:23:38Z","title":"TaDA: Training-free recipe for Decoding with Adaptive KV Cache Compression and Mean-centering","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T10:45:09.896238Z"},"links":{"citing_paper":"/paper/2506.04642"},"observation_digest":"sha256:c0265a5803f40b3f02a32f40fd17348e563735c9f50090808a7443c4bbc35a7a","observation_id":"74362e38-9bcc-4d39-8626-bfe1b68a55ea","resolution":{"observed_at":"2026-08-07T10:45:10.715024Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.02150","last_updated":"2019-11-06T00:19:05Z","snapshot_observed_at":"2026-07-06T08:35:01.386074Z","submitted_at":"2019-11-06T00:19:05Z","title":"Fast Transformer Decoding: One Write-Head is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.02150","snapshot_observed_at":"2026-08-07T10:45:09.901527Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.04642","last_updated":"2025-06-05T05:23:38Z","snapshot_observed_at":"2026-08-09T14:51:33.229436Z","submitted_at":"2025-06-05T05:23:38Z","title":"TaDA: Training-free recipe for Decoding with Adaptive KV Cache Compression and Mean-centering","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T10:45:09.901527Z"},"links":{"cited_paper":"/paper/1911.02150","citing_paper":"/paper/2506.04642"},"observation_digest":"sha256:58ea04350ebe0f1a46fb39278cc46f4c733310d6961559c4999565ff196777ef","observation_id":"5f34c911-4420-46cd-a5ae-21abb5158006","resolution":{"observed_at":"2026-08-07T10:45:09.901527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.06865","last_updated":"2023-06-12T07:48:53Z","snapshot_observed_at":"2026-08-06T08:43:40.051791Z","submitted_at":"2023-03-13T05:19:28Z","title":"FlexGen: High-Throughput Generative Inference of Large Language Models with a Single GPU","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.06865","snapshot_observed_at":"2026-08-07T10:45:09.907446Z","title":"Fu, Zhiqiang Xie, Beidi Chen, Clark Barrett, Joseph E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04642","last_updated":"2025-06-05T05:23:38Z","snapshot_observed_at":"2026-08-09T14:51:33.229436Z","submitted_at":"2025-06-05T05:23:38Z","title":"TaDA: Training-free recipe for Decoding with Adaptive KV Cache Compression and Mean-centering","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T10:45:09.907446Z"},"links":{"cited_paper":"/paper/2303.06865","citing_paper":"/paper/2506.04642"},"observation_digest":"sha256:054e59fa03aa0dab06260b75c0253c58aa4e7f28c5c11a76392fd64bc5959714","observation_id":"c9696f4f-1dba-44c6-8b5a-95c3d630a868","resolution":{"observed_at":"2026-08-07T10:45:09.907446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09864","last_updated":"2023-11-08T13:36:32Z","snapshot_observed_at":"2026-07-06T11:01:58.137141Z","submitted_at":"2021-04-20T09:54:06Z","title":"RoFormer: Enhanced Transformer with Rotary Position Embedding","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.09864","snapshot_observed_at":"2026-08-07T10:45:09.914455Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.04642","last_updated":"2025-06-05T05:23:38Z","snapshot_observed_at":"2026-08-09T14:51:33.229436Z","submitted_at":"2025-06-05T05:23:38Z","title":"TaDA: Training-free recipe for Decoding with Adaptive KV Cache Compression and Mean-centering","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T10:45:09.914455Z"},"links":{"cited_paper":"/paper/2104.09864","citing_paper":"/paper/2506.04642"},"observation_digest":"sha256:12c008903014a7d26bc3437e7f5ed03a631c4f7bb26a03c192aa159c8bb05ee6","observation_id":"59a20d92-ce06-48fe-866a-4610cd1b7b11","resolution":{"observed_at":"2026-08-07T10:45:09.914455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:09.920790Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.04642","last_updated":"2025-06-05T05:23:38Z","snapshot_observed_at":"2026-08-09T14:51:33.229436Z","submitted_at":"2025-06-05T05:23:38Z","title":"TaDA: Training-free recipe for Decoding with Adaptive KV Cache Compression and Mean-centering","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T10:45:09.920790Z"},"links":{"citing_paper":"/paper/2506.04642"},"observation_digest":"sha256:d9666150be481b304cb7c96a664e8253d75c577d5305e594455f761c68a2fb4a","observation_id":"d6cb2726-e83b-48eb-b906-833c6a995ec5","resolution":{"observed_at":"2026-08-07T10:45:09.920790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T10:45:09.926851Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04642","last_updated":"2025-06-05T05:23:38Z","snapshot_observed_at":"2026-08-09T14:51:33.229436Z","submitted_at":"2025-06-05T05:23:38Z","title":"TaDA: Training-free recipe for Decoding with Adaptive KV Cache Compression and Mean-centering","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T10:45:09.926851Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2506.04642"},"observation_digest":"sha256:b5da4d54e4620ce7d0d9530b0ab95460dfe4a91404c7ae3e53aea87590ae48d3","observation_id":"1396b045-3cf4-47a9-a74b-d7326c79c876","resolution":{"observed_at":"2026-08-07T10:45:09.926851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:10.688641Z","title":null,"venue":null,"work_id":"cf549b62-87ed-4788-953b-f5a9915dfb91","year":2024},"citing_paper":{"arxiv_id":"2506.04642","last_updated":"2025-06-05T05:23:38Z","snapshot_observed_at":"2026-08-09T14:51:33.229436Z","submitted_at":"2025-06-05T05:23:38Z","title":"TaDA: Training-free recipe for Decoding with Adaptive KV Cache Compression and Mean-centering","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T10:45:09.933063Z"},"links":{"citing_paper":"/paper/2506.04642"},"observation_digest":"sha256:8a8e6a1d9682d5484b282212b3664bee4d2fe63ee9329130dbc9a81a6606f88d","observation_id":"a773ade7-6a5e-4d4b-bb47-81844a9ece5c","resolution":{"observed_at":"2026-08-07T10:45:10.695637Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03762","last_updated":"2023-08-02T00:41:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-06-12T17:57:34Z","title":"Attention Is All You Need","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.03762","snapshot_observed_at":"2026-08-07T10:45:09.938312Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04642","last_updated":"2025-06-05T05:23:38Z","snapshot_observed_at":"2026-08-09T14:51:33.229436Z","submitted_at":"2025-06-05T05:23:38Z","title":"TaDA: Training-free recipe for Decoding with Adaptive KV Cache Compression and Mean-centering","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T10:45:09.938312Z"},"links":{"cited_paper":"/paper/1706.03762","citing_paper":"/paper/2506.04642"},"observation_digest":"sha256:998a3384d6ff2033cf7f9eecea97816eb3af7042249e940eefa80a1219e65420","observation_id":"1a3c3d1d-0243-40c2-ab7c-11379f14c19f","resolution":{"observed_at":"2026-08-07T10:45:09.938312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:09.943240Z","title":"Cohen, Ruslan Salakhutdinov, and Christopher D","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.04642","last_updated":"2025-06-05T05:23:38Z","snapshot_observed_at":"2026-08-09T14:51:33.229436Z","submitted_at":"2025-06-05T05:23:38Z","title":"TaDA: Training-free recipe for Decoding with Adaptive KV Cache Compression and Mean-centering","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T10:45:09.943240Z"},"links":{"citing_paper":"/paper/2506.04642"},"observation_digest":"sha256:e8cc0e7d3f233c09b590197a4bdafd3f4eea0885de0f70c38294a291a09f1ef0","observation_id":"bd5e42cf-18cb-4fea-9e28-bde12a9c36a8","resolution":{"observed_at":"2026-08-07T10:45:09.943240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07056","last_updated":"2024-06-11T08:37:33Z","snapshot_observed_at":"2026-08-10T10:11:23.551415Z","submitted_at":"2024-06-11T08:37:33Z","title":"Effectively Compress KV Heads for LLM","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07056","snapshot_observed_at":"2026-08-07T10:45:09.947823Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04642","last_updated":"2025-06-05T05:23:38Z","snapshot_observed_at":"2026-08-09T14:51:33.229436Z","submitted_at":"2025-06-05T05:23:38Z","title":"TaDA: Training-free recipe for Decoding with Adaptive KV Cache Compression and Mean-centering","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T10:45:09.947823Z"},"links":{"cited_paper":"/paper/2406.07056","citing_paper":"/paper/2506.04642"},"observation_digest":"sha256:f76ef00571b19d907ad332ea9dc43150a2cdbedccc84e85fcd403f3aefbc24e0","observation_id":"0f93231f-9814-4dc5-85c4-ecb43a2b7e43","resolution":{"observed_at":"2026-08-07T10:45:09.947823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.13369","last_updated":"2020-10-26T06:50:07Z","snapshot_observed_at":"2026-07-06T10:08:27.055672Z","submitted_at":"2020-10-26T06:50:07Z","title":"Accelerating Training of Transformer-Based Language Models with Progressive Layer Dropping","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.13369","snapshot_observed_at":"2026-08-07T10:45:09.952447Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.04642","last_updated":"2025-06-05T05:23:38Z","snapshot_observed_at":"2026-08-09T14:51:33.229436Z","submitted_at":"2025-06-05T05:23:38Z","title":"TaDA: Training-free recipe for Decoding with Adaptive KV Cache Compression and Mean-centering","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T10:45:09.952447Z"},"links":{"cited_paper":"/paper/2010.13369","citing_paper":"/paper/2506.04642"},"observation_digest":"sha256:fbf05c14fab043201005752b9259b01747eda9a7e0f05d1432b781e86b6434a3","observation_id":"2c7daa70-4d90-4fdb-8a50-23d4b97d8245","resolution":{"observed_at":"2026-08-07T10:45:09.952447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:10.634409Z","title":null,"venue":null,"work_id":"4957c481-0f9d-4f3d-b319-fd8ca7bf357b","year":2023},"citing_paper":{"arxiv_id":"2506.04642","last_updated":"2025-06-05T05:23:38Z","snapshot_observed_at":"2026-08-09T14:51:33.229436Z","submitted_at":"2025-06-05T05:23:38Z","title":"TaDA: Training-free recipe for Decoding with Adaptive KV Cache Compression and Mean-centering","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T10:45:09.957404Z"},"links":{"citing_paper":"/paper/2506.04642"},"observation_digest":"sha256:ee0d59431a07efd576788229fc9f6e507116600932c3ade99cebc171aed49516","observation_id":"ee8404e7-937d-4390-a1da-bb201b4e0a22","resolution":{"observed_at":"2026-08-07T10:45:10.649641Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:09.964123Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04642","last_updated":"2025-06-05T05:23:38Z","snapshot_observed_at":"2026-08-09T14:51:33.229436Z","submitted_at":"2025-06-05T05:23:38Z","title":"TaDA: Training-free recipe for Decoding with Adaptive KV Cache Compression and Mean-centering","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T10:45:09.964123Z"},"links":{"citing_paper":"/paper/2506.04642"},"observation_digest":"sha256:5dafdf9baa3c1d78257f7866387f34d2589659de1b41285b8d0faf63fad00ea8","observation_id":"8a744468-b86b-4f68-96bc-c8900601386b","resolution":{"observed_at":"2026-08-07T10:45:09.964123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:09.969345Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04642","last_updated":"2025-06-05T05:23:38Z","snapshot_observed_at":"2026-08-09T14:51:33.229436Z","submitted_at":"2025-06-05T05:23:38Z","title":"TaDA: Training-free recipe for Decoding with Adaptive KV Cache Compression and Mean-centering","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T10:45:09.969345Z"},"links":{"citing_paper":"/paper/2506.04642"},"observation_digest":"sha256:d11600668220e3c74dedf1d31538deb453087990c7e251e060b0020942d9b0de","observation_id":"1c9ebf99-05a5-4efc-9c46-b326a0197ddf","resolution":{"observed_at":"2026-08-07T10:45:09.969345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.04642","last_updated":"2025-06-05T05:23:38Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T14:51:33.229436Z","submitted_at":"2025-06-05T05:23:38Z","title":"TaDA: Training-free recipe for Decoding with Adaptive KV Cache Compression and Mean-centering"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 1 inbound Pith citation observation for arXiv:2506.04642."}