{"as_of":"2026-08-09T21:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3957270f34f071a78308a717ae668297c7b0a1a81a2d793383b4f029f69e26ba","coverage":[{"denominator":30,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T21:59:42.069033Z","state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.03276/citation-record","integrity":"/paper/2608.03276/integrity","json":"/paper/2608.03276/citation-record.json","paper":"/paper/2608.03276"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:59:39.774165Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03276","last_updated":"2026-08-04T07:51:37Z","snapshot_observed_at":"2026-08-07T23:10:50.426171Z","submitted_at":"2026-08-04T07:51:37Z","title":"TaskPress: Query-Agnostic KV Cache Compression via Task-Guided Pruning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:39.774165Z"},"links":{"citing_paper":"/paper/2608.03276"},"observation_digest":"sha256:6a3767c1b80940bf63cfe7fe4c8cb273e24f8c813c4edaba6b2d8e4606c0a3b3","observation_id":"dbe8b821-a598-48a3-a325-b8850c3ab815","resolution":{"observed_at":"2026-08-05T21:59:39.774165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-05T21:59:39.862174Z","title":"arXiv preprint arXiv:2507.06261 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03276","last_updated":"2026-08-04T07:51:37Z","snapshot_observed_at":"2026-08-07T23:10:50.426171Z","submitted_at":"2026-08-04T07:51:37Z","title":"TaskPress: Query-Agnostic KV Cache Compression via Task-Guided Pruning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:39.862174Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2608.03276"},"observation_digest":"sha256:29d3e033a8fb536c4c63d5f1c5b34bb205ca5ce1f01d62ff134e4133f157392c","observation_id":"bdd859cb-8c00-431f-b0b3-dc70ed84abc0","resolution":{"observed_at":"2026-08-05T21:59:39.862174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:59:39.949651Z","title":"arXiv e-prints , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03276","last_updated":"2026-08-04T07:51:37Z","snapshot_observed_at":"2026-08-07T23:10:50.426171Z","submitted_at":"2026-08-04T07:51:37Z","title":"TaskPress: Query-Agnostic KV Cache Compression via Task-Guided Pruning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:39.949651Z"},"links":{"citing_paper":"/paper/2608.03276"},"observation_digest":"sha256:592a70c98f41972ce6b0388e5e0aca813a22ced6f864a38c0ed6042972f512a5","observation_id":"d1da05a3-d5c9-487f-a586-3aea107f7aff","resolution":{"observed_at":"2026-08-05T21:59:39.949651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04396","last_updated":"2024-06-04T04:51:52Z","snapshot_observed_at":"2026-08-09T13:06:16.631036Z","submitted_at":"2024-02-06T20:52:12Z","title":"QuIP#: Even Better LLM Quantization with Hadamard Incoherence and Lattice Codebooks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04396","snapshot_observed_at":"2026-08-05T21:59:39.992784Z","title":"arXiv preprint arXiv:2402.04396 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03276","last_updated":"2026-08-04T07:51:37Z","snapshot_observed_at":"2026-08-07T23:10:50.426171Z","submitted_at":"2026-08-04T07:51:37Z","title":"TaskPress: Query-Agnostic KV Cache Compression via Task-Guided Pruning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:39.992784Z"},"links":{"cited_paper":"/paper/2402.04396","citing_paper":"/paper/2608.03276"},"observation_digest":"sha256:d31081adce21f4c3ae3b961e8d9654d6f71bd321583e7973a3ff0de0d1cb810a","observation_id":"c2ee7334-ce78-4440-80e0-3553412fa3c8","resolution":{"observed_at":"2026-08-05T21:59:39.992784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:59:40.053796Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03276","last_updated":"2026-08-04T07:51:37Z","snapshot_observed_at":"2026-08-07T23:10:50.426171Z","submitted_at":"2026-08-04T07:51:37Z","title":"TaskPress: Query-Agnostic KV Cache Compression via Task-Guided Pruning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:40.053796Z"},"links":{"citing_paper":"/paper/2608.03276"},"observation_digest":"sha256:8b5753b4ba8aac719f1ddc711b293e214dee38304a90940fd20bfaffac5a153e","observation_id":"d3abccd2-8256-4902-a81e-29260a35757a","resolution":{"observed_at":"2026-08-05T21:59:40.053796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:59:40.150338Z","title":"arXiv preprint arXiv:2505.23416 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03276","last_updated":"2026-08-04T07:51:37Z","snapshot_observed_at":"2026-08-07T23:10:50.426171Z","submitted_at":"2026-08-04T07:51:37Z","title":"TaskPress: Query-Agnostic KV Cache Compression via Task-Guided Pruning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:40.150338Z"},"links":{"citing_paper":"/paper/2608.03276"},"observation_digest":"sha256:29c6d418dcefe8869b2769874509f206b82788176c1acae6211f50b291507d96","observation_id":"1ca5b6de-207a-46a4-bc71-e9cb5799be3e","resolution":{"observed_at":"2026-08-05T21:59:40.150338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:59:40.206983Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03276","last_updated":"2026-08-04T07:51:37Z","snapshot_observed_at":"2026-08-07T23:10:50.426171Z","submitted_at":"2026-08-04T07:51:37Z","title":"TaskPress: Query-Agnostic KV Cache Compression via Task-Guided Pruning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:40.206983Z"},"links":{"citing_paper":"/paper/2608.03276"},"observation_digest":"sha256:cf7744d3f35a20e165bf3732c7fb1d07af3902428238764923e52a367aec006b","observation_id":"5ef4e41e-96ac-409f-bdc0-d202f9b5b105","resolution":{"observed_at":"2026-08-05T21:59:40.206983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:59:40.312184Z","title":"Proceedings of the 62nd annual meeting of the association for computational linguistics (volume 1: Long papers) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03276","last_updated":"2026-08-04T07:51:37Z","snapshot_observed_at":"2026-08-07T23:10:50.426171Z","submitted_at":"2026-08-04T07:51:37Z","title":"TaskPress: Query-Agnostic KV Cache Compression via Task-Guided Pruning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:40.312184Z"},"links":{"citing_paper":"/paper/2608.03276"},"observation_digest":"sha256:dfbba27afb16c54ef1abac51b819bd7d7f11ddc54d99aedb3d81f37468cb2843","observation_id":"d9160a4f-cdd8-456b-b203-e6bfb8f514b4","resolution":{"observed_at":"2026-08-05T21:59:40.312184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:59:40.377015Z","title":"2024 , journal=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03276","last_updated":"2026-08-04T07:51:37Z","snapshot_observed_at":"2026-08-07T23:10:50.426171Z","submitted_at":"2026-08-04T07:51:37Z","title":"TaskPress: Query-Agnostic KV Cache Compression via Task-Guided Pruning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:40.377015Z"},"links":{"citing_paper":"/paper/2608.03276"},"observation_digest":"sha256:67181bd90bc7d763fc86546686da0a7349f17338fa838bd6ca33f1b52dbfde8d","observation_id":"34f0d760-77ab-4334-a0d8-71b227860a66","resolution":{"observed_at":"2026-08-05T21:59:40.377015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13245","last_updated":"2023-12-23T17:55:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-22T17:16:38Z","title":"GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13245","snapshot_observed_at":"2026-08-05T21:59:40.454824Z","title":"arXiv preprint arXiv:2305.13245 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03276","last_updated":"2026-08-04T07:51:37Z","snapshot_observed_at":"2026-08-07T23:10:50.426171Z","submitted_at":"2026-08-04T07:51:37Z","title":"TaskPress: Query-Agnostic KV Cache Compression via Task-Guided Pruning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:40.454824Z"},"links":{"cited_paper":"/paper/2305.13245","citing_paper":"/paper/2608.03276"},"observation_digest":"sha256:5734eee52d9158b1b7b743a28457cb204599ede756b522e7a6b091b6ebbfa6ce","observation_id":"b3f571e3-5f4e-4a0e-bd3b-5dffa2fac473","resolution":{"observed_at":"2026-08-05T21:59:40.454824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:59:40.540575Z","title":"Aho and Jeffrey D","venue":null,"work_id":null,"year":1972},"citing_paper":{"arxiv_id":"2608.03276","last_updated":"2026-08-04T07:51:37Z","snapshot_observed_at":"2026-08-07T23:10:50.426171Z","submitted_at":"2026-08-04T07:51:37Z","title":"TaskPress: Query-Agnostic KV Cache Compression via Task-Guided Pruning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:40.540575Z"},"links":{"citing_paper":"/paper/2608.03276"},"observation_digest":"sha256:ba90701adac5ffaaf0e8808f67a6a3ff527aa2d36f4370a2bdb418ff4270cc4e","observation_id":"7ddb599d-f777-4390-9315-b6aa1d9198ca","resolution":{"observed_at":"2026-08-05T21:59:40.540575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:59:40.613812Z","title":null,"venue":null,"work_id":null,"year":1983},"citing_paper":{"arxiv_id":"2608.03276","last_updated":"2026-08-04T07:51:37Z","snapshot_observed_at":"2026-08-07T23:10:50.426171Z","submitted_at":"2026-08-04T07:51:37Z","title":"TaskPress: Query-Agnostic KV Cache Compression via Task-Guided Pruning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:40.613812Z"},"links":{"citing_paper":"/paper/2608.03276"},"observation_digest":"sha256:130bc9455a7da1a3444c65f380d9f99c3e5ce5fba09fbe1d7d0f3a69850af0ed","observation_id":"01f19393-51ad-4881-b2a9-75414dfd0c0c","resolution":{"observed_at":"2026-08-05T21:59:40.613812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:59:40.704848Z","title":"Chandra and Dexter C","venue":null,"work_id":null,"year":1981},"citing_paper":{"arxiv_id":"2608.03276","last_updated":"2026-08-04T07:51:37Z","snapshot_observed_at":"2026-08-07T23:10:50.426171Z","submitted_at":"2026-08-04T07:51:37Z","title":"TaskPress: Query-Agnostic KV Cache Compression via Task-Guided Pruning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:40.704848Z"},"links":{"citing_paper":"/paper/2608.03276"},"observation_digest":"sha256:cdd017dd19d6f3eee6ec43ec32d9c04a26ee0ca5742e1852580da37cc2b48799","observation_id":"3b7c5472-42cf-4cf6-854d-6ae2a2f5eb47","resolution":{"observed_at":"2026-08-05T21:59:40.704848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:59:40.773510Z","title":"Scalable training of","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03276","last_updated":"2026-08-04T07:51:37Z","snapshot_observed_at":"2026-08-07T23:10:50.426171Z","submitted_at":"2026-08-04T07:51:37Z","title":"TaskPress: Query-Agnostic KV Cache Compression via Task-Guided Pruning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:40.773510Z"},"links":{"citing_paper":"/paper/2608.03276"},"observation_digest":"sha256:9e2efc9ba3384495947ee0274b34fc40f96ab9bb7051520f12b69b00e4b661bc","observation_id":"ff383ca3-9a6f-44e1-a23c-f6d9a5273013","resolution":{"observed_at":"2026-08-05T21:59:40.773510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-05T21:59:40.837648Z","title":"arXiv preprint arXiv:2505.09388 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03276","last_updated":"2026-08-04T07:51:37Z","snapshot_observed_at":"2026-08-07T23:10:50.426171Z","submitted_at":"2026-08-04T07:51:37Z","title":"TaskPress: Query-Agnostic KV Cache Compression via Task-Guided Pruning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:40.837648Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2608.03276"},"observation_digest":"sha256:e9eb38ee6f67e11f7554b015ac5e0d96fb8ca1a5d17811d42e2c9d0305778cb6","observation_id":"2c3e9243-dfc0-412e-9079-b4ce804173e8","resolution":{"observed_at":"2026-08-05T21:59:40.837648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00071","last_updated":"2026-02-06T19:40:50Z","snapshot_observed_at":"2026-08-01T02:15:47.181936Z","submitted_at":"2023-08-31T18:18:07Z","title":"YaRN: Efficient Context Window Extension of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00071","snapshot_observed_at":"2026-08-05T21:59:40.897709Z","title":"arXiv preprint arXiv:2309.00071 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03276","last_updated":"2026-08-04T07:51:37Z","snapshot_observed_at":"2026-08-07T23:10:50.426171Z","submitted_at":"2026-08-04T07:51:37Z","title":"TaskPress: Query-Agnostic KV Cache Compression via Task-Guided Pruning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:40.897709Z"},"links":{"cited_paper":"/paper/2309.00071","citing_paper":"/paper/2608.03276"},"observation_digest":"sha256:da49352d2be943f31bfe57a13c65d354531133690c9b07ca6fdb0355ec663af9","observation_id":"b3e48bfb-cd99-4b1e-a537-10fb8a436515","resolution":{"observed_at":"2026-08-05T21:59:40.897709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02750","last_updated":"2024-07-25T09:16:05Z","snapshot_observed_at":"2026-07-06T17:25:18.238343Z","submitted_at":"2024-02-05T06:06:47Z","title":"KIVI: A Tuning-Free Asymmetric 2bit Quantization for KV Cache","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02750","snapshot_observed_at":"2026-08-05T21:59:40.975548Z","title":"arXiv preprint arXiv:2402.02750 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03276","last_updated":"2026-08-04T07:51:37Z","snapshot_observed_at":"2026-08-07T23:10:50.426171Z","submitted_at":"2026-08-04T07:51:37Z","title":"TaskPress: Query-Agnostic KV Cache Compression via Task-Guided Pruning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:40.975548Z"},"links":{"cited_paper":"/paper/2402.02750","citing_paper":"/paper/2608.03276"},"observation_digest":"sha256:64f4a8cf90d88917de46f2df3170c000802304518640e6e6c5b8956607f19900","observation_id":"2a355e80-7671-400c-b963-f70a9aa0df83","resolution":{"observed_at":"2026-08-05T21:59:40.975548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:59:40.979665Z","title":"Transactions of the Association for Computational Linguistics , volume=","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.03276","last_updated":"2026-08-04T07:51:37Z","snapshot_observed_at":"2026-08-07T23:10:50.426171Z","submitted_at":"2026-08-04T07:51:37Z","title":"TaskPress: Query-Agnostic KV Cache Compression via Task-Guided Pruning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:40.979665Z"},"links":{"citing_paper":"/paper/2608.03276"},"observation_digest":"sha256:a269bbfd88fa6c2e6dae3800c4a80122aaf56e2965fbb918f9c3e2c3df97f314","observation_id":"ecc679f1-f96a-42cc-b274-f5ae9ed5bf3e","resolution":{"observed_at":"2026-08-05T21:59:40.979665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:59:43.760987Z","title":"Proceedings of the 2021 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies , pages=","venue":null,"work_id":"388d0c6a-198d-47a8-89be-ff01b8f904b1","year":2021},"citing_paper":{"arxiv_id":"2608.03276","last_updated":"2026-08-04T07:51:37Z","snapshot_observed_at":"2026-08-07T23:10:50.426171Z","submitted_at":"2026-08-04T07:51:37Z","title":"TaskPress: Query-Agnostic KV Cache Compression via Task-Guided Pruning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:40.986985Z"},"links":{"citing_paper":"/paper/2608.03276"},"observation_digest":"sha256:0e26ce62782fb3743aca05425d22eacc1388b0ada87f984f4cb7d8b0b8c3f070","observation_id":"57ef335a-7e18-44fb-a6ca-806255c2f040","resolution":{"observed_at":"2026-08-05T21:59:43.840340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.03011","last_updated":"2021-05-07T00:12:34Z","snapshot_observed_at":"2026-08-05T23:00:05.031488Z","submitted_at":"2021-05-07T00:12:34Z","title":"A Dataset of Information-Seeking Questions and Answers Anchored in Research Papers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.03011","snapshot_observed_at":"2026-08-05T21:59:41.117398Z","title":"arXiv preprint arXiv:2105.03011 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03276","last_updated":"2026-08-04T07:51:37Z","snapshot_observed_at":"2026-08-07T23:10:50.426171Z","submitted_at":"2026-08-04T07:51:37Z","title":"TaskPress: Query-Agnostic KV Cache Compression via Task-Guided Pruning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:41.117398Z"},"links":{"cited_paper":"/paper/2105.03011","citing_paper":"/paper/2608.03276"},"observation_digest":"sha256:dc3b61abd18ec338a87ed34d666acd85cc151d1fdb54176920ba96c167ee245f","observation_id":"ebb9345c-c937-44ce-9c33-2ae149964e2c","resolution":{"observed_at":"2026-08-05T21:59:41.117398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08691","last_updated":"2023-07-17T17:50:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-17T17:50:36Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08691","snapshot_observed_at":"2026-08-05T21:59:41.204194Z","title":"arXiv preprint arXiv:2307.08691 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03276","last_updated":"2026-08-04T07:51:37Z","snapshot_observed_at":"2026-08-07T23:10:50.426171Z","submitted_at":"2026-08-04T07:51:37Z","title":"TaskPress: Query-Agnostic KV Cache Compression via Task-Guided Pruning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:41.204194Z"},"links":{"cited_paper":"/paper/2307.08691","citing_paper":"/paper/2608.03276"},"observation_digest":"sha256:4acc5538851c7d22e5e8a57c6eb44c805a4b961110ac040c65315852c14e2db6","observation_id":"fe3fd0e6-dd5b-45e0-8251-5881eb78705f","resolution":{"observed_at":"2026-08-05T21:59:41.204194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17453","last_updated":"2024-04-07T00:56:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:59:56Z","title":"Efficient Streaming Language Models with Attention Sinks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17453","snapshot_observed_at":"2026-08-05T21:59:41.276253Z","title":"arXiv preprint arXiv:2309.17453 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03276","last_updated":"2026-08-04T07:51:37Z","snapshot_observed_at":"2026-08-07T23:10:50.426171Z","submitted_at":"2026-08-04T07:51:37Z","title":"TaskPress: Query-Agnostic KV Cache Compression via Task-Guided Pruning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:41.276253Z"},"links":{"cited_paper":"/paper/2309.17453","citing_paper":"/paper/2608.03276"},"observation_digest":"sha256:78ebbe2f6c81052c52c42bb05c5266d680541e6b7fc487967bd91ecfee92249c","observation_id":"3d3ea372-f07a-409e-83f4-a56ad2a408e9","resolution":{"observed_at":"2026-08-05T21:59:41.276253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:59:43.572058Z","title":null,"venue":null,"work_id":"3ead44b6-7c9c-4348-bbbe-8fc76283f149","year":null},"citing_paper":{"arxiv_id":"2608.03276","last_updated":"2026-08-04T07:51:37Z","snapshot_observed_at":"2026-08-07T23:10:50.426171Z","submitted_at":"2026-08-04T07:51:37Z","title":"TaskPress: Query-Agnostic KV Cache Compression via Task-Guided Pruning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:41.350661Z"},"links":{"citing_paper":"/paper/2608.03276"},"observation_digest":"sha256:df7595650619560f4f10a9160d548e9a596ddb3da481c847486f92f7a61a37f8","observation_id":"8e7369dd-06b1-4177-8e43-198d788884f2","resolution":{"observed_at":"2026-08-05T21:59:43.672610Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10774","last_updated":"2024-08-26T21:01:02Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-16T01:33:02Z","title":"Quest: Query-Aware Sparsity for Efficient Long-Context LLM Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10774","snapshot_observed_at":"2026-08-05T21:59:41.431019Z","title":"arXiv preprint arXiv:2406.10774 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03276","last_updated":"2026-08-04T07:51:37Z","snapshot_observed_at":"2026-08-07T23:10:50.426171Z","submitted_at":"2026-08-04T07:51:37Z","title":"TaskPress: Query-Agnostic KV Cache Compression via Task-Guided Pruning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:41.431019Z"},"links":{"cited_paper":"/paper/2406.10774","citing_paper":"/paper/2608.03276"},"observation_digest":"sha256:dfa9177d982b1885f6d19f0f1432ce8acd8979c36a1eedb9f02177bbbf2e7d66","observation_id":"ffb8fda0-a8f9-4cb8-9bb3-0d37b8c24325","resolution":{"observed_at":"2026-08-05T21:59:41.431019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:59:41.520513Z","title":"arXiv preprint arXiv:2510.00636 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03276","last_updated":"2026-08-04T07:51:37Z","snapshot_observed_at":"2026-08-07T23:10:50.426171Z","submitted_at":"2026-08-04T07:51:37Z","title":"TaskPress: Query-Agnostic KV Cache Compression via Task-Guided Pruning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:41.520513Z"},"links":{"citing_paper":"/paper/2608.03276"},"observation_digest":"sha256:b5aa68fc946479991a1e4c9bc213a04edf3b29c6ad6b518efa93a1485299d5f6","observation_id":"b80f8092-b286-4f72-a24a-facc29f085d7","resolution":{"observed_at":"2026-08-05T21:59:41.520513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16406","last_updated":"2025-02-20T06:07:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-26T02:15:49Z","title":"SpinQuant: LLM quantization with learned rotations","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16406","snapshot_observed_at":"2026-08-05T21:59:41.606605Z","title":"arXiv preprint arXiv:2405.16406 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03276","last_updated":"2026-08-04T07:51:37Z","snapshot_observed_at":"2026-08-07T23:10:50.426171Z","submitted_at":"2026-08-04T07:51:37Z","title":"TaskPress: Query-Agnostic KV Cache Compression via Task-Guided Pruning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:41.606605Z"},"links":{"cited_paper":"/paper/2405.16406","citing_paper":"/paper/2608.03276"},"observation_digest":"sha256:657b90e63468ab3fa2913366ca37609bb543719f2f3b9802d4cec6b877895d4f","observation_id":"2fb5c9c2-02c6-4dd3-afb1-09f1be56bf53","resolution":{"observed_at":"2026-08-05T21:59:41.606605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.15038","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:59:42.290586Z","title":"arXiv preprint arXiv:2509.15038 , year=","venue":null,"work_id":"b0c88467-32ef-4583-a10e-46fde9ceb9bc","year":null},"citing_paper":{"arxiv_id":"2608.03276","last_updated":"2026-08-04T07:51:37Z","snapshot_observed_at":"2026-08-07T23:10:50.426171Z","submitted_at":"2026-08-04T07:51:37Z","title":"TaskPress: Query-Agnostic KV Cache Compression via Task-Guided Pruning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:41.757054Z"},"links":{"citing_paper":"/paper/2608.03276"},"observation_digest":"sha256:b7a598836de301effcfd937fa15d3d3f25889a7a93c0db7e0b48256d2be838d8","observation_id":"a00427ac-07d4-43e3-961f-b1e5cafe5dbb","resolution":{"observed_at":"2026-08-05T21:59:42.382640Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:59:43.290467Z","title":null,"venue":null,"work_id":"881316c0-3381-4b5c-898e-4ea46162c9cc","year":null},"citing_paper":{"arxiv_id":"2608.03276","last_updated":"2026-08-04T07:51:37Z","snapshot_observed_at":"2026-08-07T23:10:50.426171Z","submitted_at":"2026-08-04T07:51:37Z","title":"TaskPress: Query-Agnostic KV Cache Compression via Task-Guided Pruning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:41.845290Z"},"links":{"citing_paper":"/paper/2608.03276"},"observation_digest":"sha256:bfd7ce29409c3cf3cfd79239cb08996fcac8af1a86799a7ceba39541e3a23ca9","observation_id":"c9dedf5a-0ced-4481-804d-304b56cb51a9","resolution":{"observed_at":"2026-08-05T21:59:43.436389Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:59:42.953080Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":"a6baadfc-6216-409f-9809-e3af7e459722","year":null},"citing_paper":{"arxiv_id":"2608.03276","last_updated":"2026-08-04T07:51:37Z","snapshot_observed_at":"2026-08-07T23:10:50.426171Z","submitted_at":"2026-08-04T07:51:37Z","title":"TaskPress: Query-Agnostic KV Cache Compression via Task-Guided Pruning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:41.980489Z"},"links":{"citing_paper":"/paper/2608.03276"},"observation_digest":"sha256:1cd74f5076be93fbb82664cd92b675622899f44d00345536b6e7e276517ce9ca","observation_id":"e5e9855d-2838-4d65-9544-e0f09475d798","resolution":{"observed_at":"2026-08-05T21:59:43.116266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:59:42.818457Z","title":"Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing , pages=","venue":null,"work_id":"f863e342-6557-4c3a-a328-54f9bd7198bd","year":2024},"citing_paper":{"arxiv_id":"2608.03276","last_updated":"2026-08-04T07:51:37Z","snapshot_observed_at":"2026-08-07T23:10:50.426171Z","submitted_at":"2026-08-04T07:51:37Z","title":"TaskPress: Query-Agnostic KV Cache Compression via Task-Guided Pruning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:42.069033Z"},"links":{"citing_paper":"/paper/2608.03276"},"observation_digest":"sha256:7fca7f21424f30b401038eeeffe884088c6fc42293834f46bee6e760a0bce1df","observation_id":"0e718096-f87c-48ed-b599-cef4ed605f5f","resolution":{"observed_at":"2026-08-05T21:59:42.882544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.03276","last_updated":"2026-08-04T07:51:37Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-07T23:10:50.426171Z","submitted_at":"2026-08-04T07:51:37Z","title":"TaskPress: Query-Agnostic KV Cache Compression via Task-Guided Pruning"},"reference_resolution":{"displayed":30,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":1,"verified_fuzzy":3},"total_outbound_references":30},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 30 of 30 outbound references and 0 inbound Pith citation observations for arXiv:2608.03276."}