{"as_of":"2026-08-17T12:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:555cfd250835438b2dbe8c88014b51a5b3e409711244d179545a33b1655612ee","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T19:44:35.835963Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T04:15:48.991022Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-14T04:15:49.096065Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2608.06849","last_updated":"2026-08-07T06:18:18Z","snapshot_observed_at":"2026-08-17T05:55:22.437033Z","submitted_at":"2026-08-07T06:18:18Z","title":"Autonomy-of-Heads: Data-Free Sparse Attention from Frozen Query-Key Geometry","version":1},"cited_work":{"arxiv_id":"2608.06849","doi":null,"metadata_source":"pith","pith_arxiv_id":"2608.06849","snapshot_observed_at":"2026-08-14T04:15:49.096065Z","title":"Autonomy-of-Heads: Data-Free Sparse Attention from Frozen Query-Key Geometry","venue":"cs.CL","work_id":"c0acc287-f11a-40d6-be9b-b13e0ffafd7c","year":2026},"citing_paper":{"arxiv_id":"2608.10288","last_updated":"2026-08-10T22:45:22Z","snapshot_observed_at":"2026-08-16T18:06:38.184117Z","submitted_at":"2026-08-10T22:45:22Z","title":"Power law graph attention: exact generalization of scaled dot-product attention, empirical collapse at inference","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-14T04:15:48.991022Z"},"links":{"cited_paper":"/paper/2608.06849","citing_paper":"/paper/2608.10288"},"observation_digest":"sha256:fd61106427b2cd6060fcbc85dee6451831723c462aef17f1cc09812e5158dd13","observation_id":"2fa83f69-0a2a-455f-85ae-b57810537f32","resolution":{"observed_at":"2026-08-14T04:15:49.105871Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2608.06849/citation-record","integrity":"/paper/2608.06849/integrity","json":"/paper/2608.06849/citation-record.json","paper":"/paper/2608.06849"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:44:35.642890Z","title":"arXiv preprint arXiv:2602.03560 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06849","last_updated":"2026-08-07T06:18:18Z","snapshot_observed_at":"2026-08-17T05:55:22.437033Z","submitted_at":"2026-08-07T06:18:18Z","title":"Autonomy-of-Heads: Data-Free Sparse Attention from Frozen Query-Key Geometry","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-10T19:44:35.642890Z"},"links":{"citing_paper":"/paper/2608.06849"},"observation_digest":"sha256:caf0271153e0942a94dcc2ae204f7a6e9717a12381b3a2da83d2e90d70dbb06a","observation_id":"2baa8a96-9d7a-421d-846b-eb1b1f0ebc28","resolution":{"observed_at":"2026-08-10T19:44:35.642890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:44:36.865614Z","title":"DuoAttention: Efficient Long-Context LLM Inference with Retrieval and Streaming Heads , url =","venue":null,"work_id":"9f278237-ea5d-4ec5-b8de-e358a9db1038","year":null},"citing_paper":{"arxiv_id":"2608.06849","last_updated":"2026-08-07T06:18:18Z","snapshot_observed_at":"2026-08-17T05:55:22.437033Z","submitted_at":"2026-08-07T06:18:18Z","title":"Autonomy-of-Heads: Data-Free Sparse Attention from Frozen Query-Key Geometry","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-10T19:44:35.650022Z"},"links":{"citing_paper":"/paper/2608.06849"},"observation_digest":"sha256:bcd6da32e431d4e4280580c2b7fd877b15d55edbcc8f1efd5b2d3a3c90ef79a3","observation_id":"786adb56-7bab-40c8-acd0-077e75c335b8","resolution":{"observed_at":"2026-08-10T19:44:36.869167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:44:35.654506Z","title":"arXiv preprint arXiv:2602.04541 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06849","last_updated":"2026-08-07T06:18:18Z","snapshot_observed_at":"2026-08-17T05:55:22.437033Z","submitted_at":"2026-08-07T06:18:18Z","title":"Autonomy-of-Heads: Data-Free Sparse Attention from Frozen Query-Key Geometry","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-10T19:44:35.654506Z"},"links":{"citing_paper":"/paper/2608.06849"},"observation_digest":"sha256:6028f43e4a70efeff492983dc77791ea1ed4a096be8aa16c3e2a62679f2501b5","observation_id":"cda04c08-d434-4f83-8b1e-f790187b437e","resolution":{"observed_at":"2026-08-10T19:44:35.654506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:44:35.658664Z","title":"arXiv preprint arXiv:2512.16391 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06849","last_updated":"2026-08-07T06:18:18Z","snapshot_observed_at":"2026-08-17T05:55:22.437033Z","submitted_at":"2026-08-07T06:18:18Z","title":"Autonomy-of-Heads: Data-Free Sparse Attention from Frozen Query-Key Geometry","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-10T19:44:35.658664Z"},"links":{"citing_paper":"/paper/2608.06849"},"observation_digest":"sha256:46cc596f469b923ad2d0a0abd7f5ebf7fa37dbbab5cea9fa4624b40e52b34e6d","observation_id":"5377e7a1-0dae-4a69-a803-9f316acf1822","resolution":{"observed_at":"2026-08-10T19:44:35.658664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:44:36.852157Z","title":"TidalDecode: Fast and Accurate LLM Decoding with Position Persistent Sparse Attention , url =","venue":null,"work_id":"3d5a5a4f-0fed-408a-aa23-d666ec60799e","year":null},"citing_paper":{"arxiv_id":"2608.06849","last_updated":"2026-08-07T06:18:18Z","snapshot_observed_at":"2026-08-17T05:55:22.437033Z","submitted_at":"2026-08-07T06:18:18Z","title":"Autonomy-of-Heads: Data-Free Sparse Attention from Frozen Query-Key Geometry","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-10T19:44:35.663161Z"},"links":{"citing_paper":"/paper/2608.06849"},"observation_digest":"sha256:f56f89cd94ea82c8c0e46e148c6941163f7f73fca52ff6f783ec4ed1e887cd6a","observation_id":"251ce26f-15bf-4f23-b341-74b4f142b2cc","resolution":{"observed_at":"2026-08-10T19:44:36.857109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:44:35.668007Z","title":"arXiv preprint arXiv:2603.12201 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06849","last_updated":"2026-08-07T06:18:18Z","snapshot_observed_at":"2026-08-17T05:55:22.437033Z","submitted_at":"2026-08-07T06:18:18Z","title":"Autonomy-of-Heads: Data-Free Sparse Attention from Frozen Query-Key Geometry","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-10T19:44:35.668007Z"},"links":{"citing_paper":"/paper/2608.06849"},"observation_digest":"sha256:a86973d28b1c546664c5ffaf92b2d36d2ef3c07b1f34f26d45cc88707779784c","observation_id":"34cb0297-2d70-4e6e-8930-d50cc24d0c26","resolution":{"observed_at":"2026-08-10T19:44:35.668007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.02556","last_updated":"2025-12-02T09:25:14Z","snapshot_observed_at":"2026-08-17T01:58:07.850738Z","submitted_at":"2025-12-02T09:25:14Z","title":"DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.02556","snapshot_observed_at":"2026-08-10T19:44:35.672325Z","title":"2: Pushing the Frontier of Open Large Language Models , author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06849","last_updated":"2026-08-07T06:18:18Z","snapshot_observed_at":"2026-08-17T05:55:22.437033Z","submitted_at":"2026-08-07T06:18:18Z","title":"Autonomy-of-Heads: Data-Free Sparse Attention from Frozen Query-Key Geometry","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-10T19:44:35.672325Z"},"links":{"cited_paper":"/paper/2512.02556","citing_paper":"/paper/2608.06849"},"observation_digest":"sha256:913aa24bed5d2deab17c2f76f4c9ee349b9d254ba827ce1b79d8299e512bdb42","observation_id":"fcc684d6-1fac-43a8-a417-ea18ce4da16a","resolution":{"observed_at":"2026-08-10T19:44:35.672325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:44:35.675906Z","title":"arXiv preprint arXiv:2603.13314 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06849","last_updated":"2026-08-07T06:18:18Z","snapshot_observed_at":"2026-08-17T05:55:22.437033Z","submitted_at":"2026-08-07T06:18:18Z","title":"Autonomy-of-Heads: Data-Free Sparse Attention from Frozen Query-Key Geometry","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-10T19:44:35.675906Z"},"links":{"citing_paper":"/paper/2608.06849"},"observation_digest":"sha256:a74af40f396597cc8f2c6688dc8de313985dcad63c651632087b436a2695d2d4","observation_id":"7bcf13e1-0960-4e5a-beec-6ceb664bb4a8","resolution":{"observed_at":"2026-08-10T19:44:35.675906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-10T19:44:35.679427Z","title":"arXiv preprint arXiv:2412.15115 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06849","last_updated":"2026-08-07T06:18:18Z","snapshot_observed_at":"2026-08-17T05:55:22.437033Z","submitted_at":"2026-08-07T06:18:18Z","title":"Autonomy-of-Heads: Data-Free Sparse Attention from Frozen Query-Key Geometry","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-10T19:44:35.679427Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2608.06849"},"observation_digest":"sha256:99fc7aa575e7200436e391d7b05c20f910b7932fafeb980805f35ad60bfefc56","observation_id":"5382df52-881f-4cc6-bf0d-ca7890dd6284","resolution":{"observed_at":"2026-08-10T19:44:35.679427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-08-07T19:30:34.681869Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-08-10T19:44:35.683757Z","title":"arXiv preprint arXiv:2510.26692 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06849","last_updated":"2026-08-07T06:18:18Z","snapshot_observed_at":"2026-08-17T05:55:22.437033Z","submitted_at":"2026-08-07T06:18:18Z","title":"Autonomy-of-Heads: Data-Free Sparse Attention from Frozen Query-Key Geometry","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-10T19:44:35.683757Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2608.06849"},"observation_digest":"sha256:c8c2be45b12aa91ab9d6a927182a4832363ab905e120050944a999ab5020b168","observation_id":"f2e1a930-1fad-4aca-be04-64ecf0be25bd","resolution":{"observed_at":"2026-08-10T19:44:35.683757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:44:36.837133Z","title":"https://www.anthropic.com/engineering/building-effective-agents , year=","venue":null,"work_id":"833aedc4-f0d5-454a-a49a-c0a6aaff52fc","year":null},"citing_paper":{"arxiv_id":"2608.06849","last_updated":"2026-08-07T06:18:18Z","snapshot_observed_at":"2026-08-17T05:55:22.437033Z","submitted_at":"2026-08-07T06:18:18Z","title":"Autonomy-of-Heads: Data-Free Sparse Attention from Frozen Query-Key Geometry","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-10T19:44:35.687863Z"},"links":{"citing_paper":"/paper/2608.06849"},"observation_digest":"sha256:d4f17c10ebf0749a09a1b06fed89f1c0bf87957f891383a8e5f09f2aa4606b8a","observation_id":"60b204c8-0da1-43dd-96bf-10b2f72628a7","resolution":{"observed_at":"2026-08-10T19:44:36.842789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:44:35.691848Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06849","last_updated":"2026-08-07T06:18:18Z","snapshot_observed_at":"2026-08-17T05:55:22.437033Z","submitted_at":"2026-08-07T06:18:18Z","title":"Autonomy-of-Heads: Data-Free Sparse Attention from Frozen Query-Key Geometry","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-10T19:44:35.691848Z"},"links":{"citing_paper":"/paper/2608.06849"},"observation_digest":"sha256:f29a7e72e81c01b6ff9ee3779422f2e717b28bcd34af75580406f0ba303bb3bd","observation_id":"c589a056-3e06-4f5c-995c-4ac402fc9541","resolution":{"observed_at":"2026-08-10T19:44:35.691848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.13035","last_updated":"2025-03-13T03:16:43Z","snapshot_observed_at":"2026-08-16T13:41:41.327341Z","submitted_at":"2024-06-18T20:01:51Z","title":"D2O: Dynamic Discriminative Operations for Efficient Long-Context Inference of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.13035","snapshot_observed_at":"2026-08-10T19:44:35.695799Z","title":"arXiv preprint arXiv:2406.13035 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06849","last_updated":"2026-08-07T06:18:18Z","snapshot_observed_at":"2026-08-17T05:55:22.437033Z","submitted_at":"2026-08-07T06:18:18Z","title":"Autonomy-of-Heads: Data-Free Sparse Attention from Frozen Query-Key Geometry","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-10T19:44:35.695799Z"},"links":{"cited_paper":"/paper/2406.13035","citing_paper":"/paper/2608.06849"},"observation_digest":"sha256:ac62e0c5ce02cc58ffef6daa0b6517516e49d0411ecb53d5e32d54f46d8fa21a","observation_id":"9503d981-62af-4a7d-b25c-49bd3461ac8a","resolution":{"observed_at":"2026-08-10T19:44:35.695799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18845","last_updated":"2025-06-04T08:36:19Z","snapshot_observed_at":"2026-08-16T12:55:08.161209Z","submitted_at":"2025-02-26T05:31:44Z","title":"Sliding Window Attention Training for Efficient Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18845","snapshot_observed_at":"2026-08-10T19:44:35.700092Z","title":"arXiv preprint arXiv:2502.18845 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06849","last_updated":"2026-08-07T06:18:18Z","snapshot_observed_at":"2026-08-17T05:55:22.437033Z","submitted_at":"2026-08-07T06:18:18Z","title":"Autonomy-of-Heads: Data-Free Sparse Attention from Frozen Query-Key Geometry","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-10T19:44:35.700092Z"},"links":{"cited_paper":"/paper/2502.18845","citing_paper":"/paper/2608.06849"},"observation_digest":"sha256:e570332e500d963188e1ec49c09f7036a83d236be998f95abcf7c5886fd73f17","observation_id":"2d61c39c-110e-49ec-bc3d-c7d85889c825","resolution":{"observed_at":"2026-08-10T19:44:35.700092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:44:36.814988Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"2fd677ef-1ff6-4c14-9cca-3687463c0da0","year":null},"citing_paper":{"arxiv_id":"2608.06849","last_updated":"2026-08-07T06:18:18Z","snapshot_observed_at":"2026-08-17T05:55:22.437033Z","submitted_at":"2026-08-07T06:18:18Z","title":"Autonomy-of-Heads: Data-Free Sparse Attention from Frozen Query-Key Geometry","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-10T19:44:35.704436Z"},"links":{"citing_paper":"/paper/2608.06849"},"observation_digest":"sha256:8f4d6d218c808a6020f45030900831e72114a4853c5eeb1274f81ceeb56bb46b","observation_id":"2247790e-36a6-4e37-870c-b4a359832b3e","resolution":{"observed_at":"2026-08-10T19:44:36.819151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:44:36.802636Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"90995854-6fa9-425f-b1dc-50fdbc9c0e72","year":null},"citing_paper":{"arxiv_id":"2608.06849","last_updated":"2026-08-07T06:18:18Z","snapshot_observed_at":"2026-08-17T05:55:22.437033Z","submitted_at":"2026-08-07T06:18:18Z","title":"Autonomy-of-Heads: Data-Free Sparse Attention from Frozen Query-Key Geometry","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-10T19:44:35.708177Z"},"links":{"citing_paper":"/paper/2608.06849"},"observation_digest":"sha256:cd87daf7304f03b1e3eed9affbfdea8dcebbae330667ad774e146eb9fb9aea15","observation_id":"4863f428-27e8-49ec-90fb-936c60c6f781","resolution":{"observed_at":"2026-08-10T19:44:36.806555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-10T19:44:35.712318Z","title":"arXiv preprint arXiv:2407.21783 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06849","last_updated":"2026-08-07T06:18:18Z","snapshot_observed_at":"2026-08-17T05:55:22.437033Z","submitted_at":"2026-08-07T06:18:18Z","title":"Autonomy-of-Heads: Data-Free Sparse Attention from Frozen Query-Key Geometry","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-10T19:44:35.712318Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2608.06849"},"observation_digest":"sha256:719caa9b8c51ab34757e4d27fdf570cf135ee9f6c1338c2f3bd14e61b134f5fe","observation_id":"2e44d7c7-b451-45d7-be05-66f9871912c0","resolution":{"observed_at":"2026-08-10T19:44:35.712318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:44:35.718471Z","title":"Proceedings of the 62nd annual meeting of the association for computational linguistics (volume 1: Long papers) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06849","last_updated":"2026-08-07T06:18:18Z","snapshot_observed_at":"2026-08-17T05:55:22.437033Z","submitted_at":"2026-08-07T06:18:18Z","title":"Autonomy-of-Heads: Data-Free Sparse Attention from Frozen Query-Key Geometry","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-10T19:44:35.718471Z"},"links":{"citing_paper":"/paper/2608.06849"},"observation_digest":"sha256:a383e7f8a46f1c6689cf154abb1ec03bf3d942525f7ef66b1d3c70b648b193db","observation_id":"5b22a25d-6072-4bd3-bae0-f3582aa00f59","resolution":{"observed_at":"2026-08-10T19:44:35.718471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:44:35.723367Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06849","last_updated":"2026-08-07T06:18:18Z","snapshot_observed_at":"2026-08-17T05:55:22.437033Z","submitted_at":"2026-08-07T06:18:18Z","title":"Autonomy-of-Heads: Data-Free Sparse Attention from Frozen Query-Key Geometry","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-10T19:44:35.723367Z"},"links":{"citing_paper":"/paper/2608.06849"},"observation_digest":"sha256:f6332c16f05d98d0a1c230fad6d427b79e9d26fff8008967f59a078a2089b7ce","observation_id":"c5c55004-16dc-4732-b785-ccde5bfa676e","resolution":{"observed_at":"2026-08-10T19:44:35.723367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1503.00519","last_updated":"2015-03-02T13:31:08Z","snapshot_observed_at":"2026-08-14T22:58:03.795546Z","submitted_at":"2015-03-02T13:31:08Z","title":"Generalizations of Sylvester's determinantal identity","version":1},"cited_work":{"arxiv_id":"1503.00519","doi":null,"metadata_source":"pith","pith_arxiv_id":"1503.00519","snapshot_observed_at":"2026-08-10T19:44:35.981996Z","title":"Generalizations of Sylvester's determinantal identity","venue":"math.NA","work_id":"9f545a15-6818-4c78-96ef-b5f996ad5b78","year":2015},"citing_paper":{"arxiv_id":"2608.06849","last_updated":"2026-08-07T06:18:18Z","snapshot_observed_at":"2026-08-17T05:55:22.437033Z","submitted_at":"2026-08-07T06:18:18Z","title":"Autonomy-of-Heads: Data-Free Sparse Attention from Frozen Query-Key Geometry","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-10T19:44:35.727416Z"},"links":{"cited_paper":"/paper/1503.00519","citing_paper":"/paper/2608.06849"},"observation_digest":"sha256:13d8944e5d27bcfafd20560f90b5d30c9d98d872f4d0db52d6114083a64e02a5","observation_id":"be5f38f2-ed3d-4bd9-bdab-4e881a67a06b","resolution":{"observed_at":"2026-08-10T19:44:35.988602Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:44:35.732282Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06849","last_updated":"2026-08-07T06:18:18Z","snapshot_observed_at":"2026-08-17T05:55:22.437033Z","submitted_at":"2026-08-07T06:18:18Z","title":"Autonomy-of-Heads: Data-Free Sparse Attention from Frozen Query-Key Geometry","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-10T19:44:35.732282Z"},"links":{"citing_paper":"/paper/2608.06849"},"observation_digest":"sha256:eef338d5f9768dfe39c4709b36671b92b32e61bf264de1ea89e6ed28f0016014","observation_id":"09e19945-f070-4d14-8a65-f47181b4d43e","resolution":{"observed_at":"2026-08-10T19:44:35.732282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-10T19:44:35.736618Z","title":"arXiv preprint arXiv:2004.05150 , year=","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2608.06849","last_updated":"2026-08-07T06:18:18Z","snapshot_observed_at":"2026-08-17T05:55:22.437033Z","submitted_at":"2026-08-07T06:18:18Z","title":"Autonomy-of-Heads: Data-Free Sparse Attention from Frozen Query-Key Geometry","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-10T19:44:35.736618Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2608.06849"},"observation_digest":"sha256:2e1a148328fee4e1337a9acff2537933771d3dcc85270f815ea6b468ec2d16df","observation_id":"c3bee1a0-e987-4232-bb2c-c0e13bc61cfd","resolution":{"observed_at":"2026-08-10T19:44:35.736618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:44:36.759531Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"f8c0c28e-6734-4c57-a11e-03d4f6ccf07f","year":null},"citing_paper":{"arxiv_id":"2608.06849","last_updated":"2026-08-07T06:18:18Z","snapshot_observed_at":"2026-08-17T05:55:22.437033Z","submitted_at":"2026-08-07T06:18:18Z","title":"Autonomy-of-Heads: Data-Free Sparse Attention from Frozen Query-Key Geometry","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-10T19:44:35.741180Z"},"links":{"citing_paper":"/paper/2608.06849"},"observation_digest":"sha256:e1bf665e61857ade90f14196994393e183f5ecb69b832e2ef7dadb9872e7ba5e","observation_id":"a8bd2e13-f82b-466d-9012-57f16914b3d5","resolution":{"observed_at":"2026-08-10T19:44:36.764310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:44:35.745592Z","title":"Efficient Streaming Language Models with Attention Sinks , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06849","last_updated":"2026-08-07T06:18:18Z","snapshot_observed_at":"2026-08-17T05:55:22.437033Z","submitted_at":"2026-08-07T06:18:18Z","title":"Autonomy-of-Heads: Data-Free Sparse Attention from Frozen Query-Key Geometry","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-10T19:44:35.745592Z"},"links":{"citing_paper":"/paper/2608.06849"},"observation_digest":"sha256:a89c6144f211789cc1b2b88fff073c852d14063ccfd8df487c5bbe8c24fe0a60","observation_id":"6d4a9e6c-ac44-48d2-ac33-64b3f8fc31e2","resolution":{"observed_at":"2026-08-10T19:44:35.745592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:44:36.739334Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"daf6b027-9e49-4266-9651-d9b8152c9eb6","year":null},"citing_paper":{"arxiv_id":"2608.06849","last_updated":"2026-08-07T06:18:18Z","snapshot_observed_at":"2026-08-17T05:55:22.437033Z","submitted_at":"2026-08-07T06:18:18Z","title":"Autonomy-of-Heads: Data-Free Sparse Attention from Frozen Query-Key Geometry","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-10T19:44:35.749658Z"},"links":{"citing_paper":"/paper/2608.06849"},"observation_digest":"sha256:ace01bb223245255e83e81123a516870eb5956b16fdc6439b68b76845e8326d3","observation_id":"27b4b91e-6d33-4616-9439-31575493a62a","resolution":{"observed_at":"2026-08-10T19:44:36.743057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18893","last_updated":"2026-05-27T05:57:00Z","snapshot_observed_at":"2026-08-16T12:47:16.033749Z","submitted_at":"2025-03-24T17:06:37Z","title":"xKV: Cross-Layer KV-Cache Compression via Aligned Singular Vector Extraction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18893","snapshot_observed_at":"2026-08-10T19:44:35.753794Z","title":"arXiv preprint arXiv:2503.18893 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06849","last_updated":"2026-08-07T06:18:18Z","snapshot_observed_at":"2026-08-17T05:55:22.437033Z","submitted_at":"2026-08-07T06:18:18Z","title":"Autonomy-of-Heads: Data-Free Sparse Attention from Frozen Query-Key Geometry","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-10T19:44:35.753794Z"},"links":{"cited_paper":"/paper/2503.18893","citing_paper":"/paper/2608.06849"},"observation_digest":"sha256:38eb6a0200caf30a3201077c2a09177541dd74413c5e0ac21418dc00360b517f","observation_id":"7221584d-8357-49d7-8281-3bca7ca1802a","resolution":{"observed_at":"2026-08-10T19:44:35.753794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.16134","last_updated":"2025-08-22T06:55:45Z","snapshot_observed_at":"2026-08-12T12:21:51.595957Z","submitted_at":"2025-08-22T06:55:45Z","title":"CommonKV: Compressing KV Cache with Cross-layer Parameter Sharing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.16134","snapshot_observed_at":"2026-08-10T19:44:35.760151Z","title":"arXiv preprint arXiv:2508.16134 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06849","last_updated":"2026-08-07T06:18:18Z","snapshot_observed_at":"2026-08-17T05:55:22.437033Z","submitted_at":"2026-08-07T06:18:18Z","title":"Autonomy-of-Heads: Data-Free Sparse Attention from Frozen Query-Key Geometry","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-10T19:44:35.760151Z"},"links":{"cited_paper":"/paper/2508.16134","citing_paper":"/paper/2608.06849"},"observation_digest":"sha256:6803ca96e2b8f044cbe741cc936ed0fc8cdda269c8a6332075aec2e3312d0c5b","observation_id":"aaf438dc-bf41-43d0-9b1a-74b9aad4cbda","resolution":{"observed_at":"2026-08-10T19:44:35.760151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08691","last_updated":"2023-07-17T17:50:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-17T17:50:36Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08691","snapshot_observed_at":"2026-08-10T19:44:35.764980Z","title":"arXiv preprint arXiv:2307.08691 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06849","last_updated":"2026-08-07T06:18:18Z","snapshot_observed_at":"2026-08-17T05:55:22.437033Z","submitted_at":"2026-08-07T06:18:18Z","title":"Autonomy-of-Heads: Data-Free Sparse Attention from Frozen Query-Key Geometry","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-10T19:44:35.764980Z"},"links":{"cited_paper":"/paper/2307.08691","citing_paper":"/paper/2608.06849"},"observation_digest":"sha256:19f09863f8719621e54ca8a68a686ac5ab3b5417c767996e87fe884090bbbe66","observation_id":"86e16be4-d1e6-49c4-bbb6-2a91a7dfaadc","resolution":{"observed_at":"2026-08-10T19:44:35.764980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:44:35.770378Z","title":"Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06849","last_updated":"2026-08-07T06:18:18Z","snapshot_observed_at":"2026-08-17T05:55:22.437033Z","submitted_at":"2026-08-07T06:18:18Z","title":"Autonomy-of-Heads: Data-Free Sparse Attention from Frozen Query-Key Geometry","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-10T19:44:35.770378Z"},"links":{"citing_paper":"/paper/2608.06849"},"observation_digest":"sha256:37634678d079a7f437ae32203c678c9853ae85a9eb318738aeab8ca25eba0942","observation_id":"3816af21-e8cb-4dcb-96ab-b59d43e47ad2","resolution":{"observed_at":"2026-08-10T19:44:35.770378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-10T19:44:35.774721Z","title":"arXiv preprint arXiv:2505.09388 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06849","last_updated":"2026-08-07T06:18:18Z","snapshot_observed_at":"2026-08-17T05:55:22.437033Z","submitted_at":"2026-08-07T06:18:18Z","title":"Autonomy-of-Heads: Data-Free Sparse Attention from Frozen Query-Key Geometry","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-10T19:44:35.774721Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2608.06849"},"observation_digest":"sha256:9e0466fe326fe4162e9cbaafc4903535b65e7418079c92a014800fa139e918e0","observation_id":"e3c7146a-2b83-4ac1-a07b-b4bce6ebaf33","resolution":{"observed_at":"2026-08-10T19:44:35.774721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:44:36.717336Z","title":"2026 , howpublished=","venue":null,"work_id":"e46f22a1-38ef-4013-ae73-579462a47c69","year":2026},"citing_paper":{"arxiv_id":"2608.06849","last_updated":"2026-08-07T06:18:18Z","snapshot_observed_at":"2026-08-17T05:55:22.437033Z","submitted_at":"2026-08-07T06:18:18Z","title":"Autonomy-of-Heads: Data-Free Sparse Attention from Frozen Query-Key Geometry","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-10T19:44:35.779114Z"},"links":{"citing_paper":"/paper/2608.06849"},"observation_digest":"sha256:d598fa5dbee853d61c1173fe883e19c5638ce62b4b94f527d61a349c733b562b","observation_id":"7ce472bd-9dcb-4ead-8cff-b1ba68562c9e","resolution":{"observed_at":"2026-08-10T19:44:36.721978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:44:35.784770Z","title":"Neurocomputing , volume=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06849","last_updated":"2026-08-07T06:18:18Z","snapshot_observed_at":"2026-08-17T05:55:22.437033Z","submitted_at":"2026-08-07T06:18:18Z","title":"Autonomy-of-Heads: Data-Free Sparse Attention from Frozen Query-Key Geometry","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-10T19:44:35.784770Z"},"links":{"citing_paper":"/paper/2608.06849"},"observation_digest":"sha256:0f13ae6842ecaf74ed7fc3b854e32904abc7094924e44fcfa6d0eb6a27d707d2","observation_id":"3354449a-4964-40d9-b868-d039b6b55524","resolution":{"observed_at":"2026-08-10T19:44:35.784770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:44:35.790099Z","title":"SnapKV: LLM Knows What You are Looking for Before Generation , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06849","last_updated":"2026-08-07T06:18:18Z","snapshot_observed_at":"2026-08-17T05:55:22.437033Z","submitted_at":"2026-08-07T06:18:18Z","title":"Autonomy-of-Heads: Data-Free Sparse Attention from Frozen Query-Key Geometry","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-10T19:44:35.790099Z"},"links":{"citing_paper":"/paper/2608.06849"},"observation_digest":"sha256:572949e2649159644c628e1fb1c79d2a79be832aefdff6db3b19aaecc104bc63","observation_id":"6f4dc911-b628-4881-8b09-df5574e2651d","resolution":{"observed_at":"2026-08-10T19:44:35.790099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:44:36.692158Z","title":"2024 , cdate=","venue":null,"work_id":"d531e8af-363c-4175-839a-d966f9d0f340","year":2024},"citing_paper":{"arxiv_id":"2608.06849","last_updated":"2026-08-07T06:18:18Z","snapshot_observed_at":"2026-08-17T05:55:22.437033Z","submitted_at":"2026-08-07T06:18:18Z","title":"Autonomy-of-Heads: Data-Free Sparse Attention from Frozen Query-Key Geometry","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-10T19:44:35.795282Z"},"links":{"citing_paper":"/paper/2608.06849"},"observation_digest":"sha256:bb62c95406f3f5ad2e50cd28949f31cb2cd7199e045d6134faeda8140b1e27d9","observation_id":"9b46b94c-f2a6-4420-aae1-f4c28c64570a","resolution":{"observed_at":"2026-08-10T19:44:36.697591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:44:36.675865Z","title":"RazorAttention: Efficient","venue":null,"work_id":"c3cca5c0-f7a0-4900-bf59-fb969b148e0e","year":2025},"citing_paper":{"arxiv_id":"2608.06849","last_updated":"2026-08-07T06:18:18Z","snapshot_observed_at":"2026-08-17T05:55:22.437033Z","submitted_at":"2026-08-07T06:18:18Z","title":"Autonomy-of-Heads: Data-Free Sparse Attention from Frozen Query-Key Geometry","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-10T19:44:35.799719Z"},"links":{"citing_paper":"/paper/2608.06849"},"observation_digest":"sha256:6795cd8299afaffda7bd809f4ebddec3a04eda1b9291b23e65b366d1fc6ef935","observation_id":"56809ac4-a57f-435c-aa9e-4185a153817d","resolution":{"observed_at":"2026-08-10T19:44:36.680615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:44:35.804930Z","title":"NACL : A General and Effective KV Cache Eviction Framework for LLM at Inference Time","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06849","last_updated":"2026-08-07T06:18:18Z","snapshot_observed_at":"2026-08-17T05:55:22.437033Z","submitted_at":"2026-08-07T06:18:18Z","title":"Autonomy-of-Heads: Data-Free Sparse Attention from Frozen Query-Key Geometry","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-10T19:44:35.804930Z"},"links":{"citing_paper":"/paper/2608.06849"},"observation_digest":"sha256:3377f41f0d9c23c0147a73f11336bf19ecbfe8c938c5508487c885524560cf69","observation_id":"8f7f343c-c3d4-45b4-9c4f-3fb85facbc2a","resolution":{"observed_at":"2026-08-10T19:44:35.804930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16362","last_updated":"2021-05-20T14:48:30Z","snapshot_observed_at":"2026-08-09T06:13:20.021836Z","submitted_at":"2020-06-29T20:28:52Z","title":"Multi-Head Attention: Collaborate Instead of Concatenate","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.16362","snapshot_observed_at":"2026-08-10T19:44:35.809431Z","title":"arXiv preprint arXiv:2006.16362 , year=","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2608.06849","last_updated":"2026-08-07T06:18:18Z","snapshot_observed_at":"2026-08-17T05:55:22.437033Z","submitted_at":"2026-08-07T06:18:18Z","title":"Autonomy-of-Heads: Data-Free Sparse Attention from Frozen Query-Key Geometry","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-10T19:44:35.809431Z"},"links":{"cited_paper":"/paper/2006.16362","citing_paper":"/paper/2608.06849"},"observation_digest":"sha256:1458b369c190c011d11ce01a189ff62095170ff6daf1c0d76b586adeb2a4ed86","observation_id":"3db61237-7085-4db7-9169-06198db0242e","resolution":{"observed_at":"2026-08-10T19:44:35.809431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16369","last_updated":"2023-08-31T00:03:02Z","snapshot_observed_at":"2026-08-15T04:42:28.752204Z","submitted_at":"2023-08-31T00:03:02Z","title":"SARATHI: Efficient LLM Inference by Piggybacking Decodes with Chunked Prefills","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16369","snapshot_observed_at":"2026-08-10T19:44:35.815239Z","title":"arXiv preprint arXiv:2308.16369 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06849","last_updated":"2026-08-07T06:18:18Z","snapshot_observed_at":"2026-08-17T05:55:22.437033Z","submitted_at":"2026-08-07T06:18:18Z","title":"Autonomy-of-Heads: Data-Free Sparse Attention from Frozen Query-Key Geometry","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-10T19:44:35.815239Z"},"links":{"cited_paper":"/paper/2308.16369","citing_paper":"/paper/2608.06849"},"observation_digest":"sha256:0fc4d775ac606918ae79605e270011881b6d84ba81930449821901cf61a08a52","observation_id":"c9f7353c-d3e2-4448-a8eb-c44e02803f13","resolution":{"observed_at":"2026-08-10T19:44:35.815239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:44:35.819645Z","title":"Proceedings of the 29th symposium on operating systems principles , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06849","last_updated":"2026-08-07T06:18:18Z","snapshot_observed_at":"2026-08-17T05:55:22.437033Z","submitted_at":"2026-08-07T06:18:18Z","title":"Autonomy-of-Heads: Data-Free Sparse Attention from Frozen Query-Key Geometry","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-10T19:44:35.819645Z"},"links":{"citing_paper":"/paper/2608.06849"},"observation_digest":"sha256:37bce76aa3769274a5a01a68c61a42f266819ed41c77a3698ce1b05f557cdbab","observation_id":"785cf5ae-4205-405b-8700-e02012b15afa","resolution":{"observed_at":"2026-08-10T19:44:35.819645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:44:35.823398Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06849","last_updated":"2026-08-07T06:18:18Z","snapshot_observed_at":"2026-08-17T05:55:22.437033Z","submitted_at":"2026-08-07T06:18:18Z","title":"Autonomy-of-Heads: Data-Free Sparse Attention from Frozen Query-Key Geometry","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-10T19:44:35.823398Z"},"links":{"citing_paper":"/paper/2608.06849"},"observation_digest":"sha256:39d25724b456ecc1a83f52ce588b3718cf79a4e570cd2b359ce26fa7369d2b97","observation_id":"4d489b36-26ea-463f-b372-ff4f19fd222d","resolution":{"observed_at":"2026-08-10T19:44:35.823398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:44:35.826661Z","title":"Transformers: State-of-the-Art Natural Language Processing","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.06849","last_updated":"2026-08-07T06:18:18Z","snapshot_observed_at":"2026-08-17T05:55:22.437033Z","submitted_at":"2026-08-07T06:18:18Z","title":"Autonomy-of-Heads: Data-Free Sparse Attention from Frozen Query-Key Geometry","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-10T19:44:35.826661Z"},"links":{"citing_paper":"/paper/2608.06849"},"observation_digest":"sha256:66d228e2a1b54a27f34148d8caf0a80c4c0511eee5bd53f79b794a3a1101fa23","observation_id":"84d18435-2480-4c67-bf33-9c529435f7d1","resolution":{"observed_at":"2026-08-10T19:44:35.826661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:44:35.831385Z","title":"2007 15th European signal processing conference , pages=","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2608.06849","last_updated":"2026-08-07T06:18:18Z","snapshot_observed_at":"2026-08-17T05:55:22.437033Z","submitted_at":"2026-08-07T06:18:18Z","title":"Autonomy-of-Heads: Data-Free Sparse Attention from Frozen Query-Key Geometry","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-10T19:44:35.831385Z"},"links":{"citing_paper":"/paper/2608.06849"},"observation_digest":"sha256:a78621474b66c13c6fef9bd8000965b7dd2e55d400e81e8c32c93a6e5dc71e97","observation_id":"d4fed672-5e7e-405c-9867-b478d8e61a0e","resolution":{"observed_at":"2026-08-10T19:44:35.831385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:44:36.614362Z","title":"Journal of the ACM (JACM) , volume=","venue":null,"work_id":"156eb219-19ed-4a0b-87e4-60bd288b3a7e","year":2007},"citing_paper":{"arxiv_id":"2608.06849","last_updated":"2026-08-07T06:18:18Z","snapshot_observed_at":"2026-08-17T05:55:22.437033Z","submitted_at":"2026-08-07T06:18:18Z","title":"Autonomy-of-Heads: Data-Free Sparse Attention from Frozen Query-Key Geometry","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-10T19:44:35.835963Z"},"links":{"citing_paper":"/paper/2608.06849"},"observation_digest":"sha256:1931f2f5599408c58d7a2f7f29c2d6f5a9c83b1d331d1237e77969bb75b987e6","observation_id":"c1e67c36-c69e-4f7e-adbc-b562a825a4b4","resolution":{"observed_at":"2026-08-10T19:44:36.623124Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.06849","last_updated":"2026-08-07T06:18:18Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-17T05:55:22.437033Z","submitted_at":"2026-08-07T06:18:18Z","title":"Autonomy-of-Heads: Data-Free Sparse Attention from Frozen Query-Key Geometry"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":31,"verified_exact":0,"verified_fuzzy":11},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 1 inbound Pith citation observation for arXiv:2608.06849."}