{"as_of":"2026-08-16T01:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e575abb6f344a2553c9b7dcade0b00ed05b9738b86baf34f94366467c2b6090a","coverage":[{"denominator":78,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":78,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:06:32.755775Z","state":"measured"},{"denominator":90,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":90,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":12,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:11:48.900029Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T13:36:59.523914Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-13T09:28:54.701420Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"cited_work":{"arxiv_id":"2506.08889","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08889","snapshot_observed_at":"2026-07-02T13:36:59.523914Z","title":"Seerattention-r: Sparse attention adaptation for long reasoning","venue":null,"work_id":"5cd68498-f613-4fa1-a51f-eae46c0c6d2d","year":2025},"citing_paper":{"arxiv_id":"2510.09883","last_updated":"2026-05-02T01:10:22Z","snapshot_observed_at":"2026-08-02T19:55:25.209109Z","submitted_at":"2025-10-10T21:37:49Z","title":"DELTA: Dynamic Layer-Aware Token Attention for Efficient Long-Context Reasoning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-18T07:25:56.953876Z"},"links":{"cited_paper":"/paper/2506.08889","citing_paper":"/paper/2510.09883"},"observation_digest":"sha256:66b97910dc51edfcd2bb33bb25802d414ed1244e80f39881046d26a393e8e90d","observation_id":"9efce4c6-ac26-4d67-b107-bec22e6a9b2e","resolution":{"observed_at":"2026-05-18T07:26:02.860786Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-13T09:28:54.701420Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"cited_work":{"arxiv_id":"2506.08889","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08889","snapshot_observed_at":"2026-07-02T13:36:59.523914Z","title":"Seerattention-r: Sparse attention adaptation for long reasoning","venue":null,"work_id":"5cd68498-f613-4fa1-a51f-eae46c0c6d2d","year":2025},"citing_paper":{"arxiv_id":"2512.12087","last_updated":"2026-04-28T06:58:25Z","snapshot_observed_at":"2026-08-11T12:47:24.973524Z","submitted_at":"2025-12-12T23:30:43Z","title":"BLASST: Dynamic BLocked Attention Sparsity via Softmax Thresholding","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-16T22:20:53.856657Z"},"links":{"cited_paper":"/paper/2506.08889","citing_paper":"/paper/2512.12087"},"observation_digest":"sha256:c8fb053a241f79af1a7071d1d8208283cf11b3e927cbffca42974849f914e8a2","observation_id":"b4a83254-06b0-4481-9dd6-7cc3af0c7330","resolution":{"observed_at":"2026-05-16T22:21:18.608942Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-13T09:28:54.701420Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"cited_work":{"arxiv_id":"2506.08889","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08889","snapshot_observed_at":"2026-07-02T13:36:59.523914Z","title":"Seerattention-r: Sparse attention adaptation for long reasoning","venue":null,"work_id":"5cd68498-f613-4fa1-a51f-eae46c0c6d2d","year":2025},"citing_paper":{"arxiv_id":"2603.29002","last_updated":"2026-05-30T00:45:53Z","snapshot_observed_at":"2026-08-15T01:23:34.636205Z","submitted_at":"2026-03-30T21:03:39Z","title":"Understand and Accelerate Memory Processing Pipeline for Large Language Model Inference","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-14T00:25:49.807277Z"},"links":{"cited_paper":"/paper/2506.08889","citing_paper":"/paper/2603.29002"},"observation_digest":"sha256:7bbe38004a7d41454f1ef9ad70bc3460fe6819c3a609b3ceb6224658fe57383a","observation_id":"1e34d13a-9f28-459a-b6b1-af2ff9ee8997","resolution":{"observed_at":"2026-05-14T00:28:29.860253Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-13T09:28:54.701420Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"cited_work":{"arxiv_id":"2506.08889","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08889","snapshot_observed_at":"2026-07-02T13:36:59.523914Z","title":"Seerattention-r: Sparse attention adaptation for long reasoning","venue":null,"work_id":"5cd68498-f613-4fa1-a51f-eae46c0c6d2d","year":2025},"citing_paper":{"arxiv_id":"2604.14922","last_updated":"2026-04-16T12:06:59Z","snapshot_observed_at":"2026-08-11T06:42:04.240807Z","submitted_at":"2026-04-16T12:06:59Z","title":"LongAct: Harnessing Intrinsic Activation Patterns for Long-Context Reinforcement Learning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-10T11:17:43.769244Z"},"links":{"cited_paper":"/paper/2506.08889","citing_paper":"/paper/2604.14922"},"observation_digest":"sha256:2bf6a282177d4e6fd78ddd914dcc2ad2065a411827ec9afac897753f63f63185","observation_id":"3772f3b3-2b63-4da8-a594-fef652386ee2","resolution":{"observed_at":"2026-05-10T11:20:10.553722Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-13T09:28:54.701420Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"cited_work":{"arxiv_id":"2506.08889","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08889","snapshot_observed_at":"2026-07-02T13:36:59.523914Z","title":"Seerattention-r: Sparse attention adaptation for long reasoning","venue":null,"work_id":"5cd68498-f613-4fa1-a51f-eae46c0c6d2d","year":2025},"citing_paper":{"arxiv_id":"2604.26837","last_updated":"2026-04-29T16:02:00Z","snapshot_observed_at":"2026-08-13T12:10:20.507385Z","submitted_at":"2026-04-29T16:02:00Z","title":"Unifying Sparse Attention with Hierarchical Memory for Scalable Long-Context LLM Serving","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-07T13:15:21.201950Z"},"links":{"cited_paper":"/paper/2506.08889","citing_paper":"/paper/2604.26837"},"observation_digest":"sha256:b3d85fcbbd5e496b878ddedc039c328ad2b289091120d45fe1f925fe938f8e8b","observation_id":"7e737445-b0fd-423c-8c2c-b47f79990846","resolution":{"observed_at":"2026-05-12T09:01:25.896526Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-13T09:28:54.701420Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"cited_work":{"arxiv_id":"2506.08889","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08889","snapshot_observed_at":"2026-07-02T13:36:59.523914Z","title":"Seerattention-r: Sparse attention adaptation for long reasoning","venue":null,"work_id":"5cd68498-f613-4fa1-a51f-eae46c0c6d2d","year":2025},"citing_paper":{"arxiv_id":"2605.07719","last_updated":"2026-05-08T13:24:39Z","snapshot_observed_at":"2026-08-15T00:27:43.410921Z","submitted_at":"2026-05-08T13:24:39Z","title":"An Efficient Hybrid Sparse Attention with CPU-GPU Parallelism for Long-Context Inference","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-11T02:56:28.828593Z"},"links":{"cited_paper":"/paper/2506.08889","citing_paper":"/paper/2605.07719"},"observation_digest":"sha256:41108164aff67b399dca95086fdc919a684d135e20243ca37dfded6fadf82564","observation_id":"ea5e97a0-7941-4c73-84d0-4223c643f029","resolution":{"observed_at":"2026-05-11T03:05:54.140296Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-13T09:28:54.701420Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"cited_work":{"arxiv_id":"2506.08889","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08889","snapshot_observed_at":"2026-07-02T13:36:59.523914Z","title":"Seerattention-r: Sparse attention adaptation for long reasoning","venue":null,"work_id":"5cd68498-f613-4fa1-a51f-eae46c0c6d2d","year":2025},"citing_paper":{"arxiv_id":"2605.09649","last_updated":"2026-05-10T16:47:50Z","snapshot_observed_at":"2026-08-12T14:17:43.612550Z","submitted_at":"2026-05-10T16:47:50Z","title":"Make Each Token Count: Towards Improving Long-Context Performance with KV Cache Eviction","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-12T05:02:25.513351Z"},"links":{"cited_paper":"/paper/2506.08889","citing_paper":"/paper/2605.09649"},"observation_digest":"sha256:7b6e0843adae3fbc4af6be34650b4249342d00af4838d6172ce81038e8259766","observation_id":"4e375f8d-a619-4f26-8b6a-d8c8893f666e","resolution":{"observed_at":"2026-05-12T05:41:26.703884Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-13T09:28:54.701420Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"cited_work":{"arxiv_id":"2506.08889","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08889","snapshot_observed_at":"2026-07-02T13:36:59.523914Z","title":"Seerattention-r: Sparse attention adaptation for long reasoning","venue":null,"work_id":"5cd68498-f613-4fa1-a51f-eae46c0c6d2d","year":2025},"citing_paper":{"arxiv_id":"2605.18753","last_updated":"2026-05-18T17:59:52Z","snapshot_observed_at":"2026-08-02T11:52:59.734226Z","submitted_at":"2026-05-18T17:59:52Z","title":"DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-20T10:50:12.926232Z"},"links":{"cited_paper":"/paper/2506.08889","citing_paper":"/paper/2605.18753"},"observation_digest":"sha256:8100a54ac0401f2daa608370f723736d56b08deb945e5e8d699d19874c67692f","observation_id":"015213c6-84eb-4fbb-bb4f-1b04d4a97998","resolution":{"observed_at":"2026-05-20T10:53:13.586873Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-13T09:28:54.701420Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"cited_work":{"arxiv_id":"2506.08889","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08889","snapshot_observed_at":"2026-07-02T13:36:59.523914Z","title":"Seerattention-r: Sparse attention adaptation for long reasoning","venue":null,"work_id":"5cd68498-f613-4fa1-a51f-eae46c0c6d2d","year":2025},"citing_paper":{"arxiv_id":"2606.06467","last_updated":"2026-06-04T17:54:04Z","snapshot_observed_at":"2026-08-08T09:09:14.963315Z","submitted_at":"2026-06-04T17:54:04Z","title":"You Only Index Once: Cross-Layer Sparse Attention with Shared Routing","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-28T01:06:04.896501Z"},"links":{"cited_paper":"/paper/2506.08889","citing_paper":"/paper/2606.06467"},"observation_digest":"sha256:630bf501a626c9521d81a0e2d6d41968e867b3f6e0ec1eafe73a32d15a35d80c","observation_id":"25b2bac7-6670-42dc-a6cd-e008de0a2d35","resolution":{"observed_at":"2026-07-02T13:36:59.525347Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-13T09:28:54.701420Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.08889","snapshot_observed_at":"2026-07-31T11:04:04.584216Z","title":"arXiv preprint arXiv:2506.08889 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24593","last_updated":"2026-07-27T15:58:07Z","snapshot_observed_at":"2026-08-14T10:40:42.044988Z","submitted_at":"2026-07-27T15:58:07Z","title":"PIVOT: Efficient Query-Group Indexing for Token-Level Sparse Attention","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-07-31T11:04:04.584216Z"},"links":{"cited_paper":"/paper/2506.08889","citing_paper":"/paper/2607.24593"},"observation_digest":"sha256:4fa906cbc2ba71f64917caccf6bf45561cad7204ae8615abc20981db93a3b394","observation_id":"5ee18d25-c704-4b04-9543-64c33b112150","resolution":{"observed_at":"2026-07-31T11:04:04.584216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-13T09:28:54.701420Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.08889","snapshot_observed_at":"2026-08-04T13:43:53.318889Z","title":"arXiv preprint arXiv:2506.08889 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02150","last_updated":"2026-08-05T06:57:37Z","snapshot_observed_at":"2026-08-15T14:31:12.914781Z","submitted_at":"2026-08-03T12:34:31Z","title":"PhyCheck: Fine-Grained Evidence-Grounded Dataset for Physical Law Understanding in Video-LLMs","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-04T13:43:53.318889Z"},"links":{"cited_paper":"/paper/2506.08889","citing_paper":"/paper/2608.02150"},"observation_digest":"sha256:d630d5eb672b5b8eaa72940da5de29f6c783d6b2c61c13f7c7fba2a8bd752814","observation_id":"dac1432e-871b-4332-b81a-15b0cca4a735","resolution":{"observed_at":"2026-08-04T13:43:53.318889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-13T09:28:54.701420Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.08889","snapshot_observed_at":"2026-08-07T00:11:48.900029Z","title":"arXiv preprint arXiv:2506.08889 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02150","last_updated":"2026-08-05T06:57:37Z","snapshot_observed_at":"2026-08-15T14:31:12.914781Z","submitted_at":"2026-08-03T12:34:31Z","title":"PhyCheck: Fine-Grained Evidence-Grounded Dataset for Physical Law Understanding in Video-LLMs","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T00:11:48.900029Z"},"links":{"cited_paper":"/paper/2506.08889","citing_paper":"/paper/2608.02150"},"observation_digest":"sha256:acb1f199ebc690040409627ed2f4cec71e0138e0c378b828031274d13abecdef","observation_id":"5ba11f5f-1fb7-44d2-be6d-de0d04b20416","resolution":{"observed_at":"2026-08-07T00:11:48.900029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.08889/citation-record","integrity":"/paper/2506.08889/integrity","json":"/paper/2506.08889/citation-record.json","paper":"/paper/2506.08889"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:06:33.678067Z","title":"URLhttps://github.com/tile-ai/tilelang","venue":null,"work_id":"a1f8d374-2dd8-4b39-872c-e69be4aba4fd","year":null},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-13T09:28:54.701420Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.546420Z"},"links":{"citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:9a00c9d1cfc42e60c7e54c70dbcc133f302144a53afe5a42940dd1ee5ed2ae8a","observation_id":"603767e6-da74-41e3-9625-00bbc598aeab","resolution":{"observed_at":"2026-08-07T05:06:33.702936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:06:33.628253Z","title":"Keyformer: Kv cache reduction through key tokens selection for efficient generative inference.Proceedings of Machine Learning and Systems, 6:114–127, 2024","venue":null,"work_id":"61bae224-b9f6-4424-8ee6-de7fe068a3b1","year":2024},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-13T09:28:54.701420Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.550117Z"},"links":{"citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:df8f013ecd786f4459fd6da0cf9daf0d44d47283134cc226bc9a004c49c17281","observation_id":"3fca4ecb-e378-4f01-908d-ef2b18764eae","resolution":{"observed_at":"2026-08-07T05:06:33.644684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13245","last_updated":"2023-12-23T17:55:11Z","snapshot_observed_at":"2026-08-15T06:28:09.529747Z","submitted_at":"2023-05-22T17:16:38Z","title":"GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13245","snapshot_observed_at":"2026-08-07T05:06:32.553125Z","title":"Gqa: Training generalized multi-query transformer models from multi-head checkpoints.arXiv preprint arXiv:2305.13245, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-13T09:28:54.701420Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.553125Z"},"links":{"cited_paper":"/paper/2305.13245","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:131466731bd9132c739b56ef47ec76a1d54d59ea83fb804293e7fbbd26da379c","observation_id":"7f5078a8-1d1e-4198-979f-7049585bdb4c","resolution":{"observed_at":"2026-08-07T05:06:32.553125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04517","last_updated":"2024-12-06T15:42:07Z","snapshot_observed_at":"2026-08-13T22:31:58.054750Z","submitted_at":"2024-05-07T17:50:21Z","title":"xLSTM: Extended Long Short-Term Memory","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04517","snapshot_observed_at":"2026-08-07T05:06:32.556320Z","title":"xlstm: Extended long short-term memory.arXiv preprint arXiv:2405.04517, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-13T09:28:54.701420Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.556320Z"},"links":{"cited_paper":"/paper/2405.04517","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:d94c78b701785b597ddd2bea32a62280408a79be1d4342c3a5e2df3f85bae475","observation_id":"283fb409-0322-4c71-9453-dd78c3e8b1cb","resolution":{"observed_at":"2026-08-07T05:06:32.556320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14051","last_updated":"2025-08-13T17:55:58Z","snapshot_observed_at":"2026-08-12T17:20:02.896096Z","submitted_at":"2025-02-19T19:12:46Z","title":"RocketKV: Accelerating Long-Context LLM Inference via Two-Stage KV Cache Compression","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14051","snapshot_observed_at":"2026-08-07T05:06:32.559683Z","title":"Rocketkv: Accelerating long-context llm inference via two-stage kv cache compression.arXiv preprint arXiv:2502.14051, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-13T09:28:54.701420Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.559683Z"},"links":{"cited_paper":"/paper/2502.14051","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:691235d426e73f3ae14cfc0d5f9c921aed4cf5a0d051f54da947850abf5b6da7","observation_id":"09743327-ca1d-4c10-b8f3-6af12b746a81","resolution":{"observed_at":"2026-08-07T05:06:32.559683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-07T05:06:32.563190Z","title":"Longformer: The long-document transformer","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-13T09:28:54.701420Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.563190Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:7388d6f3c8ab35c1382f9f8c000a1f839b37083235546cae874a159ebc1b3d09","observation_id":"6000f946-9a71-4274-9b21-340fc650a4f6","resolution":{"observed_at":"2026-08-07T05:06:32.563190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:06:33.594310Z","title":"Reducing transformer key-value cache size with cross-layer attention","venue":null,"work_id":"d7e88efd-b770-4b50-b20a-30725e58fe7c","year":2024},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-13T09:28:54.701420Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.566599Z"},"links":{"citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:409ae3abcb4e75b28d655a93f4a6dd2e6c1dfbc3940bd5ecf735db6d2e063b20","observation_id":"0181f93e-8425-4ed1-a1f6-06a70775a97f","resolution":{"observed_at":"2026-08-07T05:06:33.609507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:06:32.569593Z","title":"R-kv: Redundancy-aware kv cache compression for training-free reasoning models acceleration.arXiv preprint arXiv:2505.24133, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-13T09:28:54.701420Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.569593Z"},"links":{"citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:498665a352948fdfcd0f431dde2601bf454189a90c45428a9b5b882781ff04e8","observation_id":"4815cf23-38f5-4b5a-ba4e-31639b59f255","resolution":{"observed_at":"2026-08-07T05:06:32.569593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.12094","last_updated":"2025-06-02T11:46:43Z","snapshot_observed_at":"2026-08-13T18:05:41.301999Z","submitted_at":"2024-12-16T18:58:57Z","title":"SepLLM: Accelerate Large Language Models by Compressing One Segment into One Separator","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.12094","snapshot_observed_at":"2026-08-07T05:06:32.572234Z","title":"Sepllm: Accelerate large language models by compressing one segment into one separator.arXiv preprint arXiv:2412.12094, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-13T09:28:54.701420Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.572234Z"},"links":{"cited_paper":"/paper/2412.12094","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:7d0d4a76550d428eaa999db9f7b838766156ea326e0290b7338fd5db0b39bf1a","observation_id":"8f496848-d855-4471-8142-2c892c297b6b","resolution":{"observed_at":"2026-08-07T05:06:32.572234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02922","last_updated":"2026-04-27T10:13:35Z","snapshot_observed_at":"2026-08-15T10:34:21.616923Z","submitted_at":"2025-05-05T18:01:17Z","title":"RetroInfer: A Vector Storage Engine for Scalable Long-Context LLM Inference","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02922","snapshot_observed_at":"2026-08-07T05:06:32.575162Z","title":"Retroinfer: A vector-storage approach for scalable long-context llm inference, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-13T09:28:54.701420Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.575162Z"},"links":{"cited_paper":"/paper/2505.02922","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:e830d7a5dab9c5b7b1edc13bdac257d53dea46963d134536eeb1418a971da6d1","observation_id":"44a057aa-bae1-493a-bc57-03ec9dab8d18","resolution":{"observed_at":"2026-08-07T05:06:32.575162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16179","last_updated":"2024-12-18T17:36:36Z","snapshot_observed_at":"2026-08-14T23:45:06.387992Z","submitted_at":"2024-10-21T16:44:51Z","title":"MagicPIG: LSH Sampling for Efficient LLM Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16179","snapshot_observed_at":"2026-08-07T05:06:32.577962Z","title":"Magicpig: Lsh sampling for efficient llm generation.arXiv preprint arXiv:2410.16179, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-13T09:28:54.701420Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.577962Z"},"links":{"cited_paper":"/paper/2410.16179","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:224c3f972dd884eaca76cde9e572d2114a028cb2e233877f7eba47f785d80dfd","observation_id":"bfb725fa-9e3e-45ef-80a5-30ddc1b6c7da","resolution":{"observed_at":"2026-08-07T05:06:32.577962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:06:33.558150Z","title":"PipeThreader: Software-defined pipelining for efficient dnn execution","venue":null,"work_id":"70e4dba4-9cd3-48de-b824-a238fc1cfcf1","year":2025},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-13T09:28:54.701420Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.580743Z"},"links":{"citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:eebd640ec77dddc1de2fdd9a7312126db3449bede939aaf5ba7f4b71763e3806","observation_id":"2bf6d40a-4219-422e-b3fc-64ba19b1d892","resolution":{"observed_at":"2026-08-07T05:06:33.570272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.10509","last_updated":"2019-04-23T19:29:47Z","snapshot_observed_at":"2026-08-09T19:46:04.857927Z","submitted_at":"2019-04-23T19:29:47Z","title":"Generating Long Sequences with Sparse Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.10509","snapshot_observed_at":"2026-08-07T05:06:32.583149Z","title":"Generating long sequences with sparse transformers.arXiv preprint arXiv:1904.10509, 2019","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-13T09:28:54.701420Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.583149Z"},"links":{"cited_paper":"/paper/1904.10509","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:5bd608295d82d7c4c8008bec19acbe608dafbef14eeb081c63b4890e4fe3e434","observation_id":"3abc9a08-dfa0-4a4e-b361-d1f14374e254","resolution":{"observed_at":"2026-08-07T05:06:32.583149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08691","last_updated":"2023-07-17T17:50:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-17T17:50:36Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08691","snapshot_observed_at":"2026-08-07T05:06:32.585847Z","title":"Flashattention-2: Faster attention with better parallelism and work partitioning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-13T09:28:54.701420Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.585847Z"},"links":{"cited_paper":"/paper/2307.08691","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:01fb422801d83f073f5830c6f0235f67bc726396d6796cfdad6b38b24b3f4af6","observation_id":"8673676c-8c53-4f7c-a57a-84f2dca653bf","resolution":{"observed_at":"2026-08-07T05:06:32.585847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21060","last_updated":"2024-05-31T17:50:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:50:01Z","title":"Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21060","snapshot_observed_at":"2026-08-07T05:06:32.588405Z","title":"Transformers are ssms: Generalized models and efficient algorithms through structured state space duality.arXiv preprint arXiv:2405.21060, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-13T09:28:54.701420Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.588405Z"},"links":{"cited_paper":"/paper/2405.21060","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:a86d1fe9accacd190e86379d114c4ae3b713b7dac148fecff7869fec23ae049c","observation_id":"97b6ae02-56b1-4b19-9cf1-daf8bc52f13f","resolution":{"observed_at":"2026-08-07T05:06:32.588405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13676","snapshot_observed_at":"2026-08-07T05:06:32.591124Z","title":"Hymba: A hybrid-head architecture for small language models.arXiv preprint arXiv:2411.13676, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-13T09:28:54.701420Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.591124Z"},"links":{"cited_paper":"/paper/2411.13676","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:d3d049286d92efa4c85918ea4d7a694448e7d67873a2a2431df6be0fd323a508","observation_id":"5d536d28-56ee-48fd-98f7-a858af3525ea","resolution":{"observed_at":"2026-08-07T05:06:32.591124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:06:32.594106Z","title":"Open r1: A fully open reproduction of deepseek-r1, January 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-13T09:28:54.701420Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.594106Z"},"links":{"citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:42011ecc97e27c8c8317ea7fd5dd2f85e734d889e3a2fede144b7b180523f6e7","observation_id":"e4e97183-6acd-47af-9892-7ea5a68e7b7b","resolution":{"observed_at":"2026-08-07T05:06:32.594106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:06:32.596786Z","title":"Moa: Mixture of sparse attention for automatic large language model compression.arXiv preprint arXiv:2406.14909, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-13T09:28:54.701420Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.596786Z"},"links":{"citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:296cee2b6aeb0c73b6bef257ccc686e66acb045dde134b7f481441307f877c98","observation_id":"ec087002-3424-487c-802c-c6f20a8d8573","resolution":{"observed_at":"2026-08-07T05:06:32.596786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13276","last_updated":"2025-02-17T02:24:47Z","snapshot_observed_at":"2026-08-16T01:29:07.684255Z","submitted_at":"2024-10-17T07:07:09Z","title":"SeerAttention: Learning Intrinsic Sparse Attention in Your LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13276","snapshot_observed_at":"2026-08-07T05:06:32.599244Z","title":"Seerattention: Learning intrinsic sparse attention in your llms.arXiv preprint arXiv:2410.13276, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-13T09:28:54.701420Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.599244Z"},"links":{"cited_paper":"/paper/2410.13276","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:1f9518af46bd11fd072eef2c50a09e1c09e0480105bfc049c52f9ca52f768c3a","observation_id":"59d96b03-d758-480d-8dea-c50af189e0f7","resolution":{"observed_at":"2026-08-07T05:06:32.599244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01801","last_updated":"2024-10-29T18:26:09Z","snapshot_observed_at":"2026-08-14T11:45:47.400186Z","submitted_at":"2023-10-03T05:17:08Z","title":"Model Tells You What to Discard: Adaptive KV Cache Compression for LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01801","snapshot_observed_at":"2026-08-07T05:06:32.602023Z","title":"Model tells you what to discard: Adaptive kv cache compression for llms.arXiv preprint arXiv:2310.01801, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-13T09:28:54.701420Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.602023Z"},"links":{"cited_paper":"/paper/2310.01801","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:ece5d187abd5d0445f2fd400ce4c2a9048fb642f980353df1b0880ad4eb97d7f","observation_id":"6574c471-194b-4c87-9736-87f3e24d4f67","resolution":{"observed_at":"2026-08-07T05:06:32.602023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19737","last_updated":"2024-04-30T17:33:57Z","snapshot_observed_at":"2026-08-12T13:06:04.804423Z","submitted_at":"2024-04-30T17:33:57Z","title":"Better & Faster Large Language Models via Multi-token Prediction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.19737","snapshot_observed_at":"2026-08-07T05:06:32.604608Z","title":"Better & faster large language models via multi-token prediction.arXiv preprint arXiv:2404.19737, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-13T09:28:54.701420Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.604608Z"},"links":{"cited_paper":"/paper/2404.19737","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:5be883e36357c529f810362bbb8c816d40fa6ed8316f81a49e59c9e0a674e589","observation_id":"f3700472-5d13-4c40-a724-ad7110675c01","resolution":{"observed_at":"2026-08-07T05:06:32.604608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-08-07T05:06:32.607376Z","title":"Mamba: Linear-time sequence modeling with selective state spaces","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-13T09:28:54.701420Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.607376Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:74b1331edbeb64ebb6db780af37dac3ea34973cb1f3c11f9a4bf8a1fc72d96c0","observation_id":"3d1573ba-6df3-4109-8a22-a7c0cb30fbfb","resolution":{"observed_at":"2026-08-07T05:06:32.607376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T05:06:32.610150Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-13T09:28:54.701420Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.610150Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:eeb2c7f2d67890298164f5967da54467a8f71dd3b7a12480d5b98abce5d2ae56","observation_id":"9fafa75e-6103-4783-8a4f-1d254ddb0115","resolution":{"observed_at":"2026-08-07T05:06:32.610150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:06:33.530852Z","title":"Omnikv: Dynamic context selection for efficient long-context llms","venue":null,"work_id":"e588d6ce-1e14-48d6-a9c9-7cc8b00b0396","year":2025},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-13T09:28:54.701420Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.612606Z"},"links":{"citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:c073d7ff1eff5e69e26f70254ba1b5a70b6a975debb999a78fef466a69aa3a9a","observation_id":"f224880f-aba3-45d4-b743-5c6e89313233","resolution":{"observed_at":"2026-08-07T05:06:33.538895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-13T20:44:28.824685Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-07T05:06:32.615350Z","title":"Measuring massive multitask language understanding.arXiv preprint arXiv:2009.03300, 2020","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-13T09:28:54.701420Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.615350Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:a568e78aa9d9555dddd9c7f01fbcf859feca5758b34aa08869d49768ceb92f01","observation_id":"26d5b8c7-b6ca-4bdb-b8bb-248d491e1837","resolution":{"observed_at":"2026-08-07T05:06:32.615350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:06:32.618100Z","title":"Squeezed attention: Accelerating long context length llm inference.arXiv preprint arXiv:2411.09688, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-13T09:28:54.701420Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.618100Z"},"links":{"citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:0b4b4754c15c8abb6ad2044859316c735c6dcc8f763972f29cf2b7d633f504de","observation_id":"a125b793-69f1-4931-b3c5-c781c13f3bc4","resolution":{"observed_at":"2026-08-07T05:06:32.618100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11147","last_updated":"2025-05-30T11:43:48Z","snapshot_observed_at":"2026-08-15T06:00:19.169230Z","submitted_at":"2025-02-16T14:28:52Z","title":"RaaS: Reasoning-Aware Attention Sparsity for Efficient LLM Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11147","snapshot_observed_at":"2026-08-07T05:06:32.620481Z","title":"Efficient long-decoding inference with reasoning-aware attention sparsity.arXiv preprint arXiv:2502.11147, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-13T09:28:54.701420Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.620481Z"},"links":{"cited_paper":"/paper/2502.11147","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:9cf24622604f827b72758c412bbce8e8800554da01bd52fff3f2729f684ba8cd","observation_id":"e30bed75-7a91-4ce3-afde-a4304d5cc93a","resolution":{"observed_at":"2026-08-07T05:06:32.620481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-07T05:06:32.622907Z","title":"Openai o1 system card.arXiv preprint arXiv:2412.16720, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-13T09:28:54.701420Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.622907Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:5e5e66192c8de44ba7ea0e3a8197190b5561e0adf76f23ff29e3136a0f454b72","observation_id":"f630c6ae-6e46-4b5c-bb03-cf706b18b457","resolution":{"observed_at":"2026-08-07T05:06:32.622907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02490","last_updated":"2024-10-30T14:53:22Z","snapshot_observed_at":"2026-08-12T23:30:11.201041Z","submitted_at":"2024-07-02T17:59:56Z","title":"MInference 1.0: Accelerating Pre-filling for Long-Context LLMs via Dynamic Sparse Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02490","snapshot_observed_at":"2026-08-07T05:06:32.625484Z","title":"Minference 1.0: Accelerating pre-filling for long-context llms via dynamic sparse attention.arXiv preprint arXiv:2407.02490, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-13T09:28:54.701420Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.625484Z"},"links":{"cited_paper":"/paper/2407.02490","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:bac0d7dce2427e0ed222531454985bb567a9b97f4c1d55c58c9014c9a2127d57","observation_id":"4999cafd-4f82-4a86-8e13-90bd51e734a5","resolution":{"observed_at":"2026-08-07T05:06:32.625484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:06:33.508595Z","title":"Kullback-leibler divergence","venue":null,"work_id":"3eee1cd5-3a47-49d9-800f-b9cf0f0a10f0","year":2011},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-13T09:28:54.701420Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.628140Z"},"links":{"citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:c6c3c50d5fa130a0f759afe0d6961633916cd4883ee38803b8192fb6f3eb1e04","observation_id":"e755f89d-3c32-44d1-89a3-42874f1b507c","resolution":{"observed_at":"2026-08-07T05:06:33.518944Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:06:32.630511Z","title":"Transformers are rnns: Fast autoregressive transformers with linear attention","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-13T09:28:54.701420Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.630511Z"},"links":{"citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:8e680e6299ede4006903b83bc1bf039f6fb92494d65799dba4f28b8a6df745a4","observation_id":"6ebb34e9-7d68-4134-a99f-d5fbb211f785","resolution":{"observed_at":"2026-08-07T05:06:32.630511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:06:32.632901Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-13T09:28:54.701420Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.632901Z"},"links":{"citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:7c80e69befb70d123b1952828ae5e013e9cc8071859c5df9da6d3429ed5e9d20","observation_id":"bcbff325-2586-45a4-86c8-cc1488914b75","resolution":{"observed_at":"2026-08-07T05:06:32.632901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20766","last_updated":"2025-02-28T06:34:53Z","snapshot_observed_at":"2026-08-14T17:42:08.545000Z","submitted_at":"2025-02-28T06:34:53Z","title":"FlexPrefill: A Context-Aware Sparse Attention Mechanism for Efficient Long-Sequence Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.20766","snapshot_observed_at":"2026-08-07T05:06:32.635500Z","title":"Flexprefill: A context- aware sparse attention mechanism for efficient long-sequence inference.arXiv preprint arXiv:2502.20766, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-13T09:28:54.701420Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.635500Z"},"links":{"cited_paper":"/paper/2502.20766","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:bb9a803365b0ffc16389b25be4f5a7d8f22e1fd8ea2e07e7706b8ce0a9278c38","observation_id":"94ff5f04-9d57-4434-b600-a547ef219e7c","resolution":{"observed_at":"2026-08-07T05:06:32.635500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:06:32.637982Z","title":"Fast inference from transformers via speculative decoding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-13T09:28:54.701420Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.637982Z"},"links":{"citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:c061aada85ec7651dd6e088d497a173f30414d55e4d38b1b31a11e2a21c89cff","observation_id":"7879778f-56b8-4abc-885c-8df83eb59889","resolution":{"observed_at":"2026-08-07T05:06:32.637982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-08-13T08:34:05.764059Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.08313","snapshot_observed_at":"2026-08-07T05:06:32.640407Z","title":"Minimax-01: Scaling foundation models with lightning attention.arXiv preprint arXiv:2501.08313, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-13T09:28:54.701420Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.640407Z"},"links":{"cited_paper":"/paper/2501.08313","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:1137bf5eabfcf488064d5ab323e807a7fdeff041894208b57ef079482b550fb2","observation_id":"67473948-fa99-448e-bea7-ef575a77dd23","resolution":{"observed_at":"2026-08-07T05:06:32.640407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10319","snapshot_observed_at":"2026-08-07T05:06:32.642988Z","title":"Scbench: A kv cache-centric analysis of long-context methods.arXiv preprint arXiv:2412.10319, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-13T09:28:54.701420Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.642988Z"},"links":{"cited_paper":"/paper/2412.10319","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:11d709254fb712f1ba9c5793886606ffe66f9917b81a0edbaa853d8faa3fd5fa","observation_id":"1d7ae517-d409-4357-b5c4-6d3b18cdd479","resolution":{"observed_at":"2026-08-07T05:06:32.642988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:06:32.645647Z","title":"Snapkv: Llm knows what you are looking for before generation.Advances in Neural Information Processing Systems, 37:22947–22970, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-13T09:28:54.701420Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.645647Z"},"links":{"citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:45d258634a74146edf7bee0ee67c7c8effaa45b555915c8515bb85fd326b4aee","observation_id":"03f08edf-0805-4bd4-9d62-5ae7f5e8cf61","resolution":{"observed_at":"2026-08-07T05:06:32.645647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:06:32.648079Z","title":"Twilight: Adaptive attention sparsity with hierarchical top- p pruning.arXiv preprint arXiv:2502.02770, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-13T09:28:54.701420Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.648079Z"},"links":{"citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:f8b71bf231e4e3208c23129121a5691fe79280c1b71a040e1f4013e0f6805e19","observation_id":"f3838f42-b8e1-41e0-8dfb-6e1323801559","resolution":{"observed_at":"2026-08-07T05:06:32.648079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06949","last_updated":"2025-08-11T19:43:22Z","snapshot_observed_at":"2026-08-14T19:27:40.764042Z","submitted_at":"2025-04-09T14:57:55Z","title":"Adaptive Computation Pruning for the Forgetting Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06949","snapshot_observed_at":"2026-08-07T05:06:32.650507Z","title":"Adaptive computation pruning for the forgetting transformer.arXiv preprint arXiv:2504.06949, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-13T09:28:54.701420Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.650507Z"},"links":{"cited_paper":"/paper/2504.06949","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:58a10549527bf10fb10e29eac83627337fc7366556376420e25d1490900edd54","observation_id":"babc598e-3810-4f5a-bff9-881b61898fe8","resolution":{"observed_at":"2026-08-07T05:06:32.650507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-07T05:06:32.652878Z","title":"Deepseek-v2: A strong, economical, and efficient mixture-of-experts language model.arXiv preprint arXiv:2405.04434, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-13T09:28:54.701420Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.652878Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:cc2c68143ff30ae7f43118e7fbe5cf516bf5fd72faa1f23b545e4ce30992a67f","observation_id":"0ff6959f-9958-4507-a9ec-1f287dd68ea6","resolution":{"observed_at":"2026-08-07T05:06:32.652878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-15T17:27:11.980940Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T05:06:32.655660Z","title":"Deepseek-v3 technical report.arXiv preprint arXiv:2412.19437, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-13T09:28:54.701420Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.655660Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:223d2c25985c5bdebd310a8ee29d6673fa161f53e33ec36dfee716d6a6d455de","observation_id":"c219a013-8686-4648-8283-db95ac9584b7","resolution":{"observed_at":"2026-08-07T05:06:32.655660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-08-15T07:47:03.589816Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10516","snapshot_observed_at":"2026-08-07T05:06:32.658257Z","title":"Retrievalattention: Accelerating long- context llm inference via vector retrieval.arXiv preprint arXiv:2409.10516, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-13T09:28:54.701420Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.658257Z"},"links":{"cited_paper":"/paper/2409.10516","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:d16bfbfd0707f0140071fbdc53244eccd9ef02cbcad09453ead82af0e6a928ce","observation_id":"2608c643-fffb-422b-877e-691614308d6c","resolution":{"observed_at":"2026-08-07T05:06:32.658257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04823","last_updated":"2025-08-18T16:06:09Z","snapshot_observed_at":"2026-08-08T03:19:58.705742Z","submitted_at":"2025-04-07T08:22:45Z","title":"Quantization Hurts Reasoning? An Empirical Study on Quantized Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.04823","snapshot_observed_at":"2026-08-07T05:06:32.660824Z","title":"Quantization hurts reasoning? an empirical study on quantized reasoning models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-13T09:28:54.701420Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.660824Z"},"links":{"cited_paper":"/paper/2504.04823","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:69d0084655c99ea1143034fdcf1fbb6df14d9611938d9eaf616534e132f39f2a","observation_id":"3530e94f-8a37-4537-b556-73ba454253da","resolution":{"observed_at":"2026-08-07T05:06:32.660824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:06:32.663343Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-13T09:28:54.701420Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.663343Z"},"links":{"citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:9026c110c99afbc672af2fd902f757fda99a9d78c1f6f42cc260f44dab46e71d","observation_id":"5e68eb24-e125-495b-beec-fbcb87c254a1","resolution":{"observed_at":"2026-08-07T05:06:32.663343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-08-12T19:30:23.025771Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13189","snapshot_observed_at":"2026-08-07T05:06:32.665648Z","title":"Moba: Mixture of block attention for long-context llms.arXiv preprint arXiv:2502.13189, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-13T09:28:54.701420Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.665648Z"},"links":{"cited_paper":"/paper/2502.13189","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:e44628d2bde3219a48ef539e58ecb4552434aad1533512267569d194cd9c418d","observation_id":"293d79b4-1d15-40dc-a4f6-305781561c89","resolution":{"observed_at":"2026-08-07T05:06:32.665648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08246","last_updated":"2025-06-03T10:07:35Z","snapshot_observed_at":"2026-08-13T07:44:10.367333Z","submitted_at":"2025-02-12T09:39:54Z","title":"Inference-time sparse attention with asymmetric indexing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.08246","snapshot_observed_at":"2026-08-07T05:06:32.671170Z","title":"Inference-time sparse attention with asymmetric indexing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-13T09:28:54.701420Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.671170Z"},"links":{"cited_paper":"/paper/2502.08246","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:33016f76ba9111f4bb78eaf754caeb61c7a9aa4e03877dbc465a5ca039000b74","observation_id":"7a362d9b-f617-41b7-bbf1-6fb73bd032fe","resolution":{"observed_at":"2026-08-07T05:06:32.671170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:06:33.463465Z","title":"Aime problems and solutions","venue":null,"work_id":"610883e8-163a-4277-9317-7847900638a6","year":null},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-13T09:28:54.701420Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.673524Z"},"links":{"citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:80845429f0d86f587fed9f0267e74cf4512142a3cea050b7c65824a5e80bfffb","observation_id":"d667d25b-3933-414d-a5b6-143357e4e96c","resolution":{"observed_at":"2026-08-07T05:06:33.472215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13048","last_updated":"2023-12-11T03:58:56Z","snapshot_observed_at":"2026-08-14T04:57:43.972237Z","submitted_at":"2023-05-22T13:57:41Z","title":"RWKV: Reinventing RNNs for the Transformer Era","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13048","snapshot_observed_at":"2026-08-07T05:06:32.676223Z","title":"Rwkv: Reinventing rnns for the transformer era.arXiv preprint arXiv:2305.13048, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-13T09:28:54.701420Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.676223Z"},"links":{"cited_paper":"/paper/2305.13048","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:56cddc247a94c3e6d612f5c04b9cfc8260c697607de9d06b9d9ee77c4b2c517c","observation_id":"c01b0e2c-6de0-4f45-ad94-953af6858da4","resolution":{"observed_at":"2026-08-07T05:06:32.676223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:06:32.678846Z","title":"Gpqa: A graduate-level google-proof q&a benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-13T09:28:54.701420Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.678846Z"},"links":{"citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:6e95b93e0eb791875aa8ce7c80e52a7bc1984902de2a9d4607a20366aaec20d2","observation_id":"0cf432c8-7479-46db-b6a4-144757bb9505","resolution":{"observed_at":"2026-08-07T05:06:32.678846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:06:32.681295Z","title":"Flashattention-3: Fast and accurate attention with asynchrony and low-precision.Advances in Neural Information Processing Systems, 37:68658–68685, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-13T09:28:54.701420Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.681295Z"},"links":{"citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:422640b27964a41906c0958120b9362c629aad5dbf396eeeb200a84d56138e79","observation_id":"d49d1105-3f23-496a-83b3-036244b4a626","resolution":{"observed_at":"2026-08-07T05:06:32.681295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.02150","last_updated":"2019-11-06T00:19:05Z","snapshot_observed_at":"2026-07-06T08:35:01.386074Z","submitted_at":"2019-11-06T00:19:05Z","title":"Fast Transformer Decoding: One Write-Head is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.02150","snapshot_observed_at":"2026-08-07T05:06:32.683732Z","title":"Fast transformer decoding: One write-head is all you need.arXiv preprint arXiv:1911.02150, 2019","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-13T09:28:54.701420Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.683732Z"},"links":{"cited_paper":"/paper/1911.02150","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:8747e965e2f79696c8d94226e6f6fe1f6304ab5777a7aad584fa5eb1c5305b40","observation_id":"8b4bec04-2885-409e-a38b-b7d3854429c1","resolution":{"observed_at":"2026-08-07T05:06:32.683732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:06:32.686218Z","title":"Roformer: Enhanced transformer with rotary position embedding.Neurocomputing, 568:127063, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-13T09:28:54.701420Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.686218Z"},"links":{"citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:3c02c505f409efd79df8fc800e0f8e8955b62ff7b7b0359a74cec653f3156200","observation_id":"d984e696-1486-4856-95d9-d4a857901aa0","resolution":{"observed_at":"2026-08-07T05:06:32.686218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08621","last_updated":"2023-08-09T08:53:08Z","snapshot_observed_at":"2026-08-02T13:21:32.251959Z","submitted_at":"2023-07-17T16:40:01Z","title":"Retentive Network: A Successor to Transformer for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08621","snapshot_observed_at":"2026-08-07T05:06:32.688555Z","title":"Retentive network: A successor to transformer for large language models.arXiv preprint arXiv:2307.08621, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-13T09:28:54.701420Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.688555Z"},"links":{"cited_paper":"/paper/2307.08621","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:d6fa279733fb21cdc2fe2da44c703e5f81cf37fbbb5b0b436ee7d1983e265129","observation_id":"e4e05d7f-6813-44c6-813c-7b8878ce31b7","resolution":{"observed_at":"2026-08-07T05:06:32.688555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:06:32.691080Z","title":"You only cache once: Decoder-decoder architectures for language models.Advances in Neural Information Processing Systems, 37:7339–7361, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-13T09:28:54.701420Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.691080Z"},"links":{"citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:af773676a9fbfe6146b66552916aea588627d999de92f4157e7ec19042a7a545","observation_id":"fd83167e-1222-400d-8695-d27c9f5de1de","resolution":{"observed_at":"2026-08-07T05:06:32.691080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04108","last_updated":"2025-06-05T05:39:48Z","snapshot_observed_at":"2026-08-13T03:34:21.096360Z","submitted_at":"2025-06-04T16:01:48Z","title":"Rectified Sparse Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.04108","snapshot_observed_at":"2026-08-07T05:06:32.693476Z","title":"Rectified sparse attention.arXiv preprint arXiv:2506.04108, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-13T09:28:54.701420Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.693476Z"},"links":{"cited_paper":"/paper/2506.04108","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:d594daacb81956a12df723c2e8f02d20cf25d67e77b7bf51f7e8c90d53a5620b","observation_id":"973f0b67-f390-49b2-b41c-433cfb715649","resolution":{"observed_at":"2026-08-07T05:06:32.693476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10774","last_updated":"2024-08-26T21:01:02Z","snapshot_observed_at":"2026-08-14T18:53:06.624928Z","submitted_at":"2024-06-16T01:33:02Z","title":"Quest: Query-Aware Sparsity for Efficient Long-Context LLM Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10774","snapshot_observed_at":"2026-08-07T05:06:32.696425Z","title":"Quest: Query-aware sparsity for efficient long-context llm inference.arXiv preprint arXiv:2406.10774, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-13T09:28:54.701420Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.696425Z"},"links":{"cited_paper":"/paper/2406.10774","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:e26251ee66b5268dd9205722383035cbf68829e35317a1650cc3cd9d849229c1","observation_id":"e7e5477f-7825-4fd7-9640-a0efa6e1f46c","resolution":{"observed_at":"2026-08-07T05:06:32.696425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:06:33.425527Z","title":"Minicpm4: Ultra-efficient llms on end devices","venue":null,"work_id":"d733986f-49e3-42a3-b7a7-5fdd1dceeefd","year":2025},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-13T09:28:54.701420Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.699380Z"},"links":{"citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:239175fc07ac28f4314aeb2e5992ce278fcf374dd719b65f109c21159acf24f9","observation_id":"a67b2b37-dab9-4ff1-a390-54ec09637381","resolution":{"observed_at":"2026-08-07T05:06:33.432664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:06:32.701827Z","title":"Triton: an intermediate language and compiler for tiled neural network computations","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-13T09:28:54.701420Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.701827Z"},"links":{"citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:5d2abfc4d8de8d5bb59ff90600bb342c573912644c8a798670aff2d78689a4a8","observation_id":"cd3ca030-3cf0-40aa-a4f0-706877f84057","resolution":{"observed_at":"2026-08-07T05:06:32.701827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:06:33.407121Z","title":"Attention is all you need.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":"a60e99c0-6974-4047-9230-8e19b84a025b","year":2017},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-13T09:28:54.701420Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.704664Z"},"links":{"citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:0c6a8f0255d6afac4f1c1a1b95d02fd3ee98087b3cbdffdb232d1dc865ce5dea","observation_id":"6ac5c415-4962-4918-ba04-6d5b0b62b380","resolution":{"observed_at":"2026-08-07T05:06:33.411160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:06:33.397942Z","title":"Ladder: Enabling efficient low-precision deep learning computing through hardware-aware tensor transformation","venue":null,"work_id":"ba61e929-0e24-4be9-bac9-88695145c928","year":2024},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-13T09:28:54.701420Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.707584Z"},"links":{"citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:77cc22f88989c830358e3c3d093ebb3b0cc0d79e1b93e6009984c25e0a913c3f","observation_id":"a4ba9d5f-4361-4aed-88d1-e2f654aeaaf8","resolution":{"observed_at":"2026-08-07T05:06:33.401791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04617","last_updated":"2024-05-28T12:05:12Z","snapshot_observed_at":"2026-08-14T18:50:28.444749Z","submitted_at":"2024-02-07T06:50:42Z","title":"InfLLM: Training-Free Long-Context Extrapolation for LLMs with an Efficient Context Memory","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04617","snapshot_observed_at":"2026-08-07T05:06:32.710225Z","title":"Infllm: Training-free long-context extrapolation for llms with an efficient context memory.arXiv preprint arXiv:2402.04617, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-13T09:28:54.701420Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.710225Z"},"links":{"cited_paper":"/paper/2402.04617","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:8bb515479e8015fabda5e27c7ea372e8e0192d92be4631c0e02b7c67efa36bab","observation_id":"e51bd4e9-f1ae-497b-b21f-cb827e7bdd73","resolution":{"observed_at":"2026-08-07T05:06:32.710225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17453","last_updated":"2024-04-07T00:56:53Z","snapshot_observed_at":"2026-08-14T06:01:54.549199Z","submitted_at":"2023-09-29T17:59:56Z","title":"Efficient Streaming Language Models with Attention Sinks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17453","snapshot_observed_at":"2026-08-07T05:06:32.712682Z","title":"Efficient streaming language models with attention sinks.arXiv preprint arXiv:2309.17453, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-13T09:28:54.701420Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.712682Z"},"links":{"cited_paper":"/paper/2309.17453","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:6f64219951bb7d6b4e3c231fd98fd001e6c564496c916cb0b98d74c80f247c56","observation_id":"0da04754-dc55-459a-abb4-c029a17bb797","resolution":{"observed_at":"2026-08-07T05:06:32.712682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10819","last_updated":"2024-10-14T17:59:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-14T17:59:58Z","title":"DuoAttention: Efficient Long-Context LLM Inference with Retrieval and Streaming Heads","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10819","snapshot_observed_at":"2026-08-07T05:06:32.715316Z","title":"Duoattention: Efficient long-context llm inference with retrieval and streaming heads.arXiv preprint arXiv:2410.10819, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-13T09:28:54.701420Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.715316Z"},"links":{"cited_paper":"/paper/2410.10819","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:5188fd992b34d82c2e30338496db3465c240cd9147513acf216a8e0021855da2","observation_id":"af72d851-2eef-4c38-93dc-e2ca446dc95f","resolution":{"observed_at":"2026-08-07T05:06:32.715316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16428","last_updated":"2025-03-20T17:59:58Z","snapshot_observed_at":"2026-08-14T17:42:03.975212Z","submitted_at":"2025-03-20T17:59:58Z","title":"XAttention: Block Sparse Attention with Antidiagonal Scoring","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.16428","snapshot_observed_at":"2026-08-07T05:06:32.718359Z","title":"Xattention: Block sparse attention with antidiagonal scoring.arXiv preprint arXiv:2503.16428, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-13T09:28:54.701420Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.718359Z"},"links":{"cited_paper":"/paper/2503.16428","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:a17262f2417aa4374be4cca6c89c077da416556b833ee13938d81e4f582c257d","observation_id":"c1f77f0b-62cc-436f-a5a8-9fb99f5859c8","resolution":{"observed_at":"2026-08-07T05:06:32.718359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-07T05:06:32.721183Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-13T09:28:54.701420Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.721183Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:35ff35171363f79bd47fe0a18e8d463c2f7e576eeb7f93605feca24e0a9df1cf","observation_id":"c2b5e48b-48d0-4ef7-8fc6-80bd77976df3","resolution":{"observed_at":"2026-08-07T05:06:32.721183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14866","last_updated":"2025-04-21T15:13:44Z","snapshot_observed_at":"2026-08-07T18:00:57.140205Z","submitted_at":"2025-02-20T18:59:52Z","title":"LServe: Efficient Long-sequence LLM Serving with Unified Sparse Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14866","snapshot_observed_at":"2026-08-07T05:06:32.724124Z","title":"Lserve: Efficient long-sequence llm serving with unified sparse attention.arXiv preprint arXiv:2502.14866, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-13T09:28:54.701420Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.724124Z"},"links":{"cited_paper":"/paper/2502.14866","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:0b966ad7126f1a6285c272e7664b5bb4e83b2f799aaa359897b47c154f410563","observation_id":"e6a73f34-695e-4872-ae7d-4196c0ddbddb","resolution":{"observed_at":"2026-08-07T05:06:32.724124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.07092","last_updated":"2024-08-18T17:27:17Z","snapshot_observed_at":"2026-08-12T23:05:17.933276Z","submitted_at":"2024-08-11T18:40:36Z","title":"Post-Training Sparse Attention with Double Sparsity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.07092","snapshot_observed_at":"2026-08-07T05:06:32.726866Z","title":"Post-training sparse attention with double sparsity.arXiv preprint arXiv:2408.07092, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-13T09:28:54.701420Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.726866Z"},"links":{"cited_paper":"/paper/2408.07092","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:e6e5c72430b940247adb2bda84c4a623f6aae2be0d0d6386e0d1b2e5ab8fddc8","observation_id":"bab96539-ebe4-47de-8355-181e7446dd8d","resolution":{"observed_at":"2026-08-07T05:06:32.726866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06635","last_updated":"2024-08-27T01:27:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-11T18:51:59Z","title":"Gated Linear Attention Transformers with Hardware-Efficient Training","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06635","snapshot_observed_at":"2026-08-07T05:06:32.729535Z","title":"Gated linear attention transformers with hardware-efficient training.arXiv preprint arXiv:2312.06635, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-13T09:28:54.701420Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.729535Z"},"links":{"cited_paper":"/paper/2312.06635","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:f34be3dbc06f7dfab8c4836e1cb1f100f90e3ac96065ce20c093b5f8f3c7181f","observation_id":"95dfe03b-fd92-4e07-8d3f-2a2c169094e6","resolution":{"observed_at":"2026-08-07T05:06:32.729535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06484","last_updated":"2025-01-15T10:41:40Z","snapshot_observed_at":"2026-08-12T23:46:14.417356Z","submitted_at":"2024-06-10T17:24:42Z","title":"Parallelizing Linear Transformers with the Delta Rule over Sequence Length","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06484","snapshot_observed_at":"2026-08-07T05:06:32.732274Z","title":"Parallelizing linear transformers with the delta rule over sequence length.arXiv preprint arXiv:2406.06484, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-13T09:28:54.701420Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.732274Z"},"links":{"cited_paper":"/paper/2406.06484","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:1ad5602b34d2bbf513579cf9e4da9ef3a881d5f45541b1811226fcadf18df9dd","observation_id":"ba368b4c-83f6-4f2c-9b86-76d1891b91af","resolution":{"observed_at":"2026-08-07T05:06:32.732274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11089","last_updated":"2025-02-27T09:01:21Z","snapshot_observed_at":"2026-08-07T14:17:15.942844Z","submitted_at":"2025-02-16T11:53:44Z","title":"Native Sparse Attention: Hardware-Aligned and Natively Trainable Sparse Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11089","snapshot_observed_at":"2026-08-07T05:06:32.735020Z","title":"Native sparse attention: Hardware-aligned and natively trainable sparse attention.arXiv preprint arXiv:2502.11089, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-13T09:28:54.701420Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.735020Z"},"links":{"cited_paper":"/paper/2502.11089","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:b9d272b579a557530f12cac499a1ef3178af9f059c504312c0a680edd1bfa3b4","observation_id":"92fa3dfc-1f8d-4cf3-90db-dd119862ed8b","resolution":{"observed_at":"2026-08-07T05:06:32.735020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21487","snapshot_observed_at":"2026-08-07T05:06:32.737715Z","title":"Hardware-efficient attention for fast decoding.arXiv preprint arXiv:2505.21487, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-13T09:28:54.701420Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.737715Z"},"links":{"cited_paper":"/paper/2505.21487","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:1ab33d79c93a86dd16dcb4d5ea038f3dffc7c21983177689a2b9f64c7073d7c7","observation_id":"292cce17-8c9a-4178-887e-7497c8c511e0","resolution":{"observed_at":"2026-08-07T05:06:32.737715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:06:32.740450Z","title":"Big bird: Transformers for longer sequences.Advances in neural information processing systems, 33: 17283–17297, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-13T09:28:54.701420Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.740450Z"},"links":{"citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:0d068f65617ddab49139604f633e00d363bc8b559f28358f4bab57409da7774a","observation_id":"563df4f2-cca6-45f9-a9b7-96a0005e3186","resolution":{"observed_at":"2026-08-07T05:06:32.740450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12876","last_updated":"2025-04-17T03:51:06Z","snapshot_observed_at":"2026-08-15T07:21:27.940778Z","submitted_at":"2024-10-15T05:01:19Z","title":"In-context KV-Cache Eviction for LLMs via Attention-Gate","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12876","snapshot_observed_at":"2026-08-07T05:06:32.742963Z","title":"In-context kv-cache eviction for llms via attention-gate.arXiv preprint arXiv:2410.12876, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-13T09:28:54.701420Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.742963Z"},"links":{"cited_paper":"/paper/2410.12876","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:0d5e1e03738558b38bbbfb778569664d3fdcfa75c7b295731fcacce3e350381a","observation_id":"ce549a7a-91ea-40a8-b8bd-ec2b2a44d192","resolution":{"observed_at":"2026-08-07T05:06:32.742963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12820","last_updated":"2025-03-30T08:13:50Z","snapshot_observed_at":"2026-08-14T07:48:38.103893Z","submitted_at":"2024-07-01T13:05:42Z","title":"PQCache: Product Quantization-based KVCache for Long Context LLM Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12820","snapshot_observed_at":"2026-08-07T05:06:32.745585Z","title":"Pqcache: Product quantization-based kvcache for long context llm inference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-13T09:28:54.701420Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.745585Z"},"links":{"cited_paper":"/paper/2407.12820","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:d2a975abc03b7c901cfd07bf42b89577d0ed995b3eadd364be5a3d3eea049de6","observation_id":"506d2d3c-2bcb-4aea-9efb-b6071374512a","resolution":{"observed_at":"2026-08-07T05:06:32.745585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:06:33.384228Z","title":"Spargeattn: Accurate sparse attention accelerating any model inference","venue":null,"work_id":"1d6f8963-aa67-4674-b832-d8c823b0020e","year":2025},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-13T09:28:54.701420Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.748548Z"},"links":{"citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:c4c5d9206edf71df6f701d38cc0c7d4e5a0993e1a5b7e6053d4c1e3a1177019a","observation_id":"f109a2ac-2869-4b5e-9f1b-2099b952ac7d","resolution":{"observed_at":"2026-08-07T05:06:33.387280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:06:33.376358Z","title":"H2o: Heavy-hitter oracle for efficient generative inference of large language models","venue":null,"work_id":"9a0dbb63-614f-45fb-bebc-fe1156f4bf3d","year":2023},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-13T09:28:54.701420Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.751054Z"},"links":{"citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:734c942970c34a041bd5a16a92d1204e48f67ea0606692d7c57ef5b3f9b4f054","observation_id":"ab92dd5a-4c2b-42ca-936f-3deb329e8c07","resolution":{"observed_at":"2026-08-07T05:06:33.379076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:06:33.368280Z","title":"Sglang: Efficient execution of structured language model programs.Advances in Neural Information Processing Systems, 37:62557–62583, 2024","venue":null,"work_id":"7374e48b-6552-47b6-9618-03cda1891ff4","year":2024},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-13T09:28:54.701420Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.753405Z"},"links":{"citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:f61b5f2be62768ea7c35b8cff1911a94e08e457dec56cfe74ab8af7ead4efc8b","observation_id":"0e4c6dc1-84ad-4eee-897e-4fe0150e1e66","resolution":{"observed_at":"2026-08-07T05:06:33.371151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:06:33.358149Z","title":"ROLLER: Fast and efficient tensor compilation for deep learning","venue":null,"work_id":"a36a06ef-2191-4a56-9591-e3f2e10bc2ee","year":2022},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-13T09:28:54.701420Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.755775Z"},"links":{"citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:2b62658298d05b61219db52ee40689e240d0c45762332e9ceb3efcc77a6464fe","observation_id":"53b8b144-c7aa-40e1-9c49-15a0541be264","resolution":{"observed_at":"2026-08-07T05:06:33.362723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-13T09:28:54.701420Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning"},"reference_resolution":{"displayed":78,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":64,"verified_exact":0,"verified_fuzzy":14},"total_outbound_references":78},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 78 of 78 outbound references and 12 inbound Pith citation observations for arXiv:2506.08889."}