{"as_of":"2026-08-15T13:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f5df9220a1ca9e0bfce4edf7b85f3231611700fa15f2a1324b87b45632287567","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:10:50.032662Z","state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.11498/citation-record","integrity":"/paper/2506.11498/integrity","json":"/paper/2506.11498/citation-record.json","paper":"/paper/2506.11498"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-07T04:10:45.390155Z","title":"arXiv preprint arXiv:2004.05150 (2020)","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.11498","last_updated":"2025-06-13T06:49:53Z","snapshot_observed_at":"2026-08-10T13:22:21.396028Z","submitted_at":"2025-06-13T06:49:53Z","title":"Lag-Relative Sparse Attention In Long Context Training","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T04:10:45.390155Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2506.11498"},"observation_digest":"sha256:acf1d5e0539db71d14072a9c42a947b6a4ff8b331cc76efbe473c29c350577a6","observation_id":"8e0c89a8-6963-4fab-8847-878f1383cd32","resolution":{"observed_at":"2026-08-07T04:10:45.390155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:10:45.442228Z","title":"ACM transactions on intelligent systems and technology15(3), 1–45 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11498","last_updated":"2025-06-13T06:49:53Z","snapshot_observed_at":"2026-08-10T13:22:21.396028Z","submitted_at":"2025-06-13T06:49:53Z","title":"Lag-Relative Sparse Attention In Long Context Training","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T04:10:45.442228Z"},"links":{"citing_paper":"/paper/2506.11498"},"observation_digest":"sha256:39a8a7b4d07e19139b737feed2754ae40c9aa6f7212360b91668fd13fe35d8d0","observation_id":"99f00575-4a14-4f4f-b684-39292ea5e963","resolution":{"observed_at":"2026-08-07T04:10:45.442228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.10509","last_updated":"2019-04-23T19:29:47Z","snapshot_observed_at":"2026-08-09T19:46:04.857927Z","submitted_at":"2019-04-23T19:29:47Z","title":"Generating Long Sequences with Sparse Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.10509","snapshot_observed_at":"2026-08-07T04:10:45.518337Z","title":"arXiv preprint arXiv:1904.10509 (2019)","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.11498","last_updated":"2025-06-13T06:49:53Z","snapshot_observed_at":"2026-08-10T13:22:21.396028Z","submitted_at":"2025-06-13T06:49:53Z","title":"Lag-Relative Sparse Attention In Long Context Training","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T04:10:45.518337Z"},"links":{"cited_paper":"/paper/1904.10509","citing_paper":"/paper/2506.11498"},"observation_digest":"sha256:60bdee4e43f9139937b032b28e788df1885c7251a03cc74013de3f4132620e7b","observation_id":"9858e872-dc4e-49fb-acb1-162b3f78f323","resolution":{"observed_at":"2026-08-07T04:10:45.518337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:10:45.598331Z","title":"Advances in neural information pro- cessing systems35, 16344–16359 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.11498","last_updated":"2025-06-13T06:49:53Z","snapshot_observed_at":"2026-08-10T13:22:21.396028Z","submitted_at":"2025-06-13T06:49:53Z","title":"Lag-Relative Sparse Attention In Long Context Training","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T04:10:45.598331Z"},"links":{"citing_paper":"/paper/2506.11498"},"observation_digest":"sha256:151cabe8163ca28c7013c9b410232c124bbbbdcf83453bbbe805115eb2acb60c","observation_id":"660f74f3-918e-4453-87f1-ee55c3ffde2f","resolution":{"observed_at":"2026-08-07T04:10:45.598331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13753","last_updated":"2024-02-21T12:30:33Z","snapshot_observed_at":"2026-08-02T12:47:57.325302Z","submitted_at":"2024-02-21T12:30:33Z","title":"LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13753","snapshot_observed_at":"2026-08-07T04:10:45.692174Z","title":"arXiv preprint arXiv:2402.13753 (2024) Lag-Relative Sparse Attention In Long Context Training 11","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11498","last_updated":"2025-06-13T06:49:53Z","snapshot_observed_at":"2026-08-10T13:22:21.396028Z","submitted_at":"2025-06-13T06:49:53Z","title":"Lag-Relative Sparse Attention In Long Context Training","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T04:10:45.692174Z"},"links":{"cited_paper":"/paper/2402.13753","citing_paper":"/paper/2506.11498"},"observation_digest":"sha256:ca2c7157c9bd0cedc1ce9b8706f38a5c57bb2b7c2a279b269443dba4bec5040e","observation_id":"a11b3d47-cc92-4d8e-833a-c9f2cb615b2c","resolution":{"observed_at":"2026-08-07T04:10:45.692174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-08-12T20:32:53.188699Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.11550","snapshot_observed_at":"2026-08-07T04:10:45.799671Z","title":"arXiv preprint arXiv:2407.11550 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11498","last_updated":"2025-06-13T06:49:53Z","snapshot_observed_at":"2026-08-10T13:22:21.396028Z","submitted_at":"2025-06-13T06:49:53Z","title":"Lag-Relative Sparse Attention In Long Context Training","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T04:10:45.799671Z"},"links":{"cited_paper":"/paper/2407.11550","citing_paper":"/paper/2506.11498"},"observation_digest":"sha256:fee2a7a66408835f443bb256a195eb9a240e2d15900420eee03f0767325d2aa3","observation_id":"951d4d05-8915-4e9d-8769-0451d3550c08","resolution":{"observed_at":"2026-08-07T04:10:45.799671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01801","last_updated":"2024-10-29T18:26:09Z","snapshot_observed_at":"2026-08-14T11:45:47.400186Z","submitted_at":"2023-10-03T05:17:08Z","title":"Model Tells You What to Discard: Adaptive KV Cache Compression for LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01801","snapshot_observed_at":"2026-08-07T04:10:45.945773Z","title":"arXiv preprint arXiv:2310.01801 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11498","last_updated":"2025-06-13T06:49:53Z","snapshot_observed_at":"2026-08-10T13:22:21.396028Z","submitted_at":"2025-06-13T06:49:53Z","title":"Lag-Relative Sparse Attention In Long Context Training","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T04:10:45.945773Z"},"links":{"cited_paper":"/paper/2310.01801","citing_paper":"/paper/2506.11498"},"observation_digest":"sha256:b7be7f248275c2e3f35236a0258f79aa59a0bbb20c3ce9f0eae9f26e811cf680","observation_id":"453bb1dc-f0de-4956-8038-2d0652d1c99a","resolution":{"observed_at":"2026-08-07T04:10:45.945773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-08-14T09:25:42.723726Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-07T04:10:46.033655Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11498","last_updated":"2025-06-13T06:49:53Z","snapshot_observed_at":"2026-08-10T13:22:21.396028Z","submitted_at":"2025-06-13T06:49:53Z","title":"Lag-Relative Sparse Attention In Long Context Training","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T04:10:46.033655Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2506.11498"},"observation_digest":"sha256:7846058ed992c155e8f2daedf3cf92709271a55d293a0c5ed897423d387317e4","observation_id":"072bec5e-41b3-4ba7-987b-b09d19c14c40","resolution":{"observed_at":"2026-08-07T04:10:46.033655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:10:51.181631Z","title":null,"venue":null,"work_id":"b531a5ae-3617-4df0-8c13-464473ed3a65","year":2024},"citing_paper":{"arxiv_id":"2506.11498","last_updated":"2025-06-13T06:49:53Z","snapshot_observed_at":"2026-08-10T13:22:21.396028Z","submitted_at":"2025-06-13T06:49:53Z","title":"Lag-Relative Sparse Attention In Long Context Training","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T04:10:46.135214Z"},"links":{"citing_paper":"/paper/2506.11498"},"observation_digest":"sha256:7ff8acfd3e4b68c31f34569a76e8bacd95208e1536561e4c97be9df91b35dfdb","observation_id":"fd22ae9b-fc94-4c64-b8be-ada4766b70af","resolution":{"observed_at":"2026-08-07T04:10:51.186709Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20766","last_updated":"2025-02-28T06:34:53Z","snapshot_observed_at":"2026-08-14T17:42:08.545000Z","submitted_at":"2025-02-28T06:34:53Z","title":"FlexPrefill: A Context-Aware Sparse Attention Mechanism for Efficient Long-Sequence Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.20766","snapshot_observed_at":"2026-08-07T04:10:46.279283Z","title":"arXiv preprint arXiv:2502.20766 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11498","last_updated":"2025-06-13T06:49:53Z","snapshot_observed_at":"2026-08-10T13:22:21.396028Z","submitted_at":"2025-06-13T06:49:53Z","title":"Lag-Relative Sparse Attention In Long Context Training","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T04:10:46.279283Z"},"links":{"cited_paper":"/paper/2502.20766","citing_paper":"/paper/2506.11498"},"observation_digest":"sha256:bfba9cac3c0d76915fdc2f8c666b5e4b4f69c054cf71283fccf4e83bca7cb97a","observation_id":"17a278f5-ba27-41f6-b918-962f6bd530f4","resolution":{"observed_at":"2026-08-07T04:10:46.279283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:10:51.163271Z","title":"In: Proceedings of the AAAI Conference on Artificial Intelligence","venue":null,"work_id":"c857a121-5184-4fc6-856b-ad58c4daafc7","year":2025},"citing_paper":{"arxiv_id":"2506.11498","last_updated":"2025-06-13T06:49:53Z","snapshot_observed_at":"2026-08-10T13:22:21.396028Z","submitted_at":"2025-06-13T06:49:53Z","title":"Lag-Relative Sparse Attention In Long Context Training","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T04:10:46.387353Z"},"links":{"citing_paper":"/paper/2506.11498"},"observation_digest":"sha256:c3b709a44c44d0024e21b6afdabc30fd2e4b4bcf1466d652e2ba3234e1cce78b","observation_id":"95d69890-e773-4016-9ffe-e21d987ac112","resolution":{"observed_at":"2026-08-07T04:10:51.168669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19442","last_updated":"2025-07-30T05:24:46Z","snapshot_observed_at":"2026-08-11T00:33:34.388194Z","submitted_at":"2024-12-27T04:17:57Z","title":"A Survey on Large Language Model Acceleration based on KV Cache Management","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19442","snapshot_observed_at":"2026-08-07T04:10:46.494111Z","title":"arXiv preprint arXiv:2412.19442 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11498","last_updated":"2025-06-13T06:49:53Z","snapshot_observed_at":"2026-08-10T13:22:21.396028Z","submitted_at":"2025-06-13T06:49:53Z","title":"Lag-Relative Sparse Attention In Long Context Training","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T04:10:46.494111Z"},"links":{"cited_paper":"/paper/2412.19442","citing_paper":"/paper/2506.11498"},"observation_digest":"sha256:42d1dc4496379242cb2600516f1d9990fcd9704f26e40ee77cc49bd2e2d9b34d","observation_id":"f1ade16f-2c92-4fc1-b178-ac781e464afe","resolution":{"observed_at":"2026-08-07T04:10:46.494111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:10:51.130288Z","title":"In: International Conference on Machine Learning","venue":null,"work_id":"a6bd873e-6bb7-4446-91cf-18c410314609","year":2023},"citing_paper":{"arxiv_id":"2506.11498","last_updated":"2025-06-13T06:49:53Z","snapshot_observed_at":"2026-08-10T13:22:21.396028Z","submitted_at":"2025-06-13T06:49:53Z","title":"Lag-Relative Sparse Attention In Long Context Training","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T04:10:46.603238Z"},"links":{"citing_paper":"/paper/2506.11498"},"observation_digest":"sha256:3ed06d07a716bb40c98818f8cf959b8da3eec4a779decadc2f8c7234a2e9b539","observation_id":"7901cc6a-1c85-4958-89de-9a23092d9d9e","resolution":{"observed_at":"2026-08-07T04:10:51.135416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-13T16:34:08.378180Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10319","snapshot_observed_at":"2026-08-07T04:10:46.759948Z","title":"arXiv preprint arXiv:2412.10319 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11498","last_updated":"2025-06-13T06:49:53Z","snapshot_observed_at":"2026-08-10T13:22:21.396028Z","submitted_at":"2025-06-13T06:49:53Z","title":"Lag-Relative Sparse Attention In Long Context Training","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T04:10:46.759948Z"},"links":{"cited_paper":"/paper/2412.10319","citing_paper":"/paper/2506.11498"},"observation_digest":"sha256:154159f7bb065a1e4b3fe057edc36f5097f605d4b80910f49dd0ea1a659e9727","observation_id":"e5d9f31e-b613-4a3c-8b4c-a3c8fbe621df","resolution":{"observed_at":"2026-08-07T04:10:46.759948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:10:46.915070Z","title":"Advances in Neural Information Processing Systems37, 22947–22970 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11498","last_updated":"2025-06-13T06:49:53Z","snapshot_observed_at":"2026-08-10T13:22:21.396028Z","submitted_at":"2025-06-13T06:49:53Z","title":"Lag-Relative Sparse Attention In Long Context Training","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T04:10:46.915070Z"},"links":{"citing_paper":"/paper/2506.11498"},"observation_digest":"sha256:737d0c54323cf407f95f8ea3ce4e113a7a2e9afd2874613cc6fce9d34b32256c","observation_id":"1a340d0c-bd4d-4793-811b-b66cfa7953fb","resolution":{"observed_at":"2026-08-07T04:10:46.915070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04704","last_updated":"2025-07-24T16:25:51Z","snapshot_observed_at":"2026-08-07T16:08:06.904769Z","submitted_at":"2025-04-07T03:22:15Z","title":"LagKV: Lag-Relative Information of the KV Cache Tells Which Tokens Are Important","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.04704","snapshot_observed_at":"2026-08-07T04:10:46.987437Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11498","last_updated":"2025-06-13T06:49:53Z","snapshot_observed_at":"2026-08-10T13:22:21.396028Z","submitted_at":"2025-06-13T06:49:53Z","title":"Lag-Relative Sparse Attention In Long Context Training","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T04:10:46.987437Z"},"links":{"cited_paper":"/paper/2504.04704","citing_paper":"/paper/2506.11498"},"observation_digest":"sha256:a7e004e091fec24a08408c43fbbc03d84701a2c7ab4675744870f0858a80f66f","observation_id":"0d54b903-c43e-4757-82b3-b28368f6f2de","resolution":{"observed_at":"2026-08-07T04:10:46.987437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:10:51.105156Z","title":"Advances in Neural Information Processing Systems36, 52342–52364 (2023)","venue":null,"work_id":"fc455a24-9218-4c45-bbff-ab7bb2a92220","year":2023},"citing_paper":{"arxiv_id":"2506.11498","last_updated":"2025-06-13T06:49:53Z","snapshot_observed_at":"2026-08-10T13:22:21.396028Z","submitted_at":"2025-06-13T06:49:53Z","title":"Lag-Relative Sparse Attention In Long Context Training","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T04:10:47.139536Z"},"links":{"citing_paper":"/paper/2506.11498"},"observation_digest":"sha256:c5a54104274f591b41f7c836cead43a8b8dd52dd4fb420f5f5b811c3b95f1735","observation_id":"74c5279a-4547-4804-89d1-cc6e734aca02","resolution":{"observed_at":"2026-08-07T04:10:51.109431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-07T04:10:47.302052Z","title":"arXiv preprint arXiv:1711.05101 (2017)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.11498","last_updated":"2025-06-13T06:49:53Z","snapshot_observed_at":"2026-08-10T13:22:21.396028Z","submitted_at":"2025-06-13T06:49:53Z","title":"Lag-Relative Sparse Attention In Long Context Training","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T04:10:47.302052Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2506.11498"},"observation_digest":"sha256:a885c9f91298a92dd9f9eef7091fb533b99eee364e8c5e73cb041986ba57e288","observation_id":"f8b4264f-0eee-4127-9039-d2956b12d165","resolution":{"observed_at":"2026-08-07T04:10:47.302052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16747","last_updated":"2024-06-24T15:55:59Z","snapshot_observed_at":"2026-08-12T23:35:59.371821Z","submitted_at":"2024-06-24T15:55:59Z","title":"Sparser is Faster and Less is More: Efficient Sparse Attention for Long-Range Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16747","snapshot_observed_at":"2026-08-07T04:10:47.490600Z","title":"arXiv preprint arXiv:2406.16747 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11498","last_updated":"2025-06-13T06:49:53Z","snapshot_observed_at":"2026-08-10T13:22:21.396028Z","submitted_at":"2025-06-13T06:49:53Z","title":"Lag-Relative Sparse Attention In Long Context Training","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T04:10:47.490600Z"},"links":{"cited_paper":"/paper/2406.16747","citing_paper":"/paper/2506.11498"},"observation_digest":"sha256:e380f1f86f5aee75de6711b256f4546389425001d18c9d01d126b276683888f0","observation_id":"b7b9b8d8-57db-4204-8c37-c22797ae4e76","resolution":{"observed_at":"2026-08-07T04:10:47.490600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06435","last_updated":"2024-10-17T01:10:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-12T20:01:52Z","title":"A Comprehensive Overview of Large Language Models","version":10},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06435","snapshot_observed_at":"2026-08-07T04:10:47.680043Z","title":"arXiv preprint arXiv:2307.06435 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11498","last_updated":"2025-06-13T06:49:53Z","snapshot_observed_at":"2026-08-10T13:22:21.396028Z","submitted_at":"2025-06-13T06:49:53Z","title":"Lag-Relative Sparse Attention In Long Context Training","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T04:10:47.680043Z"},"links":{"cited_paper":"/paper/2307.06435","citing_paper":"/paper/2506.11498"},"observation_digest":"sha256:d8213350e400f321d8c5fb089d7241c8a35082258867c009f1fa4805ffff5445","observation_id":"7d81b4e5-93ba-42e7-82ec-1d5060865a47","resolution":{"observed_at":"2026-08-07T04:10:47.680043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:10:51.090910Z","title":null,"venue":null,"work_id":"3d71e979-7383-452b-a423-1255cdd90a81","year":2024},"citing_paper":{"arxiv_id":"2506.11498","last_updated":"2025-06-13T06:49:53Z","snapshot_observed_at":"2026-08-10T13:22:21.396028Z","submitted_at":"2025-06-13T06:49:53Z","title":"Lag-Relative Sparse Attention In Long Context Training","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T04:10:47.810410Z"},"links":{"citing_paper":"/paper/2506.11498"},"observation_digest":"sha256:54fd7e7d8426e46a876d9a1d9e21cb7819a2129536b0575e1965a4ae991d79ce","observation_id":"9ee3ff58-ddc7-43ba-affe-fd86f9d17363","resolution":{"observed_at":"2026-08-07T04:10:51.095216Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:10:51.042291Z","title":null,"venue":null,"work_id":"963ce4cd-6898-4596-8cbd-437ba3029c6f","year":2024},"citing_paper":{"arxiv_id":"2506.11498","last_updated":"2025-06-13T06:49:53Z","snapshot_observed_at":"2026-08-10T13:22:21.396028Z","submitted_at":"2025-06-13T06:49:53Z","title":"Lag-Relative Sparse Attention In Long Context Training","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T04:10:47.981499Z"},"links":{"citing_paper":"/paper/2506.11498"},"observation_digest":"sha256:5296024154ee7c3e6d14abf3595eb4562150fd8955ed7374cea3be779748809f","observation_id":"43ee4ba6-d273-4641-aa4f-ee72187c57da","resolution":{"observed_at":"2026-08-07T04:10:51.076910Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00071","last_updated":"2026-02-06T19:40:50Z","snapshot_observed_at":"2026-08-01T02:15:47.181936Z","submitted_at":"2023-08-31T18:18:07Z","title":"YaRN: Efficient Context Window Extension of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00071","snapshot_observed_at":"2026-08-07T04:10:48.191985Z","title":"arXiv preprint arXiv:2309.00071 (2023) 12 Manlal Liang, Wanyi Huang, Mandi Liu, Huaijun Li, and Jinlong Li","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11498","last_updated":"2025-06-13T06:49:53Z","snapshot_observed_at":"2026-08-10T13:22:21.396028Z","submitted_at":"2025-06-13T06:49:53Z","title":"Lag-Relative Sparse Attention In Long Context Training","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T04:10:48.191985Z"},"links":{"cited_paper":"/paper/2309.00071","citing_paper":"/paper/2506.11498"},"observation_digest":"sha256:5533e56c33991075d409bc8c4dbfa8715e343fa43ec5b6146d421ded8562d994","observation_id":"49707010-7876-4cd1-8929-f6a69f522c32","resolution":{"observed_at":"2026-08-07T04:10:48.191985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T04:10:48.330610Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11498","last_updated":"2025-06-13T06:49:53Z","snapshot_observed_at":"2026-08-10T13:22:21.396028Z","submitted_at":"2025-06-13T06:49:53Z","title":"Lag-Relative Sparse Attention In Long Context Training","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T04:10:48.330610Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2506.11498"},"observation_digest":"sha256:5b55df33acf699cc9ba1f8d0af7e360d2859b1be206e111f8efef7c8914148e3","observation_id":"cf6665d2-74a0-4dc7-b880-d861afc4a0dc","resolution":{"observed_at":"2026-08-07T04:10:48.330610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-08-12T10:50:46.357243Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-07T04:10:48.406540Z","title":"arXiv preprint arXiv:1909.08053 (2019)","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.11498","last_updated":"2025-06-13T06:49:53Z","snapshot_observed_at":"2026-08-10T13:22:21.396028Z","submitted_at":"2025-06-13T06:49:53Z","title":"Lag-Relative Sparse Attention In Long Context Training","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T04:10:48.406540Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2506.11498"},"observation_digest":"sha256:ef2ed0144c1338f4e4653494a1777cb0d4a1e0a98a3caf4fbaeba4f4d83c3471","observation_id":"2af3c4f5-3cbd-4259-842a-853b4e637f71","resolution":{"observed_at":"2026-08-07T04:10:48.406540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:10:48.509422Z","title":"Neurocomputing568, 127063 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11498","last_updated":"2025-06-13T06:49:53Z","snapshot_observed_at":"2026-08-10T13:22:21.396028Z","submitted_at":"2025-06-13T06:49:53Z","title":"Lag-Relative Sparse Attention In Long Context Training","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T04:10:48.509422Z"},"links":{"citing_paper":"/paper/2506.11498"},"observation_digest":"sha256:f6858c39e06a46ae2f309c510e0b9b75ce9a49411ffecb5e5721e42959e8543a","observation_id":"8c335968-fa1d-4fa6-b2bd-1cc67049f5a7","resolution":{"observed_at":"2026-08-07T04:10:48.509422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10501","last_updated":"2025-03-13T16:04:31Z","snapshot_observed_at":"2026-08-13T19:06:51.411621Z","submitted_at":"2025-03-13T16:04:31Z","title":"TokenCarve: Information-Preserving Visual Token Compression in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10501","snapshot_observed_at":"2026-08-07T04:10:48.606851Z","title":"arXiv preprint arXiv:2503.10501 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11498","last_updated":"2025-06-13T06:49:53Z","snapshot_observed_at":"2026-08-10T13:22:21.396028Z","submitted_at":"2025-06-13T06:49:53Z","title":"Lag-Relative Sparse Attention In Long Context Training","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T04:10:48.606851Z"},"links":{"cited_paper":"/paper/2503.10501","citing_paper":"/paper/2506.11498"},"observation_digest":"sha256:61d67d524c147e055955ee827d743261980c0b349cad9365e33e5ae11091fff4","observation_id":"7498beaa-71fc-4113-8280-c9aa8c69579d","resolution":{"observed_at":"2026-08-07T04:10:48.606851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15891","last_updated":"2024-07-22T01:12:23Z","snapshot_observed_at":"2026-08-12T23:17:40.204038Z","submitted_at":"2024-07-22T01:12:23Z","title":"RazorAttention: Efficient KV Cache Compression Through Retrieval Heads","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15891","snapshot_observed_at":"2026-08-07T04:10:48.721531Z","title":"arXiv preprint arXiv:2407.15891 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11498","last_updated":"2025-06-13T06:49:53Z","snapshot_observed_at":"2026-08-10T13:22:21.396028Z","submitted_at":"2025-06-13T06:49:53Z","title":"Lag-Relative Sparse Attention In Long Context Training","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T04:10:48.721531Z"},"links":{"cited_paper":"/paper/2407.15891","citing_paper":"/paper/2506.11498"},"observation_digest":"sha256:2394c6c84d3e4e40e4a068f78a097e37fdb72ec5ffa039f421bc22f118ad5802","observation_id":"49883b0e-1ec7-4da8-8c75-11935e0ed8b1","resolution":{"observed_at":"2026-08-07T04:10:48.721531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:10:50.829840Z","title":"In: Proceedings of the 41st Inter- national Conference on Machine Learning","venue":null,"work_id":"6faeb78c-c6c9-4f7b-af2a-31964f80e0c9","year":2024},"citing_paper":{"arxiv_id":"2506.11498","last_updated":"2025-06-13T06:49:53Z","snapshot_observed_at":"2026-08-10T13:22:21.396028Z","submitted_at":"2025-06-13T06:49:53Z","title":"Lag-Relative Sparse Attention In Long Context Training","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T04:10:48.760326Z"},"links":{"citing_paper":"/paper/2506.11498"},"observation_digest":"sha256:3bc9f378e142f734ccc0efc842c77720000674c6add91273da9523ec37a90023","observation_id":"f95ac60f-4d6d-42e5-bc00-ac612b3132e9","resolution":{"observed_at":"2026-08-07T04:10:50.944929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:10:48.854820Z","title":"Advances in neural information pro- cessing systems30(2017)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.11498","last_updated":"2025-06-13T06:49:53Z","snapshot_observed_at":"2026-08-10T13:22:21.396028Z","submitted_at":"2025-06-13T06:49:53Z","title":"Lag-Relative Sparse Attention In Long Context Training","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T04:10:48.854820Z"},"links":{"citing_paper":"/paper/2506.11498"},"observation_digest":"sha256:57f6777efe3437bb6300af5b82e14dce5880bbe3003d4a98b7b116e23e0eb520","observation_id":"4a43fa87-0313-4e3c-bc61-5b1fe083beee","resolution":{"observed_at":"2026-08-07T04:10:48.854820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:10:50.679878Z","title":"Neurocomputing 639, 130193 (2025)","venue":null,"work_id":"4b5820a6-b230-4f44-bf0d-f6c553791f7b","year":2025},"citing_paper":{"arxiv_id":"2506.11498","last_updated":"2025-06-13T06:49:53Z","snapshot_observed_at":"2026-08-10T13:22:21.396028Z","submitted_at":"2025-06-13T06:49:53Z","title":"Lag-Relative Sparse Attention In Long Context Training","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T04:10:48.977954Z"},"links":{"citing_paper":"/paper/2506.11498"},"observation_digest":"sha256:d9d9c4596347e45722a9ddcc6ba10708db5bd3aae06947dda62c458774432d4b","observation_id":"2d0b8531-07fd-4d2b-9e1f-5acb8da24bb2","resolution":{"observed_at":"2026-08-07T04:10:50.762890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07378","last_updated":"2025-03-16T03:27:33Z","snapshot_observed_at":"2026-08-13T18:13:07.594457Z","submitted_at":"2024-03-12T07:31:18Z","title":"SVD-LLM: Truncation-aware Singular Value Decomposition for Large Language Model Compression","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07378","snapshot_observed_at":"2026-08-07T04:10:49.095108Z","title":"arXiv preprint arXiv:2403.07378 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11498","last_updated":"2025-06-13T06:49:53Z","snapshot_observed_at":"2026-08-10T13:22:21.396028Z","submitted_at":"2025-06-13T06:49:53Z","title":"Lag-Relative Sparse Attention In Long Context Training","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T04:10:49.095108Z"},"links":{"cited_paper":"/paper/2403.07378","citing_paper":"/paper/2506.11498"},"observation_digest":"sha256:384f5c3b2114b1b53185da23effa90d49da2f44def734d7b8d834dc720d3146d","observation_id":"425cc9a5-9881-41dc-83e2-a397465c72f0","resolution":{"observed_at":"2026-08-07T04:10:49.095108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02244","last_updated":"2024-05-29T13:38:25Z","snapshot_observed_at":"2026-08-13T04:27:39.469177Z","submitted_at":"2024-02-03T19:20:02Z","title":"Beyond the Limits: A Survey of Techniques to Extend the Context Length in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02244","snapshot_observed_at":"2026-08-07T04:10:49.229617Z","title":"arXiv preprint arXiv:2402.02244 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11498","last_updated":"2025-06-13T06:49:53Z","snapshot_observed_at":"2026-08-10T13:22:21.396028Z","submitted_at":"2025-06-13T06:49:53Z","title":"Lag-Relative Sparse Attention In Long Context Training","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T04:10:49.229617Z"},"links":{"cited_paper":"/paper/2402.02244","citing_paper":"/paper/2506.11498"},"observation_digest":"sha256:8edc43d84b82b0081e2fb426bf3bd1cb3b9385df6590f1ed9bf2b0ee93dd711e","observation_id":"d1134c5e-e1ca-476f-8ab7-1c9149894f03","resolution":{"observed_at":"2026-08-07T04:10:49.229617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17453","last_updated":"2024-04-07T00:56:53Z","snapshot_observed_at":"2026-08-14T06:01:54.549199Z","submitted_at":"2023-09-29T17:59:56Z","title":"Efficient Streaming Language Models with Attention Sinks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17453","snapshot_observed_at":"2026-08-07T04:10:49.389953Z","title":"arXiv preprint arXiv:2309.17453 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11498","last_updated":"2025-06-13T06:49:53Z","snapshot_observed_at":"2026-08-10T13:22:21.396028Z","submitted_at":"2025-06-13T06:49:53Z","title":"Lag-Relative Sparse Attention In Long Context Training","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T04:10:49.389953Z"},"links":{"cited_paper":"/paper/2309.17453","citing_paper":"/paper/2506.11498"},"observation_digest":"sha256:6c7f149c43e3e06f084df111790fea3d4194303872d8cd8c3d44fb0ff7ffb1e6","observation_id":"c9863385-8ff4-48f3-abdb-17f30cb769db","resolution":{"observed_at":"2026-08-07T04:10:49.389953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11089","last_updated":"2025-02-27T09:01:21Z","snapshot_observed_at":"2026-08-07T14:17:15.942844Z","submitted_at":"2025-02-16T11:53:44Z","title":"Native Sparse Attention: Hardware-Aligned and Natively Trainable Sparse Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11089","snapshot_observed_at":"2026-08-07T04:10:49.560520Z","title":"arXiv preprint arXiv:2502.11089 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11498","last_updated":"2025-06-13T06:49:53Z","snapshot_observed_at":"2026-08-10T13:22:21.396028Z","submitted_at":"2025-06-13T06:49:53Z","title":"Lag-Relative Sparse Attention In Long Context Training","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T04:10:49.560520Z"},"links":{"cited_paper":"/paper/2502.11089","citing_paper":"/paper/2506.11498"},"observation_digest":"sha256:61f8b1ecbb033e45add769df904b7d37c89ed66be0cf1cc39178d8b060607e67","observation_id":"7d858341-c554-4867-83dc-9affe32268aa","resolution":{"observed_at":"2026-08-07T04:10:49.560520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:10:49.778422Z","title":"Advances in neural information processing systems33, 17283–17297 (2020)","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.11498","last_updated":"2025-06-13T06:49:53Z","snapshot_observed_at":"2026-08-10T13:22:21.396028Z","submitted_at":"2025-06-13T06:49:53Z","title":"Lag-Relative Sparse Attention In Long Context Training","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T04:10:49.778422Z"},"links":{"citing_paper":"/paper/2506.11498"},"observation_digest":"sha256:e6f2f15045f20f0573ccc2a88dd4b0c15de9ff82ee463d639d93ec7faf395a65","observation_id":"56f79d8c-4bff-4689-b515-d04403ebe265","resolution":{"observed_at":"2026-08-07T04:10:49.778422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23520","last_updated":"2025-05-29T14:59:06Z","snapshot_observed_at":"2026-08-09T06:40:41.698351Z","submitted_at":"2025-05-29T14:59:06Z","title":"AnchorAttention: Difference-Aware Sparse Attention with Stripe Granularity","version":1},"cited_work":{"arxiv_id":"2505.23520","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.23520","snapshot_observed_at":"2026-08-07T04:10:50.173158Z","title":"AnchorAttention: Difference-Aware Sparse Attention with Stripe Granularity","venue":"cs.LG","work_id":"14cddf77-91fd-4dce-80f8-89370a48c6b5","year":2025},"citing_paper":{"arxiv_id":"2506.11498","last_updated":"2025-06-13T06:49:53Z","snapshot_observed_at":"2026-08-10T13:22:21.396028Z","submitted_at":"2025-06-13T06:49:53Z","title":"Lag-Relative Sparse Attention In Long Context Training","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T04:10:49.923424Z"},"links":{"cited_paper":"/paper/2505.23520","citing_paper":"/paper/2506.11498"},"observation_digest":"sha256:b310753c21e722b8c5450fe4dcf4f4ffa3ec74562307e89412249518f5f88b94","observation_id":"f075099b-2eb5-4225-88f1-5d9e0ed8b034","resolution":{"observed_at":"2026-08-07T04:10:50.229411Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:10:50.032662Z","title":"Advances in Neural Information Processing Systems36, 34661–34710 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11498","last_updated":"2025-06-13T06:49:53Z","snapshot_observed_at":"2026-08-10T13:22:21.396028Z","submitted_at":"2025-06-13T06:49:53Z","title":"Lag-Relative Sparse Attention In Long Context Training","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T04:10:50.032662Z"},"links":{"citing_paper":"/paper/2506.11498"},"observation_digest":"sha256:b4edfde770344f41b75e2f7e4b2ae2570e879fe21bbd07b0f6b5a4c470484db3","observation_id":"2d1b7631-13f6-487b-b674-6251e5079563","resolution":{"observed_at":"2026-08-07T04:10:50.032662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.11498","last_updated":"2025-06-13T06:49:53Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-10T13:22:21.396028Z","submitted_at":"2025-06-13T06:49:53Z","title":"Lag-Relative Sparse Attention In Long Context Training"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":32,"verified_exact":0,"verified_fuzzy":5},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 0 inbound Pith citation observations for arXiv:2506.11498."}