{"as_of":"2026-08-16T00:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f19b54a57fa1a23bfa43763dc195f9dcfdf351964e1be5a037bb9b3c5c63aefc","coverage":[{"denominator":67,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":67,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:39:10.193536Z","state":"measured"},{"denominator":67,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":67,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.24179/citation-record","integrity":"/paper/2505.24179/integrity","json":"/paper/2505.24179/citation-record.json","paper":"/paper/2505.24179"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:26.947338Z","title":"Booksum: A collection of datasets for long-form narrative summarization,","venue":null,"work_id":"13c7cd1b-e589-4d1b-ac05-1c976349a1da","year":2022},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-14T13:47:24.609733Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:01.544466Z"},"links":{"citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:0bc86ee9101e281e783796c8595d2308d5f51e967c34f2d791a8052936464787","observation_id":"f1181232-b07a-4c73-a2fe-3033e696e651","resolution":{"observed_at":"2026-08-07T12:39:27.136294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.07057","last_updated":"2023-01-17T18:18:51Z","snapshot_observed_at":"2026-08-13T13:03:01.582499Z","submitted_at":"2023-01-17T18:18:51Z","title":"Transformer Based Implementation for Automatic Book Summarization","version":1},"cited_work":{"arxiv_id":"2301.07057","doi":null,"metadata_source":"pith","pith_arxiv_id":"2301.07057","snapshot_observed_at":"2026-08-07T12:39:12.015624Z","title":"Transformer Based Implementation for Automatic Book Summarization","venue":"cs.CL","work_id":"85b53d41-53d8-49a7-af61-8758dac3bfff","year":2023},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-14T13:47:24.609733Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:01.698014Z"},"links":{"cited_paper":"/paper/2301.07057","citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:4e173cb4dc7be31a9658ab1a63db143dbb18530acd6bb1ecba45b93780c093aa","observation_id":"b13ab18e-98c6-42c3-beed-4206e077c3af","resolution":{"observed_at":"2026-08-07T12:39:12.172785Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:26.727940Z","title":"Booookscore: A systematic exploration of book-length summarization in the era of LLMs,","venue":null,"work_id":"3ee9875f-1228-4f9f-8db0-d6730e8716ef","year":2024},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-14T13:47:24.609733Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:01.862280Z"},"links":{"citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:8919b49e355466b9f6af7c0c968f1dc8f8da43f7cef676aee1549f1141db0d9e","observation_id":"512c5be2-fb3e-47e2-8561-02f765bf403d","resolution":{"observed_at":"2026-08-07T12:39:26.814959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:26.474067Z","title":"Peek across: Improving multi-document modeling via cross-document question-answering,","venue":null,"work_id":"aae011c1-9621-4337-b27b-cdc77ecd4855","year":1970},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-14T13:47:24.609733Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:01.995486Z"},"links":{"citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:aa3ad9063c934d412d1f0a2fec8be3f3fde62ca81a6ef5bcaedc7e11c9fa1702","observation_id":"8d871b43-4e3d-458f-adad-b036b31dd6f2","resolution":{"observed_at":"2026-08-07T12:39:26.607039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:26.235579Z","title":"Quality: Question answering with long input texts, yes!,","venue":null,"work_id":"0bb4d4db-80d4-4836-9c23-edcc956ab142","year":2022},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-14T13:47:24.609733Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:02.119346Z"},"links":{"citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:eba492f86826acb04080846b8cd88e8d3af45d3d3d9c1b322b7aaba5df747dd6","observation_id":"0492a883-5869-4d00-b33a-23eaf3cf4da0","resolution":{"observed_at":"2026-08-07T12:39:26.360575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:26.079482Z","title":"Eli5: Long form question answering,","venue":null,"work_id":"566b8261-1676-41c7-8d56-459029444b4e","year":2019},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-14T13:47:24.609733Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:02.225120Z"},"links":{"citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:3a8cb7a88da36c8a66e1ab5dfd517cd585e671e1b0aecd0ae5cb8795b626ccd0","observation_id":"51bd3625-2748-411d-8673-c8a17d439cb9","resolution":{"observed_at":"2026-08-07T12:39:26.148743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:24.302391Z","title":"Teaching code llms to use autocompletion tools in repository-level code generation,","venue":null,"work_id":"ecb9288f-df63-42ee-a823-51d019fd1041","year":2024},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-14T13:47:24.609733Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:02.354328Z"},"links":{"citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:9fb046a813f49730788935406aa8ee6859522062d2dbe411b3b5ce09846f193c","observation_id":"11e139f6-855e-441e-9eb1-dee98a1dcd55","resolution":{"observed_at":"2026-08-07T12:39:25.930551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:23.284835Z","title":"Rlcoder: Reinforcement learning for repository-level code completion,","venue":null,"work_id":"3c23c241-a4b1-45fc-9a87-05c98afa7450","year":2024},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-14T13:47:24.609733Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:02.439280Z"},"links":{"citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:00d2796bb4be3337fa9f07157f306776a2c4224141634f3b631de584c2c170e3","observation_id":"d394e65c-6b84-4b07-85e6-84e86266e87e","resolution":{"observed_at":"2026-08-07T12:39:23.459473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:19.124796Z","title":"The llama 3 herd of models,","venue":null,"work_id":"8542a403-0569-4e55-844e-89351c1fbb74","year":2024},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-14T13:47:24.609733Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:02.540264Z"},"links":{"citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:51032194a7e2d669cab14cbfda0a65ed675106dae8ad0068e5e19eeaebc3c1df","observation_id":"cd7e2f28-2281-477c-ae9e-67a4033939f2","resolution":{"observed_at":"2026-08-07T12:39:21.967928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15383","last_updated":"2025-01-26T03:47:25Z","snapshot_observed_at":"2026-08-11T19:42:36.266059Z","submitted_at":"2025-01-26T03:47:25Z","title":"Qwen2.5-1M Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15383","snapshot_observed_at":"2026-08-07T12:39:02.628737Z","title":"Qwen2. 5-1m technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-14T13:47:24.609733Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:02.628737Z"},"links":{"cited_paper":"/paper/2501.15383","citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:a70e60d6f56014547c9e32372df1e2ebf92dae7d205adf17e30221a12b9b34f8","observation_id":"3dbd470f-d605-4360-a5f6-439816f638b5","resolution":{"observed_at":"2026-08-07T12:39:02.628737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:18.718269Z","title":"Gemma 3 technical report,","venue":null,"work_id":"fe568a44-9f3c-4a9e-bf3e-4b3a07021996","year":2025},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-14T13:47:24.609733Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:02.777619Z"},"links":{"citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:b0919a2cafabdca3a170709ac304197cd7972d8ccfb9b4e00904c84ae5d8738f","observation_id":"7024eba2-1cc9-4e41-8937-4623bc89b760","resolution":{"observed_at":"2026-08-07T12:39:18.840840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:18.480378Z","title":"Deepseek-v3 technical report,","venue":null,"work_id":"371c2263-81b1-4c2f-a620-a62363d78dd8","year":2025},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-14T13:47:24.609733Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:02.883538Z"},"links":{"citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:a302c52091fe2013785569770f3e396d9069850d3fe10de087f1580d141d102a","observation_id":"e6c144f1-0568-490a-8e08-926250a7c254","resolution":{"observed_at":"2026-08-07T12:39:18.572954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:02.961058Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-14T13:47:24.609733Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:02.961058Z"},"links":{"citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:27e30250c143626f54cbf5e6781e72ca35f419ae02a14df1d899680f72cd20e6","observation_id":"3ebd4d0b-4c23-4611-a066-be719b0961b9","resolution":{"observed_at":"2026-08-07T12:39:02.961058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:18.220573Z","title":"Challenges in deploying long-context transformers: A theoretical peak performance analysis,","venue":null,"work_id":"ad1bf2a5-d445-4a5b-ba8d-4061a4f5ea7a","year":2024},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-14T13:47:24.609733Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:03.066855Z"},"links":{"citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:f68d1ae6ab860e15297629ce5ac82c6c2d243820fca2da7457f3827effb1db38","observation_id":"e8d31f66-3863-43e5-8cba-31d97e3a4ff1","resolution":{"observed_at":"2026-08-07T12:39:18.317295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:17.836819Z","title":"Minference 1.0: Accelerating pre-filling for long-context llms via dynamic sparse attention,","venue":null,"work_id":"5aa31dbe-16f6-4ebe-bc00-be6e26e26319","year":2024},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-14T13:47:24.609733Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:03.195707Z"},"links":{"citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:d277c0a3cc578292e6db23788454e9f4fa12fc6b4663ec76e3c45697f0bb455b","observation_id":"dc30b61e-5109-45e4-afa2-82763aa26a9e","resolution":{"observed_at":"2026-08-07T12:39:18.087881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02690","last_updated":"2025-02-12T14:32:46Z","snapshot_observed_at":"2026-08-13T00:38:30.794894Z","submitted_at":"2024-04-03T12:37:34Z","title":"How Sparse Attention Approximates Exact Attention? Your Attention is Naturally $n^C$-Sparse","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02690","snapshot_observed_at":"2026-08-07T12:39:03.324221Z","title":"Attention is naturally sparse with gaussian distributed input,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-14T13:47:24.609733Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:03.324221Z"},"links":{"cited_paper":"/paper/2404.02690","citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:8de845eb1d30f35920ec1276c4d96c279cc6c148a821c39a558cf5d6fd5ff1c0","observation_id":"9b8de900-60eb-4bab-8ac4-71d127049db3","resolution":{"observed_at":"2026-08-07T12:39:03.324221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.10509","last_updated":"2019-04-23T19:29:47Z","snapshot_observed_at":"2026-08-09T19:46:04.857927Z","submitted_at":"2019-04-23T19:29:47Z","title":"Generating Long Sequences with Sparse Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.10509","snapshot_observed_at":"2026-08-07T12:39:03.429468Z","title":"Generating long sequences with sparse transformers,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-14T13:47:24.609733Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:03.429468Z"},"links":{"cited_paper":"/paper/1904.10509","citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:2216ff03d72861d82a787b05fe6bd8d12de3b7deac69a5f739de18f43f49af6f","observation_id":"f1fbed45-88d9-46ac-9bde-e090760fa7d3","resolution":{"observed_at":"2026-08-07T12:39:03.429468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:17.600124Z","title":"Big bird: Transformers for longer sequences,","venue":null,"work_id":"2d17a5b2-be45-4b7a-bf04-6bc4b182807e","year":2020},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-14T13:47:24.609733Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:03.569330Z"},"links":{"citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:495e5fe8c5009d1b81b4754284afa58c55a8008360b459b355354707f78560a4","observation_id":"3fb3dcee-4063-43f4-9f7a-9f4a119ed900","resolution":{"observed_at":"2026-08-07T12:39:17.709833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-07T12:39:03.743592Z","title":"Longformer: The long-document transformer,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-14T13:47:24.609733Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:03.743592Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:08bf45ab1cadba7302cd61525e5e389346b384924aa8468a3151d6927398019d","observation_id":"1077f3fa-2255-4a52-aecf-c71753c526b4","resolution":{"observed_at":"2026-08-07T12:39:03.743592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:17.357721Z","title":"Efficient streaming language models with attention sinks,","venue":null,"work_id":"7a042444-2001-42ae-9890-5b12133ad7e8","year":2024},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-14T13:47:24.609733Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:03.876438Z"},"links":{"citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:85d50cffb151123e5177c19d98acdd03f8bc0b5a1589ff15595bdfc928c07a30","observation_id":"dd0ba8b8-d185-4029-98eb-6479edf9cd5d","resolution":{"observed_at":"2026-08-07T12:39:17.413962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16137","last_updated":"2024-06-24T21:22:00Z","snapshot_observed_at":"2026-08-13T10:24:04.166455Z","submitted_at":"2023-08-30T16:47:51Z","title":"LM-Infinite: Zero-Shot Extreme Length Generalization for Large Language Models","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16137","snapshot_observed_at":"2026-08-07T12:39:03.996288Z","title":"Lm-infinite: Zero-shot extreme length generalization for large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-14T13:47:24.609733Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:03.996288Z"},"links":{"cited_paper":"/paper/2308.16137","citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:b5331da3196a53ff51f9f2357238ca13c30644723749c06cc8d8f5d77f7eca17","observation_id":"9c1f97f4-31be-47bf-a7e4-89aa14373d90","resolution":{"observed_at":"2026-08-07T12:39:03.996288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15486","last_updated":"2025-09-03T02:11:32Z","snapshot_observed_at":"2026-08-14T19:00:21.042943Z","submitted_at":"2024-06-17T11:05:15Z","title":"SampleAttention: Near-Lossless Acceleration of Long Context LLM Inference with Adaptive Structured Sparse Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15486","snapshot_observed_at":"2026-08-07T12:39:04.130346Z","title":"Sampleat- tention: Near-lossless acceleration of long context llm inference with adaptive structured sparse attention,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-14T13:47:24.609733Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:04.130346Z"},"links":{"cited_paper":"/paper/2406.15486","citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:d6781edac2859b685f904008ee04fbacb53ac1f97c8754e2be8f7b54065bfd8d","observation_id":"880c0f54-d757-48f2-b888-07afa42268bf","resolution":{"observed_at":"2026-08-07T12:39:04.130346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:16.990235Z","title":"Flexprefill: A context-aware sparse attention mechanism for ef- ficient long-sequence inference,","venue":null,"work_id":"24b1ac07-69f5-4630-b7cd-ab31a8d14761","year":2025},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-14T13:47:24.609733Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:04.292807Z"},"links":{"citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:14fdd8985425570e85ad412f2ce23ac853da58e4a02037c168cd48cc0ac1f488","observation_id":"23c86693-7505-4dfc-ab59-2ab4c6e8a005","resolution":{"observed_at":"2026-08-07T12:39:17.203121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:04.457185Z","title":"Spargeattn: Accurate sparse attention accelerating any model inference,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-14T13:47:24.609733Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:04.457185Z"},"links":{"citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:382b4e41293992f39457d4842eaa88b2f6e0915cf78b015b398c8640e7fb4642","observation_id":"c91011ad-266a-48c1-a33f-3149672e4140","resolution":{"observed_at":"2026-08-07T12:39:04.457185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:16.653496Z","title":"A training-free sub-quadratic cost transformer model serving framework with hierarchically pruned attention,","venue":null,"work_id":"de0d885c-4733-4c03-a950-0ac058190db8","year":2025},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-14T13:47:24.609733Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:04.564148Z"},"links":{"citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:ce5ea2848b08d82b18e01f65b68c1a55d4291a4022783030b51e60bb197d9d6f","observation_id":"c552fb85-094a-49c9-ab38-0dc97356c943","resolution":{"observed_at":"2026-08-07T12:39:16.819110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:16.344359Z","title":"When attention sink emerges in language models: An empirical view,","venue":null,"work_id":"2163edae-5bd7-40ac-b698-01cf9fe16009","year":2025},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-14T13:47:24.609733Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:04.678368Z"},"links":{"citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:81b98aaf0f76335b0e5798e094f3aaf1d64f9d14a9f59f392156cad7de1c4035","observation_id":"4d02b2b5-2c14-4ecb-9d69-11e44e8a1782","resolution":{"observed_at":"2026-08-07T12:39:16.468229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:16.069942Z","title":"H2o: Heavy-hitter oracle for efficient generative inference of large language models,","venue":null,"work_id":"66089d60-72bd-4765-ac27-ce78318cdda1","year":2023},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-14T13:47:24.609733Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:04.867954Z"},"links":{"citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:7fce7b7f27f229f1098baf3f4f4307303d4a15f90f11787552a8629f27f518ff","observation_id":"777fd1ba-d746-48d0-8058-35432def5b16","resolution":{"observed_at":"2026-08-07T12:39:16.209941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:15.755021Z","title":"Snapkv: Llm knows what you are looking for before generation,","venue":null,"work_id":"767b6d6e-62cd-4877-aa3e-f3e9035e1a7c","year":2024},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-14T13:47:24.609733Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:05.026810Z"},"links":{"citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:b61cced928d8566a1fa1b496862d6c344a8db9ecb6e1427929174a708fe9b036","observation_id":"0b2391d7-3bc3-4e6a-9457-1abb8c98786d","resolution":{"observed_at":"2026-08-07T12:39:15.903699Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12820","last_updated":"2025-03-30T08:13:50Z","snapshot_observed_at":"2026-08-14T07:48:38.103893Z","submitted_at":"2024-07-01T13:05:42Z","title":"PQCache: Product Quantization-based KVCache for Long Context LLM Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12820","snapshot_observed_at":"2026-08-07T12:39:05.152541Z","title":"Pqcache: Product quantization- based kvcache for long context llm inference,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-14T13:47:24.609733Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:05.152541Z"},"links":{"cited_paper":"/paper/2407.12820","citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:e5a478d20552364ee47eed5e892f5d039299be99a5ebd1d82adb31ebe66e95d5","observation_id":"f0d3eeb6-e310-4965-99c8-b85aa2d41096","resolution":{"observed_at":"2026-08-07T12:39:05.152541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02789","last_updated":"2025-05-19T18:24:50Z","snapshot_observed_at":"2026-08-13T08:58:53.238480Z","submitted_at":"2025-02-05T00:22:06Z","title":"Speculative Prefill: Turbocharging TTFT with Lightweight and Training-Free Token Importance Estimation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02789","snapshot_observed_at":"2026-08-07T12:39:05.263720Z","title":"Speculative prefill: Turbocharging ttft with lightweight and training-free token importance estimation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-14T13:47:24.609733Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:05.263720Z"},"links":{"cited_paper":"/paper/2502.02789","citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:e75880965d4a1ca93c368168b3f7e8010a3643d92b2a1301070365ae13d095a9","observation_id":"68f5277a-7d78-4afb-813e-57c80128c8d0","resolution":{"observed_at":"2026-08-07T12:39:05.263720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T12:39:05.385233Z","title":"Qwen2. 5 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-14T13:47:24.609733Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:05.385233Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:3030e62e34c57ef65cca67da6c241fed0f38b63e0f013db3a083f25e95372f32","observation_id":"d099f893-9734-41ba-994f-43a4a313878a","resolution":{"observed_at":"2026-08-07T12:39:05.385233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08892","last_updated":"2024-07-11T23:34:32Z","snapshot_observed_at":"2026-08-12T23:23:51.653843Z","submitted_at":"2024-07-11T23:34:32Z","title":"Characterizing Prompt Compression Methods for Long Context Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08892","snapshot_observed_at":"2026-08-07T12:39:05.504381Z","title":"Characterizing prompt compression methods for long context inference,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-14T13:47:24.609733Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:05.504381Z"},"links":{"cited_paper":"/paper/2407.08892","citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:e817ed089d8dafd6f3bca36a641aaa4f89b874a64afa4dd9fa1a3c4e2cff5d08","observation_id":"8fbdeb21-5945-4ade-a74b-dfe82e553374","resolution":{"observed_at":"2026-08-07T12:39:05.504381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17422","last_updated":"2024-09-25T23:14:47Z","snapshot_observed_at":"2026-08-12T22:37:21.042988Z","submitted_at":"2024-09-25T23:14:47Z","title":"Discovering the Gems in Early Layers: Accelerating Long-Context LLMs with 1000x Input Token Reduction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17422","snapshot_observed_at":"2026-08-07T12:39:05.601985Z","title":"Discovering the gems in early layers: Accelerating long-context llms with 1000x input token reduction,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-14T13:47:24.609733Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:05.601985Z"},"links":{"cited_paper":"/paper/2409.17422","citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:bb2274ffda5ebd7158261b2ffed112c24146e7805bd59df4177765fb45a39252","observation_id":"0e17897b-9f3b-4af4-bd78-0b15be0fe53d","resolution":{"observed_at":"2026-08-07T12:39:05.601985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05736","last_updated":"2023-12-06T17:02:25Z","snapshot_observed_at":"2026-08-15T15:21:44.762068Z","submitted_at":"2023-10-09T14:10:21Z","title":"LLMLingua: Compressing Prompts for Accelerated Inference of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05736","snapshot_observed_at":"2026-08-07T12:39:05.729533Z","title":"Llmlingua: Compressing prompts for accelerated inference of large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-14T13:47:24.609733Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:05.729533Z"},"links":{"cited_paper":"/paper/2310.05736","citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:aac230a822803a27f387db63302f846c2c52bbb1997143eaf57b478614cabf34","observation_id":"7fb1ec33-d153-40f9-9093-18fd3a040d60","resolution":{"observed_at":"2026-08-07T12:39:05.729533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06201","last_updated":"2023-10-09T23:03:24Z","snapshot_observed_at":"2026-08-14T02:06:56.363483Z","submitted_at":"2023-10-09T23:03:24Z","title":"Compressing Context to Enhance Inference Efficiency of Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06201","snapshot_observed_at":"2026-08-07T12:39:05.895555Z","title":"Compressing context to enhance inference efficiency of large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-14T13:47:24.609733Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:05.895555Z"},"links":{"cited_paper":"/paper/2310.06201","citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:cf19bb26e26533503336affb9a07a89895f3e08cc9e7c42367bc08fbd7727efe","observation_id":"8677bee6-8834-4439-a1f5-446277b5db5b","resolution":{"observed_at":"2026-08-07T12:39:05.895555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01527","last_updated":"2024-10-08T19:34:03Z","snapshot_observed_at":"2026-08-12T23:31:02.186715Z","submitted_at":"2024-07-01T17:59:47Z","title":"KV Cache Compression, But What Must We Give in Return? A Comprehensive Benchmark of Long Context Capable Approaches","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01527","snapshot_observed_at":"2026-08-07T12:39:06.015867Z","title":"Kv cache compression, but what must we give in return? a comprehensive benchmark of long context capable approaches,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-14T13:47:24.609733Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:06.015867Z"},"links":{"cited_paper":"/paper/2407.01527","citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:85d618acf08f772cb30ea479a174516a8b68fc3cee9363a4f7ade0c89cef42e4","observation_id":"54ad1def-52a4-41d4-9065-0738cec69d22","resolution":{"observed_at":"2026-08-07T12:39:06.015867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:06.153339Z","title":"Moa: Mix- ture of sparse attention for automatic large language model compression,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-14T13:47:24.609733Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:06.153339Z"},"links":{"citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:96e1e1f4950f3821b9732386307af07ae5264eabc026795aca19bdd509b4dc1b","observation_id":"73c9d2ff-0379-4a51-80bc-4a1411f3cd37","resolution":{"observed_at":"2026-08-07T12:39:06.153339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10819","last_updated":"2024-10-14T17:59:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-14T17:59:58Z","title":"DuoAttention: Efficient Long-Context LLM Inference with Retrieval and Streaming Heads","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10819","snapshot_observed_at":"2026-08-07T12:39:06.317237Z","title":"Duoattention: Efficient long-context llm inference with retrieval and streaming heads,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-14T13:47:24.609733Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:06.317237Z"},"links":{"cited_paper":"/paper/2410.10819","citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:ad2206a1f87bca419f13f241a8fb623e8a0be6d5fba060aaa006006bd7055c26","observation_id":"a9985a76-0204-4317-95d5-3abf1cd66568","resolution":{"observed_at":"2026-08-07T12:39:06.317237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13276","last_updated":"2025-02-17T02:24:47Z","snapshot_observed_at":"2026-08-15T23:30:20.193229Z","submitted_at":"2024-10-17T07:07:09Z","title":"SeerAttention: Learning Intrinsic Sparse Attention in Your LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13276","snapshot_observed_at":"2026-08-07T12:39:06.471625Z","title":"Seerattention: Learning intrinsic sparse attention in your llms,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-14T13:47:24.609733Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:06.471625Z"},"links":{"cited_paper":"/paper/2410.13276","citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:7da22c4bbad305c6137aa9102c50cb2b5d48db5591b5cd38c2a8825511fd7154","observation_id":"783534c0-5b4b-49b8-bff0-f2b48d7627f8","resolution":{"observed_at":"2026-08-07T12:39:06.471625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11089","last_updated":"2025-02-27T09:01:21Z","snapshot_observed_at":"2026-08-07T14:17:15.942844Z","submitted_at":"2025-02-16T11:53:44Z","title":"Native Sparse Attention: Hardware-Aligned and Natively Trainable Sparse Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11089","snapshot_observed_at":"2026-08-07T12:39:06.633344Z","title":"Native sparse attention: Hardware-aligned and natively trainable sparse attention,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-14T13:47:24.609733Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:06.633344Z"},"links":{"cited_paper":"/paper/2502.11089","citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:f8f7ce0e2dea81d69fdf727127ee474d936c911a2e519e1b47e44d65f99ced5c","observation_id":"cb1b6144-7239-4bab-a852-bd4d7f9f8a3e","resolution":{"observed_at":"2026-08-07T12:39:06.633344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-08-12T19:30:23.025771Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13189","snapshot_observed_at":"2026-08-07T12:39:06.783759Z","title":"Moba: Mixture of block attention for long-context llms,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-14T13:47:24.609733Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:06.783759Z"},"links":{"cited_paper":"/paper/2502.13189","citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:00642c66cc443b576afb3973f8ab12267f826b08253ccb115f7f1feb2f247c10","observation_id":"52639c41-fccf-42ba-a00f-b3047216356f","resolution":{"observed_at":"2026-08-07T12:39:06.783759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13048","last_updated":"2023-12-11T03:58:56Z","snapshot_observed_at":"2026-08-14T04:57:43.972237Z","submitted_at":"2023-05-22T13:57:41Z","title":"RWKV: Reinventing RNNs for the Transformer Era","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13048","snapshot_observed_at":"2026-08-07T12:39:06.925763Z","title":"Rwkv: Reinventing rnns for the transformer era,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-14T13:47:24.609733Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:06.925763Z"},"links":{"cited_paper":"/paper/2305.13048","citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:0d555100118126357a8d431afc1082aa520b08a1ddb9fc47b853e89fc85a2731","observation_id":"122136bc-932d-4d23-a356-0c9231bfa3bc","resolution":{"observed_at":"2026-08-07T12:39:06.925763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06635","last_updated":"2024-08-27T01:27:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-11T18:51:59Z","title":"Gated Linear Attention Transformers with Hardware-Efficient Training","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06635","snapshot_observed_at":"2026-08-07T12:39:07.074760Z","title":"Gated linear attention transformers with hardware- efficient training,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-14T13:47:24.609733Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:07.074760Z"},"links":{"cited_paper":"/paper/2312.06635","citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:fb8db19e090513e57ee103f47e45c7ebce24f1ac4ce79b0ae8cea3355a3ab452","observation_id":"9ffea3ab-fd1e-43dd-ac41-cd4805e84c8e","resolution":{"observed_at":"2026-08-07T12:39:07.074760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:15.426767Z","title":"Mamba: Linear-time sequence modeling with selective state spaces,","venue":null,"work_id":"a375d4b9-795c-4f8f-8af3-e234e73a2d8b","year":2024},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-14T13:47:24.609733Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:07.195393Z"},"links":{"citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:46f81b906060fd3ebd074b169e6c312dededeaa7c50e9575f36523097ec22a55","observation_id":"072a6031-85e0-4157-9026-1e82c3954bfd","resolution":{"observed_at":"2026-08-07T12:39:15.549430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:15.106236Z","title":"Transformers are ssms: generalized models and efficient algorithms through structured state space duality,","venue":null,"work_id":"a46aa87a-3117-4121-91f2-d67f01a8420a","year":2024},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-14T13:47:24.609733Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:07.353698Z"},"links":{"citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:ac420bdfcc1e98ef76d33523975ad00c8533ca00cc966979ea5aed5532572243","observation_id":"656dcb64-0540-4ede-b338-6e62a40d085d","resolution":{"observed_at":"2026-08-07T12:39:15.233636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.04985","last_updated":"2024-09-04T10:04:52Z","snapshot_observed_at":"2026-08-13T05:07:19.369907Z","submitted_at":"2023-12-08T11:47:35Z","title":"SparQ Attention: Bandwidth-Efficient LLM Inference","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.04985","snapshot_observed_at":"2026-08-07T12:39:07.482431Z","title":"Sparq attention: Bandwidth- efficient llm inference,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-14T13:47:24.609733Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:07.482431Z"},"links":{"cited_paper":"/paper/2312.04985","citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:17adaa837be3d30928a343586deff590aa3ecf128b628f1d8de4674b73f1f5a5","observation_id":"8094898b-a09f-4271-ac6e-1e47a32bf967","resolution":{"observed_at":"2026-08-07T12:39:07.482431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:14.782342Z","title":"{InfiniGen}: Efficient generative inference of large language models with dynamic {KV} cache management,","venue":null,"work_id":"1e6d3737-a004-48b7-9d9a-552ef1c2a9b7","year":2024},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-14T13:47:24.609733Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:07.591420Z"},"links":{"citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:66d2d653d63524ac62269f2113d953c421b00d25ac980efbd43b18b4ccfa2b0f","observation_id":"c1ede19b-d24e-4f37-9da5-4551d0f4b7eb","resolution":{"observed_at":"2026-08-07T12:39:14.895773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:14.620873Z","title":"MagicPIG: LSH sampling for efficient LLM generation,","venue":null,"work_id":"3ce645c7-ffc5-4f2f-985a-8970feb1339c","year":2025},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-14T13:47:24.609733Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:07.803444Z"},"links":{"citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:6632d2daf8398c38d003847e1f305d4fdc9c4bbad3fa60cb7ef013dd6022afef","observation_id":"c8b8f53b-8397-443e-8325-0edc21cec549","resolution":{"observed_at":"2026-08-07T12:39:14.691354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-08-15T07:47:03.589816Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10516","snapshot_observed_at":"2026-08-07T12:39:07.925816Z","title":"Retrievalattention: Accelerating long-context llm inference via vector retrieval,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-14T13:47:24.609733Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:07.925816Z"},"links":{"cited_paper":"/paper/2409.10516","citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:c9c7aa04190a7901af0bac029b3aae493b0c7f330222d1ebb0bd7f368249d129","observation_id":"421f902d-d766-48e5-9a7c-159250df986e","resolution":{"observed_at":"2026-08-07T12:39:07.925816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:14.460083Z","title":"Scissorhands: Exploiting the persistence of importance hypothesis for llm kv cache compression at test time,","venue":null,"work_id":"cb60c92c-c38e-4cb0-aada-91dce00057d6","year":2023},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-14T13:47:24.609733Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:08.057556Z"},"links":{"citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:1300cd1b882ff71cd4cd9b6944d28d3602ea5149d127fe5608c9257d76d33a34","observation_id":"05e50e07-b88e-4883-b6a4-fc715debffd4","resolution":{"observed_at":"2026-08-07T12:39:14.514745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01801","last_updated":"2024-10-29T18:26:09Z","snapshot_observed_at":"2026-08-14T11:45:47.400186Z","submitted_at":"2023-10-03T05:17:08Z","title":"Model Tells You What to Discard: Adaptive KV Cache Compression for LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01801","snapshot_observed_at":"2026-08-07T12:39:08.191015Z","title":"Model tells you what to discard: Adaptive kv cache compression for llms,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-14T13:47:24.609733Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:08.191015Z"},"links":{"cited_paper":"/paper/2310.01801","citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:f168670ef2069e021ae17db5d285a9025c5e062111bafd62c8f0640deb3ba599","observation_id":"815689dc-7de3-4398-8a7d-9d441cf63646","resolution":{"observed_at":"2026-08-07T12:39:08.191015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11430","last_updated":"2024-11-03T09:42:35Z","snapshot_observed_at":"2026-08-15T06:43:46.557876Z","submitted_at":"2024-06-17T11:35:16Z","title":"A Simple and Effective $L_2$ Norm-Based Strategy for KV Cache Compression","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11430","snapshot_observed_at":"2026-08-07T12:39:08.367652Z","title":"A simple and effectivel_2 norm-based strategy for kv cache compression,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-14T13:47:24.609733Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:08.367652Z"},"links":{"cited_paper":"/paper/2406.11430","citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:b6bc5988b96940828940470e8116d00563b2dcc748d1ab712ac4f81faef37f16","observation_id":"dbc3a49e-e94f-44ed-96cd-72c9db4abe33","resolution":{"observed_at":"2026-08-07T12:39:08.367652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:14.313647Z","title":"Cam: Cache merging for memory-efficient llms inference,","venue":null,"work_id":"e6d41042-0f80-44a0-a742-391a2fb04641","year":2024},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-14T13:47:24.609733Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:08.545492Z"},"links":{"citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:08e20cba28d4f05a3b65fa3b40e53d2519c67f820168e8ae26d953972313b008","observation_id":"7771ceee-8c80-42c4-ab8e-5e1c995482d3","resolution":{"observed_at":"2026-08-07T12:39:14.395429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.06082","last_updated":"2024-02-08T22:17:40Z","snapshot_observed_at":"2026-08-15T04:48:44.897402Z","submitted_at":"2024-02-08T22:17:40Z","title":"SubGen: Token Generation in Sublinear Time and Memory","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.06082","snapshot_observed_at":"2026-08-07T12:39:08.668655Z","title":"Subgen: Token generation in sublinear time and memory,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-14T13:47:24.609733Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:08.668655Z"},"links":{"cited_paper":"/paper/2402.06082","citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:d6b11ceb3a73bebadc23249e38054eb3f6aed9cb0dab3348e0a3e414acdac6af","observation_id":"cc45d404-06d6-4b1f-b8bb-d6a0af867bdd","resolution":{"observed_at":"2026-08-07T12:39:08.668655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:14.080301Z","title":"Flashattention: Fast and memory-efficient exact attention with io-awareness,","venue":null,"work_id":"18232260-0ca2-4942-84e9-0d20f0904f09","year":2022},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-14T13:47:24.609733Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:08.838348Z"},"links":{"citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:efc4b7c10fc229da294ad60789c4bd0c96dfcf5183859515e1e2525042c503e3","observation_id":"7d3e88fc-7553-4943-bd0e-8208da72cbd5","resolution":{"observed_at":"2026-08-07T12:39:14.199089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08691","last_updated":"2023-07-17T17:50:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-17T17:50:36Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08691","snapshot_observed_at":"2026-08-07T12:39:08.999098Z","title":"Flashattention-2: Faster attention with better parallelism and work partitioning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-14T13:47:24.609733Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:08.999098Z"},"links":{"cited_paper":"/paper/2307.08691","citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:876c97be1883f817a9e5de9a16f882711a32f21ec666f18ae1295fd84046253d","observation_id":"cc81e05c-8df2-4ac4-9c0f-1c127d93a221","resolution":{"observed_at":"2026-08-07T12:39:08.999098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:13.880239Z","title":"Flashattention-3: Fast and accurate attention with asynchrony and low-precision,","venue":null,"work_id":"ec88b74b-e082-41d8-8836-62df04fca373","year":2024},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-14T13:47:24.609733Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:09.165987Z"},"links":{"citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:861ecb94c3ea7373127f2b8053ae7c710392d74ccbf341a7ced6e8c1c5b57a68","observation_id":"0a37b6a5-5f58-4758-9f2b-8da82c070851","resolution":{"observed_at":"2026-08-07T12:39:13.945945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10480","last_updated":"2025-01-14T05:00:34Z","snapshot_observed_at":"2026-08-13T00:05:26.465007Z","submitted_at":"2024-05-17T00:52:39Z","title":"Lean Attention: Hardware-Aware Scalable Attention Mechanism for the Decode-Phase of Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10480","snapshot_observed_at":"2026-08-07T12:39:09.239572Z","title":"Lean attention: Hardware-aware scalable attention mechanism for the decode-phase of transformers,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-14T13:47:24.609733Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:09.239572Z"},"links":{"cited_paper":"/paper/2405.10480","citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:3fdd735239d5ce32f101c8d0ebcfc4928d7e62e0c1bc449510c15a95b2b69daf","observation_id":"d15aa6d2-c9ba-4662-8b4f-9464d76ad745","resolution":{"observed_at":"2026-08-07T12:39:09.239572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:09.376740Z","title":"Sageattention2 technical report: Accurate 4 bit attention for plug-and-play inference acceleration,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-14T13:47:24.609733Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:09.376740Z"},"links":{"citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:cec5ef5ebf7b2c48135458dbb36a617c291edf2b6e2a5104e8efa8bcb47d7ede","observation_id":"b210d8f7-8e27-4561-b883-0e2d0f162c3c","resolution":{"observed_at":"2026-08-07T12:39:09.376740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:13.716477Z","title":"Sageattention: Accurate 8-bit attention for plug-and-play inference acceleration,","venue":null,"work_id":"9922390a-f7bc-4c35-9201-ec4f34b6af87","year":2025},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-14T13:47:24.609733Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:09.493235Z"},"links":{"citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:5c672cb19e4f14601efcb5eb8c20924cc08a7dbae9cbbe7b19cd6f9e3bfa73c5","observation_id":"fb3fe215-278a-4b2a-a516-3d74a2c82088","resolution":{"observed_at":"2026-08-07T12:39:13.794860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:13.486079Z","title":"Triton: an intermediate language and compiler for tiled neural network computations,","venue":null,"work_id":"f747ba6f-7a11-4c36-afe9-e35e0e43d490","year":2019},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-14T13:47:24.609733Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:09.618175Z"},"links":{"citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:21912dd09f0c62325a678f58ce012adb1690345ffc0f86996cf742934067c4f0","observation_id":"0a3992ac-f256-4aa1-87be-50971fe84b26","resolution":{"observed_at":"2026-08-07T12:39:13.573170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:13.162496Z","title":"Transformers: State-of-the-art natural language processing,","venue":null,"work_id":"8424353c-fc10-43ee-bb3a-bbef445c2dc3","year":2020},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-14T13:47:24.609733Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:09.724622Z"},"links":{"citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:c744a52a966b1f635420f4e740882d40047458866c2f63aed647235be6b7489e","observation_id":"b2475b7e-d19d-470d-bab2-1864008f8952","resolution":{"observed_at":"2026-08-07T12:39:13.287003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-08-12T10:50:46.357243Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-07T12:39:09.826529Z","title":"Megatron-lm: Training multi-billion parameter language models using model parallelism,","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-14T13:47:24.609733Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:09.826529Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:5a9213e5240c06977f0a92e1d65f0387d524cc112834a80b89b12ad8b3b2255d","observation_id":"b7f2c074-e5c4-4711-9955-6e96db117fca","resolution":{"observed_at":"2026-08-07T12:39:09.826529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03294","last_updated":"2024-03-31T21:11:08Z","snapshot_observed_at":"2026-08-13T05:57:06.403236Z","submitted_at":"2023-10-05T03:47:57Z","title":"DISTFLASHATTN: Distributed Memory-efficient Attention for Long-context LLMs Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03294","snapshot_observed_at":"2026-08-07T12:39:09.890077Z","title":"Distflashattn: Distributed memory-efficient attention for long-context llms training,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-14T13:47:24.609733Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:09.890077Z"},"links":{"cited_paper":"/paper/2310.03294","citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:1d86204629ac1da237987d992bf4a3e65be0f78b1956a98712f97974d40f3a83","observation_id":"b44475d5-4d5b-4b6a-aa3b-fe28cae2bbc4","resolution":{"observed_at":"2026-08-07T12:39:09.890077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:12.874287Z","title":"LongBench: A bilingual, multitask benchmark for long context understanding,","venue":null,"work_id":"4ca06036-71ff-4bc0-b295-695ac05b7ab2","year":2024},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-14T13:47:24.609733Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:09.973087Z"},"links":{"citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:c3c530b33b958f71f5ec624f1150b7fa2870ff32f6bbc714f737524c31e5fe34","observation_id":"3b2b6213-5e68-4e18-8bb8-1ed454617470","resolution":{"observed_at":"2026-08-07T12:39:12.976678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:12.545602Z","title":"∞bench: Extending long context evaluation beyond 100k tokens,","venue":null,"work_id":"81e9d330-b412-46cc-8579-5546633660f1","year":2024},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-14T13:47:24.609733Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:10.082023Z"},"links":{"citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:8e622bb934de14d6397c33cfaed57e5fcedcb67df29592c7eb344ca29a0f3c7d","observation_id":"01963edd-4a23-4919-b6cd-d2123191a12a","resolution":{"observed_at":"2026-08-07T12:39:12.732486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:12.345939Z","title":"Needle in a haystack - pressure testing llms,","venue":null,"work_id":"ce2819f5-b6cb-4049-834f-fddc8d2a476b","year":2023},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-14T13:47:24.609733Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:10.193536Z"},"links":{"citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:bc3cfa04eb848bca80ce65dcab41052bd7f38510c003a1dcd2ac39d4bbcfc2cd","observation_id":"a29cb238-8b36-448d-a202-e4a809b09dea","resolution":{"observed_at":"2026-08-07T12:39:12.426025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-14T13:47:24.609733Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling"},"reference_resolution":{"displayed":67,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":33,"verified_exact":1,"verified_fuzzy":33},"total_outbound_references":67},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 67 of 67 outbound references and 0 inbound Pith citation observations for arXiv:2505.24179."}