{"as_of":"2026-08-10T04:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:721e2f492f924a7decbca074b049293efca1a01392e83ded8abec4bd6f8d61c8","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T14:29:13.953052Z","state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T21:05:02.658992Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T01:17:31.567653Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.06766","last_updated":"2025-02-12T15:55:37Z","snapshot_observed_at":"2026-08-09T00:35:37.697981Z","submitted_at":"2025-02-10T18:47:04Z","title":"Exploiting Sparsity for Long Context Inference: Million Token Contexts on Commodity GPUs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06766","snapshot_observed_at":"2026-08-05T20:59:36.902216Z","title":"Exploiting sparsity for long context inference: Million token contexts on commodity gpus","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.09627","last_updated":"2025-08-13T08:59:04Z","snapshot_observed_at":"2026-08-06T15:53:16.127835Z","submitted_at":"2025-08-13T08:59:04Z","title":"Physics- and geometry-aware spatio-spectral graph neural operator for time-independent and time-dependent PDEs","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T20:59:36.902216Z"},"links":{"cited_paper":"/paper/2502.06766","citing_paper":"/paper/2508.09627"},"observation_digest":"sha256:977769609e94887c6b511250e6f0df4b5cd9a18c624e32b3004c183c1d131c06","observation_id":"0048375a-034c-445f-aa2a-f55b6ab1c697","resolution":{"observed_at":"2026-08-05T20:59:36.902216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06766","last_updated":"2025-02-12T15:55:37Z","snapshot_observed_at":"2026-08-09T00:35:37.697981Z","submitted_at":"2025-02-10T18:47:04Z","title":"Exploiting Sparsity for Long Context Inference: Million Token Contexts on Commodity GPUs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06766","snapshot_observed_at":"2026-08-05T21:05:02.658992Z","title":"Exploiting sparsity for long context inference: Million token contexts on commodity gpus","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.09628","last_updated":"2025-08-13T08:59:13Z","snapshot_observed_at":"2026-08-08T15:12:43.884415Z","submitted_at":"2025-08-13T08:59:13Z","title":"Attention's forward pass and Frank-Wolfe","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T21:05:02.658992Z"},"links":{"cited_paper":"/paper/2502.06766","citing_paper":"/paper/2508.09628"},"observation_digest":"sha256:277e6095b6ce83e5e213699ca3bb558f61bb41191c1fd61f6df78c8ed24590b3","observation_id":"57282a15-f411-456a-84a5-032af00dde3f","resolution":{"observed_at":"2026-08-05T21:05:02.658992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06766","last_updated":"2025-02-12T15:55:37Z","snapshot_observed_at":"2026-08-09T00:35:37.697981Z","submitted_at":"2025-02-10T18:47:04Z","title":"Exploiting Sparsity for Long Context Inference: Million Token Contexts on Commodity GPUs","version":2},"cited_work":{"arxiv_id":"2502.06766","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.06766","snapshot_observed_at":"2026-07-03T01:17:31.567653Z","title":"Exploiting sparsity for long context inference: Million token contexts on commodity gpus","venue":null,"work_id":"5e2b594e-14f5-4ef9-a35b-43aad8660db3","year":2025},"citing_paper":{"arxiv_id":"2606.09659","last_updated":"2026-06-08T15:43:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-08T15:43:16Z","title":"End-to-End Context Compression at Scale","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-06-27T16:36:54.699174Z"},"links":{"cited_paper":"/paper/2502.06766","citing_paper":"/paper/2606.09659"},"observation_digest":"sha256:3e7b3c13c1b3ec1b47fee4a64e93b8fda02adfb78d282f2b00c1112aa4298565","observation_id":"2e674d1c-95a9-407e-bb2b-6644d511d0b7","resolution":{"observed_at":"2026-07-03T01:17:31.569092Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06766","last_updated":"2025-02-12T15:55:37Z","snapshot_observed_at":"2026-08-09T00:35:37.697981Z","submitted_at":"2025-02-10T18:47:04Z","title":"Exploiting Sparsity for Long Context Inference: Million Token Contexts on Commodity GPUs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06766","snapshot_observed_at":"2026-08-02T07:07:39.861302Z","title":"Exploiting sparsity for long context inference: Million token contexts on commodity gpus.arXiv preprint arXiv:2502.06766,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11976","last_updated":"2026-07-26T04:17:22Z","snapshot_observed_at":"2026-08-09T00:36:09.452998Z","submitted_at":"2026-07-13T03:53:56Z","title":"LiteTopK: Exploiting the Curse of Dimensionality for a Fused Indexer-TopK Kernel in Long-Context Sparse Attention","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T07:07:39.861302Z"},"links":{"cited_paper":"/paper/2502.06766","citing_paper":"/paper/2607.11976"},"observation_digest":"sha256:bf3e596057d4b505d8d7c2cb19ae652858e6e11880a3349ac6925386c580e3ba","observation_id":"dff7b74b-a10c-4dba-bbb3-fdc41ad26aed","resolution":{"observed_at":"2026-08-02T07:07:39.861302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2502.06766/citation-record","integrity":"/paper/2502.06766/integrity","json":"/paper/2502.06766/citation-record.json","paper":"/paper/2502.06766"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:29:13.759814Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06766","last_updated":"2025-02-12T15:55:37Z","snapshot_observed_at":"2026-08-09T00:35:37.697981Z","submitted_at":"2025-02-10T18:47:04Z","title":"Exploiting Sparsity for Long Context Inference: Million Token Contexts on Commodity GPUs","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-08T14:29:13.759814Z"},"links":{"citing_paper":"/paper/2502.06766"},"observation_digest":"sha256:35b2eed7f860d7b8dff244367afb0dae7bb1def914014feaf88392ab4cb5a472","observation_id":"54993fde-173f-4101-b8d6-417b5c39b4b3","resolution":{"observed_at":"2026-08-08T14:29:13.759814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:29:13.765443Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06766","last_updated":"2025-02-12T15:55:37Z","snapshot_observed_at":"2026-08-09T00:35:37.697981Z","submitted_at":"2025-02-10T18:47:04Z","title":"Exploiting Sparsity for Long Context Inference: Million Token Contexts on Commodity GPUs","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-08T14:29:13.765443Z"},"links":{"citing_paper":"/paper/2502.06766"},"observation_digest":"sha256:f4d219bb0cf84ff6d21a6b68a8fa07750b927b250bfea96c5fc2cc8fcf5743ad","observation_id":"8550423d-459c-488f-9614-bd0382e27052","resolution":{"observed_at":"2026-08-08T14:29:13.765443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:29:13.769661Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06766","last_updated":"2025-02-12T15:55:37Z","snapshot_observed_at":"2026-08-09T00:35:37.697981Z","submitted_at":"2025-02-10T18:47:04Z","title":"Exploiting Sparsity for Long Context Inference: Million Token Contexts on Commodity GPUs","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-08T14:29:13.769661Z"},"links":{"citing_paper":"/paper/2502.06766"},"observation_digest":"sha256:35a1e8633e88c282978a5f208273a9dcb365afa8512cbd95223e016c38179046","observation_id":"db06c88a-287f-4fdd-9084-f482a061eccb","resolution":{"observed_at":"2026-08-08T14:29:13.769661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:29:13.773753Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06766","last_updated":"2025-02-12T15:55:37Z","snapshot_observed_at":"2026-08-09T00:35:37.697981Z","submitted_at":"2025-02-10T18:47:04Z","title":"Exploiting Sparsity for Long Context Inference: Million Token Contexts on Commodity GPUs","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-08T14:29:13.773753Z"},"links":{"citing_paper":"/paper/2502.06766"},"observation_digest":"sha256:a99358024236bd5da8fa7b918680dd9b659e6a87509e2374abebcf147c5c3713","observation_id":"c79d6a49-971f-43f5-b8a6-5b47984d16bc","resolution":{"observed_at":"2026-08-08T14:29:13.773753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01889","last_updated":"2023-11-27T06:38:47Z","snapshot_observed_at":"2026-08-07T09:22:20.831075Z","submitted_at":"2023-10-03T08:44:50Z","title":"Ring Attention with Blockwise Transformers for Near-Infinite Context","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01889","snapshot_observed_at":"2026-08-08T14:29:13.777883Z","title":"@E+M hzirI5Dsx VA<V K2 6<[ſn*ƽ,+fq S '&> -qtVȕ Ā hּk s_; 2| <t B2 ̉rInq)LP>EXNН[\\4 -n7v]P@ӧ) k ,q fH! ̂h<","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.06766","last_updated":"2025-02-12T15:55:37Z","snapshot_observed_at":"2026-08-09T00:35:37.697981Z","submitted_at":"2025-02-10T18:47:04Z","title":"Exploiting Sparsity for Long Context Inference: Million Token Contexts on Commodity GPUs","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-08T14:29:13.777883Z"},"links":{"cited_paper":"/paper/2310.01889","citing_paper":"/paper/2502.06766"},"observation_digest":"sha256:e15bb73d1117a0afb1749a328dfaa5e7e3b1d18788c24df32a160df9a076871e","observation_id":"551d0c8d-6e99-4471-8002-921546cf9a2f","resolution":{"observed_at":"2026-08-08T14:29:13.777883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:29:14.578808Z","title":"Llama 3.2: Revolutionizing edge ai and vision with open, customizable models","venue":null,"work_id":"eaec4988-6e66-4806-bf20-511a31fc1d4e","year":2024},"citing_paper":{"arxiv_id":"2502.06766","last_updated":"2025-02-12T15:55:37Z","snapshot_observed_at":"2026-08-09T00:35:37.697981Z","submitted_at":"2025-02-10T18:47:04Z","title":"Exploiting Sparsity for Long Context Inference: Million Token Contexts on Commodity GPUs","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-08T14:29:13.783553Z"},"links":{"citing_paper":"/paper/2502.06766"},"observation_digest":"sha256:c412b079ad104d4d99b78ce7bebd7e202560b0582f3a031226681957d28e429b","observation_id":"f18732d6-7d8b-4d2a-a471-c5580e0c1028","resolution":{"observed_at":"2026-08-08T14:29:14.583100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-08T14:29:13.791771Z","title":"E., and Cohan, A","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2502.06766","last_updated":"2025-02-12T15:55:37Z","snapshot_observed_at":"2026-08-09T00:35:37.697981Z","submitted_at":"2025-02-10T18:47:04Z","title":"Exploiting Sparsity for Long Context Inference: Million Token Contexts on Commodity GPUs","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-08T14:29:13.791771Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2502.06766"},"observation_digest":"sha256:8b0065d24cfb9921147eb57fb807da9e07d2e670e6eb3d8557002d9531ac1e23","observation_id":"3e11d60e-ac7b-4254-b1ab-738c649b4437","resolution":{"observed_at":"2026-08-08T14:29:13.791771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:29:13.795628Z","title":"L., Gao, J., and Choi, Y","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.06766","last_updated":"2025-02-12T15:55:37Z","snapshot_observed_at":"2026-08-09T00:35:37.697981Z","submitted_at":"2025-02-10T18:47:04Z","title":"Exploiting Sparsity for Long Context Inference: Million Token Contexts on Commodity GPUs","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-08T14:29:13.795628Z"},"links":{"citing_paper":"/paper/2502.06766"},"observation_digest":"sha256:f1e289e90e053a7dbd12736513de5e1e605cf508c305179e30fbf6182af125f0","observation_id":"902399f9-3fd8-4946-907c-36eaeabe1a28","resolution":{"observed_at":"2026-08-08T14:29:13.795628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16179","last_updated":"2024-12-18T17:36:36Z","snapshot_observed_at":"2026-07-06T19:37:11.636987Z","submitted_at":"2024-10-21T16:44:51Z","title":"MagicPIG: LSH Sampling for Efficient LLM Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16179","snapshot_observed_at":"2026-08-08T14:29:13.799090Z","title":"Magicpig: Lsh sampling for efficient llm generation, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06766","last_updated":"2025-02-12T15:55:37Z","snapshot_observed_at":"2026-08-09T00:35:37.697981Z","submitted_at":"2025-02-10T18:47:04Z","title":"Exploiting Sparsity for Long Context Inference: Million Token Contexts on Commodity GPUs","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-08T14:29:13.799090Z"},"links":{"cited_paper":"/paper/2410.16179","citing_paper":"/paper/2502.06766"},"observation_digest":"sha256:3c9a2f3d2a84d0f3bf70a5f2912510ddfe3efccc93b2b2c4f8badb75756137e6","observation_id":"7e6550d2-bf47-4809-b6c9-89a45ac5e230","resolution":{"observed_at":"2026-08-08T14:29:13.799090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.10509","last_updated":"2019-04-23T19:29:47Z","snapshot_observed_at":"2026-08-09T19:46:04.857927Z","submitted_at":"2019-04-23T19:29:47Z","title":"Generating Long Sequences with Sparse Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.10509","snapshot_observed_at":"2026-08-08T14:29:13.803285Z","title":"Generating long sequences with sparse transformers, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.06766","last_updated":"2025-02-12T15:55:37Z","snapshot_observed_at":"2026-08-09T00:35:37.697981Z","submitted_at":"2025-02-10T18:47:04Z","title":"Exploiting Sparsity for Long Context Inference: Million Token Contexts on Commodity GPUs","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-08T14:29:13.803285Z"},"links":{"cited_paper":"/paper/1904.10509","citing_paper":"/paper/2502.06766"},"observation_digest":"sha256:9213a420b4141163dcbd71a46fc0ba6ff641f2563c7d23a9212fe86b4ce68ff0","observation_id":"38ba009a-6396-495c-80c8-c86c0e8d7ed9","resolution":{"observed_at":"2026-08-08T14:29:13.803285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:29:13.807304Z","title":"Boolq: Exploring the surprising difficulty of natural yes/no questions","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.06766","last_updated":"2025-02-12T15:55:37Z","snapshot_observed_at":"2026-08-09T00:35:37.697981Z","submitted_at":"2025-02-10T18:47:04Z","title":"Exploiting Sparsity for Long Context Inference: Million Token Contexts on Commodity GPUs","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-08T14:29:13.807304Z"},"links":{"citing_paper":"/paper/2502.06766"},"observation_digest":"sha256:bcfa4592a28cf135c38ddc436515be9f56cd642209e642f60ef8c061d0ec1436","observation_id":"ab71d7a5-b318-4792-94e7-20df258069e6","resolution":{"observed_at":"2026-08-08T14:29:13.807304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-08T14:29:13.810775Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.06766","last_updated":"2025-02-12T15:55:37Z","snapshot_observed_at":"2026-08-09T00:35:37.697981Z","submitted_at":"2025-02-10T18:47:04Z","title":"Exploiting Sparsity for Long Context Inference: Million Token Contexts on Commodity GPUs","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-08T14:29:13.810775Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2502.06766"},"observation_digest":"sha256:661e0e977e07439aba8fdef79247aae4c795151fdc5612b846f172a40cf16b90","observation_id":"a2a321e2-9e13-4b17-98f3-d55fdd816210","resolution":{"observed_at":"2026-08-08T14:29:13.810775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:29:13.818243Z","title":"Flashattention-2: Faster attention with better parallelism and work partitioning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06766","last_updated":"2025-02-12T15:55:37Z","snapshot_observed_at":"2026-08-09T00:35:37.697981Z","submitted_at":"2025-02-10T18:47:04Z","title":"Exploiting Sparsity for Long Context Inference: Million Token Contexts on Commodity GPUs","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-08T14:29:13.818243Z"},"links":{"citing_paper":"/paper/2502.06766"},"observation_digest":"sha256:87cdfbfea7ad0640f850127e0564713686cb1ea5596dec67630aa9f58ef208be","observation_id":"6fdb94af-4f89-4625-ac00-ebf00adc9c61","resolution":{"observed_at":"2026-08-08T14:29:13.818243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.14135","last_updated":"2022-06-23T17:53:32Z","snapshot_observed_at":"2026-07-06T13:14:48.753329Z","submitted_at":"2022-05-27T17:53:09Z","title":"FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.14135","snapshot_observed_at":"2026-08-08T14:29:13.822810Z","title":"Y., Ermon, S., Rudra, A., and Ré, C","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.06766","last_updated":"2025-02-12T15:55:37Z","snapshot_observed_at":"2026-08-09T00:35:37.697981Z","submitted_at":"2025-02-10T18:47:04Z","title":"Exploiting Sparsity for Long Context Inference: Million Token Contexts on Commodity GPUs","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-08T14:29:13.822810Z"},"links":{"cited_paper":"/paper/2205.14135","citing_paper":"/paper/2502.06766"},"observation_digest":"sha256:c7d3841e9c7415c44d9d754f62a66b2e4e3fa9d5e404dfce0543963659528466","observation_id":"dddbe6d7-8fd2-495b-a4a2-848671133341","resolution":{"observed_at":"2026-08-08T14:29:13.822810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04475","last_updated":"2025-03-10T09:27:03Z","snapshot_observed_at":"2026-07-06T17:56:23.317089Z","submitted_at":"2024-04-06T02:29:02Z","title":"Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04475","snapshot_observed_at":"2026-08-08T14:29:13.831220Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06766","last_updated":"2025-02-12T15:55:37Z","snapshot_observed_at":"2026-08-09T00:35:37.697981Z","submitted_at":"2025-02-10T18:47:04Z","title":"Exploiting Sparsity for Long Context Inference: Million Token Contexts on Commodity GPUs","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-08T14:29:13.831220Z"},"links":{"cited_paper":"/paper/2404.04475","citing_paper":"/paper/2502.06766"},"observation_digest":"sha256:76703432f1526b4b416dca986502983c702042a0797830ef29b672b1c95a04ec","observation_id":"27a19358-5f05-4083-a7b4-fef243487a6f","resolution":{"observed_at":"2026-08-08T14:29:13.831220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:29:13.835668Z","title":"A framework for few-shot language model evaluation, 07 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06766","last_updated":"2025-02-12T15:55:37Z","snapshot_observed_at":"2026-08-09T00:35:37.697981Z","submitted_at":"2025-02-10T18:47:04Z","title":"Exploiting Sparsity for Long Context Inference: Million Token Contexts on Commodity GPUs","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-08T14:29:13.835668Z"},"links":{"citing_paper":"/paper/2502.06766"},"observation_digest":"sha256:d6b9cd239f138651e1358e63dc40c3280ccff8b69c180fb4652bd8854a66e3a6","observation_id":"256d080c-c0d0-4f3c-8638-177dff01874f","resolution":{"observed_at":"2026-08-08T14:29:13.835668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:29:14.545066Z","title":"Scaling rotational embeddings for long-context language models","venue":null,"work_id":"eabc71ab-af73-487f-abf4-f79cfdd977e8","year":2024},"citing_paper":{"arxiv_id":"2502.06766","last_updated":"2025-02-12T15:55:37Z","snapshot_observed_at":"2026-08-09T00:35:37.697981Z","submitted_at":"2025-02-10T18:47:04Z","title":"Exploiting Sparsity for Long Context Inference: Million Token Contexts on Commodity GPUs","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-08T14:29:13.839482Z"},"links":{"citing_paper":"/paper/2502.06766"},"observation_digest":"sha256:9fcb625fc2ecfafd8690ec38e6efaa78f50cb6633d678edb210fa82a47125164","observation_id":"daacac68-35aa-44e6-b389-3d9ed965d1d3","resolution":{"observed_at":"2026-08-08T14:29:14.549210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-08T14:29:13.843112Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06766","last_updated":"2025-02-12T15:55:37Z","snapshot_observed_at":"2026-08-09T00:35:37.697981Z","submitted_at":"2025-02-10T18:47:04Z","title":"Exploiting Sparsity for Long Context Inference: Million Token Contexts on Commodity GPUs","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-08T14:29:13.843112Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2502.06766"},"observation_digest":"sha256:731de26f9f3008a3d16252476ee0d5b0b4a1ca029c9990d1aa99a25f53a629d6","observation_id":"2a2af44a-adbf-479c-a628-5ca521e8099a","resolution":{"observed_at":"2026-08-08T14:29:13.843112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17887","last_updated":"2025-03-03T17:02:05Z","snapshot_observed_at":"2026-08-03T06:33:46.668360Z","submitted_at":"2024-03-26T17:20:04Z","title":"The Unreasonable Ineffectiveness of the Deeper Layers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17887","snapshot_observed_at":"2026-08-08T14:29:13.847195Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06766","last_updated":"2025-02-12T15:55:37Z","snapshot_observed_at":"2026-08-09T00:35:37.697981Z","submitted_at":"2025-02-10T18:47:04Z","title":"Exploiting Sparsity for Long Context Inference: Million Token Contexts on Commodity GPUs","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-08T14:29:13.847195Z"},"links":{"cited_paper":"/paper/2403.17887","citing_paper":"/paper/2502.06766"},"observation_digest":"sha256:b22860e591ab0522a9c331bfe48becf51020e5375ba9fb4d71c6b6d57d7d04b4","observation_id":"8278ec27-444a-4a53-b670-5bf17e096aa5","resolution":{"observed_at":"2026-08-08T14:29:13.847195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:29:13.851910Z","title":"Memory-efficient Transformers via Top-k Attention","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.06766","last_updated":"2025-02-12T15:55:37Z","snapshot_observed_at":"2026-08-09T00:35:37.697981Z","submitted_at":"2025-02-10T18:47:04Z","title":"Exploiting Sparsity for Long Context Inference: Million Token Contexts on Commodity GPUs","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-08T14:29:13.851910Z"},"links":{"citing_paper":"/paper/2502.06766"},"observation_digest":"sha256:4bef36990db1cf6110af50469fc496cf3394900343f21eb7abcf46052535199b","observation_id":"153b8895-84a1-400e-b7e2-27957bd983ef","resolution":{"observed_at":"2026-08-08T14:29:13.851910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:29:13.856191Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.06766","last_updated":"2025-02-12T15:55:37Z","snapshot_observed_at":"2026-08-09T00:35:37.697981Z","submitted_at":"2025-02-10T18:47:04Z","title":"Exploiting Sparsity for Long Context Inference: Million Token Contexts on Commodity GPUs","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-08T14:29:13.856191Z"},"links":{"citing_paper":"/paper/2502.06766"},"observation_digest":"sha256:632448307396753ef1115025df4a104ee04ffd9400dc6f79ac6ef24189388428","observation_id":"d5fd0138-942e-42e8-b4ef-46d3f10192e3","resolution":{"observed_at":"2026-08-08T14:29:13.856191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:29:14.526742Z","title":"RULER : What 's the Real Context Size of Your Long-Context Language Models ?, April 2024","venue":null,"work_id":"415f527c-b199-4013-88b0-e7e811e6dffa","year":2024},"citing_paper":{"arxiv_id":"2502.06766","last_updated":"2025-02-12T15:55:37Z","snapshot_observed_at":"2026-08-09T00:35:37.697981Z","submitted_at":"2025-02-10T18:47:04Z","title":"Exploiting Sparsity for Long Context Inference: Million Token Contexts on Commodity GPUs","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-08T14:29:13.860515Z"},"links":{"citing_paper":"/paper/2502.06766"},"observation_digest":"sha256:38e6ef82a9da066790f8ce98fa58b34acac9b0f0dddb2b13115f2fdee5c75309","observation_id":"c3a16dc3-69ec-4550-aa0f-3b0b603b306b","resolution":{"observed_at":"2026-08-08T14:29:14.530816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:29:14.514288Z","title":"Needle in a haystack - pressure testing llms","venue":null,"work_id":"509b5b07-2a0b-47e2-adf8-85340db067e5","year":2023},"citing_paper":{"arxiv_id":"2502.06766","last_updated":"2025-02-12T15:55:37Z","snapshot_observed_at":"2026-08-09T00:35:37.697981Z","submitted_at":"2025-02-10T18:47:04Z","title":"Exploiting Sparsity for Long Context Inference: Million Token Contexts on Commodity GPUs","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-08T14:29:13.863917Z"},"links":{"citing_paper":"/paper/2502.06766"},"observation_digest":"sha256:50f7559a14e003b372542224d3c61e0e44f0ef8eb21fbb5c22c17986065de9b5","observation_id":"397f8154-9083-4bad-bc71-f41efec1583b","resolution":{"observed_at":"2026-08-08T14:29:14.518574Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:29:13.868392Z","title":"B., Chandra, B., and Yejin, C","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.06766","last_updated":"2025-02-12T15:55:37Z","snapshot_observed_at":"2026-08-09T00:35:37.697981Z","submitted_at":"2025-02-10T18:47:04Z","title":"Exploiting Sparsity for Long Context Inference: Million Token Contexts on Commodity GPUs","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-08T14:29:13.868392Z"},"links":{"citing_paper":"/paper/2502.06766"},"observation_digest":"sha256:c053e10fa895381fa423944cb8d373be1d0e9ddfadeecb58b3979436b825d616","observation_id":"65abee94-256a-4d90-bd22-34aa31e4eb72","resolution":{"observed_at":"2026-08-08T14:29:13.868392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:29:13.872596Z","title":"H., Gonzalez, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06766","last_updated":"2025-02-12T15:55:37Z","snapshot_observed_at":"2026-08-09T00:35:37.697981Z","submitted_at":"2025-02-10T18:47:04Z","title":"Exploiting Sparsity for Long Context Inference: Million Token Contexts on Commodity GPUs","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-08T14:29:13.872596Z"},"links":{"citing_paper":"/paper/2502.06766"},"observation_digest":"sha256:bd600133d580d0286c80482dcc232ea428ff4be22398edbf64da006b8d3edf57","observation_id":"84d35603-d1f4-4140-8372-d63d0a8911d4","resolution":{"observed_at":"2026-08-08T14:29:13.872596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-08-07T09:13:28.333702Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10516","snapshot_observed_at":"2026-08-08T14:29:13.876668Z","title":"Retrievalattention: Accelerating long-context llm inference via vector retrieval, 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06766","last_updated":"2025-02-12T15:55:37Z","snapshot_observed_at":"2026-08-09T00:35:37.697981Z","submitted_at":"2025-02-10T18:47:04Z","title":"Exploiting Sparsity for Long Context Inference: Million Token Contexts on Commodity GPUs","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-08T14:29:13.876668Z"},"links":{"cited_paper":"/paper/2409.10516","citing_paper":"/paper/2502.06766"},"observation_digest":"sha256:9970b009c26177c2c4daad920ef50f42379aff5722ec302aabcc3a5bf0311957","observation_id":"1635e9b8-f15f-4503-8824-331e79b3e922","resolution":{"observed_at":"2026-08-08T14:29:13.876668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01889","last_updated":"2023-11-27T06:38:47Z","snapshot_observed_at":"2026-08-07T09:22:20.831075Z","submitted_at":"2023-10-03T08:44:50Z","title":"Ring Attention with Blockwise Transformers for Near-Infinite Context","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01889","snapshot_observed_at":"2026-08-08T14:29:13.880612Z","title":"Ring attention with blockwise transformers for near-infinite context, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06766","last_updated":"2025-02-12T15:55:37Z","snapshot_observed_at":"2026-08-09T00:35:37.697981Z","submitted_at":"2025-02-10T18:47:04Z","title":"Exploiting Sparsity for Long Context Inference: Million Token Contexts on Commodity GPUs","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-08T14:29:13.880612Z"},"links":{"cited_paper":"/paper/2310.01889","citing_paper":"/paper/2502.06766"},"observation_digest":"sha256:d77d36825caf8cf813e0048d6d551deb0ad1b79b844069842f8c7429fe536719","observation_id":"a1483b56-843d-44a4-9269-22ae9cfdd3f2","resolution":{"observed_at":"2026-08-08T14:29:13.880612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08268","last_updated":"2025-02-03T21:47:31Z","snapshot_observed_at":"2026-08-05T16:01:06.026395Z","submitted_at":"2024-02-13T07:47:36Z","title":"World Model on Million-Length Video And Language With Blockwise RingAttention","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08268","snapshot_observed_at":"2026-08-08T14:29:13.884896Z","title":"World model on million-length video and language with blockwise ringattention, 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06766","last_updated":"2025-02-12T15:55:37Z","snapshot_observed_at":"2026-08-09T00:35:37.697981Z","submitted_at":"2025-02-10T18:47:04Z","title":"Exploiting Sparsity for Long Context Inference: Million Token Contexts on Commodity GPUs","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-08T14:29:13.884896Z"},"links":{"cited_paper":"/paper/2402.08268","citing_paper":"/paper/2502.06766"},"observation_digest":"sha256:7f6d8d38c8b873facd7bc1fd1421ecd8fcb476a8429f2c94b4f23b78ca3276bb","observation_id":"2fa32ff4-c7aa-4fb6-8223-a64abfea562b","resolution":{"observed_at":"2026-08-08T14:29:13.884896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:29:13.888866Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.06766","last_updated":"2025-02-12T15:55:37Z","snapshot_observed_at":"2026-08-09T00:35:37.697981Z","submitted_at":"2025-02-10T18:47:04Z","title":"Exploiting Sparsity for Long Context Inference: Million Token Contexts on Commodity GPUs","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-08T14:29:13.888866Z"},"links":{"citing_paper":"/paper/2502.06766"},"observation_digest":"sha256:00fd1b6941fd0350000a2ffb1008c5e2fb245cce8241a05c699b648cf93520d6","observation_id":"d5b8732a-9843-4fb1-9c48-88de3aac92b3","resolution":{"observed_at":"2026-08-08T14:29:13.888866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:29:13.893490Z","title":"Can a suit of armor conduct electricity? a new dataset for open book question answering","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.06766","last_updated":"2025-02-12T15:55:37Z","snapshot_observed_at":"2026-08-09T00:35:37.697981Z","submitted_at":"2025-02-10T18:47:04Z","title":"Exploiting Sparsity for Long Context Inference: Million Token Contexts on Commodity GPUs","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-08T14:29:13.893490Z"},"links":{"citing_paper":"/paper/2502.06766"},"observation_digest":"sha256:6626730c4b3d82a700b84ae87882ee5ee055d348acc86fdfa12064413f662341","observation_id":"db090933-f005-432c-abaf-5fbe244166d9","resolution":{"observed_at":"2026-08-08T14:29:13.893490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:29:13.897639Z","title":"Efficiently scaling transformer inference","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06766","last_updated":"2025-02-12T15:55:37Z","snapshot_observed_at":"2026-08-09T00:35:37.697981Z","submitted_at":"2025-02-10T18:47:04Z","title":"Exploiting Sparsity for Long Context Inference: Million Token Contexts on Commodity GPUs","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-08T14:29:13.897639Z"},"links":{"citing_paper":"/paper/2502.06766"},"observation_digest":"sha256:bf6e13621acde3f35c5508670f466c1526439fb85228879343a7e55da47abaaa","observation_id":"44d212e6-333a-4f3b-9bc4-f5368a0d2780","resolution":{"observed_at":"2026-08-08T14:29:13.897639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.05250","last_updated":"2016-10-11T02:42:36Z","snapshot_observed_at":"2026-08-08T11:05:45.903773Z","submitted_at":"2016-06-16T16:36:00Z","title":"SQuAD: 100,000+ Questions for Machine Comprehension of Text","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.05250","snapshot_observed_at":"2026-08-08T14:29:13.902124Z","title":"Squad: 100,000+ questions for machine comprehension of text, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.06766","last_updated":"2025-02-12T15:55:37Z","snapshot_observed_at":"2026-08-09T00:35:37.697981Z","submitted_at":"2025-02-10T18:47:04Z","title":"Exploiting Sparsity for Long Context Inference: Million Token Contexts on Commodity GPUs","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-08T14:29:13.902124Z"},"links":{"cited_paper":"/paper/1606.05250","citing_paper":"/paper/2502.06766"},"observation_digest":"sha256:104228d1aab196365ac5a7f07a395c22db3556ced841caf655b1c5219989368e","observation_id":"47658574-3561-47a1-8750-9c044bf123e2","resolution":{"observed_at":"2026-08-08T14:29:13.902124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:29:14.475144Z","title":"Flexgen: high-throughput generative inference of large language models with a single gpu","venue":null,"work_id":"4f61d972-bf0e-4a5d-b042-3437d01ba1e4","year":2023},"citing_paper":{"arxiv_id":"2502.06766","last_updated":"2025-02-12T15:55:37Z","snapshot_observed_at":"2026-08-09T00:35:37.697981Z","submitted_at":"2025-02-10T18:47:04Z","title":"Exploiting Sparsity for Long Context Inference: Million Token Contexts on Commodity GPUs","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-08T14:29:13.906745Z"},"links":{"citing_paper":"/paper/2502.06766"},"observation_digest":"sha256:6fd5bc8a888712bc55917b9aa726c7ceb5afdb047a369bf16e497efc3743a0e7","observation_id":"e383ab97-b82b-4b0c-b505-222d5de198c5","resolution":{"observed_at":"2026-08-08T14:29:14.478749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02542","last_updated":"2024-11-07T18:58:50Z","snapshot_observed_at":"2026-08-09T13:29:29.418787Z","submitted_at":"2024-06-04T17:58:03Z","title":"Loki: Low-rank Keys for Efficient Sparse Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02542","snapshot_observed_at":"2026-08-08T14:29:13.910553Z","title":"Loki: Low-rank keys for efficient sparse attention, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06766","last_updated":"2025-02-12T15:55:37Z","snapshot_observed_at":"2026-08-09T00:35:37.697981Z","submitted_at":"2025-02-10T18:47:04Z","title":"Exploiting Sparsity for Long Context Inference: Million Token Contexts on Commodity GPUs","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-08T14:29:13.910553Z"},"links":{"cited_paper":"/paper/2406.02542","citing_paper":"/paper/2502.06766"},"observation_digest":"sha256:d3f4b3044548a595c805abb9787679c88836a56f304ad849c5a54d4a6d74b529","observation_id":"4930a632-4f1d-42cd-b2d2-53356ebee0ba","resolution":{"observed_at":"2026-08-08T14:29:13.910553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10774","last_updated":"2024-08-26T21:01:02Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-16T01:33:02Z","title":"Quest: Query-Aware Sparsity for Efficient Long-Context LLM Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10774","snapshot_observed_at":"2026-08-08T14:29:13.914777Z","title":"Quest: Query-aware sparsity for efficient long-context llm inference, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06766","last_updated":"2025-02-12T15:55:37Z","snapshot_observed_at":"2026-08-09T00:35:37.697981Z","submitted_at":"2025-02-10T18:47:04Z","title":"Exploiting Sparsity for Long Context Inference: Million Token Contexts on Commodity GPUs","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-08T14:29:13.914777Z"},"links":{"cited_paper":"/paper/2406.10774","citing_paper":"/paper/2502.06766"},"observation_digest":"sha256:f38d64ab844305cd20b65e401291b143bdb781c4754ee8a65511ca4b9d4f2440","observation_id":"1fae160c-2723-4657-929d-efd23f51e6a7","resolution":{"observed_at":"2026-08-08T14:29:13.914777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-08T14:29:13.919045Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06766","last_updated":"2025-02-12T15:55:37Z","snapshot_observed_at":"2026-08-09T00:35:37.697981Z","submitted_at":"2025-02-10T18:47:04Z","title":"Exploiting Sparsity for Long Context Inference: Million Token Contexts on Commodity GPUs","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-08T14:29:13.919045Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2502.06766"},"observation_digest":"sha256:d5cb40a4956b7f78adce96981ba6133f511617fd3d8c44f1f70adeb421cb4912","observation_id":"691e681e-023f-4a2c-b3e1-c08b26c8532d","resolution":{"observed_at":"2026-08-08T14:29:13.919045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-08T14:29:13.923421Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06766","last_updated":"2025-02-12T15:55:37Z","snapshot_observed_at":"2026-08-09T00:35:37.697981Z","submitted_at":"2025-02-10T18:47:04Z","title":"Exploiting Sparsity for Long Context Inference: Million Token Contexts on Commodity GPUs","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-08T14:29:13.923421Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2502.06766"},"observation_digest":"sha256:870570c0ee55a395f34a4ebbec65acd58ae177f3dd496cf1a35224ec9a9e34e4","observation_id":"d000197d-d80a-4e49-8620-e2a18b2a19cc","resolution":{"observed_at":"2026-08-08T14:29:13.923421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:29:13.927821Z","title":"Efficient streaming language models with attention sinks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06766","last_updated":"2025-02-12T15:55:37Z","snapshot_observed_at":"2026-08-09T00:35:37.697981Z","submitted_at":"2025-02-10T18:47:04Z","title":"Exploiting Sparsity for Long Context Inference: Million Token Contexts on Commodity GPUs","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-08T14:29:13.927821Z"},"links":{"citing_paper":"/paper/2502.06766"},"observation_digest":"sha256:7776ef48b5a39007917f355768a42acc5d7252915f35a2a86c9e51db5f29f078","observation_id":"b8f6d6e6-410f-4b73-bd07-0baf78eb830b","resolution":{"observed_at":"2026-08-08T14:29:13.927821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:29:14.455892Z","title":"Efficient streaming language models with attention sinks","venue":null,"work_id":"8a8f239a-d94c-488f-8313-d0a9828b03a7","year":2024},"citing_paper":{"arxiv_id":"2502.06766","last_updated":"2025-02-12T15:55:37Z","snapshot_observed_at":"2026-08-09T00:35:37.697981Z","submitted_at":"2025-02-10T18:47:04Z","title":"Exploiting Sparsity for Long Context Inference: Million Token Contexts on Commodity GPUs","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-08T14:29:13.932114Z"},"links":{"citing_paper":"/paper/2502.06766"},"observation_digest":"sha256:0242c791a8d29f354d63a216128686114f184ed1edbccc11218114f8b2ec5d14","observation_id":"acdc13a7-f186-4d14-8138-685e4382e4ec","resolution":{"observed_at":"2026-08-08T14:29:14.461596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1809.09600","last_updated":"2018-09-25T17:28:20Z","snapshot_observed_at":"2026-08-09T10:11:58.541007Z","submitted_at":"2018-09-25T17:28:20Z","title":"HotpotQA: A Dataset for Diverse, Explainable Multi-hop Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.09600","snapshot_observed_at":"2026-08-08T14:29:13.935794Z","title":"W., Salakhutdinov, R., and Manning, C","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.06766","last_updated":"2025-02-12T15:55:37Z","snapshot_observed_at":"2026-08-09T00:35:37.697981Z","submitted_at":"2025-02-10T18:47:04Z","title":"Exploiting Sparsity for Long Context Inference: Million Token Contexts on Commodity GPUs","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-08T14:29:13.935794Z"},"links":{"cited_paper":"/paper/1809.09600","citing_paper":"/paper/2502.06766"},"observation_digest":"sha256:3ca6538a5a58e6f577d6f02814cfd1d2fdf3ddbb3f26a7441e7aa3b516c16f2b","observation_id":"8b5e6642-90a0-4b57-baf0-35762383ff09","resolution":{"observed_at":"2026-08-08T14:29:13.935794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:29:13.940205Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.06766","last_updated":"2025-02-12T15:55:37Z","snapshot_observed_at":"2026-08-09T00:35:37.697981Z","submitted_at":"2025-02-10T18:47:04Z","title":"Exploiting Sparsity for Long Context Inference: Million Token Contexts on Commodity GPUs","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-08T14:29:13.940205Z"},"links":{"citing_paper":"/paper/2502.06766"},"observation_digest":"sha256:5a765fed32d09c103b0e8901704a1a50fa419fea833f77345615ae253fa07705","observation_id":"c66cce35-626a-4433-b689-b2d630ad696b","resolution":{"observed_at":"2026-08-08T14:29:13.940205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12820","last_updated":"2025-03-30T08:13:50Z","snapshot_observed_at":"2026-07-06T18:48:00.070861Z","submitted_at":"2024-07-01T13:05:42Z","title":"PQCache: Product Quantization-based KVCache for Long Context LLM Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12820","snapshot_observed_at":"2026-08-08T14:29:13.944332Z","title":"Pqcache: Product quantization-based kvcache for long context llm inference, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06766","last_updated":"2025-02-12T15:55:37Z","snapshot_observed_at":"2026-08-09T00:35:37.697981Z","submitted_at":"2025-02-10T18:47:04Z","title":"Exploiting Sparsity for Long Context Inference: Million Token Contexts on Commodity GPUs","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-08T14:29:13.944332Z"},"links":{"cited_paper":"/paper/2407.12820","citing_paper":"/paper/2502.06766"},"observation_digest":"sha256:f9099628be7a2b9c610875d6bb9b7b75f99ac13f89171856e6948854ffe6f6bc","observation_id":"a0e7f2bf-fb87-479a-8ca3-3ca35c60e3a2","resolution":{"observed_at":"2026-08-08T14:29:13.944332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-08-06T19:19:02.165567Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14048","snapshot_observed_at":"2026-08-08T14:29:13.948667Z","title":"H _2 o: Heavy-hitter oracle for efficient generative inference of large language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06766","last_updated":"2025-02-12T15:55:37Z","snapshot_observed_at":"2026-08-09T00:35:37.697981Z","submitted_at":"2025-02-10T18:47:04Z","title":"Exploiting Sparsity for Long Context Inference: Million Token Contexts on Commodity GPUs","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-08T14:29:13.948667Z"},"links":{"cited_paper":"/paper/2306.14048","citing_paper":"/paper/2502.06766"},"observation_digest":"sha256:bfbeb78e6d03fb0ffcde9300299d35b62c0b6c978dad6b6a0a55d27a0d208e73","observation_id":"78d04669-c49c-493f-94d2-50c292f429da","resolution":{"observed_at":"2026-08-08T14:29:13.948667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:29:13.953052Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06766","last_updated":"2025-02-12T15:55:37Z","snapshot_observed_at":"2026-08-09T00:35:37.697981Z","submitted_at":"2025-02-10T18:47:04Z","title":"Exploiting Sparsity for Long Context Inference: Million Token Contexts on Commodity GPUs","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-08T14:29:13.953052Z"},"links":{"citing_paper":"/paper/2502.06766"},"observation_digest":"sha256:b83d88b856587c2882b6a3976bc8357a11a287fe427fa0d6acdcc0e93c1c6bfb","observation_id":"8e949884-6027-4bbc-bfea-653ac3a2ae1a","resolution":{"observed_at":"2026-08-08T14:29:13.953052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.06766","last_updated":"2025-02-12T15:55:37Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T00:35:37.697981Z","submitted_at":"2025-02-10T18:47:04Z","title":"Exploiting Sparsity for Long Context Inference: Million Token Contexts on Commodity GPUs"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":38,"verified_exact":0,"verified_fuzzy":6},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 4 inbound Pith citation observations for arXiv:2502.06766."}