{"as_of":"2026-08-08T22:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:585f037cf63fad1f92edc443e28216fa74be6ef4e8a6fb1c9bfa35b0a84a2f73","coverage":[{"denominator":33,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":33,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T23:19:37.955444Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T14:00:43.304573Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-20T05:53:04.753054Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.08910","last_updated":"2025-02-13T02:52:01Z","snapshot_observed_at":"2026-08-07T23:12:54.397262Z","submitted_at":"2025-02-13T02:52:01Z","title":"InfiniteHiP: Extending Language Model Context Up to 3 Million Tokens on a Single GPU","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.08910","snapshot_observed_at":"2026-08-06T14:00:43.304573Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.20030","last_updated":"2025-07-26T18:20:25Z","snapshot_observed_at":"2026-08-06T14:00:29.609119Z","submitted_at":"2025-07-26T18:20:25Z","title":"FAEDKV: Infinite-Window Fourier Transform for Unbiased KV Cache Compression","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T14:00:43.304573Z"},"links":{"cited_paper":"/paper/2502.08910","citing_paper":"/paper/2507.20030"},"observation_digest":"sha256:4b2100a5fdee1e3f73bfed07dc1ec117c395e8cf01de6988f3c97efc6e81e911","observation_id":"ce79bcc8-386d-4afd-af53-3b4a5f0ec7d0","resolution":{"observed_at":"2026-08-06T14:00:43.304573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08910","last_updated":"2025-02-13T02:52:01Z","snapshot_observed_at":"2026-08-07T23:12:54.397262Z","submitted_at":"2025-02-13T02:52:01Z","title":"InfiniteHiP: Extending Language Model Context Up to 3 Million Tokens on a Single GPU","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.08910","snapshot_observed_at":"2026-08-03T23:33:57.667935Z","title":"Infinitehip: Extending language model context up to 3 million tokens on a single gpu, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.05313","last_updated":"2026-07-13T06:02:36Z","snapshot_observed_at":"2026-08-07T04:09:13.749315Z","submitted_at":"2025-11-07T15:13:28Z","title":"Controllably Efficient Language Models","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-03T23:33:57.667935Z"},"links":{"cited_paper":"/paper/2502.08910","citing_paper":"/paper/2511.05313"},"observation_digest":"sha256:ffe1eb970380112be98c3545e0fef803946fb424ec44a6cdda17f443051f9a78","observation_id":"be78e69b-d60a-44a1-b951-354d1b35ac41","resolution":{"observed_at":"2026-08-03T23:33:57.667935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08910","last_updated":"2025-02-13T02:52:01Z","snapshot_observed_at":"2026-08-07T23:12:54.397262Z","submitted_at":"2025-02-13T02:52:01Z","title":"InfiniteHiP: Extending Language Model Context Up to 3 Million Tokens on a Single GPU","version":1},"cited_work":{"arxiv_id":"2502.08910","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.08910","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Infinitehip: Extending language model context up to 3 million tokens on a single gpu, 2025.URL https://arxiv","venue":null,"work_id":"c15395bc-f615-4235-91f0-945c6997b550","year":2025},"citing_paper":{"arxiv_id":"2605.19932","last_updated":"2026-05-19T14:51:32Z","snapshot_observed_at":"2026-08-01T11:55:24.196821Z","submitted_at":"2026-05-19T14:51:32Z","title":"PEEK: Context Map as an Orientation Cache for Long-Context LLM Agents","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-20T05:50:14.266278Z"},"links":{"cited_paper":"/paper/2502.08910","citing_paper":"/paper/2605.19932"},"observation_digest":"sha256:04045c5a8da0a68d8b0ca1f7cfc9023f27d2da34e2af7e7b854c6f574b004cc9","observation_id":"3836c4a1-58cd-44df-a149-fa7a038473eb","resolution":{"observed_at":"2026-05-20T05:53:04.754570Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.08910/citation-record","integrity":"/paper/2502.08910/integrity","json":"/paper/2502.08910/citation-record.json","paper":"/paper/2502.08910"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:19:37.781866Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08910","last_updated":"2025-02-13T02:52:01Z","snapshot_observed_at":"2026-08-07T23:12:54.397262Z","submitted_at":"2025-02-13T02:52:01Z","title":"InfiniteHiP: Extending Language Model Context Up to 3 Million Tokens on a Single GPU","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T23:19:37.781866Z"},"links":{"citing_paper":"/paper/2502.08910"},"observation_digest":"sha256:5778d967298ee5bb0b2287fd9cbf2657a3a9506067583229dbbe0574e121efc6","observation_id":"5da89157-b546-42a5-9486-966ef03a9ef9","resolution":{"observed_at":"2026-08-07T23:19:37.781866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.14508","last_updated":"2024-06-19T04:00:32Z","snapshot_observed_at":"2026-08-08T03:49:18.086396Z","submitted_at":"2023-08-28T11:53:40Z","title":"LongBench: A Bilingual, Multitask Benchmark for Long Context Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.14508","snapshot_observed_at":"2026-08-07T23:19:37.788191Z","title":"Longbench: A bilingual, multitask benchmark for long context understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08910","last_updated":"2025-02-13T02:52:01Z","snapshot_observed_at":"2026-08-07T23:12:54.397262Z","submitted_at":"2025-02-13T02:52:01Z","title":"InfiniteHiP: Extending Language Model Context Up to 3 Million Tokens on a Single GPU","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T23:19:37.788191Z"},"links":{"cited_paper":"/paper/2308.14508","citing_paper":"/paper/2502.08910"},"observation_digest":"sha256:f5ae1c0e4c9cf9d639b9302b4a40ef214ce03ec1cae621ca570cbf2c516f3edc","observation_id":"66c36de9-0f72-4e09-95b3-1422237f243f","resolution":{"observed_at":"2026-08-07T23:19:37.788191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:19:39.092561Z","title":"NTK - Aware Scaled RoPE allows LLaMA models to have extended (8k+) context size without any fine-tuning and minimal perplexity degradation., June 2023","venue":null,"work_id":"77d8db0e-49e5-4345-a211-6900f76103e2","year":2023},"citing_paper":{"arxiv_id":"2502.08910","last_updated":"2025-02-13T02:52:01Z","snapshot_observed_at":"2026-08-07T23:12:54.397262Z","submitted_at":"2025-02-13T02:52:01Z","title":"InfiniteHiP: Extending Language Model Context Up to 3 Million Tokens on a Single GPU","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T23:19:37.794159Z"},"links":{"citing_paper":"/paper/2502.08910"},"observation_digest":"sha256:1659710ec69e735d888cbc7cee44f9b1d3aa80f81d58181d103663d5ed07cd53","observation_id":"1376c85a-8125-4214-8b04-6808982abe62","resolution":{"observed_at":"2026-08-07T23:19:39.112315Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.14135","last_updated":"2022-06-23T17:53:32Z","snapshot_observed_at":"2026-07-06T13:14:48.753329Z","submitted_at":"2022-05-27T17:53:09Z","title":"FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.14135","snapshot_observed_at":"2026-08-07T23:19:37.800257Z","title":"Y., Ermon, S., Rudra, A., and Ré, C","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.08910","last_updated":"2025-02-13T02:52:01Z","snapshot_observed_at":"2026-08-07T23:12:54.397262Z","submitted_at":"2025-02-13T02:52:01Z","title":"InfiniteHiP: Extending Language Model Context Up to 3 Million Tokens on a Single GPU","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T23:19:37.800257Z"},"links":{"cited_paper":"/paper/2205.14135","citing_paper":"/paper/2502.08910"},"observation_digest":"sha256:77d5ebb62372b7537b73494823c6fe3854e850398d5f7a703c953468c6a055d9","observation_id":"1bb8716c-3377-4043-beac-34b16c36cf78","resolution":{"observed_at":"2026-08-07T23:19:37.800257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:19:39.040326Z","title":"Flash-decoding for long-context inference, 2023","venue":null,"work_id":"7a2225fe-235d-4e81-ad1d-af0e9d9fcb72","year":2023},"citing_paper":{"arxiv_id":"2502.08910","last_updated":"2025-02-13T02:52:01Z","snapshot_observed_at":"2026-08-07T23:12:54.397262Z","submitted_at":"2025-02-13T02:52:01Z","title":"InfiniteHiP: Extending Language Model Context Up to 3 Million Tokens on a Single GPU","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T23:19:37.805815Z"},"links":{"citing_paper":"/paper/2502.08910"},"observation_digest":"sha256:5fabf608778742d0b004488cb3bcabc98372dfd79650360096b5bdb82322581a","observation_id":"26a7e9fd-9fcf-4035-8590-4d2117e44b35","resolution":{"observed_at":"2026-08-07T23:19:39.063296Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-07T23:19:37.811005Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08910","last_updated":"2025-02-13T02:52:01Z","snapshot_observed_at":"2026-08-07T23:12:54.397262Z","submitted_at":"2025-02-13T02:52:01Z","title":"InfiniteHiP: Extending Language Model Context Up to 3 Million Tokens on a Single GPU","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T23:19:37.811005Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2502.08910"},"observation_digest":"sha256:d3ed5e1395e95119314a90b95aa6844f4b02a10badcb61001b1ee50bd3685830","observation_id":"3545b50a-5b7b-4782-8228-be7689c494c1","resolution":{"observed_at":"2026-08-07T23:19:37.811005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T23:19:37.816306Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.08910","last_updated":"2025-02-13T02:52:01Z","snapshot_observed_at":"2026-08-07T23:12:54.397262Z","submitted_at":"2025-02-13T02:52:01Z","title":"InfiniteHiP: Extending Language Model Context Up to 3 Million Tokens on a Single GPU","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T23:19:37.816306Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2502.08910"},"observation_digest":"sha256:d5e6438f7c501421c3a3e27b6851a6679e70728d47c4aacd9452cf67f6652d40","observation_id":"56f4ec7d-d063-45b8-b78d-a5cdf8372526","resolution":{"observed_at":"2026-08-07T23:19:37.816306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14057","last_updated":"2024-07-19T06:34:45Z","snapshot_observed_at":"2026-07-06T18:48:49.546589Z","submitted_at":"2024-07-19T06:34:45Z","title":"LazyLLM: Dynamic Token Pruning for Efficient Long Context LLM Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14057","snapshot_observed_at":"2026-08-07T23:19:37.822448Z","title":"Lazyllm: Dynamic token pruning for efficient long context llm inference, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08910","last_updated":"2025-02-13T02:52:01Z","snapshot_observed_at":"2026-08-07T23:12:54.397262Z","submitted_at":"2025-02-13T02:52:01Z","title":"InfiniteHiP: Extending Language Model Context Up to 3 Million Tokens on a Single GPU","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T23:19:37.822448Z"},"links":{"cited_paper":"/paper/2407.14057","citing_paper":"/paper/2502.08910"},"observation_digest":"sha256:07f48553438f95a72cada45c74e767212a96ecd5c1a8cc5e808dfc2a3e7e61b6","observation_id":"f1e4bc0d-81d0-4354-bc7d-ea55a0ebc2c7","resolution":{"observed_at":"2026-08-07T23:19:37.822448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-02T16:20:09.773989Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-08-07T23:19:37.827717Z","title":"Gemma 2: Improving Open Language Models at a Practical Size , October 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08910","last_updated":"2025-02-13T02:52:01Z","snapshot_observed_at":"2026-08-07T23:12:54.397262Z","submitted_at":"2025-02-13T02:52:01Z","title":"InfiniteHiP: Extending Language Model Context Up to 3 Million Tokens on a Single GPU","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T23:19:37.827717Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2502.08910"},"observation_digest":"sha256:fd612264f216f0c0533c821836696358556dbb8f29b1fc9dd8077bf1bbaf9da4","observation_id":"cf36afdf-078a-4509-a810-d3dd43910de1","resolution":{"observed_at":"2026-08-07T23:19:37.827717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16137","last_updated":"2024-06-24T21:22:00Z","snapshot_observed_at":"2026-08-07T16:57:45.872655Z","submitted_at":"2023-08-30T16:47:51Z","title":"LM-Infinite: Zero-Shot Extreme Length Generalization for Large Language Models","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16137","snapshot_observed_at":"2026-08-07T23:19:37.832723Z","title":"LM - Infinite : Zero - Shot Extreme Length Generalization for Large Language Models , June 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08910","last_updated":"2025-02-13T02:52:01Z","snapshot_observed_at":"2026-08-07T23:12:54.397262Z","submitted_at":"2025-02-13T02:52:01Z","title":"InfiniteHiP: Extending Language Model Context Up to 3 Million Tokens on a Single GPU","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T23:19:37.832723Z"},"links":{"cited_paper":"/paper/2308.16137","citing_paper":"/paper/2502.08910"},"observation_digest":"sha256:a266473ae832d4729e81e7df746b0745c34dac3a625c8eb0b5014e982344bb2c","observation_id":"42f8bdbd-f073-407f-b83e-93d7f6cc8a34","resolution":{"observed_at":"2026-08-07T23:19:37.832723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-05T09:48:25.127042Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-07T23:19:37.838100Z","title":"W., Shao, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08910","last_updated":"2025-02-13T02:52:01Z","snapshot_observed_at":"2026-08-07T23:12:54.397262Z","submitted_at":"2025-02-13T02:52:01Z","title":"InfiniteHiP: Extending Language Model Context Up to 3 Million Tokens on a Single GPU","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T23:19:37.838100Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2502.08910"},"observation_digest":"sha256:5386f596bb7c44714009f1b980d91721f41d998d53f597b34ed4522b8dd6dc08","observation_id":"238d4a53-ec19-4a44-95f3-f91b2843baa0","resolution":{"observed_at":"2026-08-07T23:19:37.838100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-07T23:19:37.843510Z","title":"Q., Sablayrolles, A., Mensch, A., Bamford, C., Chaplot, D","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08910","last_updated":"2025-02-13T02:52:01Z","snapshot_observed_at":"2026-08-07T23:12:54.397262Z","submitted_at":"2025-02-13T02:52:01Z","title":"InfiniteHiP: Extending Language Model Context Up to 3 Million Tokens on a Single GPU","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T23:19:37.843510Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2502.08910"},"observation_digest":"sha256:e10e9ffa136416e7fed9a0f2621cad4630465bcb21be7f01244dfc9eff4462bb","observation_id":"1c5451d0-0d44-40d1-9102-6d299b70deb3","resolution":{"observed_at":"2026-08-07T23:19:37.843510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02490","last_updated":"2024-10-30T14:53:22Z","snapshot_observed_at":"2026-08-07T20:59:29.819833Z","submitted_at":"2024-07-02T17:59:56Z","title":"MInference 1.0: Accelerating Pre-filling for Long-Context LLMs via Dynamic Sparse Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02490","snapshot_observed_at":"2026-08-07T23:19:37.848294Z","title":"H., Li, D., Lin, C.-Y., Yang, Y., and Qiu, L","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08910","last_updated":"2025-02-13T02:52:01Z","snapshot_observed_at":"2026-08-07T23:12:54.397262Z","submitted_at":"2025-02-13T02:52:01Z","title":"InfiniteHiP: Extending Language Model Context Up to 3 Million Tokens on a Single GPU","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T23:19:37.848294Z"},"links":{"cited_paper":"/paper/2407.02490","citing_paper":"/paper/2502.08910"},"observation_digest":"sha256:c2cbddf547eb239de6ee5e0c7c0654b6ca719c1e4f3f398ee7a7d68678395cd5","observation_id":"6ed5391c-3d37-4a5c-be11-bce0d9996892","resolution":{"observed_at":"2026-08-07T23:19:37.848294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01325","last_updated":"2024-07-11T06:11:46Z","snapshot_observed_at":"2026-08-03T00:46:19.287073Z","submitted_at":"2024-01-02T18:30:51Z","title":"LLM Maybe LongLM: Self-Extend LLM Context Window Without Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01325","snapshot_observed_at":"2026-08-07T23:19:37.854054Z","title":"LLM Maybe LongLM : Self - Extend LLM Context Window Without Tuning , July 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08910","last_updated":"2025-02-13T02:52:01Z","snapshot_observed_at":"2026-08-07T23:12:54.397262Z","submitted_at":"2025-02-13T02:52:01Z","title":"InfiniteHiP: Extending Language Model Context Up to 3 Million Tokens on a Single GPU","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T23:19:37.854054Z"},"links":{"cited_paper":"/paper/2401.01325","citing_paper":"/paper/2502.08910"},"observation_digest":"sha256:85f0abef958c9888b11f22b3ee5284265919b79885371d7280b955c9afe3c325","observation_id":"5e5821af-de8f-4a27-ba7b-f7971d4cedff","resolution":{"observed_at":"2026-08-07T23:19:37.854054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-07T23:19:37.859198Z","title":"H., Gonzalez, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08910","last_updated":"2025-02-13T02:52:01Z","snapshot_observed_at":"2026-08-07T23:12:54.397262Z","submitted_at":"2025-02-13T02:52:01Z","title":"InfiniteHiP: Extending Language Model Context Up to 3 Million Tokens on a Single GPU","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T23:19:37.859198Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2502.08910"},"observation_digest":"sha256:4064592372722582ae331f245027e60f295f4608532a2e9926f661737b10656c","observation_id":"9d3eec75-e510-4ba7-8f31-ff15cca3b029","resolution":{"observed_at":"2026-08-07T23:19:37.859198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:19:38.946971Z","title":null,"venue":null,"work_id":"f6506595-c07d-482e-ad13-bc62fabda461","year":2023},"citing_paper":{"arxiv_id":"2502.08910","last_updated":"2025-02-13T02:52:01Z","snapshot_observed_at":"2026-08-07T23:12:54.397262Z","submitted_at":"2025-02-13T02:52:01Z","title":"InfiniteHiP: Extending Language Model Context Up to 3 Million Tokens on a Single GPU","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T23:19:37.864013Z"},"links":{"citing_paper":"/paper/2502.08910"},"observation_digest":"sha256:056f04c20e0a943c441c5f8b2a7f3cd14e3433794c44ec4c9844b119c13f714d","observation_id":"6d086886-eac4-406b-a35b-8fc72910edbb","resolution":{"observed_at":"2026-08-07T23:19:38.997502Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:19:38.855019Z","title":null,"venue":null,"work_id":"94e4f3dd-24bf-435a-9593-53b691c757a0","year":2024},"citing_paper":{"arxiv_id":"2502.08910","last_updated":"2025-02-13T02:52:01Z","snapshot_observed_at":"2026-08-07T23:12:54.397262Z","submitted_at":"2025-02-13T02:52:01Z","title":"InfiniteHiP: Extending Language Model Context Up to 3 Million Tokens on a Single GPU","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T23:19:37.872254Z"},"links":{"citing_paper":"/paper/2502.08910"},"observation_digest":"sha256:55be9758eb81305ad30b448e1b764529dee0800fd3c5a626e07a24ad9a7990de","observation_id":"383c3a34-8b05-4958-ac3b-0fea11b3874e","resolution":{"observed_at":"2026-08-07T23:19:38.894823Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09827","last_updated":"2025-01-23T07:25:28Z","snapshot_observed_at":"2026-08-06T20:10:53.073960Z","submitted_at":"2024-06-14T08:32:45Z","title":"A Training-free Sub-quadratic Cost Transformer Model Serving Framework With Hierarchically Pruned Attention","version":3},"cited_work":{"arxiv_id":"2406.09827","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.09827","snapshot_observed_at":"2026-08-07T23:19:38.619168Z","title":"A Training-free Sub-quadratic Cost Transformer Model Serving Framework With Hierarchically Pruned Attention","venue":"cs.CL","work_id":"c269fee4-409f-4ed3-9352-6efa1712da13","year":2024},"citing_paper":{"arxiv_id":"2502.08910","last_updated":"2025-02-13T02:52:01Z","snapshot_observed_at":"2026-08-07T23:12:54.397262Z","submitted_at":"2025-02-13T02:52:01Z","title":"InfiniteHiP: Extending Language Model Context Up to 3 Million Tokens on a Single GPU","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T23:19:37.877479Z"},"links":{"cited_paper":"/paper/2406.09827","citing_paper":"/paper/2502.08910"},"observation_digest":"sha256:da0a134d08aa8572d396b31b7d6e394461ac0c9c3fab8462243da066a6c8a665","observation_id":"1abf58e2-42c7-4a8f-906b-62e7cc0517d9","resolution":{"observed_at":"2026-08-07T23:19:38.625454Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:19:37.883272Z","title":"EXAONE 3.0 7","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08910","last_updated":"2025-02-13T02:52:01Z","snapshot_observed_at":"2026-08-07T23:12:54.397262Z","submitted_at":"2025-02-13T02:52:01Z","title":"InfiniteHiP: Extending Language Model Context Up to 3 Million Tokens on a Single GPU","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T23:19:37.883272Z"},"links":{"citing_paper":"/paper/2502.08910"},"observation_digest":"sha256:de29c40dc9aa15e17dc89b5d4c5a5290dd36f31d81f5e74d7e988b56302cba94","observation_id":"407523f4-dad4-40ea-be25-5fa859bf4d05","resolution":{"observed_at":"2026-08-07T23:19:37.883272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:19:37.888459Z","title":"EXAONE 3.5: Series of Large Language Models for Real -world Use Cases , December 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08910","last_updated":"2025-02-13T02:52:01Z","snapshot_observed_at":"2026-08-07T23:12:54.397262Z","submitted_at":"2025-02-13T02:52:01Z","title":"InfiniteHiP: Extending Language Model Context Up to 3 Million Tokens on a Single GPU","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T23:19:37.888459Z"},"links":{"citing_paper":"/paper/2502.08910"},"observation_digest":"sha256:4d39b6d7a5771b4dfe91dbd662260b078266f84dcfa27032f302bcfba5a7eca8","observation_id":"57decbb3-1e36-47ba-9f02-3d67d5c653fa","resolution":{"observed_at":"2026-08-07T23:19:37.888459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14469","last_updated":"2024-06-17T03:01:58Z","snapshot_observed_at":"2026-08-07T22:57:56.263839Z","submitted_at":"2024-04-22T17:42:58Z","title":"SnapKV: LLM Knows What You are Looking for Before Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14469","snapshot_observed_at":"2026-08-07T23:19:37.892901Z","title":"Snapkv: Llm knows what you are looking for before generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08910","last_updated":"2025-02-13T02:52:01Z","snapshot_observed_at":"2026-08-07T23:12:54.397262Z","submitted_at":"2025-02-13T02:52:01Z","title":"InfiniteHiP: Extending Language Model Context Up to 3 Million Tokens on a Single GPU","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T23:19:37.892901Z"},"links":{"cited_paper":"/paper/2404.14469","citing_paper":"/paper/2502.08910"},"observation_digest":"sha256:55625d4c14d97a4e7324c92da4eadeb01313bfcb16386cad7eedf4853dc4c3b2","observation_id":"c6b7e9af-e392-4be5-b046-466c5b80d87f","resolution":{"observed_at":"2026-08-07T23:19:37.892901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T23:19:37.897728Z","title":"The Llama 3 Herd of Models , November 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08910","last_updated":"2025-02-13T02:52:01Z","snapshot_observed_at":"2026-08-07T23:12:54.397262Z","submitted_at":"2025-02-13T02:52:01Z","title":"InfiniteHiP: Extending Language Model Context Up to 3 Million Tokens on a Single GPU","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T23:19:37.897728Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2502.08910"},"observation_digest":"sha256:1e1c8e7e4b559394e9b90af838596f0927eab38aede73540f9ff7be6b74473ce","observation_id":"6c57521d-a509-44c7-ab93-8bc7d2dc9658","resolution":{"observed_at":"2026-08-07T23:19:37.897728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06104","last_updated":"2024-06-18T09:16:14Z","snapshot_observed_at":"2026-08-07T11:50:21.011836Z","submitted_at":"2024-01-11T18:35:26Z","title":"Transformers are Multi-State RNNs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06104","snapshot_observed_at":"2026-08-07T23:19:37.902581Z","title":"Transformers are Multi - State RNNs , June 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08910","last_updated":"2025-02-13T02:52:01Z","snapshot_observed_at":"2026-08-07T23:12:54.397262Z","submitted_at":"2025-02-13T02:52:01Z","title":"InfiniteHiP: Extending Language Model Context Up to 3 Million Tokens on a Single GPU","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T23:19:37.902581Z"},"links":{"cited_paper":"/paper/2401.06104","citing_paper":"/paper/2502.08910"},"observation_digest":"sha256:6b9c429ffd6cadca801ddc7e7e166969bddd21b8ba491365be8a1c8b8832e19a","observation_id":"92e6b6c2-8183-4301-8eab-e3804da67195","resolution":{"observed_at":"2026-08-07T23:19:37.902581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12950","last_updated":"2024-01-31T19:47:26Z","snapshot_observed_at":"2026-07-06T16:10:07.931347Z","submitted_at":"2023-08-24T17:39:13Z","title":"Code Llama: Open Foundation Models for Code","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12950","snapshot_observed_at":"2026-08-07T23:19:37.908106Z","title":"E., Adi, Y., Liu, J., Sauvestre, R., Remez, T., Rapin, J., Kozhevnikov, A., Evtimov, I., Bitton, J., Bhatt, M., Ferrer, C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08910","last_updated":"2025-02-13T02:52:01Z","snapshot_observed_at":"2026-08-07T23:12:54.397262Z","submitted_at":"2025-02-13T02:52:01Z","title":"InfiniteHiP: Extending Language Model Context Up to 3 Million Tokens on a Single GPU","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T23:19:37.908106Z"},"links":{"cited_paper":"/paper/2308.12950","citing_paper":"/paper/2502.08910"},"observation_digest":"sha256:30172004cea21e2c2a8054663a3edc77dce72328fedced31692168cba3eec1cc","observation_id":"b388a196-ed47-4fe7-9652-fd5cc6970cb2","resolution":{"observed_at":"2026-08-07T23:19:37.908106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09864","last_updated":"2023-11-08T13:36:32Z","snapshot_observed_at":"2026-07-06T11:01:58.137141Z","submitted_at":"2021-04-20T09:54:06Z","title":"RoFormer: Enhanced Transformer with Rotary Position Embedding","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.09864","snapshot_observed_at":"2026-08-07T23:19:37.913396Z","title":"RoFormer : Enhanced Transformer with Rotary Position Embedding , November 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08910","last_updated":"2025-02-13T02:52:01Z","snapshot_observed_at":"2026-08-07T23:12:54.397262Z","submitted_at":"2025-02-13T02:52:01Z","title":"InfiniteHiP: Extending Language Model Context Up to 3 Million Tokens on a Single GPU","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T23:19:37.913396Z"},"links":{"cited_paper":"/paper/2104.09864","citing_paper":"/paper/2502.08910"},"observation_digest":"sha256:c62945201e25de90815b6f03e0eaeaf81299f76bf4a26759c7129cc80168bbbe","observation_id":"c08b7145-6752-4f1f-8046-99752f72a97f","resolution":{"observed_at":"2026-08-07T23:19:37.913396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10774","last_updated":"2024-08-26T21:01:02Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-16T01:33:02Z","title":"Quest: Query-Aware Sparsity for Efficient Long-Context LLM Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10774","snapshot_observed_at":"2026-08-07T23:19:37.918446Z","title":"Quest: Query - Aware Sparsity for Efficient Long - Context LLM Inference , August 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08910","last_updated":"2025-02-13T02:52:01Z","snapshot_observed_at":"2026-08-07T23:12:54.397262Z","submitted_at":"2025-02-13T02:52:01Z","title":"InfiniteHiP: Extending Language Model Context Up to 3 Million Tokens on a Single GPU","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T23:19:37.918446Z"},"links":{"cited_paper":"/paper/2406.10774","citing_paper":"/paper/2502.08910"},"observation_digest":"sha256:6e3d85f7c44e1d2a53e4f9173e77a560d1a89042847f9999c806fd6ea28c716b","observation_id":"22c1a1c4-8617-42aa-bfba-9be1fd2a9751","resolution":{"observed_at":"2026-08-07T23:19:37.918446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:19:38.829248Z","title":null,"venue":null,"work_id":"f0996da4-c8b5-4de5-a53b-603dfee39570","year":2019},"citing_paper":{"arxiv_id":"2502.08910","last_updated":"2025-02-13T02:52:01Z","snapshot_observed_at":"2026-08-07T23:12:54.397262Z","submitted_at":"2025-02-13T02:52:01Z","title":"InfiniteHiP: Extending Language Model Context Up to 3 Million Tokens on a Single GPU","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T23:19:37.924374Z"},"links":{"citing_paper":"/paper/2502.08910"},"observation_digest":"sha256:9bd95ac8bc6c725df4dcc936de48b1b8952f77481c0189789b1bd8153b2a1f3a","observation_id":"d63b3f5e-75b9-4dbc-9aeb-73b44ba9cc58","resolution":{"observed_at":"2026-08-07T23:19:38.834399Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03762","last_updated":"2023-08-02T00:41:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-06-12T17:57:34Z","title":"Attention Is All You Need","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.03762","snapshot_observed_at":"2026-08-07T23:19:37.928806Z","title":"N., Kaiser, L., and Polosukhin, I","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.08910","last_updated":"2025-02-13T02:52:01Z","snapshot_observed_at":"2026-08-07T23:12:54.397262Z","submitted_at":"2025-02-13T02:52:01Z","title":"InfiniteHiP: Extending Language Model Context Up to 3 Million Tokens on a Single GPU","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T23:19:37.928806Z"},"links":{"cited_paper":"/paper/1706.03762","citing_paper":"/paper/2502.08910"},"observation_digest":"sha256:658dd7e3e6db8c202397d3f5fd84e1cb1fa2c38debc2d97800f8eaddc801bef3","observation_id":"87ec3dcb-ead0-453b-8e13-e762b07b64cf","resolution":{"observed_at":"2026-08-07T23:19:37.928806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17808","last_updated":"2025-03-31T03:28:44Z","snapshot_observed_at":"2026-07-06T18:36:56.124021Z","submitted_at":"2024-06-24T03:59:17Z","title":"Training-Free Exponential Context Extension via Cascading KV Cache","version":4},"cited_work":{"arxiv_id":"2406.17808","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.17808","snapshot_observed_at":"2026-08-07T23:19:38.062457Z","title":"Training-Free Exponential Context Extension via Cascading KV Cache","venue":"cs.CL","work_id":"7ededebe-f4c4-43cb-84e6-32aecaf8b5bd","year":2024},"citing_paper":{"arxiv_id":"2502.08910","last_updated":"2025-02-13T02:52:01Z","snapshot_observed_at":"2026-08-07T23:12:54.397262Z","submitted_at":"2025-02-13T02:52:01Z","title":"InfiniteHiP: Extending Language Model Context Up to 3 Million Tokens on a Single GPU","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T23:19:37.933737Z"},"links":{"cited_paper":"/paper/2406.17808","citing_paper":"/paper/2502.08910"},"observation_digest":"sha256:b114975c56774e7cd5a7099b46fbb7320a5d6a459aa764f7bfc1c6c6e5435411","observation_id":"48941070-f497-4cd2-986e-3dffe4170ca6","resolution":{"observed_at":"2026-08-07T23:19:38.069832Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04617","last_updated":"2024-05-28T12:05:12Z","snapshot_observed_at":"2026-07-06T17:26:39.109878Z","submitted_at":"2024-02-07T06:50:42Z","title":"InfLLM: Training-Free Long-Context Extrapolation for LLMs with an Efficient Context Memory","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04617","snapshot_observed_at":"2026-08-07T23:19:37.938758Z","title":"InfLLM : Training - Free Long - Context Extrapolation for LLMs with an Efficient Context Memory , May 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08910","last_updated":"2025-02-13T02:52:01Z","snapshot_observed_at":"2026-08-07T23:12:54.397262Z","submitted_at":"2025-02-13T02:52:01Z","title":"InfiniteHiP: Extending Language Model Context Up to 3 Million Tokens on a Single GPU","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T23:19:37.938758Z"},"links":{"cited_paper":"/paper/2402.04617","citing_paper":"/paper/2502.08910"},"observation_digest":"sha256:e816b57a5634f4c27a0177fc8f58442ce5b0b55f55e7f6ffd3e57c1ffee4ef2d","observation_id":"32ef12c0-7a4f-4fc5-b005-9a28ffecec08","resolution":{"observed_at":"2026-08-07T23:19:37.938758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17453","last_updated":"2024-04-07T00:56:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:59:56Z","title":"Efficient Streaming Language Models with Attention Sinks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17453","snapshot_observed_at":"2026-08-07T23:19:37.944290Z","title":"Efficient Streaming Language Models with Attention Sinks , April 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08910","last_updated":"2025-02-13T02:52:01Z","snapshot_observed_at":"2026-08-07T23:12:54.397262Z","submitted_at":"2025-02-13T02:52:01Z","title":"InfiniteHiP: Extending Language Model Context Up to 3 Million Tokens on a Single GPU","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T23:19:37.944290Z"},"links":{"cited_paper":"/paper/2309.17453","citing_paper":"/paper/2502.08910"},"observation_digest":"sha256:2054b666c761e2aa8fca40029b9cb054d3900c86ee8c3195a2deb33d0f09cbc0","observation_id":"d81550cf-d9b9-4065-82bd-9852e424cfb3","resolution":{"observed_at":"2026-08-07T23:19:37.944290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13718","last_updated":"2024-02-24T15:07:55Z","snapshot_observed_at":"2026-08-02T23:59:10.592798Z","submitted_at":"2024-02-21T11:30:29Z","title":"$\\infty$Bench: Extending Long Context Evaluation Beyond 100K Tokens","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13718","snapshot_observed_at":"2026-08-07T23:19:37.949529Z","title":"K., Han, X., Thai, Z","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08910","last_updated":"2025-02-13T02:52:01Z","snapshot_observed_at":"2026-08-07T23:12:54.397262Z","submitted_at":"2025-02-13T02:52:01Z","title":"InfiniteHiP: Extending Language Model Context Up to 3 Million Tokens on a Single GPU","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T23:19:37.949529Z"},"links":{"cited_paper":"/paper/2402.13718","citing_paper":"/paper/2502.08910"},"observation_digest":"sha256:d93b0810eec020a2da237f8901403d00b5052ed9e408702c3ef55ec687c0d0a4","observation_id":"7df593e2-e375-404e-be22-b30d877a80c0","resolution":{"observed_at":"2026-08-07T23:19:37.949529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-08-06T19:19:02.165567Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14048","snapshot_observed_at":"2026-08-07T23:19:37.955444Z","title":"H\\ \\_2\\ O : Heavy - Hitter Oracle for Efficient Generative Inference of Large Language Models , December 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08910","last_updated":"2025-02-13T02:52:01Z","snapshot_observed_at":"2026-08-07T23:12:54.397262Z","submitted_at":"2025-02-13T02:52:01Z","title":"InfiniteHiP: Extending Language Model Context Up to 3 Million Tokens on a Single GPU","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T23:19:37.955444Z"},"links":{"cited_paper":"/paper/2306.14048","citing_paper":"/paper/2502.08910"},"observation_digest":"sha256:cd51e2a10ded05449ef779d1e62a00eed15f58fce5a32f34e9227dfceff49ab5","observation_id":"7d1d90c1-3251-4737-b299-aaed6e22a2c2","resolution":{"observed_at":"2026-08-07T23:19:37.955444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.08910","last_updated":"2025-02-13T02:52:01Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T23:12:54.397262Z","submitted_at":"2025-02-13T02:52:01Z","title":"InfiniteHiP: Extending Language Model Context Up to 3 Million Tokens on a Single GPU"},"reference_resolution":{"displayed":33,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":2,"verified_fuzzy":2},"total_outbound_references":33},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 33 of 33 outbound references and 3 inbound Pith citation observations for arXiv:2502.08910."}