{"as_of":"2026-08-10T00:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:067d60c4bd25b244a1c154fb9140446f50bc61247910a5791c400901420f6427","coverage":[{"denominator":59,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T11:11:17.839813Z","state":"measured"},{"denominator":62,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":62,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:39:05.263720Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T14:48:33.364894Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.02789","last_updated":"2025-05-19T18:24:50Z","snapshot_observed_at":"2026-08-09T11:04:51.007349Z","submitted_at":"2025-02-05T00:22:06Z","title":"Speculative Prefill: Turbocharging TTFT with Lightweight and Training-Free Token Importance Estimation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02789","snapshot_observed_at":"2026-08-07T12:39:05.263720Z","title":"Speculative prefill: Turbocharging ttft with lightweight and training-free token importance estimation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-09T00:29:42.217756Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:05.263720Z"},"links":{"cited_paper":"/paper/2502.02789","citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:d328187d7b236133c132ab3ef57636fa67adde0aaf721e5fa4662dc54d923287","observation_id":"68f5277a-7d78-4afb-813e-57c80128c8d0","resolution":{"observed_at":"2026-08-07T12:39:05.263720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02789","last_updated":"2025-05-19T18:24:50Z","snapshot_observed_at":"2026-08-09T11:04:51.007349Z","submitted_at":"2025-02-05T00:22:06Z","title":"Speculative Prefill: Turbocharging TTFT with Lightweight and Training-Free Token Importance Estimation","version":2},"cited_work":{"arxiv_id":"2502.02789","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.02789","snapshot_observed_at":"2026-07-03T14:48:33.364894Z","title":"Speculative prefill: Turbocharging ttft with lightweight and training-free token importance estimation,","venue":null,"work_id":"f2d11d0a-67e4-4bcd-adf6-9931574b1c11","year":2025},"citing_paper":{"arxiv_id":"2606.12969","last_updated":"2026-06-11T06:57:01Z","snapshot_observed_at":"2026-07-06T23:51:49.819867Z","submitted_at":"2026-06-11T06:57:01Z","title":"Multi-Modal Agents for Power Distribution Defect Detection: An Evaluation of Foundation Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-27T06:53:51.279880Z"},"links":{"cited_paper":"/paper/2502.02789","citing_paper":"/paper/2606.12969"},"observation_digest":"sha256:41b5afee8856e51f39e43ae3804b06f9ec97eab37043530da1927379476a933e","observation_id":"559406c1-ef58-46ce-b620-3a64915e8109","resolution":{"observed_at":"2026-07-03T14:48:33.366365Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02789","last_updated":"2025-05-19T18:24:50Z","snapshot_observed_at":"2026-08-09T11:04:51.007349Z","submitted_at":"2025-02-05T00:22:06Z","title":"Speculative Prefill: Turbocharging TTFT with Lightweight and Training-Free Token Importance Estimation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02789","snapshot_observed_at":"2026-08-02T02:01:48.669846Z","title":"Skyrl-v0: Train real-world long-horizon agents via reinforcement learning.arXiv preprint arXiv:2502.02789, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14506","last_updated":"2026-07-16T02:42:24Z","snapshot_observed_at":"2026-08-02T02:01:47.032587Z","submitted_at":"2026-07-16T02:42:24Z","title":"Non-vacuous Generalization Bounds for Reinforcement Learning with Verifiable Rewards","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T02:01:48.669846Z"},"links":{"cited_paper":"/paper/2502.02789","citing_paper":"/paper/2607.14506"},"observation_digest":"sha256:667f37b5f98c6db9e521584b8cf568c03112922d851cc4114b12bb8f82cfb618","observation_id":"bdf29ee7-e41d-4710-93d0-0ab622e72a68","resolution":{"observed_at":"2026-08-02T02:01:48.669846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2502.02789/citation-record","integrity":"/paper/2502.02789/integrity","json":"/paper/2502.02789/citation-record.json","paper":"/paper/2502.02789"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:11:17.602177Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02789","last_updated":"2025-05-19T18:24:50Z","snapshot_observed_at":"2026-08-09T11:04:51.007349Z","submitted_at":"2025-02-05T00:22:06Z","title":"Speculative Prefill: Turbocharging TTFT with Lightweight and Training-Free Token Importance Estimation","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-09T11:11:17.602177Z"},"links":{"citing_paper":"/paper/2502.02789"},"observation_digest":"sha256:addbf27bd3398d225c3ed301670f8ec20de5304b14682a3b01c628e99fa93398","observation_id":"825cc507-4d35-4288-a66c-0e4333a50bbd","resolution":{"observed_at":"2026-08-09T11:11:17.602177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-09T11:11:17.607441Z","title":"Program synthesis with large language models, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.02789","last_updated":"2025-05-19T18:24:50Z","snapshot_observed_at":"2026-08-09T11:04:51.007349Z","submitted_at":"2025-02-05T00:22:06Z","title":"Speculative Prefill: Turbocharging TTFT with Lightweight and Training-Free Token Importance Estimation","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-09T11:11:17.607441Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2502.02789"},"observation_digest":"sha256:9dbbe21e8186b769126e636edb7b30634f5df226442fb5325f48dc4c1b45a012","observation_id":"c35c8163-c947-43dc-ac37-4657bc64e693","resolution":{"observed_at":"2026-08-09T11:11:17.607441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:11:17.611991Z","title":"L ong B ench: A bilingual, multitask benchmark for long context understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02789","last_updated":"2025-05-19T18:24:50Z","snapshot_observed_at":"2026-08-09T11:04:51.007349Z","submitted_at":"2025-02-05T00:22:06Z","title":"Speculative Prefill: Turbocharging TTFT with Lightweight and Training-Free Token Importance Estimation","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-09T11:11:17.611991Z"},"links":{"citing_paper":"/paper/2502.02789"},"observation_digest":"sha256:7cd63349f772fb521050151ac0b22a6268696481f7ae60025947a1420043eca7","observation_id":"f0bb1da9-e101-4c37-a710-7353aed9f5c4","resolution":{"observed_at":"2026-08-09T11:11:17.611991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-09T11:11:17.615898Z","title":"E., and Cohan, A","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.02789","last_updated":"2025-05-19T18:24:50Z","snapshot_observed_at":"2026-08-09T11:04:51.007349Z","submitted_at":"2025-02-05T00:22:06Z","title":"Speculative Prefill: Turbocharging TTFT with Lightweight and Training-Free Token Importance Estimation","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-09T11:11:17.615898Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2502.02789"},"observation_digest":"sha256:d2acabf3a3c18b053f73527cb0382349fbd86c63e2f8097c352ec22c34b766f6","observation_id":"8ba76ba8-24d4-46dd-9062-7b6f7dbcd9c7","resolution":{"observed_at":"2026-08-09T11:11:17.615898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.12712","last_updated":"2023-04-13T20:41:31Z","snapshot_observed_at":"2026-08-03T04:49:15.195814Z","submitted_at":"2023-03-22T16:51:28Z","title":"Sparks of Artificial General Intelligence: Early experiments with GPT-4","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.12712","snapshot_observed_at":"2026-08-09T11:11:17.620625Z","title":"T., Li, Y., Lundberg, S., Nori, H., Palangi, H., Ribeiro, M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02789","last_updated":"2025-05-19T18:24:50Z","snapshot_observed_at":"2026-08-09T11:04:51.007349Z","submitted_at":"2025-02-05T00:22:06Z","title":"Speculative Prefill: Turbocharging TTFT with Lightweight and Training-Free Token Importance Estimation","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-09T11:11:17.620625Z"},"links":{"cited_paper":"/paper/2303.12712","citing_paper":"/paper/2502.02789"},"observation_digest":"sha256:3224b5509bd174c1b12d61f677b4d4400bce1bf4663bf4e0a5b971489c7b137d","observation_id":"40efdeaf-b4f3-4037-a16a-495ea9432db2","resolution":{"observed_at":"2026-08-09T11:11:17.620625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-09T11:11:17.624690Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.02789","last_updated":"2025-05-19T18:24:50Z","snapshot_observed_at":"2026-08-09T11:04:51.007349Z","submitted_at":"2025-02-05T00:22:06Z","title":"Speculative Prefill: Turbocharging TTFT with Lightweight and Training-Free Token Importance Estimation","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-09T11:11:17.624690Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2502.02789"},"observation_digest":"sha256:af25f9876059383a0bdb9cbeacf653d8e04e8e7f2740f04484d5729011f4f700","observation_id":"233f7931-9bf8-4029-9d07-a205c366d6e2","resolution":{"observed_at":"2026-08-09T11:11:17.624690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-09T11:11:17.628946Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.02789","last_updated":"2025-05-19T18:24:50Z","snapshot_observed_at":"2026-08-09T11:04:51.007349Z","submitted_at":"2025-02-05T00:22:06Z","title":"Speculative Prefill: Turbocharging TTFT with Lightweight and Training-Free Token Importance Estimation","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-09T11:11:17.628946Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2502.02789"},"observation_digest":"sha256:8d952d18074345d6e56340e3bbdc9e87af897e3e6beee9fe7acfe50d60f5ff82","observation_id":"67435126-6772-4b69-b780-3fc8020cd76b","resolution":{"observed_at":"2026-08-09T11:11:17.628946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:11:31.005898Z","title":"Training verifiers to solve math word problems, 2021","venue":null,"work_id":"3ede8cbd-63a3-456f-8ad8-09fdf31cd018","year":2021},"citing_paper":{"arxiv_id":"2502.02789","last_updated":"2025-05-19T18:24:50Z","snapshot_observed_at":"2026-08-09T11:04:51.007349Z","submitted_at":"2025-02-05T00:22:06Z","title":"Speculative Prefill: Turbocharging TTFT with Lightweight and Training-Free Token Importance Estimation","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-09T11:11:17.633140Z"},"links":{"citing_paper":"/paper/2502.02789"},"observation_digest":"sha256:85cc2640d1d4fe44e777665742339eec7cddb72acc1aa4d07408d5b779c6cf68","observation_id":"25149e5d-9d65-43a2-9266-6357f6084a6d","resolution":{"observed_at":"2026-08-09T11:11:31.010258Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08691","last_updated":"2023-07-17T17:50:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-17T17:50:36Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08691","snapshot_observed_at":"2026-08-09T11:11:17.636804Z","title":"Flashattention-2: Faster attention with better parallelism and work partitioning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02789","last_updated":"2025-05-19T18:24:50Z","snapshot_observed_at":"2026-08-09T11:04:51.007349Z","submitted_at":"2025-02-05T00:22:06Z","title":"Speculative Prefill: Turbocharging TTFT with Lightweight and Training-Free Token Importance Estimation","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-09T11:11:17.636804Z"},"links":{"cited_paper":"/paper/2307.08691","citing_paper":"/paper/2502.02789"},"observation_digest":"sha256:92ac58cdff852ea422e481403ffddf8b7c39892fe48279042791722d5013af5d","observation_id":"db173266-a6eb-45d5-9fe3-470492b91798","resolution":{"observed_at":"2026-08-09T11:11:17.636804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.14135","last_updated":"2022-06-23T17:53:32Z","snapshot_observed_at":"2026-07-06T13:14:48.753329Z","submitted_at":"2022-05-27T17:53:09Z","title":"FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.14135","snapshot_observed_at":"2026-08-09T11:11:17.640537Z","title":"Y., Ermon, S., Rudra, A., and Ré, C","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.02789","last_updated":"2025-05-19T18:24:50Z","snapshot_observed_at":"2026-08-09T11:04:51.007349Z","submitted_at":"2025-02-05T00:22:06Z","title":"Speculative Prefill: Turbocharging TTFT with Lightweight and Training-Free Token Importance Estimation","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-09T11:11:17.640537Z"},"links":{"cited_paper":"/paper/2205.14135","citing_paper":"/paper/2502.02789"},"observation_digest":"sha256:10e97beb0cf266dcc7046c5c8f72e23069de98aa641d4bc4b3d4e08fa1bf8197","observation_id":"82b64e1e-fb99-41bc-9b80-58758ec30ea8","resolution":{"observed_at":"2026-08-09T11:11:17.640537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-09T11:11:17.644345Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.02789","last_updated":"2025-05-19T18:24:50Z","snapshot_observed_at":"2026-08-09T11:04:51.007349Z","submitted_at":"2025-02-05T00:22:06Z","title":"Speculative Prefill: Turbocharging TTFT with Lightweight and Training-Free Token Importance Estimation","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-09T11:11:17.644345Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2502.02789"},"observation_digest":"sha256:5279d21d2db1f6335dada33ba2e236c413df2d553f75c4cdd7f1ef0a71f6cdd6","observation_id":"da49d82b-1f3f-4462-a0a1-d40ea8354f05","resolution":{"observed_at":"2026-08-09T11:11:17.644345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:11:17.648359Z","title":"Layerskip: Enabling early exit inference and self-speculative decoding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02789","last_updated":"2025-05-19T18:24:50Z","snapshot_observed_at":"2026-08-09T11:04:51.007349Z","submitted_at":"2025-02-05T00:22:06Z","title":"Speculative Prefill: Turbocharging TTFT with Lightweight and Training-Free Token Importance Estimation","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-09T11:11:17.648359Z"},"links":{"citing_paper":"/paper/2502.02789"},"observation_digest":"sha256:34f9ec8c82a22bbfc8c85ca82fa0640ca5799e48280b8242d4278d2ba81db65e","observation_id":"c793fdf5-84a3-4a65-8b54-3bb3a0111926","resolution":{"observed_at":"2026-08-09T11:11:17.648359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10313","last_updated":"2024-11-24T18:44:27Z","snapshot_observed_at":"2026-07-06T18:15:24.541427Z","submitted_at":"2024-05-16T17:59:02Z","title":"How Far Are We From AGI: Are LLMs All We Need?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10313","snapshot_observed_at":"2026-08-09T11:11:17.652509Z","title":"How far are we from agi: Are llms all we need?, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02789","last_updated":"2025-05-19T18:24:50Z","snapshot_observed_at":"2026-08-09T11:04:51.007349Z","submitted_at":"2025-02-05T00:22:06Z","title":"Speculative Prefill: Turbocharging TTFT with Lightweight and Training-Free Token Importance Estimation","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-09T11:11:17.652509Z"},"links":{"cited_paper":"/paper/2405.10313","citing_paper":"/paper/2502.02789"},"observation_digest":"sha256:9d00abcb3c2b13f8a37cb7ef04557f81c47d04e9ff6ae52830e4649a3921e87f","observation_id":"1afb1e5c-3e4f-4a51-9223-9c80ed6df62e","resolution":{"observed_at":"2026-08-09T11:11:17.652509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:11:17.656292Z","title":"A framework for few-shot language model evaluation, 07 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02789","last_updated":"2025-05-19T18:24:50Z","snapshot_observed_at":"2026-08-09T11:04:51.007349Z","submitted_at":"2025-02-05T00:22:06Z","title":"Speculative Prefill: Turbocharging TTFT with Lightweight and Training-Free Token Importance Estimation","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-09T11:11:17.656292Z"},"links":{"citing_paper":"/paper/2502.02789"},"observation_digest":"sha256:2769e1ec1a91b30ccfa6717641e112d27ac36e4aacf2c6fb6c50f00194ba669a","observation_id":"0a4600c3-a957-4af5-8d74-fe913fb18020","resolution":{"observed_at":"2026-08-09T11:11:17.656292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10997","last_updated":"2024-03-27T09:16:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-18T07:47:33Z","title":"Retrieval-Augmented Generation for Large Language Models: A Survey","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10997","snapshot_observed_at":"2026-08-09T11:11:17.659971Z","title":"Retrieval-augmented generation for large language models: A survey, 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02789","last_updated":"2025-05-19T18:24:50Z","snapshot_observed_at":"2026-08-09T11:04:51.007349Z","submitted_at":"2025-02-05T00:22:06Z","title":"Speculative Prefill: Turbocharging TTFT with Lightweight and Training-Free Token Importance Estimation","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-09T11:11:17.659971Z"},"links":{"cited_paper":"/paper/2312.10997","citing_paper":"/paper/2502.02789"},"observation_digest":"sha256:902ce90300f37b34fb6c99d65f194f3c97d0e1b230480e3a14200191553868c3","observation_id":"8cc5a2cf-5255-4c68-91c9-bd138ecd0c98","resolution":{"observed_at":"2026-08-09T11:11:17.659971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-09T11:11:17.664015Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02789","last_updated":"2025-05-19T18:24:50Z","snapshot_observed_at":"2026-08-09T11:04:51.007349Z","submitted_at":"2025-02-05T00:22:06Z","title":"Speculative Prefill: Turbocharging TTFT with Lightweight and Training-Free Token Importance Estimation","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-09T11:11:17.664015Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2502.02789"},"observation_digest":"sha256:9eef8e79ab8b40d3bc6563e9edaa318af18def96e18435646cb369ca8394d34b","observation_id":"db3c62e1-e760-4347-9604-a1e22c7a2580","resolution":{"observed_at":"2026-08-09T11:11:17.664015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-09T10:28:06.906299Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-09T11:11:17.669337Z","title":"Measuring massive multitask language understanding, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.02789","last_updated":"2025-05-19T18:24:50Z","snapshot_observed_at":"2026-08-09T11:04:51.007349Z","submitted_at":"2025-02-05T00:22:06Z","title":"Speculative Prefill: Turbocharging TTFT with Lightweight and Training-Free Token Importance Estimation","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-09T11:11:17.669337Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2502.02789"},"observation_digest":"sha256:98faaf517dd8638806ed9e76943f9d4fc291a5b4a0e4d10c06af9ee6eb01defb","observation_id":"f41cc89b-f9d8-47f3-8744-968c435497e9","resolution":{"observed_at":"2026-08-09T11:11:17.669337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08391","last_updated":"2024-10-10T21:55:11Z","snapshot_observed_at":"2026-07-06T19:31:31.809692Z","submitted_at":"2024-10-10T21:55:11Z","title":"KV Prediction for Improved Time to First Token","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08391","snapshot_observed_at":"2026-08-09T11:11:17.673384Z","title":"Kv prediction for improved time to first token, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02789","last_updated":"2025-05-19T18:24:50Z","snapshot_observed_at":"2026-08-09T11:04:51.007349Z","submitted_at":"2025-02-05T00:22:06Z","title":"Speculative Prefill: Turbocharging TTFT with Lightweight and Training-Free Token Importance Estimation","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-09T11:11:17.673384Z"},"links":{"cited_paper":"/paper/2410.08391","citing_paper":"/paper/2502.02789"},"observation_digest":"sha256:09aaaa3a4bd9bd8d6fd696b4dff47e739f1c8c6ae637377aa73421dd0228e653","observation_id":"b1d47dfe-223c-4c48-a082-8e450037c5a3","resolution":{"observed_at":"2026-08-09T11:11:17.673384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-09T11:11:17.677430Z","title":"Ruler: What's the real context size of your long-context language models? arXiv preprint arXiv:2404.06654, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02789","last_updated":"2025-05-19T18:24:50Z","snapshot_observed_at":"2026-08-09T11:04:51.007349Z","submitted_at":"2025-02-05T00:22:06Z","title":"Speculative Prefill: Turbocharging TTFT with Lightweight and Training-Free Token Importance Estimation","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-09T11:11:17.677430Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2502.02789"},"observation_digest":"sha256:9788d66bd19c5c0bbf8907319eb4a2a2574369723d7a7b12dacfc326c4547343","observation_id":"37a9dd95-f2aa-43f0-a172-06288745b923","resolution":{"observed_at":"2026-08-09T11:11:17.677430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-09T11:11:17.681510Z","title":"Q., Sablayrolles, A., Mensch, A., Bamford, C., Chaplot, D","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02789","last_updated":"2025-05-19T18:24:50Z","snapshot_observed_at":"2026-08-09T11:04:51.007349Z","submitted_at":"2025-02-05T00:22:06Z","title":"Speculative Prefill: Turbocharging TTFT with Lightweight and Training-Free Token Importance Estimation","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-09T11:11:17.681510Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2502.02789"},"observation_digest":"sha256:231a42eadf95ae1d01a240b5501737030e88816c8578bbab5d0b5d0d441f7257","observation_id":"6ee53d13-3743-46d1-9a53-d46014661c0b","resolution":{"observed_at":"2026-08-09T11:11:17.681510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05736","last_updated":"2023-12-06T17:02:25Z","snapshot_observed_at":"2026-08-06T08:38:21.368130Z","submitted_at":"2023-10-09T14:10:21Z","title":"LLMLingua: Compressing Prompts for Accelerated Inference of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05736","snapshot_observed_at":"2026-08-09T11:11:17.685933Z","title":"Llmlingua: Compressing prompts for accelerated inference of large language models, 2023 b","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02789","last_updated":"2025-05-19T18:24:50Z","snapshot_observed_at":"2026-08-09T11:04:51.007349Z","submitted_at":"2025-02-05T00:22:06Z","title":"Speculative Prefill: Turbocharging TTFT with Lightweight and Training-Free Token Importance Estimation","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-09T11:11:17.685933Z"},"links":{"cited_paper":"/paper/2310.05736","citing_paper":"/paper/2502.02789"},"observation_digest":"sha256:14fc0546281f5e80fda74b95af52014827c4c3c29c61e935606d530a4a418982","observation_id":"c0805d18-4818-4e42-8e52-cf6f52f50a36","resolution":{"observed_at":"2026-08-09T11:11:17.685933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02490","last_updated":"2024-10-30T14:53:22Z","snapshot_observed_at":"2026-08-07T20:59:29.819833Z","submitted_at":"2024-07-02T17:59:56Z","title":"MInference 1.0: Accelerating Pre-filling for Long-Context LLMs via Dynamic Sparse Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02490","snapshot_observed_at":"2026-08-09T11:11:17.689930Z","title":"H., Li, D., Lin, C.-Y., Yang, Y., and Qiu, L","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02789","last_updated":"2025-05-19T18:24:50Z","snapshot_observed_at":"2026-08-09T11:04:51.007349Z","submitted_at":"2025-02-05T00:22:06Z","title":"Speculative Prefill: Turbocharging TTFT with Lightweight and Training-Free Token Importance Estimation","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-09T11:11:17.689930Z"},"links":{"cited_paper":"/paper/2407.02490","citing_paper":"/paper/2502.02789"},"observation_digest":"sha256:3e07c9312f8dc67519b5b08170c6e3118fd5cad850fc9c08691f0c5fa27c688e","observation_id":"81687733-b76f-4519-b52d-389e12613747","resolution":{"observed_at":"2026-08-09T11:11:17.689930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06839","last_updated":"2024-08-12T03:53:35Z","snapshot_observed_at":"2026-08-06T17:12:58.658176Z","submitted_at":"2023-10-10T17:59:58Z","title":"LongLLMLingua: Accelerating and Enhancing LLMs in Long Context Scenarios via Prompt Compression","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06839","snapshot_observed_at":"2026-08-09T11:11:17.694065Z","title":"Longllmlingua: Accelerating and enhancing llms in long context scenarios via prompt compression, 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02789","last_updated":"2025-05-19T18:24:50Z","snapshot_observed_at":"2026-08-09T11:04:51.007349Z","submitted_at":"2025-02-05T00:22:06Z","title":"Speculative Prefill: Turbocharging TTFT with Lightweight and Training-Free Token Importance Estimation","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-09T11:11:17.694065Z"},"links":{"cited_paper":"/paper/2310.06839","citing_paper":"/paper/2502.02789"},"observation_digest":"sha256:220af2d1be8ae4c0582d593e74719dace07684ea8d046646a0b95fdee726211e","observation_id":"e98294fb-c605-48be-9e27-8efe5c153e0c","resolution":{"observed_at":"2026-08-09T11:11:17.694065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:11:17.698253Z","title":"H., Gonzalez, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02789","last_updated":"2025-05-19T18:24:50Z","snapshot_observed_at":"2026-08-09T11:04:51.007349Z","submitted_at":"2025-02-05T00:22:06Z","title":"Speculative Prefill: Turbocharging TTFT with Lightweight and Training-Free Token Importance Estimation","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-09T11:11:17.698253Z"},"links":{"citing_paper":"/paper/2502.02789"},"observation_digest":"sha256:1a2c86e6de1d33188e860e7a4dc3a6a18da154340d4813bc2c7d9bf0da4e56d8","observation_id":"40f0d174-2e08-400d-aa92-67080801e89e","resolution":{"observed_at":"2026-08-09T11:11:17.698253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20766","last_updated":"2025-02-28T06:34:53Z","snapshot_observed_at":"2026-08-07T17:40:46.337382Z","submitted_at":"2025-02-28T06:34:53Z","title":"FlexPrefill: A Context-Aware Sparse Attention Mechanism for Efficient Long-Sequence Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.20766","snapshot_observed_at":"2026-08-09T11:11:17.702371Z","title":"Flexprefill: A context-aware sparse attention mechanism for efficient long-sequence inference, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.02789","last_updated":"2025-05-19T18:24:50Z","snapshot_observed_at":"2026-08-09T11:04:51.007349Z","submitted_at":"2025-02-05T00:22:06Z","title":"Speculative Prefill: Turbocharging TTFT with Lightweight and Training-Free Token Importance Estimation","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-09T11:11:17.702371Z"},"links":{"cited_paper":"/paper/2502.20766","citing_paper":"/paper/2502.02789"},"observation_digest":"sha256:af4a88c82e2eaaeb73b75969374e62831c3e8969bff676cf30edb023fef54c38","observation_id":"730aa723-d591-417c-832f-5400fda1cef9","resolution":{"observed_at":"2026-08-09T11:11:17.702371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08910","last_updated":"2025-02-13T02:52:01Z","snapshot_observed_at":"2026-08-09T23:07:19.000117Z","submitted_at":"2025-02-13T02:52:01Z","title":"InfiniteHiP: Extending Language Model Context Up to 3 Million Tokens on a Single GPU","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.08910","snapshot_observed_at":"2026-08-09T11:11:17.706860Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.02789","last_updated":"2025-05-19T18:24:50Z","snapshot_observed_at":"2026-08-09T11:04:51.007349Z","submitted_at":"2025-02-05T00:22:06Z","title":"Speculative Prefill: Turbocharging TTFT with Lightweight and Training-Free Token Importance Estimation","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-09T11:11:17.706860Z"},"links":{"cited_paper":"/paper/2502.08910","citing_paper":"/paper/2502.02789"},"observation_digest":"sha256:b40620c51b2de87a8ba80d35b8f137131694a09851ce06097f2cc9833f0de0d8","observation_id":"e97223e2-fc57-465d-8165-a03c84f75dbd","resolution":{"observed_at":"2026-08-09T11:11:17.706860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.17192","last_updated":"2023-05-18T20:28:20Z","snapshot_observed_at":"2026-08-08T11:03:33.403601Z","submitted_at":"2022-11-30T17:33:28Z","title":"Fast Inference from Transformers via Speculative Decoding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.17192","snapshot_observed_at":"2026-08-09T11:11:17.711098Z","title":"Fast inference from transformers via speculative decoding, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02789","last_updated":"2025-05-19T18:24:50Z","snapshot_observed_at":"2026-08-09T11:04:51.007349Z","submitted_at":"2025-02-05T00:22:06Z","title":"Speculative Prefill: Turbocharging TTFT with Lightweight and Training-Free Token Importance Estimation","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-09T11:11:17.711098Z"},"links":{"cited_paper":"/paper/2211.17192","citing_paper":"/paper/2502.02789"},"observation_digest":"sha256:e0dfedeca0dde042d1d4de15905d8c35093e7d5681a10b7ffcf71ed4dc7d00a4","observation_id":"67b9bca9-d6bf-4eb9-834a-6212459ce350","resolution":{"observed_at":"2026-08-09T11:11:17.711098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11401","last_updated":"2021-04-12T15:42:18Z","snapshot_observed_at":"2026-08-07T05:44:30.677502Z","submitted_at":"2020-05-22T21:34:34Z","title":"Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.11401","snapshot_observed_at":"2026-08-09T11:11:17.714944Z","title":"Retrieval-augmented generation for knowledge-intensive nlp tasks, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.02789","last_updated":"2025-05-19T18:24:50Z","snapshot_observed_at":"2026-08-09T11:04:51.007349Z","submitted_at":"2025-02-05T00:22:06Z","title":"Speculative Prefill: Turbocharging TTFT with Lightweight and Training-Free Token Importance Estimation","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-09T11:11:17.714944Z"},"links":{"cited_paper":"/paper/2005.11401","citing_paper":"/paper/2502.02789"},"observation_digest":"sha256:8f741fc11e0d9af9a5b42a26dcacec51535944669bb9931314fa2c44293651f8","observation_id":"02d31b63-ea18-4cd1-9788-c6119ad433e5","resolution":{"observed_at":"2026-08-09T11:11:17.714944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06201","last_updated":"2023-10-09T23:03:24Z","snapshot_observed_at":"2026-08-06T01:26:00.668084Z","submitted_at":"2023-10-09T23:03:24Z","title":"Compressing Context to Enhance Inference Efficiency of Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06201","snapshot_observed_at":"2026-08-09T11:11:17.718608Z","title":"Compressing context to enhance inference efficiency of large language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02789","last_updated":"2025-05-19T18:24:50Z","snapshot_observed_at":"2026-08-09T11:04:51.007349Z","submitted_at":"2025-02-05T00:22:06Z","title":"Speculative Prefill: Turbocharging TTFT with Lightweight and Training-Free Token Importance Estimation","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-09T11:11:17.718608Z"},"links":{"cited_paper":"/paper/2310.06201","citing_paper":"/paper/2502.02789"},"observation_digest":"sha256:2d347fd9719e0d143238142dbead1691278d2cb99dc99f4f5eeebbd32f981d02","observation_id":"c1aa0ade-cbc0-4d9f-8a4d-5969cbca6a80","resolution":{"observed_at":"2026-08-09T11:11:17.718608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-06T07:50:40.568356Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10319","snapshot_observed_at":"2026-08-09T11:11:17.722512Z","title":"H., Li, D., Gao, J., Yang, Y., and Qiu, L","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.02789","last_updated":"2025-05-19T18:24:50Z","snapshot_observed_at":"2026-08-09T11:04:51.007349Z","submitted_at":"2025-02-05T00:22:06Z","title":"Speculative Prefill: Turbocharging TTFT with Lightweight and Training-Free Token Importance Estimation","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-09T11:11:17.722512Z"},"links":{"cited_paper":"/paper/2412.10319","citing_paper":"/paper/2502.02789"},"observation_digest":"sha256:3266a3df813d670d84d86359d127ebfb06e75518d738f17ff09ec5e6cf6829bb","observation_id":"73f6391c-4166-407d-973e-5850a203fe1f","resolution":{"observed_at":"2026-08-09T11:11:17.722512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16833","last_updated":"2024-10-17T17:51:19Z","snapshot_observed_at":"2026-07-06T18:50:57.722348Z","submitted_at":"2024-07-23T20:51:52Z","title":"Retrieval Augmented Generation or Long-Context LLMs? A Comprehensive Study and Hybrid Approach","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.16833","snapshot_observed_at":"2026-08-09T11:11:17.726660Z","title":"Retrieval augmented generation or long-context llms? a comprehensive study and hybrid approach, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02789","last_updated":"2025-05-19T18:24:50Z","snapshot_observed_at":"2026-08-09T11:04:51.007349Z","submitted_at":"2025-02-05T00:22:06Z","title":"Speculative Prefill: Turbocharging TTFT with Lightweight and Training-Free Token Importance Estimation","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-09T11:11:17.726660Z"},"links":{"cited_paper":"/paper/2407.16833","citing_paper":"/paper/2502.02789"},"observation_digest":"sha256:8dd973e03c1c425ebf88d8478d9f34f109b112a0c7c376887c1847e8f1d0660b","observation_id":"5662039a-e072-439e-866d-c89b879a0ff1","resolution":{"observed_at":"2026-08-09T11:11:17.726660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00978","last_updated":"2026-04-25T06:58:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-01T17:59:10Z","title":"AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00978","snapshot_observed_at":"2026-08-09T11:11:17.730999Z","title":"Awq: Activation-aware weight quantization for llm compression and acceleration, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02789","last_updated":"2025-05-19T18:24:50Z","snapshot_observed_at":"2026-08-09T11:04:51.007349Z","submitted_at":"2025-02-05T00:22:06Z","title":"Speculative Prefill: Turbocharging TTFT with Lightweight and Training-Free Token Importance Estimation","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-09T11:11:17.730999Z"},"links":{"cited_paper":"/paper/2306.00978","citing_paper":"/paper/2502.02789"},"observation_digest":"sha256:7feafcc21114adb0027e1482e63ef0f0a9056553694178d61c69698a0c91a5fb","observation_id":"2df015bd-3b85-4f0d-bc87-472d78c5de49","resolution":{"observed_at":"2026-08-09T11:11:17.730999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:11:17.735194Z","title":"S., Wang, Y., and Zhang, L","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02789","last_updated":"2025-05-19T18:24:50Z","snapshot_observed_at":"2026-08-09T11:04:51.007349Z","submitted_at":"2025-02-05T00:22:06Z","title":"Speculative Prefill: Turbocharging TTFT with Lightweight and Training-Free Token Importance Estimation","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-09T11:11:17.735194Z"},"links":{"citing_paper":"/paper/2502.02789"},"observation_digest":"sha256:bdce4fd9d55a48b9958e73db0be351a2e2eb4f6d50dc4c430f21cce85e2d4ce2","observation_id":"45bce6ca-a1cb-4663-b39f-64869f22f964","resolution":{"observed_at":"2026-08-09T11:11:17.735194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07240","last_updated":"2024-07-19T21:04:14Z","snapshot_observed_at":"2026-08-07T17:46:33.336201Z","submitted_at":"2023-10-11T07:08:20Z","title":"CacheGen: KV Cache Compression and Streaming for Fast Large Language Model Serving","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07240","snapshot_observed_at":"2026-08-09T11:11:17.739768Z","title":"Cachegen: Kv cache compression and streaming for fast large language model serving, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02789","last_updated":"2025-05-19T18:24:50Z","snapshot_observed_at":"2026-08-09T11:04:51.007349Z","submitted_at":"2025-02-05T00:22:06Z","title":"Speculative Prefill: Turbocharging TTFT with Lightweight and Training-Free Token Importance Estimation","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-09T11:11:17.739768Z"},"links":{"cited_paper":"/paper/2310.07240","citing_paper":"/paper/2502.02789"},"observation_digest":"sha256:d26c2a971eaa705adcdc27b0ee3b11fe3bd163c488c8306722b97503af6c3cc2","observation_id":"12d1fef0-7650-4007-95a7-1d84b3e70cb5","resolution":{"observed_at":"2026-08-09T11:11:17.739768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"cs/0205028","last_updated":"2002-05-17T12:51:00Z","snapshot_observed_at":"2026-07-07T03:04:36.695497Z","submitted_at":"2002-05-17T12:51:00Z","title":"NLTK: The Natural Language Toolkit","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"cs/0205028","snapshot_observed_at":"2026-08-09T11:11:17.743641Z","title":"and Bird, S","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2502.02789","last_updated":"2025-05-19T18:24:50Z","snapshot_observed_at":"2026-08-09T11:04:51.007349Z","submitted_at":"2025-02-05T00:22:06Z","title":"Speculative Prefill: Turbocharging TTFT with Lightweight and Training-Free Token Importance Estimation","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-09T11:11:17.743641Z"},"links":{"cited_paper":"/paper/cs/0205028","citing_paper":"/paper/2502.02789"},"observation_digest":"sha256:fb5c783baf7321aebc2fa83c207aebd0dd3dcf3dd5ef1a7717aa2571629458ac","observation_id":"4476ab2b-8dbc-4bc6-bb4e-ff108b27ed32","resolution":{"observed_at":"2026-08-09T11:11:17.743641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12490","last_updated":"2024-09-23T02:24:33Z","snapshot_observed_at":"2026-07-06T19:18:00.304916Z","submitted_at":"2024-09-19T06:09:56Z","title":"CritiPrefill: A Segment-wise Criticality-based Approach for Prefilling Acceleration in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12490","snapshot_observed_at":"2026-08-09T11:11:17.748351Z","title":"Critiprefill: A segment-wise criticality-based approach for prefilling acceleration in llms, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02789","last_updated":"2025-05-19T18:24:50Z","snapshot_observed_at":"2026-08-09T11:04:51.007349Z","submitted_at":"2025-02-05T00:22:06Z","title":"Speculative Prefill: Turbocharging TTFT with Lightweight and Training-Free Token Importance Estimation","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-09T11:11:17.748351Z"},"links":{"cited_paper":"/paper/2409.12490","citing_paper":"/paper/2502.02789"},"observation_digest":"sha256:d822277ed1abaa228f30ca75621257109e7b4180325586e85cbacb6b05dd67dd","observation_id":"be5abe06-8e50-4a74-b148-10464d34f148","resolution":{"observed_at":"2026-08-09T11:11:17.748351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15234","last_updated":"2025-07-23T10:11:55Z","snapshot_observed_at":"2026-08-05T06:23:34.302204Z","submitted_at":"2023-12-23T11:57:53Z","title":"Towards Efficient Generative Large Language Model Serving: A Survey from Algorithms to Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15234","snapshot_observed_at":"2026-08-09T11:11:17.752885Z","title":"Towards efficient generative large language model serving: A survey from algorithms to systems, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02789","last_updated":"2025-05-19T18:24:50Z","snapshot_observed_at":"2026-08-09T11:04:51.007349Z","submitted_at":"2025-02-05T00:22:06Z","title":"Speculative Prefill: Turbocharging TTFT with Lightweight and Training-Free Token Importance Estimation","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-09T11:11:17.752885Z"},"links":{"cited_paper":"/paper/2312.15234","citing_paper":"/paper/2502.02789"},"observation_digest":"sha256:3b63522df7aac397e3f1b9539210add120a7be4fbead6115d6f6791743ce61eb","observation_id":"56fc0fe0-bdde-48b2-82e9-b1931cd5c1a5","resolution":{"observed_at":"2026-08-09T11:11:17.752885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-09T11:11:17.756918Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02789","last_updated":"2025-05-19T18:24:50Z","snapshot_observed_at":"2026-08-09T11:04:51.007349Z","submitted_at":"2025-02-05T00:22:06Z","title":"Speculative Prefill: Turbocharging TTFT with Lightweight and Training-Free Token Importance Estimation","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-09T11:11:17.756918Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2502.02789"},"observation_digest":"sha256:f92a17b1aa6c992073a8bf68dec2014d91c5f2a89efca02e3074043f61aa4dcb","observation_id":"229521fa-32a6-4c05-a7a2-1ccd4e4db97d","resolution":{"observed_at":"2026-08-09T11:11:17.756918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03960","last_updated":"2025-06-02T02:08:06Z","snapshot_observed_at":"2026-07-06T19:28:12.480864Z","submitted_at":"2024-10-04T22:45:26Z","title":"SwiftKV: Fast Prefill-Optimized Inference with Knowledge-Preserving Model Transformation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03960","snapshot_observed_at":"2026-08-09T11:11:17.760837Z","title":"Swiftkv: Fast prefill-optimized inference with knowledge-preserving model transformation, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02789","last_updated":"2025-05-19T18:24:50Z","snapshot_observed_at":"2026-08-09T11:04:51.007349Z","submitted_at":"2025-02-05T00:22:06Z","title":"Speculative Prefill: Turbocharging TTFT with Lightweight and Training-Free Token Importance Estimation","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-09T11:11:17.760837Z"},"links":{"cited_paper":"/paper/2410.03960","citing_paper":"/paper/2502.02789"},"observation_digest":"sha256:abad9814c43d9d9178de3536055c61d145687c8a13a94c0cbaacfb657a955cf2","observation_id":"42e8049c-d875-46f0-8f10-659c77c0504c","resolution":{"observed_at":"2026-08-09T11:11:17.760837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.10084","last_updated":"2019-08-27T08:50:17Z","snapshot_observed_at":"2026-07-06T08:17:05.681370Z","submitted_at":"2019-08-27T08:50:17Z","title":"Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.10084","snapshot_observed_at":"2026-08-09T11:11:17.764820Z","title":"and Gurevych, I","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.02789","last_updated":"2025-05-19T18:24:50Z","snapshot_observed_at":"2026-08-09T11:04:51.007349Z","submitted_at":"2025-02-05T00:22:06Z","title":"Speculative Prefill: Turbocharging TTFT with Lightweight and Training-Free Token Importance Estimation","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-09T11:11:17.764820Z"},"links":{"cited_paper":"/paper/1908.10084","citing_paper":"/paper/2502.02789"},"observation_digest":"sha256:31366a0a972d1416b890485b9afc2201edc9fb8a18081a17a4ecd30c373e7ed7","observation_id":"02c128c2-b44d-4c5a-a9b5-205f2c17f685","resolution":{"observed_at":"2026-08-09T11:11:17.764820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:11:17.768911Z","title":"L., Stickland, A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02789","last_updated":"2025-05-19T18:24:50Z","snapshot_observed_at":"2026-08-09T11:04:51.007349Z","submitted_at":"2025-02-05T00:22:06Z","title":"Speculative Prefill: Turbocharging TTFT with Lightweight and Training-Free Token Importance Estimation","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-09T11:11:17.768911Z"},"links":{"citing_paper":"/paper/2502.02789"},"observation_digest":"sha256:611510cfbdee1a4a38e252565b67296c503bf15af996ad1263af289d5f5a4e9e","observation_id":"e2d7906d-5500-4d0d-aca2-5cfcc5490e8e","resolution":{"observed_at":"2026-08-09T11:11:17.768911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17422","last_updated":"2024-09-25T23:14:47Z","snapshot_observed_at":"2026-08-08T15:17:09.772737Z","submitted_at":"2024-09-25T23:14:47Z","title":"Discovering the Gems in Early Layers: Accelerating Long-Context LLMs with 1000x Input Token Reduction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17422","snapshot_observed_at":"2026-08-09T11:11:17.772628Z","title":"Discovering the gems in early layers: Accelerating long-context llms with 1000x input token reduction, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02789","last_updated":"2025-05-19T18:24:50Z","snapshot_observed_at":"2026-08-09T11:04:51.007349Z","submitted_at":"2025-02-05T00:22:06Z","title":"Speculative Prefill: Turbocharging TTFT with Lightweight and Training-Free Token Importance Estimation","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-09T11:11:17.772628Z"},"links":{"cited_paper":"/paper/2409.17422","citing_paper":"/paper/2502.02789"},"observation_digest":"sha256:16c9aabd63a4d9867f8d7942b8a2c72297035382853ee75d2d4a44b716e9818e","observation_id":"0e6dc874-1a7f-4625-9aea-9f54564b78d3","resolution":{"observed_at":"2026-08-09T11:11:17.772628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-09T11:11:17.776294Z","title":"Megatron-lm: Training multi-billion parameter language models using model parallelism, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.02789","last_updated":"2025-05-19T18:24:50Z","snapshot_observed_at":"2026-08-09T11:04:51.007349Z","submitted_at":"2025-02-05T00:22:06Z","title":"Speculative Prefill: Turbocharging TTFT with Lightweight and Training-Free Token Importance Estimation","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-09T11:11:17.776294Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2502.02789"},"observation_digest":"sha256:0928e212b46d08c7072188ca0f3b013181706b337d3d81d81b4a42f51f8ea4f6","observation_id":"1bc901b6-2acf-4280-a233-9b90ced92faf","resolution":{"observed_at":"2026-08-09T11:11:17.776294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21465","last_updated":"2025-04-25T19:40:54Z","snapshot_observed_at":"2026-08-01T20:33:25.557711Z","submitted_at":"2024-10-28T19:08:12Z","title":"ShadowKV: KV Cache in Shadows for High-Throughput Long-Context LLM Inference","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21465","snapshot_observed_at":"2026-08-09T11:11:17.779908Z","title":"Shadowkv: Kv cache in shadows for high-throughput long-context llm inference, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02789","last_updated":"2025-05-19T18:24:50Z","snapshot_observed_at":"2026-08-09T11:04:51.007349Z","submitted_at":"2025-02-05T00:22:06Z","title":"Speculative Prefill: Turbocharging TTFT with Lightweight and Training-Free Token Importance Estimation","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-09T11:11:17.779908Z"},"links":{"cited_paper":"/paper/2410.21465","citing_paper":"/paper/2502.02789"},"observation_digest":"sha256:253c58402af3ba97de7af93f27d4388e0a157c6e4d8e64c4bfb87c7e4a8857f9","observation_id":"858ec0b8-1b25-42de-a93e-597ba1aa812a","resolution":{"observed_at":"2026-08-09T11:11:17.779908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-09T11:11:17.783386Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02789","last_updated":"2025-05-19T18:24:50Z","snapshot_observed_at":"2026-08-09T11:04:51.007349Z","submitted_at":"2025-02-05T00:22:06Z","title":"Speculative Prefill: Turbocharging TTFT with Lightweight and Training-Free Token Importance Estimation","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-09T11:11:17.783386Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2502.02789"},"observation_digest":"sha256:2eebdb13732227bc701c4393d6620de570462d7f53d8faad8b2e95343d42cb38","observation_id":"fbe6a1a6-a70f-4a57-83b8-747c165b2d18","resolution":{"observed_at":"2026-08-09T11:11:17.783386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18139","last_updated":"2024-06-26T07:44:24Z","snapshot_observed_at":"2026-08-04T06:27:25.663339Z","submitted_at":"2024-06-26T07:44:24Z","title":"LOOK-M: Look-Once Optimization in KV Cache for Efficient Multimodal Long-Context Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18139","snapshot_observed_at":"2026-08-09T11:11:17.788093Z","title":"Look-m: Look-once optimization in kv cache for efficient multimodal long-context inference, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02789","last_updated":"2025-05-19T18:24:50Z","snapshot_observed_at":"2026-08-09T11:04:51.007349Z","submitted_at":"2025-02-05T00:22:06Z","title":"Speculative Prefill: Turbocharging TTFT with Lightweight and Training-Free Token Importance Estimation","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-09T11:11:17.788093Z"},"links":{"cited_paper":"/paper/2406.18139","citing_paper":"/paper/2502.02789"},"observation_digest":"sha256:ddf1bab067da5a75008b368ce93b75b66597d70bbfc9a31d4e9a9301bb0b8a47","observation_id":"73bf3f2f-7191-4dfb-b041-4b4823b62010","resolution":{"observed_at":"2026-08-09T11:11:17.788093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.07682","last_updated":"2022-10-26T05:06:24Z","snapshot_observed_at":"2026-08-02T15:56:35.249569Z","submitted_at":"2022-06-15T17:32:01Z","title":"Emergent Abilities of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.07682","snapshot_observed_at":"2026-08-09T11:11:17.791959Z","title":"H., Hashimoto, T., Vinyals, O., Liang, P., Dean, J., and Fedus, W","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.02789","last_updated":"2025-05-19T18:24:50Z","snapshot_observed_at":"2026-08-09T11:04:51.007349Z","submitted_at":"2025-02-05T00:22:06Z","title":"Speculative Prefill: Turbocharging TTFT with Lightweight and Training-Free Token Importance Estimation","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-09T11:11:17.791959Z"},"links":{"cited_paper":"/paper/2206.07682","citing_paper":"/paper/2502.02789"},"observation_digest":"sha256:a1d23bcb783af63256db1b5792b3ba9b171af116f94fa53ee726e89b338a3ee7","observation_id":"e4b23d10-0562-4206-9311-5db5d06a788b","resolution":{"observed_at":"2026-08-09T11:11:17.791959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.07851","last_updated":"2024-06-04T17:08:37Z","snapshot_observed_at":"2026-07-06T17:15:46.395218Z","submitted_at":"2024-01-15T17:26:50Z","title":"Unlocking Efficiency in Large Language Model Inference: A Comprehensive Survey of Speculative Decoding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.07851","snapshot_observed_at":"2026-08-09T11:11:17.795746Z","title":"Unlocking efficiency in large language model inference: A comprehensive survey of speculative decoding, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02789","last_updated":"2025-05-19T18:24:50Z","snapshot_observed_at":"2026-08-09T11:04:51.007349Z","submitted_at":"2025-02-05T00:22:06Z","title":"Speculative Prefill: Turbocharging TTFT with Lightweight and Training-Free Token Importance Estimation","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-09T11:11:17.795746Z"},"links":{"cited_paper":"/paper/2401.07851","citing_paper":"/paper/2502.02789"},"observation_digest":"sha256:4118fa91b63ff93468249f6f8fe76196686082c9eea4474373793baec18003f9","observation_id":"771287dc-540e-4263-a3ca-95401869bafc","resolution":{"observed_at":"2026-08-09T11:11:17.795746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10819","last_updated":"2024-10-14T17:59:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-14T17:59:58Z","title":"DuoAttention: Efficient Long-Context LLM Inference with Retrieval and Streaming Heads","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10819","snapshot_observed_at":"2026-08-09T11:11:17.799746Z","title":"Duoattention: Efficient long-context llm inference with retrieval and streaming heads, 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02789","last_updated":"2025-05-19T18:24:50Z","snapshot_observed_at":"2026-08-09T11:04:51.007349Z","submitted_at":"2025-02-05T00:22:06Z","title":"Speculative Prefill: Turbocharging TTFT with Lightweight and Training-Free Token Importance Estimation","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-09T11:11:17.799746Z"},"links":{"cited_paper":"/paper/2410.10819","citing_paper":"/paper/2502.02789"},"observation_digest":"sha256:f604d6459628f1cdcfa81400089d567bf3a9304ba1b0111b0ff97b51b2d0826a","observation_id":"3fbfa1cb-6a3e-4d12-81c3-d6c13e579e7d","resolution":{"observed_at":"2026-08-09T11:11:17.799746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17453","last_updated":"2024-04-07T00:56:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:59:56Z","title":"Efficient Streaming Language Models with Attention Sinks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17453","snapshot_observed_at":"2026-08-09T11:11:17.803412Z","title":"Efficient streaming language models with attention sinks, 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02789","last_updated":"2025-05-19T18:24:50Z","snapshot_observed_at":"2026-08-09T11:04:51.007349Z","submitted_at":"2025-02-05T00:22:06Z","title":"Speculative Prefill: Turbocharging TTFT with Lightweight and Training-Free Token Importance Estimation","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-09T11:11:17.803412Z"},"links":{"cited_paper":"/paper/2309.17453","citing_paper":"/paper/2502.02789"},"observation_digest":"sha256:8f5c8ffb2f7cde4b197c2f292e5e367eeb45f9cbf042449d85a060c971f670cc","observation_id":"ab3ff739-7f95-4d28-933e-196791966058","resolution":{"observed_at":"2026-08-09T11:11:17.803412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16039","last_updated":"2023-11-14T01:40:13Z","snapshot_observed_at":"2026-07-06T16:24:38.375055Z","submitted_at":"2023-09-27T21:41:49Z","title":"Effective Long-Context Scaling of Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16039","snapshot_observed_at":"2026-08-09T11:11:17.807536Z","title":"A., Oguz, B., Khabsa, M., Fang, H., Mehdad, Y., Narang, S., Malik, K., Fan, A., Bhosale, S., Edunov, S., Lewis, M., Wang, S., and Ma, H","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02789","last_updated":"2025-05-19T18:24:50Z","snapshot_observed_at":"2026-08-09T11:04:51.007349Z","submitted_at":"2025-02-05T00:22:06Z","title":"Speculative Prefill: Turbocharging TTFT with Lightweight and Training-Free Token Importance Estimation","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-09T11:11:17.807536Z"},"links":{"cited_paper":"/paper/2309.16039","citing_paper":"/paper/2502.02789"},"observation_digest":"sha256:55e7d7dcac969dd7878ab7a403f730ed1957d2350b95ae127417cd5af40941f7","observation_id":"f80f3215-5206-4997-ac88-d9ea0cd44b21","resolution":{"observed_at":"2026-08-09T11:11:17.807536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-09T11:11:17.811606Z","title":"Qwen2 technical report, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02789","last_updated":"2025-05-19T18:24:50Z","snapshot_observed_at":"2026-08-09T11:04:51.007349Z","submitted_at":"2025-02-05T00:22:06Z","title":"Speculative Prefill: Turbocharging TTFT with Lightweight and Training-Free Token Importance Estimation","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-09T11:11:17.811606Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2502.02789"},"observation_digest":"sha256:7365c0a1e0124b77bcc20c2fbf40c8bb8cb2e55b603fee6328bcfef781111d9d","observation_id":"98b2bab2-103c-456d-90cf-932a6058636a","resolution":{"observed_at":"2026-08-09T11:11:17.811606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16363","last_updated":"2024-05-01T20:42:28Z","snapshot_observed_at":"2026-08-01T22:52:35.092898Z","submitted_at":"2024-02-26T07:33:05Z","title":"LLM Inference Unveiled: Survey and Roofline Model Insights","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16363","snapshot_observed_at":"2026-08-09T11:11:17.815570Z","title":"J., Yan, Y., Chen, B., Sun, G., and Keutzer, K","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02789","last_updated":"2025-05-19T18:24:50Z","snapshot_observed_at":"2026-08-09T11:04:51.007349Z","submitted_at":"2025-02-05T00:22:06Z","title":"Speculative Prefill: Turbocharging TTFT with Lightweight and Training-Free Token Importance Estimation","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-09T11:11:17.815570Z"},"links":{"cited_paper":"/paper/2402.16363","citing_paper":"/paper/2502.02789"},"observation_digest":"sha256:e9112e38ef8aa9a926d12e4193b2123e9f5935f18f6dc29cfd12fb93394735bd","observation_id":"ecfd4f90-ce9d-497b-a883-24e8b28f6620","resolution":{"observed_at":"2026-08-09T11:11:17.815570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.08168","last_updated":"2024-05-20T02:37:20Z","snapshot_observed_at":"2026-07-06T16:18:49.258642Z","submitted_at":"2023-09-15T05:34:32Z","title":"Draft & Verify: Lossless Large Language Model Acceleration via Self-Speculative Decoding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.08168","snapshot_observed_at":"2026-08-09T11:11:17.819360Z","title":"Draft & verify: Lossless large language model acceleration via self-speculative decoding, 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02789","last_updated":"2025-05-19T18:24:50Z","snapshot_observed_at":"2026-08-09T11:04:51.007349Z","submitted_at":"2025-02-05T00:22:06Z","title":"Speculative Prefill: Turbocharging TTFT with Lightweight and Training-Free Token Importance Estimation","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-09T11:11:17.819360Z"},"links":{"cited_paper":"/paper/2309.08168","citing_paper":"/paper/2502.02789"},"observation_digest":"sha256:be95faefaa1858ddbcf9ba639e156966613f264fbf14fa22fab82a0edcea4dbb","observation_id":"fec84020-9065-4149-b785-b80c0267ae27","resolution":{"observed_at":"2026-08-09T11:11:17.819360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-08-06T19:19:02.165567Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14048","snapshot_observed_at":"2026-08-09T11:11:17.823352Z","title":"H _2 o: Heavy-hitter oracle for efficient generative inference of large language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02789","last_updated":"2025-05-19T18:24:50Z","snapshot_observed_at":"2026-08-09T11:04:51.007349Z","submitted_at":"2025-02-05T00:22:06Z","title":"Speculative Prefill: Turbocharging TTFT with Lightweight and Training-Free Token Importance Estimation","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-09T11:11:17.823352Z"},"links":{"cited_paper":"/paper/2306.14048","citing_paper":"/paper/2502.02789"},"observation_digest":"sha256:304b9f06778d6fd5d76f2bdecbb092f41f5dd55f2d78469ec3d74b43fa7393f8","observation_id":"e183dc25-5ec7-4f8a-b359-10b893767903","resolution":{"observed_at":"2026-08-09T11:11:17.823352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:11:30.972143Z","title":"Q-hitter: A better token oracle for efficient llm inference via sparse-quantized kv cache","venue":null,"work_id":"497c9d1f-df7e-4a15-9539-597bd22b6526","year":2024},"citing_paper":{"arxiv_id":"2502.02789","last_updated":"2025-05-19T18:24:50Z","snapshot_observed_at":"2026-08-09T11:04:51.007349Z","submitted_at":"2025-02-05T00:22:06Z","title":"Speculative Prefill: Turbocharging TTFT with Lightweight and Training-Free Token Importance Estimation","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-09T11:11:17.827379Z"},"links":{"citing_paper":"/paper/2502.02789"},"observation_digest":"sha256:ad26131eaef02e1d433d6b764510fa462d0c4e71d4bf76ab379d3f258e9361a1","observation_id":"4df35ab7-1b69-492f-9ad8-f440963f86a7","resolution":{"observed_at":"2026-08-09T11:11:30.978098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-09T11:11:17.832003Z","title":"H., Cao, S., Kozyrakis, C., Stoica, I., Gonzalez, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02789","last_updated":"2025-05-19T18:24:50Z","snapshot_observed_at":"2026-08-09T11:04:51.007349Z","submitted_at":"2025-02-05T00:22:06Z","title":"Speculative Prefill: Turbocharging TTFT with Lightweight and Training-Free Token Importance Estimation","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-09T11:11:17.832003Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2502.02789"},"observation_digest":"sha256:40558599159ee55ba574d9b613ef7492d7bee695bf6fed41f1855e477b3ff602","observation_id":"3cc57133-f199-4d1a-ab98-0d5a9cc4a8f4","resolution":{"observed_at":"2026-08-09T11:11:17.832003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-08-09T11:11:17.835920Z","title":"Instruction-following evaluation for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02789","last_updated":"2025-05-19T18:24:50Z","snapshot_observed_at":"2026-08-09T11:04:51.007349Z","submitted_at":"2025-02-05T00:22:06Z","title":"Speculative Prefill: Turbocharging TTFT with Lightweight and Training-Free Token Importance Estimation","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-09T11:11:17.835920Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2502.02789"},"observation_digest":"sha256:a3d1dd2b5a17ef47fc3e1fb4ecb79c96d22dcf0f05318596fef3020ad71e93b9","observation_id":"9f5f087b-b25b-45c8-9ae1-ec36d0fe213d","resolution":{"observed_at":"2026-08-09T11:11:17.835920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15486","last_updated":"2025-09-03T02:11:32Z","snapshot_observed_at":"2026-07-06T18:35:08.874127Z","submitted_at":"2024-06-17T11:05:15Z","title":"SampleAttention: Near-Lossless Acceleration of Long Context LLM Inference with Adaptive Structured Sparse Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15486","snapshot_observed_at":"2026-08-09T11:11:17.839813Z","title":"Sampleattention: Near-lossless acceleration of long context llm inference with adaptive structured sparse attention, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02789","last_updated":"2025-05-19T18:24:50Z","snapshot_observed_at":"2026-08-09T11:04:51.007349Z","submitted_at":"2025-02-05T00:22:06Z","title":"Speculative Prefill: Turbocharging TTFT with Lightweight and Training-Free Token Importance Estimation","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-09T11:11:17.839813Z"},"links":{"cited_paper":"/paper/2406.15486","citing_paper":"/paper/2502.02789"},"observation_digest":"sha256:09e51400e86a041ccc7af9ee1207932d587c857b05f6df5de187f1bd134d2267","observation_id":"e00000cd-e7e5-4938-b067-d560714c60f6","resolution":{"observed_at":"2026-08-09T11:11:17.839813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.02789","last_updated":"2025-05-19T18:24:50Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T11:04:51.007349Z","submitted_at":"2025-02-05T00:22:06Z","title":"Speculative Prefill: Turbocharging TTFT with Lightweight and Training-Free Token Importance Estimation"},"reference_resolution":{"displayed":59,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":57,"verified_exact":0,"verified_fuzzy":2},"total_outbound_references":59},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 3 inbound Pith citation observations for arXiv:2502.02789."}