{"as_of":"2026-08-13T07:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:98c95bdd60425c5eb8de6daab1eb1c356ff6712d8bd493a871da161295991230","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T16:49:22.119488Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T21:14:49.396548Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-23T05:52:37.366136Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.13157","last_updated":"2024-11-27T03:25:44Z","snapshot_observed_at":"2026-08-12T18:55:40.560075Z","submitted_at":"2024-11-20T09:46:30Z","title":"Closer Look at Efficient Inference Methods: A Survey of Speculative Decoding","version":2},"cited_work":{"arxiv_id":"2411.13157","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.13157","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Closer look at efficient inference methods: A survey of speculative decoding","venue":null,"work_id":"d3987510-903f-4556-a368-bd38dcf63459","year":2024},"citing_paper":{"arxiv_id":"2501.05465","last_updated":"2026-05-14T16:52:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-03T19:53:57Z","title":"Small Language Models (SLMs) Can Still Pack a Punch: A survey (updated 2026)","version":2},"reference_index":108,"source":"pdf_text","source_observed_at":"2026-05-23T05:47:48.488826Z"},"links":{"cited_paper":"/paper/2411.13157","citing_paper":"/paper/2501.05465"},"observation_digest":"sha256:6c5c8ed3cbeb4a718dd233ab564af9faa82349075ef5284d50b10bbd7bd648fc","observation_id":"b8429e6c-757e-45cf-b217-b51061460cec","resolution":{"observed_at":"2026-05-23T05:52:37.369603Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13157","last_updated":"2024-11-27T03:25:44Z","snapshot_observed_at":"2026-08-12T18:55:40.560075Z","submitted_at":"2024-11-20T09:46:30Z","title":"Closer Look at Efficient Inference Methods: A Survey of Speculative Decoding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13157","snapshot_observed_at":"2026-08-02T21:14:49.396548Z","title":"and Kim, E","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.18016","last_updated":"2026-06-01T17:56:47Z","snapshot_observed_at":"2026-08-09T14:28:28.848023Z","submitted_at":"2026-02-24T17:24:50Z","title":"MineDraft: A Framework for Batch Parallel Speculative Decoding","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-02T21:14:49.396548Z"},"links":{"cited_paper":"/paper/2411.13157","citing_paper":"/paper/2603.18016"},"observation_digest":"sha256:4193ffb38176244f02c2a1328a98a2c9a13500c2834e2b6fcb3d8813f3afb2e1","observation_id":"1e4581c2-f0a9-4a66-ac11-d89c5b5ce6e1","resolution":{"observed_at":"2026-08-02T21:14:49.396548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2411.13157/citation-record","integrity":"/paper/2411.13157/integrity","json":"/paper/2411.13157/citation-record.json","paper":"/paper/2411.13157"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.05109","last_updated":"2024-10-07T16:21:29Z","snapshot_observed_at":"2026-08-13T05:24:30.707806Z","submitted_at":"2024-02-07T18:58:50Z","title":"Hydra: Sequentially-Dependent Draft Heads for Medusa Decoding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05109","snapshot_observed_at":"2026-08-12T16:49:21.949062Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13157","last_updated":"2024-11-27T03:25:44Z","snapshot_observed_at":"2026-08-12T18:55:40.560075Z","submitted_at":"2024-11-20T09:46:30Z","title":"Closer Look at Efficient Inference Methods: A Survey of Speculative Decoding","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-12T16:49:21.949062Z"},"links":{"cited_paper":"/paper/2402.05109","citing_paper":"/paper/2411.13157"},"observation_digest":"sha256:81332c19f0d0833349febe1b9b3817aed55b8ed58f474971f17babf86058efcc","observation_id":"0abdf2cf-8cde-4e6f-b36d-9eb5b1a2bb38","resolution":{"observed_at":"2026-08-12T16:49:21.949062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-12T16:49:21.954693Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.13157","last_updated":"2024-11-27T03:25:44Z","snapshot_observed_at":"2026-08-12T18:55:40.560075Z","submitted_at":"2024-11-20T09:46:30Z","title":"Closer Look at Efficient Inference Methods: A Survey of Speculative Decoding","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-12T16:49:21.954693Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2411.13157"},"observation_digest":"sha256:ff92822efdc071511e16de7f7aa5bb95e8a74a8299f6c707920187a79abce037","observation_id":"ee22bae8-de6f-4823-ba50-06861346e704","resolution":{"observed_at":"2026-08-12T16:49:21.954693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10774","last_updated":"2024-06-14T23:32:32Z","snapshot_observed_at":"2026-07-06T17:17:56.276857Z","submitted_at":"2024-01-19T15:48:40Z","title":"Medusa: Simple LLM Inference Acceleration Framework with Multiple Decoding Heads","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10774","snapshot_observed_at":"2026-08-12T16:49:21.959474Z","title":"Lee, Deming Chen, and Tri Dao","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13157","last_updated":"2024-11-27T03:25:44Z","snapshot_observed_at":"2026-08-12T18:55:40.560075Z","submitted_at":"2024-11-20T09:46:30Z","title":"Closer Look at Efficient Inference Methods: A Survey of Speculative Decoding","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-12T16:49:21.959474Z"},"links":{"cited_paper":"/paper/2401.10774","citing_paper":"/paper/2411.13157"},"observation_digest":"sha256:3d60ccec005a0dbbfe63fb0adee60721db1c63ce016822dc189af63d92c2110a","observation_id":"b2de981b-9f46-46ff-b7ba-f463d6da1a1d","resolution":{"observed_at":"2026-08-12T16:49:21.959474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:49:21.963961Z","title":"Venieris, and Hongxiang Fan","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13157","last_updated":"2024-11-27T03:25:44Z","snapshot_observed_at":"2026-08-12T18:55:40.560075Z","submitted_at":"2024-11-20T09:46:30Z","title":"Closer Look at Efficient Inference Methods: A Survey of Speculative Decoding","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-12T16:49:21.963961Z"},"links":{"citing_paper":"/paper/2411.13157"},"observation_digest":"sha256:e9f61a58f1e574376855380232f2f4fbb2ed14031630c09f14c6bd32f0e670a8","observation_id":"be596067-787b-4f63-ae93-cf5097a769d3","resolution":{"observed_at":"2026-08-12T16:49:21.963961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11049","last_updated":"2025-04-02T01:58:38Z","snapshot_observed_at":"2026-08-12T23:00:30.530780Z","submitted_at":"2024-08-20T17:57:31Z","title":"MagicDec: Breaking the Latency-Throughput Tradeoff for Long Context Generation with Speculative Decoding","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11049","snapshot_observed_at":"2026-08-12T16:49:21.968003Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13157","last_updated":"2024-11-27T03:25:44Z","snapshot_observed_at":"2026-08-12T18:55:40.560075Z","submitted_at":"2024-11-20T09:46:30Z","title":"Closer Look at Efficient Inference Methods: A Survey of Speculative Decoding","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-12T16:49:21.968003Z"},"links":{"cited_paper":"/paper/2408.11049","citing_paper":"/paper/2411.13157"},"observation_digest":"sha256:afab163595ae2825edd4b79641e537ab49cfa8d8ce2d2659d417003a0bcb11fe","observation_id":"c6975d42-9037-49d9-898a-845f03dc45e9","resolution":{"observed_at":"2026-08-12T16:49:21.968003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16710","last_updated":"2024-10-18T04:02:31Z","snapshot_observed_at":"2026-08-13T00:22:09.881753Z","submitted_at":"2024-04-25T16:20:23Z","title":"LayerSkip: Enabling Early Exit Inference and Self-Speculative Decoding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16710","snapshot_observed_at":"2026-08-12T16:49:21.972377Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13157","last_updated":"2024-11-27T03:25:44Z","snapshot_observed_at":"2026-08-12T18:55:40.560075Z","submitted_at":"2024-11-20T09:46:30Z","title":"Closer Look at Efficient Inference Methods: A Survey of Speculative Decoding","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-12T16:49:21.972377Z"},"links":{"cited_paper":"/paper/2404.16710","citing_paper":"/paper/2411.13157"},"observation_digest":"sha256:f8f05fec43bce83c487a2bbbf38d8bc76b13eb844a79bbc157f5568d1d1e6676","observation_id":"07188d4d-5a22-405b-bb08-22ab47ce7331","resolution":{"observed_at":"2026-08-12T16:49:21.972377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14057","last_updated":"2024-07-19T06:34:45Z","snapshot_observed_at":"2026-08-12T23:18:57.138931Z","submitted_at":"2024-07-19T06:34:45Z","title":"LazyLLM: Dynamic Token Pruning for Efficient Long Context LLM Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14057","snapshot_observed_at":"2026-08-12T16:49:21.976799Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13157","last_updated":"2024-11-27T03:25:44Z","snapshot_observed_at":"2026-08-12T18:55:40.560075Z","submitted_at":"2024-11-20T09:46:30Z","title":"Closer Look at Efficient Inference Methods: A Survey of Speculative Decoding","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-12T16:49:21.976799Z"},"links":{"cited_paper":"/paper/2407.14057","citing_paper":"/paper/2411.13157"},"observation_digest":"sha256:de8bc02b74962fdbaec70c9cb8889aa54643afa1490c8e7c18b574091c581747","observation_id":"f1e8f27e-4c36-4d5b-a8dd-e8e522e1cc1b","resolution":{"observed_at":"2026-08-12T16:49:21.976799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00858","last_updated":"2024-05-13T18:34:30Z","snapshot_observed_at":"2026-08-13T04:06:05.520150Z","submitted_at":"2024-02-29T19:55:06Z","title":"Direct Alignment of Draft Model for Speculative Decoding with Chat-Fine-Tuned LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.00858","snapshot_observed_at":"2026-08-12T16:49:21.980587Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13157","last_updated":"2024-11-27T03:25:44Z","snapshot_observed_at":"2026-08-12T18:55:40.560075Z","submitted_at":"2024-11-20T09:46:30Z","title":"Closer Look at Efficient Inference Methods: A Survey of Speculative Decoding","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-12T16:49:21.980587Z"},"links":{"cited_paper":"/paper/2403.00858","citing_paper":"/paper/2411.13157"},"observation_digest":"sha256:ca9ef46eccac063940f7adab4a428bd968a4dc41bbae07c2aa7e625f6b825a84","observation_id":"abe529a7-b683-4686-ab18-64dd79546dc9","resolution":{"observed_at":"2026-08-12T16:49:21.980587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16207","last_updated":"2024-07-23T06:21:24Z","snapshot_observed_at":"2026-08-12T23:16:44.032890Z","submitted_at":"2024-07-23T06:21:24Z","title":"Graph-Structured Speculative Decoding","version":1},"cited_work":{"arxiv_id":"2407.16207","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.16207","snapshot_observed_at":"2026-08-12T16:49:22.504417Z","title":"Graph-Structured Speculative Decoding","venue":"cs.CL","work_id":"3c8fcc89-9e1e-4d76-a514-68765dc45430","year":2024},"citing_paper":{"arxiv_id":"2411.13157","last_updated":"2024-11-27T03:25:44Z","snapshot_observed_at":"2026-08-12T18:55:40.560075Z","submitted_at":"2024-11-20T09:46:30Z","title":"Closer Look at Efficient Inference Methods: A Survey of Speculative Decoding","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-12T16:49:21.984449Z"},"links":{"cited_paper":"/paper/2407.16207","citing_paper":"/paper/2411.13157"},"observation_digest":"sha256:9643856b6cc8200af4c705af16b0d2edc8cc73d58c660c0ad04dd68ce859be15","observation_id":"874cc401-3e53-48d5-a40a-e7cdf8612913","resolution":{"observed_at":"2026-08-12T16:49:22.509465Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:49:22.674092Z","title":"Hennessy and David A","venue":null,"work_id":"921220a1-f37b-42d2-a7b4-066eb1bf569b","year":2012},"citing_paper":{"arxiv_id":"2411.13157","last_updated":"2024-11-27T03:25:44Z","snapshot_observed_at":"2026-08-12T18:55:40.560075Z","submitted_at":"2024-11-20T09:46:30Z","title":"Closer Look at Efficient Inference Methods: A Survey of Speculative Decoding","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-12T16:49:21.988466Z"},"links":{"citing_paper":"/paper/2411.13157"},"observation_digest":"sha256:1911f45f3c2218d8f1e6426cb9f7cae5d4092363aa050322f018c185bf86f9d9","observation_id":"f9f8d6c6-2148-456b-b209-0d8740e2e53d","resolution":{"observed_at":"2026-08-12T16:49:22.678088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09751","last_updated":"2020-02-14T21:56:30Z","snapshot_observed_at":"2026-07-06T07:47:32.745963Z","submitted_at":"2019-04-22T07:17:18Z","title":"The Curious Case of Neural Text Degeneration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09751","snapshot_observed_at":"2026-08-12T16:49:21.992107Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.13157","last_updated":"2024-11-27T03:25:44Z","snapshot_observed_at":"2026-08-12T18:55:40.560075Z","submitted_at":"2024-11-20T09:46:30Z","title":"Closer Look at Efficient Inference Methods: A Survey of Speculative Decoding","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-12T16:49:21.992107Z"},"links":{"cited_paper":"/paper/1904.09751","citing_paper":"/paper/2411.13157"},"observation_digest":"sha256:daf469f8a429776c8aac06ce4bdefe63f78929ee6550c1b13dd2f6b6666ce23e","observation_id":"0999b3a0-41dd-41e0-a840-f97b6c267f7a","resolution":{"observed_at":"2026-08-12T16:49:21.992107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19715","last_updated":"2025-07-11T01:33:18Z","snapshot_observed_at":"2026-08-12T23:54:33.795003Z","submitted_at":"2024-05-30T05:49:38Z","title":"SpecDec++: Boosting Speculative Decoding via Adaptive Candidate Lengths","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19715","snapshot_observed_at":"2026-08-12T16:49:21.995860Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13157","last_updated":"2024-11-27T03:25:44Z","snapshot_observed_at":"2026-08-12T18:55:40.560075Z","submitted_at":"2024-11-20T09:46:30Z","title":"Closer Look at Efficient Inference Methods: A Survey of Speculative Decoding","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-12T16:49:21.995860Z"},"links":{"cited_paper":"/paper/2405.19715","citing_paper":"/paper/2411.13157"},"observation_digest":"sha256:c49d1c5503cf802d60aa0dba7c26446b9de85d2f9f965e64f9d6a63771e5c9aa","observation_id":"cc0d3953-17a2-4a76-9e09-025ab2b8bae0","resolution":{"observed_at":"2026-08-12T16:49:21.995860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14160","last_updated":"2024-03-05T06:55:26Z","snapshot_observed_at":"2026-08-13T04:13:20.255050Z","submitted_at":"2024-02-21T22:57:49Z","title":"Recursive Speculative Decoding: Accelerating LLM Inference via Sampling Without Replacement","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14160","snapshot_observed_at":"2026-08-12T16:49:22.001779Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13157","last_updated":"2024-11-27T03:25:44Z","snapshot_observed_at":"2026-08-12T18:55:40.560075Z","submitted_at":"2024-11-20T09:46:30Z","title":"Closer Look at Efficient Inference Methods: A Survey of Speculative Decoding","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-12T16:49:22.001779Z"},"links":{"cited_paper":"/paper/2402.14160","citing_paper":"/paper/2411.13157"},"observation_digest":"sha256:7479e926c1ae6b8f884db7c83d139046cedcc91f9d2d1e54a85ca3ea30dd1b25","observation_id":"7bee0cd3-585c-4d57-9b91-bd87e18bd513","resolution":{"observed_at":"2026-08-12T16:49:22.001779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.10169","last_updated":"2023-07-19T17:55:13Z","snapshot_observed_at":"2026-08-10T14:34:24.189939Z","submitted_at":"2023-07-19T17:55:13Z","title":"Challenges and Applications of Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.10169","snapshot_observed_at":"2026-08-12T16:49:22.005913Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13157","last_updated":"2024-11-27T03:25:44Z","snapshot_observed_at":"2026-08-12T18:55:40.560075Z","submitted_at":"2024-11-20T09:46:30Z","title":"Closer Look at Efficient Inference Methods: A Survey of Speculative Decoding","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-12T16:49:22.005913Z"},"links":{"cited_paper":"/paper/2307.10169","citing_paper":"/paper/2411.13157"},"observation_digest":"sha256:1ea8e72a4edd121e2e6efa74a38eef6fb9c8d406a671c6b9f6d2015d2004015b","observation_id":"8f1f3c4e-f69a-4938-9db7-0c6abfbb3748","resolution":{"observed_at":"2026-08-12T16:49:22.005913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01955","last_updated":"2024-07-02T05:14:15Z","snapshot_observed_at":"2026-08-12T23:30:44.206909Z","submitted_at":"2024-07-02T05:14:15Z","title":"S2D: Sorted Speculative Decoding For More Efficient Deployment of Nested Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01955","snapshot_observed_at":"2026-08-12T16:49:22.009699Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13157","last_updated":"2024-11-27T03:25:44Z","snapshot_observed_at":"2026-08-12T18:55:40.560075Z","submitted_at":"2024-11-20T09:46:30Z","title":"Closer Look at Efficient Inference Methods: A Survey of Speculative Decoding","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-12T16:49:22.009699Z"},"links":{"cited_paper":"/paper/2407.01955","citing_paper":"/paper/2411.13157"},"observation_digest":"sha256:70c1fd0e21ab5dba3144d23385f0bd18016f9e19f7a86be141760b36e3cf1808","observation_id":"2807b841-f987-422f-8170-466e7ae4faae","resolution":{"observed_at":"2026-08-12T16:49:22.009699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09221","last_updated":"2024-06-05T05:00:35Z","snapshot_observed_at":"2026-08-13T00:30:33.837898Z","submitted_at":"2024-04-14T11:49:38Z","title":"Exploring and Improving Drafts in Blockwise Parallel Decoding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09221","snapshot_observed_at":"2026-08-12T16:49:22.013856Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13157","last_updated":"2024-11-27T03:25:44Z","snapshot_observed_at":"2026-08-12T18:55:40.560075Z","submitted_at":"2024-11-20T09:46:30Z","title":"Closer Look at Efficient Inference Methods: A Survey of Speculative Decoding","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-12T16:49:22.013856Z"},"links":{"cited_paper":"/paper/2404.09221","citing_paper":"/paper/2411.13157"},"observation_digest":"sha256:be158ec868d9cffa1a2c07389f2c5c8e688355eb408a56d9a87bb4b959135be3","observation_id":"32bcd353-1a6e-4f61-9fb1-6c54de0bb76a","resolution":{"observed_at":"2026-08-12T16:49:22.013856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.17192","last_updated":"2023-05-18T20:28:20Z","snapshot_observed_at":"2026-08-08T11:03:33.403601Z","submitted_at":"2022-11-30T17:33:28Z","title":"Fast Inference from Transformers via Speculative Decoding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.17192","snapshot_observed_at":"2026-08-12T16:49:22.018382Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13157","last_updated":"2024-11-27T03:25:44Z","snapshot_observed_at":"2026-08-12T18:55:40.560075Z","submitted_at":"2024-11-20T09:46:30Z","title":"Closer Look at Efficient Inference Methods: A Survey of Speculative Decoding","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-12T16:49:22.018382Z"},"links":{"cited_paper":"/paper/2211.17192","citing_paper":"/paper/2411.13157"},"observation_digest":"sha256:d8df67556b8d14f372e63868d0c769e37e38d954660942ab4db176e1f22da9f9","observation_id":"fc5a947c-d673-479f-923e-0733027509a9","resolution":{"observed_at":"2026-08-12T16:49:22.018382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16858","last_updated":"2024-06-30T15:03:25Z","snapshot_observed_at":"2026-08-12T23:35:52.061974Z","submitted_at":"2024-06-24T17:59:11Z","title":"EAGLE-2: Faster Inference of Language Models with Dynamic Draft Trees","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16858","snapshot_observed_at":"2026-08-12T16:49:22.023146Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13157","last_updated":"2024-11-27T03:25:44Z","snapshot_observed_at":"2026-08-12T18:55:40.560075Z","submitted_at":"2024-11-20T09:46:30Z","title":"Closer Look at Efficient Inference Methods: A Survey of Speculative Decoding","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-12T16:49:22.023146Z"},"links":{"cited_paper":"/paper/2406.16858","citing_paper":"/paper/2411.13157"},"observation_digest":"sha256:4c98f4ee1841bbf9cf46c9decf8fa951c8ca1af37a2cc4cb56341658e7ee219c","observation_id":"d36b7f12-c9d6-4ba6-b500-208fba847f01","resolution":{"observed_at":"2026-08-12T16:49:22.023146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.15077","last_updated":"2025-03-04T13:58:39Z","snapshot_observed_at":"2026-08-03T09:40:31.365295Z","submitted_at":"2024-01-26T18:59:01Z","title":"EAGLE: Speculative Sampling Requires Rethinking Feature Uncertainty","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.15077","snapshot_observed_at":"2026-08-12T16:49:22.028419Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13157","last_updated":"2024-11-27T03:25:44Z","snapshot_observed_at":"2026-08-12T18:55:40.560075Z","submitted_at":"2024-11-20T09:46:30Z","title":"Closer Look at Efficient Inference Methods: A Survey of Speculative Decoding","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-12T16:49:22.028419Z"},"links":{"cited_paper":"/paper/2401.15077","citing_paper":"/paper/2411.13157"},"observation_digest":"sha256:ebc9e4b06cd63267fde3f65c8b8d7c26e20f249ac8614566ffd079d5ad12d2c2","observation_id":"e5325b75-6181-46e6-9373-c4b5ba1b1d63","resolution":{"observed_at":"2026-08-12T16:49:22.028419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.findings-naacl.63","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:49:22.146657Z","title":null,"venue":null,"work_id":"95f3c145-f09e-4c9d-a1a5-9be563dad093","year":2024},"citing_paper":{"arxiv_id":"2411.13157","last_updated":"2024-11-27T03:25:44Z","snapshot_observed_at":"2026-08-12T18:55:40.560075Z","submitted_at":"2024-11-20T09:46:30Z","title":"Closer Look at Efficient Inference Methods: A Survey of Speculative Decoding","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-12T16:49:22.033038Z"},"links":{"citing_paper":"/paper/2411.13157"},"observation_digest":"sha256:ea5c8dde71a385c22b4c390766f8a4913174a27352ae04579dddab8a12d29a21","observation_id":"cc622119-7f13-4af3-9e5a-b57751ecf335","resolution":{"observed_at":"2026-08-12T16:49:22.151546Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04532","last_updated":"2025-05-01T02:14:05Z","snapshot_observed_at":"2026-08-13T00:12:52.272658Z","submitted_at":"2024-05-07T17:59:30Z","title":"QServe: W4A8KV4 Quantization and System Co-design for Efficient LLM Serving","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04532","snapshot_observed_at":"2026-08-12T16:49:22.036883Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13157","last_updated":"2024-11-27T03:25:44Z","snapshot_observed_at":"2026-08-12T18:55:40.560075Z","submitted_at":"2024-11-20T09:46:30Z","title":"Closer Look at Efficient Inference Methods: A Survey of Speculative Decoding","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-12T16:49:22.036883Z"},"links":{"cited_paper":"/paper/2405.04532","citing_paper":"/paper/2411.13157"},"observation_digest":"sha256:138f892c4483cfe2eaa8f6d76e3cc4bc875581fc29f1809990729ee3b462b030","observation_id":"be7a49e3-da9d-4777-a1a0-900695a64818","resolution":{"observed_at":"2026-08-12T16:49:22.036883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03853","last_updated":"2024-06-06T08:40:28Z","snapshot_observed_at":"2026-08-12T23:49:00.666045Z","submitted_at":"2024-06-06T08:40:28Z","title":"Speculative Decoding via Early-exiting for Faster LLM Inference with Thompson Sampling Control Mechanism","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03853","snapshot_observed_at":"2026-08-12T16:49:22.040682Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13157","last_updated":"2024-11-27T03:25:44Z","snapshot_observed_at":"2026-08-12T18:55:40.560075Z","submitted_at":"2024-11-20T09:46:30Z","title":"Closer Look at Efficient Inference Methods: A Survey of Speculative Decoding","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-12T16:49:22.040682Z"},"links":{"cited_paper":"/paper/2406.03853","citing_paper":"/paper/2411.13157"},"observation_digest":"sha256:dffd9be0d16006a387032e31845899e2d7d16cc057106e09885b79c04d117dbd","observation_id":"6ba9773e-0a74-4e05-a19a-0cae9258f561","resolution":{"observed_at":"2026-08-12T16:49:22.040682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14066","last_updated":"2025-07-27T03:20:41Z","snapshot_observed_at":"2026-08-12T23:38:38.849903Z","submitted_at":"2024-06-20T07:43:33Z","title":"TurboSpec: Closed-loop Speculation Control System for Optimizing LLM Serving Goodput","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14066","snapshot_observed_at":"2026-08-12T16:49:22.044631Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13157","last_updated":"2024-11-27T03:25:44Z","snapshot_observed_at":"2026-08-12T18:55:40.560075Z","submitted_at":"2024-11-20T09:46:30Z","title":"Closer Look at Efficient Inference Methods: A Survey of Speculative Decoding","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-12T16:49:22.044631Z"},"links":{"cited_paper":"/paper/2406.14066","citing_paper":"/paper/2411.13157"},"observation_digest":"sha256:a16b65184c16372aa31689eb9d734eaa2526abc5ec4e65fbd03448b89ec4fd66","observation_id":"17217c18-239e-4b89-bd91-465afb186577","resolution":{"observed_at":"2026-08-12T16:49:22.044631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07177","last_updated":"2024-06-10T01:36:31Z","snapshot_observed_at":"2026-08-13T05:52:30.524254Z","submitted_at":"2023-10-11T04:03:42Z","title":"Online Speculative Decoding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07177","snapshot_observed_at":"2026-08-12T16:49:22.048449Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13157","last_updated":"2024-11-27T03:25:44Z","snapshot_observed_at":"2026-08-12T18:55:40.560075Z","submitted_at":"2024-11-20T09:46:30Z","title":"Closer Look at Efficient Inference Methods: A Survey of Speculative Decoding","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-12T16:49:22.048449Z"},"links":{"cited_paper":"/paper/2310.07177","citing_paper":"/paper/2411.13157"},"observation_digest":"sha256:0b27b104bcc4dfcb45bff2823fb6b95b44666dc11d6b4ef8801eb08d98c8b94a","observation_id":"a1614b59-c72a-415e-a2ab-ed70a576fe69","resolution":{"observed_at":"2026-08-12T16:49:22.048449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07542","last_updated":"2024-10-14T02:55:33Z","snapshot_observed_at":"2026-08-13T00:09:07.617311Z","submitted_at":"2024-05-13T08:24:21Z","title":"EMS-SD: Efficient Multi-sample Speculative Decoding for Accelerating Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.07542","snapshot_observed_at":"2026-08-12T16:49:22.052301Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13157","last_updated":"2024-11-27T03:25:44Z","snapshot_observed_at":"2026-08-12T18:55:40.560075Z","submitted_at":"2024-11-20T09:46:30Z","title":"Closer Look at Efficient Inference Methods: A Survey of Speculative Decoding","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-12T16:49:22.052301Z"},"links":{"cited_paper":"/paper/2405.07542","citing_paper":"/paper/2411.13157"},"observation_digest":"sha256:883e77447d87833a1474d3f2f876ca4ed92cefe7cc09f5b39515a97de294a003","observation_id":"95c9c5a4-d499-4ee5-9549-a12ad577cb98","resolution":{"observed_at":"2026-08-12T16:49:22.052301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.06856","last_updated":"2024-05-11T00:00:23Z","snapshot_observed_at":"2026-08-13T00:09:55.953046Z","submitted_at":"2024-05-11T00:00:23Z","title":"Aladdin: Joint Placement and Scaling for SLO-Aware LLM Serving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.06856","snapshot_observed_at":"2026-08-12T16:49:22.056194Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13157","last_updated":"2024-11-27T03:25:44Z","snapshot_observed_at":"2026-08-12T18:55:40.560075Z","submitted_at":"2024-11-20T09:46:30Z","title":"Closer Look at Efficient Inference Methods: A Survey of Speculative Decoding","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-12T16:49:22.056194Z"},"links":{"cited_paper":"/paper/2405.06856","citing_paper":"/paper/2411.13157"},"observation_digest":"sha256:df3b59f213a5609640a462fb41d4c506c4dde43bac9113e8f3b15102e1e435a4","observation_id":"7f645844-ee90-45e6-a8e6-24cf1b32dfad","resolution":{"observed_at":"2026-08-12T16:49:22.056194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.15778","last_updated":"2024-06-26T17:29:46Z","snapshot_observed_at":"2026-08-13T00:23:09.578424Z","submitted_at":"2024-04-24T09:57:11Z","title":"BASS: Batched Attention-optimized Speculative Sampling","version":2},"cited_work":{"arxiv_id":"2404.15778","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.15778","snapshot_observed_at":"2026-08-12T16:49:22.312967Z","title":"BASS: Batched Attention-optimized Speculative Sampling","venue":"cs.LG","work_id":"6124d6f8-7a91-43a0-be81-9d84db1b69f7","year":2024},"citing_paper":{"arxiv_id":"2411.13157","last_updated":"2024-11-27T03:25:44Z","snapshot_observed_at":"2026-08-12T18:55:40.560075Z","submitted_at":"2024-11-20T09:46:30Z","title":"Closer Look at Efficient Inference Methods: A Survey of Speculative Decoding","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-12T16:49:22.059842Z"},"links":{"cited_paper":"/paper/2404.15778","citing_paper":"/paper/2411.13157"},"observation_digest":"sha256:5ee6deb517f42724915ba82e6dc91e9b84cd360c8ed8d55c6832841e2ed34005","observation_id":"f275e36b-fef8-4079-b1a3-dee89fa75110","resolution":{"observed_at":"2026-08-12T16:49:22.317757Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.02150","last_updated":"2019-11-06T00:19:05Z","snapshot_observed_at":"2026-07-06T08:35:01.386074Z","submitted_at":"2019-11-06T00:19:05Z","title":"Fast Transformer Decoding: One Write-Head is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.02150","snapshot_observed_at":"2026-08-12T16:49:22.063495Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.13157","last_updated":"2024-11-27T03:25:44Z","snapshot_observed_at":"2026-08-12T18:55:40.560075Z","submitted_at":"2024-11-20T09:46:30Z","title":"Closer Look at Efficient Inference Methods: A Survey of Speculative Decoding","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-12T16:49:22.063495Z"},"links":{"cited_paper":"/paper/1911.02150","citing_paper":"/paper/2411.13157"},"observation_digest":"sha256:34ac619a6c556f972d60e20ffac987d32e041de3c5ad2918f462b96c2e34d0cc","observation_id":"2b2d2d00-3927-4f2c-8462-3032f9a881e9","resolution":{"observed_at":"2026-08-12T16:49:22.063495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.06925","last_updated":"2024-10-08T07:46:47Z","snapshot_observed_at":"2026-08-13T04:22:05.711789Z","submitted_at":"2024-02-10T11:14:53Z","title":"A Thorough Examination of Decoding Methods in the Era of LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.06925","snapshot_observed_at":"2026-08-12T16:49:22.067366Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13157","last_updated":"2024-11-27T03:25:44Z","snapshot_observed_at":"2026-08-12T18:55:40.560075Z","submitted_at":"2024-11-20T09:46:30Z","title":"Closer Look at Efficient Inference Methods: A Survey of Speculative Decoding","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-12T16:49:22.067366Z"},"links":{"cited_paper":"/paper/2402.06925","citing_paper":"/paper/2411.13157"},"observation_digest":"sha256:04ed0834145441901c350e5388fc8c4482a71ba18cf303193c85189ff07a0c1b","observation_id":"16516d35-5d27-4371-9ef7-d1897b44d049","resolution":{"observed_at":"2026-08-12T16:49:22.067366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.03115","last_updated":"2018-11-07T19:09:40Z","snapshot_observed_at":"2026-08-11T01:49:32.059098Z","submitted_at":"2018-11-07T19:09:40Z","title":"Blockwise Parallel Decoding for Deep Autoregressive Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.03115","snapshot_observed_at":"2026-08-12T16:49:22.071435Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.13157","last_updated":"2024-11-27T03:25:44Z","snapshot_observed_at":"2026-08-12T18:55:40.560075Z","submitted_at":"2024-11-20T09:46:30Z","title":"Closer Look at Efficient Inference Methods: A Survey of Speculative Decoding","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-12T16:49:22.071435Z"},"links":{"cited_paper":"/paper/1811.03115","citing_paper":"/paper/2411.13157"},"observation_digest":"sha256:bd752bf38962a754cbc6e52c0bcae45314674c552a8f09b91bb026ae69f49eb8","observation_id":"d952aa2c-dc8d-46d5-bae1-42a5ba7a9efd","resolution":{"observed_at":"2026-08-12T16:49:22.071435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.11912","last_updated":"2024-08-04T00:58:04Z","snapshot_observed_at":"2026-08-13T00:27:40.768040Z","submitted_at":"2024-04-18T05:25:54Z","title":"TriForce: Lossless Acceleration of Long Sequence Generation with Hierarchical Speculative Decoding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.11912","snapshot_observed_at":"2026-08-12T16:49:22.075191Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13157","last_updated":"2024-11-27T03:25:44Z","snapshot_observed_at":"2026-08-12T18:55:40.560075Z","submitted_at":"2024-11-20T09:46:30Z","title":"Closer Look at Efficient Inference Methods: A Survey of Speculative Decoding","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-12T16:49:22.075191Z"},"links":{"cited_paper":"/paper/2404.11912","citing_paper":"/paper/2411.13157"},"observation_digest":"sha256:3b32394ead40592b7e1aff8657c7c0834a469aacf96a87932a3341355b66254a","observation_id":"fdb70399-e86a-418a-90a7-a6a4e4d6bcbd","resolution":{"observed_at":"2026-08-12T16:49:22.075191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02532","last_updated":"2024-11-30T21:33:59Z","snapshot_observed_at":"2026-08-12T23:50:15.896281Z","submitted_at":"2024-06-04T17:53:36Z","title":"SpecExec: Massively Parallel Speculative Decoding for Interactive LLM Inference on Consumer Devices","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02532","snapshot_observed_at":"2026-08-12T16:49:22.079379Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13157","last_updated":"2024-11-27T03:25:44Z","snapshot_observed_at":"2026-08-12T18:55:40.560075Z","submitted_at":"2024-11-20T09:46:30Z","title":"Closer Look at Efficient Inference Methods: A Survey of Speculative Decoding","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-12T16:49:22.079379Z"},"links":{"cited_paper":"/paper/2406.02532","citing_paper":"/paper/2411.13157"},"observation_digest":"sha256:fa5396d74dc95aa374d2d0b3578a5d2be93afa609fc45f01aed9b9b11a4d6e94","observation_id":"84b2bb9d-d6d4-41f5-b1e3-78598bc1ce1c","resolution":{"observed_at":"2026-08-12T16:49:22.079379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.08239","last_updated":"2022-02-10T16:30:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-01-20T15:44:37Z","title":"LaMDA: Language Models for Dialog Applications","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.08239","snapshot_observed_at":"2026-08-12T16:49:22.083189Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.13157","last_updated":"2024-11-27T03:25:44Z","snapshot_observed_at":"2026-08-12T18:55:40.560075Z","submitted_at":"2024-11-20T09:46:30Z","title":"Closer Look at Efficient Inference Methods: A Survey of Speculative Decoding","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-12T16:49:22.083189Z"},"links":{"cited_paper":"/paper/2201.08239","citing_paper":"/paper/2411.13157"},"observation_digest":"sha256:78208c14bdaeaa09789c7f829697fca6c02510731d736da8d825c920b7a8f817","observation_id":"b4aa017e-1ba6-4363-958b-efa98f08795a","resolution":{"observed_at":"2026-08-12T16:49:22.083189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17276","last_updated":"2025-04-24T08:52:19Z","snapshot_observed_at":"2026-08-13T05:01:46.355716Z","submitted_at":"2024-06-25T04:45:53Z","title":"OPT-Tree: Speculative Decoding with Adaptive Draft Tree Structure","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17276","snapshot_observed_at":"2026-08-12T16:49:22.091326Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13157","last_updated":"2024-11-27T03:25:44Z","snapshot_observed_at":"2026-08-12T18:55:40.560075Z","submitted_at":"2024-11-20T09:46:30Z","title":"Closer Look at Efficient Inference Methods: A Survey of Speculative Decoding","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-12T16:49:22.091326Z"},"links":{"cited_paper":"/paper/2406.17276","citing_paper":"/paper/2411.13157"},"observation_digest":"sha256:b4de3931d6bde6a1fb5721048e5c7792250a4bda2fef97c758c04bd3273d6765","observation_id":"e9416438-faa4-4589-8eb6-1ca6764a495f","resolution":{"observed_at":"2026-08-12T16:49:22.091326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.07851","last_updated":"2024-06-04T17:08:37Z","snapshot_observed_at":"2026-08-13T04:42:35.832870Z","submitted_at":"2024-01-15T17:26:50Z","title":"Unlocking Efficiency in Large Language Model Inference: A Comprehensive Survey of Speculative Decoding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.07851","snapshot_observed_at":"2026-08-12T16:49:22.096162Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13157","last_updated":"2024-11-27T03:25:44Z","snapshot_observed_at":"2026-08-12T18:55:40.560075Z","submitted_at":"2024-11-20T09:46:30Z","title":"Closer Look at Efficient Inference Methods: A Survey of Speculative Decoding","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-12T16:49:22.096162Z"},"links":{"cited_paper":"/paper/2401.07851","citing_paper":"/paper/2411.13157"},"observation_digest":"sha256:e41094b34c8f5e806c4bddcc34bdc1197917b0d2b767ac26b2b4b93273283db6","observation_id":"917008b4-235a-437f-8a8f-eeb94b1ac049","resolution":{"observed_at":"2026-08-12T16:49:22.096162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15758","last_updated":"2024-04-18T16:23:16Z","snapshot_observed_at":"2026-08-13T04:10:59.265786Z","submitted_at":"2024-02-24T08:10:39Z","title":"Chimera: A Lossless Decoding Method for Accelerating Large Language Models Inference by Fusing all Tokens","version":2},"cited_work":{"arxiv_id":"2402.15758","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.15758","snapshot_observed_at":"2026-08-12T16:49:22.201943Z","title":"Chimera: A Lossless Decoding Method for Accelerating Large Language Models Inference by Fusing all Tokens","venue":"cs.CL","work_id":"fe72f0cb-50de-47db-8635-aa289931fad9","year":2024},"citing_paper":{"arxiv_id":"2411.13157","last_updated":"2024-11-27T03:25:44Z","snapshot_observed_at":"2026-08-12T18:55:40.560075Z","submitted_at":"2024-11-20T09:46:30Z","title":"Closer Look at Efficient Inference Methods: A Survey of Speculative Decoding","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-12T16:49:22.100106Z"},"links":{"cited_paper":"/paper/2402.15758","citing_paper":"/paper/2411.13157"},"observation_digest":"sha256:fb8721e90cb1f77c33f92b05e604ab405efe4a29523da79441425b2c83fc6b35","observation_id":"df77fa73-b2b9-41bc-9743-e0bd889b5664","resolution":{"observed_at":"2026-08-12T16:49:22.207486Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15766","last_updated":"2025-02-26T11:47:58Z","snapshot_observed_at":"2026-08-12T22:55:55.064746Z","submitted_at":"2024-08-28T12:59:12Z","title":"Learning Harmonized Representations for Speculative Sampling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15766","snapshot_observed_at":"2026-08-12T16:49:22.103844Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13157","last_updated":"2024-11-27T03:25:44Z","snapshot_observed_at":"2026-08-12T18:55:40.560075Z","submitted_at":"2024-11-20T09:46:30Z","title":"Closer Look at Efficient Inference Methods: A Survey of Speculative Decoding","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-12T16:49:22.103844Z"},"links":{"cited_paper":"/paper/2408.15766","citing_paper":"/paper/2411.13157"},"observation_digest":"sha256:0af6094b3f715d0f8d4b437c0e21ac5a90b2ec587c43f4d0a7ca401bdb5d506b","observation_id":"6f858e5b-7290-4b3f-a779-42811aa61ce0","resolution":{"observed_at":"2026-08-12T16:49:22.103844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.12728","last_updated":"2024-05-30T11:25:08Z","snapshot_observed_at":"2026-08-13T04:58:00.331388Z","submitted_at":"2023-12-20T02:55:15Z","title":"Lookahead: An Inference Acceleration Framework for Large Language Model with Lossless Generation Accuracy","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.12728","snapshot_observed_at":"2026-08-12T16:49:22.107629Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13157","last_updated":"2024-11-27T03:25:44Z","snapshot_observed_at":"2026-08-12T18:55:40.560075Z","submitted_at":"2024-11-20T09:46:30Z","title":"Closer Look at Efficient Inference Methods: A Survey of Speculative Decoding","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-12T16:49:22.107629Z"},"links":{"cited_paper":"/paper/2312.12728","citing_paper":"/paper/2411.13157"},"observation_digest":"sha256:f0c40a34e7f7d63a528cd0e31b9abcb003805c6a84c0f807a1191cd99e27f417","observation_id":"65acae3d-50cb-4ef2-8b7a-53141b7509bb","resolution":{"observed_at":"2026-08-12T16:49:22.107629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13485","last_updated":"2024-02-21T02:51:07Z","snapshot_observed_at":"2026-08-13T04:14:04.836979Z","submitted_at":"2024-02-21T02:51:07Z","title":"ProPD: Dynamic Token Tree Pruning and Generation for LLM Parallel Decoding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13485","snapshot_observed_at":"2026-08-12T16:49:22.111443Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13157","last_updated":"2024-11-27T03:25:44Z","snapshot_observed_at":"2026-08-12T18:55:40.560075Z","submitted_at":"2024-11-20T09:46:30Z","title":"Closer Look at Efficient Inference Methods: A Survey of Speculative Decoding","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-12T16:49:22.111443Z"},"links":{"cited_paper":"/paper/2402.13485","citing_paper":"/paper/2411.13157"},"observation_digest":"sha256:2d6ceaf4911050f6d208d6b3761b4662386eb951f2480b5711b0d505b99d6a3a","observation_id":"eaa754bb-750c-4a9c-b523-204b3f353780","resolution":{"observed_at":"2026-08-12T16:49:22.111443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:49:22.115235Z","title":"URL: \" 'urlintro :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.13157","last_updated":"2024-11-27T03:25:44Z","snapshot_observed_at":"2026-08-12T18:55:40.560075Z","submitted_at":"2024-11-20T09:46:30Z","title":"Closer Look at Efficient Inference Methods: A Survey of Speculative Decoding","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-12T16:49:22.115235Z"},"links":{"citing_paper":"/paper/2411.13157"},"observation_digest":"sha256:2f7dddf4f2fa9f1a332cf90cb3fdf68623b2f9669d61ecb890d4dcdf1200087d","observation_id":"95b8f6fc-a444-400e-b818-03f87c1caaa1","resolution":{"observed_at":"2026-08-12T16:49:22.115235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:49:22.119488Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.13157","last_updated":"2024-11-27T03:25:44Z","snapshot_observed_at":"2026-08-12T18:55:40.560075Z","submitted_at":"2024-11-20T09:46:30Z","title":"Closer Look at Efficient Inference Methods: A Survey of Speculative Decoding","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-12T16:49:22.119488Z"},"links":{"citing_paper":"/paper/2411.13157"},"observation_digest":"sha256:a3d75083493a49e73a735cc44300a1e958e4c0bfa2d62d899d1b1dfd9edde240","observation_id":"41d1e8b3-c7e6-4157-870d-e57bf8da292a","resolution":{"observed_at":"2026-08-12T16:49:22.119488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2411.13157","last_updated":"2024-11-27T03:25:44Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-12T18:55:40.560075Z","submitted_at":"2024-11-20T09:46:30Z","title":"Closer Look at Efficient Inference Methods: A Survey of Speculative Decoding"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":36,"verified_exact":4,"verified_fuzzy":1},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 2 inbound Pith citation observations for arXiv:2411.13157."}