{"as_of":"2026-08-19T01:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f62cd655c5c9cd02c199ca36889acdaa25e57621b86b147c314e1d5e06b3088b","coverage":[{"denominator":28,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T13:15:07.306486Z","state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:16:26.218271Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-28T19:02:34.639740Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.00061","last_updated":"2024-11-25T14:10:21Z","snapshot_observed_at":"2026-08-18T07:16:48.734774Z","submitted_at":"2024-11-25T14:10:21Z","title":"Speculative Decoding with CTC-based Draft Model for LLM Inference Acceleration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00061","snapshot_observed_at":"2026-08-07T11:16:26.218271Z","title":"DOI: https://doi.org/10.48550/arXiv.2412.00061 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05387","last_updated":"2025-06-11T16:08:29Z","snapshot_observed_at":"2026-08-13T07:03:43.882155Z","submitted_at":"2025-06-03T14:25:23Z","title":"Advancing Decoding Strategies: Enhancements in Locally Typical Sampling for LLMs","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:26.218271Z"},"links":{"cited_paper":"/paper/2412.00061","citing_paper":"/paper/2506.05387"},"observation_digest":"sha256:d8c68533aa87119dde7348a2f46846d3df8008d11f3b115fdbcab6f477b052d3","observation_id":"dfaa0113-e027-4ed0-9e7f-fb27dead30ad","resolution":{"observed_at":"2026-08-07T11:16:26.218271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00061","last_updated":"2024-11-25T14:10:21Z","snapshot_observed_at":"2026-08-18T07:16:48.734774Z","submitted_at":"2024-11-25T14:10:21Z","title":"Speculative Decoding with CTC-based Draft Model for LLM Inference Acceleration","version":1},"cited_work":{"arxiv_id":"2412.00061","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.00061","snapshot_observed_at":"2026-06-28T19:02:34.639740Z","title":"arXiv preprint arXiv:2412.00061 , year=","venue":null,"work_id":"d687bf67-96c0-4189-8172-2fe574e520f1","year":null},"citing_paper":{"arxiv_id":"2606.00535","last_updated":"2026-05-30T05:05:24Z","snapshot_observed_at":"2026-08-16T00:43:44.943332Z","submitted_at":"2026-05-30T05:05:24Z","title":"DREAM-S: Speculative Decoding with Searchable Drafting and Target-Aware Refinement for Multimodal Generation","version":1},"reference_index":112,"source":"arxiv_source","source_observed_at":"2026-06-28T18:55:51.474956Z"},"links":{"cited_paper":"/paper/2412.00061","citing_paper":"/paper/2606.00535"},"observation_digest":"sha256:cf0dbb5bef013da4d11f523212f3e2f6a7bcd276cd08b966b899d773fa70fcec","observation_id":"9c1fd930-b4d6-41aa-ae7c-cadfb9313ffb","resolution":{"observed_at":"2026-06-28T19:02:34.641097Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.00061/citation-record","integrity":"/paper/2412.00061/integrity","json":"/paper/2412.00061/citation-record.json","paper":"/paper/2412.00061"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-12T13:15:07.134891Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00061","last_updated":"2024-11-25T14:10:21Z","snapshot_observed_at":"2026-08-18T07:16:48.734774Z","submitted_at":"2024-11-25T14:10:21Z","title":"Speculative Decoding with CTC-based Draft Model for LLM Inference Acceleration","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T13:15:07.134891Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2412.00061"},"observation_digest":"sha256:2c90fbc4409d060696ae5452f25a97e3090fc2179c5afc5bf8747e71e7014fed","observation_id":"7dafc0a5-e07b-4b38-9f4c-963008ed5712","resolution":{"observed_at":"2026-08-12T13:15:07.134891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05109","last_updated":"2024-10-07T16:21:29Z","snapshot_observed_at":"2026-08-17T14:00:35.798553Z","submitted_at":"2024-02-07T18:58:50Z","title":"Hydra: Sequentially-Dependent Draft Heads for Medusa Decoding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05109","snapshot_observed_at":"2026-08-12T13:15:07.141779Z","title":"Hydra: Sequentially-dependent draft heads for medusa decoding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00061","last_updated":"2024-11-25T14:10:21Z","snapshot_observed_at":"2026-08-18T07:16:48.734774Z","submitted_at":"2024-11-25T14:10:21Z","title":"Speculative Decoding with CTC-based Draft Model for LLM Inference Acceleration","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T13:15:07.141779Z"},"links":{"cited_paper":"/paper/2402.05109","citing_paper":"/paper/2412.00061"},"observation_digest":"sha256:0a38bc3b18686295e11d2d3bc337b34cf33e54d4ba62cb8416a760a21cf81e9a","observation_id":"81e64fd7-4189-4b95-a1f8-8a6d545713fe","resolution":{"observed_at":"2026-08-12T13:15:07.141779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:15:07.796518Z","title":"Medusa: Simple framework for accelerating llm generation with multiple decoding heads, 2023","venue":null,"work_id":"2586c870-2fc2-4a79-874f-2bfe47770aef","year":2023},"citing_paper":{"arxiv_id":"2412.00061","last_updated":"2024-11-25T14:10:21Z","snapshot_observed_at":"2026-08-18T07:16:48.734774Z","submitted_at":"2024-11-25T14:10:21Z","title":"Speculative Decoding with CTC-based Draft Model for LLM Inference Acceleration","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T13:15:07.147755Z"},"links":{"citing_paper":"/paper/2412.00061"},"observation_digest":"sha256:f0313d28124977f13495d7b1fcde015d738cdc85ed86e186f644e925721408b4","observation_id":"39c6ce24-f594-4281-973d-e1b8eceb7b43","resolution":{"observed_at":"2026-08-12T13:15:07.802892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.01318","last_updated":"2023-02-02T18:44:11Z","snapshot_observed_at":"2026-08-13T23:55:57.074762Z","submitted_at":"2023-02-02T18:44:11Z","title":"Accelerating Large Language Model Decoding with Speculative Sampling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.01318","snapshot_observed_at":"2026-08-12T13:15:07.154072Z","title":"Accelerating large language model decoding with speculative sampling","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00061","last_updated":"2024-11-25T14:10:21Z","snapshot_observed_at":"2026-08-18T07:16:48.734774Z","submitted_at":"2024-11-25T14:10:21Z","title":"Speculative Decoding with CTC-based Draft Model for LLM Inference Acceleration","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T13:15:07.154072Z"},"links":{"cited_paper":"/paper/2302.01318","citing_paper":"/paper/2412.00061"},"observation_digest":"sha256:12e4008139c8d3e982e0d8f7e0f9c11b980327d89240f9501cb21328d01c2ac9","observation_id":"cdc6218a-69f1-4979-98a0-ea0fcf3165cc","resolution":{"observed_at":"2026-08-12T13:15:07.154072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11462","last_updated":"2025-07-13T19:45:40Z","snapshot_observed_at":"2026-08-16T14:33:39.138288Z","submitted_at":"2023-12-18T18:59:46Z","title":"Cascade Speculative Drafting for Even Faster LLM Inference","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11462","snapshot_observed_at":"2026-08-12T13:15:07.159423Z","title":"Cascade speculative drafting for even faster llm inference","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00061","last_updated":"2024-11-25T14:10:21Z","snapshot_observed_at":"2026-08-18T07:16:48.734774Z","submitted_at":"2024-11-25T14:10:21Z","title":"Speculative Decoding with CTC-based Draft Model for LLM Inference Acceleration","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T13:15:07.159423Z"},"links":{"cited_paper":"/paper/2312.11462","citing_paper":"/paper/2412.00061"},"observation_digest":"sha256:967da826af3e82e18c2a94bc3e538a6ce3ecc6ffcc31312e854f6577b864e779","observation_id":"dbb37119-5ca2-498f-9683-4fe5acd61444","resolution":{"observed_at":"2026-08-12T13:15:07.159423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:15:07.165281Z","title":"Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00061","last_updated":"2024-11-25T14:10:21Z","snapshot_observed_at":"2026-08-18T07:16:48.734774Z","submitted_at":"2024-11-25T14:10:21Z","title":"Speculative Decoding with CTC-based Draft Model for LLM Inference Acceleration","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T13:15:07.165281Z"},"links":{"citing_paper":"/paper/2412.00061"},"observation_digest":"sha256:df9dc7cd72e4dd902e29c6a9786116253d485b350fded3d8505106f9b2777ada","observation_id":"ec52fe2a-7e90-4c52-a0e6-0d1e81cbad69","resolution":{"observed_at":"2026-08-12T13:15:07.165281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-12T13:15:07.170268Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00061","last_updated":"2024-11-25T14:10:21Z","snapshot_observed_at":"2026-08-18T07:16:48.734774Z","submitted_at":"2024-11-25T14:10:21Z","title":"Speculative Decoding with CTC-based Draft Model for LLM Inference Acceleration","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T13:15:07.170268Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2412.00061"},"observation_digest":"sha256:1957df96d2b2d7e5173604c2d78a15a860300b8d2d0aaf132a01203e0957b0e3","observation_id":"6bb13f95-7222-43db-8910-0a07a5aa976d","resolution":{"observed_at":"2026-08-12T13:15:07.170268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:15:07.766171Z","title":"Tutorial on directed acyclic graphs","venue":null,"work_id":"f2e006af-fa32-4875-93c8-26f1432d2e6d","year":2022},"citing_paper":{"arxiv_id":"2412.00061","last_updated":"2024-11-25T14:10:21Z","snapshot_observed_at":"2026-08-18T07:16:48.734774Z","submitted_at":"2024-11-25T14:10:21Z","title":"Speculative Decoding with CTC-based Draft Model for LLM Inference Acceleration","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T13:15:07.177796Z"},"links":{"citing_paper":"/paper/2412.00061"},"observation_digest":"sha256:3d0aba77ed37d8f1b693cac756f2951b195542e2c27947272f577c782c77ce5a","observation_id":"680c2458-c6e9-49e8-bac1-419f3190087c","resolution":{"observed_at":"2026-08-12T13:15:07.772628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:15:07.183111Z","title":"Connectionist temporal classification: labelling unsegmented sequence data with recurrent neural networks","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2412.00061","last_updated":"2024-11-25T14:10:21Z","snapshot_observed_at":"2026-08-18T07:16:48.734774Z","submitted_at":"2024-11-25T14:10:21Z","title":"Speculative Decoding with CTC-based Draft Model for LLM Inference Acceleration","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T13:15:07.183111Z"},"links":{"citing_paper":"/paper/2412.00061"},"observation_digest":"sha256:f99aab99f3f630d7f78175b76ca56ac3c4252117faa9799216a601c970d0d3d8","observation_id":"beed94b1-721e-44ad-8974-102fac87eac9","resolution":{"observed_at":"2026-08-12T13:15:07.183111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12072","last_updated":"2024-01-03T00:32:43Z","snapshot_observed_at":"2026-08-16T14:51:00.499475Z","submitted_at":"2023-10-18T16:07:01Z","title":"SPEED: Speculative Pipelined Execution for Efficient Decoding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12072","snapshot_observed_at":"2026-08-12T13:15:07.188194Z","title":"Speed: Speculative pipelined execution for efficient decoding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00061","last_updated":"2024-11-25T14:10:21Z","snapshot_observed_at":"2026-08-18T07:16:48.734774Z","submitted_at":"2024-11-25T14:10:21Z","title":"Speculative Decoding with CTC-based Draft Model for LLM Inference Acceleration","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T13:15:07.188194Z"},"links":{"cited_paper":"/paper/2310.12072","citing_paper":"/paper/2412.00061"},"observation_digest":"sha256:3b758027d3b41a7d7764206b7b659dca7ba1ecfd9debd21d4c5079ebb43ecf3e","observation_id":"746dfe29-8e6b-4a38-a806-c19cbc1ca527","resolution":{"observed_at":"2026-08-12T13:15:07.188194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-08-17T20:30:34.016254Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-12T13:15:07.201980Z","title":"Mistral 7b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00061","last_updated":"2024-11-25T14:10:21Z","snapshot_observed_at":"2026-08-18T07:16:48.734774Z","submitted_at":"2024-11-25T14:10:21Z","title":"Speculative Decoding with CTC-based Draft Model for LLM Inference Acceleration","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T13:15:07.201980Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2412.00061"},"observation_digest":"sha256:7ab492f4f3138481e5d3646a7e1ef8303e19e8bcd662254ea18af106c5798b4c","observation_id":"67459f86-ae2a-4eef-a242-e0fb2c7f3ad4","resolution":{"observed_at":"2026-08-12T13:15:07.201980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:15:07.207424Z","title":"Fast inference from transformers via speculative decoding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00061","last_updated":"2024-11-25T14:10:21Z","snapshot_observed_at":"2026-08-18T07:16:48.734774Z","submitted_at":"2024-11-25T14:10:21Z","title":"Speculative Decoding with CTC-based Draft Model for LLM Inference Acceleration","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T13:15:07.207424Z"},"links":{"citing_paper":"/paper/2412.00061"},"observation_digest":"sha256:e3e9e5ce600e2811783e22fdcb98b68f9ef8fa6647894e1298dbbb7a2ad39b32","observation_id":"5e41ad1c-e367-4eed-a1f7-21f74b60999f","resolution":{"observed_at":"2026-08-12T13:15:07.207424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.15077","last_updated":"2025-03-04T13:58:39Z","snapshot_observed_at":"2026-08-03T09:40:31.365295Z","submitted_at":"2024-01-26T18:59:01Z","title":"EAGLE: Speculative Sampling Requires Rethinking Feature Uncertainty","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.15077","snapshot_observed_at":"2026-08-12T13:15:07.213417Z","title":"Eagle: Speculative sampling requires rethinking feature uncertainty","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00061","last_updated":"2024-11-25T14:10:21Z","snapshot_observed_at":"2026-08-18T07:16:48.734774Z","submitted_at":"2024-11-25T14:10:21Z","title":"Speculative Decoding with CTC-based Draft Model for LLM Inference Acceleration","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T13:15:07.213417Z"},"links":{"cited_paper":"/paper/2401.15077","citing_paper":"/paper/2412.00061"},"observation_digest":"sha256:cb923630a099ec238081a7a1dde480d42f1a2d02ec7b3580ad88c481f87df99a","observation_id":"035dd2d0-7333-48d4-8ba3-e175db4f4d79","resolution":{"observed_at":"2026-08-12T13:15:07.213417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.09781","last_updated":"2024-04-01T02:18:42Z","snapshot_observed_at":"2026-08-16T15:32:32.643405Z","submitted_at":"2023-05-16T20:12:59Z","title":"SpecInfer: Accelerating Generative Large Language Model Serving with Tree-based Speculative Inference and Verification","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.09781","snapshot_observed_at":"2026-08-12T13:15:07.218014Z","title":"Specinfer: Accelerating generative llm serving with speculative inference and token tree verification","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00061","last_updated":"2024-11-25T14:10:21Z","snapshot_observed_at":"2026-08-18T07:16:48.734774Z","submitted_at":"2024-11-25T14:10:21Z","title":"Speculative Decoding with CTC-based Draft Model for LLM Inference Acceleration","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T13:15:07.218014Z"},"links":{"cited_paper":"/paper/2305.09781","citing_paper":"/paper/2412.00061"},"observation_digest":"sha256:7af931415a626d72e30787a09fe495973b8033d731560bb5bfcc60d3e6c5e326","observation_id":"139f8768-1ac8-486b-a60b-659023c6dd8d","resolution":{"observed_at":"2026-08-12T13:15:07.218014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.04623","last_updated":"2023-08-08T23:29:55Z","snapshot_observed_at":"2026-08-16T16:45:25.532419Z","submitted_at":"2023-08-08T23:29:55Z","title":"Accelerating LLM Inference with Staged Speculative Decoding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.04623","snapshot_observed_at":"2026-08-12T13:15:07.224514Z","title":"Accelerating llm inference with staged speculative decoding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00061","last_updated":"2024-11-25T14:10:21Z","snapshot_observed_at":"2026-08-18T07:16:48.734774Z","submitted_at":"2024-11-25T14:10:21Z","title":"Speculative Decoding with CTC-based Draft Model for LLM Inference Acceleration","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T13:15:07.224514Z"},"links":{"cited_paper":"/paper/2308.04623","citing_paper":"/paper/2412.00061"},"observation_digest":"sha256:22d13b27638d382e0c7bc85314c633e2a98e88150c86899d76362447ff889a52","observation_id":"b955a8cc-9cb4-4edf-b883-f1225addf738","resolution":{"observed_at":"2026-08-12T13:15:07.224514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:15:07.230200Z","title":"Insertion transformer: Flexible sequence generation via insertion operations","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.00061","last_updated":"2024-11-25T14:10:21Z","snapshot_observed_at":"2026-08-18T07:16:48.734774Z","submitted_at":"2024-11-25T14:10:21Z","title":"Speculative Decoding with CTC-based Draft Model for LLM Inference Acceleration","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T13:15:07.230200Z"},"links":{"citing_paper":"/paper/2412.00061"},"observation_digest":"sha256:049bb4afc2a5f3ea27f972857ab5f20b303ed49c6e11aaf872c8c0bd6d075dcf","observation_id":"fcf09a45-24f9-42ea-aa36-08e6cec69b61","resolution":{"observed_at":"2026-08-12T13:15:07.230200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:15:07.707749Z","title":"Blockwise parallel decoding for deep autoregressive models","venue":null,"work_id":"00845c33-ba66-4473-814d-804c3b8029e8","year":2018},"citing_paper":{"arxiv_id":"2412.00061","last_updated":"2024-11-25T14:10:21Z","snapshot_observed_at":"2026-08-18T07:16:48.734774Z","submitted_at":"2024-11-25T14:10:21Z","title":"Speculative Decoding with CTC-based Draft Model for LLM Inference Acceleration","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T13:15:07.235539Z"},"links":{"citing_paper":"/paper/2412.00061"},"observation_digest":"sha256:22fae99a36cbb61cfdbe89faad12c441e8a0e6f4b8f060b76566e5ef6bfb81a2","observation_id":"8554d824-62b3-4d4b-a860-74ce9a8650a1","resolution":{"observed_at":"2026-08-12T13:15:07.713516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04970","last_updated":"2021-06-09T10:30:59Z","snapshot_observed_at":"2026-08-19T00:16:47.134711Z","submitted_at":"2021-06-09T10:30:59Z","title":"Instantaneous Grammatical Error Correction with Shallow Aggressive Decoding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.04970","snapshot_observed_at":"2026-08-12T13:15:07.240855Z","title":"Instantaneous grammatical error correction with shallow aggressive decoding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.00061","last_updated":"2024-11-25T14:10:21Z","snapshot_observed_at":"2026-08-18T07:16:48.734774Z","submitted_at":"2024-11-25T14:10:21Z","title":"Speculative Decoding with CTC-based Draft Model for LLM Inference Acceleration","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T13:15:07.240855Z"},"links":{"cited_paper":"/paper/2106.04970","citing_paper":"/paper/2412.00061"},"observation_digest":"sha256:9debf4b2e814eb5ce79d8194400c81554cc07317247965e315046c41498dfa0f","observation_id":"f7555fba-55e2-4eb3-9abc-3605e48fd5ec","resolution":{"observed_at":"2026-08-12T13:15:07.240855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:15:07.245355Z","title":"Spectr: Fast speculative decoding via optimal transport","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00061","last_updated":"2024-11-25T14:10:21Z","snapshot_observed_at":"2026-08-18T07:16:48.734774Z","submitted_at":"2024-11-25T14:10:21Z","title":"Speculative Decoding with CTC-based Draft Model for LLM Inference Acceleration","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T13:15:07.245355Z"},"links":{"citing_paper":"/paper/2412.00061"},"observation_digest":"sha256:2d7948074b12654cff01add8fc345c6274288da3646e5fe2454f2ce5f22721f0","observation_id":"46a3c2dd-d6ee-4b52-b306-a8a8358e1e58","resolution":{"observed_at":"2026-08-12T13:15:07.245355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:15:07.678041Z","title":"An introduction to conditional random fields","venue":null,"work_id":"7fe844ca-d18c-4f36-9b61-7d46ceb3f980","year":2012},"citing_paper":{"arxiv_id":"2412.00061","last_updated":"2024-11-25T14:10:21Z","snapshot_observed_at":"2026-08-18T07:16:48.734774Z","submitted_at":"2024-11-25T14:10:21Z","title":"Speculative Decoding with CTC-based Draft Model for LLM Inference Acceleration","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T13:15:07.250401Z"},"links":{"citing_paper":"/paper/2412.00061"},"observation_digest":"sha256:7894caddb1912f7a683d3722911debbe7f6991ab4e9bf7a3a3edc60bf88b1d6c","observation_id":"69cd8bde-5543-4faa-8d6b-5828699f8564","resolution":{"observed_at":"2026-08-12T13:15:07.682407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-12T13:15:07.256088Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00061","last_updated":"2024-11-25T14:10:21Z","snapshot_observed_at":"2026-08-18T07:16:48.734774Z","submitted_at":"2024-11-25T14:10:21Z","title":"Speculative Decoding with CTC-based Draft Model for LLM Inference Acceleration","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T13:15:07.256088Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2412.00061"},"observation_digest":"sha256:5254d56d4d7a25f9e1387f449ef9769a14c2109e6412372ff711e9f3598d1356","observation_id":"e5fb8e5f-0bc6-472f-9433-e9c514a86e46","resolution":{"observed_at":"2026-08-12T13:15:07.256088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-12T13:15:07.262618Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00061","last_updated":"2024-11-25T14:10:21Z","snapshot_observed_at":"2026-08-18T07:16:48.734774Z","submitted_at":"2024-11-25T14:10:21Z","title":"Speculative Decoding with CTC-based Draft Model for LLM Inference Acceleration","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T13:15:07.262618Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2412.00061"},"observation_digest":"sha256:052237c4cb5725b3ddfd07684a1a3e6b7ede9d765620d415413fdcf3ed47ccc8","observation_id":"74eb00b7-fb34-424d-898d-79eeedc215a4","resolution":{"observed_at":"2026-08-12T13:15:07.262618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:15:07.662865Z","title":"Speculative decoding: Exploiting speculative execution for accelerating seq2seq generation","venue":null,"work_id":"4e4427b5-3dbf-4678-8d0f-c179560c99af","year":2023},"citing_paper":{"arxiv_id":"2412.00061","last_updated":"2024-11-25T14:10:21Z","snapshot_observed_at":"2026-08-18T07:16:48.734774Z","submitted_at":"2024-11-25T14:10:21Z","title":"Speculative Decoding with CTC-based Draft Model for LLM Inference Acceleration","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T13:15:07.268976Z"},"links":{"citing_paper":"/paper/2412.00061"},"observation_digest":"sha256:fb78052dc8920410171de7c8497b26163bc10fcc724c8ac83a16a4c292daa7e3","observation_id":"b351093e-64fc-4cbd-a61f-1569b67f3936","resolution":{"observed_at":"2026-08-12T13:15:07.668268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.07851","last_updated":"2024-06-04T17:08:37Z","snapshot_observed_at":"2026-08-17T17:39:03.032373Z","submitted_at":"2024-01-15T17:26:50Z","title":"Unlocking Efficiency in Large Language Model Inference: A Comprehensive Survey of Speculative Decoding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.07851","snapshot_observed_at":"2026-08-12T13:15:07.274460Z","title":"Unlocking efficiency in large language model inference: A comprehensive survey of speculative decoding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00061","last_updated":"2024-11-25T14:10:21Z","snapshot_observed_at":"2026-08-18T07:16:48.734774Z","submitted_at":"2024-11-25T14:10:21Z","title":"Speculative Decoding with CTC-based Draft Model for LLM Inference Acceleration","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T13:15:07.274460Z"},"links":{"cited_paper":"/paper/2401.07851","citing_paper":"/paper/2412.00061"},"observation_digest":"sha256:30b56b66925523cb84c831098f5e79aa13bbab965bbd160b820dd5f4fbd5c34a","observation_id":"d116a5fe-8de5-42a1-9943-686b508e1d1d","resolution":{"observed_at":"2026-08-12T13:15:07.274460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.05908","last_updated":"2024-07-29T04:03:22Z","snapshot_observed_at":"2026-08-19T00:16:47.734536Z","submitted_at":"2023-07-12T04:28:41Z","title":"Predictive Pipelined Decoding: A Compute-Latency Trade-off for Exact LLM Decoding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.05908","snapshot_observed_at":"2026-08-12T13:15:07.283186Z","title":"Predictive pipelined decoding: A compute-latency trade-off for exact llm decoding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00061","last_updated":"2024-11-25T14:10:21Z","snapshot_observed_at":"2026-08-18T07:16:48.734774Z","submitted_at":"2024-11-25T14:10:21Z","title":"Speculative Decoding with CTC-based Draft Model for LLM Inference Acceleration","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T13:15:07.283186Z"},"links":{"cited_paper":"/paper/2307.05908","citing_paper":"/paper/2412.00061"},"observation_digest":"sha256:0700a5de167ad3a6d6cd2efb7e52db792580f7c9c3249af690de218ab58ff79d","observation_id":"aeb6f735-149c-4e40-895f-ca6eae19d0ba","resolution":{"observed_at":"2026-08-12T13:15:07.283186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.08168","last_updated":"2024-05-20T02:37:20Z","snapshot_observed_at":"2026-08-18T00:12:18.095284Z","submitted_at":"2023-09-15T05:34:32Z","title":"Draft & Verify: Lossless Large Language Model Acceleration via Self-Speculative Decoding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.08168","snapshot_observed_at":"2026-08-12T13:15:07.288948Z","title":"Draft & verify: Lossless large language model acceleration via self-speculative decoding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00061","last_updated":"2024-11-25T14:10:21Z","snapshot_observed_at":"2026-08-18T07:16:48.734774Z","submitted_at":"2024-11-25T14:10:21Z","title":"Speculative Decoding with CTC-based Draft Model for LLM Inference Acceleration","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T13:15:07.288948Z"},"links":{"cited_paper":"/paper/2309.08168","citing_paper":"/paper/2412.00061"},"observation_digest":"sha256:dd6413398122f05fa0a06a6603f4314ceff0f155a40729cfb758a27a65ea144d","observation_id":"e0e5002c-af63-483c-9901-77ee3353e1d0","resolution":{"observed_at":"2026-08-12T13:15:07.288948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:15:07.645596Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena","venue":null,"work_id":"1ce281c1-4d5d-4cb4-bac6-e194f28a002b","year":2024},"citing_paper":{"arxiv_id":"2412.00061","last_updated":"2024-11-25T14:10:21Z","snapshot_observed_at":"2026-08-18T07:16:48.734774Z","submitted_at":"2024-11-25T14:10:21Z","title":"Speculative Decoding with CTC-based Draft Model for LLM Inference Acceleration","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T13:15:07.301072Z"},"links":{"citing_paper":"/paper/2412.00061"},"observation_digest":"sha256:cbb3fdf17ddc0c51c8cabdf9dbab0368fa6d43c0de647cf2a3d1d59cefa1f07b","observation_id":"f8a9214b-1cd2-4e06-881f-14e16d536fba","resolution":{"observed_at":"2026-08-12T13:15:07.652003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08461","last_updated":"2024-03-31T03:06:51Z","snapshot_observed_at":"2026-08-16T14:52:38.095793Z","submitted_at":"2023-10-12T16:21:04Z","title":"DistillSpec: Improving Speculative Decoding via Knowledge Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08461","snapshot_observed_at":"2026-08-12T13:15:07.306486Z","title":"Distillspec: Improving speculative decoding via knowledge distillation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00061","last_updated":"2024-11-25T14:10:21Z","snapshot_observed_at":"2026-08-18T07:16:48.734774Z","submitted_at":"2024-11-25T14:10:21Z","title":"Speculative Decoding with CTC-based Draft Model for LLM Inference Acceleration","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T13:15:07.306486Z"},"links":{"cited_paper":"/paper/2310.08461","citing_paper":"/paper/2412.00061"},"observation_digest":"sha256:38b1899152d5669103849c2298d436352b2cda3081307f31e460656aeab1e88d","observation_id":"e8bcaf73-917d-478c-8fad-6b701a3a0a92","resolution":{"observed_at":"2026-08-12T13:15:07.306486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.00061","last_updated":"2024-11-25T14:10:21Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-18T07:16:48.734774Z","submitted_at":"2024-11-25T14:10:21Z","title":"Speculative Decoding with CTC-based Draft Model for LLM Inference Acceleration"},"reference_resolution":{"displayed":28,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":0,"verified_fuzzy":6},"total_outbound_references":28},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 28 of 28 outbound references and 2 inbound Pith citation observations for arXiv:2412.00061."}