{"as_of":"2026-08-10T02:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:50e151e821266515c5691a173f18e975d6c792ddfda34c4af5d1a354a1163471","coverage":[{"denominator":19,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":19,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T21:38:54.851579Z","state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T13:15:30.174288Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-20T22:54:09.662817Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.08192","last_updated":"2025-08-11T17:11:26Z","snapshot_observed_at":"2026-08-08T01:17:25.728418Z","submitted_at":"2025-08-11T17:11:26Z","title":"Efficient Speculative Decoding for Llama at Scale: Challenges and Solutions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.08192","snapshot_observed_at":"2026-08-04T13:15:30.174288Z","title":"Efficient speculative decoding for llama at scale: Challenges and solutions.arXiv preprint arXiv:2508.08192,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.01336","last_updated":"2026-05-26T05:53:44Z","snapshot_observed_at":"2026-08-04T13:15:28.029864Z","submitted_at":"2025-10-01T18:04:14Z","title":"HiSpec: Hierarchical Speculative Decoding for LLMs","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T13:15:30.174288Z"},"links":{"cited_paper":"/paper/2508.08192","citing_paper":"/paper/2510.01336"},"observation_digest":"sha256:a308b9aeeb011a223cb55dfae736c1bd9f447e021ed54d0be32191bc4cc5a45b","observation_id":"17d775b5-4e95-4970-b31b-6bcf50c3f27d","resolution":{"observed_at":"2026-08-04T13:15:30.174288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.08192","last_updated":"2025-08-11T17:11:26Z","snapshot_observed_at":"2026-08-08T01:17:25.728418Z","submitted_at":"2025-08-11T17:11:26Z","title":"Efficient Speculative Decoding for Llama at Scale: Challenges and Solutions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.08192","snapshot_observed_at":"2026-08-02T23:27:56.589526Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.13836","last_updated":"2026-07-17T14:00:00Z","snapshot_observed_at":"2026-08-09T21:06:11.555710Z","submitted_at":"2026-02-14T16:10:00Z","title":"Speculative Decoding with a Speculative Vocabulary","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-02T23:27:56.589526Z"},"links":{"cited_paper":"/paper/2508.08192","citing_paper":"/paper/2602.13836"},"observation_digest":"sha256:72a92ddd481968ea5bb5dd27bf5fb772a67e321efadc559a5db9ee2280c2cad7","observation_id":"4e20ca68-c9a4-48a1-b6e0-3bd8ab542d69","resolution":{"observed_at":"2026-08-02T23:27:56.589526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.08192","last_updated":"2025-08-11T17:11:26Z","snapshot_observed_at":"2026-08-08T01:17:25.728418Z","submitted_at":"2025-08-11T17:11:26Z","title":"Efficient Speculative Decoding for Llama at Scale: Challenges and Solutions","version":1},"cited_work":{"arxiv_id":"2508.08192","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.08192","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2508.08192 , year=","venue":null,"work_id":"8914f61e-1ada-4708-96b7-f448642fba9e","year":null},"citing_paper":{"arxiv_id":"2605.09329","last_updated":"2026-05-19T16:34:43Z","snapshot_observed_at":"2026-07-06T23:21:26.017420Z","submitted_at":"2026-05-10T05:02:39Z","title":"Test-Time Speculation","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-12T04:20:15.459967Z"},"links":{"cited_paper":"/paper/2508.08192","citing_paper":"/paper/2605.09329"},"observation_digest":"sha256:5ccdca6bccff0660584a2654b852849c2b0c7685d882d577cc4d22c5a7c38886","observation_id":"e8e80813-20fa-4aa2-8701-38fcc58e3bda","resolution":{"observed_at":"2026-05-12T04:21:22.742941Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.08192","last_updated":"2025-08-11T17:11:26Z","snapshot_observed_at":"2026-08-08T01:17:25.728418Z","submitted_at":"2025-08-11T17:11:26Z","title":"Efficient Speculative Decoding for Llama at Scale: Challenges and Solutions","version":1},"cited_work":{"arxiv_id":"2508.08192","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.08192","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2508.08192 , year=","venue":null,"work_id":"8914f61e-1ada-4708-96b7-f448642fba9e","year":null},"citing_paper":{"arxiv_id":"2605.09329","last_updated":"2026-05-19T16:34:43Z","snapshot_observed_at":"2026-07-06T23:21:26.017420Z","submitted_at":"2026-05-10T05:02:39Z","title":"Test-Time Speculation","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-20T22:53:56.914556Z"},"links":{"cited_paper":"/paper/2508.08192","citing_paper":"/paper/2605.09329"},"observation_digest":"sha256:6499352d7b79a4a797ae923f72d41c7ff9547fc875ba5cfd36d86487d864b741","observation_id":"e90e11a9-e217-4497-9262-f8b754177ac4","resolution":{"observed_at":"2026-05-20T22:54:09.665858Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2508.08192/citation-record","integrity":"/paper/2508.08192/integrity","json":"/paper/2508.08192/citation-record.json","paper":"/paper/2508.08192"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T21:38:52.423030Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.08192","last_updated":"2025-08-11T17:11:26Z","snapshot_observed_at":"2026-08-08T01:17:25.728418Z","submitted_at":"2025-08-11T17:11:26Z","title":"Efficient Speculative Decoding for Llama at Scale: Challenges and Solutions","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T21:38:52.423030Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2508.08192"},"observation_digest":"sha256:efcb4d5e194c73a50f6e6b58bdb75a594eda27574b06463ccd204cda3c817a9b","observation_id":"0af16ab2-4b16-4e29-8b75-adef00a83fb5","resolution":{"observed_at":"2026-08-05T21:38:52.423030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:38:55.350905Z","title":"The curious case of neural text degeneration","venue":null,"work_id":"edd454a3-d98f-449f-9301-a07f758d9ae9","year":2020},"citing_paper":{"arxiv_id":"2508.08192","last_updated":"2025-08-11T17:11:26Z","snapshot_observed_at":"2026-08-08T01:17:25.728418Z","submitted_at":"2025-08-11T17:11:26Z","title":"Efficient Speculative Decoding for Llama at Scale: Challenges and Solutions","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T21:38:52.897703Z"},"links":{"citing_paper":"/paper/2508.08192"},"observation_digest":"sha256:92ba867d73e57774375b6a24a4176031e54c19fa6ad2f2ec6f19c83d6d74a53f","observation_id":"2fa6a4eb-df24-455e-b6e1-dac3ab84623a","resolution":{"observed_at":"2026-08-05T21:38:55.506409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05099","last_updated":"2024-05-13T08:49:44Z","snapshot_observed_at":"2026-08-09T16:33:20.413953Z","submitted_at":"2024-02-07T18:53:01Z","title":"Hydragen: High-Throughput LLM Inference with Shared Prefixes","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05099","snapshot_observed_at":"2026-08-05T21:38:53.050106Z","title":"Hydragen: High-throughput llm inference with shared prefixes.arXiv preprint arXiv:2402.05099,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.08192","last_updated":"2025-08-11T17:11:26Z","snapshot_observed_at":"2026-08-08T01:17:25.728418Z","submitted_at":"2025-08-11T17:11:26Z","title":"Efficient Speculative Decoding for Llama at Scale: Challenges and Solutions","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T21:38:53.050106Z"},"links":{"cited_paper":"/paper/2402.05099","citing_paper":"/paper/2508.08192"},"observation_digest":"sha256:98c078ba31bac8e34b11f2f8ccd672acff4f866945cafed23d499f5977dbfef6","observation_id":"d4bd292e-1473-4a07-954c-7d0590f9378e","resolution":{"observed_at":"2026-08-05T21:38:53.050106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-05T21:38:53.157905Z","title":"Adam: A method for stochastic optimization.arXiv preprint arXiv:1412.6980,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.08192","last_updated":"2025-08-11T17:11:26Z","snapshot_observed_at":"2026-08-08T01:17:25.728418Z","submitted_at":"2025-08-11T17:11:26Z","title":"Efficient Speculative Decoding for Llama at Scale: Challenges and Solutions","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T21:38:53.157905Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2508.08192"},"observation_digest":"sha256:175d07e201513b176eec658ba589eae557866a09609fbb54255a266126e416c0","observation_id":"c659adac-c136-43a8-a190-429d4a696843","resolution":{"observed_at":"2026-08-05T21:38:53.157905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.15077","last_updated":"2025-03-04T13:58:39Z","snapshot_observed_at":"2026-08-03T09:40:31.365295Z","submitted_at":"2024-01-26T18:59:01Z","title":"EAGLE: Speculative Sampling Requires Rethinking Feature Uncertainty","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.15077","snapshot_observed_at":"2026-08-05T21:38:53.285462Z","title":"Eagle: Speculative sampling requires rethinking feature uncertainty.arXiv preprint arXiv:2401.15077,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.08192","last_updated":"2025-08-11T17:11:26Z","snapshot_observed_at":"2026-08-08T01:17:25.728418Z","submitted_at":"2025-08-11T17:11:26Z","title":"Efficient Speculative Decoding for Llama at Scale: Challenges and Solutions","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T21:38:53.285462Z"},"links":{"cited_paper":"/paper/2401.15077","citing_paper":"/paper/2508.08192"},"observation_digest":"sha256:5d63e332f250ad56f89256294b8369ff3c28394d9486b011c5124bdcc76f0ed0","observation_id":"22dc4cd0-3f2c-4a13-9d49-ec375612ab34","resolution":{"observed_at":"2026-08-05T21:38:53.285462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01840","last_updated":"2025-04-23T07:08:17Z","snapshot_observed_at":"2026-07-06T20:45:55.263034Z","submitted_at":"2025-03-03T18:59:04Z","title":"EAGLE-3: Scaling up Inference Acceleration of Large Language Models via Training-Time Test","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01840","snapshot_observed_at":"2026-08-05T21:38:53.476154Z","title":"Eagle-3: Scaling up inference acceleration of large language models via training-time test.arXiv preprint arXiv:2503.01840,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.08192","last_updated":"2025-08-11T17:11:26Z","snapshot_observed_at":"2026-08-08T01:17:25.728418Z","submitted_at":"2025-08-11T17:11:26Z","title":"Efficient Speculative Decoding for Llama at Scale: Challenges and Solutions","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T21:38:53.476154Z"},"links":{"cited_paper":"/paper/2503.01840","citing_paper":"/paper/2508.08192"},"observation_digest":"sha256:66bee443738358def9fd144aba2b92a10d943898b33874ebc92df2880add579b","observation_id":"def561ff-a131-44a3-93d8-5e6c10b04c7e","resolution":{"observed_at":"2026-08-05T21:38:53.476154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14066","last_updated":"2025-07-27T03:20:41Z","snapshot_observed_at":"2026-07-06T18:34:03.037351Z","submitted_at":"2024-06-20T07:43:33Z","title":"TurboSpec: Closed-loop Speculation Control System for Optimizing LLM Serving Goodput","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14066","snapshot_observed_at":"2026-08-05T21:38:53.660836Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.08192","last_updated":"2025-08-11T17:11:26Z","snapshot_observed_at":"2026-08-08T01:17:25.728418Z","submitted_at":"2025-08-11T17:11:26Z","title":"Efficient Speculative Decoding for Llama at Scale: Challenges and Solutions","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T21:38:53.660836Z"},"links":{"cited_paper":"/paper/2406.14066","citing_paper":"/paper/2508.08192"},"observation_digest":"sha256:802cc1de700c6f5226237216fcebf35a7fcc4b9c169d06a8e7e28916db13eeaf","observation_id":"235d3e2c-a8ac-4b40-b616-9ae04db67d3b","resolution":{"observed_at":"2026-08-05T21:38:53.660836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.09781","last_updated":"2024-04-01T02:18:42Z","snapshot_observed_at":"2026-07-06T15:28:24.682211Z","submitted_at":"2023-05-16T20:12:59Z","title":"SpecInfer: Accelerating Generative Large Language Model Serving with Tree-based Speculative Inference and Verification","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.09781","snapshot_observed_at":"2026-08-05T21:38:54.075982Z","title":"14 Ruoyu Qin, Zheming Li, Weiran He, Mingxing Zhang, Yongwei Wu, Weimin Zheng, and Xinran Xu","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.08192","last_updated":"2025-08-11T17:11:26Z","snapshot_observed_at":"2026-08-08T01:17:25.728418Z","submitted_at":"2025-08-11T17:11:26Z","title":"Efficient Speculative Decoding for Llama at Scale: Challenges and Solutions","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T21:38:54.075982Z"},"links":{"cited_paper":"/paper/2305.09781","citing_paper":"/paper/2508.08192"},"observation_digest":"sha256:08502ee48039de0908b95dfcbf7be21b7988e6704b38de2c8aad5cc4429979b3","observation_id":"7d4fb8f7-47d7-454d-97a3-2158615ea817","resolution":{"observed_at":"2026-08-05T21:38:54.075982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.05682","last_updated":"2022-10-10T16:36:47Z","snapshot_observed_at":"2026-08-06T17:49:01.053607Z","submitted_at":"2021-12-10T17:25:07Z","title":"Self-attention Does Not Need $O(n^2)$ Memory","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.05682","snapshot_observed_at":"2026-08-05T21:38:54.293572Z","title":"Self-attention does not needo(n2)memory.arXiv preprint arXiv:2112.05682,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.08192","last_updated":"2025-08-11T17:11:26Z","snapshot_observed_at":"2026-08-08T01:17:25.728418Z","submitted_at":"2025-08-11T17:11:26Z","title":"Efficient Speculative Decoding for Llama at Scale: Challenges and Solutions","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T21:38:54.293572Z"},"links":{"cited_paper":"/paper/2112.05682","citing_paper":"/paper/2508.08192"},"observation_digest":"sha256:2f7d73618542f6d16fb1b871ae40ab685f21bd6473d96c5c73f544a8867ccfa5","observation_id":"99e518d1-e991-443a-a8e0-5e07929bd86f","resolution":{"observed_at":"2026-08-05T21:38:54.293572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11049","last_updated":"2025-04-02T01:58:38Z","snapshot_observed_at":"2026-08-08T01:17:07.764692Z","submitted_at":"2024-08-20T17:57:31Z","title":"MagicDec: Breaking the Latency-Throughput Tradeoff for Long Context Generation with Speculative Decoding","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11049","snapshot_observed_at":"2026-08-05T21:38:54.422691Z","title":"Ranajoy Sadhukhan, Jian Chen, Zhuoming Chen, Vashisth Tiwari, Ruihang Lai, Jinyuan Shi, Ian En-Hsu Yen, Avner May, Tianqi Chen, and Beidi Chen","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.08192","last_updated":"2025-08-11T17:11:26Z","snapshot_observed_at":"2026-08-08T01:17:25.728418Z","submitted_at":"2025-08-11T17:11:26Z","title":"Efficient Speculative Decoding for Llama at Scale: Challenges and Solutions","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T21:38:54.422691Z"},"links":{"cited_paper":"/paper/2408.11049","citing_paper":"/paper/2508.08192"},"observation_digest":"sha256:9daf8ef17a6d1c33146345b6f1f05bb4db7b526e587e2dc88ccee112c0372c50","observation_id":"4e294fe4-01d2-4df9-951e-e13471fef135","resolution":{"observed_at":"2026-08-05T21:38:54.422691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1701.06538","last_updated":"2017-01-23T18:10:00Z","snapshot_observed_at":"2026-07-06T05:27:13.416519Z","submitted_at":"2017-01-23T18:10:00Z","title":"Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1701.06538","snapshot_observed_at":"2026-08-05T21:38:54.550812Z","title":"Noam Shazeer, Azalia Mirhoseini, Krzysztof Maziarz, Andy Davis, Quoc Le, Geoffrey Hinton, and Jeff Dean","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.08192","last_updated":"2025-08-11T17:11:26Z","snapshot_observed_at":"2026-08-08T01:17:25.728418Z","submitted_at":"2025-08-11T17:11:26Z","title":"Efficient Speculative Decoding for Llama at Scale: Challenges and Solutions","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T21:38:54.550812Z"},"links":{"cited_paper":"/paper/1701.06538","citing_paper":"/paper/2508.08192"},"observation_digest":"sha256:946063c14d2af44225b144bee1230547cc1448e1ef83c6a12e533bb4c6aaaed5","observation_id":"a069bcfd-b7fd-43b0-8302-5ec377fbd2f5","resolution":{"observed_at":"2026-08-05T21:38:54.550812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09702","last_updated":"2023-08-19T21:27:51Z","snapshot_observed_at":"2026-08-09T04:46:02.275866Z","submitted_at":"2023-07-19T01:14:49Z","title":"Efficient Guided Generation for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09702","snapshot_observed_at":"2026-08-05T21:38:54.851579Z","title":"Efficient guided generation for llms.arXiv preprint arXiv:2307.09702,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.08192","last_updated":"2025-08-11T17:11:26Z","snapshot_observed_at":"2026-08-08T01:17:25.728418Z","submitted_at":"2025-08-11T17:11:26Z","title":"Efficient Speculative Decoding for Llama at Scale: Challenges and Solutions","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T21:38:54.851579Z"},"links":{"cited_paper":"/paper/2307.09702","citing_paper":"/paper/2508.08192"},"observation_digest":"sha256:1c680c46b7e1da3cd74e7a7be79951956efae11596f6b9bc916e4cd128bd5ea1","observation_id":"bb5258b7-e136-43be-956e-618bcf07e180","resolution":{"observed_at":"2026-08-05T21:38:54.851579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.18813","last_updated":"2023-10-28T20:36:36Z","snapshot_observed_at":"2026-07-06T16:40:00.062668Z","submitted_at":"2023-10-28T20:36:36Z","title":"The Synergy of Speculative Decoding and Batching in Serving Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.18813","snapshot_observed_at":"2026-08-05T21:38:54.729462Z","title":"The synergy of speculative decoding and batching in serving large language models, 2023.https://arxiv.org/abs/2310.18813","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.08192","last_updated":"2025-08-11T17:11:26Z","snapshot_observed_at":"2026-08-08T01:17:25.728418Z","submitted_at":"2025-08-11T17:11:26Z","title":"Efficient Speculative Decoding for Llama at Scale: Challenges and Solutions","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-05T21:38:54.729462Z"},"links":{"cited_paper":"/paper/2310.18813","citing_paper":"/paper/2508.08192"},"observation_digest":"sha256:cbbfc1d8f57995f1dccaeb4e4b782afb4ae21fa88688a330c452e846c1c4bcda","observation_id":"d13dfcad-6739-4a19-afb7-61714e8215ec","resolution":{"observed_at":"2026-08-05T21:38:54.729462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14160","last_updated":"2024-03-05T06:55:26Z","snapshot_observed_at":"2026-07-06T17:33:41.634820Z","submitted_at":"2024-02-21T22:57:49Z","title":"Recursive Speculative Decoding: Accelerating LLM Inference via Sampling Without Replacement","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14160","snapshot_observed_at":"2026-08-05T21:38:52.973941Z","title":"Wonseok Jeon, Mukul Gagrani, Raghavv Goel, Junyoung Park, Mingu Lee, and Christopher Lott","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.08192","last_updated":"2025-08-11T17:11:26Z","snapshot_observed_at":"2026-08-08T01:17:25.728418Z","submitted_at":"2025-08-11T17:11:26Z","title":"Efficient Speculative Decoding for Llama at Scale: Challenges and Solutions","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-05T21:38:52.973941Z"},"links":{"cited_paper":"/paper/2402.14160","citing_paper":"/paper/2508.08192"},"observation_digest":"sha256:9ec615fb1df14d244091de8f049a3df4c5bb5a206ff77ef908e172ade13ffede","observation_id":"907cf67f-c951-468a-9f60-d087a4d7a53d","resolution":{"observed_at":"2026-08-05T21:38:52.973941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10774","last_updated":"2024-06-14T23:32:32Z","snapshot_observed_at":"2026-07-06T17:17:56.276857Z","submitted_at":"2024-01-19T15:48:40Z","title":"Medusa: Simple LLM Inference Acceleration Framework with Multiple Decoding Heads","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10774","snapshot_observed_at":"2026-08-05T21:38:52.474661Z","title":"Medusa: Simple llm inference acceleration framework with multiple decoding heads.arXiv preprint arXiv:2401.10774,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.08192","last_updated":"2025-08-11T17:11:26Z","snapshot_observed_at":"2026-08-08T01:17:25.728418Z","submitted_at":"2025-08-11T17:11:26Z","title":"Efficient Speculative Decoding for Llama at Scale: Challenges and Solutions","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-05T21:38:52.474661Z"},"links":{"cited_paper":"/paper/2401.10774","citing_paper":"/paper/2508.08192"},"observation_digest":"sha256:4ddc876e23b5bf2a4948230e49ed1025dac0ddaa60d34091ef7738d69229a321","observation_id":"828ff934-d954-451a-aeba-d4f35015f049","resolution":{"observed_at":"2026-08-05T21:38:52.474661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:38:55.597208Z","title":"Flash-decoding for long-context inference.https: //crfm.stanford.edu/2023/10/12/flashdecoding.html, October 12","venue":null,"work_id":"dcc54b0c-2054-4e64-8f8e-e897f14d2c96","year":2023},"citing_paper":{"arxiv_id":"2508.08192","last_updated":"2025-08-11T17:11:26Z","snapshot_observed_at":"2026-08-08T01:17:25.728418Z","submitted_at":"2025-08-11T17:11:26Z","title":"Efficient Speculative Decoding for Llama at Scale: Challenges and Solutions","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-05T21:38:52.670091Z"},"links":{"citing_paper":"/paper/2508.08192"},"observation_digest":"sha256:b3c4c138005652c7e34b48cb5392f5f7936e40ba47b15efa12cef1f489e81ee7","observation_id":"a4d9578e-0d0c-490a-b387-ee34a99bc436","resolution":{"observed_at":"2026-08-05T21:38:55.702221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-05T21:38:52.767983Z","title":"Aaron Grattafiori et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.08192","last_updated":"2025-08-11T17:11:26Z","snapshot_observed_at":"2026-08-08T01:17:25.728418Z","submitted_at":"2025-08-11T17:11:26Z","title":"Efficient Speculative Decoding for Llama at Scale: Challenges and Solutions","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-05T21:38:52.767983Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2508.08192"},"observation_digest":"sha256:40530879c78e88810d766a587de4f9f0e7bf4143762af55ce45f5c8ba0871d69","observation_id":"a254f1c7-000d-4e24-aff4-5321cd42a9bb","resolution":{"observed_at":"2026-08-05T21:38:52.767983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.01318","last_updated":"2023-02-02T18:44:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-02T18:44:11Z","title":"Accelerating Large Language Model Decoding with Speculative Sampling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.01318","snapshot_observed_at":"2026-08-05T21:38:52.571364Z","title":"Accelerating large language model decoding with speculative sampling.arXiv preprint arXiv:2302.01318,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.08192","last_updated":"2025-08-11T17:11:26Z","snapshot_observed_at":"2026-08-08T01:17:25.728418Z","submitted_at":"2025-08-11T17:11:26Z","title":"Efficient Speculative Decoding for Llama at Scale: Challenges and Solutions","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-05T21:38:52.571364Z"},"links":{"cited_paper":"/paper/2302.01318","citing_paper":"/paper/2508.08192"},"observation_digest":"sha256:c962f3ada5d196b4703afe534a78fc4274d7636f737cef400f265c4fe4a33e30","observation_id":"33ef08b4-b26e-4bd0-875b-27f2784c268e","resolution":{"observed_at":"2026-08-05T21:38:52.571364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:38:55.107928Z","title":"Xupeng Miao et al","venue":null,"work_id":"39289c27-7377-468f-a316-2c809d62e9b7","year":2025},"citing_paper":{"arxiv_id":"2508.08192","last_updated":"2025-08-11T17:11:26Z","snapshot_observed_at":"2026-08-08T01:17:25.728418Z","submitted_at":"2025-08-11T17:11:26Z","title":"Efficient Speculative Decoding for Llama at Scale: Challenges and Solutions","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-05T21:38:53.815994Z"},"links":{"citing_paper":"/paper/2508.08192"},"observation_digest":"sha256:51e091027ee585f15b840dabffc5ea6531751169efdee3600f10815af7dbf08d","observation_id":"ee79eeae-b9dc-4d04-863c-a77925ad01d5","resolution":{"observed_at":"2026-08-05T21:38:55.238570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.08192","last_updated":"2025-08-11T17:11:26Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T01:17:25.728418Z","submitted_at":"2025-08-11T17:11:26Z","title":"Efficient Speculative Decoding for Llama at Scale: Challenges and Solutions"},"reference_resolution":{"displayed":19,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":0,"verified_fuzzy":3},"total_outbound_references":19},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 19 of 19 outbound references and 4 inbound Pith citation observations for arXiv:2508.08192."}