{"as_of":"2026-08-13T16:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:54c71e7523d23be9a4fb52717cca496296601f688fa604e00f4cffaf1dc90bd2","coverage":[{"denominator":71,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":71,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:02:39.419910Z","state":"measured"},{"denominator":75,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":75,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T04:16:08.552840Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-30T08:44:27.295523Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03700","snapshot_observed_at":"2026-08-04T13:15:30.182708Z","title":"Adadecode: Accelerating llm decoding with adaptive layer parallelism.arXiv preprint arXiv:2506.03700,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.01336","last_updated":"2026-05-26T05:53:44Z","snapshot_observed_at":"2026-08-13T06:18:33.029708Z","submitted_at":"2025-10-01T18:04:14Z","title":"HiSpec: Hierarchical Speculative Decoding for LLMs","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T13:15:30.182708Z"},"links":{"cited_paper":"/paper/2506.03700","citing_paper":"/paper/2510.01336"},"observation_digest":"sha256:7515564a76c53017237a8438eaf8f2fc7bcd691d8b4a3f87e9d92bf1a2bb238d","observation_id":"f6daaf60-f3ba-4e44-b348-d33c26c2b93a","resolution":{"observed_at":"2026-08-04T13:15:30.182708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"cited_work":{"arxiv_id":"2506.03700","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03700","snapshot_observed_at":"2026-06-30T08:44:27.295523Z","title":"Zhuofan Wen, Shangtong Gui, and Yang Feng","venue":null,"work_id":"ff8086b5-d03d-4644-9a5e-fe1ac9fbabf7","year":2025},"citing_paper":{"arxiv_id":"2604.12247","last_updated":"2026-04-14T03:47:04Z","snapshot_observed_at":"2026-07-06T23:00:28.036409Z","submitted_at":"2026-04-14T03:47:04Z","title":"SpecBound: Adaptive Bounded Self-Speculation with Layer-wise Confidence Calibration","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T16:22:05.049712Z"},"links":{"cited_paper":"/paper/2506.03700","citing_paper":"/paper/2604.12247"},"observation_digest":"sha256:8c395a9689c0a06e0081c6a98fe7cd7c8fac0f49dc00801524b29ae8dd82827e","observation_id":"475e5a31-0525-44da-9544-e3508eba031d","resolution":{"observed_at":"2026-05-11T09:00:58.697801Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"cited_work":{"arxiv_id":"2506.03700","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03700","snapshot_observed_at":"2026-06-30T08:44:27.295523Z","title":"Zhuofan Wen, Shangtong Gui, and Yang Feng","venue":null,"work_id":"ff8086b5-d03d-4644-9a5e-fe1ac9fbabf7","year":2025},"citing_paper":{"arxiv_id":"2606.29223","last_updated":"2026-06-28T06:22:09Z","snapshot_observed_at":"2026-08-12T12:45:36.075408Z","submitted_at":"2026-06-28T06:22:09Z","title":"Depth Exploration for LLM Decoding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T08:43:47.472682Z"},"links":{"cited_paper":"/paper/2506.03700","citing_paper":"/paper/2606.29223"},"observation_digest":"sha256:25a35e6ed31208500336705293a4323f4b1a84cba7cdbcea45189261bc0482c7","observation_id":"642cdc18-96fd-4579-97ce-916b42d78cd2","resolution":{"observed_at":"2026-06-30T08:44:27.297075Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03700","snapshot_observed_at":"2026-08-05T04:16:08.552840Z","title":"arXiv preprint arXiv:2506.03700 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04010","last_updated":"2026-08-04T17:59:58Z","snapshot_observed_at":"2026-08-13T08:29:27.770579Z","submitted_at":"2026-08-04T17:59:58Z","title":"ParVL: Parallel Scaling and Expandable Compute Allocation for Multimodal LLMs","version":1},"reference_index":115,"source":"arxiv_source","source_observed_at":"2026-08-05T04:16:08.552840Z"},"links":{"cited_paper":"/paper/2506.03700","citing_paper":"/paper/2608.04010"},"observation_digest":"sha256:9714f600f8394d682086d1f63b1b5aef2b44bb9be9c01dd98caf22eba28d720f","observation_id":"ca429a9b-ae99-4be2-b3ba-6fe0e5517d08","resolution":{"observed_at":"2026-08-05T04:16:08.552840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.03700/citation-record","integrity":"/paper/2506.03700/integrity","json":"/paper/2506.03700/citation-record.json","paper":"/paper/2506.03700"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:39.111163Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.111163Z"},"links":{"citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:1d521af6637ee3ee440d839e53926827eb8a04cd6b14a7fa82e41dc569b64e68","observation_id":"4bbd273e-ae5b-44cd-b242-8d013d4217c0","resolution":{"observed_at":"2026-08-07T11:02:39.111163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T11:02:39.117325Z","title":"L., Almeida, D., Altenschmidt, J., Altman, S., Anadkat, S., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.117325Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:c56e83bd3482773022186f9e1afd8d4bb6abed9902b59d48e7df07868fec404c","observation_id":"e876ddf6-366d-4099-a62e-a32c355c1ba1","resolution":{"observed_at":"2026-08-07T11:02:39.117325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:40.537453Z","title":"Hydra: Sequentially-dependent draft heads for medusa decoding","venue":null,"work_id":"a6739bfb-a644-4b28-a974-1e08ccc0fbb9","year":2024},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.122576Z"},"links":{"citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:9174c6d6b45f7eca426880da7fcbbe281ef30bc936c046c0f4d151c264c3d1a8","observation_id":"fa0354e5-809f-4963-96b7-b4e489d0721f","resolution":{"observed_at":"2026-08-07T11:02:40.542572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:40.521725Z","title":"Anthropic: Introducing claude 3.5 sonnet, 2024","venue":null,"work_id":"8e6cc60a-cb82-47e3-a1e8-586cbac3eea0","year":2024},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.127205Z"},"links":{"citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:0fa5c439a0c9aba44988705c996f94715972ff2674f5873ce7520743969e4098","observation_id":"cc87aa4a-3646-4859-b130-69d357c602d1","resolution":{"observed_at":"2026-08-07T11:02:40.526458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-07T11:02:39.131952Z","title":"Program synthesis with large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.131952Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:bbdf46fecd01552d4b04eaea857de1b8b33ff0ac98fd21a288745bcb28e9349c","observation_id":"19c0759c-be96-4050-8989-a97eb1fd32cd","resolution":{"observed_at":"2026-08-07T11:02:39.131952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:39.136964Z","title":"Fast and robust early-exiting framework for autoregressive language models with synchronized parallel decoding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.136964Z"},"links":{"citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:4dd4a1652b5deb8cc0f0fce7b224ae48088659f5cd1d3f99ed918801ebd5aba7","observation_id":"19d12a47-2d5d-44d4-8aea-3aee6179fd5d","resolution":{"observed_at":"2026-08-07T11:02:39.136964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.07055","last_updated":"2024-08-13T17:46:12Z","snapshot_observed_at":"2026-08-12T23:04:08.269970Z","submitted_at":"2024-08-13T17:46:12Z","title":"LongWriter: Unleashing 10,000+ Word Generation from Long Context LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.07055","snapshot_observed_at":"2026-08-07T11:02:39.141519Z","title":"LongWriter : Unleashing 10,000+ word generation from long context llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.141519Z"},"links":{"cited_paper":"/paper/2408.07055","citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:172454d1808eaa535ede31f23d04434b1785ec86e7b9cd8167f9f22b95fbf6b0","observation_id":"b8914505-6fde-4fe7-8f1d-0292bec2367d","resolution":{"observed_at":"2026-08-07T11:02:39.141519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21787","last_updated":"2024-12-30T19:03:24Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:57:25Z","title":"Large Language Monkeys: Scaling Inference Compute with Repeated Sampling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21787","snapshot_observed_at":"2026-08-07T11:02:39.146799Z","title":"V., R \\'e , C., and Mirhoseini, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.146799Z"},"links":{"cited_paper":"/paper/2407.21787","citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:25566460f720ac023f2a105b570ff0f2c185dabc37b84484c93bd483effba887","observation_id":"dad9f962-f222-425e-8389-f2f82e441797","resolution":{"observed_at":"2026-08-07T11:02:39.146799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:40.495104Z","title":"D., Chen, D., and Dao, T","venue":null,"work_id":"25fe5d29-227a-47f5-9c61-c37620612716","year":2024},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.151371Z"},"links":{"citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:1204252e10845e63cfdab7396491d367daa460583da2d946b7bf237e35385992","observation_id":"a6d50787-59f9-4d9b-9fde-cbfb998908a9","resolution":{"observed_at":"2026-08-07T11:02:40.499957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.01318","last_updated":"2023-02-02T18:44:11Z","snapshot_observed_at":"2026-08-10T21:52:49.568983Z","submitted_at":"2023-02-02T18:44:11Z","title":"Accelerating Large Language Model Decoding with Speculative Sampling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.01318","snapshot_observed_at":"2026-08-07T11:02:39.155905Z","title":"Accelerating large language model decoding with speculative sampling","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.155905Z"},"links":{"cited_paper":"/paper/2302.01318","citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:479739c6cbd23e8b074f33fd023de385140a07b98aeac739a7d7f6fa74e421e3","observation_id":"d6f76329-635d-4bdd-8141-deb9541e6a9e","resolution":{"observed_at":"2026-08-07T11:02:39.155905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06467","last_updated":"2024-12-06T16:50:13Z","snapshot_observed_at":"2026-08-13T08:42:08.002374Z","submitted_at":"2024-10-09T01:41:14Z","title":"WAPITI: A Watermark for Finetuned Open-Source LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06467","snapshot_observed_at":"2026-08-07T11:02:39.160378Z","title":"WAPITI : A watermark for finetuned open-source LLMs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.160378Z"},"links":{"cited_paper":"/paper/2410.06467","citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:880868bb0a47e83dc4240bdbaa21b9843ae338db60ab37ffa8129194611b0925","observation_id":"517a3181-d6a9-43b6-b6a7-e03263455086","resolution":{"observed_at":"2026-08-07T11:02:39.160378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-07T11:02:39.164777Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.164777Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:3241896b4d4501f23859db7fc188b16525d59f1688210fa7c5e7a222cdd35d8e","observation_id":"2995c851-694e-414b-8043-b2cf4dc76ec0","resolution":{"observed_at":"2026-08-07T11:02:39.164777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T11:02:39.169280Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.169280Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:a04cee9ff20adad5f563800ff57fb38606e318e7eab651bfede807e0e91cf927","observation_id":"06865bfe-f5cb-4986-bc51-0c98ec6ac986","resolution":{"observed_at":"2026-08-07T11:02:39.169280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:39.173568Z","title":"Flashattention-2: Faster attention with better parallelism and work partitioning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.173568Z"},"links":{"citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:7f9edb57f7ca4cb877b133adf2f742843c9d219edff9cbb6f5028755b0ddeda2","observation_id":"b5ab56a2-a86e-48d8-aeee-ffb48ab8ecca","resolution":{"observed_at":"2026-08-07T11:02:39.173568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02954","last_updated":"2024-01-05T18:59:13Z","snapshot_observed_at":"2026-08-10T17:03:38.042994Z","submitted_at":"2024-01-05T18:59:13Z","title":"DeepSeek LLM: Scaling Open-Source Language Models with Longtermism","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02954","snapshot_observed_at":"2026-08-07T11:02:39.177936Z","title":"DeepSeek LLM : Scaling open-source language models with longtermism","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.177936Z"},"links":{"cited_paper":"/paper/2401.02954","citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:969ef412b90594ce823a80782d48f21abc69f5b067b2f8de9afda3d2f50ad4cd","observation_id":"c5a98939-fdc4-4245-b86f-46aa7c54c832","resolution":{"observed_at":"2026-08-07T11:02:39.177936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-13T15:58:13.809876Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T11:02:39.182650Z","title":"DeepSeek-R1 : Incentivizing reasoning capability in LLMs via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.182650Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:a1a9c21ce88e6e50f75d1edaefb1597f055850d9c0bb6374e3861cc0694dc74b","observation_id":"18e49189-a87c-4c21-9a4e-6006e3a73a7f","resolution":{"observed_at":"2026-08-07T11:02:39.182650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02628","last_updated":"2023-07-05T19:59:09Z","snapshot_observed_at":"2026-08-13T11:02:00.153169Z","submitted_at":"2023-07-05T19:59:09Z","title":"SkipDecode: Autoregressive Skip Decoding with Batching and Caching for Efficient LLM Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.02628","snapshot_observed_at":"2026-08-07T11:02:39.187286Z","title":"Skipdecode: Autoregressive skip decoding with batching and caching for efficient LLM inference","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.187286Z"},"links":{"cited_paper":"/paper/2307.02628","citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:adacf8db78c86982652cbb2f7ad01298817cfaa7196ead3692e1c9635046fc4d","observation_id":"8387e030-7012-406e-b94c-0a712bcafefc","resolution":{"observed_at":"2026-08-07T11:02:39.187286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:40.469982Z","title":"QLoRA : Efficient finetuning of quantized LLMs","venue":null,"work_id":"d180e22a-d278-4c7f-a7b9-9d4618487ca7","year":2023},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.193356Z"},"links":{"citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:f8f49477f55125cccc182f6bf6448de40fb078de20c5d214e20fec12cd4b4722","observation_id":"38732595-4509-47ae-922b-34fc6e2a3a39","resolution":{"observed_at":"2026-08-07T11:02:40.474491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09435","last_updated":"2024-06-18T19:58:27Z","snapshot_observed_at":"2026-08-13T12:23:16.704823Z","submitted_at":"2023-03-16T16:10:16Z","title":"Jump to Conclusions: Short-Cutting Transformers With Linear Transformations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.09435","snapshot_observed_at":"2026-08-07T11:02:39.197592Z","title":"Y., Karidi, T., Choshen, L., and Geva, M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.197592Z"},"links":{"cited_paper":"/paper/2303.09435","citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:53c3b72614535fa2aaff4de390d3c1185d56737c854693e192e9eddc10c123be","observation_id":"7b6071e4-831a-43f8-8200-da6fc141262c","resolution":{"observed_at":"2026-08-07T11:02:39.197592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:40.455302Z","title":"Glide with a cape: A low-hassle method to accelerate speculative decoding","venue":null,"work_id":"4aa88216-a916-40ea-8d33-e31ab017cada","year":2024},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.202238Z"},"links":{"citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:f768c4e1aed95e1c481e4d40c64123f0f6726d361895ee881e213325d6a2c063","observation_id":"8ab443d8-4c37-4ed2-881b-a094f71fe195","resolution":{"observed_at":"2026-08-07T11:02:40.459979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T11:02:39.206389Z","title":"The Llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.206389Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:45ac9f75a4196b2f4a6284cfd05ffaa8611c3737e73df11fcef8bf6f55c788a2","observation_id":"15e11d1e-e8f8-4514-815f-f1ae43ebe166","resolution":{"observed_at":"2026-08-07T11:02:39.206389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:40.440792Z","title":"Depth-adaptive transformer","venue":null,"work_id":"6278d262-bbfd-456c-9d39-d84209d52d23","year":2020},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.210467Z"},"links":{"citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:1ece12e0e96d1d3bb92d53a1db1db57bd3debf3b537f7e68b3ceb3bee70da6b2","observation_id":"e86cd2b5-5a9a-440d-be4c-034879542cfd","resolution":{"observed_at":"2026-08-07T11:02:40.445245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:40.425488Z","title":"L ayer S kip: Enabling early exit inference and self-speculative decoding","venue":null,"work_id":"cef8b44f-182e-46e3-ab9e-29a243842973","year":2024},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.214544Z"},"links":{"citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:bad1cfcd6f1fe1a0c5bd1d9557090a3c44036eb8ce584d1c5f105c77d395a5f2","observation_id":"a80e998c-4443-4ea8-adbe-f0323b900831","resolution":{"observed_at":"2026-08-07T11:02:40.430525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:40.410565Z","title":"Break the sequential dependency of LLM inference using lookahead decoding","venue":null,"work_id":"eef8e80d-e76e-485c-93e5-6e826123a8d2","year":2024},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.218593Z"},"links":{"citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:a1fce603146bffe13ca0a8f97eceaf507b4618ee8638342f42b41096254c9681","observation_id":"201dc01e-7564-4e6e-a3fa-9b6a8a11b585","resolution":{"observed_at":"2026-08-07T11:02:40.415153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:40.394685Z","title":"Transformer feed-forward layers build predictions by promoting concepts in the vocabulary space","venue":null,"work_id":"10d5f668-8e48-43b7-9a93-bedf46d98121","year":2022},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.222519Z"},"links":{"citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:b7d9f99547737b771c3ee859656eae77a7b7f21e06dce3403581b252701d00c4","observation_id":"bb14de1f-0ab4-4afb-8f6a-818d935ffdca","resolution":{"observed_at":"2026-08-07T11:02:40.399611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04519","last_updated":"2025-01-08T14:12:57Z","snapshot_observed_at":"2026-08-13T07:49:29.333270Z","submitted_at":"2025-01-08T14:12:57Z","title":"rStar-Math: Small LLMs Can Master Math Reasoning with Self-Evolved Deep Thinking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04519","snapshot_observed_at":"2026-08-07T11:02:39.226807Z","title":"L., Liu, Y., Shang, N., Sun, Y., Zhu, Y., Yang, F., and Yang, M","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.226807Z"},"links":{"cited_paper":"/paper/2501.04519","citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:565f05530e0a7604885e7468e15456a0d8910023502f24994a209486fb61a3ee","observation_id":"94f56415-7df1-433c-b465-91a8350e4ce4","resolution":{"observed_at":"2026-08-07T11:02:39.226807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:40.378000Z","title":"REST : Retrieval-based speculative decoding","venue":null,"work_id":"7dee5c07-c28c-45cb-ba47-9021104dc52e","year":2024},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.231129Z"},"links":{"citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:e3f59a4436a584d53fef833c3a54253c53df7cd7f3e5f008a6604a02b2269d6b","observation_id":"5bed347e-7dc9-447c-a58b-b38a6354fe65","resolution":{"observed_at":"2026-08-07T11:02:40.383163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-08-09T19:52:33.533277Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-07T11:02:39.235113Z","title":"A., Welbl, J., Clark, A., Hennigan, T., Noland, E., Millican, K., van den Driessche, G., Damoc, B., Guy, A., Osindero, S., Simonyan, K., Elsen, E., Rae, J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.235113Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:05613c9ae3213ff0a6429226b34c3512e338267625a3d36dada3832e84cb8f8b","observation_id":"a12cfdc8-b27b-4192-a2d0-6e48d50e6eb5","resolution":{"observed_at":"2026-08-07T11:02:39.235113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:40.362103Z","title":"The curious case of neural text degeneration","venue":null,"work_id":"e3d2d144-6044-441b-ae85-19f5648d80ee","year":2020},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.239313Z"},"links":{"citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:0974c3b9f56b2424278b3083d5e659f3cded0f693e5ebbc67758e5bc9bd0a89f","observation_id":"daff1876-b4f7-4876-b4fd-120090b0c010","resolution":{"observed_at":"2026-08-07T11:02:40.366794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12072","last_updated":"2024-01-03T00:32:43Z","snapshot_observed_at":"2026-08-13T05:46:05.462247Z","submitted_at":"2023-10-18T16:07:01Z","title":"SPEED: Speculative Pipelined Execution for Efficient Decoding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12072","snapshot_observed_at":"2026-08-07T11:02:39.243484Z","title":"Speed: Speculative pipelined execution for efficient decoding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.243484Z"},"links":{"cited_paper":"/paper/2310.12072","citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:293dfea5729156977dce5366932a5eea4087f7b2c16c00664fa55aa016e108bd","observation_id":"5b54c427-bdf2-4722-a5b0-6f787aff1049","resolution":{"observed_at":"2026-08-07T11:02:39.243484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:40.347062Z","title":"E., Shen, Y., Wallis, P., Allen-Zhu, Z., Li, Y., Wang, S., and Chen, W","venue":null,"work_id":"a533bb01-4fa0-4070-84b2-0df9dbf3181d","year":2022},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.247841Z"},"links":{"citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:2093b0bf5a22e48a374a12f79edb5c5d274f6b4de2e645ed5830273cfa1ee9b5","observation_id":"8031e3f1-13b2-4eed-8dad-9b94ecfa7908","resolution":{"observed_at":"2026-08-07T11:02:40.351586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.00031","last_updated":"2025-02-25T00:21:14Z","snapshot_observed_at":"2026-08-10T01:27:28.903517Z","submitted_at":"2025-02-25T00:21:14Z","title":"Efficient Test-Time Scaling via Self-Calibration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.00031","snapshot_observed_at":"2026-08-07T11:02:39.251956Z","title":"Efficient test-time scaling via self-calibration","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.251956Z"},"links":{"cited_paper":"/paper/2503.00031","citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:06b4433a0a287e4ae47c20294ac91bdd4d31658e24d23fce02bc770925b58651","observation_id":"92faf0a8-b416-4acc-8d08-63636b1f2689","resolution":{"observed_at":"2026-08-07T11:02:39.251956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:40.332220Z","title":"Multi-scale dense networks for resource efficient image classification","venue":null,"work_id":"bc56766c-0eb1-486c-bfbe-9fe64cf44fa7","year":2018},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.256248Z"},"links":{"citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:a021b80cdca7c04381da5cc888e68bdb4abe4f2baf496854254805e3bd270225","observation_id":"0b37d04a-8585-4b7f-9845-86a22812cabb","resolution":{"observed_at":"2026-08-07T11:02:40.336787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19715","last_updated":"2025-07-11T01:33:18Z","snapshot_observed_at":"2026-08-12T23:54:33.795003Z","submitted_at":"2024-05-30T05:49:38Z","title":"SpecDec++: Boosting Speculative Decoding via Adaptive Candidate Lengths","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19715","snapshot_observed_at":"2026-08-07T11:02:39.260580Z","title":"Specdec++: Boosting speculative decoding via adaptive candidate lengths","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.260580Z"},"links":{"cited_paper":"/paper/2405.19715","citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:1059d14559f45787cbc46d17265c402939c0266e0b8ac0d1d25f50151b7283cb","observation_id":"c6ba6a95-54c5-4eb3-b122-6a9b5d7193e7","resolution":{"observed_at":"2026-08-07T11:02:39.260580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:40.317291Z","title":"A survey on hallucination in large language models: Principles, taxonomy, challenges, and open questions","venue":null,"work_id":"637c2aec-fe5a-44fd-83aa-52ba4ca76d20","year":2023},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.264904Z"},"links":{"citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:07b267e87935c3dd1a15c9ee19b7f31799834982a0a655aa35290dd76142d8ee","observation_id":"757b7c6c-b126-4ce0-84d0-6d6d96164eeb","resolution":{"observed_at":"2026-08-07T11:02:40.321949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-08T06:16:25.839566Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-07T11:02:39.268868Z","title":"Q., Sablayrolles, A., Roux, A., Mensch, A., Savary, B., Bamford, C., Chaplot, D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.268868Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:dde34381384f349b7676083c990183ebdf93cab389145930376fb2a7b65f9492","observation_id":"411e6a88-6391-4fd9-b649-592e0f0e39da","resolution":{"observed_at":"2026-08-07T11:02:39.268868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:40.302087Z","title":"Sigsoftmax: Reanalysis of the softmax bottleneck","venue":null,"work_id":"5bc237c7-c74b-4b4d-97bd-0d7928888130","year":2018},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.273111Z"},"links":{"citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:540c183cb8990baf43e73d63a93a91f9b2a23745bb7e88f9cc21e942a711e698","observation_id":"8ef25ad9-1f64-4dba-a51a-44173e48128e","resolution":{"observed_at":"2026-08-07T11:02:40.307036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-07T11:02:39.277280Z","title":"B., Chess, B., Child, R., Gray, S., Radford, A., Wu, J., and Amodei, D","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.277280Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:7dc1ae4fdfeba88f6f24ee3e790851e1a800000a10397d0cbf195cf072ff4cb3","observation_id":"1b63bef3-2853-4021-818a-d4ccc8d5b4e0","resolution":{"observed_at":"2026-08-07T11:02:39.277280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.13019","last_updated":"2024-05-24T07:40:27Z","snapshot_observed_at":"2026-08-13T00:07:26.389160Z","submitted_at":"2024-05-15T07:36:56Z","title":"A Comprehensive Survey of Accelerated Generation Techniques in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.13019","snapshot_observed_at":"2026-08-07T11:02:39.281273Z","title":"A comprehensive survey of accelerated generation techniques in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.281273Z"},"links":{"cited_paper":"/paper/2405.13019","citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:e979a49a8963d74ad9a19ae7f68f4513b1e221921f21b0c938a44e803dc193ba","observation_id":"471210c7-f1bc-4815-8654-554b09d948a9","resolution":{"observed_at":"2026-08-07T11:02:39.281273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:39.285634Z","title":"W., Gholami, A., and Keutzer, K","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.285634Z"},"links":{"citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:9cbec45656a0cb24439245516663905a702ae2d0ba52ca2327e026f2554a88db","observation_id":"2beb81a9-c3c8-4764-a4ce-583a06234c48","resolution":{"observed_at":"2026-08-07T11:02:39.285634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-08-11T01:31:26.242281Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-07T11:02:39.289715Z","title":"Kimi K1.5 : Scaling reinforcement learning with LLMs","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.289715Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:bcbcaf99b591b746eae3f298ab8389624afc499d36f89a89b0dfa48192601960","observation_id":"bb7f8bf5-bb5c-4c31-981c-8a06f41d05cf","resolution":{"observed_at":"2026-08-07T11:02:39.289715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-07T11:02:39.294461Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.294461Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:de1ab04750903d4fd7de5b6e909a6abc415110b0889409f85d4b27f6a46bf669","observation_id":"3ef55932-148c-41f3-9398-670a7691f026","resolution":{"observed_at":"2026-08-07T11:02:39.294461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:39.298736Z","title":"Fast inference from transformers via speculative decoding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.298736Z"},"links":{"citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:2af1b7f9e7ea0248f703e4152deb3c45cc78cf232f0005054b1859e8b3b05b01","observation_id":"9866707e-911f-403d-8b81-2558603b726e","resolution":{"observed_at":"2026-08-07T11:02:39.298736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:40.263215Z","title":"EAGLE : Speculative sampling requires rethinking feature uncertainty","venue":null,"work_id":"ebe3316e-acdc-4f7b-a7d8-a60bf4892db4","year":2024},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.302878Z"},"links":{"citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:9e89fa20839486960a71f7938020f1e43dcf3fa34bb5d68a20f686722ebcc369","observation_id":"94acec46-634f-44f3-b2e3-ff75c53c7aaa","resolution":{"observed_at":"2026-08-07T11:02:40.268093Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:40.247314Z","title":"EAGLE -2: Faster inference of language models with dynamic draft trees","venue":null,"work_id":"be95996c-82b9-4d14-8ced-e4db59005468","year":2024},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.306771Z"},"links":{"citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:e0ab1e344063d780ebeadcf8004fb29c6a46f663549cb83988e95abd8f2d0e63","observation_id":"8c182b05-b6c8-49b4-9489-3bab0d4c6b74","resolution":{"observed_at":"2026-08-07T11:02:40.252446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18911","last_updated":"2024-04-29T17:53:54Z","snapshot_observed_at":"2026-08-13T00:19:14.097200Z","submitted_at":"2024-04-29T17:53:54Z","title":"Kangaroo: Lossless Self-Speculative Decoding via Double Early Exiting","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18911","snapshot_observed_at":"2026-08-07T11:02:39.310757Z","title":"Kangaroo: Lossless self-speculative decoding via double early exiting","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.310757Z"},"links":{"cited_paper":"/paper/2404.18911","citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:61139098aee0d6cca7904af369419e9e79117c38a634aefa9f46caa5d3524f0e","observation_id":"4a3730a1-1a9a-448b-b099-e8041ad0a0d7","resolution":{"observed_at":"2026-08-07T11:02:39.310757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:40.231365Z","title":"Speculative decoding via early-exiting for faster LLM inference with T hompson sampling control mechanism","venue":null,"work_id":"bd30b920-2fa6-472c-b6bf-7147238f42e5","year":2024},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.315020Z"},"links":{"citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:6bf4e6e5c20efc9b0bafd9ee65bcc65594e9982ad203cb91d51e360bf0ed105d","observation_id":"c3e6d8d3-1059-4a40-b3e0-6c887e8ac97c","resolution":{"observed_at":"2026-08-07T11:02:40.236346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07177","last_updated":"2024-06-10T01:36:31Z","snapshot_observed_at":"2026-08-13T10:57:16.489873Z","submitted_at":"2023-10-11T04:03:42Z","title":"Online Speculative Decoding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07177","snapshot_observed_at":"2026-08-07T11:02:39.319649Z","title":"Online speculative decoding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.319649Z"},"links":{"cited_paper":"/paper/2310.07177","citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:2ca629226087406a6df79e8b518dc2ff92b61425bf1cbfacd7a4737ed0cefac9","observation_id":"392f706e-b5d3-4f78-8388-c4441d6cd354","resolution":{"observed_at":"2026-08-07T11:02:39.319649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08767","last_updated":"2025-05-26T01:07:58Z","snapshot_observed_at":"2026-08-09T01:41:22.532098Z","submitted_at":"2025-02-12T20:13:56Z","title":"SelfElicit: Your Language Model Secretly Knows Where is the Relevant Evidence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.08767","snapshot_observed_at":"2026-08-07T11:02:39.324065Z","title":"A., Adkathimar, R., Wei, T., and Tong, H","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.324065Z"},"links":{"cited_paper":"/paper/2502.08767","citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:16c17926853009cba4342b26baa36f59a24b1ce3000667012320406844b5c91b","observation_id":"d65e517c-e34b-44ef-8000-15ee09bcc21e","resolution":{"observed_at":"2026-08-07T11:02:39.324065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15234","last_updated":"2025-07-23T10:11:55Z","snapshot_observed_at":"2026-08-13T04:54:48.340267Z","submitted_at":"2023-12-23T11:57:53Z","title":"Towards Efficient Generative Large Language Model Serving: A Survey from Algorithms to Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15234","snapshot_observed_at":"2026-08-07T11:02:39.328762Z","title":"Towards efficient generative large language model serving: A survey from algorithms to systems","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.328762Z"},"links":{"cited_paper":"/paper/2312.15234","citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:3455b5210e637af2e799a26b192f49ccb7adfb30db26d3caf28fb04c604101a8","observation_id":"13b92ac1-0853-49ca-b29a-7b46567ace67","resolution":{"observed_at":"2026-08-07T11:02:39.328762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.09781","last_updated":"2024-04-01T02:18:42Z","snapshot_observed_at":"2026-08-13T11:40:43.963312Z","submitted_at":"2023-05-16T20:12:59Z","title":"SpecInfer: Accelerating Generative Large Language Model Serving with Tree-based Speculative Inference and Verification","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.09781","snapshot_observed_at":"2026-08-07T11:02:39.332990Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.332990Z"},"links":{"cited_paper":"/paper/2305.09781","citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:384fc2590bf31c917707f3af4ba8e4b97112c1ac4990faec48c0a15d2c03639b","observation_id":"524c374e-19b6-41cb-94cf-db6ad6372692","resolution":{"observed_at":"2026-08-07T11:02:39.332990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:40.215451Z","title":"B., and Lapata, M","venue":null,"work_id":"efd57f02-c2f0-4a06-b09d-eb9163d3d4b1","year":2018},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.337310Z"},"links":{"citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:36754c7689c831312865251825688e05252285df15a609ae9033bd9bc3d397a0","observation_id":"fbeac526-b188-40c9-92ca-a53d9fd3eff2","resolution":{"observed_at":"2026-08-07T11:02:40.220011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:40.200408Z","title":"Introducing OpenAI o1: Learning to reason with large language models, 2024","venue":null,"work_id":"d121b9b9-d3ea-4fc4-9f6a-2e7b0c283114","year":2024},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.341535Z"},"links":{"citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:1110f1cd511ac5c6bdf8c6382b63bb6f2943390ddad4ec92e715decae3799a0e","observation_id":"6dbb81cc-5103-41ad-b311-0f9705e9b60f","resolution":{"observed_at":"2026-08-07T11:02:40.205186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19371","last_updated":"2024-10-02T01:01:57Z","snapshot_observed_at":"2026-08-12T23:33:24.821991Z","submitted_at":"2024-06-27T17:50:35Z","title":"Suri: Multi-constraint Instruction Following for Long-form Text Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19371","snapshot_observed_at":"2026-08-07T11:02:39.345559Z","title":"M., Sun, S., and Iyyer, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.345559Z"},"links":{"cited_paper":"/paper/2406.19371","citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:339db047ace9f8dd77e79d93c6684f49823d7139ed68b097a8bcf5f39fac5749","observation_id":"b5b52e0b-3b03-412f-8a18-be2363e6336d","resolution":{"observed_at":"2026-08-07T11:02:39.345559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.09722","last_updated":"2025-04-10T02:35:34Z","snapshot_observed_at":"2026-08-12T23:23:02.922103Z","submitted_at":"2024-07-12T23:29:54Z","title":"Optimized Multi-Token Joint Decoding with Auxiliary Model for LLM Inference","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.09722","snapshot_observed_at":"2026-08-07T11:02:39.349604Z","title":"Optimized multi-token joint decoding with auxiliary model for LLM inference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.349604Z"},"links":{"cited_paper":"/paper/2407.09722","citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:2e619da3a801f66dc4d457f523a5a57f3fa11c5621d3d80da4716d4ac0adf88c","observation_id":"137b5722-76e6-45f9-93f9-7dd36980ffda","resolution":{"observed_at":"2026-08-07T11:02:39.349604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:39.354357Z","title":"Zero: Memory optimizations toward training trillion parameter models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.354357Z"},"links":{"citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:46700b84d612896cbc97163e4f107bf481193595992d9f7b988b329c10d809b4","observation_id":"c7d2b5b6-ba6f-4ae0-bd91-d6335a15b7d7","resolution":{"observed_at":"2026-08-07T11:02:39.354357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02258","last_updated":"2024-04-02T19:28:11Z","snapshot_observed_at":"2026-07-06T17:54:47.689340Z","submitted_at":"2024-04-02T19:28:11Z","title":"Mixture-of-Depths: Dynamically allocating compute in transformer-based language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02258","snapshot_observed_at":"2026-08-07T11:02:39.358502Z","title":"C., and Santoro, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.358502Z"},"links":{"cited_paper":"/paper/2404.02258","citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:b655052595b2ad19002fe98f9ffcacabe345f8dce27596c996675ae7e58f0d1f","observation_id":"00f1598f-a45e-45c9-8378-1ca46fde6337","resolution":{"observed_at":"2026-08-07T11:02:39.358502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:39.363381Z","title":"Confident adaptive language modeling","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.363381Z"},"links":{"citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:3720894c9dd2ba2659dbb248ffe60a01e34d71f7021c36813bad0323adef8899","observation_id":"c5b092e6-bafb-4015-b99a-ff921311b22b","resolution":{"observed_at":"2026-08-07T11:02:39.363381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-07T11:02:39.367516Z","title":"Scaling LLM test-time compute optimally can be more effective than scaling model parameters","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.367516Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:4290cd5a7ea8df3677df0a672000d02548dd45ffdfc870ea6d5088669120f1c0","observation_id":"1a47a6e7-9004-4fb9-af90-21d5e8a57ec0","resolution":{"observed_at":"2026-08-07T11:02:39.367516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:39.371960Z","title":"Blockwise parallel decoding for deep autoregressive models","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.371960Z"},"links":{"citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:1c21b8f2149f5f8a07ea6d4b16cfb76be5fc943c0f9b3b1250d8b032f0f52441","observation_id":"80b9a603-75a1-4c5a-9dc0-d52cb414d087","resolution":{"observed_at":"2026-08-07T11:02:39.371960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:39.376015Z","title":"Branchynet: Fast inference via early exiting from deep neural networks","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.376015Z"},"links":{"citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:7b4f24b77e73012e7393ef9dd5f2fe6bf2b35b4d9b7d632dc1984c4ff0ddbeee","observation_id":"f90a9b21-851c-4a9f-957b-736288df6d89","resolution":{"observed_at":"2026-08-07T11:02:39.376015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.18581","last_updated":"2023-11-07T05:44:17Z","snapshot_observed_at":"2026-08-13T05:38:39.725689Z","submitted_at":"2023-10-28T04:07:58Z","title":"Accelerating LLaMA Inference by Enabling Intermediate Layer Decoding via Instruction Tuning with LITE","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.18581","snapshot_observed_at":"2026-08-07T11:02:39.380095Z","title":"Accelerating Llama inference by enabling intermediate layer decoding via instruction tuning with LITE","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.380095Z"},"links":{"cited_paper":"/paper/2310.18581","citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:0546a6e71bb87b3d961b624396ef5c3473a77dedc42bad8937124e6b52d60867","observation_id":"91e438b8-eb7b-48b9-9186-9aea743e3c0b","resolution":{"observed_at":"2026-08-07T11:02:39.380095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.07851","last_updated":"2024-06-04T17:08:37Z","snapshot_observed_at":"2026-08-13T04:42:35.832870Z","submitted_at":"2024-01-15T17:26:50Z","title":"Unlocking Efficiency in Large Language Model Inference: A Comprehensive Survey of Speculative Decoding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.07851","snapshot_observed_at":"2026-08-07T11:02:39.384667Z","title":"Unlocking efficiency in large language model inference: A comprehensive survey of speculative decoding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.384667Z"},"links":{"cited_paper":"/paper/2401.07851","citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:b141c75c96f910fa99bfa535dfc079cc9021db0dd52678db67cdac788adcd4db","observation_id":"bc2d3b77-700d-4849-9bce-2a0b5b5c1298","resolution":{"observed_at":"2026-08-07T11:02:39.384667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:40.142366Z","title":"SWIFT : On-the-fly self-speculative decoding for LLM inference acceleration","venue":null,"work_id":"6152a21a-8772-40ed-b248-2f6e7c28c300","year":2025},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.389151Z"},"links":{"citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:15f050450f2aa16786d434610807e2ffbe0d7ce0b8a7bc4c471b125a63ea2573","observation_id":"6a266fe9-7a37-46dd-ac7d-0d2d051c1307","resolution":{"observed_at":"2026-08-07T11:02:40.146961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:40.126785Z","title":"Sheared LLaMA : Accelerating language model pre-training via structured pruning","venue":null,"work_id":"b06e97af-165f-4e28-8178-c7cd33bb5e9c","year":2024},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.393390Z"},"links":{"citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:0ca1fc412ae1c6ee5cc178df7c7dad986485689e5112f213d555a265b71ab8bb","observation_id":"3c447bb5-cafd-47be-b11f-5fc3ac132133","resolution":{"observed_at":"2026-08-07T11:02:40.131589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:40.109237Z","title":"Predictive pipelined decoding: A compute-latency trade-off for exact LLM decoding","venue":null,"work_id":"f61529a6-23dc-4221-8dd3-ddad18c96a70","year":2024},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.397839Z"},"links":{"citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:e0f81408fbfafc9480d86fcf272ca2865be5212e33924abedd402a49496ad834","observation_id":"1b1fd645-bab9-4770-a385-c6b917c22b62","resolution":{"observed_at":"2026-08-07T11:02:40.114487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:40.093151Z","title":null,"venue":null,"work_id":"9e3b822d-4497-4e78-8b7b-56b9ebd92323","year":2018},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.402276Z"},"links":{"citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:b6d674d3ada5d36b9f750a151581bb533ad8a7d0741d4cc4aa1a0f9849b99478","observation_id":"21a3dae6-973a-4857-968f-03fbbd74d4bf","resolution":{"observed_at":"2026-08-07T11:02:40.097652Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:40.077826Z","title":"C o S afe: Evaluating large language model safety in multi-turn dialogue coreference","venue":null,"work_id":"eceb10dc-6c7e-4d5e-984b-02641318dae7","year":2024},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.406543Z"},"links":{"citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:84b7eb14b6ac3c03e9c84c41140eb9b3ff2009c57a6ce8f362ad2e7b709db4fe","observation_id":"99ec4d90-e5a2-4bc7-9b00-edef53252766","resolution":{"observed_at":"2026-08-07T11:02:40.082567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:40.062338Z","title":"L., Ma, Z., Xue, Y., Zhai, J., Chen, W., Liu, Z., Zhang, P., Dong, Y., and Tang, J","venue":null,"work_id":"3bc01218-49ec-4416-b40a-17c23734d095","year":2023},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.410964Z"},"links":{"citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:d9f6875dd75cfdc9f61fb8daba9b24ed1b2b03e2e11823e78e2d17045ca6f5b6","observation_id":"1ab76d82-5c3e-4c69-b777-6e309c525fb3","resolution":{"observed_at":"2026-08-07T11:02:40.066657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:40.046591Z","title":"Draft & verify: Lossless large language model acceleration via self-speculative decoding","venue":null,"work_id":"f0532c18-ca09-4b34-a72f-53d223750018","year":2024},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.415285Z"},"links":{"citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:8c8975a972da67add749954234ba0f0b3173ed2d5a4e9c5a8508c5a271cb774c","observation_id":"b43b1424-d65b-4f94-b3e4-c5ea393af016","resolution":{"observed_at":"2026-08-07T11:02:40.051401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:40.027775Z","title":"SafetyBench : Evaluating the safety of large language models with multiple choice questions","venue":null,"work_id":"d952c3dd-5409-4206-a13a-fe71d5d9686e","year":2024},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.419910Z"},"links":{"citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:afe3d4e4aadf423b845899daa8b990ccc27538cd7475a35af6b07d0bafe32208","observation_id":"98a08fef-5fd2-4b5e-a4e8-127f583d7fcc","resolution":{"observed_at":"2026-08-07T11:02:40.035083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism"},"reference_resolution":{"displayed":71,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":44,"verified_exact":0,"verified_fuzzy":27},"total_outbound_references":71},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 71 of 71 outbound references and 4 inbound Pith citation observations for arXiv:2506.03700."}