{"as_of":"2026-08-10T12:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e07693c49a32241927509355cc4dea3b86e311e9d997d24742e7d261a3301e88","coverage":[{"denominator":59,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T16:38:30.250542Z","state":"measured"},{"denominator":60,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":60,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T15:02:37.509164Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2604.10152","last_updated":"2026-04-11T10:52:17Z","snapshot_observed_at":"2026-08-06T10:02:07.653631Z","submitted_at":"2026-04-11T10:52:17Z","title":"SpecMoE: A Fast and Efficient Mixture-of-Experts Inference via Self-Assisted Speculative Decoding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.10152","snapshot_observed_at":"2026-07-31T15:02:37.509164Z","title":"2604.10152 , archivePrefix=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24434","last_updated":"2026-07-27T13:44:42Z","snapshot_observed_at":"2026-08-04T22:26:57.428934Z","submitted_at":"2026-07-27T13:44:42Z","title":"DraftExpert: Expansion-Aware Self-Speculative Decoding for End-Device MoE Inference","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-07-31T15:02:37.509164Z"},"links":{"cited_paper":"/paper/2604.10152","citing_paper":"/paper/2607.24434"},"observation_digest":"sha256:5777ec57011a3b4047cc7ac7b6e5eac64a11c7cd153393a4c000f85545e983ed","observation_id":"49d73e67-0429-40a3-8a4e-9807b34d1f08","resolution":{"observed_at":"2026-07-31T15:02:37.509164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2604.10152/citation-record","integrity":"/paper/2604.10152/integrity","json":"/paper/2604.10152/citation-record.json","paper":"/paper/2604.10152"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SARATHI: Efficient LLM Inference by Piggybacking Decodes with Chunked Prefills","venue":null,"work_id":"6ba6a6b3-8d63-4aff-ab0d-627ca9b011a7","year":2023},"citing_paper":{"arxiv_id":"2604.10152","last_updated":"2026-04-11T10:52:17Z","snapshot_observed_at":"2026-08-06T10:02:07.653631Z","submitted_at":"2026-04-11T10:52:17Z","title":"SpecMoE: A Fast and Efficient Mixture-of-Experts Inference via Self-Assisted Speculative Decoding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T16:38:30.250542Z"},"links":{"citing_paper":"/paper/2604.10152"},"observation_digest":"sha256:49dddbabd9c2ef7ee710a27e0b0556c6d429fec89177762024ed55726431e11e","observation_id":"b566f263-596f-4861-b051-ab2de4d0446a","resolution":{"observed_at":"2026-05-17T14:19:46.475973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"GQA: Training Generalized Multi-query Transformer Models from Multi-Head Checkpoints","venue":null,"work_id":"29de49c9-ae83-4a4e-89df-1fe82c4cb360","year":2023},"citing_paper":{"arxiv_id":"2604.10152","last_updated":"2026-04-11T10:52:17Z","snapshot_observed_at":"2026-08-06T10:02:07.653631Z","submitted_at":"2026-04-11T10:52:17Z","title":"SpecMoE: A Fast and Efficient Mixture-of-Experts Inference via Self-Assisted Speculative Decoding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T16:38:30.250542Z"},"links":{"citing_paper":"/paper/2604.10152"},"observation_digest":"sha256:86a2e3b8629f75d538688309630b1b34c1baa2f6e204230da37f21f17d7cbcaf","observation_id":"37c68beb-f224-4c9a-ab1f-2d5145135533","resolution":{"observed_at":"2026-05-17T14:19:46.463271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"DeepSpeed- Inference: Enabling Efficient Inference of Transformer Models at Un- precedented Scale","venue":null,"work_id":"b323de04-f1aa-4530-8795-73a69c0434d3","year":2022},"citing_paper":{"arxiv_id":"2604.10152","last_updated":"2026-04-11T10:52:17Z","snapshot_observed_at":"2026-08-06T10:02:07.653631Z","submitted_at":"2026-04-11T10:52:17Z","title":"SpecMoE: A Fast and Efficient Mixture-of-Experts Inference via Self-Assisted Speculative Decoding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T16:38:30.250542Z"},"links":{"citing_paper":"/paper/2604.10152"},"observation_digest":"sha256:cbeebb64b6ecbde0f7dc1e447ef2b96381086c31d54c781b1a7296fdb1ad3858","observation_id":"0355760d-2113-457e-ab29-17d67028646e","resolution":{"observed_at":"2026-05-17T14:19:46.422803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Findings of the 2014 Workshop on Statistical Ma- chine Translation","venue":null,"work_id":"0390be0f-01e0-44db-91dc-9106605d01da","year":2014},"citing_paper":{"arxiv_id":"2604.10152","last_updated":"2026-04-11T10:52:17Z","snapshot_observed_at":"2026-08-06T10:02:07.653631Z","submitted_at":"2026-04-11T10:52:17Z","title":"SpecMoE: A Fast and Efficient Mixture-of-Experts Inference via Self-Assisted Speculative Decoding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T16:38:30.250542Z"},"links":{"citing_paper":"/paper/2604.10152"},"observation_digest":"sha256:b3be25429c598662e0feb89454739983d12ba1607e1fea0e42b27d1fecffedd1","observation_id":"405fb333-0b98-4080-bbdf-ff93d89518a9","resolution":{"observed_at":"2026-05-17T14:19:46.426003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Language Models are Few-shot Learners","venue":null,"work_id":"77dea86f-a53d-4f36-8ba6-b2049ed59e8d","year":2020},"citing_paper":{"arxiv_id":"2604.10152","last_updated":"2026-04-11T10:52:17Z","snapshot_observed_at":"2026-08-06T10:02:07.653631Z","submitted_at":"2026-04-11T10:52:17Z","title":"SpecMoE: A Fast and Efficient Mixture-of-Experts Inference via Self-Assisted Speculative Decoding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T16:38:30.250542Z"},"links":{"citing_paper":"/paper/2604.10152"},"observation_digest":"sha256:343c979148137971baecec0b88790b5f4108f9978511d85d46d09943b1ac5336","observation_id":"5ef2a298-8e66-4a77-aff4-bf70cb0eac91","resolution":{"observed_at":"2026-05-17T14:19:46.432864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Medusa: Simple LLM Inference Acceleration Framework with Multiple Decoding Heads","venue":null,"work_id":"6f1dd3a0-b855-4856-8fb4-8f491faac4ab","year":2024},"citing_paper":{"arxiv_id":"2604.10152","last_updated":"2026-04-11T10:52:17Z","snapshot_observed_at":"2026-08-06T10:02:07.653631Z","submitted_at":"2026-04-11T10:52:17Z","title":"SpecMoE: A Fast and Efficient Mixture-of-Experts Inference via Self-Assisted Speculative Decoding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T16:38:30.250542Z"},"links":{"citing_paper":"/paper/2604.10152"},"observation_digest":"sha256:c9f025881e26a5adaa46930dfd406b2b655e2de7ab5fd89633997910c714673e","observation_id":"691ceb76-dfb3-45f2-899e-dd57412a02f0","resolution":{"observed_at":"2026-05-17T14:19:46.439607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Accelerating Large Language Model Decoding with Speculative Sam- pling","venue":null,"work_id":"0f8f85cf-6347-4106-ac48-fc73492c5f8d","year":2023},"citing_paper":{"arxiv_id":"2604.10152","last_updated":"2026-04-11T10:52:17Z","snapshot_observed_at":"2026-08-06T10:02:07.653631Z","submitted_at":"2026-04-11T10:52:17Z","title":"SpecMoE: A Fast and Efficient Mixture-of-Experts Inference via Self-Assisted Speculative Decoding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T16:38:30.250542Z"},"links":{"citing_paper":"/paper/2604.10152"},"observation_digest":"sha256:458ab167b09001b7764bb63cf1dcd8b7c1c2c225a90936375090b53856658fb6","observation_id":"a457f1cb-78c2-43cb-8439-7b8517015f3b","resolution":{"observed_at":"2026-05-17T14:19:46.416059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Punica: Multi-tenant LoRA Serving","venue":null,"work_id":"cc7fe4ad-f620-4030-85df-232ca38e6218","year":2024},"citing_paper":{"arxiv_id":"2604.10152","last_updated":"2026-04-11T10:52:17Z","snapshot_observed_at":"2026-08-06T10:02:07.653631Z","submitted_at":"2026-04-11T10:52:17Z","title":"SpecMoE: A Fast and Efficient Mixture-of-Experts Inference via Self-Assisted Speculative Decoding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T16:38:30.250542Z"},"links":{"citing_paper":"/paper/2604.10152"},"observation_digest":"sha256:1001449d66478076194e1c2e85136a680d0202b6d3aa0b66537ee9f4e355fc8b","observation_id":"9d54a26b-0d96-48f0-ad37-9915d17a105f","resolution":{"observed_at":"2026-05-17T14:19:46.412494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sequoia: Scalable, Robust, and Hardware-aware Speculative Decoding","venue":null,"work_id":"f42d2a81-1aae-4885-9be4-b0118d24f783","year":2024},"citing_paper":{"arxiv_id":"2604.10152","last_updated":"2026-04-11T10:52:17Z","snapshot_observed_at":"2026-08-06T10:02:07.653631Z","submitted_at":"2026-04-11T10:52:17Z","title":"SpecMoE: A Fast and Efficient Mixture-of-Experts Inference via Self-Assisted Speculative Decoding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T16:38:30.250542Z"},"links":{"citing_paper":"/paper/2604.10152"},"observation_digest":"sha256:7ce9ca9325deeba6c52560a45de53c5f3e761fcf59005611e047db57aff0b1cf","observation_id":"e90832ac-51a3-404d-9e9c-7b7fb628efa9","resolution":{"observed_at":"2026-05-17T14:19:46.429488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"DeepSeek- R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":null,"work_id":"76ddc25b-45d6-4640-8845-38c4cad88394","year":2025},"citing_paper":{"arxiv_id":"2604.10152","last_updated":"2026-04-11T10:52:17Z","snapshot_observed_at":"2026-08-06T10:02:07.653631Z","submitted_at":"2026-04-11T10:52:17Z","title":"SpecMoE: A Fast and Efficient Mixture-of-Experts Inference via Self-Assisted Speculative Decoding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T16:38:30.250542Z"},"links":{"citing_paper":"/paper/2604.10152"},"observation_digest":"sha256:bc1851afea89d014cc51484c692c993721585e7717dd770d29269afe8276eec5","observation_id":"63ef1615-8a70-43f7-8ea9-5e3381c3c2b8","resolution":{"observed_at":"2026-05-17T14:19:46.397886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"LayerSkip: Enabling Early Exit Inference and Self-speculative Decoding","venue":null,"work_id":"ded94e91-ff4d-42d8-a566-679e81a7a866","year":2024},"citing_paper":{"arxiv_id":"2604.10152","last_updated":"2026-04-11T10:52:17Z","snapshot_observed_at":"2026-08-06T10:02:07.653631Z","submitted_at":"2026-04-11T10:52:17Z","title":"SpecMoE: A Fast and Efficient Mixture-of-Experts Inference via Self-Assisted Speculative Decoding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T16:38:30.250542Z"},"links":{"citing_paper":"/paper/2604.10152"},"observation_digest":"sha256:1e076946ecd9ea7e2d37d06154cedfe0a7d3016a05e074a61b49783a42c6ce43","observation_id":"4e2c2884-dad3-4c97-a583-5128aa759f66","resolution":{"observed_at":"2026-05-17T14:19:46.401644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fast Inference of Mixture-of-Experts Lan- guage Models with Offloading","venue":null,"work_id":"24136751-11c2-436c-9094-c247f6a3c7a9","year":2023},"citing_paper":{"arxiv_id":"2604.10152","last_updated":"2026-04-11T10:52:17Z","snapshot_observed_at":"2026-08-06T10:02:07.653631Z","submitted_at":"2026-04-11T10:52:17Z","title":"SpecMoE: A Fast and Efficient Mixture-of-Experts Inference via Self-Assisted Speculative Decoding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T16:38:30.250542Z"},"links":{"citing_paper":"/paper/2604.10152"},"observation_digest":"sha256:94c47ff1ec86f3819aab5abd2917843474f9750514a7323533119276f9a0cb21","observation_id":"316409e3-8e20-4ea0-b8a0-bf173dfa743f","resolution":{"observed_at":"2026-05-17T14:19:46.405055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity","venue":null,"work_id":"4bf969fc-e6db-43ef-b0d9-2b10cdf9285b","year":2022},"citing_paper":{"arxiv_id":"2604.10152","last_updated":"2026-04-11T10:52:17Z","snapshot_observed_at":"2026-08-06T10:02:07.653631Z","submitted_at":"2026-04-11T10:52:17Z","title":"SpecMoE: A Fast and Efficient Mixture-of-Experts Inference via Self-Assisted Speculative Decoding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T16:38:30.250542Z"},"links":{"citing_paper":"/paper/2604.10152"},"observation_digest":"sha256:29d0aa7615d0cfaf95023fe57ed66975f8965858f5cb36200c91b5babe363e9d","observation_id":"9b469f28-fafa-4ff3-a3c1-53de9ea7df4f","resolution":{"observed_at":"2026-05-17T14:19:46.376410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gemini: A Family of Highly Capable Multimodal Models","venue":null,"work_id":"5b8edaab-68b8-4300-bdda-5b98859f5bb4","year":2023},"citing_paper":{"arxiv_id":"2604.10152","last_updated":"2026-04-11T10:52:17Z","snapshot_observed_at":"2026-08-06T10:02:07.653631Z","submitted_at":"2026-04-11T10:52:17Z","title":"SpecMoE: A Fast and Efficient Mixture-of-Experts Inference via Self-Assisted Speculative Decoding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T16:38:30.250542Z"},"links":{"citing_paper":"/paper/2604.10152"},"observation_digest":"sha256:f4c05e13b55ae9d98deb86fb27d3ae1a7738d17f5dcb0d2d26258af59bb9f069","observation_id":"00b850ca-407a-49c9-9aa6-e4ec8a787b66","resolution":{"observed_at":"2026-05-17T14:19:46.379747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gemini 1.5: Unlocking Multimodal Understanding Across Mil- lions of Tokens of Context","venue":null,"work_id":"fd4fa2ec-3348-4b9f-8cfa-5a97f3c14152","year":2024},"citing_paper":{"arxiv_id":"2604.10152","last_updated":"2026-04-11T10:52:17Z","snapshot_observed_at":"2026-08-06T10:02:07.653631Z","submitted_at":"2026-04-11T10:52:17Z","title":"SpecMoE: A Fast and Efficient Mixture-of-Experts Inference via Self-Assisted Speculative Decoding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T16:38:30.250542Z"},"links":{"citing_paper":"/paper/2604.10152"},"observation_digest":"sha256:89dae5b961054fbcbb6118e8a1627695b411aae3709e192d3242a42d30b48e43","observation_id":"fc612821-20af-46cb-aad8-e3437c17930c","resolution":{"observed_at":"2026-05-17T14:19:46.383398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Teaching Machines to Read and Comprehend","venue":null,"work_id":"85e68446-4101-44f5-a101-b339a2b98b3c","year":2015},"citing_paper":{"arxiv_id":"2604.10152","last_updated":"2026-04-11T10:52:17Z","snapshot_observed_at":"2026-08-06T10:02:07.653631Z","submitted_at":"2026-04-11T10:52:17Z","title":"SpecMoE: A Fast and Efficient Mixture-of-Experts Inference via Self-Assisted Speculative Decoding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T16:38:30.250542Z"},"links":{"citing_paper":"/paper/2604.10152"},"observation_digest":"sha256:ed948a1c3f9f9aa3aa7a7e35e4299dc5c5ff1307000a6bc63740e2f2b008fd1a","observation_id":"1b2bbd69-c14a-4a2a-856a-d4f77c5cc20b","resolution":{"observed_at":"2026-05-17T14:19:46.369300Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Training Compute-Optimal Large Language Models","venue":null,"work_id":"d5802af2-2bae-469c-b5c2-3117476d26a3","year":2022},"citing_paper":{"arxiv_id":"2604.10152","last_updated":"2026-04-11T10:52:17Z","snapshot_observed_at":"2026-08-06T10:02:07.653631Z","submitted_at":"2026-04-11T10:52:17Z","title":"SpecMoE: A Fast and Efficient Mixture-of-Experts Inference via Self-Assisted Speculative Decoding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T16:38:30.250542Z"},"links":{"citing_paper":"/paper/2604.10152"},"observation_digest":"sha256:b6de6ee6c676f7ad109fa553e2c1495766d1559adb54a0374edf7f8e48320270","observation_id":"c20af1fb-17fe-4ce9-8b5f-51c9fe90cec8","resolution":{"observed_at":"2026-05-17T14:19:46.372262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Speed: Speculative Pipelined Execution for Efficient Decoding","venue":null,"work_id":"b935a0ea-e369-4c6c-b3cd-adab5711efd3","year":2023},"citing_paper":{"arxiv_id":"2604.10152","last_updated":"2026-04-11T10:52:17Z","snapshot_observed_at":"2026-08-06T10:02:07.653631Z","submitted_at":"2026-04-11T10:52:17Z","title":"SpecMoE: A Fast and Efficient Mixture-of-Experts Inference via Self-Assisted Speculative Decoding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T16:38:30.250542Z"},"links":{"citing_paper":"/paper/2604.10152"},"observation_digest":"sha256:9f8df89ad9eac3025d3a7ee9592f9d0c9b0209b2e1a73c84c2ba7f81c4fdb241","observation_id":"bc0d8b24-2a96-449d-81d9-fdbec2afffc9","resolution":{"observed_at":"2026-05-17T14:19:46.386939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards MoE Deployment: Mitigating Inefficiencies in Mixture-of-Expert (MoE) Inference","venue":null,"work_id":"1294bb43-03c4-4018-b069-89e75c8b3717","year":2023},"citing_paper":{"arxiv_id":"2604.10152","last_updated":"2026-04-11T10:52:17Z","snapshot_observed_at":"2026-08-06T10:02:07.653631Z","submitted_at":"2026-04-11T10:52:17Z","title":"SpecMoE: A Fast and Efficient Mixture-of-Experts Inference via Self-Assisted Speculative Decoding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T16:38:30.250542Z"},"links":{"citing_paper":"/paper/2604.10152"},"observation_digest":"sha256:51da55044545087d30d71af46e3c5d19dd6369eccbf1d55301c2d28d73ab5a97","observation_id":"3273372c-dfa3-447e-ae51-585c7ab9126c","resolution":{"observed_at":"2026-05-17T14:19:46.390734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hugging Face Accelerate","venue":null,"work_id":"f43cd6a2-3a08-40b4-8a24-6e50975f477e","year":2022},"citing_paper":{"arxiv_id":"2604.10152","last_updated":"2026-04-11T10:52:17Z","snapshot_observed_at":"2026-08-06T10:02:07.653631Z","submitted_at":"2026-04-11T10:52:17Z","title":"SpecMoE: A Fast and Efficient Mixture-of-Experts Inference via Self-Assisted Speculative Decoding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T16:38:30.250542Z"},"links":{"citing_paper":"/paper/2604.10152"},"observation_digest":"sha256:2a93cad8e078e374a4abf4484653037c153a21380af822e4a160fdae8e7a7a53","observation_id":"0e7d6da9-72ab-479a-a2cc-53779fcf006c","resolution":{"observed_at":"2026-05-17T14:19:46.435783Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tutel: Adaptive Mixture-of-Experts at Scale","venue":null,"work_id":"eeb1c7fa-6fd1-4006-8d98-2dd733981163","year":2023},"citing_paper":{"arxiv_id":"2604.10152","last_updated":"2026-04-11T10:52:17Z","snapshot_observed_at":"2026-08-06T10:02:07.653631Z","submitted_at":"2026-04-11T10:52:17Z","title":"SpecMoE: A Fast and Efficient Mixture-of-Experts Inference via Self-Assisted Speculative Decoding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T16:38:30.250542Z"},"links":{"citing_paper":"/paper/2604.10152"},"observation_digest":"sha256:7bea4bcc47f6461eb879d52d390c20db62d1c8982b63770b324900568a19e2d6","observation_id":"ca1d037e-de87-406d-b988-b0b447cb7f0b","resolution":{"observed_at":"2026-05-17T14:19:46.482714Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pre-gated MoE: An Algorithm-system Co-design for Fast and Scal- able Mixture-of-Expert Inference","venue":null,"work_id":"28746af0-d4c1-4d0f-a1bb-6c624ef60145","year":2024},"citing_paper":{"arxiv_id":"2604.10152","last_updated":"2026-04-11T10:52:17Z","snapshot_observed_at":"2026-08-06T10:02:07.653631Z","submitted_at":"2026-04-11T10:52:17Z","title":"SpecMoE: A Fast and Efficient Mixture-of-Experts Inference via Self-Assisted Speculative Decoding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T16:38:30.250542Z"},"links":{"citing_paper":"/paper/2604.10152"},"observation_digest":"sha256:e3f16aa8506d28cc70a793e0561954906cadeef3e40b1f41ab291ed66ca8da29","observation_id":"380ee061-47b4-441b-b21d-bb33afbbaddf","resolution":{"observed_at":"2026-05-17T14:21:51.689471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mixtral of Experts","venue":null,"work_id":"f99c6d21-bdce-4e54-972c-c3df53577b64","year":2024},"citing_paper":{"arxiv_id":"2604.10152","last_updated":"2026-04-11T10:52:17Z","snapshot_observed_at":"2026-08-06T10:02:07.653631Z","submitted_at":"2026-04-11T10:52:17Z","title":"SpecMoE: A Fast and Efficient Mixture-of-Experts Inference via Self-Assisted Speculative Decoding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T16:38:30.250542Z"},"links":{"citing_paper":"/paper/2604.10152"},"observation_digest":"sha256:bd967f920750a10e3a4a398d327496626e8b722f824fcd2fcb25be947e2e2e6c","observation_id":"9f212b4f-49d4-4af5-872d-fe58e011a35e","resolution":{"observed_at":"2026-05-17T14:21:51.679247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling Laws for Neural Language Models","venue":null,"work_id":"12b262ea-72c4-4003-9031-18882a4985b8","year":2020},"citing_paper":{"arxiv_id":"2604.10152","last_updated":"2026-04-11T10:52:17Z","snapshot_observed_at":"2026-08-06T10:02:07.653631Z","submitted_at":"2026-04-11T10:52:17Z","title":"SpecMoE: A Fast and Efficient Mixture-of-Experts Inference via Self-Assisted Speculative Decoding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T16:38:30.250542Z"},"links":{"citing_paper":"/paper/2604.10152"},"observation_digest":"sha256:7596f9fd560591a9dfd9da9198f37091011b9a6c3bc493132528d11637446ab0","observation_id":"3207587f-8095-457b-84b0-abf69c6fac66","resolution":{"observed_at":"2026-05-17T14:21:51.672578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling Laws for Neural Language Models","venue":null,"work_id":"1d17a8e2-e4bb-4ba1-b166-f480b7920ecd","year":2020},"citing_paper":{"arxiv_id":"2604.10152","last_updated":"2026-04-11T10:52:17Z","snapshot_observed_at":"2026-08-06T10:02:07.653631Z","submitted_at":"2026-04-11T10:52:17Z","title":"SpecMoE: A Fast and Efficient Mixture-of-Experts Inference via Self-Assisted Speculative Decoding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T16:38:30.250542Z"},"links":{"citing_paper":"/paper/2604.10152"},"observation_digest":"sha256:84d11b63240ca322f3096fbe05f65fdb91ec9896010bf9efc9ea41a6f8b4272c","observation_id":"45d4180b-0a65-4969-9a44-dd2e13215463","resolution":{"observed_at":"2026-05-17T14:19:46.491827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","venue":null,"work_id":"3289da25-6b02-4adc-a691-19773a5cb9cf","year":2023},"citing_paper":{"arxiv_id":"2604.10152","last_updated":"2026-04-11T10:52:17Z","snapshot_observed_at":"2026-08-06T10:02:07.653631Z","submitted_at":"2026-04-11T10:52:17Z","title":"SpecMoE: A Fast and Efficient Mixture-of-Experts Inference via Self-Assisted Speculative Decoding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T16:38:30.250542Z"},"links":{"citing_paper":"/paper/2604.10152"},"observation_digest":"sha256:8958b43a23555d2e82b0d80e7907533ab794ddd8d2352412fa1f52847df69f26","observation_id":"44fd884e-aff6-4fab-ba46-55f5d7f7203e","resolution":{"observed_at":"2026-05-17T14:19:46.496131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"GShard: Scaling Giant Models with Condi- tional Computation and Automatic Sharding","venue":null,"work_id":"f4acaa2d-d129-417a-8727-60f0401bd17d","year":2020},"citing_paper":{"arxiv_id":"2604.10152","last_updated":"2026-04-11T10:52:17Z","snapshot_observed_at":"2026-08-06T10:02:07.653631Z","submitted_at":"2026-04-11T10:52:17Z","title":"SpecMoE: A Fast and Efficient Mixture-of-Experts Inference via Self-Assisted Speculative Decoding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T16:38:30.250542Z"},"links":{"citing_paper":"/paper/2604.10152"},"observation_digest":"sha256:f8f792356689edb28feeb0288a861040aca80552d79eab623e188bf1dfbf8275","observation_id":"57bc9b2f-70d8-4dc6-9d71-2ee6c47007c9","resolution":{"observed_at":"2026-05-17T14:19:46.500340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fast Inference from Trans- formers via Speculative Decoding","venue":null,"work_id":"59ed1db5-fd60-4904-8ad3-427c00656fbd","year":2023},"citing_paper":{"arxiv_id":"2604.10152","last_updated":"2026-04-11T10:52:17Z","snapshot_observed_at":"2026-08-06T10:02:07.653631Z","submitted_at":"2026-04-11T10:52:17Z","title":"SpecMoE: A Fast and Efficient Mixture-of-Experts Inference via Self-Assisted Speculative Decoding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T16:38:30.250542Z"},"links":{"citing_paper":"/paper/2604.10152"},"observation_digest":"sha256:2b8f0d9ff2a41b76d3f65d55efc9cfa988568754a29a6e5878f409c952ce919c","observation_id":"e373bc3f-c164-4c10-9f82-151aeb10e8e2","resolution":{"observed_at":"2026-05-17T14:19:46.504183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"EAGLE: Speculative Sam- pling Requires Rethinking Feature Uncertainty","venue":null,"work_id":"fee4917d-47bb-4187-a723-2629e9511039","year":2024},"citing_paper":{"arxiv_id":"2604.10152","last_updated":"2026-04-11T10:52:17Z","snapshot_observed_at":"2026-08-06T10:02:07.653631Z","submitted_at":"2026-04-11T10:52:17Z","title":"SpecMoE: A Fast and Efficient Mixture-of-Experts Inference via Self-Assisted Speculative Decoding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T16:38:30.250542Z"},"links":{"citing_paper":"/paper/2604.10152"},"observation_digest":"sha256:60e07884f645e3cbb139f2a03caf7933b2ba9b0bf081301908782cfcf1f73fa6","observation_id":"e0320d12-49a5-4b9f-9b93-ae742bba1fcc","resolution":{"observed_at":"2026-05-17T14:19:46.508176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llama 4 and Multimodal AI: Expanding Intelligence Across Modalities","venue":null,"work_id":"bfe04756-c12b-48e0-8225-9456a7790066","year":2024},"citing_paper":{"arxiv_id":"2604.10152","last_updated":"2026-04-11T10:52:17Z","snapshot_observed_at":"2026-08-06T10:02:07.653631Z","submitted_at":"2026-04-11T10:52:17Z","title":"SpecMoE: A Fast and Efficient Mixture-of-Experts Inference via Self-Assisted Speculative Decoding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-10T16:38:30.250542Z"},"links":{"citing_paper":"/paper/2604.10152"},"observation_digest":"sha256:976d8ef1c273ddb265324488695135bf1e68775bef9e4db10ea8d5d12a0e5556","observation_id":"3f0aa89f-3f17-47d7-a6cd-da36cc2aedd4","resolution":{"observed_at":"2026-05-17T14:19:46.511888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Specinfer: Accelerating Large Language Model Serving with Tree-based Speculative Inference and Verification","venue":null,"work_id":"5ab831c6-6ac9-4e0f-9be6-14e1695b7a92","year":2024},"citing_paper":{"arxiv_id":"2604.10152","last_updated":"2026-04-11T10:52:17Z","snapshot_observed_at":"2026-08-06T10:02:07.653631Z","submitted_at":"2026-04-11T10:52:17Z","title":"SpecMoE: A Fast and Efficient Mixture-of-Experts Inference via Self-Assisted Speculative Decoding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T16:38:30.250542Z"},"links":{"citing_paper":"/paper/2604.10152"},"observation_digest":"sha256:90235d97c7a0dd7db47f50e52e963f429a29f148d144828dddd3e60330f65d92","observation_id":"cc43ec45-b1d8-4d1f-936b-c447b47639dc","resolution":{"observed_at":"2026-05-17T14:19:46.515980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"GPT-4 Technical Report","venue":null,"work_id":"5cda2cf9-af91-428b-9bf3-154f295421d2","year":2023},"citing_paper":{"arxiv_id":"2604.10152","last_updated":"2026-04-11T10:52:17Z","snapshot_observed_at":"2026-08-06T10:02:07.653631Z","submitted_at":"2026-04-11T10:52:17Z","title":"SpecMoE: A Fast and Efficient Mixture-of-Experts Inference via Self-Assisted Speculative Decoding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T16:38:30.250542Z"},"links":{"citing_paper":"/paper/2604.10152"},"observation_digest":"sha256:94d2e26b1259976e0ed770c2b1b7dbb282acb70323ba077785b144fffba26bfa","observation_id":"c8b8c081-b2bd-41c2-9e38-d86730793e35","resolution":{"observed_at":"2026-05-17T14:21:51.692508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Characterizing Power Management Opportunities for LLMs in the Cloud","venue":null,"work_id":"a4c2cafc-f3c7-443b-9cb6-fc6918c2c7db","year":2024},"citing_paper":{"arxiv_id":"2604.10152","last_updated":"2026-04-11T10:52:17Z","snapshot_observed_at":"2026-08-06T10:02:07.653631Z","submitted_at":"2026-04-11T10:52:17Z","title":"SpecMoE: A Fast and Efficient Mixture-of-Experts Inference via Self-Assisted Speculative Decoding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T16:38:30.250542Z"},"links":{"citing_paper":"/paper/2604.10152"},"observation_digest":"sha256:d1a608f597a9ec835d898d5fc494717782e0a82f1a5eebc51b8319324b21d87a","observation_id":"a1297ea4-aa9c-4bfb-ba42-6aba885d4899","resolution":{"observed_at":"2026-05-17T14:19:46.456058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Splitwise: Efficient Generative LLM Inference using Phase Splitting","venue":null,"work_id":"4a382607-95ea-4b6d-a2ae-8f8e0fc32c59","year":2024},"citing_paper":{"arxiv_id":"2604.10152","last_updated":"2026-04-11T10:52:17Z","snapshot_observed_at":"2026-08-06T10:02:07.653631Z","submitted_at":"2026-04-11T10:52:17Z","title":"SpecMoE: A Fast and Efficient Mixture-of-Experts Inference via Self-Assisted Speculative Decoding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-10T16:38:30.250542Z"},"links":{"citing_paper":"/paper/2604.10152"},"observation_digest":"sha256:14ebce6be679e51431c60754453ffb3ede30455620f0ee5ce2a8aa2bae764cc2","observation_id":"77769e0d-fda0-465a-ae90-0b268f419368","resolution":{"observed_at":"2026-05-17T14:19:46.459939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling Language Mod- els: Methods, Analysis & Insights from Training Gopher","venue":null,"work_id":"0b5965a9-c1ca-4d91-8f47-6dc96250fe6d","year":2022},"citing_paper":{"arxiv_id":"2604.10152","last_updated":"2026-04-11T10:52:17Z","snapshot_observed_at":"2026-08-06T10:02:07.653631Z","submitted_at":"2026-04-11T10:52:17Z","title":"SpecMoE: A Fast and Efficient Mixture-of-Experts Inference via Self-Assisted Speculative Decoding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-10T16:38:30.250542Z"},"links":{"citing_paper":"/paper/2604.10152"},"observation_digest":"sha256:5fa80e50ba32fc49de666ed0304467806510c0f77d0b903f988716acd1f160f1","observation_id":"64822a6a-ed74-421d-88a9-4a9cbe0ab2a0","resolution":{"observed_at":"2026-05-17T14:19:46.452825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deepspeed-MoE: Advancing Mixture-of- Experts Inference and Training to Power Next-generation AI Scale","venue":null,"work_id":"bff45f6c-9582-413a-9ec0-30c487571cbd","year":2022},"citing_paper":{"arxiv_id":"2604.10152","last_updated":"2026-04-11T10:52:17Z","snapshot_observed_at":"2026-08-06T10:02:07.653631Z","submitted_at":"2026-04-11T10:52:17Z","title":"SpecMoE: A Fast and Efficient Mixture-of-Experts Inference via Self-Assisted Speculative Decoding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-10T16:38:30.250542Z"},"links":{"citing_paper":"/paper/2604.10152"},"observation_digest":"sha256:3ca192ea6d1dc1aebf4d8b0bfd62fae4f4f223f998d0672895ddbe98c259c4e4","observation_id":"b56a02c1-932a-4554-9718-f0f37cbe7fba","resolution":{"observed_at":"2026-05-17T14:19:46.469923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Zero- Infinity: Breaking the GPU Memory Wall for Extreme Scale Deep Learning","venue":null,"work_id":"a1964e10-6a31-45b0-9ad3-42594fa8069f","year":2021},"citing_paper":{"arxiv_id":"2604.10152","last_updated":"2026-04-11T10:52:17Z","snapshot_observed_at":"2026-08-06T10:02:07.653631Z","submitted_at":"2026-04-11T10:52:17Z","title":"SpecMoE: A Fast and Efficient Mixture-of-Experts Inference via Self-Assisted Speculative Decoding","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-10T16:38:30.250542Z"},"links":{"citing_paper":"/paper/2604.10152"},"observation_digest":"sha256:d9ab666187cd5afd96f35784f7920bd48a54db57a17ca29ea185269b2689d104","observation_id":"86722ba3-7bc6-4f07-ab14-6c430ea7080f","resolution":{"observed_at":"2026-05-17T14:19:46.472899Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ZeRO-Offload: Democratizing Billion-scale Model Training","venue":null,"work_id":"93e9eea0-9a98-4183-bfed-f18ae7985fd6","year":2021},"citing_paper":{"arxiv_id":"2604.10152","last_updated":"2026-04-11T10:52:17Z","snapshot_observed_at":"2026-08-06T10:02:07.653631Z","submitted_at":"2026-04-11T10:52:17Z","title":"SpecMoE: A Fast and Efficient Mixture-of-Experts Inference via Self-Assisted Speculative Decoding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-10T16:38:30.250542Z"},"links":{"citing_paper":"/paper/2604.10152"},"observation_digest":"sha256:50761a806eb63e562e2848d8943c6c8b0fb0969f96ece0abbb7c7692837c9f42","observation_id":"1fff10f7-fcb5-465e-be75-3a766bab5524","resolution":{"observed_at":"2026-05-17T14:19:46.486277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Speculative decoding","venue":null,"work_id":"7b3bf725-5948-4a54-a378-4d91da7be7e9","year":2025},"citing_paper":{"arxiv_id":"2604.10152","last_updated":"2026-04-11T10:52:17Z","snapshot_observed_at":"2026-08-06T10:02:07.653631Z","submitted_at":"2026-04-11T10:52:17Z","title":"SpecMoE: A Fast and Efficient Mixture-of-Experts Inference via Self-Assisted Speculative Decoding","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-10T16:38:30.250542Z"},"links":{"citing_paper":"/paper/2604.10152"},"observation_digest":"sha256:87abf1131814a067f47105aadf159a4c14c7532808c05db9edd25179fe231f04","observation_id":"7cff7c62-b0a1-45bf-ad7d-9d0bedf159fb","resolution":{"observed_at":"2026-05-17T14:19:46.419368Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Get to The Point: Summarization with Pointer-generator Networks","venue":null,"work_id":"cacb7dc7-d1e9-4081-899e-7f19bb3ff2d5","year":2017},"citing_paper":{"arxiv_id":"2604.10152","last_updated":"2026-04-11T10:52:17Z","snapshot_observed_at":"2026-08-06T10:02:07.653631Z","submitted_at":"2026-04-11T10:52:17Z","title":"SpecMoE: A Fast and Efficient Mixture-of-Experts Inference via Self-Assisted Speculative Decoding","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-10T16:38:30.250542Z"},"links":{"citing_paper":"/paper/2604.10152"},"observation_digest":"sha256:7ea06eabdd3675c2a2897a116ba62d82852af5ca01003e706542d010da1f8120","observation_id":"4b96bcb2-3a70-4688-9f1e-fbac3f6bf4f7","resolution":{"observed_at":"2026-05-17T14:19:46.442967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Outrageously Large Neural Networks: The Sparsely-gated Mixture-of-Experts Layer","venue":null,"work_id":"1283ba53-afd8-45c2-9e28-9fbd154b6661","year":2017},"citing_paper":{"arxiv_id":"2604.10152","last_updated":"2026-04-11T10:52:17Z","snapshot_observed_at":"2026-08-06T10:02:07.653631Z","submitted_at":"2026-04-11T10:52:17Z","title":"SpecMoE: A Fast and Efficient Mixture-of-Experts Inference via Self-Assisted Speculative Decoding","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-10T16:38:30.250542Z"},"links":{"citing_paper":"/paper/2604.10152"},"observation_digest":"sha256:43a7e4060ac85ff627debcb0742b1dece18cad76e6d01a748a7547112d23567f","observation_id":"20547573-269e-4efc-a69e-3eb014b69054","resolution":{"observed_at":"2026-05-17T14:19:46.408980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"S-LoRA: Serving Thousands of Concurrent Lora Adapters","venue":null,"work_id":"94ff021a-4a47-4962-86ab-c47ee16d913c","year":2023},"citing_paper":{"arxiv_id":"2604.10152","last_updated":"2026-04-11T10:52:17Z","snapshot_observed_at":"2026-08-06T10:02:07.653631Z","submitted_at":"2026-04-11T10:52:17Z","title":"SpecMoE: A Fast and Efficient Mixture-of-Experts Inference via Self-Assisted Speculative Decoding","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-10T16:38:30.250542Z"},"links":{"citing_paper":"/paper/2604.10152"},"observation_digest":"sha256:67958f8636f849b07c174aca90b41966204aa637fc1fe68c1a1cdaf280fcb02e","observation_id":"06d6bb69-ca1b-428f-ab40-45e8f0c88523","resolution":{"observed_at":"2026-05-17T14:19:46.393962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"FlexGen: High-throughput Generative Inference of Large Language Models with a Single GPU","venue":null,"work_id":"f01ab37b-8b0a-4e24-92b6-ad7a5ff8adb4","year":2023},"citing_paper":{"arxiv_id":"2604.10152","last_updated":"2026-04-11T10:52:17Z","snapshot_observed_at":"2026-08-06T10:02:07.653631Z","submitted_at":"2026-04-11T10:52:17Z","title":"SpecMoE: A Fast and Efficient Mixture-of-Experts Inference via Self-Assisted Speculative Decoding","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-10T16:38:30.250542Z"},"links":{"citing_paper":"/paper/2604.10152"},"observation_digest":"sha256:0518af31d131aafe761cd0b1f278699532d1cfa1a3b72c94e9f193be254d3e67","observation_id":"60790074-9311-4c6c-9e43-64ef6c24e27e","resolution":{"observed_at":"2026-05-17T14:19:46.446198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling LLM Test-time Compute Optimally can be More Effective Than Scaling Model Parameters","venue":null,"work_id":"0ddb0672-f08e-42aa-98e6-9cc3926b2513","year":2024},"citing_paper":{"arxiv_id":"2604.10152","last_updated":"2026-04-11T10:52:17Z","snapshot_observed_at":"2026-08-06T10:02:07.653631Z","submitted_at":"2026-04-11T10:52:17Z","title":"SpecMoE: A Fast and Efficient Mixture-of-Experts Inference via Self-Assisted Speculative Decoding","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-10T16:38:30.250542Z"},"links":{"citing_paper":"/paper/2604.10152"},"observation_digest":"sha256:97dd52f56537c425ea4a178f71eda7cffd70971756504c100b3425b498f986b9","observation_id":"6229c04a-c89f-4a4b-bf40-d45ff7b91e61","resolution":{"observed_at":"2026-05-17T14:19:46.479285Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"PowerInfer: Fast Large Language Model Serving with a Consumer-grade GPU","venue":null,"work_id":"35aa28db-50f1-45ab-9f52-834bc72e7150","year":2024},"citing_paper":{"arxiv_id":"2604.10152","last_updated":"2026-04-11T10:52:17Z","snapshot_observed_at":"2026-08-06T10:02:07.653631Z","submitted_at":"2026-04-11T10:52:17Z","title":"SpecMoE: A Fast and Efficient Mixture-of-Experts Inference via Self-Assisted Speculative Decoding","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-10T16:38:30.250542Z"},"links":{"citing_paper":"/paper/2604.10152"},"observation_digest":"sha256:81dde57026505fba6357014ec584b86343616f5b1e2d433131cbf770a2a45df0","observation_id":"d8f3d2e9-fe74-4de4-9918-f22dc97f60b7","resolution":{"observed_at":"2026-05-17T14:21:51.647013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Accelerating LLM Inference with Staged Speculative Decoding","venue":null,"work_id":"f228903d-717c-40fe-a2bd-21112a02d3c8","year":2023},"citing_paper":{"arxiv_id":"2604.10152","last_updated":"2026-04-11T10:52:17Z","snapshot_observed_at":"2026-08-06T10:02:07.653631Z","submitted_at":"2026-04-11T10:52:17Z","title":"SpecMoE: A Fast and Efficient Mixture-of-Experts Inference via Self-Assisted Speculative Decoding","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-10T16:38:30.250542Z"},"links":{"citing_paper":"/paper/2604.10152"},"observation_digest":"sha256:23fa4389d613c60e61a847d4df9cfbc0d0a42277efc3a3caadae8f6049f20f27","observation_id":"b92f4e30-bb73-49cd-b78a-f03a85dc7ef8","resolution":{"observed_at":"2026-05-17T14:21:51.669024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Blockwise Parallel Decoding for Deep Autoregressive Models","venue":null,"work_id":"650842e0-7590-432f-819f-9e2771253f35","year":2018},"citing_paper":{"arxiv_id":"2604.10152","last_updated":"2026-04-11T10:52:17Z","snapshot_observed_at":"2026-08-06T10:02:07.653631Z","submitted_at":"2026-04-11T10:52:17Z","title":"SpecMoE: A Fast and Efficient Mixture-of-Experts Inference via Self-Assisted Speculative Decoding","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-10T16:38:30.250542Z"},"links":{"citing_paper":"/paper/2604.10152"},"observation_digest":"sha256:71cc0fc1ca07b205ade83d0d4ce38fdadbd9b831c12d7dc6563bf8274d4524a6","observation_id":"abdc8994-7c0a-4b0c-bae2-fb8455d9c68e","resolution":{"observed_at":"2026-05-17T14:21:51.656890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SpecExec: Massively Parallel Speculative Decoding For Interactive LLM Inference on Consumer Devices","venue":null,"work_id":"c4ff7d72-ae82-47c8-bb7f-003e52de5183","year":2024},"citing_paper":{"arxiv_id":"2604.10152","last_updated":"2026-04-11T10:52:17Z","snapshot_observed_at":"2026-08-06T10:02:07.653631Z","submitted_at":"2026-04-11T10:52:17Z","title":"SpecMoE: A Fast and Efficient Mixture-of-Experts Inference via Self-Assisted Speculative Decoding","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-10T16:38:30.250542Z"},"links":{"citing_paper":"/paper/2604.10152"},"observation_digest":"sha256:d20a5de03906b965b7c2fae792b31f73cadd9625ac59b4c7183f36535d96aae8","observation_id":"ff9b6ab1-76cb-44d5-b0db-34c072dd1000","resolution":{"observed_at":"2026-05-17T14:21:51.652480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"No Language Left Behind: Scaling Human-centered Machine Translation","venue":null,"work_id":"d83d2496-3748-4401-bccf-a1c1cb8b007c","year":2022},"citing_paper":{"arxiv_id":"2604.10152","last_updated":"2026-04-11T10:52:17Z","snapshot_observed_at":"2026-08-06T10:02:07.653631Z","submitted_at":"2026-04-11T10:52:17Z","title":"SpecMoE: A Fast and Efficient Mixture-of-Experts Inference via Self-Assisted Speculative Decoding","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-10T16:38:30.250542Z"},"links":{"citing_paper":"/paper/2604.10152"},"observation_digest":"sha256:4077aa1c4b7b2a4b7d0525853d10b3fdd917359c1c8b851ed0e2af052c21bfa4","observation_id":"226645b6-bd55-4f95-a397-6a318d1a2b47","resolution":{"observed_at":"2026-05-17T14:21:51.682631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"LLaMA: Open and Efficient Foundation Language Models","venue":null,"work_id":"9aa8db54-d267-4cea-93a4-8bc0d55c607d","year":2023},"citing_paper":{"arxiv_id":"2604.10152","last_updated":"2026-04-11T10:52:17Z","snapshot_observed_at":"2026-08-06T10:02:07.653631Z","submitted_at":"2026-04-11T10:52:17Z","title":"SpecMoE: A Fast and Efficient Mixture-of-Experts Inference via Self-Assisted Speculative Decoding","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-10T16:38:30.250542Z"},"links":{"citing_paper":"/paper/2604.10152"},"observation_digest":"sha256:05f7a23e4f7a09f8b637447e79d1345ea96906643128448afb18975b22b43160","observation_id":"e954ce5e-ffd4-4a18-967d-19b206295255","resolution":{"observed_at":"2026-05-17T14:21:51.686123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"APTMoE: Affinity-aware Pipeline Tuning for MoE Models on Bandwidth-constrained GPU Nodes","venue":null,"work_id":"9e973274-183a-4f66-b797-a72dd339d3f5","year":2024},"citing_paper":{"arxiv_id":"2604.10152","last_updated":"2026-04-11T10:52:17Z","snapshot_observed_at":"2026-08-06T10:02:07.653631Z","submitted_at":"2026-04-11T10:52:17Z","title":"SpecMoE: A Fast and Efficient Mixture-of-Experts Inference via Self-Assisted Speculative Decoding","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-10T16:38:30.250542Z"},"links":{"citing_paper":"/paper/2604.10152"},"observation_digest":"sha256:01334b1b0d740c1dd09261dd8a6ea297b4e9f5dfd72814716e7a182d51c0191b","observation_id":"4d9233e4-5e1d-4f94-aea8-8666986847d9","resolution":{"observed_at":"2026-05-17T14:19:46.466586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"HuggingFace’s Transformers: State-of-the-art Natural Language Processing","venue":null,"work_id":"8ac91e2c-9ff8-4515-94f5-fa33b652d697","year":2020},"citing_paper":{"arxiv_id":"2604.10152","last_updated":"2026-04-11T10:52:17Z","snapshot_observed_at":"2026-08-06T10:02:07.653631Z","submitted_at":"2026-04-11T10:52:17Z","title":"SpecMoE: A Fast and Efficient Mixture-of-Experts Inference via Self-Assisted Speculative Decoding","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-10T16:38:30.250542Z"},"links":{"citing_paper":"/paper/2604.10152"},"observation_digest":"sha256:6dfa9a3d16c17fe5c4ff015d6fa16221b3f8b30fd8ce07507791922ce5c848cb","observation_id":"94b21548-da04-47bf-acc5-9c6098344bc2","resolution":{"observed_at":"2026-05-17T14:19:46.449500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"{dLoRA}: Dynamically Orchestrating Requests and Adapters for{LoRA}{LLM} Serving","venue":null,"work_id":"14b2d542-312e-49cf-97d4-376d9d034130","year":2024},"citing_paper":{"arxiv_id":"2604.10152","last_updated":"2026-04-11T10:52:17Z","snapshot_observed_at":"2026-08-06T10:02:07.653631Z","submitted_at":"2026-04-11T10:52:17Z","title":"SpecMoE: A Fast and Efficient Mixture-of-Experts Inference via Self-Assisted Speculative Decoding","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-10T16:38:30.250542Z"},"links":{"citing_paper":"/paper/2604.10152"},"observation_digest":"sha256:04d5ef9b0697697e204ae374edd68fd2764aa3fb0385194e1b5857ba70848607","observation_id":"3538104c-2d4b-4b64-8f90-746e9fde1d4a","resolution":{"observed_at":"2026-05-17T14:21:51.695468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"EdgeLLM: Fast On-Device LLM Inference With Speculative Decoding","venue":null,"work_id":"3437c80e-2848-405e-bdb4-c72708905ef8","year":2024},"citing_paper":{"arxiv_id":"2604.10152","last_updated":"2026-04-11T10:52:17Z","snapshot_observed_at":"2026-08-06T10:02:07.653631Z","submitted_at":"2026-04-11T10:52:17Z","title":"SpecMoE: A Fast and Efficient Mixture-of-Experts Inference via Self-Assisted Speculative Decoding","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-10T16:38:30.250542Z"},"links":{"citing_paper":"/paper/2604.10152"},"observation_digest":"sha256:0c8b3336c61c3395061f77272f0d9a3aa140ad1ad8ba0d288dbb380ba0b62c16","observation_id":"14eab501-0dd4-4503-ac73-39a6295c2de9","resolution":{"observed_at":"2026-05-17T14:21:51.664824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"EdgeMoE: Fast On-device Inference of MoE-based Large Language Models","venue":null,"work_id":"2e7d0fd9-30e2-4d56-b1f4-bc67771d1db9","year":2023},"citing_paper":{"arxiv_id":"2604.10152","last_updated":"2026-04-11T10:52:17Z","snapshot_observed_at":"2026-08-06T10:02:07.653631Z","submitted_at":"2026-04-11T10:52:17Z","title":"SpecMoE: A Fast and Efficient Mixture-of-Experts Inference via Self-Assisted Speculative Decoding","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-10T16:38:30.250542Z"},"links":{"citing_paper":"/paper/2604.10152"},"observation_digest":"sha256:b6248973b6679e74920f3d8d05c6e11a10c478aafb914a2049c64f3ff4e782ea","observation_id":"9cb31b67-b91f-4c60-81d2-22040506c662","resolution":{"observed_at":"2026-05-17T14:21:51.661084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"MoESys: A Distributed and Efficient Mixture-of-Experts Training and Inference System for Internet Services","venue":null,"work_id":"2a6e0b6d-4e1a-4879-a787-7518dbbcc6f0","year":2022},"citing_paper":{"arxiv_id":"2604.10152","last_updated":"2026-04-11T10:52:17Z","snapshot_observed_at":"2026-08-06T10:02:07.653631Z","submitted_at":"2026-04-11T10:52:17Z","title":"SpecMoE: A Fast and Efficient Mixture-of-Experts Inference via Self-Assisted Speculative Decoding","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-10T16:38:30.250542Z"},"links":{"citing_paper":"/paper/2604.10152"},"observation_digest":"sha256:4ed045d4bbbab155be645783657c8a2d91f9b7661056df03fbc7261d85df77e6","observation_id":"317ec3a9-c46a-4606-b4f5-0a5642e00339","resolution":{"observed_at":"2026-05-17T14:19:46.527756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Orca: A Distributed Serving System for{Transformer-based}Generative Mod- els","venue":null,"work_id":"0de51487-4ad0-46a5-9693-470cefd318c6","year":2022},"citing_paper":{"arxiv_id":"2604.10152","last_updated":"2026-04-11T10:52:17Z","snapshot_observed_at":"2026-08-06T10:02:07.653631Z","submitted_at":"2026-04-11T10:52:17Z","title":"SpecMoE: A Fast and Efficient Mixture-of-Experts Inference via Self-Assisted Speculative Decoding","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-10T16:38:30.250542Z"},"links":{"citing_paper":"/paper/2604.10152"},"observation_digest":"sha256:432b661460f653c41f414f737357128d0d80d84baea0252b495843a69b32b757","observation_id":"591e4733-b9f1-4fbe-859e-8518bda0c982","resolution":{"observed_at":"2026-05-17T14:19:46.519934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Duplex: A Device for Large Language Models with Mixture of Experts, Grouped Query Attention, and Continuous Batching","venue":null,"work_id":"b9c00c5a-d6f7-4e0e-b97b-579d15bfccd7","year":2024},"citing_paper":{"arxiv_id":"2604.10152","last_updated":"2026-04-11T10:52:17Z","snapshot_observed_at":"2026-08-06T10:02:07.653631Z","submitted_at":"2026-04-11T10:52:17Z","title":"SpecMoE: A Fast and Efficient Mixture-of-Experts Inference via Self-Assisted Speculative Decoding","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-10T16:38:30.250542Z"},"links":{"citing_paper":"/paper/2604.10152"},"observation_digest":"sha256:a47ac99c3b9fdf0a6a3050645ee855626ee251b0cd66199ede809c7c8c15349f","observation_id":"c2a44426-12d3-4750-90a2-5704b2b52f10","resolution":{"observed_at":"2026-05-17T14:19:46.524136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Draft & Verify: Lossless Large Language Model Acceleration via Self- speculative decoding","venue":null,"work_id":"fe13cb44-15fa-4159-939e-45a3268d55d2","year":2023},"citing_paper":{"arxiv_id":"2604.10152","last_updated":"2026-04-11T10:52:17Z","snapshot_observed_at":"2026-08-06T10:02:07.653631Z","submitted_at":"2026-04-11T10:52:17Z","title":"SpecMoE: A Fast and Efficient Mixture-of-Experts Inference via Self-Assisted Speculative Decoding","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-10T16:38:30.250542Z"},"links":{"citing_paper":"/paper/2604.10152"},"observation_digest":"sha256:e8b3b38f0cd6d0db54edcf3959cbcc2914b22bf3ae10e7835fcd90a3f075aa00","observation_id":"1817edb4-684e-4db7-b8d0-c049b052165a","resolution":{"observed_at":"2026-05-17T14:21:51.675824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.10152","last_updated":"2026-04-11T10:52:17Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-06T10:02:07.653631Z","submitted_at":"2026-04-11T10:52:17Z","title":"SpecMoE: A Fast and Efficient Mixture-of-Experts Inference via Self-Assisted Speculative Decoding"},"reference_resolution":{"displayed":59,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":59},"total_outbound_references":59},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 1 inbound Pith citation observation for arXiv:2604.10152."}