{"as_of":"2026-08-17T07:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:10e9290540c995b5ef7ea63d750b909e0fdb886418560940fa9326e98cc5f61d","coverage":[{"denominator":69,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":69,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T15:48:05.592441Z","state":"measured"},{"denominator":69,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":69,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.05303/citation-record","integrity":"/paper/2608.05303/integrity","json":"/paper/2608.05303/citation-record.json","paper":"/paper/2608.05303"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.12013","last_updated":"2024-10-15T19:22:27Z","snapshot_observed_at":"2026-08-16T13:09:03.103606Z","submitted_at":"2024-10-15T19:22:27Z","title":"MoE-Pruner: Pruning Mixture-of-Experts Large Language Model using the Hints from Its Router","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12013","snapshot_observed_at":"2026-08-08T15:48:05.370776Z","title":"MoE-Pruner: Pruning Mixture-of-Experts Large Language Model using the Hints from Its Router,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-14T12:53:51.651510Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.370776Z"},"links":{"cited_paper":"/paper/2410.12013","citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:47a21708af96b454c4a8cf5815bb843b8b68da26113cb25395b30e542ffd1b9c","observation_id":"ed695317-8d7c-41bc-837b-f2d21b5eca00","resolution":{"observed_at":"2026-08-08T15:48:05.370776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:48:07.698451Z","title":"EdgeMoE: Empowering Sparse Large Language Models on Mobile Devices,","venue":null,"work_id":"bc43a0a8-483d-4548-af4d-7940370f76fe","year":2025},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-14T12:53:51.651510Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.374909Z"},"links":{"citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:58698d448f41935d4e30cc09897809acebcd1b3fe710d974f2aabceeeb6042a0","observation_id":"f3f5d51a-8acc-4b44-ae49-dbfe0854c943","resolution":{"observed_at":"2026-08-08T15:48:07.701101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:48:07.690409Z","title":"SMoLPU: 122.1µJ/Token Sparse MoE- Based Speculative Decoding Language Processing Unit with Adaptive- Offload NPU-CIM Core,","venue":null,"work_id":"eb99a1d0-349e-4942-952e-6f0b36abbe3f","year":2026},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-14T12:53:51.651510Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.378530Z"},"links":{"citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:bae279092eb39b74a675b37524eef826eb9ed20dbeb610c880832192555c3897","observation_id":"ae263b66-9294-4466-8a4f-00936893b512","resolution":{"observed_at":"2026-08-08T15:48:07.693024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T03:30:12.735656Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-08T15:48:05.381623Z","title":"GPT-4 Technical Report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-14T12:53:51.651510Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.381623Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:f0841f57e4ec4a0f2c079d95e2843a7282c3c0922858215ebcdbdb1f5c54d476","observation_id":"5b2ecdfb-c0dc-4ed0-a45a-9bcbf43469f4","resolution":{"observed_at":"2026-08-08T15:48:05.381623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-08T15:48:05.385130Z","title":"The Llama 3 Herd of Models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-14T12:53:51.651510Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.385130Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:8ee9781bd40ce838e92030d5ec1ac1f2a7e8783626138dab63c372ecfbcef1d2","observation_id":"db22c0f0-b175-463e-9034-0cf8ee242061","resolution":{"observed_at":"2026-08-08T15:48:05.385130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-08-14T18:15:53.516440Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-08T15:48:05.388512Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-14T12:53:51.651510Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.388512Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:b1cc71eccfbce3ab9f19894d6febef31ae8348ed10b55a3cdc4dee339892f40a","observation_id":"051c5fe7-3177-483f-a8ef-098e51f1b1e2","resolution":{"observed_at":"2026-08-08T15:48:05.388512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:48:05.392025Z","title":"Squeezed atten- tion: Accelerating long context length llm inference,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-14T12:53:51.651510Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.392025Z"},"links":{"citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:4eed1db6677a6c82a3c471c7c1a247aa585881f41d29519d02d2f45325ff8649","observation_id":"4e9b8a5e-85bd-4193-bf90-dce9372c11d4","resolution":{"observed_at":"2026-08-08T15:48:05.392025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:48:07.682727Z","title":"ALISA: Accelerating Large Language Model Inference via Sparsity-Aware KV Caching,","venue":null,"work_id":"b17b9e2c-257b-4c7b-b108-5c2b750b1323","year":2024},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-14T12:53:51.651510Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.394901Z"},"links":{"citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:8b5f90be360c9c6d67c6c1bb05f472090ce8a4330c33732f38643b9afab70769","observation_id":"809ce551-d722-49fb-b103-277daee70d60","resolution":{"observed_at":"2026-08-08T15:48:07.685342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:48:07.673644Z","title":"23.7 BROCA: A 52.4-to-559.2mW Mobile Social Agent System-on-Chip with Adaptive Bit-Truncate Unit and Acoustic-Cluster Bit Grouping,","venue":null,"work_id":"2f2f123c-17f8-4d6e-a309-39f10cb140bb","year":2025},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-14T12:53:51.651510Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.398249Z"},"links":{"citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:d045cf0f7b7271cdc796d4775a8090a6fd2f39176f41b478a6c4c75e56e65bcc","observation_id":"ac65b07a-5a20-485d-aca6-501ffe8b44d5","resolution":{"observed_at":"2026-08-08T15:48:07.676879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:48:07.664121Z","title":"Fast on-device LLM inference with npus,","venue":null,"work_id":"75e3fe20-c2d8-4b6c-b490-7246ae85a6c8","year":2025},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-14T12:53:51.651510Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.401099Z"},"links":{"citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:b82ab7d7387087f925c0d007e4a7b0b5abcd86d89d0c2d8e3697c65f8b50fc8d","observation_id":"ba28f471-836c-4fd3-a67c-ef42ce85d1c0","resolution":{"observed_at":"2026-08-08T15:48:07.667360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:48:07.654827Z","title":"C-Transformer: An Energy-Efficient Homogeneous DNN- Transformer/SNN-Transformer Processor for Large Language Models,","venue":null,"work_id":"542ab405-6ae4-451c-9ebc-0aa891bf381a","year":2025},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-14T12:53:51.651510Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.404815Z"},"links":{"citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:2aa312c7003ea240a70e7245a61f04199b1974b80eca5de325a9a777e735ff79","observation_id":"511be75b-39ab-4849-b3e2-28be5a08d4d8","resolution":{"observed_at":"2026-08-08T15:48:07.658221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:48:07.645240Z","title":"MECLA: Memory-Compute-Efficient LLM Accelerator with Scaling Sub-matrix Partition,","venue":null,"work_id":"522f1871-c024-4d23-9960-d313fa8e2b69","year":2024},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-14T12:53:51.651510Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.407945Z"},"links":{"citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:8b1e3924b79393b2353cfe6affa05ea892642ec8fdcbadb7b1e1dcf13d4528d0","observation_id":"c4fb3c66-d9e3-42e2-8ef6-7be519996abf","resolution":{"observed_at":"2026-08-08T15:48:07.648874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:48:07.636362Z","title":"Granite 3.0 Language Models,","venue":null,"work_id":"7ce45ba4-881b-40ac-bdd8-23bf1a1924c1","year":null},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-14T12:53:51.651510Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.411220Z"},"links":{"citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:40d2ef8a4f0e3ffd33da04bf2180cded7d663df6a67264002c81e84174bda770","observation_id":"1838530b-5a93-4da0-8371-ce4af794968f","resolution":{"observed_at":"2026-08-08T15:48:07.639501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-08T15:48:05.417780Z","title":"Qwen3 technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-14T12:53:51.651510Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.417780Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:ac3ffb17cb7a1d8950c0dd8cc78b4af35742dc9efc628803453464d8829fd2ff","observation_id":"4abd0f5e-0d08-47be-a10b-d0e55a78211a","resolution":{"observed_at":"2026-08-08T15:48:05.417780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06066","last_updated":"2024-01-11T17:31:42Z","snapshot_observed_at":"2026-08-13T15:18:04.411100Z","submitted_at":"2024-01-11T17:31:42Z","title":"DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06066","snapshot_observed_at":"2026-08-08T15:48:05.420966Z","title":"DeepSeekMoE: Towards ultimate expert spe- cialization in mixture-of-experts language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-14T12:53:51.651510Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.420966Z"},"links":{"cited_paper":"/paper/2401.06066","citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:ff42caaa6e9bd6ed9b95ce9ad6886d717e8d17b6c0e58f8762591134047cd05a","observation_id":"a5d2494a-4a8b-45d7-94f5-a145dd962520","resolution":{"observed_at":"2026-08-08T15:48:05.420966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:48:07.618403Z","title":"GlaM: Efficient scaling of language models with mixture-of-experts,","venue":null,"work_id":"16d49216-0b14-4661-b013-c70db6138f2f","year":2022},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-14T12:53:51.651510Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.424336Z"},"links":{"citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:db0958056da04ea650fb3f3a2e4c402a3902993df30aa24c540d27a817b2fd7e","observation_id":"b6b9e935-9268-43a5-bac9-02781e31ef48","resolution":{"observed_at":"2026-08-08T15:48:07.621676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-13T19:43:49.936776Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-08T15:48:05.427000Z","title":"Mixtral of Experts,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-14T12:53:51.651510Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.427000Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:62fa55f20db75068a09382f23609405da6c1d8fcf079b025a4584e0740c3b79a","observation_id":"664ae81a-5b4f-4a52-919c-51ae0d8ffa87","resolution":{"observed_at":"2026-08-08T15:48:05.427000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:48:07.609230Z","title":"LLaMA-MoE: Building mixture-of-experts from llama with continual pre-training,","venue":null,"work_id":"59b62fea-5c4e-47c8-9728-78c1842f048f","year":2024},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-14T12:53:51.651510Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.430825Z"},"links":{"citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:b987e9e97912641329a4758836c08c13619b1bcd7e092bff247232ffb67622a3","observation_id":"7a846a52-6e18-4057-9cca-fb3633c892d5","resolution":{"observed_at":"2026-08-08T15:48:07.612630Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10774","last_updated":"2024-06-14T23:32:32Z","snapshot_observed_at":"2026-07-06T17:17:56.276857Z","submitted_at":"2024-01-19T15:48:40Z","title":"Medusa: Simple LLM Inference Acceleration Framework with Multiple Decoding Heads","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10774","snapshot_observed_at":"2026-08-08T15:48:05.433834Z","title":"Medusa: Simple llm inference acceleration framework with multiple decoding heads,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-14T12:53:51.651510Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.433834Z"},"links":{"cited_paper":"/paper/2401.10774","citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:7391316d06701aeb183c812db2e27cf88aca6f20bdfea7250c09f740c55ecbb5","observation_id":"88b87ab0-4e6a-4802-9d8f-310c81853211","resolution":{"observed_at":"2026-08-08T15:48:05.433834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.16487","last_updated":"2023-10-30T01:36:06Z","snapshot_observed_at":"2026-08-16T22:29:32.620789Z","submitted_at":"2022-03-30T17:27:09Z","title":"Speculative Decoding: Exploiting Speculative Execution for Accelerating Seq2seq Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.16487","snapshot_observed_at":"2026-08-08T15:48:05.437417Z","title":"Speculative decoding: Exploiting speculative execution for accelerating seq2seq generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-14T12:53:51.651510Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.437417Z"},"links":{"cited_paper":"/paper/2203.16487","citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:16fbebe7ad2e26c2f90a9c5f500727653ec1556723927379085de3b96a7d97f8","observation_id":"1823bac8-8314-4eac-823e-f9ef4c1401c8","resolution":{"observed_at":"2026-08-08T15:48:05.437417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:48:05.440658Z","title":"Fast inference from transform- ers via speculative decoding,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-14T12:53:51.651510Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.440658Z"},"links":{"citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:a58da0e3f7cb63702dc9f9239410f94832afe74d819eda12c8c2ddb7566dc045","observation_id":"8c9a80ed-3034-4919-b947-ed19cdf9a461","resolution":{"observed_at":"2026-08-08T15:48:05.440658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.01318","last_updated":"2023-02-02T18:44:11Z","snapshot_observed_at":"2026-08-13T23:55:57.074762Z","submitted_at":"2023-02-02T18:44:11Z","title":"Accelerating Large Language Model Decoding with Speculative Sampling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.01318","snapshot_observed_at":"2026-08-08T15:48:05.444304Z","title":"Accelerating large language model decoding with speculative sam- pling,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-14T12:53:51.651510Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.444304Z"},"links":{"cited_paper":"/paper/2302.01318","citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:c28abb3344d6f63218f079f525e8780aed0aa65afe36d6ca151730455dd51f0a","observation_id":"961ebce8-44ad-4258-a45a-2eba2a942fc6","resolution":{"observed_at":"2026-08-08T15:48:05.444304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16710","last_updated":"2024-10-18T04:02:31Z","snapshot_observed_at":"2026-08-16T13:57:49.916883Z","submitted_at":"2024-04-25T16:20:23Z","title":"LayerSkip: Enabling Early Exit Inference and Self-Speculative Decoding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16710","snapshot_observed_at":"2026-08-08T15:48:05.447443Z","title":"LayerSkip: Enabling early exit inference and self-speculative decoding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-14T12:53:51.651510Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.447443Z"},"links":{"cited_paper":"/paper/2404.16710","citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:4a18738e7d9972be39d3e2a42432be5d5e39edb4618f115c4fd07c91af9a9465","observation_id":"e6f76a28-735c-4b5f-9efa-b3e29193f342","resolution":{"observed_at":"2026-08-08T15:48:05.447443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:48:07.594684Z","title":"Speculative decoding with big little decoder,","venue":null,"work_id":"fd5487d9-d158-4cef-9af1-b8a0416c4182","year":2023},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-14T12:53:51.651510Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.450810Z"},"links":{"citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:48dc959977405b5f33ea9a3b14fd3c6a363141d5c9f854febf84db3cf6466e40","observation_id":"7f16ba3b-926f-441d-91b0-9aa9211f3dee","resolution":{"observed_at":"2026-08-08T15:48:07.597995Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01840","last_updated":"2025-04-23T07:08:17Z","snapshot_observed_at":"2026-08-13T11:30:48.832931Z","submitted_at":"2025-03-03T18:59:04Z","title":"EAGLE-3: Scaling up Inference Acceleration of Large Language Models via Training-Time Test","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01840","snapshot_observed_at":"2026-08-08T15:48:05.453468Z","title":"EAGLE-3: Scaling up inference acceleration of large language models via training-time test,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-14T12:53:51.651510Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.453468Z"},"links":{"cited_paper":"/paper/2503.01840","citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:1e20337ccdc01d62f62b2857f40091ac5111aed9f1b600c35c63a1d93313b5c4","observation_id":"eed58b92-de0e-40ab-9dd9-621f04b8eca5","resolution":{"observed_at":"2026-08-08T15:48:05.453468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13565","last_updated":"2025-03-17T08:38:45Z","snapshot_observed_at":"2026-08-16T12:49:27.252936Z","submitted_at":"2025-03-17T08:38:45Z","title":"ML-SpecQD: Multi-Level Speculative Decoding with Quantized Drafts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13565","snapshot_observed_at":"2026-08-08T15:48:05.456995Z","title":"ML-SpecQD: Multi-level speculative decoding with quantized drafts,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-14T12:53:51.651510Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.456995Z"},"links":{"cited_paper":"/paper/2503.13565","citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:1afed9ea5f6b8ab0bab54013c3f6ec242017d9cd0fd40588cef9655b1acd22f6","observation_id":"85835bdf-8a21-4e13-bce0-e53038b268d5","resolution":{"observed_at":"2026-08-08T15:48:05.456995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:48:07.584845Z","title":"EdgeLLM: Fast On-Device LLM Inference With Speculative Decoding,","venue":null,"work_id":"56583f82-9891-4c25-ad39-c17545dbf63a","year":2025},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-14T12:53:51.651510Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.460225Z"},"links":{"citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:fd05b833635a57f0c6716e8d93a2f8c65ca75da583b67ae5e60c78bb44417368","observation_id":"fb2305c1-23da-42da-8dc2-8b7077efd693","resolution":{"observed_at":"2026-08-08T15:48:07.588032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01986","last_updated":"2025-05-16T22:12:29Z","snapshot_observed_at":"2026-08-16T23:08:25.891178Z","submitted_at":"2025-05-16T22:12:29Z","title":"SpecMemo: Speculative Decoding is in Your Pocket","version":1},"cited_work":{"arxiv_id":"2506.01986","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.01986","snapshot_observed_at":"2026-08-08T15:48:07.058755Z","title":"SpecMemo: Speculative Decoding is in Your Pocket","venue":"cs.LG","work_id":"2686edf6-4410-449f-bf9c-7cee930d2935","year":2025},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-14T12:53:51.651510Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.463273Z"},"links":{"cited_paper":"/paper/2506.01986","citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:027abd36c062a30dd367230877960fb799a19239e0bf1722d412adb9d6b6ba0c","observation_id":"cc9a7068-a057-40fd-b7fe-df79c43812e4","resolution":{"observed_at":"2026-08-08T15:48:07.063112Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-08T15:48:05.466359Z","title":"DeepSeek-R1: Incentivizing reasoning capability in llms via reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-14T12:53:51.651510Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.466359Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:19386d0a24501d0d679764bd47b4523abb6228da746c6438a73d76cec98f18e5","observation_id":"82ee0902-2a62-4b5e-90af-0586845a430d","resolution":{"observed_at":"2026-08-08T15:48:05.466359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.15077","last_updated":"2025-03-04T13:58:39Z","snapshot_observed_at":"2026-08-03T09:40:31.365295Z","submitted_at":"2024-01-26T18:59:01Z","title":"EAGLE: Speculative Sampling Requires Rethinking Feature Uncertainty","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.15077","snapshot_observed_at":"2026-08-08T15:48:05.469674Z","title":"Eagle: Speculative sampling re- quires rethinking feature uncertainty,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-14T12:53:51.651510Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.469674Z"},"links":{"cited_paper":"/paper/2401.15077","citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:0f239589fa13af80bfcddba64050da5a87f7f3486c2d99334aa3d3cdfb582005","observation_id":"aa1bf1a1-79ba-4f9a-860e-05bd8e02feb6","resolution":{"observed_at":"2026-08-08T15:48:05.469674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:48:05.472875Z","title":"MoESD: Unveil Speculative Decoding’s Potential for Accelerating Sparse MoE,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-14T12:53:51.651510Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.472875Z"},"links":{"citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:299fc97d10129739e27bc320d6986d4fcdc9e56c28661bafb68c99cb74688748","observation_id":"abf13411-7af7-4b04-82e5-104d3b16802a","resolution":{"observed_at":"2026-08-08T15:48:05.472875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-08T15:48:05.475775Z","title":"Deepseek-v2: A strong, economical, and efficient mixture-of-experts language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-14T12:53:51.651510Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.475775Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:7f76affe0abc7eb97df9eefc2f6fc88889671b1e849ba9e90aa420ad47491644","observation_id":"dfe7d41f-1e8f-4dcc-9ad0-2d43a8c8b853","resolution":{"observed_at":"2026-08-08T15:48:05.475775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02060","last_updated":"2025-03-03T01:25:46Z","snapshot_observed_at":"2026-08-15T00:07:51.079800Z","submitted_at":"2024-09-03T17:08:20Z","title":"OLMoE: Open Mixture-of-Experts Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02060","snapshot_observed_at":"2026-08-08T15:48:05.478932Z","title":"OLMoE: Open mixture- of-experts language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-14T12:53:51.651510Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.478932Z"},"links":{"cited_paper":"/paper/2409.02060","citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:25f461a4e0bc746877d85847f0e99c7aa1766cce1e3ad4950b24ff6bdf53ac59","observation_id":"fed56ccb-64d4-4da0-84f1-215bb62753bd","resolution":{"observed_at":"2026-08-08T15:48:05.478932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00099","last_updated":"2025-06-24T09:27:46Z","snapshot_observed_at":"2026-08-16T21:28:32.155514Z","submitted_at":"2024-11-27T18:59:48Z","title":"Mixture of Cache-Conditional Experts for Efficient Mobile Device Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00099","snapshot_observed_at":"2026-08-08T15:48:05.482175Z","title":"Mixture of cache- conditional experts for efficient mobile device inference,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-14T12:53:51.651510Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.482175Z"},"links":{"cited_paper":"/paper/2412.00099","citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:a2c85df883c2d00dcef3a4e88cac13feea623956343ecd9fa36afc5dbfc3ebbb","observation_id":"a17e14cd-43c7-43ad-a5bd-340afe275ac9","resolution":{"observed_at":"2026-08-08T15:48:05.482175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:48:07.575056Z","title":"Read-ME: Refactorizing LLMs as Router-Decoupled Mixture of Experts with System Co-Design,","venue":null,"work_id":"4124018b-a99b-4e1f-9dd1-6eaffbd30783","year":2024},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-14T12:53:51.651510Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.485453Z"},"links":{"citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:3b0a29189519991a71342d2f53ad07921ba586f1554d2300d608e2e8ce22cf1d","observation_id":"ea6b6aec-b0aa-4b41-9583-7c5cc053537a","resolution":{"observed_at":"2026-08-08T15:48:07.578776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:48:07.565538Z","title":"Duplex: A Device for Large Language Models with Mixture of Experts, Grouped Query Attention, and Continuous Batching,","venue":null,"work_id":"45bdbf78-013e-4e37-b286-6260e8f7b557","year":2024},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-14T12:53:51.651510Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.488860Z"},"links":{"citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:babc7ce4824b5110fe610587eafc5360be8f74bcb814b563c3c1b23d45589d22","observation_id":"0251c8c5-b9f9-48cc-ab79-2af095ca6c76","resolution":{"observed_at":"2026-08-08T15:48:07.568814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:48:07.556378Z","title":"20.8 Space-Mate: A 303.5mW Real-Time Sparse Mixture-of-Experts- Based NeRF-SLAM Processor for Mobile Spatial Computing,","venue":null,"work_id":"c274913e-a6c7-4729-ba73-6596e2d1c987","year":2024},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-14T12:53:51.651510Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.491756Z"},"links":{"citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:8d7564df4fdabb5b42d3fd9e68c99ae4f6c91e8df6710205a5189a1da7eafa03","observation_id":"e67b1ddc-3bec-4b49-9202-303e48de200a","resolution":{"observed_at":"2026-08-08T15:48:07.559672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:48:06.815024Z","title":"SpecInfer: Accelerating Large Language Model Serving with Tree-based Speculative Inference and Verification,","venue":null,"work_id":"6f59f1d5-c63c-4fc5-8d26-a8d231de498a","year":2024},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-14T12:53:51.651510Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.495329Z"},"links":{"citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:dc83821f0b8caa0e20b3281d2e610b2401628b919009974a49147694ddf0f946","observation_id":"8c15e677-9f27-46b1-bb99-04049c5179a9","resolution":{"observed_at":"2026-08-08T15:48:06.818755Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19715","last_updated":"2025-07-11T01:33:18Z","snapshot_observed_at":"2026-08-16T13:47:55.108954Z","submitted_at":"2024-05-30T05:49:38Z","title":"SpecDec++: Boosting Speculative Decoding via Adaptive Candidate Lengths","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19715","snapshot_observed_at":"2026-08-08T15:48:05.498093Z","title":"Specdec++: Boosting spec- ulative decoding via adaptive candidate lengths,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-14T12:53:51.651510Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.498093Z"},"links":{"cited_paper":"/paper/2405.19715","citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:d52e21879e337eb28a176e4b5762bc97f717e8ebf911d9eb8eefca921a31aa22","observation_id":"1de07ba8-0bac-4dc7-a0db-c8acf3181940","resolution":{"observed_at":"2026-08-08T15:48:05.498093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:48:07.547199Z","title":"Fast best-of-n decoding via speculative rejection,","venue":null,"work_id":"e2e6db70-5fd1-4b11-97d8-0b8f0ae5982c","year":2024},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-14T12:53:51.651510Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.501944Z"},"links":{"citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:78cf09aa347abf3dbb6483208e39d8e48ee791a6c0ab0dc73642abfdeb1422b3","observation_id":"d7160d2e-1d4a-4abe-a1ef-4aeb4170b491","resolution":{"observed_at":"2026-08-08T15:48:07.550479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12374","last_updated":"2025-07-05T03:31:01Z","snapshot_observed_at":"2026-08-16T14:17:13.546713Z","submitted_at":"2024-02-19T18:58:32Z","title":"Sequoia: Scalable, Robust, and Hardware-aware Speculative Decoding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12374","snapshot_observed_at":"2026-08-08T15:48:05.504790Z","title":"Sequoia: Scalable, robust, and hardware-aware speculative decoding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-14T12:53:51.651510Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.504790Z"},"links":{"cited_paper":"/paper/2402.12374","citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:e4e3191eb74f1f46c8555da8bfa359ea2a9131c2271c2869a34cd299ee9d22f8","observation_id":"2055f79f-efb3-4781-b2ee-6dea2c53cc7a","resolution":{"observed_at":"2026-08-08T15:48:05.504790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:48:07.538175Z","title":"Not all experts are equal: Efficient expert pruning and skipping for mixture-of-experts large language models,","venue":null,"work_id":"055c554f-a282-40bc-9c3e-4797c80867b3","year":2024},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-14T12:53:51.651510Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.508383Z"},"links":{"citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:04c43b702814e4c30d6d0e70baf8a5de155215fccded84eb1838098effcf6d9d","observation_id":"5934ef46-3f3a-4b75-92bd-25a4b590bc57","resolution":{"observed_at":"2026-08-08T15:48:07.541433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:48:07.528642Z","title":"Moe-i2: Compressing mixture of experts models through inter-expert pruning and intra-expert low-rank decom- position,","venue":null,"work_id":"e6761c3f-b65d-4fee-88f9-d5105e1d2534","year":2024},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-14T12:53:51.651510Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.511406Z"},"links":{"citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:f0d9d6ab522cdbff8d1be2d6f1471c343c9ee0efb111dc9cfbb1c100c8d63087","observation_id":"8385853b-6233-4470-88db-f6eccc8cde97","resolution":{"observed_at":"2026-08-08T15:48:07.532354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00945","last_updated":"2024-07-01T03:57:35Z","snapshot_observed_at":"2026-08-16T13:38:16.914876Z","submitted_at":"2024-07-01T03:57:35Z","title":"Efficient Expert Pruning for Sparse Mixture-of-Experts Language Models: Enhancing Performance and Reducing Inference Costs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00945","snapshot_observed_at":"2026-08-08T15:48:05.515013Z","title":"Efficient expert pruning for sparse mixture-of-experts language models: Enhancing performance and reducing inference costs,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-14T12:53:51.651510Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.515013Z"},"links":{"cited_paper":"/paper/2407.00945","citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:3c15026370b11ff8903431ff0d5ebd1e63f1b992435be586f14707a00c6f9821","observation_id":"5ed985b9-0324-446d-8bd4-5eb1f49936ce","resolution":{"observed_at":"2026-08-08T15:48:05.515013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:48:06.624344Z","title":"Self-speculative decoding for on-device moe acceleration,","venue":null,"work_id":"3ea4d61f-9e20-4ad6-aaba-00ad0fa7ae9d","year":2026},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-14T12:53:51.651510Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.518084Z"},"links":{"citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:a800a7362b49f62a1ff4a841597fa77ce08ef1834c2aef35ddcc4d1664f71d44","observation_id":"c2592ca9-03d6-4912-86e9-b7e0c254c2f5","resolution":{"observed_at":"2026-08-08T15:48:06.627756Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:48:05.521241Z","title":"MoE-Spec: Ex- pert Budgeting for Efficient Speculative Decoding,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-14T12:53:51.651510Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.521241Z"},"links":{"citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:ddf7c702245badbec36eeba745a3047b111c099584d34851cefc6c1455985c41","observation_id":"5b962831-68d3-4223-a6e7-fc29abcb80b6","resolution":{"observed_at":"2026-08-08T15:48:05.521241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:48:05.524086Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-14T12:53:51.651510Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.524086Z"},"links":{"citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:1ca8b44ffb6d3070372948e225ce14806ddb72471ab7aa44a24b64c3a7f2d3a0","observation_id":"671a1651-b0a5-4294-a807-7dd54cf9ccbf","resolution":{"observed_at":"2026-08-08T15:48:05.524086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:48:05.527731Z","title":"Emerging properties in self-supervised vision transformers,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-14T12:53:51.651510Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.527731Z"},"links":{"citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:fa1e82ae5940a74246865a66e47f8bfd5dc97f4abc12316891858c2d924a92bb","observation_id":"f549ddb7-a3b5-4147-a11c-f38f85d2d55e","resolution":{"observed_at":"2026-08-08T15:48:05.527731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:48:05.530625Z","title":"Dense passage retrieval for open-domain question answering,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-14T12:53:51.651510Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.530625Z"},"links":{"citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:a3bc4a865db4d10cac03e75a9f92348917c7a478fb3ab976dfe78f5ad9a001b8","observation_id":"a764ec8c-961b-4968-96a1-09507f4cd167","resolution":{"observed_at":"2026-08-08T15:48:05.530625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01818","last_updated":"2025-05-11T17:45:02Z","snapshot_observed_at":"2026-08-17T07:14:12.508584Z","submitted_at":"2024-12-02T18:57:40Z","title":"Beyond Text-Visual Attention: Exploiting Visual Cues for Effective Token Pruning in VLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01818","snapshot_observed_at":"2026-08-08T15:48:05.534196Z","title":"[CLS] attention is all you need for training- free visual token pruning: Make vlm inference faster,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-14T12:53:51.651510Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.534196Z"},"links":{"cited_paper":"/paper/2412.01818","citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:89058ca7b656f33547f4fa05af13fb4cda187d474af0f2d444b1986eee2116b6","observation_id":"00f90a41-8bbb-41cb-a3f2-5cb76184f4b1","resolution":{"observed_at":"2026-08-08T15:48:05.534196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:48:07.504510Z","title":"HiPrune: Training-Free Visual Token Pruning via Hierarchical Attention in Vision-Language Models (Student Ab- stract),","venue":null,"work_id":"a8d88edc-5036-4c99-be98-5717f17109ba","year":2026},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-14T12:53:51.651510Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.537368Z"},"links":{"citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:04cd31e2b91bae2128a71ad9374b05f9f8f9b25f1ccd47c5e7f6da488ba88d04","observation_id":"825ed448-8683-47ed-81eb-7260bb47b5e6","resolution":{"observed_at":"2026-08-08T15:48:07.507759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:48:07.495584Z","title":"Atp-llava: Adaptive token pruning for large vision language models,","venue":null,"work_id":"385639e3-d682-48af-9ad7-1f050031f7a3","year":2025},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-14T12:53:51.651510Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.540750Z"},"links":{"citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:18b45f99a037df99fa0344169c3989c920e6e935cfe3a73b53a07f6d33120917","observation_id":"50900402-f295-4453-b4d4-e4d01cb9b06d","resolution":{"observed_at":"2026-08-08T15:48:07.498714Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:48:07.486374Z","title":"all-minilm-l6-v2: Sentence transformers model,","venue":null,"work_id":"5d09efdf-c7a2-405b-8e43-0469c8413f96","year":2021},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-14T12:53:51.651510Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.543761Z"},"links":{"citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:91e20bbb5293e1c4e5264f4b139fefae895e2883e65a4949b074c4b3f716d831","observation_id":"6bc4df81-91b6-4a07-8c93-e95bf1956905","resolution":{"observed_at":"2026-08-08T15:48:07.489593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:48:06.176988Z","title":"Pre-Gated MoE: An Algorithm-System Co-Design for Fast and Scalable Mixture-of-Expert Inference,","venue":null,"work_id":"5ecdb95a-a8f5-48b3-bea0-614f5363ab3f","year":2025},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-14T12:53:51.651510Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.547508Z"},"links":{"citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:fdd8037f3e112eaa140a3d8549bcf14748d7bad7031397c3599b3b6cf90c6f37","observation_id":"29504228-7919-4bce-8800-7b54eac0093d","resolution":{"observed_at":"2026-08-08T15:48:06.180319Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:48:05.550292Z","title":"Sigma: A sparse and irregular gemm ac- celerator with flexible interconnects for dnn training,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-14T12:53:51.651510Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.550292Z"},"links":{"citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:8f4d7e119f4bb6c436b2073eff518c4077c55307f71a4c908b53676521268bd6","observation_id":"c2805c7d-735b-49ee-baec-2298e994a166","resolution":{"observed_at":"2026-08-08T15:48:05.550292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:48:07.472740Z","title":"2022, rev","venue":null,"work_id":"5cf98c44-14b0-4092-afab-e0af8eccbbf9","year":2022},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-14T12:53:51.651510Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.554023Z"},"links":{"citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:1c8e16334470fc333e7d7a2a04cfe4cf5c84753f80c526c865f80c475ae12c45","observation_id":"81e16d87-8484-431b-a7dc-94a1f2e2fd3d","resolution":{"observed_at":"2026-08-08T15:48:07.475928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:48:07.463977Z","title":"SCNN: An accelerator for compressed-sparse convolutional neural networks,","venue":null,"work_id":"36ae0132-13e3-43d6-be28-c34e7e5d1e0a","year":2017},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-14T12:53:51.651510Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.556825Z"},"links":{"citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:ce2b62a5b3ecae980af430af65ea9745e810cf5741d90020891eb789d8c2abc3","observation_id":"d188d3c3-0f45-45c3-9001-e3110bebfdb0","resolution":{"observed_at":"2026-08-08T15:48:07.467223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:48:05.560519Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-14T12:53:51.651510Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.560519Z"},"links":{"citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:d0215afe3f5f018579e75183c41fb854af1c6955676914dbf2d27d95f4173419","observation_id":"d61f043c-d1fe-4200-a1e9-596323a909b5","resolution":{"observed_at":"2026-08-08T15:48:05.560519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-08T15:48:05.563489Z","title":"Training verifiers to solve math word problems,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-14T12:53:51.651510Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.563489Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:c0b8c44eedab4d8525232cbbad961b567b1d7757db14e4b3b1dfc5aeb77210a0","observation_id":"49e0ac6f-c82f-421f-870a-ebb14c9e39f8","resolution":{"observed_at":"2026-08-08T15:48:05.563489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-13T20:44:28.824685Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-08T15:48:05.566935Z","title":"Measuring massive multitask language understanding,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-14T12:53:51.651510Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.566935Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:28ca96fcd51adc653406f0a3908a5900aa44e5a3a152aa24714fe64017c536b1","observation_id":"ff4a0b63-6cce-403f-be61-5e4fa02f69d8","resolution":{"observed_at":"2026-08-08T15:48:05.566935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.07830","last_updated":"2019-05-19T23:57:23Z","snapshot_observed_at":"2026-08-15T09:37:44.321271Z","submitted_at":"2019-05-19T23:57:23Z","title":"HellaSwag: Can a Machine Really Finish Your Sentence?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.07830","snapshot_observed_at":"2026-08-08T15:48:05.569995Z","title":"Hel- laswag: Can a machine really finish your sentence?","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-14T12:53:51.651510Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.569995Z"},"links":{"cited_paper":"/paper/1905.07830","citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:527103e486a8cf3544af8224d289c9f1039e23106bd9edcbbdc605d96e1ed47f","observation_id":"78b6eddc-74c7-4cde-9c81-9e55b7cab3fd","resolution":{"observed_at":"2026-08-08T15:48:05.569995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-08-14T19:36:07.505691Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-08T15:48:05.573207Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-14T12:53:51.651510Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.573207Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:0639650a6f8c5e062062aca5b110297702529ccea8f82a2635c3e1beffd8e150","observation_id":"3a9f32e8-afbd-456d-870b-e8a4b73faf5d","resolution":{"observed_at":"2026-08-08T15:48:05.573207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:48:05.576315Z","title":"Winogrande: An adversarial winograd schema challenge at scale,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-14T12:53:51.651510Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.576315Z"},"links":{"citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:267ac26e923dc9ea20ec7abb8cc1cf1d52dc351ff884dc9d048fc140905577d0","observation_id":"69a296cd-70d0-443a-9e69-0552bbec13ea","resolution":{"observed_at":"2026-08-08T15:48:05.576315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:48:05.579324Z","title":"Piqa: Reasoning about physical commonsense in natural language,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-14T12:53:51.651510Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.579324Z"},"links":{"citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:c9491dc9ee615a3d7fac7a4b5101ac9c2fab569538ff651436be575a3e740ec5","observation_id":"88be2782-5a1d-43a9-b183-231a003128c7","resolution":{"observed_at":"2026-08-08T15:48:05.579324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.07843","last_updated":"2016-09-26T04:06:13Z","snapshot_observed_at":"2026-08-17T01:46:43.513643Z","submitted_at":"2016-09-26T04:06:13Z","title":"Pointer Sentinel Mixture Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.07843","snapshot_observed_at":"2026-08-08T15:48:05.582063Z","title":"Pointer Sentinel Mixture Models,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-14T12:53:51.651510Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.582063Z"},"links":{"cited_paper":"/paper/1609.07843","citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:80b3deac742ab2964690e1f83e330e681441240d0101c3e1455609ad02ea221a","observation_id":"5a9cb099-3d82-4296-8501-7d41cfc99c69","resolution":{"observed_at":"2026-08-08T15:48:05.582063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:48:07.440243Z","title":"MLPerf Inference interactive benchmark,","venue":null,"work_id":"dfe70dd5-283c-4d3d-86f0-cbe157863f46","year":2024},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-14T12:53:51.651510Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.585984Z"},"links":{"citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:f3c92496bdafd2bb4137039cbaead8a1eaed28f91ec4a0d37a67faa0b3bed650","observation_id":"3c6fcc8c-25af-4813-b23b-866bc30e9d7f","resolution":{"observed_at":"2026-08-08T15:48:07.443859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:48:05.589074Z","title":"Spatten: Efficient sparse attention architecture with cascade token and head pruning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-14T12:53:51.651510Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.589074Z"},"links":{"citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:2f559554627fe8408600d911436aa2032ad5aeb6de1c7c5a42871ccf58285df6","observation_id":"dc73aff7-80fb-4e2a-8b99-4cc40d8d1e95","resolution":{"observed_at":"2026-08-08T15:48:05.589074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:48:05.915417Z","title":"FACT: FFN-Attention Co-optimized Transformer Architecture with Eager Correlation Prediction,","venue":null,"work_id":"d548b9ea-4b7a-465e-b8cd-dc90b9e2cad0","year":2023},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-14T12:53:51.651510Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.592441Z"},"links":{"citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:f8e5dada883e84cba1fe5bb05c434f9368778668f1811f0cf8d480862c839765","observation_id":"0dbda71c-3190-4436-87ef-c3b05591e032","resolution":{"observed_at":"2026-08-08T15:48:05.921856Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:48:07.627555Z","title":"Available: https://github.com/ibm-granite/granite-3","venue":null,"work_id":"25b9c610-a6b0-487a-b1ab-6b45cfc98b3f","year":null},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-14T12:53:51.651510Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.414109Z"},"links":{"citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:b52a26bb51baf98832a56c7062720c29986d818518cb29549adf7868fbea6377","observation_id":"55ad2281-72cf-4765-8890-eabf11a64b56","resolution":{"observed_at":"2026-08-08T15:48:07.630644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","latest_version":1,"primary_category":"cs.AR","snapshot_observed_at":"2026-08-14T12:53:51.651510Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding"},"reference_resolution":{"displayed":69,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":39,"verified_exact":5,"verified_fuzzy":25},"total_outbound_references":69},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 69 of 69 outbound references and 0 inbound Pith citation observations for arXiv:2608.05303."}