{"as_of":"2026-08-22T07:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ef22ddf15aced21b3aecbdcdcdd63ec776d636e2c8497cedf28c246147ac7e35","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T18:53:58.740609Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T23:00:17.763102Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-15T23:00:19.435484Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-18T20:24:28.154075Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"cited_work":{"arxiv_id":"2411.11217","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.11217","snapshot_observed_at":"2026-08-15T23:00:19.435484Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","venue":"cs.DC","work_id":"7d33d0fc-8af2-4c03-bc04-8049f1594a2c","year":2024},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-19T01:38:01.563506Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:17.763102Z"},"links":{"cited_paper":"/paper/2411.11217","citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:7fec6a41394372e68431b027ea8b82d9289353627f756ebd5deb0780758bb1f1","observation_id":"3ce825a4-85b8-4bf8-b9a9-d13331b3daf9","resolution":{"observed_at":"2026-08-15T23:00:19.443779Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2411.11217/citation-record","integrity":"/paper/2411.11217/integrity","json":"/paper/2411.11217/citation-record.json","paper":"/paper/2411.11217"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:53:59.206865Z","title":"Flashinfer: Kernel library for llm serving","venue":null,"work_id":"17f609f3-410f-44b4-b46b-db3c1a0a3d82","year":2024},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-18T20:24:28.154075Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.569013Z"},"links":{"citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:8607d23582cc956d8c3c4a33dd54e29c3599e954412436356dcaefd87390d7cf","observation_id":"8da072c8-5949-4691-b6a2-fef7e5d32b8c","resolution":{"observed_at":"2026-08-12T18:53:59.210066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13245","last_updated":"2023-12-23T17:55:11Z","snapshot_observed_at":"2026-08-15T06:28:09.529747Z","submitted_at":"2023-05-22T17:16:38Z","title":"GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13245","snapshot_observed_at":"2026-08-12T18:53:58.572830Z","title":"Gqa: Training generalized multi- query transformer models from multi-head checkpoints.arXiv preprint arXiv:2305.13245, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-18T20:24:28.154075Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.572830Z"},"links":{"cited_paper":"/paper/2305.13245","citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:c1aa5b1e210bd83f281b177138dc75e8cb8e48a84eee9a3fa5e79f80d8fbc848","observation_id":"fa5341d7-fbc9-4a3d-bbef-2b1e985a54e5","resolution":{"observed_at":"2026-08-12T18:53:58.572830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:53:59.197896Z","title":"Llm in a flash: Efficient large language model inference with limited memory, 2024","venue":null,"work_id":"458477e9-8498-4eb8-93d1-e61faeaddff5","year":2024},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-18T20:24:28.154075Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.576262Z"},"links":{"citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:e5908f394bef457e847beebf589e5960e87c2ccda7837f2a7288d9434b9f7b3c","observation_id":"009a2d51-8c25-4fdc-a176-d01a4b12d137","resolution":{"observed_at":"2026-08-12T18:53:59.201165Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:53:58.579622Z","title":"Deepspeed-inference: enabling efficient inference of transformer models at unprecedented scale","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-18T20:24:28.154075Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.579622Z"},"links":{"citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:2712481d6d1dbbca38f069f6b491694787a8082b5a885e3146ac488e585a5a9a","observation_id":"9967325f-6af9-423a-b845-3c356f178664","resolution":{"observed_at":"2026-08-12T18:53:58.579622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:53:58.582688Z","title":"Accelerating large language model decoding with speculative sampling, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-18T20:24:28.154075Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.582688Z"},"links":{"citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:7d498316bbd1b3d255dc342b9f8dc3ce269c8764e064c1b802e3ee831181492f","observation_id":"b0c8aec7-1d4f-4c0a-95cd-375f17aa571f","resolution":{"observed_at":"2026-08-12T18:53:58.582688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:53:59.178559Z","title":"Lifelong language pretraining with distribution-specialized experts","venue":null,"work_id":"07650f6f-1546-496c-ba88-e3c19af43d78","year":2023},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-18T20:24:28.154075Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.585827Z"},"links":{"citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:3d0f597066e112f2bcc685748413420b541240f8c9b0b38767ff8e71b3b86e20","observation_id":"6f2e38fb-5ad5-4bbe-ab60-b9f11d7fcc7f","resolution":{"observed_at":"2026-08-12T18:53:59.181927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:53:59.169119Z","title":"Spreadsheetcoder: Formula prediction from semi-structured context","venue":null,"work_id":"118c38c8-e38a-4215-b6a3-c6d6cee1324d","year":2021},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-18T20:24:28.154075Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.589148Z"},"links":{"citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:837067b1682c2419e70bdc29d5d0488aec528c03a2b58e40daaf3722fbadac9c","observation_id":"1a75a12b-1a28-4e22-ac01-7b08d93f3396","resolution":{"observed_at":"2026-08-12T18:53:59.172382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04132","last_updated":"2024-03-07T01:22:38Z","snapshot_observed_at":"2026-08-02T17:55:33.750637Z","submitted_at":"2024-03-07T01:22:38Z","title":"Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04132","snapshot_observed_at":"2026-08-12T18:53:58.592078Z","title":"Chatbot arena: An open platform for evaluating llms by human preference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-18T20:24:28.154075Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.592078Z"},"links":{"cited_paper":"/paper/2403.04132","citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:cc693cbe4d6a2f0439eddd89ced5a41b3deb2cef1dd3b8f09437512d15eb4d20","observation_id":"cb96245e-f471-4cfe-8707-587d6323d85d","resolution":{"observed_at":"2026-08-12T18:53:58.592078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:53:58.595355Z","title":"Generating long sequences with sparse transformers, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-18T20:24:28.154075Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.595355Z"},"links":{"citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:2ee77d11276ca18b9cba258b4d0156e8ee92791a3e64948250360955d1af88f4","observation_id":"8ce5be6e-b065-41b1-88db-eda92ce41cc2","resolution":{"observed_at":"2026-08-12T18:53:58.595355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06066","last_updated":"2024-01-11T17:31:42Z","snapshot_observed_at":"2026-08-18T13:55:31.813413Z","submitted_at":"2024-01-11T17:31:42Z","title":"DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06066","snapshot_observed_at":"2026-08-12T18:53:58.598074Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-18T20:24:28.154075Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.598074Z"},"links":{"cited_paper":"/paper/2401.06066","citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:38963f54b826594262e1acbbb7e63a9f0561c66a067609cbf8d4e122c0c1b677","observation_id":"beb32e99-611c-4b2a-b42a-16685f72a4aa","resolution":{"observed_at":"2026-08-12T18:53:58.598074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:53:59.154816Z","title":"FlashAttention-2: Faster attention with better parallelism and work partitioning","venue":null,"work_id":"d98a6110-de39-4a00-9b5e-d3f4c4183155","year":2024},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-18T20:24:28.154075Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.601425Z"},"links":{"citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:049c94622a87e4b18c9d1f102f327e7c88758225e6d234441c917d27b6fa8e7d","observation_id":"7a11b14a-0f39-440e-86f8-c9814b8fa096","resolution":{"observed_at":"2026-08-12T18:53:59.158305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:53:59.145903Z","title":"Fu, Stefano Ermon, Atri Rudra, and Christopher Ré","venue":null,"work_id":"368c3d93-e377-4c5c-817b-2777d30fcfbf","year":2022},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-18T20:24:28.154075Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.604536Z"},"links":{"citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:d5e1d687d0bc468175a9df1f2470158bc94dfa365c98950d109f6dbfa27e4878","observation_id":"68aa2d8d-7e73-42d5-8009-6502458b876e","resolution":{"observed_at":"2026-08-12T18:53:59.149069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:53:59.137280Z","title":"Glam: Efficient scaling of language models with mixture-of-experts","venue":null,"work_id":"976f4275-3618-47dc-a64b-82480058911b","year":2022},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-18T20:24:28.154075Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.607616Z"},"links":{"citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:9df2021c2aed5c7c5e11df93c2f75f4cf2253da2df96ac529ce6c9fe69e56b47","observation_id":"7cb30671-87f3-47e3-a01a-61078df5b0cb","resolution":{"observed_at":"2026-08-12T18:53:59.140456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-12T18:53:58.610574Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-18T20:24:28.154075Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.610574Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:b95eae0d4d3a03e6def2ec04f89e81e304d349e873a2b240c6e43a91f4e4f805","observation_id":"41d24f27-b2cf-4e63-88ba-f6b921fbf4ff","resolution":{"observed_at":"2026-08-12T18:53:58.610574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:53:59.128432Z","title":"Fast inference of mixture-of-experts language models with offloading, 2023","venue":null,"work_id":"1a2cb14e-e122-484d-abe5-05eeee01aa60","year":2023},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-18T20:24:28.154075Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.613730Z"},"links":{"citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:121004928cc19f8d658fa25909fba6f597d6bfb67890f3d2bf7456b808e821bc","observation_id":"5eac09d1-0975-4c86-9970-0e15d2df344a","resolution":{"observed_at":"2026-08-12T18:53:59.131718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:53:59.119667Z","title":"Dap- ple: A pipelined data parallel approach for training large models","venue":null,"work_id":"d199f643-8b6a-477a-b5c6-76857357ff0f","year":2021},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-18T20:24:28.154075Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.616760Z"},"links":{"citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:e4ed8c1b909503ca4bbdd1c017b6e4be75188c4d3f761bc69f779e6bf68e5dfe","observation_id":"8fe4204f-144d-4044-8fdc-8b1f16d15c1d","resolution":{"observed_at":"2026-08-12T18:53:59.122947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:53:59.110159Z","title":"Fastdecode: High-throughput gpu-efficient llm serving using heterogeneous pipelines, 2024","venue":null,"work_id":"2f949ec2-c88a-47c8-9717-cb935dc5e991","year":2024},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-18T20:24:28.154075Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.619628Z"},"links":{"citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:27a9cf4bc8801106fab6362ce30ea10dacbec84ebaa326bd6ac1a77f855f2139","observation_id":"43ead05a-ff96-4587-b4b1-ce2d915667f8","resolution":{"observed_at":"2026-08-12T18:53:59.113719Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:53:58.622530Z","title":"Gpipe: Efficient training of giant neural networks using pipeline parallelism","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-18T20:24:28.154075Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.622530Z"},"links":{"citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:b2a865d0bc8900b6c87326024782694972113a5fc8a202252cb625369316a7f7","observation_id":"4e0e2679-1602-4ac0-a4db-611b73ba8ab5","resolution":{"observed_at":"2026-08-12T18:53:58.622530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:53:59.094740Z","title":"Hugging face accelerate","venue":null,"work_id":"a17e2589-5f1f-4088-97fd-8efc324f7edc","year":2022},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-18T20:24:28.154075Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.625275Z"},"links":{"citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:be89929028c8280b0f828e0141bbbf974e17b5a3619e50531082e757134d2e43","observation_id":"eb5a6805-341d-47e0-ac34-f47d35eca29d","resolution":{"observed_at":"2026-08-12T18:53:59.098032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:53:59.085293Z","title":"Intel(r) oneapi math kernel library (onemkl)","venue":null,"work_id":"cc76a790-1081-49a1-af6e-f189df7cadea","year":2024},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-18T20:24:28.154075Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.628410Z"},"links":{"citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:880032c7df537ef862eaca7873b7df6de19406ddda728010db515b6ecf4a39eb","observation_id":"42c246a0-b8cd-48f7-b8f5-c3d9d776cfe8","resolution":{"observed_at":"2026-08-12T18:53:59.088910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:53:59.076408Z","title":"Jacobs, Michael I","venue":null,"work_id":"14136ec6-92f3-44a7-b1a7-5f418127bdf6","year":1991},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-18T20:24:28.154075Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.631285Z"},"links":{"citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:776305ddfcd461dd1a60e0d4dbf41eeb2d7f9bfa54afbf5eedc5921a2dfbf858","observation_id":"ed49b8cd-f4f6-43d6-9ad9-1a9a7b7870d4","resolution":{"observed_at":"2026-08-12T18:53:59.079406Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-13T19:43:49.936776Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-12T18:53:58.634169Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-18T20:24:28.154075Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.634169Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:bd2a129c1830e070a382137f61d2914eacc841bd944dee96696da3c92162ea57","observation_id":"2cddb5ee-09a3-4e40-a6ba-974e76d19948","resolution":{"observed_at":"2026-08-12T18:53:58.634169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:53:58.637627Z","title":"Hierarchical mixtures of experts and the em algorithm","venue":null,"work_id":null,"year":1994},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-18T20:24:28.154075Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.637627Z"},"links":{"citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:88960f8c32a41cefbdaf5278d893740f55c4d91ed3a4fa5159789d1fbf3bf1db","observation_id":"d529eedc-00ec-4315-ba86-75a4ad3b9ed9","resolution":{"observed_at":"2026-08-12T18:53:58.637627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:53:59.061673Z","title":"Fu, Christo- pher Ré, and Azalia Mirhoseini","venue":null,"work_id":"d0fe1571-0404-4127-9dfa-e771ba44dbac","year":2024},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-18T20:24:28.154075Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.640464Z"},"links":{"citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:942956b9aed65a32b78acfdc534a9005e0d7589340da2010108e86bfa8e992f2","observation_id":"d2e2f8a2-b873-41f7-ae23-52fc6bd3699d","resolution":{"observed_at":"2026-08-12T18:53:59.064941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:53:59.052312Z","title":"Fiddler: Cpu- gpu orchestration for fast inference of mixture-of-experts models, 2024","venue":null,"work_id":"6610bbcd-a30c-4c55-af15-c459e3621dbf","year":2024},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-18T20:24:28.154075Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.643198Z"},"links":{"citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:fc4b34a955f07a24a9b5585eb3fa26b183b1c44d0eec5b8c741009c0d647dcfe","observation_id":"27c18c25-64a7-4d95-96f2-a8546200e836","resolution":{"observed_at":"2026-08-12T18:53:59.055522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:53:58.646145Z","title":"Efficient memory management for large language model serving with pagedattention","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-18T20:24:28.154075Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.646145Z"},"links":{"citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:a1482a2c799973be0ae158a4d1c0a8f8444e9b76df5194e7d4559b794c1b3291","observation_id":"bf8ed4c5-ecf2-4a2a-a662-4c00a31e70b5","resolution":{"observed_at":"2026-08-12T18:53:58.646145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16668","last_updated":"2020-06-30T10:42:02Z","snapshot_observed_at":"2026-08-07T09:27:36.420559Z","submitted_at":"2020-06-30T10:42:02Z","title":"GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.16668","snapshot_observed_at":"2026-08-12T18:53:58.649016Z","title":"Gshard: Scaling giant models with conditional com- putation and automatic sharding","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-18T20:24:28.154075Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.649016Z"},"links":{"cited_paper":"/paper/2006.16668","citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:8915d81a174260bfd2b25d9aa162e81e8d92fb906096b0cf342ae080dcd96a2b","observation_id":"b60c6726-b44a-453b-8d85-dd8ad830cae8","resolution":{"observed_at":"2026-08-12T18:53:58.649016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:53:58.652418Z","title":"Fast inference from transformers via speculative decoding, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-18T20:24:28.154075Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.652418Z"},"links":{"citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:c0fb5c9a20d12c1b85425d76ccd4d1b05ac2dfe2efa6186729624c98fee8d5a2","observation_id":"50cc8e15-4e9d-43c8-bd38-bf08e7a406a5","resolution":{"observed_at":"2026-08-12T18:53:58.652418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-12T18:53:58.655265Z","title":"Holistic evaluation of language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-18T20:24:28.154075Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.655265Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:02104baa96d8c690777089b3d234737b0e3352bf203f81f3854ceb9e8db5dae4","observation_id":"854a1e9f-aa4b-4011-9d9e-4a05206611dc","resolution":{"observed_at":"2026-08-12T18:53:58.655265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:53:59.033255Z","title":"Qserve: W4a8kv4 quantization and system co-design for efficient llm serving, 2024","venue":null,"work_id":"abdda3fb-3ca2-4708-8b74-8e8c05b3263a","year":2024},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-18T20:24:28.154075Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.659136Z"},"links":{"citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:82066413bf8f8cd28c35f6cec953eba9c180dc0d71dd3b67f5cdc913732afb0d","observation_id":"0c52fa16-3192-49a1-959a-6a51a5ec991c","resolution":{"observed_at":"2026-08-12T18:53:59.036481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:53:58.661945Z","title":"Gonzalez, Ion Stoica, and Matei Zaharia","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-18T20:24:28.154075Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.661945Z"},"links":{"citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:a95fc2fc8472584344c676919162707aa5ed617f8326d98614be5446894582c4","observation_id":"ab0a877a-ac83-429c-9448-a8b5ceeeed51","resolution":{"observed_at":"2026-08-12T18:53:58.661945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:53:59.018850Z","title":"https://mistral.ai/news/mixtral-8x22b/, April 2024","venue":null,"work_id":"0e8ea6ca-ee53-49e6-8115-95b4ea48554f","year":2024},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-18T20:24:28.154075Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.664995Z"},"links":{"citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:2760d1b2086b5e008c57790f888a9393f3d7a760542e75835ca3f09cb1e6009f","observation_id":"0ddcab18-85f7-4c14-b8f9-f58b2fed74fa","resolution":{"observed_at":"2026-08-12T18:53:59.022040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.09911","last_updated":"2022-12-24T10:12:53Z","snapshot_observed_at":"2026-08-19T07:45:34.431982Z","submitted_at":"2022-05-20T00:53:43Z","title":"Can Foundation Models Wrangle Your Data?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.09911","snapshot_observed_at":"2026-08-12T18:53:58.667936Z","title":"Can foundation models wrangle your data?arXiv preprint arXiv:2205.09911, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-18T20:24:28.154075Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.667936Z"},"links":{"cited_paper":"/paper/2205.09911","citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:e246e29abe0b943635253036f0176c84f8bd0348138cc231cd4f453fec997512","observation_id":"98ae3737-33c3-4c1c-acb9-a09cb2ce5d7a","resolution":{"observed_at":"2026-08-12T18:53:58.667936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:53:59.010080Z","title":"Pipedream: generalized pipeline parallelism for dnn train- ing","venue":null,"work_id":"4fcf1694-c1c8-4de3-8823-ecf91724745b","year":2019},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-18T20:24:28.154075Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.671082Z"},"links":{"citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:acc142629c5b5858d51aa280a9f01b4dda7d20c5907cab43b8f3afe1c55c45f4","observation_id":"caa36d69-df5c-4da8-ba84-fd06f4860082","resolution":{"observed_at":"2026-08-12T18:53:59.013260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:53:58.673854Z","title":"Efficient large- scale language model training on gpu clusters using megatron-lm","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-18T20:24:28.154075Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.673854Z"},"links":{"citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:28e0036798fc2d6f4a84962f3d7dd3977fcb7f0b6556778e48033cb61a980ee0","observation_id":"0f061996-066e-48ae-b67f-4d82d6e4132a","resolution":{"observed_at":"2026-08-12T18:53:58.673854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:53:58.676884Z","title":"Pytorch: An imperative style, high- performance deep learning library","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-18T20:24:28.154075Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.676884Z"},"links":{"citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:1136c5fdb739d2d4099ac6ff07f98716713ad55a00d259f920039f122ae4c2b1","observation_id":"bbcac705-de64-4bce-89a2-325d5c149bab","resolution":{"observed_at":"2026-08-12T18:53:58.676884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:53:58.991114Z","title":"Efficiently scaling transformer inference","venue":null,"work_id":"099eb52a-288f-4396-9b62-081811e4d2db","year":2023},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-18T20:24:28.154075Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.679584Z"},"links":{"citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:a79550ba02d3fbae4ce1bbfd24de982d2c805ed7750838aa9596a719421a178d","observation_id":"a48a4139-6f90-4c9a-b9df-fa69800813b2","resolution":{"observed_at":"2026-08-12T18:53:58.994340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:53:58.982286Z","title":"Int4 decoding gqa cuda optimizations for llm inference","venue":null,"work_id":"b76ed2b3-c33f-4f06-a859-badca6c2f58a","year":2024},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-18T20:24:28.154075Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.682282Z"},"links":{"citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:cf4ae336fb8c2994c89489fec3657716499fc2fae61d2d02eb8799285314f8e8","observation_id":"3c40886d-2f0c-49a8-ba95-f17e086b9b8d","resolution":{"observed_at":"2026-08-12T18:53:58.985437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:53:58.973298Z","title":"Accelerating transformer inference for translation via parallel decod- ing","venue":null,"work_id":"0ee4c4f0-815a-4c0a-86c4-5208a550bd14","year":2023},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-18T20:24:28.154075Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.685155Z"},"links":{"citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:589b4215a3951bd270e1b8a6f76847077d8c35ce74dc718d62d83adb4d6307c2","observation_id":"27ca07b3-ed1d-4218-815e-0adcd9ae4157","resolution":{"observed_at":"2026-08-12T18:53:58.976464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05100","last_updated":"2023-06-27T09:57:58Z","snapshot_observed_at":"2026-08-04T18:56:03.233715Z","submitted_at":"2022-11-09T18:48:09Z","title":"BLOOM: A 176B-Parameter Open-Access Multilingual Language Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.05100","snapshot_observed_at":"2026-08-12T18:53:58.688100Z","title":"Bloom: A 176b-parameter open- access multilingual language model","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-18T20:24:28.154075Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.688100Z"},"links":{"cited_paper":"/paper/2211.05100","citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:0643a71d26206b75a99ea73a646664af780d1e47d630769008f611fc305f706a","observation_id":"529a1180-301d-4b3f-b41a-d892698429ce","resolution":{"observed_at":"2026-08-12T18:53:58.688100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1701.06538","last_updated":"2017-01-23T18:10:00Z","snapshot_observed_at":"2026-08-19T12:32:00.517027Z","submitted_at":"2017-01-23T18:10:00Z","title":"Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1701.06538","snapshot_observed_at":"2026-08-12T18:53:58.691288Z","title":"Outrageously large neural networks: The sparsely-gated mixture-of-experts layer","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-18T20:24:28.154075Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.691288Z"},"links":{"cited_paper":"/paper/1701.06538","citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:30f2b9cbb92d3cb00d165944542263e2cedcea1c1a02f7346aaaa699b19b9b77","observation_id":"c9d347d1-5518-461c-afb6-97737c26e6c1","resolution":{"observed_at":"2026-08-12T18:53:58.691288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:53:58.694423Z","title":"Flexgen: High-throughput generative inference of large language models with a single gpu","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-18T20:24:28.154075Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.694423Z"},"links":{"citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:1756e07c43de4578785fea5c7c6dc794b83be99c8ad680dd86f9e9774094b9e4","observation_id":"d3d95062-058a-4ec2-9761-03a9e6ee0b21","resolution":{"observed_at":"2026-08-12T18:53:58.694423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:53:58.958020Z","title":"Powerinfer: Fast large language model serving with a consumer-grade gpu, 2023","venue":null,"work_id":"d6a04d77-a4cd-427d-8e2f-cfbdc543d802","year":2023},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-18T20:24:28.154075Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.697301Z"},"links":{"citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:d8286b298c9e2645942143464e829be7f85701bb14e59a96136ae933ddf36ff6","observation_id":"fe41c939-776a-4a03-ab5d-d5bde01a1396","resolution":{"observed_at":"2026-08-12T18:53:58.961970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:53:58.948498Z","title":"Blockwise parallel decoding for deep autoregressive models, 2018","venue":null,"work_id":"1fcf41b9-d177-41bd-9023-1f5b17ba580c","year":2018},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-18T20:24:28.154075Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.700423Z"},"links":{"citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:902356721ac6dfb79448f2718af8206c2ced3d4292e43407e9f010474f85625c","observation_id":"01f3f65f-3a72-4fab-81e1-462b883fb1c3","resolution":{"observed_at":"2026-08-12T18:53:58.951762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10774","last_updated":"2024-08-26T21:01:02Z","snapshot_observed_at":"2026-08-19T19:59:53.494904Z","submitted_at":"2024-06-16T01:33:02Z","title":"Quest: Query-Aware Sparsity for Efficient Long-Context LLM Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10774","snapshot_observed_at":"2026-08-12T18:53:58.703312Z","title":"Quest: Query-aware sparsity for efficient long-context llm inference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-18T20:24:28.154075Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.703312Z"},"links":{"cited_paper":"/paper/2406.10774","citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:df92f933b4716c89bd71e3b0e82b779b02f0b6aaa1860c74ca56e46a8110bd41","observation_id":"65f40479-2123-4938-a987-30448f8f6236","resolution":{"observed_at":"2026-08-12T18:53:58.703312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:53:58.939036Z","title":"Introducing dbrx: A new state-of-the-art open llm, 2024","venue":null,"work_id":"ea41e0d8-cac2-40b0-99f0-1545d364c70f","year":2024},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-18T20:24:28.154075Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.706692Z"},"links":{"citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:1f6c665d8b5a4a5d46b687e81adb33c7818daf8a4994467ad37085a94aa157f8","observation_id":"bc4e239d-4295-49b9-a2d4-0f7d79d70e05","resolution":{"observed_at":"2026-08-12T18:53:58.942656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-12T18:53:58.709940Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-18T20:24:28.154075Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.709940Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:b6034cbf2b87184205582a20e8dd0da2f124f92a2f146faf22da9bc7d5f834e4","observation_id":"8512b705-473b-4585-8a91-61a75c353df6","resolution":{"observed_at":"2026-08-12T18:53:58.709940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:53:58.930096Z","title":"Patterson","venue":null,"work_id":"cf3464b7-6a2e-4d3c-aa3f-1bcdc70e4631","year":2009},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-18T20:24:28.154075Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.712972Z"},"links":{"citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:38f37ab4e354c031937ee27430353ddd3bca498f18eb4b6f6529d863a2dbc216","observation_id":"82f6bb67-35da-44ff-9b32-512a4dd9306a","resolution":{"observed_at":"2026-08-12T18:53:58.933257Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:53:58.920942Z","title":"Hetegen: Efficient heterogeneous parallel inference for large language models on resource-constrained devices","venue":null,"work_id":"07f0c365-e9c0-44da-a7b1-eeff3b6560a1","year":2024},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-18T20:24:28.154075Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.715786Z"},"links":{"citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:e7438492990c687e23bd7f80a10c744730b727eef5d93ba09743edd85bbfcaab","observation_id":"426a9ebc-8270-4434-89e8-8c451dcce4e3","resolution":{"observed_at":"2026-08-12T18:53:58.924325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:53:58.911271Z","title":"Moe- infinity: Activation-aware expert offloading for efficient moe serving, 2024","venue":null,"work_id":"d0777069-d95a-4ee2-affa-b541fda7fd5b","year":2024},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-18T20:24:28.154075Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.719047Z"},"links":{"citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:4f8f2d1e2e670a1a7309929b9bd15cdff28880cc9c5307a8486009fbe1b6fd61","observation_id":"4d0a4246-cd10-47af-a22e-b2ef80cf4cbb","resolution":{"observed_at":"2026-08-12T18:53:58.914493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:53:58.722241Z","title":"Orca: A distributed serving system for {Transformer-Based} generative models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-18T20:24:28.154075Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.722241Z"},"links":{"citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:c5c53637cfe41220208be57e88b73bb4fab95c450674cd7dd51089e5fc9d1207","observation_id":"92fdc5f8-79f9-45cc-8fce-0ead5940fce9","resolution":{"observed_at":"2026-08-12T18:53:58.722241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:53:58.725433Z","title":"Llm inference unveiled: Survey and roofline model insights, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-18T20:24:28.154075Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.725433Z"},"links":{"citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:ef55c88d89ca91fc972598881f486c36bc143393944a3888e7b877a10bbe43d4","observation_id":"091b585a-d928-4c63-9bef-ad4582ae5f35","resolution":{"observed_at":"2026-08-12T18:53:58.725433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-12T18:53:58.728292Z","title":"Opt: Open pre-trained transformer language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-18T20:24:28.154075Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.728292Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:d4073013330a41a696df81625bf76ee5ec37d1a445eabe5b130621fc9afca4bc","observation_id":"96114ba4-97b0-4a2e-82ab-d502a5f31661","resolution":{"observed_at":"2026-08-12T18:53:58.728292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:53:58.891180Z","title":"H2o: Heavy-hitter oracle for efficient generative in- ference of large language models","venue":null,"work_id":"6a59cd75-c305-4da5-8afc-35c152841be0","year":2024},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-18T20:24:28.154075Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.731529Z"},"links":{"citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:756161b76d203218c23173954acef06ab3732b7254c8bc16a22261db78301e91","observation_id":"edf02297-787e-4ff1-b456-6570380d7f81","resolution":{"observed_at":"2026-08-12T18:53:58.894605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:53:58.882075Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena","venue":null,"work_id":"9f6069cd-a513-4bdf-818a-fc7a6bebf8a4","year":2024},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-18T20:24:28.154075Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.734590Z"},"links":{"citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:4e983b4bd2d5dc722749f3364a080b0f2a5dd4ce84da6f7f350030a802095448","observation_id":"91bdd8b7-1edd-4155-b51d-1767b4b4eae9","resolution":{"observed_at":"2026-08-12T18:53:58.885475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:53:58.737467Z","title":"Gonzalez, Clark Barrett, and Ying Sheng","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-18T20:24:28.154075Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.737467Z"},"links":{"citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:baf1169a64a1e54affa5f62970875a5f636baf36e03e72d47c0b1743985777ce","observation_id":"07fb519d-789a-43b0-a989-ce9514a7e432","resolution":{"observed_at":"2026-08-12T18:53:58.737467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:53:58.865914Z","title":"Mixture-of- experts with expert choice routing","venue":null,"work_id":"cde60ce8-bab9-4e5b-971b-86c72ab92d73","year":2022},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-18T20:24:28.154075Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.740609Z"},"links":{"citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:fdafd9425efc39ca99b974a37194d169f945d5d0cf5ae28caa883c80e5d12e8c","observation_id":"859ce6be-be1c-4784-b280-8697531af128","resolution":{"observed_at":"2026-08-12T18:53:58.870916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","latest_version":1,"primary_category":"cs.DC","snapshot_observed_at":"2026-08-18T20:24:28.154075Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":0,"verified_fuzzy":30},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 1 inbound Pith citation observation for arXiv:2411.11217."}