{"as_of":"2026-08-15T20:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0bf2e1d0c6918525378e0e69e2051a60e064fb2c79d5f03f1f358928ea12bf42","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T04:32:58.446447Z","state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.08650/citation-record","integrity":"/paper/2608.08650/integrity","json":"/paper/2608.08650/citation-record.json","paper":"/paper/2608.08650"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:32:59.252398Z","title":null,"venue":null,"work_id":"b5114b7c-926a-4c87-a8df-3f9c01e6abb8","year":null},"citing_paper":{"arxiv_id":"2608.08650","last_updated":"2026-08-09T11:46:29Z","snapshot_observed_at":"2026-08-15T18:58:43.376157Z","submitted_at":"2026-08-09T11:46:29Z","title":"The Evolution of Mixture-of-Experts Architectures in Large Language Models: Routing, Topology, Load Balancing, and Expert Parallelism","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:58.233177Z"},"links":{"citing_paper":"/paper/2608.08650"},"observation_digest":"sha256:9e6f9490c03224fcc142421ac0a93348682f17a60084cffd0baa14ddf43adca3","observation_id":"155412e3-7d0f-44fa-acc7-9d39d244d27b","resolution":{"observed_at":"2026-08-14T04:32:59.257784Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:32:59.226948Z","title":null,"venue":null,"work_id":"3eb0307f-dc78-4860-993f-0cd6c96dd0da","year":null},"citing_paper":{"arxiv_id":"2608.08650","last_updated":"2026-08-09T11:46:29Z","snapshot_observed_at":"2026-08-15T18:58:43.376157Z","submitted_at":"2026-08-09T11:46:29Z","title":"The Evolution of Mixture-of-Experts Architectures in Large Language Models: Routing, Topology, Load Balancing, and Expert Parallelism","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:58.238758Z"},"links":{"citing_paper":"/paper/2608.08650"},"observation_digest":"sha256:dfb334a77668e281b50cf94310a860840c16f2ba2ed2b1fc0ea1a9ab7cc7704e","observation_id":"f7f081eb-159f-4567-ba8b-42f519014d53","resolution":{"observed_at":"2026-08-14T04:32:59.232328Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:32:59.208319Z","title":"总 All-to-All 时间","venue":null,"work_id":"a4ee8ae3-86a9-4d41-894f-5e45775eb366","year":2026},"citing_paper":{"arxiv_id":"2608.08650","last_updated":"2026-08-09T11:46:29Z","snapshot_observed_at":"2026-08-15T18:58:43.376157Z","submitted_at":"2026-08-09T11:46:29Z","title":"The Evolution of Mixture-of-Experts Architectures in Large Language Models: Routing, Topology, Load Balancing, and Expert Parallelism","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:58.245187Z"},"links":{"citing_paper":"/paper/2608.08650"},"observation_digest":"sha256:16675480d275b006c5dbe0709d954e26a0fff385ca16594de2549574aae582bf","observation_id":"88128731-e303-4cc8-b293-7508c5abf31e","resolution":{"observed_at":"2026-08-14T04:32:59.213592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:32:59.379246Z","title":"A Survey on Mixture of Experts in Large Language Models","venue":null,"work_id":"ab77af3a-6df6-479f-8646-73a5d29e7b3f","year":null},"citing_paper":{"arxiv_id":"2608.08650","last_updated":"2026-08-09T11:46:29Z","snapshot_observed_at":"2026-08-15T18:58:43.376157Z","submitted_at":"2026-08-09T11:46:29Z","title":"The Evolution of Mixture-of-Experts Architectures in Large Language Models: Routing, Topology, Load Balancing, and Expert Parallelism","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:58.251293Z"},"links":{"citing_paper":"/paper/2608.08650"},"observation_digest":"sha256:59dc3556642c626d550738eeba7c1372c43568097a0ea503fc65c3c876ea8f86","observation_id":"1b015d02-473e-477d-8c0c-00fff5e8c6e9","resolution":{"observed_at":"2026-08-14T04:32:59.384791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06204","last_updated":"2025-04-09T13:54:59Z","snapshot_observed_at":"2026-08-14T07:20:22.540923Z","submitted_at":"2024-06-26T16:34:33Z","title":"A Survey on Mixture of Experts in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06204","snapshot_observed_at":"2026-08-14T04:32:58.257289Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08650","last_updated":"2026-08-09T11:46:29Z","snapshot_observed_at":"2026-08-15T18:58:43.376157Z","submitted_at":"2026-08-09T11:46:29Z","title":"The Evolution of Mixture-of-Experts Architectures in Large Language Models: Routing, Topology, Load Balancing, and Expert Parallelism","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:58.257289Z"},"links":{"cited_paper":"/paper/2407.06204","citing_paper":"/paper/2608.08650"},"observation_digest":"sha256:ad488cb511e3d84699c7f6f057a9aca8d1f631a6163a37107855e5eea4fce3b3","observation_id":"78903f03-9259-4bf6-9fd4-697cb33ce04b","resolution":{"observed_at":"2026-08-14T04:32:58.257289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14219","last_updated":"2025-01-22T03:33:25Z","snapshot_observed_at":"2026-08-13T23:36:29.207493Z","submitted_at":"2024-12-18T14:11:15Z","title":"A Survey on Inference Optimization Techniques for Mixture of Experts Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14219","snapshot_observed_at":"2026-08-14T04:32:58.262836Z","title":"A Survey on Inference Optimization Techniques for Mixture of Experts Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08650","last_updated":"2026-08-09T11:46:29Z","snapshot_observed_at":"2026-08-15T18:58:43.376157Z","submitted_at":"2026-08-09T11:46:29Z","title":"The Evolution of Mixture-of-Experts Architectures in Large Language Models: Routing, Topology, Load Balancing, and Expert Parallelism","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:58.262836Z"},"links":{"cited_paper":"/paper/2412.14219","citing_paper":"/paper/2608.08650"},"observation_digest":"sha256:1f70ac180464d464c8d8e666cb963dad5582e60b1f135df1f26aa95f87dab2dd","observation_id":"8f2b9ad3-4bc8-440b-b148-5692f207abeb","resolution":{"observed_at":"2026-08-14T04:32:58.262836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09834","last_updated":"2025-08-13T14:13:46Z","snapshot_observed_at":"2026-08-08T08:45:25.504330Z","submitted_at":"2025-08-13T14:13:46Z","title":"Speed Always Wins: A Survey on Efficient Architectures for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.09834","snapshot_observed_at":"2026-08-14T04:32:58.267934Z","title":"Speed Always Wins: A Survey on Eﬀicient Architectures for Large Language Models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08650","last_updated":"2026-08-09T11:46:29Z","snapshot_observed_at":"2026-08-15T18:58:43.376157Z","submitted_at":"2026-08-09T11:46:29Z","title":"The Evolution of Mixture-of-Experts Architectures in Large Language Models: Routing, Topology, Load Balancing, and Expert Parallelism","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:58.267934Z"},"links":{"cited_paper":"/paper/2508.09834","citing_paper":"/paper/2608.08650"},"observation_digest":"sha256:b28afcf2c0c3abc6c817f38e4e4e80e507f509240e763b1171596c31eed5c04d","observation_id":"61c66eaf-ae8f-4359-9f8e-fc8da2449351","resolution":{"observed_at":"2026-08-14T04:32:58.267934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:32:58.273267Z","title":"Adaptive Mixtures of Local Experts","venue":null,"work_id":null,"year":1991},"citing_paper":{"arxiv_id":"2608.08650","last_updated":"2026-08-09T11:46:29Z","snapshot_observed_at":"2026-08-15T18:58:43.376157Z","submitted_at":"2026-08-09T11:46:29Z","title":"The Evolution of Mixture-of-Experts Architectures in Large Language Models: Routing, Topology, Load Balancing, and Expert Parallelism","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:58.273267Z"},"links":{"citing_paper":"/paper/2608.08650"},"observation_digest":"sha256:19ed30db4df30f600a32e549fbfec6c8925df23e9cfddc1779dbc44f0e15e074","observation_id":"8984cb4b-f455-4def-9e56-094faf9ff28f","resolution":{"observed_at":"2026-08-14T04:32:58.273267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1701.06538","last_updated":"2017-01-23T18:10:00Z","snapshot_observed_at":"2026-08-13T11:35:07.866136Z","submitted_at":"2017-01-23T18:10:00Z","title":"Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1701.06538","snapshot_observed_at":"2026-08-14T04:32:58.279219Z","title":"Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.08650","last_updated":"2026-08-09T11:46:29Z","snapshot_observed_at":"2026-08-15T18:58:43.376157Z","submitted_at":"2026-08-09T11:46:29Z","title":"The Evolution of Mixture-of-Experts Architectures in Large Language Models: Routing, Topology, Load Balancing, and Expert Parallelism","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:58.279219Z"},"links":{"cited_paper":"/paper/1701.06538","citing_paper":"/paper/2608.08650"},"observation_digest":"sha256:0c68bcee8d6d4f55bf9c552713568855cc6507c8e449570a36382834c118a679","observation_id":"2a1ecfed-c799-4c62-858a-1ffa1c4724dc","resolution":{"observed_at":"2026-08-14T04:32:58.279219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16668","last_updated":"2020-06-30T10:42:02Z","snapshot_observed_at":"2026-08-07T09:27:36.420559Z","submitted_at":"2020-06-30T10:42:02Z","title":"GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.16668","snapshot_observed_at":"2026-08-14T04:32:58.284500Z","title":"GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.08650","last_updated":"2026-08-09T11:46:29Z","snapshot_observed_at":"2026-08-15T18:58:43.376157Z","submitted_at":"2026-08-09T11:46:29Z","title":"The Evolution of Mixture-of-Experts Architectures in Large Language Models: Routing, Topology, Load Balancing, and Expert Parallelism","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:58.284500Z"},"links":{"cited_paper":"/paper/2006.16668","citing_paper":"/paper/2608.08650"},"observation_digest":"sha256:af0ae0d1ec4e444484d042641eeb750cb7c681f1079ee0d3f7936bd6f4008647","observation_id":"cd8cec16-c0d2-493a-953e-44a51c39c2ad","resolution":{"observed_at":"2026-08-14T04:32:58.284500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.03961","last_updated":"2022-06-16T20:36:07Z","snapshot_observed_at":"2026-08-14T22:45:56.335948Z","submitted_at":"2021-01-11T16:11:52Z","title":"Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.03961","snapshot_observed_at":"2026-08-14T04:32:58.289591Z","title":"Switch Transformers: Scaling to Trillion Parameter Models with Simple and Eﬀicient Sparsity","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.08650","last_updated":"2026-08-09T11:46:29Z","snapshot_observed_at":"2026-08-15T18:58:43.376157Z","submitted_at":"2026-08-09T11:46:29Z","title":"The Evolution of Mixture-of-Experts Architectures in Large Language Models: Routing, Topology, Load Balancing, and Expert Parallelism","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:58.289591Z"},"links":{"cited_paper":"/paper/2101.03961","citing_paper":"/paper/2608.08650"},"observation_digest":"sha256:842c23ae2585c7d7b506054aa5544a182e75188cfff4807dc77a2e0d10ea297d","observation_id":"c43a1dfd-0197-4799-aa11-1113006dd440","resolution":{"observed_at":"2026-08-14T04:32:58.289591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-08-14T04:32:58.294305Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.08650","last_updated":"2026-08-09T11:46:29Z","snapshot_observed_at":"2026-08-15T18:58:43.376157Z","submitted_at":"2026-08-09T11:46:29Z","title":"The Evolution of Mixture-of-Experts Architectures in Large Language Models: Routing, Topology, Load Balancing, and Expert Parallelism","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:58.294305Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2608.08650"},"observation_digest":"sha256:4574d72098c97eedb5e04e8deece14ac52aa0895de9ae9d68e23b350fc71875b","observation_id":"c45be21f-5096-447c-9f5f-f1fe7941a958","resolution":{"observed_at":"2026-08-14T04:32:58.294305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.16716","last_updated":"2021-03-30T23:08:32Z","snapshot_observed_at":"2026-08-14T02:05:35.181421Z","submitted_at":"2021-03-30T23:08:32Z","title":"BASE Layers: Simplifying Training of Large, Sparse Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.16716","snapshot_observed_at":"2026-08-14T04:32:58.299078Z","title":"BASE Layers: Simplifying Training of Large, Sparse Models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.08650","last_updated":"2026-08-09T11:46:29Z","snapshot_observed_at":"2026-08-15T18:58:43.376157Z","submitted_at":"2026-08-09T11:46:29Z","title":"The Evolution of Mixture-of-Experts Architectures in Large Language Models: Routing, Topology, Load Balancing, and Expert Parallelism","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:58.299078Z"},"links":{"cited_paper":"/paper/2103.16716","citing_paper":"/paper/2608.08650"},"observation_digest":"sha256:99aef885da5caa6f381702a53b30b7e8a9f42a072cfa441753d9d428d0ee359f","observation_id":"a98cf91f-94b7-4bdc-afd9-d0719badc588","resolution":{"observed_at":"2026-08-14T04:32:58.299078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.09368","last_updated":"2022-10-14T00:08:24Z","snapshot_observed_at":"2026-08-14T20:08:44.842157Z","submitted_at":"2022-02-18T17:46:11Z","title":"Mixture-of-Experts with Expert Choice Routing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.09368","snapshot_observed_at":"2026-08-14T04:32:58.304689Z","title":"Mixture-of-Experts with Expert Choice Routing","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.08650","last_updated":"2026-08-09T11:46:29Z","snapshot_observed_at":"2026-08-15T18:58:43.376157Z","submitted_at":"2026-08-09T11:46:29Z","title":"The Evolution of Mixture-of-Experts Architectures in Large Language Models: Routing, Topology, Load Balancing, and Expert Parallelism","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:58.304689Z"},"links":{"cited_paper":"/paper/2202.09368","citing_paper":"/paper/2608.08650"},"observation_digest":"sha256:b8c2819c2cd0026e3a95a66a50eba6ebd134e6d040f861bd9800696e22ceb45d","observation_id":"32714d3f-e41a-46c4-90d8-7886c02c8b33","resolution":{"observed_at":"2026-08-14T04:32:58.304689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-13T19:43:49.936776Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-14T04:32:58.311824Z","title":"Mixtral of Experts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08650","last_updated":"2026-08-09T11:46:29Z","snapshot_observed_at":"2026-08-15T18:58:43.376157Z","submitted_at":"2026-08-09T11:46:29Z","title":"The Evolution of Mixture-of-Experts Architectures in Large Language Models: Routing, Topology, Load Balancing, and Expert Parallelism","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:58.311824Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2608.08650"},"observation_digest":"sha256:f9033c8e15dd4b28660374debb47f3d26cc90726c67587baced0055d5dd1d3e9","observation_id":"61850748-812c-48c4-941f-dec0ffaa1b60","resolution":{"observed_at":"2026-08-14T04:32:58.311824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06066","last_updated":"2024-01-11T17:31:42Z","snapshot_observed_at":"2026-08-13T15:18:04.411100Z","submitted_at":"2024-01-11T17:31:42Z","title":"DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06066","snapshot_observed_at":"2026-08-14T04:32:58.316527Z","title":"DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08650","last_updated":"2026-08-09T11:46:29Z","snapshot_observed_at":"2026-08-15T18:58:43.376157Z","submitted_at":"2026-08-09T11:46:29Z","title":"The Evolution of Mixture-of-Experts Architectures in Large Language Models: Routing, Topology, Load Balancing, and Expert Parallelism","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:58.316527Z"},"links":{"cited_paper":"/paper/2401.06066","citing_paper":"/paper/2608.08650"},"observation_digest":"sha256:5e676b51364188c97cc6bed260a7ea3c333aa35f1be7130a1d24d26fd1202145","observation_id":"31688b3b-bc2c-40b5-9c15-8cc59de059d1","resolution":{"observed_at":"2026-08-14T04:32:58.316527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-14T04:32:58.321856Z","title":"DeepSeek-V2: A Strong, Economical, and Eﬀicient Mixture-of-Experts Language Model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08650","last_updated":"2026-08-09T11:46:29Z","snapshot_observed_at":"2026-08-15T18:58:43.376157Z","submitted_at":"2026-08-09T11:46:29Z","title":"The Evolution of Mixture-of-Experts Architectures in Large Language Models: Routing, Topology, Load Balancing, and Expert Parallelism","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:58.321856Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2608.08650"},"observation_digest":"sha256:098d8e478148e948c2122a04b9416bb72c5a0a24094f34a18da663ad006dff7d","observation_id":"07ebc0aa-91b1-4fa2-a626-cbea7ee04639","resolution":{"observed_at":"2026-08-14T04:32:58.321856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:32:59.359066Z","title":"Arctic: Snowflake’s Open-Source LLM","venue":null,"work_id":"bfb1bbf8-d7dc-471e-8ee3-6c90a83882d3","year":2024},"citing_paper":{"arxiv_id":"2608.08650","last_updated":"2026-08-09T11:46:29Z","snapshot_observed_at":"2026-08-15T18:58:43.376157Z","submitted_at":"2026-08-09T11:46:29Z","title":"The Evolution of Mixture-of-Experts Architectures in Large Language Models: Routing, Topology, Load Balancing, and Expert Parallelism","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:58.329082Z"},"links":{"citing_paper":"/paper/2608.08650"},"observation_digest":"sha256:c342fc8d1960a368021c929c806af4af93170872638a203a231cb768293a2ba2","observation_id":"1b20fc12-e4e1-4461-94ac-0d948153fc82","resolution":{"observed_at":"2026-08-14T04:32:59.365891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-14T04:32:58.334915Z","title":"Qwen3 Technical Report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08650","last_updated":"2026-08-09T11:46:29Z","snapshot_observed_at":"2026-08-15T18:58:43.376157Z","submitted_at":"2026-08-09T11:46:29Z","title":"The Evolution of Mixture-of-Experts Architectures in Large Language Models: Routing, Topology, Load Balancing, and Expert Parallelism","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:58.334915Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2608.08650"},"observation_digest":"sha256:556b17d5fd86d1f6f87fefcb859b137faa0399e6e8a1cf5f484c913c5b58f3d9","observation_id":"192b8514-451f-4f73-8613-4e8da2c1d24a","resolution":{"observed_at":"2026-08-14T04:32:58.334915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04153","last_updated":"2024-07-04T20:59:20Z","snapshot_observed_at":"2026-08-12T23:28:33.412949Z","submitted_at":"2024-07-04T20:59:20Z","title":"Mixture of A Million Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04153","snapshot_observed_at":"2026-08-14T04:32:58.340157Z","title":"Mixture of A Million Experts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08650","last_updated":"2026-08-09T11:46:29Z","snapshot_observed_at":"2026-08-15T18:58:43.376157Z","submitted_at":"2026-08-09T11:46:29Z","title":"The Evolution of Mixture-of-Experts Architectures in Large Language Models: Routing, Topology, Load Balancing, and Expert Parallelism","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:58.340157Z"},"links":{"cited_paper":"/paper/2407.04153","citing_paper":"/paper/2608.08650"},"observation_digest":"sha256:901a79364a718640b92df137412217c83e682e34f9d11aef25243dc789528d1f","observation_id":"879cd6f2-c6d0-4b73-a76a-4efda08f2733","resolution":{"observed_at":"2026-08-14T04:32:58.340157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20534","last_updated":"2026-02-03T04:57:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-28T05:35:43Z","title":"Kimi K2: Open Agentic Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.20534","snapshot_observed_at":"2026-08-14T04:32:58.345266Z","title":"Kimi K2: Open Agentic Intelligence","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08650","last_updated":"2026-08-09T11:46:29Z","snapshot_observed_at":"2026-08-15T18:58:43.376157Z","submitted_at":"2026-08-09T11:46:29Z","title":"The Evolution of Mixture-of-Experts Architectures in Large Language Models: Routing, Topology, Load Balancing, and Expert Parallelism","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:58.345266Z"},"links":{"cited_paper":"/paper/2507.20534","citing_paper":"/paper/2608.08650"},"observation_digest":"sha256:f56ae9be60dd000d46cef81a99028986aa88af6e3d8c1d3ad299aaa6682ae107","observation_id":"1f73fa79-2c97-4189-945a-659621f98fed","resolution":{"observed_at":"2026-08-14T04:32:58.345266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:32:59.337281Z","title":"gpt-oss Model Card: Architecture","venue":null,"work_id":"96a695d8-1475-4d9c-8a58-23e0ed88c584","year":2025},"citing_paper":{"arxiv_id":"2608.08650","last_updated":"2026-08-09T11:46:29Z","snapshot_observed_at":"2026-08-15T18:58:43.376157Z","submitted_at":"2026-08-09T11:46:29Z","title":"The Evolution of Mixture-of-Experts Architectures in Large Language Models: Routing, Topology, Load Balancing, and Expert Parallelism","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:58.351257Z"},"links":{"citing_paper":"/paper/2608.08650"},"observation_digest":"sha256:9a4be94be42dba335cb98658f979e232c55ee692d2254542f289211938c1437b","observation_id":"ab426b07-485c-4686-a67a-560098855d76","resolution":{"observed_at":"2026-08-14T04:32:59.345701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:32:58.356618Z","title":"LongCat-Flash Technical Report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08650","last_updated":"2026-08-09T11:46:29Z","snapshot_observed_at":"2026-08-15T18:58:43.376157Z","submitted_at":"2026-08-09T11:46:29Z","title":"The Evolution of Mixture-of-Experts Architectures in Large Language Models: Routing, Topology, Load Balancing, and Expert Parallelism","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:58.356618Z"},"links":{"citing_paper":"/paper/2608.08650"},"observation_digest":"sha256:7b73674f914aa6cc8ded2eea60026d8eed6dcb5cdf037c55304adf92255f8566","observation_id":"d634a2cc-ec24-42c7-8c8e-5debaca623cb","resolution":{"observed_at":"2026-08-14T04:32:58.356618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05019","last_updated":"2025-05-29T04:25:16Z","snapshot_observed_at":"2026-08-13T00:35:31.529133Z","submitted_at":"2024-04-07T17:17:23Z","title":"Shortcut-connected Expert Parallelism for Accelerating Mixture-of-Experts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05019","snapshot_observed_at":"2026-08-14T04:32:58.362126Z","title":"Shortcut-connected Expert Parallelism for Accelerating Mixture-of-Experts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08650","last_updated":"2026-08-09T11:46:29Z","snapshot_observed_at":"2026-08-15T18:58:43.376157Z","submitted_at":"2026-08-09T11:46:29Z","title":"The Evolution of Mixture-of-Experts Architectures in Large Language Models: Routing, Topology, Load Balancing, and Expert Parallelism","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:58.362126Z"},"links":{"cited_paper":"/paper/2404.05019","citing_paper":"/paper/2608.08650"},"observation_digest":"sha256:f25da9db4c37af734a5e897a57e4f63365fe2ea34df90c82eca9720013cd87ed","observation_id":"6b6f590d-e17a-4d7c-ab6a-4bd47c855fca","resolution":{"observed_at":"2026-08-14T04:32:58.362126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:32:59.312963Z","title":"LongCat 2.0 Technical Blog","venue":null,"work_id":"4d46f3ee-c4f4-48ac-b8cd-6d44bd197e5a","year":2026},"citing_paper":{"arxiv_id":"2608.08650","last_updated":"2026-08-09T11:46:29Z","snapshot_observed_at":"2026-08-15T18:58:43.376157Z","submitted_at":"2026-08-09T11:46:29Z","title":"The Evolution of Mixture-of-Experts Architectures in Large Language Models: Routing, Topology, Load Balancing, and Expert Parallelism","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:58.368767Z"},"links":{"citing_paper":"/paper/2608.08650"},"observation_digest":"sha256:3a0dce6bf59e9efa3ab60edeb868c96ae215baac7cd21cef6446b9081a70ff03","observation_id":"8f27f14c-fbd6-44e2-998d-1f1b0f54fc92","resolution":{"observed_at":"2026-08-14T04:32:59.317922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:32:59.291441Z","title":"MoHGE: Mixture of Heterogeneous Grouped Experts","venue":null,"work_id":"115b858b-a33c-4509-a4e1-3b5d673e46e2","year":2026},"citing_paper":{"arxiv_id":"2608.08650","last_updated":"2026-08-09T11:46:29Z","snapshot_observed_at":"2026-08-15T18:58:43.376157Z","submitted_at":"2026-08-09T11:46:29Z","title":"The Evolution of Mixture-of-Experts Architectures in Large Language Models: Routing, Topology, Load Balancing, and Expert Parallelism","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:58.374274Z"},"links":{"citing_paper":"/paper/2608.08650"},"observation_digest":"sha256:ca7c0250294281a4b05c86a1f45a016469317c264830704498590785756e699d","observation_id":"898a66da-b382-4426-9b70-927251efbefc","resolution":{"observed_at":"2026-08-14T04:32:59.297216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:32:59.271521Z","title":"GMoE: Global Mixture-of-Experts","venue":null,"work_id":"e12ad60b-ad62-46bf-a192-d0d0a4f38447","year":2026},"citing_paper":{"arxiv_id":"2608.08650","last_updated":"2026-08-09T11:46:29Z","snapshot_observed_at":"2026-08-15T18:58:43.376157Z","submitted_at":"2026-08-09T11:46:29Z","title":"The Evolution of Mixture-of-Experts Architectures in Large Language Models: Routing, Topology, Load Balancing, and Expert Parallelism","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:58.380158Z"},"links":{"citing_paper":"/paper/2608.08650"},"observation_digest":"sha256:e9511e103e2e321ecca4fc2e458331e26141b0b0978d801499e383ba9de8a629","observation_id":"6226d18c-7617-47dd-86bf-e488410062da","resolution":{"observed_at":"2026-08-14T04:32:59.277555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.04870","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:32:58.783702Z","title":"Multi-Head LatentMoE and Head Parallel","venue":null,"work_id":"ad0e3095-1c0a-4700-996f-0c1618a5d649","year":2026},"citing_paper":{"arxiv_id":"2608.08650","last_updated":"2026-08-09T11:46:29Z","snapshot_observed_at":"2026-08-15T18:58:43.376157Z","submitted_at":"2026-08-09T11:46:29Z","title":"The Evolution of Mixture-of-Experts Architectures in Large Language Models: Routing, Topology, Load Balancing, and Expert Parallelism","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:58.387367Z"},"links":{"citing_paper":"/paper/2608.08650"},"observation_digest":"sha256:ada9f77c3ec2410076a4055119cc288c6e85577ffcea4b577413b2eae713a4cb","observation_id":"42e1fceb-5840-425e-a95c-c0374e5b5b72","resolution":{"observed_at":"2026-08-14T04:32:58.792734Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05055","last_updated":"2023-02-17T17:54:50Z","snapshot_observed_at":"2026-08-14T02:15:57.199561Z","submitted_at":"2022-12-09T18:57:37Z","title":"Sparse Upcycling: Training Mixture-of-Experts from Dense Checkpoints","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.05055","snapshot_observed_at":"2026-08-14T04:32:58.393621Z","title":"Sparse Upcycling: Training Mixture-of-Experts from Dense Checkpoints","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.08650","last_updated":"2026-08-09T11:46:29Z","snapshot_observed_at":"2026-08-15T18:58:43.376157Z","submitted_at":"2026-08-09T11:46:29Z","title":"The Evolution of Mixture-of-Experts Architectures in Large Language Models: Routing, Topology, Load Balancing, and Expert Parallelism","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:58.393621Z"},"links":{"cited_paper":"/paper/2212.05055","citing_paper":"/paper/2608.08650"},"observation_digest":"sha256:471575aa68122a437f1fc89eed4a8404ba63520e5e9614ed48398c195e88e675","observation_id":"6ea333fd-a000-4440-a917-4a2dd234c26b","resolution":{"observed_at":"2026-08-14T04:32:58.393621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.19835","last_updated":"2026-05-10T18:33:52Z","snapshot_observed_at":"2026-08-15T19:42:17.129212Z","submitted_at":"2026-04-21T05:53:33Z","title":"Expert Upcycling: Shifting the Compute-Efficient Frontier of Mixture-of-Experts","version":2},"cited_work":{"arxiv_id":"2604.19835","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.19835","snapshot_observed_at":"2026-08-14T04:32:58.676122Z","title":"Expert Upcycling: Shifting the Compute-Efficient Frontier of Mixture-of-Experts","venue":"cs.LG","work_id":"0eb618c0-29b9-41c1-800f-c9e1cede3440","year":2026},"citing_paper":{"arxiv_id":"2608.08650","last_updated":"2026-08-09T11:46:29Z","snapshot_observed_at":"2026-08-15T18:58:43.376157Z","submitted_at":"2026-08-09T11:46:29Z","title":"The Evolution of Mixture-of-Experts Architectures in Large Language Models: Routing, Topology, Load Balancing, and Expert Parallelism","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:58.404138Z"},"links":{"cited_paper":"/paper/2604.19835","citing_paper":"/paper/2608.08650"},"observation_digest":"sha256:ce35555361931817dbc797206a405645312ea61ad7e8216defdfc8a18e8e20da","observation_id":"1a7fe1c8-47ff-462b-8b70-68986a7d781b","resolution":{"observed_at":"2026-08-14T04:32:58.684185Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00951","last_updated":"2024-05-27T11:44:51Z","snapshot_observed_at":"2026-08-13T21:59:34.951949Z","submitted_at":"2023-08-02T05:20:55Z","title":"From Sparse to Soft Mixtures of Experts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.00951","snapshot_observed_at":"2026-08-14T04:32:58.409771Z","title":"From Sparse to Soft Mixtures of Experts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08650","last_updated":"2026-08-09T11:46:29Z","snapshot_observed_at":"2026-08-15T18:58:43.376157Z","submitted_at":"2026-08-09T11:46:29Z","title":"The Evolution of Mixture-of-Experts Architectures in Large Language Models: Routing, Topology, Load Balancing, and Expert Parallelism","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:58.409771Z"},"links":{"cited_paper":"/paper/2308.00951","citing_paper":"/paper/2608.08650"},"observation_digest":"sha256:a469e960a7dbebff31a9c8cc4ebcbc1ee2753ab85bfa4c2f1102484a7cbcfb0f","observation_id":"6bd2c283-d122-4b69-83c7-0fa779d27a17","resolution":{"observed_at":"2026-08-14T04:32:58.409771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.03133","last_updated":"2024-08-19T06:45:06Z","snapshot_observed_at":"2026-08-14T08:26:41.184324Z","submitted_at":"2024-05-06T03:06:33Z","title":"Lory: Fully Differentiable Mixture-of-Experts for Autoregressive Language Model Pre-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.03133","snapshot_observed_at":"2026-08-14T04:32:58.414782Z","title":"Lory: Fully Differentiable Mixture-of-Experts for Autoregressive Language Model Pre-training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08650","last_updated":"2026-08-09T11:46:29Z","snapshot_observed_at":"2026-08-15T18:58:43.376157Z","submitted_at":"2026-08-09T11:46:29Z","title":"The Evolution of Mixture-of-Experts Architectures in Large Language Models: Routing, Topology, Load Balancing, and Expert Parallelism","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:58.414782Z"},"links":{"cited_paper":"/paper/2405.03133","citing_paper":"/paper/2608.08650"},"observation_digest":"sha256:1ed5e62bc40874387ef36918b6820fe1834cd738dc6ff74a8973853a40c04ade","observation_id":"fa229c4d-40aa-428a-80f9-51b3769444ac","resolution":{"observed_at":"2026-08-14T04:32:58.414782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15664","last_updated":"2024-08-28T09:31:09Z","snapshot_observed_at":"2026-08-15T04:59:51.918109Z","submitted_at":"2024-08-28T09:31:09Z","title":"Auxiliary-Loss-Free Load Balancing Strategy for Mixture-of-Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15664","snapshot_observed_at":"2026-08-14T04:32:58.419634Z","title":"Auxiliary-Loss-Free Load Balancing Strategy for Mixture-of-Experts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08650","last_updated":"2026-08-09T11:46:29Z","snapshot_observed_at":"2026-08-15T18:58:43.376157Z","submitted_at":"2026-08-09T11:46:29Z","title":"The Evolution of Mixture-of-Experts Architectures in Large Language Models: Routing, Topology, Load Balancing, and Expert Parallelism","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:58.419634Z"},"links":{"cited_paper":"/paper/2408.15664","citing_paper":"/paper/2608.08650"},"observation_digest":"sha256:7282d878f1ab9e2780b46d04a52a0695f663334b9ec1732f0c29a66cf6acda8a","observation_id":"d413417b-2018-4afc-b784-c10df13c43d0","resolution":{"observed_at":"2026-08-14T04:32:58.419634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-15T17:27:11.980940Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-14T04:32:58.425384Z","title":"DeepSeek-V3 Technical Report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08650","last_updated":"2026-08-09T11:46:29Z","snapshot_observed_at":"2026-08-15T18:58:43.376157Z","submitted_at":"2026-08-09T11:46:29Z","title":"The Evolution of Mixture-of-Experts Architectures in Large Language Models: Routing, Topology, Load Balancing, and Expert Parallelism","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:58.425384Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2608.08650"},"observation_digest":"sha256:58e54bad551aeb0aaf431db4a8419a063429ddbff161925b217ba923e4f67765","observation_id":"21f6a2cc-cb6e-41bf-a386-d66cf431e1e2","resolution":{"observed_at":"2026-08-14T04:32:58.425384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.15841","last_updated":"2022-11-29T00:27:08Z","snapshot_observed_at":"2026-08-14T06:23:10.369442Z","submitted_at":"2022-11-29T00:27:08Z","title":"MegaBlocks: Efficient Sparse Training with Mixture-of-Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.15841","snapshot_observed_at":"2026-08-14T04:32:58.430621Z","title":"MegaBlocks: Eﬀicient Sparse Training with Mixture-of-Experts","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.08650","last_updated":"2026-08-09T11:46:29Z","snapshot_observed_at":"2026-08-15T18:58:43.376157Z","submitted_at":"2026-08-09T11:46:29Z","title":"The Evolution of Mixture-of-Experts Architectures in Large Language Models: Routing, Topology, Load Balancing, and Expert Parallelism","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:58.430621Z"},"links":{"cited_paper":"/paper/2211.15841","citing_paper":"/paper/2608.08650"},"observation_digest":"sha256:1ac33279df8229b7f665aa58fc1716023a0eb509f2c496d3dfc3027cf1d289bf","observation_id":"5e4dd52a-1fc9-48fe-891b-a29c91793666","resolution":{"observed_at":"2026-08-14T04:32:58.430621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.03382","last_updated":"2023-06-05T15:05:24Z","snapshot_observed_at":"2026-08-13T15:28:37.815201Z","submitted_at":"2022-06-07T15:20:20Z","title":"Tutel: Adaptive Mixture-of-Experts at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.03382","snapshot_observed_at":"2026-08-14T04:32:58.435499Z","title":"Tutel: Adaptive Mixture-of-Experts at Scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.08650","last_updated":"2026-08-09T11:46:29Z","snapshot_observed_at":"2026-08-15T18:58:43.376157Z","submitted_at":"2026-08-09T11:46:29Z","title":"The Evolution of Mixture-of-Experts Architectures in Large Language Models: Routing, Topology, Load Balancing, and Expert Parallelism","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:58.435499Z"},"links":{"cited_paper":"/paper/2206.03382","citing_paper":"/paper/2608.08650"},"observation_digest":"sha256:50e9f2e2749e4f49641e51ec87c258a4db141a53d2a4b1bc89eedc86955752df","observation_id":"47e0c6d9-4338-48fe-8537-2c9497c55301","resolution":{"observed_at":"2026-08-14T04:32:58.435499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07413","last_updated":"2024-04-11T00:52:39Z","snapshot_observed_at":"2026-08-13T00:33:01.973672Z","submitted_at":"2024-04-11T00:52:39Z","title":"JetMoE: Reaching Llama2 Performance with 0.1M Dollars","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07413","snapshot_observed_at":"2026-08-14T04:32:58.441113Z","title":"JetMoE: Reaching Llama2 Performance with 0.1M Dollars","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08650","last_updated":"2026-08-09T11:46:29Z","snapshot_observed_at":"2026-08-15T18:58:43.376157Z","submitted_at":"2026-08-09T11:46:29Z","title":"The Evolution of Mixture-of-Experts Architectures in Large Language Models: Routing, Topology, Load Balancing, and Expert Parallelism","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:58.441113Z"},"links":{"cited_paper":"/paper/2404.07413","citing_paper":"/paper/2608.08650"},"observation_digest":"sha256:91ce319fd154f2255ef551c4f6782824cf01691a6b329cb4e8309e3eebe921b6","observation_id":"96585586-e007-4b53-a86a-6917574ca7c4","resolution":{"observed_at":"2026-08-14T04:32:58.441113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19887","last_updated":"2024-07-03T14:30:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-28T23:55:06Z","title":"Jamba: A Hybrid Transformer-Mamba Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19887","snapshot_observed_at":"2026-08-14T04:32:58.446447Z","title":"Jamba: A Hybrid Transformer–Mamba Language Model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08650","last_updated":"2026-08-09T11:46:29Z","snapshot_observed_at":"2026-08-15T18:58:43.376157Z","submitted_at":"2026-08-09T11:46:29Z","title":"The Evolution of Mixture-of-Experts Architectures in Large Language Models: Routing, Topology, Load Balancing, and Expert Parallelism","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:58.446447Z"},"links":{"cited_paper":"/paper/2403.19887","citing_paper":"/paper/2608.08650"},"observation_digest":"sha256:beec8dadeccf15fee9778f75a22d04b8eacb08cd9fb493339bc3b5d7e9b7ab26","observation_id":"a825bfe9-00c2-4a9d-aa07-a6cb2e9774a0","resolution":{"observed_at":"2026-08-14T04:32:58.446447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.08650","last_updated":"2026-08-09T11:46:29Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-15T18:58:43.376157Z","submitted_at":"2026-08-09T11:46:29Z","title":"The Evolution of Mixture-of-Experts Architectures in Large Language Models: Routing, Topology, Load Balancing, and Expert Parallelism"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":2,"verified_fuzzy":7},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 0 inbound Pith citation observations for arXiv:2608.08650."}