{"as_of":"2026-08-09T09:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1159c5d7a7b1e6cfb598180645e4ac082330881d38815163339a90b1ae1780c8","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":19,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":19,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":19,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":19,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:42:40.349198Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":55,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2201.05596","last_updated":"2022-07-21T18:21:36Z","snapshot_observed_at":"2026-07-06T12:27:29.223870Z","submitted_at":"2022-01-14T18:36:04Z","title":"DeepSpeed-MoE: Advancing Mixture-of-Experts Inference and Training to Power Next-Generation AI Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.05596","snapshot_observed_at":"2026-08-07T15:42:40.349198Z","title":"Preprint, arXiv:2201.05596","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.14173","last_updated":"2025-05-20T10:27:19Z","snapshot_observed_at":"2026-08-07T15:36:42.578633Z","submitted_at":"2025-05-20T10:27:19Z","title":"THOR-MoE: Hierarchical Task-Guided and Context-Responsive Routing for Neural Machine Translation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:40.349198Z"},"links":{"cited_paper":"/paper/2201.05596","citing_paper":"/paper/2505.14173"},"observation_digest":"sha256:c777fe73e64e730b3f0a2a0a2fe26630ea9796bf2a0ac232e10325c1ea0a6f97","observation_id":"4a6e3fea-d3f0-420e-8fe3-141a6ee723d2","resolution":{"observed_at":"2026-08-07T15:42:40.349198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.05596","last_updated":"2022-07-21T18:21:36Z","snapshot_observed_at":"2026-07-06T12:27:29.223870Z","submitted_at":"2022-01-14T18:36:04Z","title":"DeepSpeed-MoE: Advancing Mixture-of-Experts Inference and Training to Power Next-Generation AI Scale","version":2},"cited_work":{"arxiv_id":"2201.05596","doi":"10.48550/arxiv.2201.05596","metadata_source":"arxiv_reference","pith_arxiv_id":"2201.05596","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Keisuke Sakaguchi, Ronan Le Bras, Chandra Bhagavatula, and Yejin Choi","venue":"arXiv (Cornell University)","work_id":"5af8bbea-08f6-4519-8d7e-b7ce9c838e57","year":2022},"citing_paper":{"arxiv_id":"2506.12119","last_updated":"2026-05-17T08:18:55Z","snapshot_observed_at":"2026-08-02T23:22:23.397250Z","submitted_at":"2025-06-13T17:59:05Z","title":"Mixture-of-Experts Can Surpass Dense LLMs Under Strictly Equal Resource","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-22T00:05:08.916339Z"},"links":{"cited_paper":"/paper/2201.05596","citing_paper":"/paper/2506.12119"},"observation_digest":"sha256:fde35b4f66515b9cda6bddc5e780febd4786494e128f4d0dcb7444345990c6c5","observation_id":"f142a64e-c741-441d-9f0f-2b83526640db","resolution":{"observed_at":"2026-05-22T00:05:47.665184Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.05596","last_updated":"2022-07-21T18:21:36Z","snapshot_observed_at":"2026-07-06T12:27:29.223870Z","submitted_at":"2022-01-14T18:36:04Z","title":"DeepSpeed-MoE: Advancing Mixture-of-Experts Inference and Training to Power Next-Generation AI Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.05596","snapshot_observed_at":"2026-08-06T23:49:26.969481Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.16258","last_updated":"2025-06-19T12:17:31Z","snapshot_observed_at":"2026-08-06T23:41:53.635842Z","submitted_at":"2025-06-19T12:17:31Z","title":"ViFusion: In-Network Tensor Fusion for Scalable Video Feature Indexing","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:26.969481Z"},"links":{"cited_paper":"/paper/2201.05596","citing_paper":"/paper/2506.16258"},"observation_digest":"sha256:7094fa3d51d5c322eb09892c43a5f396be4fbbacc6bca839d72b82197ea4765b","observation_id":"eedc4595-aabf-4780-b92a-0a605933d8d6","resolution":{"observed_at":"2026-08-06T23:49:26.969481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.05596","last_updated":"2022-07-21T18:21:36Z","snapshot_observed_at":"2026-07-06T12:27:29.223870Z","submitted_at":"2022-01-14T18:36:04Z","title":"DeepSpeed-MoE: Advancing Mixture-of-Experts Inference and Training to Power Next-Generation AI Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.05596","snapshot_observed_at":"2026-08-06T21:59:51.170050Z","title":"Deepspeed-moe: Advanc- ing mixture-of-experts inference and training to power next-generation ai scale","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.22919","last_updated":"2025-07-01T09:00:34Z","snapshot_observed_at":"2026-08-09T05:54:36.256745Z","submitted_at":"2025-06-28T15:03:43Z","title":"Hecto: Modular Sparse Experts for Adaptive and Interpretable Reasoning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:51.170050Z"},"links":{"cited_paper":"/paper/2201.05596","citing_paper":"/paper/2506.22919"},"observation_digest":"sha256:164f648432d26e491113f09c514204192d13dbfdfc59f4b1496ef067b78c00fe","observation_id":"e60790ab-ee19-4e09-a1ef-42a9d02db857","resolution":{"observed_at":"2026-08-06T21:59:51.170050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.05596","last_updated":"2022-07-21T18:21:36Z","snapshot_observed_at":"2026-07-06T12:27:29.223870Z","submitted_at":"2022-01-14T18:36:04Z","title":"DeepSpeed-MoE: Advancing Mixture-of-Experts Inference and Training to Power Next-Generation AI Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.05596","snapshot_observed_at":"2026-08-06T19:48:44.601247Z","title":"DeepSpeed-MoE: Advancing Mixture-of-Experts Inference and Training to Power Next-Generation AI Scale, July 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.04575","last_updated":"2025-07-06T23:18:51Z","snapshot_observed_at":"2026-08-08T14:02:11.355763Z","submitted_at":"2025-07-06T23:18:51Z","title":"Lilith: Developmental Modular LLMs with Chemical Signaling","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T19:48:44.601247Z"},"links":{"cited_paper":"/paper/2201.05596","citing_paper":"/paper/2507.04575"},"observation_digest":"sha256:3f3ed7ed0493ddb88a6664b378c9af8b9e219d3438822c14b6f840d7e561ab99","observation_id":"1efa5c55-1c32-41a8-a2fd-f94b669458ff","resolution":{"observed_at":"2026-08-06T19:48:44.601247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.05596","last_updated":"2022-07-21T18:21:36Z","snapshot_observed_at":"2026-07-06T12:27:29.223870Z","submitted_at":"2022-01-14T18:36:04Z","title":"DeepSpeed-MoE: Advancing Mixture-of-Experts Inference and Training to Power Next-Generation AI Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.05596","snapshot_observed_at":"2026-08-05T17:03:42.700380Z","title":"https://arxiv.org/abs/2201.05596","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.17137","last_updated":"2025-08-23T20:28:32Z","snapshot_observed_at":"2026-08-09T05:24:12.653759Z","submitted_at":"2025-08-23T20:28:32Z","title":"MoE-Beyond: Learning-Based Expert Activation Prediction on Edge Devices","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-05T17:03:42.700380Z"},"links":{"cited_paper":"/paper/2201.05596","citing_paper":"/paper/2508.17137"},"observation_digest":"sha256:80f05c49ceae488274f411864e363de21c507baf3fb5aaf6e06e40b0f0b6ef5e","observation_id":"b8bfb265-4748-4fe9-9caa-a729f3db85ad","resolution":{"observed_at":"2026-08-05T17:03:42.700380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.05596","last_updated":"2022-07-21T18:21:36Z","snapshot_observed_at":"2026-07-06T12:27:29.223870Z","submitted_at":"2022-01-14T18:36:04Z","title":"DeepSpeed-MoE: Advancing Mixture-of-Experts Inference and Training to Power Next-Generation AI Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.05596","snapshot_observed_at":"2026-08-05T15:45:39.094750Z","title":"Deepspeed- moe: Advancing mixture-of-experts inference and trainingtopowernext-generationaiscale, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-08T02:10:39.123561Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:39.094750Z"},"links":{"cited_paper":"/paper/2201.05596","citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:10416bd553b2522cc27ff5f083a079f0182dbcd71b6833becec656152841325d","observation_id":"add94ac0-d2e8-450f-beb4-56798e2c52e7","resolution":{"observed_at":"2026-08-05T15:45:39.094750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.05596","last_updated":"2022-07-21T18:21:36Z","snapshot_observed_at":"2026-07-06T12:27:29.223870Z","submitted_at":"2022-01-14T18:36:04Z","title":"DeepSpeed-MoE: Advancing Mixture-of-Experts Inference and Training to Power Next-Generation AI Scale","version":2},"cited_work":{"arxiv_id":"2201.05596","doi":"10.48550/arxiv.2201.05596","metadata_source":"arxiv_reference","pith_arxiv_id":"2201.05596","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Keisuke Sakaguchi, Ronan Le Bras, Chandra Bhagavatula, and Yejin Choi","venue":"arXiv (Cornell University)","work_id":"5af8bbea-08f6-4519-8d7e-b7ce9c838e57","year":2022},"citing_paper":{"arxiv_id":"2604.07173","last_updated":"2026-04-08T15:01:04Z","snapshot_observed_at":"2026-07-06T22:55:28.855291Z","submitted_at":"2026-04-08T15:01:04Z","title":"InfiniLoRA: Disaggregated Multi-LoRA Serving for Large Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-10T17:23:40.872418Z"},"links":{"cited_paper":"/paper/2201.05596","citing_paper":"/paper/2604.07173"},"observation_digest":"sha256:64215fcd4321cbf40add0d36c915ce3f955e74565d44796359975f7545b0d2c8","observation_id":"b2da6820-2894-4665-8d46-9c877e452924","resolution":{"observed_at":"2026-05-11T06:55:59.273378Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.05596","last_updated":"2022-07-21T18:21:36Z","snapshot_observed_at":"2026-07-06T12:27:29.223870Z","submitted_at":"2022-01-14T18:36:04Z","title":"DeepSpeed-MoE: Advancing Mixture-of-Experts Inference and Training to Power Next-Generation AI Scale","version":2},"cited_work":{"arxiv_id":"2201.05596","doi":"10.48550/arxiv.2201.05596","metadata_source":"arxiv_reference","pith_arxiv_id":"2201.05596","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Keisuke Sakaguchi, Ronan Le Bras, Chandra Bhagavatula, and Yejin Choi","venue":"arXiv (Cornell University)","work_id":"5af8bbea-08f6-4519-8d7e-b7ce9c838e57","year":2022},"citing_paper":{"arxiv_id":"2604.23150","last_updated":"2026-04-25T05:33:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-25T05:33:03Z","title":"Scaling Multi-Node Mixture-of-Experts Inference Using Expert Activation Patterns","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-08T08:29:17.149710Z"},"links":{"cited_paper":"/paper/2201.05596","citing_paper":"/paper/2604.23150"},"observation_digest":"sha256:dc8efc4a0766d26bf3c46f405fca3a44e55a5a941bb0ccc1078f9bd6bda0dfea","observation_id":"d66fa626-19c4-4c42-ac0c-12dac90fa6be","resolution":{"observed_at":"2026-05-11T20:36:10.855194Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.05596","last_updated":"2022-07-21T18:21:36Z","snapshot_observed_at":"2026-07-06T12:27:29.223870Z","submitted_at":"2022-01-14T18:36:04Z","title":"DeepSpeed-MoE: Advancing Mixture-of-Experts Inference and Training to Power Next-Generation AI Scale","version":2},"cited_work":{"arxiv_id":"2201.05596","doi":"10.48550/arxiv.2201.05596","metadata_source":"arxiv_reference","pith_arxiv_id":"2201.05596","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Keisuke Sakaguchi, Ronan Le Bras, Chandra Bhagavatula, and Yejin Choi","venue":"arXiv (Cornell University)","work_id":"5af8bbea-08f6-4519-8d7e-b7ce9c838e57","year":2022},"citing_paper":{"arxiv_id":"2605.02641","last_updated":"2026-05-04T14:26:33Z","snapshot_observed_at":"2026-07-06T23:15:41.793878Z","submitted_at":"2026-05-04T14:26:33Z","title":"Mamoda2.5: Enhancing Unified Multimodal Model with DiT-MoE","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-08T18:26:58.696936Z"},"links":{"cited_paper":"/paper/2201.05596","citing_paper":"/paper/2605.02641"},"observation_digest":"sha256:e6a198cf2a777f7d35319b38950c0672b49115fcfafe8885167d06d8386840a9","observation_id":"7ad34d7a-9293-4320-8ee3-62a0b1adc42d","resolution":{"observed_at":"2026-05-08T18:28:57.552698Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.05596","last_updated":"2022-07-21T18:21:36Z","snapshot_observed_at":"2026-07-06T12:27:29.223870Z","submitted_at":"2022-01-14T18:36:04Z","title":"DeepSpeed-MoE: Advancing Mixture-of-Experts Inference and Training to Power Next-Generation AI Scale","version":2},"cited_work":{"arxiv_id":"2201.05596","doi":"10.48550/arxiv.2201.05596","metadata_source":"arxiv_reference","pith_arxiv_id":"2201.05596","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Keisuke Sakaguchi, Ronan Le Bras, Chandra Bhagavatula, and Yejin Choi","venue":"arXiv (Cornell University)","work_id":"5af8bbea-08f6-4519-8d7e-b7ce9c838e57","year":2022},"citing_paper":{"arxiv_id":"2605.05049","last_updated":"2026-05-06T15:47:14Z","snapshot_observed_at":"2026-08-02T19:55:25.393308Z","submitted_at":"2026-05-06T15:47:14Z","title":"Piper: Efficient Large-Scale MoE Training via Resource Modeling and Pipelined Hybrid Parallelism","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-08T17:04:02.418499Z"},"links":{"cited_paper":"/paper/2201.05596","citing_paper":"/paper/2605.05049"},"observation_digest":"sha256:a898997c1d59eaed45a7449041d7b4cd97ecc4ea134852a2721568a5acc9a17b","observation_id":"2b3f315d-a421-439c-9a50-5f12bf42227b","resolution":{"observed_at":"2026-05-08T17:13:38.704148Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.05596","last_updated":"2022-07-21T18:21:36Z","snapshot_observed_at":"2026-07-06T12:27:29.223870Z","submitted_at":"2022-01-14T18:36:04Z","title":"DeepSpeed-MoE: Advancing Mixture-of-Experts Inference and Training to Power Next-Generation AI Scale","version":2},"cited_work":{"arxiv_id":"2201.05596","doi":"10.48550/arxiv.2201.05596","metadata_source":"arxiv_reference","pith_arxiv_id":"2201.05596","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Keisuke Sakaguchi, Ronan Le Bras, Chandra Bhagavatula, and Yejin Choi","venue":"arXiv (Cornell University)","work_id":"5af8bbea-08f6-4519-8d7e-b7ce9c838e57","year":2022},"citing_paper":{"arxiv_id":"2605.06665","last_updated":"2026-05-07T17:59:44Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-05-07T17:59:44Z","title":"UniPool: A Globally Shared Expert Pool for Mixture-of-Experts","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-08T11:56:21.623709Z"},"links":{"cited_paper":"/paper/2201.05596","citing_paper":"/paper/2605.06665"},"observation_digest":"sha256:10f343dc5310e08933629b2a6fbe4d3ac9e9cccf0cde249bbc34566bed2cc253","observation_id":"107b3812-4841-44d2-82cf-c27f45b52dcc","resolution":{"observed_at":"2026-05-11T19:26:09.286609Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.05596","last_updated":"2022-07-21T18:21:36Z","snapshot_observed_at":"2026-07-06T12:27:29.223870Z","submitted_at":"2022-01-14T18:36:04Z","title":"DeepSpeed-MoE: Advancing Mixture-of-Experts Inference and Training to Power Next-Generation AI Scale","version":2},"cited_work":{"arxiv_id":"2201.05596","doi":"10.48550/arxiv.2201.05596","metadata_source":"arxiv_reference","pith_arxiv_id":"2201.05596","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Keisuke Sakaguchi, Ronan Le Bras, Chandra Bhagavatula, and Yejin Choi","venue":"arXiv (Cornell University)","work_id":"5af8bbea-08f6-4519-8d7e-b7ce9c838e57","year":2022},"citing_paper":{"arxiv_id":"2605.08962","last_updated":"2026-05-09T13:59:27Z","snapshot_observed_at":"2026-07-06T23:21:06.773761Z","submitted_at":"2026-05-09T13:59:27Z","title":"MegaScale-Omni: A Hyper-Scale, Workload-Resilient System for MultiModal LLM Training in Production","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-12T02:04:07.344134Z"},"links":{"cited_paper":"/paper/2201.05596","citing_paper":"/paper/2605.08962"},"observation_digest":"sha256:a3d9f72d282327acff2148cdfca8f136a72ea9468e6184e2deee0386dcac956b","observation_id":"d0eb442a-f1cf-44d7-805a-660f5595b62f","resolution":{"observed_at":"2026-05-12T02:06:15.015003Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.05596","last_updated":"2022-07-21T18:21:36Z","snapshot_observed_at":"2026-07-06T12:27:29.223870Z","submitted_at":"2022-01-14T18:36:04Z","title":"DeepSpeed-MoE: Advancing Mixture-of-Experts Inference and Training to Power Next-Generation AI Scale","version":2},"cited_work":{"arxiv_id":"2201.05596","doi":"10.48550/arxiv.2201.05596","metadata_source":"arxiv_reference","pith_arxiv_id":"2201.05596","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Keisuke Sakaguchi, Ronan Le Bras, Chandra Bhagavatula, and Yejin Choi","venue":"arXiv (Cornell University)","work_id":"5af8bbea-08f6-4519-8d7e-b7ce9c838e57","year":2022},"citing_paper":{"arxiv_id":"2605.10670","last_updated":"2026-05-11T14:53:00Z","snapshot_observed_at":"2026-07-06T23:22:37.355450Z","submitted_at":"2026-05-11T14:53:00Z","title":"Surviving Partial Rank Failures in Wide Expert-Parallel MoE Inference","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-12T04:30:58.729425Z"},"links":{"cited_paper":"/paper/2201.05596","citing_paper":"/paper/2605.10670"},"observation_digest":"sha256:ea27cf6e98340a0caf882c05871c974e8aff6d29883001463182724d9e7a413a","observation_id":"a1849866-3667-4f10-885c-d955ce1e7070","resolution":{"observed_at":"2026-05-12T06:11:24.719889Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.05596","last_updated":"2022-07-21T18:21:36Z","snapshot_observed_at":"2026-07-06T12:27:29.223870Z","submitted_at":"2022-01-14T18:36:04Z","title":"DeepSpeed-MoE: Advancing Mixture-of-Experts Inference and Training to Power Next-Generation AI Scale","version":2},"cited_work":{"arxiv_id":"2201.05596","doi":"10.48550/arxiv.2201.05596","metadata_source":"arxiv_reference","pith_arxiv_id":"2201.05596","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Keisuke Sakaguchi, Ronan Le Bras, Chandra Bhagavatula, and Yejin Choi","venue":"arXiv (Cornell University)","work_id":"5af8bbea-08f6-4519-8d7e-b7ce9c838e57","year":2022},"citing_paper":{"arxiv_id":"2605.20179","last_updated":"2026-05-19T17:59:08Z","snapshot_observed_at":"2026-08-06T13:50:23.608176Z","submitted_at":"2026-05-19T17:59:08Z","title":"TIDE: Efficient and Lossless MoE Diffusion LLM Inference with I/O-aware Expert Offload","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-20T05:08:07.318040Z"},"links":{"cited_paper":"/paper/2201.05596","citing_paper":"/paper/2605.20179"},"observation_digest":"sha256:2d6a34396b1d942fb41a6702d5aeb732d24cc84bbfadd2b7582505bd5b2edaa9","observation_id":"9e642b10-4d14-4661-9f30-87781363a849","resolution":{"observed_at":"2026-05-20T05:13:03.707662Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.05596","last_updated":"2022-07-21T18:21:36Z","snapshot_observed_at":"2026-07-06T12:27:29.223870Z","submitted_at":"2022-01-14T18:36:04Z","title":"DeepSpeed-MoE: Advancing Mixture-of-Experts Inference and Training to Power Next-Generation AI Scale","version":2},"cited_work":{"arxiv_id":"2201.05596","doi":"10.48550/arxiv.2201.05596","metadata_source":"arxiv_reference","pith_arxiv_id":"2201.05596","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Keisuke Sakaguchi, Ronan Le Bras, Chandra Bhagavatula, and Yejin Choi","venue":"arXiv (Cornell University)","work_id":"5af8bbea-08f6-4519-8d7e-b7ce9c838e57","year":2022},"citing_paper":{"arxiv_id":"2606.00275","last_updated":"2026-05-29T19:08:20Z","snapshot_observed_at":"2026-08-08T17:56:30.968996Z","submitted_at":"2026-05-29T19:08:20Z","title":"Hyperbolic and Evidence-Prioritized Experts for Large Vision-Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-28T22:43:33.929871Z"},"links":{"cited_paper":"/paper/2201.05596","citing_paper":"/paper/2606.00275"},"observation_digest":"sha256:5bf79ea4ce5310d0ec625f6262924511bf081adb115e527c17b52cfc0e1f4e8b","observation_id":"3015ac02-6974-4910-8eef-975fc1f85fd0","resolution":{"observed_at":"2026-07-01T19:26:00.064149Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.05596","last_updated":"2022-07-21T18:21:36Z","snapshot_observed_at":"2026-07-06T12:27:29.223870Z","submitted_at":"2022-01-14T18:36:04Z","title":"DeepSpeed-MoE: Advancing Mixture-of-Experts Inference and Training to Power Next-Generation AI Scale","version":2},"cited_work":{"arxiv_id":"2201.05596","doi":"10.48550/arxiv.2201.05596","metadata_source":"arxiv_reference","pith_arxiv_id":"2201.05596","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Keisuke Sakaguchi, Ronan Le Bras, Chandra Bhagavatula, and Yejin Choi","venue":"arXiv (Cornell University)","work_id":"5af8bbea-08f6-4519-8d7e-b7ce9c838e57","year":2022},"citing_paper":{"arxiv_id":"2606.07019","last_updated":"2026-06-05T08:08:56Z","snapshot_observed_at":"2026-08-08T08:16:25.631459Z","submitted_at":"2026-06-05T08:08:56Z","title":"PCCL: Process Group-Aware Scalable and Generic Collective Algorithm Synthesizer","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-27T21:08:19.410192Z"},"links":{"cited_paper":"/paper/2201.05596","citing_paper":"/paper/2606.07019"},"observation_digest":"sha256:c382d04bc429de64fc3f31d83e3708c94e834d2711c35bad8f49fbc96d49371c","observation_id":"96cb56dc-3ea7-4769-a6d4-f553726eeb32","resolution":{"observed_at":"2026-07-02T19:57:20.216865Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.05596","last_updated":"2022-07-21T18:21:36Z","snapshot_observed_at":"2026-07-06T12:27:29.223870Z","submitted_at":"2022-01-14T18:36:04Z","title":"DeepSpeed-MoE: Advancing Mixture-of-Experts Inference and Training to Power Next-Generation AI Scale","version":2},"cited_work":{"arxiv_id":"2201.05596","doi":"10.48550/arxiv.2201.05596","metadata_source":"arxiv_reference","pith_arxiv_id":"2201.05596","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Keisuke Sakaguchi, Ronan Le Bras, Chandra Bhagavatula, and Yejin Choi","venue":"arXiv (Cornell University)","work_id":"5af8bbea-08f6-4519-8d7e-b7ce9c838e57","year":2022},"citing_paper":{"arxiv_id":"2607.01789","last_updated":"2026-07-02T07:02:44Z","snapshot_observed_at":"2026-08-03T13:49:07.156761Z","submitted_at":"2026-07-02T07:02:44Z","title":"EPnG: Adaptive Expert Prune-and-Grow for Parameter-Efficient MoE Fine-tuning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-03T17:25:19.699552Z"},"links":{"cited_paper":"/paper/2201.05596","citing_paper":"/paper/2607.01789"},"observation_digest":"sha256:b2bd2252c1868bf26958441460e445f785874b46cb4a410593bf6d8fb6dda01e","observation_id":"bde65f2a-46c9-434d-b8be-446d7b679644","resolution":{"observed_at":"2026-07-03T17:28:44.017643Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.05596","last_updated":"2022-07-21T18:21:36Z","snapshot_observed_at":"2026-07-06T12:27:29.223870Z","submitted_at":"2022-01-14T18:36:04Z","title":"DeepSpeed-MoE: Advancing Mixture-of-Experts Inference and Training to Power Next-Generation AI Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.05596","snapshot_observed_at":"2026-07-11T08:35:22.347459Z","title":"Deepspeed-moe: Advancing mixture-of-experts inference and training to power next-generation ai scale,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.05116","last_updated":"2026-07-06T14:06:25Z","snapshot_observed_at":"2026-08-02T18:01:37.878392Z","submitted_at":"2026-07-06T14:06:25Z","title":"Communication-Aware Placement and Pruning for Efficient Mixture-of-Experts Inference","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-11T08:35:22.347459Z"},"links":{"cited_paper":"/paper/2201.05596","citing_paper":"/paper/2607.05116"},"observation_digest":"sha256:66cfea56ca269f650533a5587e09c24f3d4f899adf9a40a589b7a6ed7c6b8962","observation_id":"77eefc14-4106-4b35-b2b6-885d49af2fd6","resolution":{"observed_at":"2026-07-11T08:35:22.347459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2201.05596/citation-record","integrity":"/paper/2201.05596/integrity","json":"/paper/2201.05596/citation-record.json","paper":"/paper/2201.05596"},"outbound":[],"paper":{"arxiv_id":"2201.05596","last_updated":"2022-07-21T18:21:36Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T12:27:29.223870Z","submitted_at":"2022-01-14T18:36:04Z","title":"DeepSpeed-MoE: Advancing Mixture-of-Experts Inference and Training to Power Next-Generation AI Scale"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 19 inbound Pith citation observations for arXiv:2201.05596."}