{"as_of":"2026-08-10T05:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f598bf89ed1f367e2409dcf2d2dcb9dac8a526d89df23ed1f31a04212ea14916","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:15:28.228455Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.22175/citation-record","integrity":"/paper/2506.22175/integrity","json":"/paper/2506.22175/citation-record.json","paper":"/paper/2506.22175"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:32.690500Z","title":"On the optimization of deep networks: Implicit acceleration by overparameterization,","venue":null,"work_id":"e379cc7b-d98d-4087-b45e-16ef734ddd8e","year":2018},"citing_paper":{"arxiv_id":"2506.22175","last_updated":"2025-06-27T12:41:53Z","snapshot_observed_at":"2026-08-06T22:07:13.608902Z","submitted_at":"2025-06-27T12:41:53Z","title":"MPipeMoE: Memory Efficient MoE for Pre-trained Models with Adaptive Pipeline Parallelism","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:25.501953Z"},"links":{"citing_paper":"/paper/2506.22175"},"observation_digest":"sha256:76bb26781771331eb4caa7ea9d0a430051a9524cf3bc7b2b8f9aea9381e44df3","observation_id":"80e302e1-70b3-48e4-9fb2-efa3d16c2011","resolution":{"observed_at":"2026-08-06T22:15:32.788377Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:32.441884Z","title":"Exploring the limits of weakly supervised pretraining,","venue":null,"work_id":"beea2488-f498-4ec5-9140-521bfa710a3c","year":2018},"citing_paper":{"arxiv_id":"2506.22175","last_updated":"2025-06-27T12:41:53Z","snapshot_observed_at":"2026-08-06T22:07:13.608902Z","submitted_at":"2025-06-27T12:41:53Z","title":"MPipeMoE: Memory Efficient MoE for Pre-trained Models with Adaptive Pipeline Parallelism","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:25.611239Z"},"links":{"citing_paper":"/paper/2506.22175"},"observation_digest":"sha256:fb30613a6affceef980c3a2388251095843cd9ce23fac33364816092f7076afd","observation_id":"da7e2b1f-e19f-4471-8b74-013bcc6e3fac","resolution":{"observed_at":"2026-08-06T22:15:32.565005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:32.226499Z","title":"Antman: Dynamic scaling on gpu clusters for deep learning,","venue":null,"work_id":"79a1f7b9-4429-4fa5-8298-fadd1b7bfff9","year":2020},"citing_paper":{"arxiv_id":"2506.22175","last_updated":"2025-06-27T12:41:53Z","snapshot_observed_at":"2026-08-06T22:07:13.608902Z","submitted_at":"2025-06-27T12:41:53Z","title":"MPipeMoE: Memory Efficient MoE for Pre-trained Models with Adaptive Pipeline Parallelism","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:25.755050Z"},"links":{"citing_paper":"/paper/2506.22175"},"observation_digest":"sha256:e346ad4da41344b9f92430ea9392a037a1f72cbb67c6a15d320fccde88092612","observation_id":"c0832550-adb5-4c73-999e-1b1107862a00","resolution":{"observed_at":"2026-08-06T22:15:32.311875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:32.017472Z","title":"Whale: Efficient giant model training over heterogeneous gpus,","venue":null,"work_id":"180c00ac-949b-412e-ae79-577357f29e0b","year":2022},"citing_paper":{"arxiv_id":"2506.22175","last_updated":"2025-06-27T12:41:53Z","snapshot_observed_at":"2026-08-06T22:07:13.608902Z","submitted_at":"2025-06-27T12:41:53Z","title":"MPipeMoE: Memory Efficient MoE for Pre-trained Models with Adaptive Pipeline Parallelism","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:25.901684Z"},"links":{"citing_paper":"/paper/2506.22175"},"observation_digest":"sha256:e401d17387f49fbb880fbd850f3c49f78630a8457a12e2397339525fef01b706","observation_id":"b4e4428f-2f87-4a99-a327-3399924419b9","resolution":{"observed_at":"2026-08-06T22:15:32.114853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:31.729947Z","title":"Axonn: An asynchronous, message-driven parallel framework for extreme-scale deep learning,","venue":null,"work_id":"09c12d9b-80b2-4c81-991f-271a87d69765","year":2022},"citing_paper":{"arxiv_id":"2506.22175","last_updated":"2025-06-27T12:41:53Z","snapshot_observed_at":"2026-08-06T22:07:13.608902Z","submitted_at":"2025-06-27T12:41:53Z","title":"MPipeMoE: Memory Efficient MoE for Pre-trained Models with Adaptive Pipeline Parallelism","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:26.037612Z"},"links":{"citing_paper":"/paper/2506.22175"},"observation_digest":"sha256:1c5a702a597697dcfc7bff930bff0d3a5fc2d52e36b9633d047ba42521ea453e","observation_id":"4a45c5aa-fed0-4ad2-903a-aa8ea74b4ac7","resolution":{"observed_at":"2026-08-06T22:15:31.870218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:31.612514Z","title":"An efficient and non-intrusive gpu schedul- ing framework for deep learning training systems,","venue":null,"work_id":"c873d53a-1b10-4ac3-b55c-d747bfbfcfd2","year":2020},"citing_paper":{"arxiv_id":"2506.22175","last_updated":"2025-06-27T12:41:53Z","snapshot_observed_at":"2026-08-06T22:07:13.608902Z","submitted_at":"2025-06-27T12:41:53Z","title":"MPipeMoE: Memory Efficient MoE for Pre-trained Models with Adaptive Pipeline Parallelism","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:26.141093Z"},"links":{"citing_paper":"/paper/2506.22175"},"observation_digest":"sha256:5870a0d6ac3b9650158caefc27cfb154008506788bdd2df85672b0d18927e5b7","observation_id":"202fd7a0-346f-4d78-b43d-6d7a2e0321a8","resolution":{"observed_at":"2026-08-06T22:15:31.651693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:31.437211Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding,","venue":null,"work_id":"2e6db439-d90d-494e-bdbe-ce1a95f98604","year":2019},"citing_paper":{"arxiv_id":"2506.22175","last_updated":"2025-06-27T12:41:53Z","snapshot_observed_at":"2026-08-06T22:07:13.608902Z","submitted_at":"2025-06-27T12:41:53Z","title":"MPipeMoE: Memory Efficient MoE for Pre-trained Models with Adaptive Pipeline Parallelism","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:26.269023Z"},"links":{"citing_paper":"/paper/2506.22175"},"observation_digest":"sha256:4b8ac8ccf17b7bf061e079371f246f3e782008b2cec1c1d3b91da0db9e7b886a","observation_id":"f4fe10b9-0f1b-4450-9e60-b23b2571da6f","resolution":{"observed_at":"2026-08-06T22:15:31.543830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-07-31T22:31:37.910868Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-06T22:15:26.398427Z","title":"Roberta: A robustly optimized bert pretraining approach,","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2506.22175","last_updated":"2025-06-27T12:41:53Z","snapshot_observed_at":"2026-08-06T22:07:13.608902Z","submitted_at":"2025-06-27T12:41:53Z","title":"MPipeMoE: Memory Efficient MoE for Pre-trained Models with Adaptive Pipeline Parallelism","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:26.398427Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2506.22175"},"observation_digest":"sha256:8d6a4896d81860ea091371b6d47dcb4d2b03c0aaf2bb95d2402a7d74b55adda5","observation_id":"ace6e3a0-ef11-45f4-a95e-78859d2aefd2","resolution":{"observed_at":"2026-08-06T22:15:26.398427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:31.293550Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":"29a70c3b-c078-4269-b1aa-c18a3dbfd02a","year":2020},"citing_paper":{"arxiv_id":"2506.22175","last_updated":"2025-06-27T12:41:53Z","snapshot_observed_at":"2026-08-06T22:07:13.608902Z","submitted_at":"2025-06-27T12:41:53Z","title":"MPipeMoE: Memory Efficient MoE for Pre-trained Models with Adaptive Pipeline Parallelism","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:26.502541Z"},"links":{"citing_paper":"/paper/2506.22175"},"observation_digest":"sha256:3d784c2dabb5c6f929202ae51c622f8387b4aef2ba0e31a7b9fffc7f218e79d4","observation_id":"5ea1faec-ca1e-4b18-8d4d-900f39b7ebea","resolution":{"observed_at":"2026-08-06T22:15:31.337050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:26.600395Z","title":"Language mod- els are few-shot learners,","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2506.22175","last_updated":"2025-06-27T12:41:53Z","snapshot_observed_at":"2026-08-06T22:07:13.608902Z","submitted_at":"2025-06-27T12:41:53Z","title":"MPipeMoE: Memory Efficient MoE for Pre-trained Models with Adaptive Pipeline Parallelism","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:26.600395Z"},"links":{"citing_paper":"/paper/2506.22175"},"observation_digest":"sha256:f1dd29b514b8fcd9ad57d05350cdac082c0675e3bf2416feb53fa0f842e1eb66","observation_id":"c0368665-aa1a-4d71-a103-10d3923d409e","resolution":{"observed_at":"2026-08-06T22:15:26.600395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.07837","last_updated":"2022-04-24T12:51:35Z","snapshot_observed_at":"2026-07-06T13:00:57.257337Z","submitted_at":"2022-04-16T16:19:47Z","title":"BLISS: Robust Sequence-to-Sequence Learning via Self-Supervised Input Representation","version":2},"cited_work":{"arxiv_id":"2204.07837","doi":null,"metadata_source":"pith","pith_arxiv_id":"2204.07837","snapshot_observed_at":"2026-08-06T22:15:28.611786Z","title":"BLISS: Robust Sequence-to-Sequence Learning via Self-Supervised Input Representation","venue":"cs.CL","work_id":"bf7130e3-d3aa-4671-8a38-fb32f5dfd2b6","year":2022},"citing_paper":{"arxiv_id":"2506.22175","last_updated":"2025-06-27T12:41:53Z","snapshot_observed_at":"2026-08-06T22:07:13.608902Z","submitted_at":"2025-06-27T12:41:53Z","title":"MPipeMoE: Memory Efficient MoE for Pre-trained Models with Adaptive Pipeline Parallelism","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:26.715460Z"},"links":{"cited_paper":"/paper/2204.07837","citing_paper":"/paper/2506.22175"},"observation_digest":"sha256:49db3e042080abb4b9b29d4c408e4a7cc576311630cf3baee94f662f2f2179c4","observation_id":"9e9724b0-cf24-495c-a834-667601713bd7","resolution":{"observed_at":"2026-08-06T22:15:28.679030Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.14912","last_updated":"2024-01-09T09:44:10Z","snapshot_observed_at":"2026-07-06T13:15:17.438229Z","submitted_at":"2022-05-30T08:25:36Z","title":"E2S2: Encoding-Enhanced Sequence-to-Sequence Pretraining for Language Understanding and Generation","version":3},"cited_work":{"arxiv_id":"2205.14912","doi":null,"metadata_source":"pith","pith_arxiv_id":"2205.14912","snapshot_observed_at":"2026-08-06T22:15:28.478666Z","title":"E2S2: Encoding-Enhanced Sequence-to-Sequence Pretraining for Language Understanding and Generation","venue":"cs.CL","work_id":"f098466c-9b72-4137-852a-85f262bea1e2","year":2022},"citing_paper":{"arxiv_id":"2506.22175","last_updated":"2025-06-27T12:41:53Z","snapshot_observed_at":"2026-08-06T22:07:13.608902Z","submitted_at":"2025-06-27T12:41:53Z","title":"MPipeMoE: Memory Efficient MoE for Pre-trained Models with Adaptive Pipeline Parallelism","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:26.817024Z"},"links":{"cited_paper":"/paper/2205.14912","citing_paper":"/paper/2506.22175"},"observation_digest":"sha256:6ae36af148fc29076f64e4703dcef14e0661edf1071563467c1ee355f08d78cd","observation_id":"9129e399-e0bb-4626-8d95-36dbff9f54fe","resolution":{"observed_at":"2026-08-06T22:15:28.537261Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:31.108581Z","title":"Unsu- pervised cross-lingual representation learning at scale,","venue":null,"work_id":"05833904-d690-43e1-953e-2e4430af2ad8","year":2020},"citing_paper":{"arxiv_id":"2506.22175","last_updated":"2025-06-27T12:41:53Z","snapshot_observed_at":"2026-08-06T22:07:13.608902Z","submitted_at":"2025-06-27T12:41:53Z","title":"MPipeMoE: Memory Efficient MoE for Pre-trained Models with Adaptive Pipeline Parallelism","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:26.871985Z"},"links":{"citing_paper":"/paper/2506.22175"},"observation_digest":"sha256:453179e907e400cc851e08d5fad7e28f2b14c63f0f0f9796c38f37ecec5ab3fc","observation_id":"a588efc2-b4fd-4dd4-8bdc-8dc75e06d433","resolution":{"observed_at":"2026-08-06T22:15:31.199126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.01853","last_updated":"2022-12-04T15:36:18Z","snapshot_observed_at":"2026-08-08T01:58:19.747610Z","submitted_at":"2022-12-04T15:36:18Z","title":"Toward Efficient Language Model Pretraining and Downstream Adaptation via Self-Evolution: A Case Study on SuperGLUE","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.01853","snapshot_observed_at":"2026-08-06T22:15:26.922616Z","title":"Toward efficient language model pretraining and downstream adaptation via self-evolution: A case study on superglue,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.22175","last_updated":"2025-06-27T12:41:53Z","snapshot_observed_at":"2026-08-06T22:07:13.608902Z","submitted_at":"2025-06-27T12:41:53Z","title":"MPipeMoE: Memory Efficient MoE for Pre-trained Models with Adaptive Pipeline Parallelism","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:26.922616Z"},"links":{"cited_paper":"/paper/2212.01853","citing_paper":"/paper/2506.22175"},"observation_digest":"sha256:4879dd54d1ef573ca4e174aeaaaf2535911514479c9ddc4513655c94acbd5dbb","observation_id":"c51cf98b-e571-425f-bbf9-cb073dfb0325","resolution":{"observed_at":"2026-08-06T22:15:26.922616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1701.06538","last_updated":"2017-01-23T18:10:00Z","snapshot_observed_at":"2026-07-06T05:27:13.416519Z","submitted_at":"2017-01-23T18:10:00Z","title":"Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1701.06538","snapshot_observed_at":"2026-08-06T22:15:26.970238Z","title":"Outrageously large neural networks: The sparsely-gated mixture-of-experts layer,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.22175","last_updated":"2025-06-27T12:41:53Z","snapshot_observed_at":"2026-08-06T22:07:13.608902Z","submitted_at":"2025-06-27T12:41:53Z","title":"MPipeMoE: Memory Efficient MoE for Pre-trained Models with Adaptive Pipeline Parallelism","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:26.970238Z"},"links":{"cited_paper":"/paper/1701.06538","citing_paper":"/paper/2506.22175"},"observation_digest":"sha256:de397c69606d012dbc905d78271f2f5fe4d9118d015368b3f948715c2c0037d5","observation_id":"45b1a33d-616a-487a-bccb-fb8ccd773284","resolution":{"observed_at":"2026-08-06T22:15:26.970238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16668","last_updated":"2020-06-30T10:42:02Z","snapshot_observed_at":"2026-08-07T09:27:36.420559Z","submitted_at":"2020-06-30T10:42:02Z","title":"GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.16668","snapshot_observed_at":"2026-08-06T22:15:27.043950Z","title":"Gshard: Scaling giant models with conditional computation and automatic sharding,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2506.22175","last_updated":"2025-06-27T12:41:53Z","snapshot_observed_at":"2026-08-06T22:07:13.608902Z","submitted_at":"2025-06-27T12:41:53Z","title":"MPipeMoE: Memory Efficient MoE for Pre-trained Models with Adaptive Pipeline Parallelism","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:27.043950Z"},"links":{"cited_paper":"/paper/2006.16668","citing_paper":"/paper/2506.22175"},"observation_digest":"sha256:9d6c9ea6e5e1556783e587bbdf7be585137681b4a2ef3b88c58260b56ab2b651","observation_id":"1e365e47-038f-4936-851c-975894fcde0d","resolution":{"observed_at":"2026-08-06T22:15:27.043950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:30.850879Z","title":"Switch transformers: Scaling to trillion parameter models with simple and efficient sparsity,","venue":null,"work_id":"7f6469cb-7e9f-463c-8847-7fa84f7aefee","year":2021},"citing_paper":{"arxiv_id":"2506.22175","last_updated":"2025-06-27T12:41:53Z","snapshot_observed_at":"2026-08-06T22:07:13.608902Z","submitted_at":"2025-06-27T12:41:53Z","title":"MPipeMoE: Memory Efficient MoE for Pre-trained Models with Adaptive Pipeline Parallelism","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:27.110599Z"},"links":{"citing_paper":"/paper/2506.22175"},"observation_digest":"sha256:bcc4b9a0ae117701ed11645b0e75104152855ecf54f4670f449006c8adebd266","observation_id":"25121131-c2c5-4c52-98d2-7cfd717c1894","resolution":{"observed_at":"2026-08-06T22:15:30.997680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05528","last_updated":"2023-05-31T09:27:56Z","snapshot_observed_at":"2026-07-06T14:16:40.674342Z","submitted_at":"2022-11-10T12:42:43Z","title":"PAD-Net: An Efficient Framework for Dynamic Networks","version":4},"cited_work":{"arxiv_id":"2211.05528","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.05528","snapshot_observed_at":"2026-08-06T22:15:28.360067Z","title":"PAD-Net: An Efficient Framework for Dynamic Networks","venue":"cs.LG","work_id":"187efe54-9ca7-452a-8933-7f8e8bc4b80a","year":2022},"citing_paper":{"arxiv_id":"2506.22175","last_updated":"2025-06-27T12:41:53Z","snapshot_observed_at":"2026-08-06T22:07:13.608902Z","submitted_at":"2025-06-27T12:41:53Z","title":"MPipeMoE: Memory Efficient MoE for Pre-trained Models with Adaptive Pipeline Parallelism","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:27.198838Z"},"links":{"cited_paper":"/paper/2211.05528","citing_paper":"/paper/2506.22175"},"observation_digest":"sha256:7fb738d97de5d6257c3fd090135a578c3dd7381bc2cf297a50cac3cf9a8d279e","observation_id":"52d7527b-358b-4360-af2c-cbe2b11d13a6","resolution":{"observed_at":"2026-08-06T22:15:28.401357Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:30.618509Z","title":"Base layers: Simplifying training of large, sparse models,","venue":null,"work_id":"e42d5bc6-9cf4-42ad-9f7b-ffc666f0b847","year":2021},"citing_paper":{"arxiv_id":"2506.22175","last_updated":"2025-06-27T12:41:53Z","snapshot_observed_at":"2026-08-06T22:07:13.608902Z","submitted_at":"2025-06-27T12:41:53Z","title":"MPipeMoE: Memory Efficient MoE for Pre-trained Models with Adaptive Pipeline Parallelism","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:27.260718Z"},"links":{"citing_paper":"/paper/2506.22175"},"observation_digest":"sha256:d746e64da095f535df7524dc2f5d6c01a5343728beeb32fb45f54138f612da92","observation_id":"d1ab2883-4be9-4ebd-8bcc-18f2bfd914b5","resolution":{"observed_at":"2026-08-06T22:15:30.739187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:30.379291Z","title":"Gating dropout: Communication-efficient regularization for sparsely activated transform- ers,","venue":null,"work_id":"92ff99a6-4add-45c7-a3bc-40ac22a7c754","year":2022},"citing_paper":{"arxiv_id":"2506.22175","last_updated":"2025-06-27T12:41:53Z","snapshot_observed_at":"2026-08-06T22:07:13.608902Z","submitted_at":"2025-06-27T12:41:53Z","title":"MPipeMoE: Memory Efficient MoE for Pre-trained Models with Adaptive Pipeline Parallelism","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:27.323226Z"},"links":{"citing_paper":"/paper/2506.22175"},"observation_digest":"sha256:d64d54ae5c756aa171e98e4694aceb48f29258517b73f98e28aeaa96c6a3de0d","observation_id":"81121fdc-711e-4918-8173-af010a61e654","resolution":{"observed_at":"2026-08-06T22:15:30.504450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:30.130248Z","title":"Deepspeed-moe: Advancing mixture-of-experts inference and training to power next-generation AI scale,","venue":null,"work_id":"5ec32c16-7920-41ef-aabe-4e66ed46099b","year":2022},"citing_paper":{"arxiv_id":"2506.22175","last_updated":"2025-06-27T12:41:53Z","snapshot_observed_at":"2026-08-06T22:07:13.608902Z","submitted_at":"2025-06-27T12:41:53Z","title":"MPipeMoE: Memory Efficient MoE for Pre-trained Models with Adaptive Pipeline Parallelism","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:27.397140Z"},"links":{"citing_paper":"/paper/2506.22175"},"observation_digest":"sha256:43cab4f5f6d47e90e669e86c7136016fe082dbd3e3656914a450f0d152f098e1","observation_id":"f5762c01-f99e-42bd-903b-cb895bac91df","resolution":{"observed_at":"2026-08-06T22:15:30.256375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:29.921414Z","title":"Fastermoe: modeling and optimizing training of large-scale dynamic pre-trained models,","venue":null,"work_id":"b2338310-f0b2-4664-83b3-58a84724d837","year":2022},"citing_paper":{"arxiv_id":"2506.22175","last_updated":"2025-06-27T12:41:53Z","snapshot_observed_at":"2026-08-06T22:07:13.608902Z","submitted_at":"2025-06-27T12:41:53Z","title":"MPipeMoE: Memory Efficient MoE for Pre-trained Models with Adaptive Pipeline Parallelism","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:27.451658Z"},"links":{"citing_paper":"/paper/2506.22175"},"observation_digest":"sha256:00f0ef66c91641e31b6fbdfdfd31780ed36007c9ea0aa2c85ca87338e6ed21f6","observation_id":"10ad3246-ce10-4f75-8cf0-b201c7eae5b4","resolution":{"observed_at":"2026-08-06T22:15:30.040462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:29.711776Z","title":"Scalable distributed dl training: Batching communication and computation,","venue":null,"work_id":"452c7e46-0d38-41b1-8499-56da71fd3c05","year":2019},"citing_paper":{"arxiv_id":"2506.22175","last_updated":"2025-06-27T12:41:53Z","snapshot_observed_at":"2026-08-06T22:07:13.608902Z","submitted_at":"2025-06-27T12:41:53Z","title":"MPipeMoE: Memory Efficient MoE for Pre-trained Models with Adaptive Pipeline Parallelism","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:27.495731Z"},"links":{"citing_paper":"/paper/2506.22175"},"observation_digest":"sha256:0199e0f81c1eb2e076b292abafea6ba15e619696bec4b027583f9daa4c451beb","observation_id":"da501c63-0f1f-4977-a420-cf8acc594f93","resolution":{"observed_at":"2026-08-06T22:15:29.822345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:29.405587Z","title":"Zero: Memory optimizations toward training trillion parameter models,","venue":null,"work_id":"4b8dce19-0c00-47ec-ac6d-317a3429a413","year":2020},"citing_paper":{"arxiv_id":"2506.22175","last_updated":"2025-06-27T12:41:53Z","snapshot_observed_at":"2026-08-06T22:07:13.608902Z","submitted_at":"2025-06-27T12:41:53Z","title":"MPipeMoE: Memory Efficient MoE for Pre-trained Models with Adaptive Pipeline Parallelism","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:27.557041Z"},"links":{"citing_paper":"/paper/2506.22175"},"observation_digest":"sha256:297b669d0b3b8bc5657ee4f997e0cc302971b06b770b0828306a97bcbc9dd4eb","observation_id":"77bc7860-4971-447f-867d-c7965f20e622","resolution":{"observed_at":"2026-08-06T22:15:29.593956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10465","last_updated":"2021-09-22T00:57:46Z","snapshot_observed_at":"2026-07-06T11:50:05.714539Z","submitted_at":"2021-09-22T00:57:46Z","title":"Scalable and Efficient MoE Training for Multitask Multilingual Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.10465","snapshot_observed_at":"2026-08-06T22:15:27.618354Z","title":"Scalable and effi- cient moe training for multitask multilingual models,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.22175","last_updated":"2025-06-27T12:41:53Z","snapshot_observed_at":"2026-08-06T22:07:13.608902Z","submitted_at":"2025-06-27T12:41:53Z","title":"MPipeMoE: Memory Efficient MoE for Pre-trained Models with Adaptive Pipeline Parallelism","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:27.618354Z"},"links":{"cited_paper":"/paper/2109.10465","citing_paper":"/paper/2506.22175"},"observation_digest":"sha256:448ff7dc36d522bbc714cb05120f1ee97727d8317f2f2a954a806779f211f5d4","observation_id":"89d2c24a-c7ce-4c6e-b494-0c6e08c1f0db","resolution":{"observed_at":"2026-08-06T22:15:27.618354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1604.06174","last_updated":"2016-04-22T19:21:36Z","snapshot_observed_at":"2026-08-08T09:03:25.135475Z","submitted_at":"2016-04-21T04:15:27Z","title":"Training Deep Nets with Sublinear Memory Cost","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1604.06174","snapshot_observed_at":"2026-08-06T22:15:27.666690Z","title":"Training deep nets with sublinear memory cost,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.22175","last_updated":"2025-06-27T12:41:53Z","snapshot_observed_at":"2026-08-06T22:07:13.608902Z","submitted_at":"2025-06-27T12:41:53Z","title":"MPipeMoE: Memory Efficient MoE for Pre-trained Models with Adaptive Pipeline Parallelism","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:27.666690Z"},"links":{"cited_paper":"/paper/1604.06174","citing_paper":"/paper/2506.22175"},"observation_digest":"sha256:fc4848c8e86cb5b56c7a13593a2ec3ad44af55fafb7d584c0e3a3d81cd833629","observation_id":"e3157efc-d1e2-4f18-928f-81e7d59f0558","resolution":{"observed_at":"2026-08-06T22:15:27.666690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:29.118385Z","title":"vdnn: Virtualized deep neural networks for scalable, memory-efficient neural network design,","venue":null,"work_id":"652d1202-309d-4db9-b209-1465e909c6a2","year":2016},"citing_paper":{"arxiv_id":"2506.22175","last_updated":"2025-06-27T12:41:53Z","snapshot_observed_at":"2026-08-06T22:07:13.608902Z","submitted_at":"2025-06-27T12:41:53Z","title":"MPipeMoE: Memory Efficient MoE for Pre-trained Models with Adaptive Pipeline Parallelism","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:27.733735Z"},"links":{"citing_paper":"/paper/2506.22175"},"observation_digest":"sha256:8322a9d9e9e7b5d0e2833442fcf84274fee1997eddcb882ef8de6e03f1de41b7","observation_id":"61131dc7-3ae8-4b15-b543-4815bf7e6cda","resolution":{"observed_at":"2026-08-06T22:15:29.248516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:29.003418Z","title":"Buddy compression: Enabling larger memory for deep learning and hpc workloads on gpus,","venue":null,"work_id":"14fb683e-0c7b-4bd7-a603-10cae21004db","year":2020},"citing_paper":{"arxiv_id":"2506.22175","last_updated":"2025-06-27T12:41:53Z","snapshot_observed_at":"2026-08-06T22:07:13.608902Z","submitted_at":"2025-06-27T12:41:53Z","title":"MPipeMoE: Memory Efficient MoE for Pre-trained Models with Adaptive Pipeline Parallelism","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:27.805975Z"},"links":{"citing_paper":"/paper/2506.22175"},"observation_digest":"sha256:8a35420335c9471091426b3b4961a2c86d8028227b983e80ea127bc92b498b3a","observation_id":"954749e8-cf15-4840-8bcd-07b8fddcad2b","resolution":{"observed_at":"2026-08-06T22:15:29.046713Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:28.878864Z","title":"Efficient large-scale language model training on gpu clusters using megatron-lm,","venue":null,"work_id":"288c267c-e064-447b-85c0-f033be1135da","year":2021},"citing_paper":{"arxiv_id":"2506.22175","last_updated":"2025-06-27T12:41:53Z","snapshot_observed_at":"2026-08-06T22:07:13.608902Z","submitted_at":"2025-06-27T12:41:53Z","title":"MPipeMoE: Memory Efficient MoE for Pre-trained Models with Adaptive Pipeline Parallelism","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:27.873864Z"},"links":{"citing_paper":"/paper/2506.22175"},"observation_digest":"sha256:850a233ab71bceeaedccbdb36cb1662fd2061497df255de39a3a6747b8328a4f","observation_id":"0637980d-29df-4b1c-b823-c91db9e0624f","resolution":{"observed_at":"2026-08-06T22:15:28.945997Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:27.918794Z","title":"Adam: A method for stochastic optimization,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.22175","last_updated":"2025-06-27T12:41:53Z","snapshot_observed_at":"2026-08-06T22:07:13.608902Z","submitted_at":"2025-06-27T12:41:53Z","title":"MPipeMoE: Memory Efficient MoE for Pre-trained Models with Adaptive Pipeline Parallelism","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:27.918794Z"},"links":{"citing_paper":"/paper/2506.22175"},"observation_digest":"sha256:2ad76c7be112f953828b3f0b6f7984b4fde0d5aed3d6d31738e7ec5219aeffc3","observation_id":"5f77f9e4-68da-46a4-9a5b-fe15d0db598c","resolution":{"observed_at":"2026-08-06T22:15:27.918794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:27.975062Z","title":"Gpipe: Efficient training of giant neu- ral networks using pipeline parallelism,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.22175","last_updated":"2025-06-27T12:41:53Z","snapshot_observed_at":"2026-08-06T22:07:13.608902Z","submitted_at":"2025-06-27T12:41:53Z","title":"MPipeMoE: Memory Efficient MoE for Pre-trained Models with Adaptive Pipeline Parallelism","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:27.975062Z"},"links":{"citing_paper":"/paper/2506.22175"},"observation_digest":"sha256:cba7fd7db1ac20e06876c6775b8ac048b98eea92a828b6ba6bb81bdf3931e289","observation_id":"1df6a646-9d37-49d9-94b6-61dbb4a70cfb","resolution":{"observed_at":"2026-08-06T22:15:27.975062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.03382","last_updated":"2023-06-05T15:05:24Z","snapshot_observed_at":"2026-08-06T17:50:04.734688Z","submitted_at":"2022-06-07T15:20:20Z","title":"Tutel: Adaptive Mixture-of-Experts at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.03382","snapshot_observed_at":"2026-08-06T22:15:28.050477Z","title":"Tutel: Adaptive mixture-of-experts at scale,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.22175","last_updated":"2025-06-27T12:41:53Z","snapshot_observed_at":"2026-08-06T22:07:13.608902Z","submitted_at":"2025-06-27T12:41:53Z","title":"MPipeMoE: Memory Efficient MoE for Pre-trained Models with Adaptive Pipeline Parallelism","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:28.050477Z"},"links":{"cited_paper":"/paper/2206.03382","citing_paper":"/paper/2506.22175"},"observation_digest":"sha256:68d0d15c6a1d84bee2d34b913ba336f3708118b99a6cf1719bbecce2cc1a2d22","observation_id":"cc6a1c04-8cc7-41c1-9dfd-bd462064a2e0","resolution":{"observed_at":"2026-08-06T22:15:28.050477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:28.763639Z","title":"Mesh-tensorflow: Deep learning for supercomputers,","venue":null,"work_id":"62b80f2d-ce57-49c5-9299-461523159765","year":2018},"citing_paper":{"arxiv_id":"2506.22175","last_updated":"2025-06-27T12:41:53Z","snapshot_observed_at":"2026-08-06T22:07:13.608902Z","submitted_at":"2025-06-27T12:41:53Z","title":"MPipeMoE: Memory Efficient MoE for Pre-trained Models with Adaptive Pipeline Parallelism","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:28.110425Z"},"links":{"citing_paper":"/paper/2506.22175"},"observation_digest":"sha256:edc961052ff84244e74f9e4d885e6b454b42bfcaefcfd553ae8ee4014c12f045","observation_id":"74773f93-26a2-4e1a-bccc-250a63346df8","resolution":{"observed_at":"2026-08-06T22:15:28.801078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-06T22:15:28.158421Z","title":"Megatron-lm: Training multi-billion parameter language models using model parallelism,","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2506.22175","last_updated":"2025-06-27T12:41:53Z","snapshot_observed_at":"2026-08-06T22:07:13.608902Z","submitted_at":"2025-06-27T12:41:53Z","title":"MPipeMoE: Memory Efficient MoE for Pre-trained Models with Adaptive Pipeline Parallelism","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:28.158421Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2506.22175"},"observation_digest":"sha256:468038a9b09dc15191edc410467a6d962d5a5e3eee0820bae398cc128f86069e","observation_id":"0cc0be77-5179-45f1-b922-db552ce61723","resolution":{"observed_at":"2026-08-06T22:15:28.158421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1806.03377","last_updated":"2018-06-08T23:18:08Z","snapshot_observed_at":"2026-08-02T18:12:03.258298Z","submitted_at":"2018-06-08T23:18:08Z","title":"PipeDream: Fast and Efficient Pipeline Parallel DNN Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.03377","snapshot_observed_at":"2026-08-06T22:15:28.228455Z","title":"Pipedream: Fast and efficient pipeline parallel dnn training,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.22175","last_updated":"2025-06-27T12:41:53Z","snapshot_observed_at":"2026-08-06T22:07:13.608902Z","submitted_at":"2025-06-27T12:41:53Z","title":"MPipeMoE: Memory Efficient MoE for Pre-trained Models with Adaptive Pipeline Parallelism","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:28.228455Z"},"links":{"cited_paper":"/paper/1806.03377","citing_paper":"/paper/2506.22175"},"observation_digest":"sha256:a9371ebe7548f37ba23ece6be7855206bf6b1df1b8c52b86fee37fc4defc4a23","observation_id":"fcc388e8-10f4-48cc-a89d-78c841b56b78","resolution":{"observed_at":"2026-08-06T22:15:28.228455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.22175","last_updated":"2025-06-27T12:41:53Z","latest_version":1,"primary_category":"cs.DC","snapshot_observed_at":"2026-08-06T22:07:13.608902Z","submitted_at":"2025-06-27T12:41:53Z","title":"MPipeMoE: Memory Efficient MoE for Pre-trained Models with Adaptive Pipeline Parallelism"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":12,"verified_exact":3,"verified_fuzzy":20},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 0 inbound Pith citation observations for arXiv:2506.22175."}