{"as_of":"2026-08-22T13:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:297819d4b3251ba6d18cfbf9edab940306d3e7dedfa8533309e1c5abd5d54512","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":49,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:17:19.030628Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":9,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2104.04473","last_updated":"2021-08-23T19:41:13Z","snapshot_observed_at":"2026-08-21T22:18:44.715830Z","submitted_at":"2021-04-09T16:43:11Z","title":"Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM","version":5},"cited_work":{"arxiv_id":"2104.04473","doi":"10.48550/arxiv.2104.04473","metadata_source":"pith","pith_arxiv_id":"2104.04473","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efﬁcient large-scale language model training on gpu clusters using megatron-lm","venue":"cs.CL","work_id":"cb405716-f30a-4004-aef0-12f4f12f0e20","year":2021},"citing_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-08-20T20:09:31.615952Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-24T12:10:49.690618Z"},"links":{"cited_paper":"/paper/2104.04473","citing_paper":"/paper/2201.11990"},"observation_digest":"sha256:be42a51b537443c123275e966a3391fb489d4d85a5b2a4ff8ae27f8d4028de39","observation_id":"a4d62a99-e85b-4e0d-86d5-17278d726ffe","resolution":{"observed_at":"2026-05-24T12:14:26.541851Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:33.133437+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:33.133437+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.04473","last_updated":"2021-08-23T19:41:13Z","snapshot_observed_at":"2026-08-21T22:18:44.715830Z","submitted_at":"2021-04-09T16:43:11Z","title":"Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM","version":5},"cited_work":{"arxiv_id":"2104.04473","doi":"10.48550/arxiv.2104.04473","metadata_source":"pith","pith_arxiv_id":"2104.04473","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efﬁcient large-scale language model training on gpu clusters using megatron-lm","venue":"cs.CL","work_id":"cb405716-f30a-4004-aef0-12f4f12f0e20","year":2021},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":142,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"cited_paper":"/paper/2104.04473","citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:694cfea5aeaec19934b87660ebf38be55a2cf544a366baf378e003685bb6151f","observation_id":"50c00f4f-b34c-4082-acab-2ff8b53dd1d2","resolution":{"observed_at":"2026-05-10T20:53:17.533584Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:33.133437+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:33.133437+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.04473","last_updated":"2021-08-23T19:41:13Z","snapshot_observed_at":"2026-08-21T22:18:44.715830Z","submitted_at":"2021-04-09T16:43:11Z","title":"Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.04473","snapshot_observed_at":"2026-08-11T00:55:03.901462Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.19255","last_updated":"2025-01-14T05:48:07Z","snapshot_observed_at":"2026-08-14T11:12:42.419587Z","submitted_at":"2024-12-26T15:45:45Z","title":"Multi-matrix Factorization Attention","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T00:55:03.901462Z"},"links":{"cited_paper":"/paper/2104.04473","citing_paper":"/paper/2412.19255"},"observation_digest":"sha256:3ea6a4d59e51cd44e2e463ebf94696ed099c024494ad09f1fff92360918ae957","observation_id":"52a26e0c-be81-4f2f-9c4c-ef851eb31be0","resolution":{"observed_at":"2026-08-11T00:55:03.901462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.04473","last_updated":"2021-08-23T19:41:13Z","snapshot_observed_at":"2026-08-21T22:18:44.715830Z","submitted_at":"2021-04-09T16:43:11Z","title":"Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.04473","snapshot_observed_at":"2026-08-10T22:59:59.146149Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.00254","last_updated":"2024-12-31T03:51:14Z","snapshot_observed_at":"2026-08-15T06:16:45.769709Z","submitted_at":"2024-12-31T03:51:14Z","title":"Automatically Planning Optimal Parallel Strategy for Large Language Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-10T22:59:59.146149Z"},"links":{"cited_paper":"/paper/2104.04473","citing_paper":"/paper/2501.00254"},"observation_digest":"sha256:bbf0f0867ee2f78cc867448ca5a53aff9e0687b19df2b7fe53fdd6e03cd19506","observation_id":"e815fc39-0ed3-46ec-a5df-920a95bf6b17","resolution":{"observed_at":"2026-08-10T22:59:59.146149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.04473","last_updated":"2021-08-23T19:41:13Z","snapshot_observed_at":"2026-08-21T22:18:44.715830Z","submitted_at":"2021-04-09T16:43:11Z","title":"Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.04473","snapshot_observed_at":"2026-08-10T21:42:38.123613Z","title":"Efficient large-scale language model training on gpu clusters using megatron-lm,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.04266","last_updated":"2025-02-04T04:32:42Z","snapshot_observed_at":"2026-08-19T14:37:25.840284Z","submitted_at":"2025-01-08T04:19:57Z","title":"Scaling Large Language Model Training on Frontier with Low-Bandwidth Partitioning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T21:42:38.123613Z"},"links":{"cited_paper":"/paper/2104.04473","citing_paper":"/paper/2501.04266"},"observation_digest":"sha256:cba9e78e62383fe9800cb99f9bda5d53e4d23a3cc748eefe1b29b401ea8876aa","observation_id":"bcbdff8a-f26d-4bc1-b441-fb0214fe0104","resolution":{"observed_at":"2026-08-10T21:42:38.123613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.04473","last_updated":"2021-08-23T19:41:13Z","snapshot_observed_at":"2026-08-21T22:18:44.715830Z","submitted_at":"2021-04-09T16:43:11Z","title":"Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.04473","snapshot_observed_at":"2026-08-10T15:31:20.118465Z","title":"Ef- ficient large-scale language model training on GPU clusters","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.13928","last_updated":"2025-03-19T19:35:52Z","snapshot_observed_at":"2026-08-17T18:56:20.884345Z","submitted_at":"2025-01-23T18:59:55Z","title":"Fast3R: Towards 3D Reconstruction of 1000+ Images in One Forward Pass","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T15:31:20.118465Z"},"links":{"cited_paper":"/paper/2104.04473","citing_paper":"/paper/2501.13928"},"observation_digest":"sha256:48ce10a9f4d390eb6af034a6a212b373a5d09450f055fca883c8e7a98384c4c1","observation_id":"9da226f6-618d-430e-9a3f-1de9a9a1b1f6","resolution":{"observed_at":"2026-08-10T15:31:20.118465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.04473","last_updated":"2021-08-23T19:41:13Z","snapshot_observed_at":"2026-08-21T22:18:44.715830Z","submitted_at":"2021-04-09T16:43:11Z","title":"Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.04473","snapshot_observed_at":"2026-08-08T10:20:02.642128Z","title":"Efficient large-scale language model training on GPU clusters,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-15T12:26:46.512448Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.642128Z"},"links":{"cited_paper":"/paper/2104.04473","citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:4f58e37f5217f0e35644167c5eee875993d589267a73817e7f0135c4e99bdb7b","observation_id":"fb0670d6-8efc-4d2e-b247-9226f418704c","resolution":{"observed_at":"2026-08-08T10:20:02.642128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.04473","last_updated":"2021-08-23T19:41:13Z","snapshot_observed_at":"2026-08-21T22:18:44.715830Z","submitted_at":"2021-04-09T16:43:11Z","title":"Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.04473","snapshot_observed_at":"2026-08-16T11:17:19.030628Z","title":"Accessed 20-04-2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.16026","last_updated":"2025-04-23T20:08:26Z","snapshot_observed_at":"2026-08-21T22:19:10.565965Z","submitted_at":"2025-04-22T16:44:34Z","title":"Trends in AI Supercomputers","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-16T11:17:19.030628Z"},"links":{"cited_paper":"/paper/2104.04473","citing_paper":"/paper/2504.16026"},"observation_digest":"sha256:0ac7509814294b554f044be67d41f9baab7e16dbc7a6a6e9955672035c6afc9f","observation_id":"38141650-6fcb-4e1f-9623-450cc0ed660b","resolution":{"observed_at":"2026-08-16T11:17:19.030628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.04473","last_updated":"2021-08-23T19:41:13Z","snapshot_observed_at":"2026-08-21T22:18:44.715830Z","submitted_at":"2021-04-09T16:43:11Z","title":"Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.04473","snapshot_observed_at":"2026-08-16T05:49:10.027522Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.19720","last_updated":"2025-04-28T12:14:02Z","snapshot_observed_at":"2026-08-19T00:58:17.913230Z","submitted_at":"2025-04-28T12:14:02Z","title":"Taming the Titans: A Survey of Efficient LLM Inference Serving","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-16T05:49:10.027522Z"},"links":{"cited_paper":"/paper/2104.04473","citing_paper":"/paper/2504.19720"},"observation_digest":"sha256:12af1cd331519beb509946650f3584964fef670fb18f0e6744c769f8a20a36a5","observation_id":"0301b650-4d67-42df-9fa1-fd627987e3a5","resolution":{"observed_at":"2026-08-16T05:49:10.027522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.04473","last_updated":"2021-08-23T19:41:13Z","snapshot_observed_at":"2026-08-21T22:18:44.715830Z","submitted_at":"2021-04-09T16:43:11Z","title":"Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.04473","snapshot_observed_at":"2026-08-16T05:32:40.828417Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.20490","last_updated":"2026-07-01T15:34:59Z","snapshot_observed_at":"2026-08-17T18:48:47.116913Z","submitted_at":"2025-04-29T07:27:54Z","title":"Hetu v2: A General and Scalable Deep Learning System with Hierarchical and Heterogeneous Single Program Multiple Data Annotations","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T05:32:40.828417Z"},"links":{"cited_paper":"/paper/2104.04473","citing_paper":"/paper/2504.20490"},"observation_digest":"sha256:c1dbade10bcb929e1298b470e24dda1217d0a125fb27e1aab43e20adea146793","observation_id":"7dc5a2f3-85a1-4c6f-a8c2-299c257b3ebc","resolution":{"observed_at":"2026-08-16T05:32:40.828417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.04473","last_updated":"2021-08-23T19:41:13Z","snapshot_observed_at":"2026-08-21T22:18:44.715830Z","submitted_at":"2021-04-09T16:43:11Z","title":"Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.04473","snapshot_observed_at":"2026-08-07T13:32:31.424098Z","title":"Efficient large-scale language model training on gpu clusters using megatron-lm, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T13:32:31.424098Z"},"links":{"cited_paper":"/paper/2104.04473","citing_paper":"/paper/2505.21487"},"observation_digest":"sha256:2f2cb549c60223c26af8ee0db002cdad653655319719b69c18ac00a9ad2c6add","observation_id":"b98d2e69-c40f-4c0f-a376-a80a2b2b4410","resolution":{"observed_at":"2026-08-07T13:32:31.424098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.04473","last_updated":"2021-08-23T19:41:13Z","snapshot_observed_at":"2026-08-21T22:18:44.715830Z","submitted_at":"2021-04-09T16:43:11Z","title":"Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.04473","snapshot_observed_at":"2026-08-07T12:58:04.791744Z","title":"Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23072","last_updated":"2025-05-29T04:24:56Z","snapshot_observed_at":"2026-08-19T19:58:02.287953Z","submitted_at":"2025-05-29T04:24:56Z","title":"Speeding up Model Loading with fastsafetensors","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:04.791744Z"},"links":{"cited_paper":"/paper/2104.04473","citing_paper":"/paper/2505.23072"},"observation_digest":"sha256:4ef850f7f236dbae9a97b94319c41d00a355b880fb2b50392aeaa5531eed7a81","observation_id":"2b1adefe-1e6a-4e8c-8fe1-fb2f309c00e3","resolution":{"observed_at":"2026-08-07T12:58:04.791744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.04473","last_updated":"2021-08-23T19:41:13Z","snapshot_observed_at":"2026-08-21T22:18:44.715830Z","submitted_at":"2021-04-09T16:43:11Z","title":"Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.04473","snapshot_observed_at":"2026-08-06T14:43:22.531285Z","title":"Efficient large-scale language model training on gpu clusters using megatron-lm, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.18013","last_updated":"2025-07-29T10:30:18Z","snapshot_observed_at":"2026-08-19T18:01:09.283309Z","submitted_at":"2025-07-24T01:00:48Z","title":"Technical Report of TeleChat2, TeleChat2.5 and T1","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T14:43:22.531285Z"},"links":{"cited_paper":"/paper/2104.04473","citing_paper":"/paper/2507.18013"},"observation_digest":"sha256:606eba07e0952ba918d8c18f5e8bf41bb3a8fe32d5c2d055a86cba731291ee27","observation_id":"2416c498-850c-4e9e-9e1a-2891e812dea0","resolution":{"observed_at":"2026-08-06T14:43:22.531285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.04473","last_updated":"2021-08-23T19:41:13Z","snapshot_observed_at":"2026-08-21T22:18:44.715830Z","submitted_at":"2021-04-09T16:43:11Z","title":"Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.04473","snapshot_observed_at":"2026-08-06T14:16:14.564374Z","title":"Efficient large-scale language model training on GPU clusters","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.19635","last_updated":"2025-07-25T19:02:42Z","snapshot_observed_at":"2026-08-21T22:19:12.119280Z","submitted_at":"2025-07-25T19:02:42Z","title":"Efficient and Scalable Agentic AI with Heterogeneous Systems","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T14:16:14.564374Z"},"links":{"cited_paper":"/paper/2104.04473","citing_paper":"/paper/2507.19635"},"observation_digest":"sha256:439103acb6ebedb4621d1300afd7c6adf9ce43aae5986a9257957f71ac41a3da","observation_id":"434e3dfa-8e73-4bda-9894-afc73a21f4fb","resolution":{"observed_at":"2026-08-06T14:16:14.564374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.04473","last_updated":"2021-08-23T19:41:13Z","snapshot_observed_at":"2026-08-21T22:18:44.715830Z","submitted_at":"2021-04-09T16:43:11Z","title":"Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM","version":5},"cited_work":{"arxiv_id":"2104.04473","doi":"10.48550/arxiv.2104.04473","metadata_source":"pith","pith_arxiv_id":"2104.04473","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efﬁcient large-scale language model training on gpu clusters using megatron-lm","venue":"cs.CL","work_id":"cb405716-f30a-4004-aef0-12f4f12f0e20","year":2021},"citing_paper":{"arxiv_id":"2509.05276","last_updated":"2026-05-08T09:41:26Z","snapshot_observed_at":"2026-08-11T05:30:18.498214Z","submitted_at":"2025-09-05T17:34:00Z","title":"SpikingBrain: Spiking Brain-inspired Large Models","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-18T18:51:06.243305Z"},"links":{"cited_paper":"/paper/2104.04473","citing_paper":"/paper/2509.05276"},"observation_digest":"sha256:831c6f76ea234165aa876f4c3a75374ba393746cd6eb00e2aac92daeb6c01305","observation_id":"98915eea-eaf6-4490-9f89-fa2b7b9db928","resolution":{"observed_at":"2026-05-18T18:51:45.811840Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:33.133437+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:33.133437+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.04473","last_updated":"2021-08-23T19:41:13Z","snapshot_observed_at":"2026-08-21T22:18:44.715830Z","submitted_at":"2021-04-09T16:43:11Z","title":"Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM","version":5},"cited_work":{"arxiv_id":"2104.04473","doi":"10.48550/arxiv.2104.04473","metadata_source":"pith","pith_arxiv_id":"2104.04473","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efﬁcient large-scale language model training on gpu clusters using megatron-lm","venue":"cs.CL","work_id":"cb405716-f30a-4004-aef0-12f4f12f0e20","year":2021},"citing_paper":{"arxiv_id":"2509.07177","last_updated":"2026-04-14T15:07:25Z","snapshot_observed_at":"2026-08-14T19:42:29.494099Z","submitted_at":"2025-09-08T19:48:52Z","title":"Towards EnergyGPT: A Large Language Model Specialized for the Energy Sector","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-18T17:39:17.456350Z"},"links":{"cited_paper":"/paper/2104.04473","citing_paper":"/paper/2509.07177"},"observation_digest":"sha256:d0b24ae5891a8bce24a1220fea30b67f11b7cd9129c6d91b0465abcc81afa959","observation_id":"fdb78c4e-ce1a-4b43-aee2-89eaf78d9c06","resolution":{"observed_at":"2026-05-18T17:42:47.536706Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:33.133437+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:33.133437+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.04473","last_updated":"2021-08-23T19:41:13Z","snapshot_observed_at":"2026-08-21T22:18:44.715830Z","submitted_at":"2021-04-09T16:43:11Z","title":"Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM","version":5},"cited_work":{"arxiv_id":"2104.04473","doi":"10.48550/arxiv.2104.04473","metadata_source":"pith","pith_arxiv_id":"2104.04473","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efﬁcient large-scale language model training on gpu clusters using megatron-lm","venue":"cs.CL","work_id":"cb405716-f30a-4004-aef0-12f4f12f0e20","year":2021},"citing_paper":{"arxiv_id":"2511.21613","last_updated":"2026-04-19T02:59:16Z","snapshot_observed_at":"2026-08-14T09:49:16.350511Z","submitted_at":"2025-11-26T17:36:31Z","title":"Beyond URLs: Metadata Diversity and Position for Efficient LLM Pretraining","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-17T04:46:33.641714Z"},"links":{"cited_paper":"/paper/2104.04473","citing_paper":"/paper/2511.21613"},"observation_digest":"sha256:6ce7ec59e0a31f133d8c0c25fe80945a01ba4f88750723133af6bb5897dfcbbb","observation_id":"5016bb78-fabd-40f9-90ce-84c305794c98","resolution":{"observed_at":"2026-05-17T04:49:03.022290Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:33.133437+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:33.133437+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.04473","last_updated":"2021-08-23T19:41:13Z","snapshot_observed_at":"2026-08-21T22:18:44.715830Z","submitted_at":"2021-04-09T16:43:11Z","title":"Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM","version":5},"cited_work":{"arxiv_id":"2104.04473","doi":"10.48550/arxiv.2104.04473","metadata_source":"pith","pith_arxiv_id":"2104.04473","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efﬁcient large-scale language model training on gpu clusters using megatron-lm","venue":"cs.CL","work_id":"cb405716-f30a-4004-aef0-12f4f12f0e20","year":2021},"citing_paper":{"arxiv_id":"2512.11470","last_updated":"2026-05-11T03:19:23Z","snapshot_observed_at":"2026-08-21T03:46:34.215289Z","submitted_at":"2025-12-12T11:13:00Z","title":"Rethinking Expert Trajectory Utilization in LLM Post-training for Mathematical Reasoning","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-16T22:43:01.937642Z"},"links":{"cited_paper":"/paper/2104.04473","citing_paper":"/paper/2512.11470"},"observation_digest":"sha256:5ca4a60b100f965964728af64fc4e1a8c7fc5a464d9fc3db07f30f5b2d6ef608","observation_id":"24b707cb-bacc-4ff0-948d-eaa90040a26f","resolution":{"observed_at":"2026-05-16T22:43:37.893546Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:33.133437+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:33.133437+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.04473","last_updated":"2021-08-23T19:41:13Z","snapshot_observed_at":"2026-08-21T22:18:44.715830Z","submitted_at":"2021-04-09T16:43:11Z","title":"Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.04473","snapshot_observed_at":"2026-08-03T11:25:09.562026Z","title":"Zaharia, M","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.06649","last_updated":"2026-06-08T14:01:39Z","snapshot_observed_at":"2026-08-19T19:07:18.043219Z","submitted_at":"2026-01-10T18:24:40Z","title":"Revisiting Training Scale: An Empirical Study of Token Count, Power Consumption, and Parameter Efficiency","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T11:25:09.562026Z"},"links":{"cited_paper":"/paper/2104.04473","citing_paper":"/paper/2601.06649"},"observation_digest":"sha256:692fcdb0f8ccb6b6c6ec600c15b2d1e5bd9d854451e810c684e8332053bb0957","observation_id":"19c9e4ea-19e8-4fd7-82ab-82d278e94d87","resolution":{"observed_at":"2026-08-03T11:25:09.562026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.04473","last_updated":"2021-08-23T19:41:13Z","snapshot_observed_at":"2026-08-21T22:18:44.715830Z","submitted_at":"2021-04-09T16:43:11Z","title":"Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM","version":5},"cited_work":{"arxiv_id":"2104.04473","doi":"10.48550/arxiv.2104.04473","metadata_source":"pith","pith_arxiv_id":"2104.04473","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efﬁcient large-scale language model training on gpu clusters using megatron-lm","venue":"cs.CL","work_id":"cb405716-f30a-4004-aef0-12f4f12f0e20","year":2021},"citing_paper":{"arxiv_id":"2602.02276","last_updated":"2026-02-02T16:17:38Z","snapshot_observed_at":"2026-08-12T00:25:39.214406Z","submitted_at":"2026-02-02T16:17:38Z","title":"Kimi K2.5: Visual Agentic Intelligence","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-10T16:09:05.225767Z"},"links":{"cited_paper":"/paper/2104.04473","citing_paper":"/paper/2602.02276"},"observation_digest":"sha256:23642cd78011c7cfba2605c255238baaa4624bb483a7b3a691e844d32899aa8f","observation_id":"328733c0-12be-44c1-8352-58b97e7d75af","resolution":{"observed_at":"2026-05-10T16:09:05.345041Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:33.133437+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:33.133437+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.04473","last_updated":"2021-08-23T19:41:13Z","snapshot_observed_at":"2026-08-21T22:18:44.715830Z","submitted_at":"2021-04-09T16:43:11Z","title":"Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM","version":5},"cited_work":{"arxiv_id":"2104.04473","doi":"10.48550/arxiv.2104.04473","metadata_source":"pith","pith_arxiv_id":"2104.04473","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efﬁcient large-scale language model training on gpu clusters using megatron-lm","venue":"cs.CL","work_id":"cb405716-f30a-4004-aef0-12f4f12f0e20","year":2021},"citing_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-16T13:30:40.009888Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-21T06:39:04.312270Z"},"links":{"cited_paper":"/paper/2104.04473","citing_paper":"/paper/2603.15031"},"observation_digest":"sha256:7fa0edacad4de9561d131991162eb5790f1e1c2b449bdc14b71e472258d8ba68","observation_id":"177b40ef-d995-4946-a80f-645b9db7e617","resolution":{"observed_at":"2026-05-21T06:39:04.522153Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:33.133437+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:33.133437+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.04473","last_updated":"2021-08-23T19:41:13Z","snapshot_observed_at":"2026-08-21T22:18:44.715830Z","submitted_at":"2021-04-09T16:43:11Z","title":"Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM","version":5},"cited_work":{"arxiv_id":"2104.04473","doi":"10.48550/arxiv.2104.04473","metadata_source":"pith","pith_arxiv_id":"2104.04473","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efﬁcient large-scale language model training on gpu clusters using megatron-lm","venue":"cs.CL","work_id":"cb405716-f30a-4004-aef0-12f4f12f0e20","year":2021},"citing_paper":{"arxiv_id":"2604.03425","last_updated":"2026-04-03T19:47:26Z","snapshot_observed_at":"2026-07-06T22:52:34.609783Z","submitted_at":"2026-04-03T19:47:26Z","title":"AEGIS: Scaling Long-Sequence Homomorphic Encrypted Transformer Inference via Hybrid Parallelism on Multi-GPU Systems","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-13T19:21:26.158870Z"},"links":{"cited_paper":"/paper/2104.04473","citing_paper":"/paper/2604.03425"},"observation_digest":"sha256:ccb1416cad0a3377dd47e991710442c128ae1f5fb7849b0cde64c79f535011f5","observation_id":"c9817349-2284-48aa-8094-16363d79dabe","resolution":{"observed_at":"2026-05-13T19:23:09.283474Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:33.133437+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:33.133437+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.04473","last_updated":"2021-08-23T19:41:13Z","snapshot_observed_at":"2026-08-21T22:18:44.715830Z","submitted_at":"2021-04-09T16:43:11Z","title":"Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM","version":5},"cited_work":{"arxiv_id":"2104.04473","doi":"10.48550/arxiv.2104.04473","metadata_source":"pith","pith_arxiv_id":"2104.04473","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efﬁcient large-scale language model training on gpu clusters using megatron-lm","venue":"cs.CL","work_id":"cb405716-f30a-4004-aef0-12f4f12f0e20","year":2021},"citing_paper":{"arxiv_id":"2604.12973","last_updated":"2026-04-15T14:12:16Z","snapshot_observed_at":"2026-08-13T09:08:09.618853Z","submitted_at":"2026-04-14T17:04:51Z","title":"An Engineering Journey Training Large Language Models at Scale on Alps: The Apertus Experience","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T14:16:02.816822Z"},"links":{"cited_paper":"/paper/2104.04473","citing_paper":"/paper/2604.12973"},"observation_digest":"sha256:43c7f9270bf78fe486d7317a37a01cfbc4ff41ee05fe7b84cb96bf93ce805913","observation_id":"6a0912e7-1778-41aa-9a95-863b705e390c","resolution":{"observed_at":"2026-05-10T14:20:30.878284Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:33.133437+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:33.133437+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.04473","last_updated":"2021-08-23T19:41:13Z","snapshot_observed_at":"2026-08-21T22:18:44.715830Z","submitted_at":"2021-04-09T16:43:11Z","title":"Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM","version":5},"cited_work":{"arxiv_id":"2104.04473","doi":"10.48550/arxiv.2104.04473","metadata_source":"pith","pith_arxiv_id":"2104.04473","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efﬁcient large-scale language model training on gpu clusters using megatron-lm","venue":"cs.CL","work_id":"cb405716-f30a-4004-aef0-12f4f12f0e20","year":2021},"citing_paper":{"arxiv_id":"2604.14825","last_updated":"2026-04-16T09:55:23Z","snapshot_observed_at":"2026-08-13T20:15:45.991992Z","submitted_at":"2026-04-16T09:55:23Z","title":"Nautilus: An Auto-Scheduling Tensor Compiler for Efficient Tiled GPU Kernels","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T10:21:05.219519Z"},"links":{"cited_paper":"/paper/2104.04473","citing_paper":"/paper/2604.14825"},"observation_digest":"sha256:dec26f72c8bf8adf1c15dde6c5fee0c6faa38086bee35e978c48e46442e7d0fa","observation_id":"b02ba0ef-36db-49ff-9907-d9d5d8aa0421","resolution":{"observed_at":"2026-05-10T10:24:21.492412Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:33.133437+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:33.133437+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.04473","last_updated":"2021-08-23T19:41:13Z","snapshot_observed_at":"2026-08-21T22:18:44.715830Z","submitted_at":"2021-04-09T16:43:11Z","title":"Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM","version":5},"cited_work":{"arxiv_id":"2104.04473","doi":"10.48550/arxiv.2104.04473","metadata_source":"pith","pith_arxiv_id":"2104.04473","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efﬁcient large-scale language model training on gpu clusters using megatron-lm","venue":"cs.CL","work_id":"cb405716-f30a-4004-aef0-12f4f12f0e20","year":2021},"citing_paper":{"arxiv_id":"2604.17861","last_updated":"2026-04-20T06:19:16Z","snapshot_observed_at":"2026-07-06T23:04:50.935335Z","submitted_at":"2026-04-20T06:19:16Z","title":"GPUOS: A GPU Operating System Primitive for Transparent Operation Fusion","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T04:30:44.728872Z"},"links":{"cited_paper":"/paper/2104.04473","citing_paper":"/paper/2604.17861"},"observation_digest":"sha256:4a9b2d0127f3493cceefc169f4487f4301fc34b265c1dd7ecbe7b735797508ea","observation_id":"b98fd996-021b-4bf4-bd1b-e32939204f3b","resolution":{"observed_at":"2026-05-11T11:51:04.200107Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:33.133437+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:33.133437+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.04473","last_updated":"2021-08-23T19:41:13Z","snapshot_observed_at":"2026-08-21T22:18:44.715830Z","submitted_at":"2021-04-09T16:43:11Z","title":"Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM","version":5},"cited_work":{"arxiv_id":"2104.04473","doi":"10.48550/arxiv.2104.04473","metadata_source":"pith","pith_arxiv_id":"2104.04473","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efﬁcient large-scale language model training on gpu clusters using megatron-lm","venue":"cs.CL","work_id":"cb405716-f30a-4004-aef0-12f4f12f0e20","year":2021},"citing_paper":{"arxiv_id":"2604.27085","last_updated":"2026-04-29T18:26:13Z","snapshot_observed_at":"2026-08-11T17:43:29.951165Z","submitted_at":"2026-04-29T18:26:13Z","title":"Efficient Training on Multiple Consumer GPUs with RoundPipe","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-07T10:37:22.251566Z"},"links":{"cited_paper":"/paper/2104.04473","citing_paper":"/paper/2604.27085"},"observation_digest":"sha256:1f577a871ad19ff338b36dcef1748d602fce2bb50be4706dc001c1f5ee61b124","observation_id":"fbf8fc09-41b9-4bdb-b3b7-64885625d174","resolution":{"observed_at":"2026-05-12T09:31:26.784462Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:33.133437+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:33.133437+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.04473","last_updated":"2021-08-23T19:41:13Z","snapshot_observed_at":"2026-08-21T22:18:44.715830Z","submitted_at":"2021-04-09T16:43:11Z","title":"Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM","version":5},"cited_work":{"arxiv_id":"2104.04473","doi":"10.48550/arxiv.2104.04473","metadata_source":"pith","pith_arxiv_id":"2104.04473","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efﬁcient large-scale language model training on gpu clusters using megatron-lm","venue":"cs.CL","work_id":"cb405716-f30a-4004-aef0-12f4f12f0e20","year":2021},"citing_paper":{"arxiv_id":"2605.07726","last_updated":"2026-05-08T13:32:17Z","snapshot_observed_at":"2026-08-16T21:01:46.228026Z","submitted_at":"2026-05-08T13:32:17Z","title":"A Scalable Recipe on SuperMUC-NG Phase 2: Efficient Large-Scale Training of Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-11T02:21:17.841592Z"},"links":{"cited_paper":"/paper/2104.04473","citing_paper":"/paper/2605.07726"},"observation_digest":"sha256:6dfe19b950912422fa046dca558e7def70287fc6f161778ea553c0c07d5b3cbe","observation_id":"4459bbc7-997e-4ae8-bc91-8ddb8ad82895","resolution":{"observed_at":"2026-05-11T03:45:56.331268Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:33.133437+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:33.133437+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.04473","last_updated":"2021-08-23T19:41:13Z","snapshot_observed_at":"2026-08-21T22:18:44.715830Z","submitted_at":"2021-04-09T16:43:11Z","title":"Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM","version":5},"cited_work":{"arxiv_id":"2104.04473","doi":"10.48550/arxiv.2104.04473","metadata_source":"pith","pith_arxiv_id":"2104.04473","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efﬁcient large-scale language model training on gpu clusters using megatron-lm","venue":"cs.CL","work_id":"cb405716-f30a-4004-aef0-12f4f12f0e20","year":2021},"citing_paper":{"arxiv_id":"2605.09176","last_updated":"2026-05-09T21:34:28Z","snapshot_observed_at":"2026-08-16T23:23:01.938769Z","submitted_at":"2026-05-09T21:34:28Z","title":"Navigating LLM Valley: From AdamW to Memory-Efficient and Matrix-Based Optimizers","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-12T04:01:32.057022Z"},"links":{"cited_paper":"/paper/2104.04473","citing_paper":"/paper/2605.09176"},"observation_digest":"sha256:a179706cfcb182024842a184760a3116c1ca68a7ab162da2decd0477bfcc5313","observation_id":"d8715644-38f9-4b6f-9f37-30e957cda438","resolution":{"observed_at":"2026-05-12T06:41:45.669017Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:33.133437+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:33.133437+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.04473","last_updated":"2021-08-23T19:41:13Z","snapshot_observed_at":"2026-08-21T22:18:44.715830Z","submitted_at":"2021-04-09T16:43:11Z","title":"Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM","version":5},"cited_work":{"arxiv_id":"2104.04473","doi":"10.48550/arxiv.2104.04473","metadata_source":"pith","pith_arxiv_id":"2104.04473","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efﬁcient large-scale language model training on gpu clusters using megatron-lm","venue":"cs.CL","work_id":"cb405716-f30a-4004-aef0-12f4f12f0e20","year":2021},"citing_paper":{"arxiv_id":"2605.13779","last_updated":"2026-05-26T16:10:31Z","snapshot_observed_at":"2026-08-19T01:48:18.988681Z","submitted_at":"2026-05-13T16:59:08Z","title":"MinT: Managed Infrastructure for Training and Serving Millions of LLMs","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-14T19:25:12.407148Z"},"links":{"cited_paper":"/paper/2104.04473","citing_paper":"/paper/2605.13779"},"observation_digest":"sha256:9eef15cee0bbc089d49bd68368f2844096226823af422a41ea69ae9ef004e9f0","observation_id":"5e29785d-d1b4-451b-88e8-0ea4b476cde0","resolution":{"observed_at":"2026-05-14T19:27:51.896687Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:33.133437+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:33.133437+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.04473","last_updated":"2021-08-23T19:41:13Z","snapshot_observed_at":"2026-08-21T22:18:44.715830Z","submitted_at":"2021-04-09T16:43:11Z","title":"Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM","version":5},"cited_work":{"arxiv_id":"2104.04473","doi":"10.48550/arxiv.2104.04473","metadata_source":"pith","pith_arxiv_id":"2104.04473","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efﬁcient large-scale language model training on gpu clusters using megatron-lm","venue":"cs.CL","work_id":"cb405716-f30a-4004-aef0-12f4f12f0e20","year":2021},"citing_paper":{"arxiv_id":"2605.13779","last_updated":"2026-05-26T16:10:31Z","snapshot_observed_at":"2026-08-19T01:48:18.988681Z","submitted_at":"2026-05-13T16:59:08Z","title":"MinT: Managed Infrastructure for Training and Serving Millions of LLMs","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-30T21:47:00.295144Z"},"links":{"cited_paper":"/paper/2104.04473","citing_paper":"/paper/2605.13779"},"observation_digest":"sha256:e1741af7fc24eb9d459b5b20cca7d00feefd9b8e02a1a2289f354eac6c97ab73","observation_id":"66d0774e-14e5-4333-ad20-0313dfe62708","resolution":{"observed_at":"2026-06-30T22:05:06.246888Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:33.133437+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:33.133437+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.04473","last_updated":"2021-08-23T19:41:13Z","snapshot_observed_at":"2026-08-21T22:18:44.715830Z","submitted_at":"2021-04-09T16:43:11Z","title":"Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM","version":5},"cited_work":{"arxiv_id":"2104.04473","doi":"10.48550/arxiv.2104.04473","metadata_source":"pith","pith_arxiv_id":"2104.04473","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efﬁcient large-scale language model training on gpu clusters using megatron-lm","venue":"cs.CL","work_id":"cb405716-f30a-4004-aef0-12f4f12f0e20","year":2021},"citing_paper":{"arxiv_id":"2605.17164","last_updated":"2026-05-19T23:51:14Z","snapshot_observed_at":"2026-08-14T07:01:53.166681Z","submitted_at":"2026-05-16T21:28:22Z","title":"Charon: A Unified and Fine-Grained Simulator for Large-Scale LLM Training and Inference","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-20T14:11:58.106397Z"},"links":{"cited_paper":"/paper/2104.04473","citing_paper":"/paper/2605.17164"},"observation_digest":"sha256:97c9bf5fd396e25a4dc23adf0dc67e5cfd04fc4acfe00973fb0db5317623bb9c","observation_id":"98a325aa-8eea-4233-abb5-1b7f161c9428","resolution":{"observed_at":"2026-05-20T14:13:21.202970Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:33.133437+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:33.133437+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.04473","last_updated":"2021-08-23T19:41:13Z","snapshot_observed_at":"2026-08-21T22:18:44.715830Z","submitted_at":"2021-04-09T16:43:11Z","title":"Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM","version":5},"cited_work":{"arxiv_id":"2104.04473","doi":"10.48550/arxiv.2104.04473","metadata_source":"pith","pith_arxiv_id":"2104.04473","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efﬁcient large-scale language model training on gpu clusters using megatron-lm","venue":"cs.CL","work_id":"cb405716-f30a-4004-aef0-12f4f12f0e20","year":2021},"citing_paper":{"arxiv_id":"2605.17164","last_updated":"2026-05-19T23:51:14Z","snapshot_observed_at":"2026-08-14T07:01:53.166681Z","submitted_at":"2026-05-16T21:28:22Z","title":"Charon: A Unified and Fine-Grained Simulator for Large-Scale LLM Training and Inference","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-21T08:55:31.298030Z"},"links":{"cited_paper":"/paper/2104.04473","citing_paper":"/paper/2605.17164"},"observation_digest":"sha256:f360b5fd55c56defd1a6a05142500360b774dddf9c0ba8aa6d91102d387b9984","observation_id":"74ea8c6e-298e-4381-a6e7-301a64b72879","resolution":{"observed_at":"2026-05-21T08:59:55.795270Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:33.133437+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:33.133437+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.04473","last_updated":"2021-08-23T19:41:13Z","snapshot_observed_at":"2026-08-21T22:18:44.715830Z","submitted_at":"2021-04-09T16:43:11Z","title":"Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM","version":5},"cited_work":{"arxiv_id":"2104.04473","doi":"10.48550/arxiv.2104.04473","metadata_source":"pith","pith_arxiv_id":"2104.04473","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efﬁcient large-scale language model training on gpu clusters using megatron-lm","venue":"cs.CL","work_id":"cb405716-f30a-4004-aef0-12f4f12f0e20","year":2021},"citing_paper":{"arxiv_id":"2605.18750","last_updated":"2026-05-18T17:59:18Z","snapshot_observed_at":"2026-08-14T15:14:52.355679Z","submitted_at":"2026-05-18T17:59:18Z","title":"A Readiness-Driven Runtime for Pipeline-Parallel Training under Runtime Variability","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-20T07:35:32.225708Z"},"links":{"cited_paper":"/paper/2104.04473","citing_paper":"/paper/2605.18750"},"observation_digest":"sha256:9e7edc227a8339682fb60f55ba2d9b2c3db18929858d034b78b1ed9d7f165ed5","observation_id":"79497a54-12f9-423d-aafb-370042858c82","resolution":{"observed_at":"2026-05-20T07:38:09.493332Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:33.133437+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:33.133437+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.04473","last_updated":"2021-08-23T19:41:13Z","snapshot_observed_at":"2026-08-21T22:18:44.715830Z","submitted_at":"2021-04-09T16:43:11Z","title":"Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM","version":5},"cited_work":{"arxiv_id":"2104.04473","doi":"10.48550/arxiv.2104.04473","metadata_source":"pith","pith_arxiv_id":"2104.04473","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efﬁcient large-scale language model training on gpu clusters using megatron-lm","venue":"cs.CL","work_id":"cb405716-f30a-4004-aef0-12f4f12f0e20","year":2021},"citing_paper":{"arxiv_id":"2605.24217","last_updated":"2026-05-26T05:47:59Z","snapshot_observed_at":"2026-08-14T08:37:34.874907Z","submitted_at":"2026-05-22T20:57:26Z","title":"Identifying and Mitigating Systemic Measurement Bias in Production LLM Inference Benchmarks","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-30T15:42:21.405913Z"},"links":{"cited_paper":"/paper/2104.04473","citing_paper":"/paper/2605.24217"},"observation_digest":"sha256:998dc2efff86f4b11d6df13bec9e38bb37b52534b5afdb6ec7c6481e3fd0bd9f","observation_id":"12c7c42b-e7ee-4c9e-a26f-e5612c9b589e","resolution":{"observed_at":"2026-06-30T15:44:48.308088Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:33.133437+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:33.133437+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.04473","last_updated":"2021-08-23T19:41:13Z","snapshot_observed_at":"2026-08-21T22:18:44.715830Z","submitted_at":"2021-04-09T16:43:11Z","title":"Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM","version":5},"cited_work":{"arxiv_id":"2104.04473","doi":"10.48550/arxiv.2104.04473","metadata_source":"pith","pith_arxiv_id":"2104.04473","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efﬁcient large-scale language model training on gpu clusters using megatron-lm","venue":"cs.CL","work_id":"cb405716-f30a-4004-aef0-12f4f12f0e20","year":2021},"citing_paper":{"arxiv_id":"2605.27678","last_updated":"2026-05-26T20:53:06Z","snapshot_observed_at":"2026-08-21T13:46:28.711598Z","submitted_at":"2026-05-26T20:53:06Z","title":"Heterogeneous Parallelism for Multimodal Large Language Model Training","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-29T18:42:09.591282Z"},"links":{"cited_paper":"/paper/2104.04473","citing_paper":"/paper/2605.27678"},"observation_digest":"sha256:54f2448d7e013ca5c1d4f1f03ddae65c82f4d8254161e2ed07c40cc771db71dc","observation_id":"18dd1c7d-1d54-4fb3-b41d-d0ad1f22525a","resolution":{"observed_at":"2026-06-29T18:43:50.412459Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:33.133437+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:33.133437+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.04473","last_updated":"2021-08-23T19:41:13Z","snapshot_observed_at":"2026-08-21T22:18:44.715830Z","submitted_at":"2021-04-09T16:43:11Z","title":"Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM","version":5},"cited_work":{"arxiv_id":"2104.04473","doi":"10.48550/arxiv.2104.04473","metadata_source":"pith","pith_arxiv_id":"2104.04473","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efﬁcient large-scale language model training on gpu clusters using megatron-lm","venue":"cs.CL","work_id":"cb405716-f30a-4004-aef0-12f4f12f0e20","year":2021},"citing_paper":{"arxiv_id":"2606.07639","last_updated":"2026-06-01T09:07:15Z","snapshot_observed_at":"2026-08-17T19:24:43.936240Z","submitted_at":"2026-06-01T09:07:15Z","title":"MOSS-Video-Preview: Toward Real-Time Video Understanding via Cross-Attention","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-28T15:22:31.310003Z"},"links":{"cited_paper":"/paper/2104.04473","citing_paper":"/paper/2606.07639"},"observation_digest":"sha256:1a56541de55f66c84a853d93d60857a5379df244c57010a794b90d656a910f07","observation_id":"702f9e44-561d-495f-a5ef-ae30dc9bc281","resolution":{"observed_at":"2026-07-01T22:26:17.872984Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:33.133437+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:33.133437+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.04473","last_updated":"2021-08-23T19:41:13Z","snapshot_observed_at":"2026-08-21T22:18:44.715830Z","submitted_at":"2021-04-09T16:43:11Z","title":"Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM","version":5},"cited_work":{"arxiv_id":"2104.04473","doi":"10.48550/arxiv.2104.04473","metadata_source":"pith","pith_arxiv_id":"2104.04473","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efﬁcient large-scale language model training on gpu clusters using megatron-lm","venue":"cs.CL","work_id":"cb405716-f30a-4004-aef0-12f4f12f0e20","year":2021},"citing_paper":{"arxiv_id":"2606.07857","last_updated":"2026-06-05T21:38:07Z","snapshot_observed_at":"2026-08-21T22:19:11.000832Z","submitted_at":"2026-06-05T21:38:07Z","title":"Model Multiplicity for Adversarial Detection in Small Language Model Training on Edge Devices","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-06-27T21:26:08.955055Z"},"links":{"cited_paper":"/paper/2104.04473","citing_paper":"/paper/2606.07857"},"observation_digest":"sha256:745a1aac0249bd1a727d80fe960c82039d4cda6ee4ec3e3b4d226566d5217bce","observation_id":"5c6e3757-cf93-446d-827b-e7eeb1a5facb","resolution":{"observed_at":"2026-07-02T19:37:19.322887Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:33.133437+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:33.133437+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.04473","last_updated":"2021-08-23T19:41:13Z","snapshot_observed_at":"2026-08-21T22:18:44.715830Z","submitted_at":"2021-04-09T16:43:11Z","title":"Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM","version":5},"cited_work":{"arxiv_id":"2104.04473","doi":"10.48550/arxiv.2104.04473","metadata_source":"pith","pith_arxiv_id":"2104.04473","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efﬁcient large-scale language model training on gpu clusters using megatron-lm","venue":"cs.CL","work_id":"cb405716-f30a-4004-aef0-12f4f12f0e20","year":2021},"citing_paper":{"arxiv_id":"2606.11169","last_updated":"2026-06-09T17:48:41Z","snapshot_observed_at":"2026-08-03T00:36:26.241446Z","submitted_at":"2026-06-09T17:48:41Z","title":"Piper: A Programmable Distributed Training System","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-27T11:34:02.562929Z"},"links":{"cited_paper":"/paper/2104.04473","citing_paper":"/paper/2606.11169"},"observation_digest":"sha256:7c81449881dd8b352843e16a4f24a5a2bb5ea63064c562f2d16552c75879054b","observation_id":"8ac83b28-42d8-4410-8f26-1dd54aa5ebbe","resolution":{"observed_at":"2026-07-03T07:57:44.655438Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:33.133437+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:33.133437+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.04473","last_updated":"2021-08-23T19:41:13Z","snapshot_observed_at":"2026-08-21T22:18:44.715830Z","submitted_at":"2021-04-09T16:43:11Z","title":"Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM","version":5},"cited_work":{"arxiv_id":"2104.04473","doi":"10.48550/arxiv.2104.04473","metadata_source":"pith","pith_arxiv_id":"2104.04473","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efﬁcient large-scale language model training on gpu clusters using megatron-lm","venue":"cs.CL","work_id":"cb405716-f30a-4004-aef0-12f4f12f0e20","year":2021},"citing_paper":{"arxiv_id":"2606.24937","last_updated":"2026-07-27T15:17:17Z","snapshot_observed_at":"2026-08-20T13:10:26.183805Z","submitted_at":"2026-06-22T17:48:54Z","title":"The Hitchhiker's Guide to Agentic AI: From Foundations to Systems","version":1},"reference_index":225,"source":"pdf_text","source_observed_at":"2026-06-26T08:09:57.542558Z"},"links":{"cited_paper":"/paper/2104.04473","citing_paper":"/paper/2606.24937"},"observation_digest":"sha256:33caa836d686d7ce824359d130a9ea8e3124ab500fd19d93d370bb6e04d54cdb","observation_id":"132e3e92-7590-4d9e-87c2-8672827fad05","resolution":{"observed_at":"2026-07-04T11:09:46.461495Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:33.133437+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:33.133437+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.04473","last_updated":"2021-08-23T19:41:13Z","snapshot_observed_at":"2026-08-21T22:18:44.715830Z","submitted_at":"2021-04-09T16:43:11Z","title":"Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.04473","snapshot_observed_at":"2026-08-02T10:27:18.508664Z","title":"Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM.arXiv Preprint arXiv:2104.04473, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.24937","last_updated":"2026-07-27T15:17:17Z","snapshot_observed_at":"2026-08-20T13:10:26.183805Z","submitted_at":"2026-06-22T17:48:54Z","title":"The Hitchhiker's Guide to Agentic AI: From Foundations to Systems","version":2},"reference_index":211,"source":"pdf_text","source_observed_at":"2026-08-02T10:27:18.508664Z"},"links":{"cited_paper":"/paper/2104.04473","citing_paper":"/paper/2606.24937"},"observation_digest":"sha256:1343c808d036ef38d4fddd710b8bf1477573a9687f06519416b9a073de3e4077","observation_id":"db29d1e9-7eb4-4784-8506-b0ee07621a42","resolution":{"observed_at":"2026-08-02T10:27:18.508664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.04473","last_updated":"2021-08-23T19:41:13Z","snapshot_observed_at":"2026-08-21T22:18:44.715830Z","submitted_at":"2021-04-09T16:43:11Z","title":"Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM","version":5},"cited_work":{"arxiv_id":"2104.04473","doi":"10.48550/arxiv.2104.04473","metadata_source":"pith","pith_arxiv_id":"2104.04473","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efﬁcient large-scale language model training on gpu clusters using megatron-lm","venue":"cs.CL","work_id":"cb405716-f30a-4004-aef0-12f4f12f0e20","year":2021},"citing_paper":{"arxiv_id":"2607.01646","last_updated":"2026-07-06T23:06:49Z","snapshot_observed_at":"2026-08-15T23:42:47.448277Z","submitted_at":"2026-07-02T03:17:58Z","title":"PHOENIX: Resilient LLM Training with Hot-Swapping via Zero-Overhead Checkpoint","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-03T17:26:07.870260Z"},"links":{"cited_paper":"/paper/2104.04473","citing_paper":"/paper/2607.01646"},"observation_digest":"sha256:17e25367d3a6e08de7a8700d9ffde7cb30ec955f16869048c9a8f2abdb77ab1f","observation_id":"78b96fde-1b39-415a-b5e3-11a9ee3918da","resolution":{"observed_at":"2026-07-03T17:28:43.916831Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:33.133437+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:33.133437+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.04473","last_updated":"2021-08-23T19:41:13Z","snapshot_observed_at":"2026-08-21T22:18:44.715830Z","submitted_at":"2021-04-09T16:43:11Z","title":"Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.04473","snapshot_observed_at":"2026-07-12T08:40:29.554554Z","title":"Efficient large-scale language model training on gpu clusters using megatron-lm,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.01646","last_updated":"2026-07-06T23:06:49Z","snapshot_observed_at":"2026-08-15T23:42:47.448277Z","submitted_at":"2026-07-02T03:17:58Z","title":"PHOENIX: Resilient LLM Training with Hot-Swapping via Zero-Overhead Checkpoint","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-12T08:40:29.554554Z"},"links":{"cited_paper":"/paper/2104.04473","citing_paper":"/paper/2607.01646"},"observation_digest":"sha256:95f8c586c8ff9b7ed9145485ad2c85a47ff2bdc9ed4ae5ea6c317a622b3086e3","observation_id":"e857b2bb-5386-442e-8cc5-6b2d1d92bfee","resolution":{"observed_at":"2026-07-12T08:40:29.554554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.04473","last_updated":"2021-08-23T19:41:13Z","snapshot_observed_at":"2026-08-21T22:18:44.715830Z","submitted_at":"2021-04-09T16:43:11Z","title":"Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.04473","snapshot_observed_at":"2026-07-12T02:29:52.764344Z","title":"Efficient","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05439","last_updated":"2026-07-03T15:50:24Z","snapshot_observed_at":"2026-08-17T14:06:36.120954Z","submitted_at":"2026-07-03T15:50:24Z","title":"Design-CP: Context Parallelism for Design of Protein Nanoparticles","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-07-12T02:29:52.764344Z"},"links":{"cited_paper":"/paper/2104.04473","citing_paper":"/paper/2607.05439"},"observation_digest":"sha256:bf3c31de4222bfecc9c51c80b91b5ff90fca30539e889d05903ae951b4593f4d","observation_id":"e919841b-30d3-4e66-a2d1-e594d06b6753","resolution":{"observed_at":"2026-07-12T02:29:52.764344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.04473","last_updated":"2021-08-23T19:41:13Z","snapshot_observed_at":"2026-08-21T22:18:44.715830Z","submitted_at":"2021-04-09T16:43:11Z","title":"Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM","version":5},"cited_work":{"arxiv_id":"2104.04473","doi":"10.48550/arxiv.2104.04473","metadata_source":"pith","pith_arxiv_id":"2104.04473","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efﬁcient large-scale language model training on gpu clusters using megatron-lm","venue":"cs.CL","work_id":"cb405716-f30a-4004-aef0-12f4f12f0e20","year":2021},"citing_paper":{"arxiv_id":"2607.07494","last_updated":"2026-07-08T14:55:51Z","snapshot_observed_at":"2026-08-15T04:18:15.955265Z","submitted_at":"2026-07-08T14:55:51Z","title":"GIFT: Geometry-Informed Low-precision Gradient Communication for LLM Pretraining","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-09T09:15:12.214083Z"},"links":{"cited_paper":"/paper/2104.04473","citing_paper":"/paper/2607.07494"},"observation_digest":"sha256:82156de5a1e0b9c0834881c43fdfd4cf58067134023bca08c9f9e0e1089e2912","observation_id":"7ed52c58-f009-466d-870c-16cd34446578","resolution":{"observed_at":"2026-07-09T09:16:06.525993Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:33.133437+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:33.133437+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.04473","last_updated":"2021-08-23T19:41:13Z","snapshot_observed_at":"2026-08-21T22:18:44.715830Z","submitted_at":"2021-04-09T16:43:11Z","title":"Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.04473","snapshot_observed_at":"2026-08-02T00:41:45.468565Z","title":"Qwen Team","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14952","last_updated":"2026-07-27T13:07:41Z","snapshot_observed_at":"2026-08-18T22:50:07.506369Z","submitted_at":"2026-07-16T13:00:32Z","title":"LongStraw: Long-Context RL Beyond 2M Tokens under a Fixed GPU Budget","version":3},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-02T00:41:45.468565Z"},"links":{"cited_paper":"/paper/2104.04473","citing_paper":"/paper/2607.14952"},"observation_digest":"sha256:8d923fe93aebb5410417f07e47e811edcf07ff0f18590dc1bb708934722c445e","observation_id":"00d01956-3547-4166-88a1-c427c5c4440e","resolution":{"observed_at":"2026-08-02T00:41:45.468565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.04473","last_updated":"2021-08-23T19:41:13Z","snapshot_observed_at":"2026-08-21T22:18:44.715830Z","submitted_at":"2021-04-09T16:43:11Z","title":"Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.04473","snapshot_observed_at":"2026-08-01T17:32:37.511773Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17644","last_updated":"2026-07-20T07:57:34Z","snapshot_observed_at":"2026-08-17T12:59:56.886335Z","submitted_at":"2026-07-20T07:57:34Z","title":"A Training-Memory Regression in MLA Sequence Parallelism: Why Megatron-Core Forbids Absorption, and LAGA -- a Communication-Efficient Fix","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-01T17:32:37.511773Z"},"links":{"cited_paper":"/paper/2104.04473","citing_paper":"/paper/2607.17644"},"observation_digest":"sha256:a16c49f34fad056a61ee098811c627377f242543e0355805c4a06964a95fcc61","observation_id":"73494bae-8a1d-4c9f-a9ac-3a3c3d90d1a0","resolution":{"observed_at":"2026-08-01T17:32:37.511773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.04473","last_updated":"2021-08-23T19:41:13Z","snapshot_observed_at":"2026-08-21T22:18:44.715830Z","submitted_at":"2021-04-09T16:43:11Z","title":"Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.04473","snapshot_observed_at":"2026-08-06T05:39:25.283911Z","title":"Eﬃcient large-scale language model train- ing on GPU clusters using Megatron-LM","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.05088","last_updated":"2026-08-05T17:26:47Z","snapshot_observed_at":"2026-08-14T10:08:31.742687Z","submitted_at":"2026-08-05T17:26:47Z","title":"MALT: Lightweight Curvature-Aware Muon via Diagonal Preconditioning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T05:39:25.283911Z"},"links":{"cited_paper":"/paper/2104.04473","citing_paper":"/paper/2608.05088"},"observation_digest":"sha256:2dc45f8cd804dc443964b35bdb6b53fc5bb9dc29af80a4a6ce0cce618ca6120c","observation_id":"af076d3f-fb73-4ce8-9211-432cca962ff0","resolution":{"observed_at":"2026-08-06T05:39:25.283911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.04473","last_updated":"2021-08-23T19:41:13Z","snapshot_observed_at":"2026-08-21T22:18:44.715830Z","submitted_at":"2021-04-09T16:43:11Z","title":"Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.04473","snapshot_observed_at":"2026-08-14T04:31:49.781442Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.08740","last_updated":"2026-08-09T14:36:19Z","snapshot_observed_at":"2026-08-20T11:25:07.234798Z","submitted_at":"2026-08-09T14:36:19Z","title":"Memory-Efficient Activation Checkpointing with Sliding Window and Hirschberg's Algorithm for 0/1 Knapsack Solving in PyTorch","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-14T04:31:49.781442Z"},"links":{"cited_paper":"/paper/2104.04473","citing_paper":"/paper/2608.08740"},"observation_digest":"sha256:85aa2cd90bd939215a8540e36356beb39deb55acf252134eae2327ff3f0a3d96","observation_id":"e931b501-2f67-4399-aabb-423c49c75522","resolution":{"observed_at":"2026-08-14T04:31:49.781442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.04473","last_updated":"2021-08-23T19:41:13Z","snapshot_observed_at":"2026-08-21T22:18:44.715830Z","submitted_at":"2021-04-09T16:43:11Z","title":"Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.04473","snapshot_observed_at":"2026-08-14T14:53:28.934067Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.13277","last_updated":"2026-08-13T14:13:46Z","snapshot_observed_at":"2026-08-18T09:20:16.562366Z","submitted_at":"2026-08-13T14:13:46Z","title":"Mixture of Training: Recombining Small-Scale Scaffolded Pretraining Runs into a Larger Language Model","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-14T14:53:28.934067Z"},"links":{"cited_paper":"/paper/2104.04473","citing_paper":"/paper/2608.13277"},"observation_digest":"sha256:39b56818e73ee33d0dde878ce6052d1a82bd690589e4d058a79cf7b6c7150645","observation_id":"1a8ef394-e7e8-4f03-adaf-c0e050621e9d","resolution":{"observed_at":"2026-08-14T14:53:28.934067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2104.04473/citation-record","integrity":"/paper/2104.04473/integrity","json":"/paper/2104.04473/citation-record.json","paper":"/paper/2104.04473"},"outbound":[],"paper":{"arxiv_id":"2104.04473","last_updated":"2021-08-23T19:41:13Z","latest_version":5,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-21T22:18:44.715830Z","submitted_at":"2021-04-09T16:43:11Z","title":"Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 49 inbound Pith citation observations for arXiv:2104.04473."}