{"as_of":"2026-08-16T09:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:de9ba53e30d062130dbf333efd1f719d1c4cb561d39f44ebc583c02563776b15","coverage":[{"denominator":88,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":88,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T23:08:28.873206Z","state":"measured"},{"denominator":89,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":89,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T18:38:58.883757Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T00:10:53.383914Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.21124","last_updated":"2025-03-16T21:10:15Z","snapshot_observed_at":"2026-08-14T23:33:35.228932Z","submitted_at":"2024-12-30T17:55:28Z","title":"Adaptive Batch Size Schedules for Distributed Training of Language Models with Data and Model Parallelism","version":2},"cited_work":{"arxiv_id":"2412.21124","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.21124","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"1b614ff8-c4e4-4fbc-b938-df553395a1f0","year":2025},"citing_paper":{"arxiv_id":"2604.06350","last_updated":"2026-04-17T20:11:31Z","snapshot_observed_at":"2026-08-07T20:25:45.792027Z","submitted_at":"2026-04-07T18:29:13Z","title":"Convergence of Riemannian Stochastic Gradient Descents: Varying Batch Sizes And Nonstandard Batch Forming","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T18:38:58.883757Z"},"links":{"cited_paper":"/paper/2412.21124","citing_paper":"/paper/2604.06350"},"observation_digest":"sha256:a14d666f3dfe98ec5a6a3a3a081389585f83949b7e23cae1bc280197ab03de19","observation_id":"3ef300f3-0353-4936-a83f-cac4e59f93c4","resolution":{"observed_at":"2026-05-11T00:10:53.387410Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.21124/citation-record","integrity":"/paper/2412.21124/integrity","json":"/paper/2412.21124/citation-record.json","paper":"/paper/2412.21124"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:08:26.118184Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.21124","last_updated":"2025-03-16T21:10:15Z","snapshot_observed_at":"2026-08-14T23:33:35.228932Z","submitted_at":"2024-12-30T17:55:28Z","title":"Adaptive Batch Size Schedules for Distributed Training of Language Models with Data and Model Parallelism","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T23:08:26.118184Z"},"links":{"citing_paper":"/paper/2412.21124"},"observation_digest":"sha256:09201d05f7867b027324850a24ec8333a32e2bce22a4fb0cd64b46636a5b28f1","observation_id":"b6810cf5-1d1c-4834-9b3b-ea411c930456","resolution":{"observed_at":"2026-08-10T23:08:26.118184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.04325","last_updated":"2017-11-12T17:36:46Z","snapshot_observed_at":"2026-08-15T20:48:03.082923Z","submitted_at":"2017-11-12T17:36:46Z","title":"Extremely Large Minibatch SGD: Training ResNet-50 on ImageNet in 15 Minutes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.04325","snapshot_observed_at":"2026-08-10T23:08:26.212271Z","title":"Extremely large minibatch SGD: Training ResNet-50 on ImageNet in 15 minutes.arXiv preprint arXiv:1711.04325, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.21124","last_updated":"2025-03-16T21:10:15Z","snapshot_observed_at":"2026-08-14T23:33:35.228932Z","submitted_at":"2024-12-30T17:55:28Z","title":"Adaptive Batch Size Schedules for Distributed Training of Language Models with Data and Model Parallelism","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T23:08:26.212271Z"},"links":{"cited_paper":"/paper/1711.04325","citing_paper":"/paper/2412.21124"},"observation_digest":"sha256:1ea7f0f87bd8ac41a4efeb6db2941c74b7f506bd25a5f89a75c705aa4a209afc","observation_id":"b4d1e638-3900-4a90-86bc-ff63b3adc3cc","resolution":{"observed_at":"2026-08-10T23:08:26.212271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-10T23:08:26.262650Z","title":"Qwen technical report.arXiv preprint arXiv:2309.16609, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.21124","last_updated":"2025-03-16T21:10:15Z","snapshot_observed_at":"2026-08-14T23:33:35.228932Z","submitted_at":"2024-12-30T17:55:28Z","title":"Adaptive Batch Size Schedules for Distributed Training of Language Models with Data and Model Parallelism","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T23:08:26.262650Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2412.21124"},"observation_digest":"sha256:2831f1173eb73387c9de37c4a7826123742826e5e048f0aafd85bc0252c866bc","observation_id":"84a20f5c-bdf2-4da6-9d0d-6056e3d8527e","resolution":{"observed_at":"2026-08-10T23:08:26.262650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:08:26.267815Z","title":"Coupling adaptive batch sizes with learning rates","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.21124","last_updated":"2025-03-16T21:10:15Z","snapshot_observed_at":"2026-08-14T23:33:35.228932Z","submitted_at":"2024-12-30T17:55:28Z","title":"Adaptive Batch Size Schedules for Distributed Training of Language Models with Data and Model Parallelism","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T23:08:26.267815Z"},"links":{"citing_paper":"/paper/2412.21124"},"observation_digest":"sha256:ac25c89b3de1d19b10d3248d0391df98580e1551eafd8880eaa99ccc30e21533","observation_id":"e363a1bf-ad3a-4431-a9ee-ebf276a9553a","resolution":{"observed_at":"2026-08-10T23:08:26.267815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17834","last_updated":"2024-02-27T19:00:07Z","snapshot_observed_at":"2026-08-13T04:08:50.424750Z","submitted_at":"2024-02-27T19:00:07Z","title":"Stable LM 2 1.6B Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17834","snapshot_observed_at":"2026-08-10T23:08:26.271570Z","title":"Stable LM 2 1.6B technical report.arXiv preprint arXiv:2402.17834, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.21124","last_updated":"2025-03-16T21:10:15Z","snapshot_observed_at":"2026-08-14T23:33:35.228932Z","submitted_at":"2024-12-30T17:55:28Z","title":"Adaptive Batch Size Schedules for Distributed Training of Language Models with Data and Model Parallelism","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T23:08:26.271570Z"},"links":{"cited_paper":"/paper/2402.17834","citing_paper":"/paper/2412.21124"},"observation_digest":"sha256:5039f9077ea2d085e56724c3cf7bd343f3a2b78a94fc6e4030255f377b935595","observation_id":"e7be17e8-052a-492e-8dfd-c091eb85b34f","resolution":{"observed_at":"2026-08-10T23:08:26.271570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05100","last_updated":"2023-06-27T09:57:58Z","snapshot_observed_at":"2026-08-04T18:56:03.233715Z","submitted_at":"2022-11-09T18:48:09Z","title":"BLOOM: A 176B-Parameter Open-Access Multilingual Language Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.05100","snapshot_observed_at":"2026-08-10T23:08:26.276815Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.21124","last_updated":"2025-03-16T21:10:15Z","snapshot_observed_at":"2026-08-14T23:33:35.228932Z","submitted_at":"2024-12-30T17:55:28Z","title":"Adaptive Batch Size Schedules for Distributed Training of Language Models with Data and Model Parallelism","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T23:08:26.276815Z"},"links":{"cited_paper":"/paper/2211.05100","citing_paper":"/paper/2412.21124"},"observation_digest":"sha256:d8da463b4c2d6f4009f163612247b1446ce24085705fcfd80676d184560072ff","observation_id":"de41598d-de41-4249-9e38-d6153b205e8a","resolution":{"observed_at":"2026-08-10T23:08:26.276815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:08:26.312733Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.21124","last_updated":"2025-03-16T21:10:15Z","snapshot_observed_at":"2026-08-14T23:33:35.228932Z","submitted_at":"2024-12-30T17:55:28Z","title":"Adaptive Batch Size Schedules for Distributed Training of Language Models with Data and Model Parallelism","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T23:08:26.312733Z"},"links":{"citing_paper":"/paper/2412.21124"},"observation_digest":"sha256:a0dd1753d66bcce344f3ec6fc48bdb80014e29aa039f5f3d70ae46c2557fb8d5","observation_id":"48f87ad8-556f-456e-8af3-b79a5c0de339","resolution":{"observed_at":"2026-08-10T23:08:26.312733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:08:26.440847Z","title":"Adaptive sampling strategies for stochastic optimization","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.21124","last_updated":"2025-03-16T21:10:15Z","snapshot_observed_at":"2026-08-14T23:33:35.228932Z","submitted_at":"2024-12-30T17:55:28Z","title":"Adaptive Batch Size Schedules for Distributed Training of Language Models with Data and Model Parallelism","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T23:08:26.440847Z"},"links":{"citing_paper":"/paper/2412.21124"},"observation_digest":"sha256:dc58758859f6155340fad49a5ce792fe492644d539f6e5a9479e1c0737863a15","observation_id":"0154dee3-e45b-4bc6-9507-a01fcdd8e549","resolution":{"observed_at":"2026-08-10T23:08:26.440847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:08:26.486876Z","title":"Curtis, and Jorge Nocedal","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.21124","last_updated":"2025-03-16T21:10:15Z","snapshot_observed_at":"2026-08-14T23:33:35.228932Z","submitted_at":"2024-12-30T17:55:28Z","title":"Adaptive Batch Size Schedules for Distributed Training of Language Models with Data and Model Parallelism","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T23:08:26.486876Z"},"links":{"citing_paper":"/paper/2412.21124"},"observation_digest":"sha256:dd7cde4979a3ff52e410072da130b21a20700f60e5b1ff608202ca4fb5defaa2","observation_id":"e54d7e66-2702-49f4-a396-a9a7e2f8d840","resolution":{"observed_at":"2026-08-10T23:08:26.486876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:08:26.491193Z","title":"JAX: composable transformations of Python+NumPy programs, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.21124","last_updated":"2025-03-16T21:10:15Z","snapshot_observed_at":"2026-08-14T23:33:35.228932Z","submitted_at":"2024-12-30T17:55:28Z","title":"Adaptive Batch Size Schedules for Distributed Training of Language Models with Data and Model Parallelism","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T23:08:26.491193Z"},"links":{"citing_paper":"/paper/2412.21124"},"observation_digest":"sha256:7e58b999b28567ca346bc740aeaa0c7644085a4bcbfc8101b1277e9d5add1165","observation_id":"23065d4c-fbea-43bd-b372-852a508c27d4","resolution":{"observed_at":"2026-08-10T23:08:26.491193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:08:26.495360Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.21124","last_updated":"2025-03-16T21:10:15Z","snapshot_observed_at":"2026-08-14T23:33:35.228932Z","submitted_at":"2024-12-30T17:55:28Z","title":"Adaptive Batch Size Schedules for Distributed Training of Language Models with Data and Model Parallelism","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T23:08:26.495360Z"},"links":{"citing_paper":"/paper/2412.21124"},"observation_digest":"sha256:38ddba2636e27d22b02324cdf53d4d5b47088321c7b9b84a1653f1488fdb8739","observation_id":"0caed567-023f-4a1d-8a3b-1d2683f1dd07","resolution":{"observed_at":"2026-08-10T23:08:26.495360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:08:26.501738Z","title":"Byrd, Gillian M","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2412.21124","last_updated":"2025-03-16T21:10:15Z","snapshot_observed_at":"2026-08-14T23:33:35.228932Z","submitted_at":"2024-12-30T17:55:28Z","title":"Adaptive Batch Size Schedules for Distributed Training of Language Models with Data and Model Parallelism","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T23:08:26.501738Z"},"links":{"citing_paper":"/paper/2412.21124"},"observation_digest":"sha256:dab23fba80a7904890b50fabcc4f2b2ec703394d0e0324ed96b4e1f057e9f221","observation_id":"d0eeab79-a6bc-47b0-b2fc-8445b74c20f9","resolution":{"observed_at":"2026-08-10T23:08:26.501738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1610.05792","last_updated":"2017-04-06T21:48:28Z","snapshot_observed_at":"2026-08-14T21:34:37.466937Z","submitted_at":"2016-10-18T20:24:10Z","title":"Big Batch SGD: Automated Inference using Adaptive Batch Sizes","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1610.05792","snapshot_observed_at":"2026-08-10T23:08:26.505657Z","title":"Big batch SGD: Automated inference using adaptive batch sizes.arXiv preprint arXiv:1610.05792, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.21124","last_updated":"2025-03-16T21:10:15Z","snapshot_observed_at":"2026-08-14T23:33:35.228932Z","submitted_at":"2024-12-30T17:55:28Z","title":"Adaptive Batch Size Schedules for Distributed Training of Language Models with Data and Model Parallelism","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T23:08:26.505657Z"},"links":{"cited_paper":"/paper/1610.05792","citing_paper":"/paper/2412.21124"},"observation_digest":"sha256:4815211d4adddf7ece1f59c13e1c70759bf2714e4a029ad5a788624b9d50be3c","observation_id":"c6be660f-e3e5-4157-b5c8-1d6ac47cf887","resolution":{"observed_at":"2026-08-10T23:08:26.505657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:08:31.504115Z","title":"Automated inference with adaptive batches","venue":null,"work_id":"defaa83f-cbb5-45fe-89aa-2402dbc26891","year":2017},"citing_paper":{"arxiv_id":"2412.21124","last_updated":"2025-03-16T21:10:15Z","snapshot_observed_at":"2026-08-14T23:33:35.228932Z","submitted_at":"2024-12-30T17:55:28Z","title":"Adaptive Batch Size Schedules for Distributed Training of Language Models with Data and Model Parallelism","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T23:08:26.510052Z"},"links":{"citing_paper":"/paper/2412.21124"},"observation_digest":"sha256:9054f454f4311de2e96b345ec470677734845663fd3dfdfd7ce80c1843fd82bb","observation_id":"35e837c6-2948-45ac-95f5-cd22a7fe7355","resolution":{"observed_at":"2026-08-10T23:08:31.508603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-10T23:08:26.514375Z","title":"Zhang, Hanwei Xu, Hao Yang, Haowei Zhang, Honghui Ding, Huajian Xin, Huazuo Gao, Hui Li, Hui Qu, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.21124","last_updated":"2025-03-16T21:10:15Z","snapshot_observed_at":"2026-08-14T23:33:35.228932Z","submitted_at":"2024-12-30T17:55:28Z","title":"Adaptive Batch Size Schedules for Distributed Training of Language Models with Data and Model Parallelism","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T23:08:26.514375Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2412.21124"},"observation_digest":"sha256:2f4d80ff4ad2a4d113bfbafbd12a39a791dc7d972ba42d95fe7d132a103ed36c","observation_id":"4b30ab26-4207-4482-920c-93f59be5f71e","resolution":{"observed_at":"2026-08-10T23:08:26.514375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-15T17:27:11.980940Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-10T23:08:26.574840Z","title":"Zhang, Han Bao, Hanwei Xu, Haocheng Wang, Haowei Zhang, Honghui Ding, Huajian Xin, Huazuo Gao, Hui Li, Hui Qu, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.21124","last_updated":"2025-03-16T21:10:15Z","snapshot_observed_at":"2026-08-14T23:33:35.228932Z","submitted_at":"2024-12-30T17:55:28Z","title":"Adaptive Batch Size Schedules for Distributed Training of Language Models with Data and Model Parallelism","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T23:08:26.574840Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2412.21124"},"observation_digest":"sha256:14bb97bbd84aad99835243ed9b3324e0fb31e9313cf5c254ec4b66f1f20d2696","observation_id":"15bc84be-5671-4d28-8a77-668b9b38bd04","resolution":{"observed_at":"2026-08-10T23:08:26.574840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.02029","last_updated":"2018-02-14T04:26:45Z","snapshot_observed_at":"2026-08-15T11:15:00.071795Z","submitted_at":"2017-12-06T04:19:14Z","title":"AdaBatch: Adaptive Batch Sizes for Training Deep Neural Networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.02029","snapshot_observed_at":"2026-08-10T23:08:26.676251Z","title":"Adabatch: Adaptive batch sizes for training deep neural networks.arXiv preprint arXiv:1712.02029, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.21124","last_updated":"2025-03-16T21:10:15Z","snapshot_observed_at":"2026-08-14T23:33:35.228932Z","submitted_at":"2024-12-30T17:55:28Z","title":"Adaptive Batch Size Schedules for Distributed Training of Language Models with Data and Model Parallelism","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T23:08:26.676251Z"},"links":{"cited_paper":"/paper/1712.02029","citing_paper":"/paper/2412.21124"},"observation_digest":"sha256:68027d0bc8935a4da5f58a72e254b7d6a102e5124ee70a7b42bba8eb07262825","observation_id":"987fb9ad-f1b0-40b2-8a3d-0e4f7f93e3ab","resolution":{"observed_at":"2026-08-10T23:08:26.676251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:08:27.007580Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.21124","last_updated":"2025-03-16T21:10:15Z","snapshot_observed_at":"2026-08-14T23:33:35.228932Z","submitted_at":"2024-12-30T17:55:28Z","title":"Adaptive Batch Size Schedules for Distributed Training of Language Models with Data and Model Parallelism","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T23:08:27.007580Z"},"links":{"citing_paper":"/paper/2412.21124"},"observation_digest":"sha256:3c9117e58bc5fd041fd59cba0142663d05c350dd244de99a00db71163bb712af","observation_id":"13543c64-9340-4ab2-b218-39a27f7781cf","resolution":{"observed_at":"2026-08-10T23:08:27.007580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:08:31.457426Z","title":"Susskind, and Armand Joulin","venue":null,"work_id":"fb47c690-e8b1-4cf6-8ab0-e6f392661b95","year":2024},"citing_paper":{"arxiv_id":"2412.21124","last_updated":"2025-03-16T21:10:15Z","snapshot_observed_at":"2026-08-14T23:33:35.228932Z","submitted_at":"2024-12-30T17:55:28Z","title":"Adaptive Batch Size Schedules for Distributed Training of Language Models with Data and Model Parallelism","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T23:08:27.787032Z"},"links":{"citing_paper":"/paper/2412.21124"},"observation_digest":"sha256:8c58b4df98d4e85e73d54a5afdb7bf79f4a7d12fb835065af95d71c1cf2b88e2","observation_id":"b961533f-5b32-49cb-a584-d36ecb1e2447","resolution":{"observed_at":"2026-08-10T23:08:31.486551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:08:31.411981Z","title":"PyTorch Lightning, 2019","venue":null,"work_id":"154dd668-3095-4bc6-b510-fc7d41f58d53","year":2019},"citing_paper":{"arxiv_id":"2412.21124","last_updated":"2025-03-16T21:10:15Z","snapshot_observed_at":"2026-08-14T23:33:35.228932Z","submitted_at":"2024-12-30T17:55:28Z","title":"Adaptive Batch Size Schedules for Distributed Training of Language Models with Data and Model Parallelism","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T23:08:27.838868Z"},"links":{"citing_paper":"/paper/2412.21124"},"observation_digest":"sha256:543a11e3b45431f8f7b5cb44158c0afd28e9651fc497e9625dd353bdd6fcac54","observation_id":"29e69ced-3080-4adc-8562-8aea5b81ec8c","resolution":{"observed_at":"2026-08-10T23:08:31.416593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:08:31.396775Z","title":"Friedlander and Mark Schmidt","venue":null,"work_id":"66c2bdf4-8955-4c93-9ab7-5f94f8abf354","year":2012},"citing_paper":{"arxiv_id":"2412.21124","last_updated":"2025-03-16T21:10:15Z","snapshot_observed_at":"2026-08-14T23:33:35.228932Z","submitted_at":"2024-12-30T17:55:28Z","title":"Adaptive Batch Size Schedules for Distributed Training of Language Models with Data and Model Parallelism","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T23:08:27.843948Z"},"links":{"citing_paper":"/paper/2412.21124"},"observation_digest":"sha256:d5ef909db59603ef1bd3d542278898b11a4ead49508f19d02e97658031352de2","observation_id":"38fb4cec-205f-4ba5-b869-2103668853ad","resolution":{"observed_at":"2026-08-10T23:08:31.402273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:08:31.298579Z","title":"Compiling machine learning programs via high-level tracing","venue":null,"work_id":"a6c4aad9-dbd8-4684-9d31-08bcc692315f","year":2018},"citing_paper":{"arxiv_id":"2412.21124","last_updated":"2025-03-16T21:10:15Z","snapshot_observed_at":"2026-08-14T23:33:35.228932Z","submitted_at":"2024-12-30T17:55:28Z","title":"Adaptive Batch Size Schedules for Distributed Training of Language Models with Data and Model Parallelism","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T23:08:27.849740Z"},"links":{"citing_paper":"/paper/2412.21124"},"observation_digest":"sha256:0ef75254ede5e1287e12820afb3a7b4d8b046cf4bb5a5cfbf14a08bd2d0d13bc","observation_id":"13baffce-448c-4f9c-9c6c-e347e157cb1a","resolution":{"observed_at":"2026-08-10T23:08:31.303387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-02T16:20:09.773989Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-08-10T23:08:27.854625Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.21124","last_updated":"2025-03-16T21:10:15Z","snapshot_observed_at":"2026-08-14T23:33:35.228932Z","submitted_at":"2024-12-30T17:55:28Z","title":"Adaptive Batch Size Schedules for Distributed Training of Language Models with Data and Model Parallelism","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T23:08:27.854625Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2412.21124"},"observation_digest":"sha256:7fdf09d5c9c188a239dd5799a2675741e4411a02a5fab1cf309d79d3326a23a7","observation_id":"cf72c474-a5cb-42c7-9018-3fb9dcfd2392","resolution":{"observed_at":"2026-08-10T23:08:27.854625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-10T23:08:27.860027Z","title":"Gemma: Open models based on Gemini research and technology","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.21124","last_updated":"2025-03-16T21:10:15Z","snapshot_observed_at":"2026-08-14T23:33:35.228932Z","submitted_at":"2024-12-30T17:55:28Z","title":"Adaptive Batch Size Schedules for Distributed Training of Language Models with Data and Model Parallelism","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T23:08:27.860027Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2412.21124"},"observation_digest":"sha256:be929333d7b8596c82c9ca84b06203b78bd37e35e9bf80a4a91ee760d201431b","observation_id":"9ac85a57-6330-4013-bb12-7df6911a50a6","resolution":{"observed_at":"2026-08-10T23:08:27.860027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:08:31.284896Z","title":"OpenLLaMA: An open reproduction of LLaMA, May 2023","venue":null,"work_id":"da1b0d8d-3e90-44d6-bb5e-1f85cbe972d9","year":2023},"citing_paper":{"arxiv_id":"2412.21124","last_updated":"2025-03-16T21:10:15Z","snapshot_observed_at":"2026-08-14T23:33:35.228932Z","submitted_at":"2024-12-30T17:55:28Z","title":"Adaptive Batch Size Schedules for Distributed Training of Language Models with Data and Model Parallelism","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T23:08:27.863843Z"},"links":{"citing_paper":"/paper/2412.21124"},"observation_digest":"sha256:0b57ecaff013ad715ae88cf4a2a969bd357c124d4b80eb8e17ce7645f00657f5","observation_id":"a3ed2a93-05a1-4f3d-aa6c-667d7e12fdf4","resolution":{"observed_at":"2026-08-10T23:08:31.288817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.02677","last_updated":"2018-04-30T21:53:41Z","snapshot_observed_at":"2026-08-09T05:23:26.365677Z","submitted_at":"2017-06-08T16:51:53Z","title":"Accurate, Large Minibatch SGD: Training ImageNet in 1 Hour","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.02677","snapshot_observed_at":"2026-08-10T23:08:27.940336Z","title":"Accurate, large minibatch SGD: Training ImageNet in 1 hour","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.21124","last_updated":"2025-03-16T21:10:15Z","snapshot_observed_at":"2026-08-14T23:33:35.228932Z","submitted_at":"2024-12-30T17:55:28Z","title":"Adaptive Batch Size Schedules for Distributed Training of Language Models with Data and Model Parallelism","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T23:08:27.940336Z"},"links":{"cited_paper":"/paper/1706.02677","citing_paper":"/paper/2412.21124"},"observation_digest":"sha256:c674ecececfb2abce779b73296a3d57a30873809b0a040a5321279680699a079","observation_id":"c6ef5449-5106-4836-bb71-1b19318437a1","resolution":{"observed_at":"2026-08-10T23:08:27.940336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00838","last_updated":"2024-06-07T21:59:52Z","snapshot_observed_at":"2026-07-06T17:23:51.547578Z","submitted_at":"2024-02-01T18:28:55Z","title":"OLMo: Accelerating the Science of Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00838","snapshot_observed_at":"2026-08-10T23:08:27.945364Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.21124","last_updated":"2025-03-16T21:10:15Z","snapshot_observed_at":"2026-08-14T23:33:35.228932Z","submitted_at":"2024-12-30T17:55:28Z","title":"Adaptive Batch Size Schedules for Distributed Training of Language Models with Data and Model Parallelism","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T23:08:27.945364Z"},"links":{"cited_paper":"/paper/2402.00838","citing_paper":"/paper/2412.21124"},"observation_digest":"sha256:c475115492d61bd2a36df8aaeb0ca1aa9d3cb5f1706f80e9d755f81849781698","observation_id":"ac423a62-c31f-41a4-906f-d01ac3142681","resolution":{"observed_at":"2026-08-10T23:08:27.945364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.13442","last_updated":"2023-02-19T01:24:51Z","snapshot_observed_at":"2026-08-13T12:54:36.786407Z","submitted_at":"2023-01-31T06:38:53Z","title":"Scaling laws for single-agent reinforcement learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.13442","snapshot_observed_at":"2026-08-10T23:08:27.949748Z","title":"Scaling laws for single-agent reinforcement learning.arXiv preprint arXiv:2301.13442, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.21124","last_updated":"2025-03-16T21:10:15Z","snapshot_observed_at":"2026-08-14T23:33:35.228932Z","submitted_at":"2024-12-30T17:55:28Z","title":"Adaptive Batch Size Schedules for Distributed Training of Language Models with Data and Model Parallelism","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T23:08:27.949748Z"},"links":{"cited_paper":"/paper/2301.13442","citing_paper":"/paper/2412.21124"},"observation_digest":"sha256:ef7448464e018c630091646d88e458bdd36a257d5fbde8f700da92d8ead6e5f9","observation_id":"b5c3fcb0-70c9-4acf-9a10-3e43e0d12e93","resolution":{"observed_at":"2026-08-10T23:08:27.949748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:08:31.181516Z","title":"Train longer, generalize better: closing the generalization gap in large batch training of neural networks","venue":null,"work_id":"66ab6497-6132-4e98-b891-beb7825eea05","year":2017},"citing_paper":{"arxiv_id":"2412.21124","last_updated":"2025-03-16T21:10:15Z","snapshot_observed_at":"2026-08-14T23:33:35.228932Z","submitted_at":"2024-12-30T17:55:28Z","title":"Adaptive Batch Size Schedules for Distributed Training of Language Models with Data and Model Parallelism","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T23:08:27.954773Z"},"links":{"citing_paper":"/paper/2412.21124"},"observation_digest":"sha256:1ce011cc419eae080676dd1a39fc28540e959fb802824a31066da878d22725d2","observation_id":"51935083-cbe8-4bab-932a-60ee23cdffa6","resolution":{"observed_at":"2026-08-10T23:08:31.275809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-10T23:08:27.958688Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.21124","last_updated":"2025-03-16T21:10:15Z","snapshot_observed_at":"2026-08-14T23:33:35.228932Z","submitted_at":"2024-12-30T17:55:28Z","title":"Adaptive Batch Size Schedules for Distributed Training of Language Models with Data and Model Parallelism","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T23:08:27.958688Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2412.21124"},"observation_digest":"sha256:d4eb267ee7123cce00fc45e2c6acbba064d87c9ddecd96f7176cb2ea5c3502ed","observation_id":"78be173c-05ad-4d19-b32c-bd48f41bc3c7","resolution":{"observed_at":"2026-08-10T23:08:27.958688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00576","last_updated":"2023-10-01T05:25:24Z","snapshot_observed_at":"2026-08-13T06:00:02.930846Z","submitted_at":"2023-10-01T05:25:24Z","title":"GrowLength: Accelerating LLMs Pretraining by Progressively Growing Training Length","version":1},"cited_work":{"arxiv_id":"2310.00576","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.00576","snapshot_observed_at":"2026-08-10T23:08:29.202235Z","title":"GrowLength: Accelerating LLMs Pretraining by Progressively Growing Training Length","venue":"cs.CL","work_id":"89d8730b-69f8-43d9-834f-e436694203f6","year":2023},"citing_paper":{"arxiv_id":"2412.21124","last_updated":"2025-03-16T21:10:15Z","snapshot_observed_at":"2026-08-14T23:33:35.228932Z","submitted_at":"2024-12-30T17:55:28Z","title":"Adaptive Batch Size Schedules for Distributed Training of Language Models with Data and Model Parallelism","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T23:08:27.964430Z"},"links":{"cited_paper":"/paper/2310.00576","citing_paper":"/paper/2412.21124"},"observation_digest":"sha256:c42776195c4ca0fb249381869bdccf19dbbf32d0e43a6f54251e1395444d9f40","observation_id":"17c167d4-30b6-4bdd-819a-27934a167b44","resolution":{"observed_at":"2026-08-10T23:08:29.256142Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:08:31.167363Z","title":"AdaScale SGD: A user-friendly algorithm for distributed training","venue":null,"work_id":"36006af4-3754-45da-9c4b-c66ce26058f5","year":2020},"citing_paper":{"arxiv_id":"2412.21124","last_updated":"2025-03-16T21:10:15Z","snapshot_observed_at":"2026-08-14T23:33:35.228932Z","submitted_at":"2024-12-30T17:55:28Z","title":"Adaptive Batch Size Schedules for Distributed Training of Language Models with Data and Model Parallelism","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T23:08:28.018228Z"},"links":{"citing_paper":"/paper/2412.21124"},"observation_digest":"sha256:862854baa82cb001aea51b93e5aff375e4fdefbdf46bcbb614b072197e86fab5","observation_id":"1760b5be-98d9-4526-b657-3081a272bab5","resolution":{"observed_at":"2026-08-10T23:08:31.172939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-10T23:08:28.022357Z","title":"Brown, Benjamin Chess, Rewon Child, Scott Gray, Alec Radford, Jeffrey Wu, and Dario Amodei","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2412.21124","last_updated":"2025-03-16T21:10:15Z","snapshot_observed_at":"2026-08-14T23:33:35.228932Z","submitted_at":"2024-12-30T17:55:28Z","title":"Adaptive Batch Size Schedules for Distributed Training of Language Models with Data and Model Parallelism","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T23:08:28.022357Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2412.21124"},"observation_digest":"sha256:d4e005c5ba5bc7ab2d5755596800416297a61b9c4608b7f967af3920f1685607","observation_id":"f48c3594-b81e-4b68-8d15-4c9f33f392e6","resolution":{"observed_at":"2026-08-10T23:08:28.022357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:08:31.107718Z","title":"On large-batch training for deep learning: Generalization gap and sharp minima","venue":null,"work_id":"aee7c6a5-dc8c-4d2a-850d-07613c335913","year":2017},"citing_paper":{"arxiv_id":"2412.21124","last_updated":"2025-03-16T21:10:15Z","snapshot_observed_at":"2026-08-14T23:33:35.228932Z","submitted_at":"2024-12-30T17:55:28Z","title":"Adaptive Batch Size Schedules for Distributed Training of Language Models with Data and Model Parallelism","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T23:08:28.026043Z"},"links":{"citing_paper":"/paper/2412.21124"},"observation_digest":"sha256:d4d6053d3a78960c8ae030c6d41a09071e898feb7995e27b709184edfc8fb018","observation_id":"17647574-453a-49ec-af1d-8bfb0abe4257","resolution":{"observed_at":"2026-08-10T23:08:31.146639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:08:28.030194Z","title":"Better theory for SGD in the nonconvex world.Transactions on Machine Learning Research, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.21124","last_updated":"2025-03-16T21:10:15Z","snapshot_observed_at":"2026-08-14T23:33:35.228932Z","submitted_at":"2024-12-30T17:55:28Z","title":"Adaptive Batch Size Schedules for Distributed Training of Language Models with Data and Model Parallelism","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T23:08:28.030194Z"},"links":{"citing_paper":"/paper/2412.21124"},"observation_digest":"sha256:ef940a05d241093c2c277efc32b7f576c24173760b88e67f45b14e05a6683867","observation_id":"a94984a0-e9fb-43e4-b2d8-10affe2a0b38","resolution":{"observed_at":"2026-08-10T23:08:28.030194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:08:31.055512Z","title":"Kingma and Jimmy Lei Ba","venue":null,"work_id":"6079e5c5-c07e-484d-a90f-7cb430c9dc1f","year":2015},"citing_paper":{"arxiv_id":"2412.21124","last_updated":"2025-03-16T21:10:15Z","snapshot_observed_at":"2026-08-14T23:33:35.228932Z","submitted_at":"2024-12-30T17:55:28Z","title":"Adaptive Batch Size Schedules for Distributed Training of Language Models with Data and Model Parallelism","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T23:08:28.033499Z"},"links":{"citing_paper":"/paper/2412.21124"},"observation_digest":"sha256:35165ffb743386b64ce84e18d6e4aaf9a9efc4524e3cca1b482ecc2f571d6ece","observation_id":"a5e987de-2f6f-4743-89b1-93ad0cfb3414","resolution":{"observed_at":"2026-08-10T23:08:31.060307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:08:31.039231Z","title":"Reducing activation recomputation in large transformer models","venue":null,"work_id":"17790cb8-2589-4188-a58f-78a8b9c88070","year":2023},"citing_paper":{"arxiv_id":"2412.21124","last_updated":"2025-03-16T21:10:15Z","snapshot_observed_at":"2026-08-14T23:33:35.228932Z","submitted_at":"2024-12-30T17:55:28Z","title":"Adaptive Batch Size Schedules for Distributed Training of Language Models with Data and Model Parallelism","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T23:08:28.037092Z"},"links":{"citing_paper":"/paper/2412.21124"},"observation_digest":"sha256:d4fc7eeed161fcb8e6c7ea9ea340ff9b250bdd481bd1303ab0f57d6aa6aae6a4","observation_id":"347cc37f-44ae-4a79-b544-a41c08c30de7","resolution":{"observed_at":"2026-08-10T23:08:31.045296Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:08:30.945586Z","title":null,"venue":null,"work_id":"7d6ba7d8-8efc-47b3-aa50-85320643d9fd","year":2012},"citing_paper":{"arxiv_id":"2412.21124","last_updated":"2025-03-16T21:10:15Z","snapshot_observed_at":"2026-08-14T23:33:35.228932Z","submitted_at":"2024-12-30T17:55:28Z","title":"Adaptive Batch Size Schedules for Distributed Training of Language Models with Data and Model Parallelism","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T23:08:28.041594Z"},"links":{"citing_paper":"/paper/2412.21124"},"observation_digest":"sha256:2102c92b5708c1a571658a10eeead3f1df8b5e945b231dc0c6774a1be4c865b5","observation_id":"6c6e722c-e118-4edf-b158-1dec81a7baf7","resolution":{"observed_at":"2026-08-10T23:08:30.949976Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:08:30.932562Z","title":"Noise is not the main factor behind the gap between SGD and Adam on transformers, but sign descent might be","venue":null,"work_id":"ac811113-c851-48b3-8541-883f6b7fa68b","year":2023},"citing_paper":{"arxiv_id":"2412.21124","last_updated":"2025-03-16T21:10:15Z","snapshot_observed_at":"2026-08-14T23:33:35.228932Z","submitted_at":"2024-12-30T17:55:28Z","title":"Adaptive Batch Size Schedules for Distributed Training of Language Models with Data and Model Parallelism","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T23:08:28.086417Z"},"links":{"citing_paper":"/paper/2412.21124"},"observation_digest":"sha256:1cccfc1e3a9570aad0193bc22faa05cf4966395166ad2eccf30210bad28d5d8e","observation_id":"c3a741b7-853d-4ea0-a2b0-fe8418af1843","resolution":{"observed_at":"2026-08-10T23:08:30.936710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19449","last_updated":"2024-07-12T05:10:32Z","snapshot_observed_at":"2026-08-13T23:00:40.138051Z","submitted_at":"2024-02-29T18:47:52Z","title":"Heavy-Tailed Class Imbalance and Why Adam Outperforms Gradient Descent on Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19449","snapshot_observed_at":"2026-08-10T23:08:28.116499Z","title":"Heavy-tailed class imbalance and why Adam outperforms gradient descent on language models.arXiv preprint arXiv:2402.19449, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.21124","last_updated":"2025-03-16T21:10:15Z","snapshot_observed_at":"2026-08-14T23:33:35.228932Z","submitted_at":"2024-12-30T17:55:28Z","title":"Adaptive Batch Size Schedules for Distributed Training of Language Models with Data and Model Parallelism","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T23:08:28.116499Z"},"links":{"cited_paper":"/paper/2402.19449","citing_paper":"/paper/2412.21124"},"observation_digest":"sha256:4adf24a8cb36e3754b7765eb4f8fab499c156d6684ff79c148bafaaa5fd44a3e","observation_id":"2f3cd7b1-45a6-4f41-be3f-4401f52edc0a","resolution":{"observed_at":"2026-08-10T23:08:28.116499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.13936","last_updated":"2024-11-06T04:53:36Z","snapshot_observed_at":"2026-08-12T23:38:47.930844Z","submitted_at":"2024-06-20T02:08:50Z","title":"Communication-Efficient Adaptive Batch Size Strategies for Distributed Local Gradient Methods","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.13936","snapshot_observed_at":"2026-08-10T23:08:28.119718Z","title":"Communication-efficient adaptive batch size strategies for distributed local gradient methods.arXiv preprint arXiv:2406.13936, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.21124","last_updated":"2025-03-16T21:10:15Z","snapshot_observed_at":"2026-08-14T23:33:35.228932Z","submitted_at":"2024-12-30T17:55:28Z","title":"Adaptive Batch Size Schedules for Distributed Training of Language Models with Data and Model Parallelism","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T23:08:28.119718Z"},"links":{"cited_paper":"/paper/2406.13936","citing_paper":"/paper/2412.21124"},"observation_digest":"sha256:49686676fb1975e7c574c263ec2b70ba94a486276a88aff75ed7908cd931f686","observation_id":"6560157b-eab2-4e15-89df-67a2ec763523","resolution":{"observed_at":"2026-08-10T23:08:28.119718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11215","last_updated":"2024-05-28T05:40:38Z","snapshot_observed_at":"2026-08-13T20:00:59.897101Z","submitted_at":"2024-02-17T07:49:50Z","title":"AdAdaGrad: Adaptive Batch Size Schemes for Adaptive Gradient Methods","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11215","snapshot_observed_at":"2026-08-10T23:08:28.123888Z","title":"arXiv preprint arXiv:2402.11215, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.21124","last_updated":"2025-03-16T21:10:15Z","snapshot_observed_at":"2026-08-14T23:33:35.228932Z","submitted_at":"2024-12-30T17:55:28Z","title":"Adaptive Batch Size Schedules for Distributed Training of Language Models with Data and Model Parallelism","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T23:08:28.123888Z"},"links":{"cited_paper":"/paper/2402.11215","citing_paper":"/paper/2412.21124"},"observation_digest":"sha256:07b558e237bc4c3af49346e1fcdb6f9ae71e340340b89d0c1ebdc5c162ea7ec0","observation_id":"2928c122-0501-4787-9a67-f490766b7b7a","resolution":{"observed_at":"2026-08-10T23:08:28.123888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:08:30.805135Z","title":"Orr, and Klaus Robert Müller","venue":null,"work_id":"a1515911-31d7-4df2-bebb-8c97581d7094","year":2002},"citing_paper":{"arxiv_id":"2412.21124","last_updated":"2025-03-16T21:10:15Z","snapshot_observed_at":"2026-08-14T23:33:35.228932Z","submitted_at":"2024-12-30T17:55:28Z","title":"Adaptive Batch Size Schedules for Distributed Training of Language Models with Data and Model Parallelism","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T23:08:28.128430Z"},"links":{"citing_paper":"/paper/2412.21124"},"observation_digest":"sha256:c179ecabfa64f5695cc30a7f0d4b0dd1e997b6eeaff9651a1a41bcbb6bcb22bd","observation_id":"0085f04e-753d-40ad-9c68-87cb0bf298a9","resolution":{"observed_at":"2026-08-10T23:08:30.901128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:08:28.132217Z","title":"GShard: Scaling giant models with conditional computation and automatic sharding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.21124","last_updated":"2025-03-16T21:10:15Z","snapshot_observed_at":"2026-08-14T23:33:35.228932Z","submitted_at":"2024-12-30T17:55:28Z","title":"Adaptive Batch Size Schedules for Distributed Training of Language Models with Data and Model Parallelism","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T23:08:28.132217Z"},"links":{"citing_paper":"/paper/2412.21124"},"observation_digest":"sha256:f737ff24339b88113f56f821d39fc241785347102c0a5076a927008880bd08b8","observation_id":"38d7e523-8b65-408a-bd78-b257912d9c85","resolution":{"observed_at":"2026-08-10T23:08:28.132217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:08:30.784018Z","title":"The stability-efficiency dilemma: Investigating sequence length warmup for training GPT models.Advances in Neural Information Processing Systems (NeurIPS), 2022","venue":null,"work_id":"9ae73aac-cc87-428b-8bd7-db24b0b9ee3f","year":2022},"citing_paper":{"arxiv_id":"2412.21124","last_updated":"2025-03-16T21:10:15Z","snapshot_observed_at":"2026-08-14T23:33:35.228932Z","submitted_at":"2024-12-30T17:55:28Z","title":"Adaptive Batch Size Schedules for Distributed Training of Language Models with Data and Model Parallelism","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T23:08:28.135256Z"},"links":{"citing_paper":"/paper/2412.21124"},"observation_digest":"sha256:60412d9896ecdbf00b31b3d13757e4ee4440b131849ac769bc9f5660f94eaa7b","observation_id":"e8fd0fe8-57ef-4aa5-92c7-0ac612b66797","resolution":{"observed_at":"2026-08-10T23:08:30.788644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:08:30.772643Z","title":"PyTorch distributed: Experiences on accelerating data parallel training","venue":null,"work_id":"e1cb37df-0624-49dd-b84d-3fd9e5aa8dcc","year":2020},"citing_paper":{"arxiv_id":"2412.21124","last_updated":"2025-03-16T21:10:15Z","snapshot_observed_at":"2026-08-14T23:33:35.228932Z","submitted_at":"2024-12-30T17:55:28Z","title":"Adaptive Batch Size Schedules for Distributed Training of Language Models with Data and Model Parallelism","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T23:08:28.139259Z"},"links":{"citing_paper":"/paper/2412.21124"},"observation_digest":"sha256:dc6119f300fdd3c023d53fdb74b211c754fb6d53684d10712aeda1cd2258b4b8","observation_id":"fd20966e-19e9-431f-9293-2f6afc57c197","resolution":{"observed_at":"2026-08-10T23:08:30.776699Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:08:30.694893Z","title":"TorchTitan: One-stop PyTorch native solution for production ready LLM pre-training","venue":null,"work_id":"da0630d2-e74a-4009-af69-9269235e8f52","year":2025},"citing_paper":{"arxiv_id":"2412.21124","last_updated":"2025-03-16T21:10:15Z","snapshot_observed_at":"2026-08-14T23:33:35.228932Z","submitted_at":"2024-12-30T17:55:28Z","title":"Adaptive Batch Size Schedules for Distributed Training of Language Models with Data and Model Parallelism","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T23:08:28.142617Z"},"links":{"citing_paper":"/paper/2412.21124"},"observation_digest":"sha256:c95973aa46be7cc80c765a8c2cfddd54f8234b5b3ff16d9ddb7cb73725626b05","observation_id":"80ff2617-719a-41af-9d88-a06457a4f1c6","resolution":{"observed_at":"2026-08-10T23:08:30.762450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:08:30.681428Z","title":"LitGPT, 2023","venue":null,"work_id":"f1794f1a-c488-42b5-9942-6c6baf6b7f2c","year":2023},"citing_paper":{"arxiv_id":"2412.21124","last_updated":"2025-03-16T21:10:15Z","snapshot_observed_at":"2026-08-14T23:33:35.228932Z","submitted_at":"2024-12-30T17:55:28Z","title":"Adaptive Batch Size Schedules for Distributed Training of Language Models with Data and Model Parallelism","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T23:08:28.191665Z"},"links":{"citing_paper":"/paper/2412.21124"},"observation_digest":"sha256:b50d5a4223dd457cdfba14bca27cdb90ab6dc3731155e62f3181b2b54e8e0749","observation_id":"58b284de-9ed3-4d16-8f14-8f780d34b680","resolution":{"observed_at":"2026-08-10T23:08:30.685452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-07-31T22:31:37.910868Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-10T23:08:28.197709Z","title":"RoBERTa: A robustly optimized BERT pretraining approach","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2412.21124","last_updated":"2025-03-16T21:10:15Z","snapshot_observed_at":"2026-08-14T23:33:35.228932Z","submitted_at":"2024-12-30T17:55:28Z","title":"Adaptive Batch Size Schedules for Distributed Training of Language Models with Data and Model Parallelism","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T23:08:28.197709Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2412.21124"},"observation_digest":"sha256:f82c0efa762ff1e6918e4f8464818998c16d521a97df30e704192c0828c0af52","observation_id":"9a41a052-d67d-4158-85f3-5931beda7774","resolution":{"observed_at":"2026-08-10T23:08:28.197709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-10T23:08:28.203669Z","title":"The Llama 3 herd of models.arXiv preprint arXiv:2407.21783, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.21124","last_updated":"2025-03-16T21:10:15Z","snapshot_observed_at":"2026-08-14T23:33:35.228932Z","submitted_at":"2024-12-30T17:55:28Z","title":"Adaptive Batch Size Schedules for Distributed Training of Language Models with Data and Model Parallelism","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T23:08:28.203669Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2412.21124"},"observation_digest":"sha256:a3f58008f73f495376d7270c012523565bb293a6626e41341a6ec2f2c7369ca9","observation_id":"c644634f-0da3-4edd-82d2-d513fe3408c7","resolution":{"observed_at":"2026-08-10T23:08:28.203669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:08:28.208234Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.21124","last_updated":"2025-03-16T21:10:15Z","snapshot_observed_at":"2026-08-14T23:33:35.228932Z","submitted_at":"2024-12-30T17:55:28Z","title":"Adaptive Batch Size Schedules for Distributed Training of Language Models with Data and Model Parallelism","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T23:08:28.208234Z"},"links":{"citing_paper":"/paper/2412.21124"},"observation_digest":"sha256:2c23a59895d93a4e20def89d5a86ba97cc0ece7d1400e6a4d6377c4262d9f813","observation_id":"34f011ae-18a7-4607-a505-725a14048efd","resolution":{"observed_at":"2026-08-10T23:08:28.208234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.06162","last_updated":"2018-12-14T20:49:09Z","snapshot_observed_at":"2026-08-14T17:43:20.166812Z","submitted_at":"2018-12-14T20:49:09Z","title":"An Empirical Model of Large-Batch Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.06162","snapshot_observed_at":"2026-08-10T23:08:28.211454Z","title":"An empirical model of large-batch training","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.21124","last_updated":"2025-03-16T21:10:15Z","snapshot_observed_at":"2026-08-14T23:33:35.228932Z","submitted_at":"2024-12-30T17:55:28Z","title":"Adaptive Batch Size Schedules for Distributed Training of Language Models with Data and Model Parallelism","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T23:08:28.211454Z"},"links":{"cited_paper":"/paper/1812.06162","citing_paper":"/paper/2412.21124"},"observation_digest":"sha256:e1c8e00f743e1bf8d47872975c55efc29cb7752ce01401da6b3369203b0cda5b","observation_id":"d34ffa08-e6a3-40e1-b3e0-5cd1ba38d35a","resolution":{"observed_at":"2026-08-10T23:08:28.211454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:08:30.487546Z","title":"Efficient large-scale language model training on GPU clusters using Megatron-LM","venue":null,"work_id":"16499b5c-e549-4fb9-880d-c30de14f3835","year":2021},"citing_paper":{"arxiv_id":"2412.21124","last_updated":"2025-03-16T21:10:15Z","snapshot_observed_at":"2026-08-14T23:33:35.228932Z","submitted_at":"2024-12-30T17:55:28Z","title":"Adaptive Batch Size Schedules for Distributed Training of Language Models with Data and Model Parallelism","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T23:08:28.215521Z"},"links":{"citing_paper":"/paper/2412.21124"},"observation_digest":"sha256:8145ac9c0b5c3ce2ebdb30e625b7fa7683901c8decc26f0b5f5547aa749c9c8f","observation_id":"074aab96-b4b6-4f21-aac4-0bb83b2515f9","resolution":{"observed_at":"2026-08-10T23:08:30.563989Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05264","last_updated":"2024-02-07T21:19:05Z","snapshot_observed_at":"2026-08-13T04:23:53.262143Z","submitted_at":"2024-02-07T21:19:05Z","title":"AdaBatchGrad: Combining Adaptive Batch Size and Adaptive Step Size","version":1},"cited_work":{"arxiv_id":"2402.05264","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.05264","snapshot_observed_at":"2026-08-10T23:08:29.080463Z","title":"AdaBatchGrad: Combining Adaptive Batch Size and Adaptive Step Size","venue":"cs.LG","work_id":"918c0034-70e6-438c-8f99-156b2018f45c","year":2024},"citing_paper":{"arxiv_id":"2412.21124","last_updated":"2025-03-16T21:10:15Z","snapshot_observed_at":"2026-08-14T23:33:35.228932Z","submitted_at":"2024-12-30T17:55:28Z","title":"Adaptive Batch Size Schedules for Distributed Training of Language Models with Data and Model Parallelism","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T23:08:28.219044Z"},"links":{"cited_paper":"/paper/2402.05264","citing_paper":"/paper/2412.21124"},"observation_digest":"sha256:642c061cb8279606f11802aa8998407329e04e3f9f4cc1491b3eb6b553e585f9","observation_id":"22200e34-27dc-4aa2-874f-5bee70eadc5f","resolution":{"observed_at":"2026-08-10T23:08:29.105925Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00204","last_updated":"2023-05-31T21:49:44Z","snapshot_observed_at":"2026-08-14T04:58:28.021753Z","submitted_at":"2023-05-31T21:49:44Z","title":"Toward Understanding Why Adam Converges Faster Than SGD for Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00204","snapshot_observed_at":"2026-08-10T23:08:28.222610Z","title":"Toward understanding why Adam converges faster than SGD for transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.21124","last_updated":"2025-03-16T21:10:15Z","snapshot_observed_at":"2026-08-14T23:33:35.228932Z","submitted_at":"2024-12-30T17:55:28Z","title":"Adaptive Batch Size Schedules for Distributed Training of Language Models with Data and Model Parallelism","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T23:08:28.222610Z"},"links":{"cited_paper":"/paper/2306.00204","citing_paper":"/paper/2412.21124"},"observation_digest":"sha256:55de91f5a580c7a62cd2535904467732221ece7f4a418b5bdf5f4b247fbb6b93","observation_id":"de7bce79-ad55-4a69-8474-051b04a9546c","resolution":{"observed_at":"2026-08-10T23:08:28.222610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16819","last_updated":"2024-02-27T15:22:57Z","snapshot_observed_at":"2026-08-13T04:09:48.475736Z","submitted_at":"2024-02-26T18:43:45Z","title":"Nemotron-4 15B Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16819","snapshot_observed_at":"2026-08-10T23:08:28.313606Z","title":"Nemotron-4 15B technical report.arXiv preprint arXiv:2402.16819, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.21124","last_updated":"2025-03-16T21:10:15Z","snapshot_observed_at":"2026-08-14T23:33:35.228932Z","submitted_at":"2024-12-30T17:55:28Z","title":"Adaptive Batch Size Schedules for Distributed Training of Language Models with Data and Model Parallelism","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T23:08:28.313606Z"},"links":{"cited_paper":"/paper/2402.16819","citing_paper":"/paper/2412.21124"},"observation_digest":"sha256:7d363f2834de71b21bab2d54c4ba9c55d2d742301954a2f21a0f756bd9c8ec77","observation_id":"a7f506ca-a3ad-4760-862d-0eda79403039","resolution":{"observed_at":"2026-08-10T23:08:28.313606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:08:30.469491Z","title":"PyTorch: An imperative style, high-performance deep learning library","venue":null,"work_id":"768f85a2-e170-456a-8d9b-d1e5779c3b98","year":2019},"citing_paper":{"arxiv_id":"2412.21124","last_updated":"2025-03-16T21:10:15Z","snapshot_observed_at":"2026-08-14T23:33:35.228932Z","submitted_at":"2024-12-30T17:55:28Z","title":"Adaptive Batch Size Schedules for Distributed Training of Language Models with Data and Model Parallelism","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T23:08:28.354771Z"},"links":{"citing_paper":"/paper/2412.21124"},"observation_digest":"sha256:784600fe4448f48db7cd0db74d9f9896283d514fd1a2c7046165a1cd99f9ccfa","observation_id":"8a8dd1b2-4148-4ef9-b20f-d797a19836dc","resolution":{"observed_at":"2026-08-10T23:08:30.479112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:08:30.401549Z","title":"Large scale language modeling: Converging on 40GB of text in four hours","venue":null,"work_id":"f56f7015-9582-44b3-8937-ced14255e262","year":2018},"citing_paper":{"arxiv_id":"2412.21124","last_updated":"2025-03-16T21:10:15Z","snapshot_observed_at":"2026-08-14T23:33:35.228932Z","submitted_at":"2024-12-30T17:55:28Z","title":"Adaptive Batch Size Schedules for Distributed Training of Language Models with Data and Model Parallelism","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-10T23:08:28.359098Z"},"links":{"citing_paper":"/paper/2412.21124"},"observation_digest":"sha256:ac9e13b6c07d737f1d1fc733c7e0111454068f1cf9fd80373b49fb544243a746","observation_id":"4137c201-4efe-4573-8233-8ca7b0e2ad11","resolution":{"observed_at":"2026-08-10T23:08:30.441402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:08:30.350025Z","title":"SimiGrad: Fine-grained adaptive batching for large scale training using gradient similarity measurement","venue":null,"work_id":"f10ae9bb-ba14-4404-82e2-15330e90bc2c","year":2021},"citing_paper":{"arxiv_id":"2412.21124","last_updated":"2025-03-16T21:10:15Z","snapshot_observed_at":"2026-08-14T23:33:35.228932Z","submitted_at":"2024-12-30T17:55:28Z","title":"Adaptive Batch Size Schedules for Distributed Training of Language Models with Data and Model Parallelism","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-10T23:08:28.362697Z"},"links":{"citing_paper":"/paper/2412.21124"},"observation_digest":"sha256:6b466b0a6bf49a4f764d6afdea08b0dfafa736f809f778cb5c91b6ec7cb309d3","observation_id":"bf88acb2-dc51-432b-a251-2a59cc317473","resolution":{"observed_at":"2026-08-10T23:08:30.356127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:08:28.367120Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.21124","last_updated":"2025-03-16T21:10:15Z","snapshot_observed_at":"2026-08-14T23:33:35.228932Z","submitted_at":"2024-12-30T17:55:28Z","title":"Adaptive Batch Size Schedules for Distributed Training of Language Models with Data and Model Parallelism","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-10T23:08:28.367120Z"},"links":{"citing_paper":"/paper/2412.21124"},"observation_digest":"sha256:ea989754ecb9c7d095fba69d201918e054f102bdd48697f5e3f5ce7c223385a6","observation_id":"9dc0ab40-ecdb-4c15-adbb-fb68b7f9e0b9","resolution":{"observed_at":"2026-08-10T23:08:28.367120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:08:30.328382Z","title":"ZeRO: Memory optimizations toward training trillion parameter models","venue":null,"work_id":"f14769d9-b4b7-43d7-a29c-94d28ab430b5","year":2020},"citing_paper":{"arxiv_id":"2412.21124","last_updated":"2025-03-16T21:10:15Z","snapshot_observed_at":"2026-08-14T23:33:35.228932Z","submitted_at":"2024-12-30T17:55:28Z","title":"Adaptive Batch Size Schedules for Distributed Training of Language Models with Data and Model Parallelism","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-10T23:08:28.370025Z"},"links":{"citing_paper":"/paper/2412.21124"},"observation_digest":"sha256:7f622fb4b47e7716146cc86d316139e124d3cf76c4c80c1902b75c832fc52313","observation_id":"6f68f0b6-4b00-4022-8e2e-3133f6e05054","resolution":{"observed_at":"2026-08-10T23:08:30.334289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:08:30.239684Z","title":"DeepSpeed: System optimizations enable training deep learning models with over 100 billion parameters","venue":null,"work_id":"0acddae0-a48a-417c-9ae2-9fda979f1810","year":2020},"citing_paper":{"arxiv_id":"2412.21124","last_updated":"2025-03-16T21:10:15Z","snapshot_observed_at":"2026-08-14T23:33:35.228932Z","submitted_at":"2024-12-30T17:55:28Z","title":"Adaptive Batch Size Schedules for Distributed Training of Language Models with Data and Model Parallelism","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-10T23:08:28.373751Z"},"links":{"citing_paper":"/paper/2412.21124"},"observation_digest":"sha256:40bccd48941bf1d9397099cec3a54a8b3b69ee16a34a4df0f492f799f1658387","observation_id":"435361fa-002d-4e5c-8082-e025b9ff84c9","resolution":{"observed_at":"2026-08-10T23:08:30.275184Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:08:30.227899Z","title":"ZeRO-Offload: Democratizing billion-scale model training","venue":null,"work_id":"c8ca784b-7a1f-4b47-9718-c444c05bfaba","year":2021},"citing_paper":{"arxiv_id":"2412.21124","last_updated":"2025-03-16T21:10:15Z","snapshot_observed_at":"2026-08-14T23:33:35.228932Z","submitted_at":"2024-12-30T17:55:28Z","title":"Adaptive Batch Size Schedules for Distributed Training of Language Models with Data and Model Parallelism","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-10T23:08:28.378205Z"},"links":{"citing_paper":"/paper/2412.21124"},"observation_digest":"sha256:6e89f9100bb2f5546c3b9bd191ee3996a2f396b4a32e08c8e67bb67f8b3461ad","observation_id":"413252af-5483-45ae-801c-a90863ecd40b","resolution":{"observed_at":"2026-08-10T23:08:30.232150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:08:30.216180Z","title":"On the different regimes of stochastic gradient descent.Proceedings of the National Academy of Sciences, 121(9):e2316301121, 2024","venue":null,"work_id":"84d63d36-fb81-4801-9b6e-2ae7a8deafa3","year":2024},"citing_paper":{"arxiv_id":"2412.21124","last_updated":"2025-03-16T21:10:15Z","snapshot_observed_at":"2026-08-14T23:33:35.228932Z","submitted_at":"2024-12-30T17:55:28Z","title":"Adaptive Batch Size Schedules for Distributed Training of Language Models with Data and Model Parallelism","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-10T23:08:28.382219Z"},"links":{"citing_paper":"/paper/2412.21124"},"observation_digest":"sha256:8ade9a828b5c3def8f49d0882cbf6ed134c981762deba6772a6c589ff2f9427e","observation_id":"284f4916-6eaa-4116-a4f4-5957e00e21ae","resolution":{"observed_at":"2026-08-10T23:08:30.219609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:08:30.042476Z","title":"Shallue, Jaehoon Lee, Joseph Antognini, Jascha Sohl-Dickstein, Roy Frostig, and George E","venue":null,"work_id":"7d19a218-8df0-47f3-b8fd-e0ac41412415","year":2019},"citing_paper":{"arxiv_id":"2412.21124","last_updated":"2025-03-16T21:10:15Z","snapshot_observed_at":"2026-08-14T23:33:35.228932Z","submitted_at":"2024-12-30T17:55:28Z","title":"Adaptive Batch Size Schedules for Distributed Training of Language Models with Data and Model Parallelism","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-10T23:08:28.401956Z"},"links":{"citing_paper":"/paper/2412.21124"},"observation_digest":"sha256:c36660dcae318a87a918a9d916915725ea5c90f9dc03c93b691890bab76fd6ab","observation_id":"b5b9e4a3-0569-436b-837d-6e4b093c86d9","resolution":{"observed_at":"2026-08-10T23:08:30.125126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-08-12T10:50:46.357243Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-10T23:08:28.459144Z","title":"Megatron-LM: Training multi-billion parameter language models using model parallelism.arXiv preprint arXiv:1909.08053, 2019","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2412.21124","last_updated":"2025-03-16T21:10:15Z","snapshot_observed_at":"2026-08-14T23:33:35.228932Z","submitted_at":"2024-12-30T17:55:28Z","title":"Adaptive Batch Size Schedules for Distributed Training of Language Models with Data and Model Parallelism","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-10T23:08:28.459144Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2412.21124"},"observation_digest":"sha256:98f1a6f0fe719dcefc3737aa974d266e2ac8b2250807ddc76f4dfb3f75a4e8b5","observation_id":"2c58e921-f588-416c-9b0f-8721c32559fe","resolution":{"observed_at":"2026-08-10T23:08:28.459144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:08:30.023669Z","title":"Smith and Quoc V","venue":null,"work_id":"9b44435f-dc61-4396-a72b-bdb2d6ecc578","year":2018},"citing_paper":{"arxiv_id":"2412.21124","last_updated":"2025-03-16T21:10:15Z","snapshot_observed_at":"2026-08-14T23:33:35.228932Z","submitted_at":"2024-12-30T17:55:28Z","title":"Adaptive Batch Size Schedules for Distributed Training of Language Models with Data and Model Parallelism","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-10T23:08:28.513312Z"},"links":{"citing_paper":"/paper/2412.21124"},"observation_digest":"sha256:6d9a25191e74f904c07bdd36b2cd2cdb8e8eac467ee82c5c21e357a06cf94b23","observation_id":"63a15759-513c-44eb-a4a2-e140610e06c2","resolution":{"observed_at":"2026-08-10T23:08:30.031318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:08:29.987110Z","title":"Smith, Pieter-Jan Kindermans, and Quoc V","venue":null,"work_id":"b153fedf-4598-4f45-81bd-ee07235c5026","year":2018},"citing_paper":{"arxiv_id":"2412.21124","last_updated":"2025-03-16T21:10:15Z","snapshot_observed_at":"2026-08-14T23:33:35.228932Z","submitted_at":"2024-12-30T17:55:28Z","title":"Adaptive Batch Size Schedules for Distributed Training of Language Models with Data and Model Parallelism","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-10T23:08:28.518013Z"},"links":{"citing_paper":"/paper/2412.21124"},"observation_digest":"sha256:27fd5b667c04e42cc39236934fbacb6ec77ff9e7287b47ec84450fdcce8997e1","observation_id":"234a99ec-997c-4c5c-81e8-00d68670c9f9","resolution":{"observed_at":"2026-08-10T23:08:29.994206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-08-09T17:07:26.804289Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.11990","snapshot_observed_at":"2026-08-10T23:08:28.522233Z","title":"Using DeepSpeed and Megatron to train Megatron-Turing NLG 530B, a large-scale generative language model.arXiv preprint arXiv:2201.11990, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.21124","last_updated":"2025-03-16T21:10:15Z","snapshot_observed_at":"2026-08-14T23:33:35.228932Z","submitted_at":"2024-12-30T17:55:28Z","title":"Adaptive Batch Size Schedules for Distributed Training of Language Models with Data and Model Parallelism","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-10T23:08:28.522233Z"},"links":{"cited_paper":"/paper/2201.11990","citing_paper":"/paper/2412.21124"},"observation_digest":"sha256:397781c0e1c8f312c1299b9931fbe0f7b38d19aba58515c63da3c9daac1b0914","observation_id":"366ce334-1037-486c-a24f-3c327afabc8c","resolution":{"observed_at":"2026-08-10T23:08:28.522233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06563","last_updated":"2024-04-05T06:39:34Z","snapshot_observed_at":"2026-08-13T00:57:48.575255Z","submitted_at":"2024-03-11T10:05:29Z","title":"Unraveling the Mystery of Scaling Laws: Part I","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06563","snapshot_observed_at":"2026-08-10T23:08:28.527070Z","title":"Unraveling the mystery of scaling laws: Part I.arXiv preprint arXiv:2403.06563, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.21124","last_updated":"2025-03-16T21:10:15Z","snapshot_observed_at":"2026-08-14T23:33:35.228932Z","submitted_at":"2024-12-30T17:55:28Z","title":"Adaptive Batch Size Schedules for Distributed Training of Language Models with Data and Model Parallelism","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-10T23:08:28.527070Z"},"links":{"cited_paper":"/paper/2403.06563","citing_paper":"/paper/2412.21124"},"observation_digest":"sha256:9b67740a67c876839cb6893f7ab3ca585e6538d08b1a3698e67f866b957dc097","observation_id":"6140cea0-75ee-42cf-ad62-feac0f1759e2","resolution":{"observed_at":"2026-08-10T23:08:28.527070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00656","last_updated":"2025-10-08T07:50:45Z","snapshot_observed_at":"2026-08-08T06:58:44.493777Z","submitted_at":"2024-12-31T21:55:10Z","title":"2 OLMo 2 Furious","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00656","snapshot_observed_at":"2026-08-10T23:08:28.532201Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2412.21124","last_updated":"2025-03-16T21:10:15Z","snapshot_observed_at":"2026-08-14T23:33:35.228932Z","submitted_at":"2024-12-30T17:55:28Z","title":"Adaptive Batch Size Schedules for Distributed Training of Language Models with Data and Model Parallelism","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-10T23:08:28.532201Z"},"links":{"cited_paper":"/paper/2501.00656","citing_paper":"/paper/2412.21124"},"observation_digest":"sha256:cf87ef39c637e607c94eae243bc6d73368e962cd07860ad19172c9e712fd45ab","observation_id":"40cd2d9e-5b48-473f-8c59-f296d3c16d4b","resolution":{"observed_at":"2026-08-10T23:08:28.532201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:08:29.887491Z","title":"Introducing DBRX: A new state-of-the-art open LLM","venue":null,"work_id":"9a70a21d-9a7d-448f-b497-eab858160b36","year":2024},"citing_paper":{"arxiv_id":"2412.21124","last_updated":"2025-03-16T21:10:15Z","snapshot_observed_at":"2026-08-14T23:33:35.228932Z","submitted_at":"2024-12-30T17:55:28Z","title":"Adaptive Batch Size Schedules for Distributed Training of Language Models with Data and Model Parallelism","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-10T23:08:28.536308Z"},"links":{"citing_paper":"/paper/2412.21124"},"observation_digest":"sha256:ae023a26aa743d34be94b4ea0bb2024bae752da06e4748ddfa2dc8f47e70e12d","observation_id":"3a15bb9d-3ca6-4f94-9491-526cf29f2130","resolution":{"observed_at":"2026-08-10T23:08:29.973315Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-10T23:08:28.626060Z","title":"Llama 2: Open foundation and fine-tuned chat models.arXiv preprint arXiv:2307.09288, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.21124","last_updated":"2025-03-16T21:10:15Z","snapshot_observed_at":"2026-08-14T23:33:35.228932Z","submitted_at":"2024-12-30T17:55:28Z","title":"Adaptive Batch Size Schedules for Distributed Training of Language Models with Data and Model Parallelism","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-10T23:08:28.626060Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2412.21124"},"observation_digest":"sha256:a34b5dd397772a62453736854c9d6625963f2051dde5222b3a6a161c90d35bf3","observation_id":"68c1c185-1b47-43b3-a13b-42f30562146f","resolution":{"observed_at":"2026-08-10T23:08:28.626060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:08:29.836116Z","title":"Gomez, Łukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":"b7956abe-f914-4e42-a070-302a56266ee5","year":2017},"citing_paper":{"arxiv_id":"2412.21124","last_updated":"2025-03-16T21:10:15Z","snapshot_observed_at":"2026-08-14T23:33:35.228932Z","submitted_at":"2024-12-30T17:55:28Z","title":"Adaptive Batch Size Schedules for Distributed Training of Language Models with Data and Model Parallelism","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-10T23:08:28.663765Z"},"links":{"citing_paper":"/paper/2412.21124"},"observation_digest":"sha256:c874d5d0dc11c9e45bf182868cef3f97605065ac5aa6a4ed400507a311012933","observation_id":"ff6ea462-df90-4351-9f61-f16f054ce4e9","resolution":{"observed_at":"2026-08-10T23:08:29.839689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:08:29.821991Z","title":"Meta Lingua: A minimal PyTorch LLM training library, 2024","venue":null,"work_id":"ca4e271d-9aa6-4a2f-8e3b-a83f18a154f9","year":2024},"citing_paper":{"arxiv_id":"2412.21124","last_updated":"2025-03-16T21:10:15Z","snapshot_observed_at":"2026-08-14T23:33:35.228932Z","submitted_at":"2024-12-30T17:55:28Z","title":"Adaptive Batch Size Schedules for Distributed Training of Language Models with Data and Model Parallelism","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-10T23:08:28.668757Z"},"links":{"citing_paper":"/paper/2412.21124"},"observation_digest":"sha256:0d3c76b8687d14d768cc556b92934f15c58f929b41ae30d7dd0138554de7b911","observation_id":"38068dd4-107f-4687-83b4-8cf6ff6ba778","resolution":{"observed_at":"2026-08-10T23:08:29.827044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:08:29.808247Z","title":"Closing the gap between the upper bound and lower bound of Adam’s iteration complexity","venue":null,"work_id":"b8ca57ca-e0e8-4f12-9eca-3ca52fc47d63","year":2023},"citing_paper":{"arxiv_id":"2412.21124","last_updated":"2025-03-16T21:10:15Z","snapshot_observed_at":"2026-08-14T23:33:35.228932Z","submitted_at":"2024-12-30T17:55:28Z","title":"Adaptive Batch Size Schedules for Distributed Training of Language Models with Data and Model Parallelism","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-10T23:08:28.672935Z"},"links":{"citing_paper":"/paper/2412.21124"},"observation_digest":"sha256:be3c1283a014ebe38eae2ea98884aa1641ebfbb89fccdfd713ef1d14515d5fa2","observation_id":"1f15343f-3aa1-4764-a255-45564d336b2c","resolution":{"observed_at":"2026-08-10T23:08:29.812872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:08:29.750661Z","title":"MicroLlama-300M","venue":null,"work_id":"afe44c88-329f-4dff-9c1e-f799386e45ec","year":2024},"citing_paper":{"arxiv_id":"2412.21124","last_updated":"2025-03-16T21:10:15Z","snapshot_observed_at":"2026-08-14T23:33:35.228932Z","submitted_at":"2024-12-30T17:55:28Z","title":"Adaptive Batch Size Schedules for Distributed Training of Language Models with Data and Model Parallelism","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-10T23:08:28.675883Z"},"links":{"citing_paper":"/paper/2412.21124"},"observation_digest":"sha256:5c9a1c9e6ad0eae4a7b35dcb56873e40b1a14a30a8a98c5e58e41330bd46cc99","observation_id":"86ddbe66-ccb9-4fec-8b2f-07de7a059f34","resolution":{"observed_at":"2026-08-10T23:08:29.799649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:08:29.630501Z","title":"Liu, Lechao Xiao, Katie Everett, Alex Alemi, Ben Adlam, John D","venue":null,"work_id":"ca3197cb-bfe1-4a4a-90b1-6cbeaa99070c","year":2024},"citing_paper":{"arxiv_id":"2412.21124","last_updated":"2025-03-16T21:10:15Z","snapshot_observed_at":"2026-08-14T23:33:35.228932Z","submitted_at":"2024-12-30T17:55:28Z","title":"Adaptive Batch Size Schedules for Distributed Training of Language Models with Data and Model Parallelism","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-10T23:08:28.679793Z"},"links":{"citing_paper":"/paper/2412.21124"},"observation_digest":"sha256:3a2d595b2b89365b8ac4add1d130efc8b9be7bf8d0451a582c06c651a4aaaed8","observation_id":"ed4e73fc-e733-4218-9e62-787e408a693e","resolution":{"observed_at":"2026-08-10T23:08:29.663870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10305","last_updated":"2025-04-17T08:34:42Z","snapshot_observed_at":"2026-08-14T19:59:05.307983Z","submitted_at":"2023-09-19T04:13:22Z","title":"Baichuan 2: Open Large-scale Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10305","snapshot_observed_at":"2026-08-10T23:08:28.684510Z","title":"Baichuan 2: Open large-scale language models.arXiv preprint arXiv:2309.10305, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.21124","last_updated":"2025-03-16T21:10:15Z","snapshot_observed_at":"2026-08-14T23:33:35.228932Z","submitted_at":"2024-12-30T17:55:28Z","title":"Adaptive Batch Size Schedules for Distributed Training of Language Models with Data and Model Parallelism","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-10T23:08:28.684510Z"},"links":{"cited_paper":"/paper/2309.10305","citing_paper":"/paper/2412.21124"},"observation_digest":"sha256:06c2594a328b703e452d883348f85fdf2e0910716a92da4d77e0d4072c63c35c","observation_id":"b954a9c7-ac0e-4775-8057-031783abea46","resolution":{"observed_at":"2026-08-10T23:08:28.684510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-10T23:08:28.733863Z","title":"Qwen2 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.21124","last_updated":"2025-03-16T21:10:15Z","snapshot_observed_at":"2026-08-14T23:33:35.228932Z","submitted_at":"2024-12-30T17:55:28Z","title":"Adaptive Batch Size Schedules for Distributed Training of Language Models with Data and Model Parallelism","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-10T23:08:28.733863Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2412.21124"},"observation_digest":"sha256:c07792927d63d7a17e144e18d5340afecb39672ef85e3c06da37c0a80f845312","observation_id":"52d360f0-e63b-4c57-abf8-3f126710905b","resolution":{"observed_at":"2026-08-10T23:08:28.733863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:08:29.615263Z","title":"Large batch optimization for deep learning: Training BERT in 76 minutes","venue":null,"work_id":"63f122f3-fe61-49f4-9e8a-440895f418fd","year":2020},"citing_paper":{"arxiv_id":"2412.21124","last_updated":"2025-03-16T21:10:15Z","snapshot_observed_at":"2026-08-14T23:33:35.228932Z","submitted_at":"2024-12-30T17:55:28Z","title":"Adaptive Batch Size Schedules for Distributed Training of Language Models with Data and Model Parallelism","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-10T23:08:28.778076Z"},"links":{"citing_paper":"/paper/2412.21124"},"observation_digest":"sha256:c85e161b50934b2d580d5dbef5c560d2bc009a84ae1e874a33bcdc2f81a4087b","observation_id":"6cdb2a43-e351-4882-944a-b155be40774b","resolution":{"observed_at":"2026-08-10T23:08:29.620830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:08:29.602790Z","title":"Susskind","venue":null,"work_id":"e5bc8bc3-9f72-455f-90c3-c74822d1776a","year":2023},"citing_paper":{"arxiv_id":"2412.21124","last_updated":"2025-03-16T21:10:15Z","snapshot_observed_at":"2026-08-14T23:33:35.228932Z","submitted_at":"2024-12-30T17:55:28Z","title":"Adaptive Batch Size Schedules for Distributed Training of Language Models with Data and Model Parallelism","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-10T23:08:28.809521Z"},"links":{"citing_paper":"/paper/2412.21124"},"observation_digest":"sha256:f15e64ed56c8cbe2dd2bb7a87a97a5b5e131e25578b9b33b700b46fb0d1e1572","observation_id":"041b3c68-5256-4840-819c-0e3d2633bbbc","resolution":{"observed_at":"2026-08-10T23:08:29.606769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:08:29.509516Z","title":"How does critical batch size scale in pre-training? InInternational Conference on Learning Representations (ICLR), 2025","venue":null,"work_id":"181b32dd-7efd-4abd-8b79-cf255675aa42","year":2025},"citing_paper":{"arxiv_id":"2412.21124","last_updated":"2025-03-16T21:10:15Z","snapshot_observed_at":"2026-08-14T23:33:35.228932Z","submitted_at":"2024-12-30T17:55:28Z","title":"Adaptive Batch Size Schedules for Distributed Training of Language Models with Data and Model Parallelism","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-10T23:08:28.813683Z"},"links":{"citing_paper":"/paper/2412.21124"},"observation_digest":"sha256:365150e219690b4541eec4286bdd9cfd9c6eb62888fd9bcacedaafa493580ecd","observation_id":"aca9d4ba-94cd-475e-9e9b-83fb0df939aa","resolution":{"observed_at":"2026-08-10T23:08:29.593274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02385","last_updated":"2024-06-04T02:05:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-04T17:54:59Z","title":"TinyLlama: An Open-Source Small Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02385","snapshot_observed_at":"2026-08-10T23:08:28.819083Z","title":"TinyLlama: An open-source small language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.21124","last_updated":"2025-03-16T21:10:15Z","snapshot_observed_at":"2026-08-14T23:33:35.228932Z","submitted_at":"2024-12-30T17:55:28Z","title":"Adaptive Batch Size Schedules for Distributed Training of Language Models with Data and Model Parallelism","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-10T23:08:28.819083Z"},"links":{"cited_paper":"/paper/2401.02385","citing_paper":"/paper/2412.21124"},"observation_digest":"sha256:4c27500a674baba62e29a24c3129126ac4838f064edf5bb5fe8fb48db72eab6f","observation_id":"c1b70b2a-0fa1-4414-9fd0-5e12aa5c7f3a","resolution":{"observed_at":"2026-08-10T23:08:28.819083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-10T23:08:28.823254Z","title":"OPT: Open pre-trained transformer language models.arXiv preprint arXiv:2205.01068, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.21124","last_updated":"2025-03-16T21:10:15Z","snapshot_observed_at":"2026-08-14T23:33:35.228932Z","submitted_at":"2024-12-30T17:55:28Z","title":"Adaptive Batch Size Schedules for Distributed Training of Language Models with Data and Model Parallelism","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-10T23:08:28.823254Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2412.21124"},"observation_digest":"sha256:149a9a15b99a5f9e3d3fea8c8e63a7b03884d8e20747f203d35bcc3118137a0e","observation_id":"8a79759a-0bd9-41a0-986e-8732853ebe77","resolution":{"observed_at":"2026-08-10T23:08:28.823254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16788","last_updated":"2024-10-21T08:27:23Z","snapshot_observed_at":"2026-08-13T04:09:49.790420Z","submitted_at":"2024-02-26T18:01:41Z","title":"Why Transformers Need Adam: A Hessian Perspective","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16788","snapshot_observed_at":"2026-08-10T23:08:28.827620Z","title":"Why transformers need Adam: A Hessian perspective.arXiv preprint arXiv:2402.16788, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.21124","last_updated":"2025-03-16T21:10:15Z","snapshot_observed_at":"2026-08-14T23:33:35.228932Z","submitted_at":"2024-12-30T17:55:28Z","title":"Adaptive Batch Size Schedules for Distributed Training of Language Models with Data and Model Parallelism","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-10T23:08:28.827620Z"},"links":{"cited_paper":"/paper/2402.16788","citing_paper":"/paper/2412.21124"},"observation_digest":"sha256:84a812e87973beef01c3b1d875b9c69a5dd955e3b3bfd154c7d96f6d7aa2ce8c","observation_id":"2a1a938c-4694-44ef-8f10-c7c54ec86094","resolution":{"observed_at":"2026-08-10T23:08:28.827620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:08:29.496299Z","title":"Picotron: Distributed training framework for education and research experimentation, 2025","venue":null,"work_id":"72ee6395-2a85-4102-90e3-3fd6e3311ec5","year":2025},"citing_paper":{"arxiv_id":"2412.21124","last_updated":"2025-03-16T21:10:15Z","snapshot_observed_at":"2026-08-14T23:33:35.228932Z","submitted_at":"2024-12-30T17:55:28Z","title":"Adaptive Batch Size Schedules for Distributed Training of Language Models with Data and Model Parallelism","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-10T23:08:28.831666Z"},"links":{"citing_paper":"/paper/2412.21124"},"observation_digest":"sha256:5512dc814abd9a87a85f188db5bf2d81c5d4bffd9d6615d3ed2b7f18ce9ab3fe","observation_id":"26383e5e-bdd6-4643-b43f-11e84065244a","resolution":{"observed_at":"2026-08-10T23:08:29.500772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:08:29.454115Z","title":"first-order term","venue":null,"work_id":"496e5d3d-4cbb-4531-82a1-6a57dbd37ca2","year":2023},"citing_paper":{"arxiv_id":"2412.21124","last_updated":"2025-03-16T21:10:15Z","snapshot_observed_at":"2026-08-14T23:33:35.228932Z","submitted_at":"2024-12-30T17:55:28Z","title":"Adaptive Batch Size Schedules for Distributed Training of Language Models with Data and Model Parallelism","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-10T23:08:28.873206Z"},"links":{"citing_paper":"/paper/2412.21124"},"observation_digest":"sha256:d3633b51dce6baa54a63de164a84b1c9cff64b58c9bc033ed69ebdf936a84946","observation_id":"3103d643-bf42-404a-9da8-2952792fec22","resolution":{"observed_at":"2026-08-10T23:08:29.489027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.21124","last_updated":"2025-03-16T21:10:15Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-14T23:33:35.228932Z","submitted_at":"2024-12-30T17:55:28Z","title":"Adaptive Batch Size Schedules for Distributed Training of Language Models with Data and Model Parallelism"},"reference_resolution":{"displayed":88,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":47,"verified_exact":2,"verified_fuzzy":39},"total_outbound_references":88},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 88 of 88 outbound references and 1 inbound Pith citation observation for arXiv:2412.21124."}