{"as_of":"2026-08-10T11:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f7c3503863d7732aeb97ca71f3985fc57b6925755f6a8a96f30cf94cd0c04baf","coverage":[{"denominator":176,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T12:35:51.957442Z","state":"measured"},{"denominator":128,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":128,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":28,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T11:59:49.778357Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.01440","snapshot_observed_at":"2026-08-05T11:59:49.778357Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.02046","last_updated":"2025-09-04T19:22:04Z","snapshot_observed_at":"2026-08-10T07:25:52.728334Z","submitted_at":"2025-09-02T07:43:22Z","title":"Fantastic Pretraining Optimizers and Where to Find Them","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-05T11:59:49.778357Z"},"links":{"cited_paper":"/paper/2509.01440","citing_paper":"/paper/2509.02046"},"observation_digest":"sha256:d27753bf993e518f34b8313a454e695783cc88f4f525057364a5854aa3476765","observation_id":"fb443bfe-da23-4701-8a9a-d8ec61521e0f","resolution":{"observed_at":"2026-08-05T11:59:49.778357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"cited_work":{"arxiv_id":"2509.01440","doi":"10.48550/arxiv.2509.01440","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01440","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Benchmarking optimizers for large language model pretraining.arXiv preprint arXiv:2509.01440","venue":"ArXiv.org","work_id":"0365a535-39b7-4c6c-8ef2-d08314864789","year":2025},"citing_paper":{"arxiv_id":"2510.10777","last_updated":"2026-05-16T11:31:52Z","snapshot_observed_at":"2026-07-06T22:32:27.698678Z","submitted_at":"2025-10-12T19:39:41Z","title":"Preconditioned Norms: A Unified Framework for Steepest Descent, Quasi-Newton and Adaptive Methods","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-21T21:05:49.844436Z"},"links":{"cited_paper":"/paper/2509.01440","citing_paper":"/paper/2510.10777"},"observation_digest":"sha256:6bf4353f33650738fc44da551dd41b30c18c10909d3df808ae409a1256bac6a3","observation_id":"949e6136-8c02-4f11-92d0-9bccef329228","resolution":{"observed_at":"2026-05-21T21:10:38.756135Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"cited_work":{"arxiv_id":"2509.01440","doi":"10.48550/arxiv.2509.01440","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01440","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Benchmarking optimizers for large language model pretraining.arXiv preprint arXiv:2509.01440","venue":"ArXiv.org","work_id":"0365a535-39b7-4c6c-8ef2-d08314864789","year":2025},"citing_paper":{"arxiv_id":"2602.01505","last_updated":"2026-05-06T16:04:38Z","snapshot_observed_at":"2026-08-04T18:30:12.465245Z","submitted_at":"2026-02-02T00:35:42Z","title":"Optimal Sample Complexity for Single Time-Scale Actor-Critic with Momentum","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-16T08:12:57.430291Z"},"links":{"cited_paper":"/paper/2509.01440","citing_paper":"/paper/2602.01505"},"observation_digest":"sha256:4db8e1155c60419ac6822b90c4c6baf5ba9a5e45bb2fb832c5dc12e5708e744b","observation_id":"c30db491-0a24-427c-8803-312436a37102","resolution":{"observed_at":"2026-05-16T08:17:36.487221Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.01440","snapshot_observed_at":"2026-08-03T04:44:56.066179Z","title":"Benchmarking optimizers for large language model pretraining.arXiv preprint arXiv: 2509.01440,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.04396","last_updated":"2026-06-17T18:22:54Z","snapshot_observed_at":"2026-08-08T18:55:31.308399Z","submitted_at":"2026-02-04T10:25:24Z","title":"LoRDO: Distributed Low-Rank Optimization with Infrequent Communication","version":2},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-03T04:44:56.066179Z"},"links":{"cited_paper":"/paper/2509.01440","citing_paper":"/paper/2602.04396"},"observation_digest":"sha256:ca6ec2111cfc7beff7e2014610f8582cf3d982f00550ac96435c8d2a89adf37d","observation_id":"cb893229-810e-4b4b-a8fb-5b78c166f127","resolution":{"observed_at":"2026-08-03T04:44:56.066179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"cited_work":{"arxiv_id":"2509.01440","doi":"10.48550/arxiv.2509.01440","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01440","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Benchmarking optimizers for large language model pretraining.arXiv preprint arXiv:2509.01440","venue":"ArXiv.org","work_id":"0365a535-39b7-4c6c-8ef2-d08314864789","year":2025},"citing_paper":{"arxiv_id":"2603.10067","last_updated":"2026-05-21T20:35:00Z","snapshot_observed_at":"2026-07-06T22:48:35.345421Z","submitted_at":"2026-03-10T02:12:24Z","title":"HTMuon: Improving Muon via Heavy-Tailed Spectral Correction","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-25T06:50:29.893126Z"},"links":{"cited_paper":"/paper/2509.01440","citing_paper":"/paper/2603.10067"},"observation_digest":"sha256:25e74d3f6d2bcaf993e7898d2d6cb3d28eda0a796ab3193e459a515876a173d3","observation_id":"bd78ae6a-878b-48cd-961f-806021dbee74","resolution":{"observed_at":"2026-05-25T06:55:26.265757Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"cited_work":{"arxiv_id":"2509.01440","doi":"10.48550/arxiv.2509.01440","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01440","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Benchmarking optimizers for large language model pretraining.arXiv preprint arXiv:2509.01440","venue":"ArXiv.org","work_id":"0365a535-39b7-4c6c-8ef2-d08314864789","year":2025},"citing_paper":{"arxiv_id":"2603.26554","last_updated":"2026-04-28T07:36:37Z","snapshot_observed_at":"2026-07-06T22:50:46.243903Z","submitted_at":"2026-03-27T16:13:18Z","title":"Sharp Capacity Scaling of Spectral Optimizers in Learning Associative Memory","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-14T23:37:33.106390Z"},"links":{"cited_paper":"/paper/2509.01440","citing_paper":"/paper/2603.26554"},"observation_digest":"sha256:7ea41fdd7a350baa04c16609338f5957f0c2b059dbc68c10384a1c2fb3a67c89","observation_id":"c9deeb18-9d70-42b9-8189-95b541cf1845","resolution":{"observed_at":"2026-05-14T23:38:16.407545Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"cited_work":{"arxiv_id":"2509.01440","doi":"10.48550/arxiv.2509.01440","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01440","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Benchmarking optimizers for large language model pretraining.arXiv preprint arXiv:2509.01440","venue":"ArXiv.org","work_id":"0365a535-39b7-4c6c-8ef2-d08314864789","year":2025},"citing_paper":{"arxiv_id":"2604.09258","last_updated":"2026-05-27T08:05:02Z","snapshot_observed_at":"2026-07-12T23:23:17.075790Z","submitted_at":"2026-04-10T12:17:18Z","title":"Nexus: Same Pretraining Loss, Better Downstream Generalization via Common Minima","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-10T17:53:39.356675Z"},"links":{"cited_paper":"/paper/2509.01440","citing_paper":"/paper/2604.09258"},"observation_digest":"sha256:0e514570441e32da78c843c4a65bc8322a747c514bce8c907fbbc3c6dc12b631","observation_id":"2a8e356d-9410-4f35-93ef-67484520e0cb","resolution":{"observed_at":"2026-05-11T05:55:57.177884Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"cited_work":{"arxiv_id":"2509.01440","doi":"10.48550/arxiv.2509.01440","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01440","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Benchmarking optimizers for large language model pretraining.arXiv preprint arXiv:2509.01440","venue":"ArXiv.org","work_id":"0365a535-39b7-4c6c-8ef2-d08314864789","year":2025},"citing_paper":{"arxiv_id":"2604.12968","last_updated":"2026-04-14T17:01:36Z","snapshot_observed_at":"2026-07-06T23:01:05.634599Z","submitted_at":"2026-04-14T17:01:36Z","title":"Evolution of Optimization Methods: Algorithms, Scenarios, and Evaluations","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T15:16:58.221358Z"},"links":{"cited_paper":"/paper/2509.01440","citing_paper":"/paper/2604.12968"},"observation_digest":"sha256:2f2bc1aed003d7c12133ca8e1200ca13a654de7b023bd06f6b5f23adc3e2b911","observation_id":"e4f7eebb-04aa-417e-872d-8d2b80194fb9","resolution":{"observed_at":"2026-05-11T10:51:20.489496Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"cited_work":{"arxiv_id":"2509.01440","doi":"10.48550/arxiv.2509.01440","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01440","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Benchmarking optimizers for large language model pretraining.arXiv preprint arXiv:2509.01440","venue":"ArXiv.org","work_id":"0365a535-39b7-4c6c-8ef2-d08314864789","year":2025},"citing_paper":{"arxiv_id":"2604.15297","last_updated":"2026-04-17T17:48:55Z","snapshot_observed_at":"2026-07-31T08:41:17.524742Z","submitted_at":"2026-04-16T17:57:02Z","title":"Benchmarking Optimizers for MLPs in Tabular Deep Learning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T12:06:08.798712Z"},"links":{"cited_paper":"/paper/2509.01440","citing_paper":"/paper/2604.15297"},"observation_digest":"sha256:0c82c62621bc778a287f944c1efc157c432f10bf928856b28800ca349c2157af","observation_id":"32b87b17-45dd-41fe-b844-5e8b4f504424","resolution":{"observed_at":"2026-05-10T12:10:22.021599Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"cited_work":{"arxiv_id":"2509.01440","doi":"10.48550/arxiv.2509.01440","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01440","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Benchmarking optimizers for large language model pretraining.arXiv preprint arXiv:2509.01440","venue":"ArXiv.org","work_id":"0365a535-39b7-4c6c-8ef2-d08314864789","year":2025},"citing_paper":{"arxiv_id":"2604.15416","last_updated":"2026-04-16T17:55:36Z","snapshot_observed_at":"2026-07-06T23:02:58.361418Z","submitted_at":"2026-04-16T17:55:36Z","title":"StoSignSGD: Unbiased Structural Stochasticity Fixes SignSGD for Training Large Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-10T12:10:44.802059Z"},"links":{"cited_paper":"/paper/2509.01440","citing_paper":"/paper/2604.15416"},"observation_digest":"sha256:d7cb69e63a8f5b12fbfcd83cbb0b35e43a2a98f491912f9e1ab985c8b9f094aa","observation_id":"47e8c762-ed4f-428b-87fc-c65a0ce4027a","resolution":{"observed_at":"2026-05-10T12:15:22.218722Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"cited_work":{"arxiv_id":"2509.01440","doi":"10.48550/arxiv.2509.01440","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01440","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Benchmarking optimizers for large language model pretraining.arXiv preprint arXiv:2509.01440","venue":"ArXiv.org","work_id":"0365a535-39b7-4c6c-8ef2-d08314864789","year":2025},"citing_paper":{"arxiv_id":"2605.06615","last_updated":"2026-05-07T17:32:09Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-05-07T17:32:09Z","title":"When and Why SignSGD Outperforms SGD: A Theoretical Study Based on $\\ell_1$-norm Lower Bounds","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-08T12:14:28.866499Z"},"links":{"cited_paper":"/paper/2509.01440","citing_paper":"/paper/2605.06615"},"observation_digest":"sha256:9d39aed47f3db638b0f4c187263d907507759c63efad5eb9604cd0ac822787d6","observation_id":"ab73c9d0-656a-4a0d-a2d1-9c563db4178b","resolution":{"observed_at":"2026-05-11T19:21:07.675545Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"cited_work":{"arxiv_id":"2509.01440","doi":"10.48550/arxiv.2509.01440","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01440","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Benchmarking optimizers for large language model pretraining.arXiv preprint arXiv:2509.01440","venue":"ArXiv.org","work_id":"0365a535-39b7-4c6c-8ef2-d08314864789","year":2025},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"cited_paper":"/paper/2509.01440","citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:86c5e2042f715d285e3f29307c3084c537ecba4dedc206f7ecdeb32da83c58d5","observation_id":"c241f457-713a-41f8-9d3e-7a495da4d34b","resolution":{"observed_at":"2026-05-11T19:26:08.543311Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"cited_work":{"arxiv_id":"2509.01440","doi":"10.48550/arxiv.2509.01440","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01440","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Benchmarking optimizers for large language model pretraining.arXiv preprint arXiv:2509.01440","venue":"ArXiv.org","work_id":"0365a535-39b7-4c6c-8ef2-d08314864789","year":2025},"citing_paper":{"arxiv_id":"2605.09176","last_updated":"2026-05-09T21:34:28Z","snapshot_observed_at":"2026-08-09T01:35:49.848565Z","submitted_at":"2026-05-09T21:34:28Z","title":"Navigating LLM Valley: From AdamW to Memory-Efficient and Matrix-Based Optimizers","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-12T04:01:32.057022Z"},"links":{"cited_paper":"/paper/2509.01440","citing_paper":"/paper/2605.09176"},"observation_digest":"sha256:03ad58165608af8eea0cf3ef4c64a9664899edb85c8a00964694214b00b0f484","observation_id":"49fb2eb5-b6a4-4d35-a8c8-2845f077e2c9","resolution":{"observed_at":"2026-05-12T06:41:45.519353Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"cited_work":{"arxiv_id":"2509.01440","doi":"10.48550/arxiv.2509.01440","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01440","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Benchmarking optimizers for large language model pretraining.arXiv preprint arXiv:2509.01440","venue":"ArXiv.org","work_id":"0365a535-39b7-4c6c-8ef2-d08314864789","year":2025},"citing_paper":{"arxiv_id":"2605.13434","last_updated":"2026-05-13T12:27:22Z","snapshot_observed_at":"2026-07-06T23:25:01.951546Z","submitted_at":"2026-05-13T12:27:22Z","title":"Rescaled Asynchronous SGD: Optimal Distributed Optimization under Data and System Heterogeneity","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-14T19:31:12.149482Z"},"links":{"cited_paper":"/paper/2509.01440","citing_paper":"/paper/2605.13434"},"observation_digest":"sha256:0aef98f2af05e93362508872f3573285e5b53da12309a730a0e6d1eb69a22e3e","observation_id":"5883819f-1012-4d65-a32d-7cdeca1deba4","resolution":{"observed_at":"2026-05-14T19:32:50.855805Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"cited_work":{"arxiv_id":"2509.01440","doi":"10.48550/arxiv.2509.01440","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01440","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Benchmarking optimizers for large language model pretraining.arXiv preprint arXiv:2509.01440","venue":"ArXiv.org","work_id":"0365a535-39b7-4c6c-8ef2-d08314864789","year":2025},"citing_paper":{"arxiv_id":"2605.18106","last_updated":"2026-06-22T06:06:33Z","snapshot_observed_at":"2026-07-06T23:28:59.503300Z","submitted_at":"2026-05-18T09:17:26Z","title":"Symmetry-Compatible Principle for Optimizer Design: Embeddings, LM Heads, SwiGLU MLPs, and MoE Routers","version":1},"reference_index":134,"source":"pdf_text","source_observed_at":"2026-05-20T09:34:45.186929Z"},"links":{"cited_paper":"/paper/2509.01440","citing_paper":"/paper/2605.18106"},"observation_digest":"sha256:55038efb3457252b2a01807e6871fe5d440b217cb3ac9fa1a4e9bdd72bc8e850","observation_id":"68c55c15-3ee8-495a-88c3-3a8999dc5df4","resolution":{"observed_at":"2026-05-20T09:38:11.217214Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"cited_work":{"arxiv_id":"2509.01440","doi":"10.48550/arxiv.2509.01440","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01440","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Benchmarking optimizers for large language model pretraining.arXiv preprint arXiv:2509.01440","venue":"ArXiv.org","work_id":"0365a535-39b7-4c6c-8ef2-d08314864789","year":2025},"citing_paper":{"arxiv_id":"2605.18106","last_updated":"2026-06-22T06:06:33Z","snapshot_observed_at":"2026-07-06T23:28:59.503300Z","submitted_at":"2026-05-18T09:17:26Z","title":"Symmetry-Compatible Principle for Optimizer Design: Embeddings, LM Heads, SwiGLU MLPs, and MoE Routers","version":4},"reference_index":136,"source":"pdf_text","source_observed_at":"2026-06-30T18:42:01.854481Z"},"links":{"cited_paper":"/paper/2509.01440","citing_paper":"/paper/2605.18106"},"observation_digest":"sha256:b64fc38522e4544ca7795129687d8a4ee99e57f378132ea99e7c8fb2ee63e00c","observation_id":"1750ef5d-27b2-4566-848b-b9b4cd74497a","resolution":{"observed_at":"2026-06-30T18:45:00.393205Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"cited_work":{"arxiv_id":"2509.01440","doi":"10.48550/arxiv.2509.01440","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01440","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Benchmarking optimizers for large language model pretraining.arXiv preprint arXiv:2509.01440","venue":"ArXiv.org","work_id":"0365a535-39b7-4c6c-8ef2-d08314864789","year":2025},"citing_paper":{"arxiv_id":"2605.19811","last_updated":"2026-06-21T10:26:37Z","snapshot_observed_at":"2026-07-06T23:30:30.141040Z","submitted_at":"2026-05-19T13:07:59Z","title":"LionMuon: Alternating Spectral and Sign Descent for Efficient Training","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-20T07:24:55.516803Z"},"links":{"cited_paper":"/paper/2509.01440","citing_paper":"/paper/2605.19811"},"observation_digest":"sha256:d38040603f339cf13023d92fd89a9f91786ade18d1773fdd41da8e5cb1f76cc9","observation_id":"56fd8440-a43e-42df-ad27-029d1533ea45","resolution":{"observed_at":"2026-05-20T07:28:06.765568Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"cited_work":{"arxiv_id":"2509.01440","doi":"10.48550/arxiv.2509.01440","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01440","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Benchmarking optimizers for large language model pretraining.arXiv preprint arXiv:2509.01440","venue":"ArXiv.org","work_id":"0365a535-39b7-4c6c-8ef2-d08314864789","year":2025},"citing_paper":{"arxiv_id":"2605.19811","last_updated":"2026-06-21T10:26:37Z","snapshot_observed_at":"2026-07-06T23:30:30.141040Z","submitted_at":"2026-05-19T13:07:59Z","title":"LionMuon: Alternating Spectral and Sign Descent for Efficient Training","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-30T18:30:51.719396Z"},"links":{"cited_paper":"/paper/2509.01440","citing_paper":"/paper/2605.19811"},"observation_digest":"sha256:892c168e6e5ff745b8a03bf65799e15bcfb06a6ca8af4b94f280f42c9bc49cbf","observation_id":"8fd65943-b119-450d-a15c-bc72839058d5","resolution":{"observed_at":"2026-06-30T18:35:00.435900Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"cited_work":{"arxiv_id":"2509.01440","doi":"10.48550/arxiv.2509.01440","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01440","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Benchmarking optimizers for large language model pretraining.arXiv preprint arXiv:2509.01440","venue":"ArXiv.org","work_id":"0365a535-39b7-4c6c-8ef2-d08314864789","year":2025},"citing_paper":{"arxiv_id":"2605.22644","last_updated":"2026-05-21T15:50:40Z","snapshot_observed_at":"2026-08-02T21:41:54.474589Z","submitted_at":"2026-05-21T15:50:40Z","title":"Why SGD is not Brownian Motion: A New Perspective on Stochastic Dynamics","version":1},"reference_index":192,"source":"arxiv_source","source_observed_at":"2026-05-22T08:06:52.309619Z"},"links":{"cited_paper":"/paper/2509.01440","citing_paper":"/paper/2605.22644"},"observation_digest":"sha256:dcd845840673f098226ad514ba1412410ec51500f0d854f80fb8b3e80fdb34de","observation_id":"cef63c76-0d48-4a8f-ab54-be36c37a7463","resolution":{"observed_at":"2026-05-22T08:11:17.313797Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"cited_work":{"arxiv_id":"2509.01440","doi":"10.48550/arxiv.2509.01440","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01440","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Benchmarking optimizers for large language model pretraining.arXiv preprint arXiv:2509.01440","venue":"ArXiv.org","work_id":"0365a535-39b7-4c6c-8ef2-d08314864789","year":2025},"citing_paper":{"arxiv_id":"2605.26327","last_updated":"2026-05-25T21:03:03Z","snapshot_observed_at":"2026-08-06T22:03:33.463183Z","submitted_at":"2026-05-25T21:03:03Z","title":"Reparametrizing Shampoo and SOAP for Subspace Basis Updates and BFloat16 Storage","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-06-29T22:16:53.946499Z"},"links":{"cited_paper":"/paper/2509.01440","citing_paper":"/paper/2605.26327"},"observation_digest":"sha256:9a234b8a6874ebd4a139ac97f0190594a0951a747a23faa2d523b8ab75d4d93d","observation_id":"36e17f08-5a44-462f-b932-356011a2b584","resolution":{"observed_at":"2026-06-29T22:24:00.706903Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"cited_work":{"arxiv_id":"2509.01440","doi":"10.48550/arxiv.2509.01440","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01440","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Benchmarking optimizers for large language model pretraining.arXiv preprint arXiv:2509.01440","venue":"ArXiv.org","work_id":"0365a535-39b7-4c6c-8ef2-d08314864789","year":2025},"citing_paper":{"arxiv_id":"2605.31371","last_updated":"2026-05-29T14:41:36Z","snapshot_observed_at":"2026-08-07T08:56:05.149276Z","submitted_at":"2026-05-29T14:41:36Z","title":"Softsign: Smooth Sign in Your Optimizer For Better Parameter Heterogeneity Handling","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-06-28T22:51:38.488754Z"},"links":{"cited_paper":"/paper/2509.01440","citing_paper":"/paper/2605.31371"},"observation_digest":"sha256:f0d5e033908ee03bf7e8f519bfa9b15c5b5c7920fb09c584e3c62ffec9531a54","observation_id":"b9670b42-1ecb-444c-bd9d-520367ce8fa4","resolution":{"observed_at":"2026-06-28T22:52:44.860967Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"cited_work":{"arxiv_id":"2509.01440","doi":"10.48550/arxiv.2509.01440","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01440","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Benchmarking optimizers for large language model pretraining.arXiv preprint arXiv:2509.01440","venue":"ArXiv.org","work_id":"0365a535-39b7-4c6c-8ef2-d08314864789","year":2025},"citing_paper":{"arxiv_id":"2606.03899","last_updated":"2026-06-03T02:06:07Z","snapshot_observed_at":"2026-08-01T15:38:47.150046Z","submitted_at":"2026-06-02T16:54:38Z","title":"Denoise First, Orthogonalize Later: Understanding Momentum in Muon via Spectral Filtering","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-28T11:24:38.292078Z"},"links":{"cited_paper":"/paper/2509.01440","citing_paper":"/paper/2606.03899"},"observation_digest":"sha256:8b77989f55537cc96a4bab9ccb20f80518756d45ad4bbaf403e31eb9458af8ff","observation_id":"670a7054-6c7e-4b71-b263-8d575561617c","resolution":{"observed_at":"2026-07-02T01:56:27.815268Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"cited_work":{"arxiv_id":"2509.01440","doi":"10.48550/arxiv.2509.01440","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01440","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Benchmarking optimizers for large language model pretraining.arXiv preprint arXiv:2509.01440","venue":"ArXiv.org","work_id":"0365a535-39b7-4c6c-8ef2-d08314864789","year":2025},"citing_paper":{"arxiv_id":"2606.23676","last_updated":"2026-06-22T17:58:52Z","snapshot_observed_at":"2026-08-06T14:32:57.924655Z","submitted_at":"2026-06-22T17:58:52Z","title":"Open Problem: Is AdamW Effective Under Heavy-Tailed Noise?","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-26T09:08:41.993925Z"},"links":{"cited_paper":"/paper/2509.01440","citing_paper":"/paper/2606.23676"},"observation_digest":"sha256:3fe35343d995531f4adce1c884b2835d014d64bf042b38b67318358ad5cdcbe4","observation_id":"68a78f89-2c6a-40fe-b4de-9242b71381ca","resolution":{"observed_at":"2026-07-04T10:09:44.602263Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.01440","snapshot_observed_at":"2026-07-11T22:10:49.683444Z","title":"Benchmarking optimizers for large language model pretraining.arXiv preprint arXiv:2509.01440, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04033","last_updated":"2026-07-04T21:27:05Z","snapshot_observed_at":"2026-08-07T05:07:10.107694Z","submitted_at":"2026-07-04T21:27:05Z","title":"OmniOpt: Taxonomy, Geometry, and Benchmarking of Modern Optimizers","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-07-11T22:10:49.683444Z"},"links":{"cited_paper":"/paper/2509.01440","citing_paper":"/paper/2607.04033"},"observation_digest":"sha256:6f750bcb936b86cf62e602b8cc1dfcbeb7fcf292da21d2c105a120a1c704c693","observation_id":"9c5e31cf-cfa2-4bc6-ac80-97675cc31922","resolution":{"observed_at":"2026-07-11T22:10:49.683444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.01440","snapshot_observed_at":"2026-08-01T17:47:03.790519Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17550","last_updated":"2026-07-20T04:51:20Z","snapshot_observed_at":"2026-08-10T06:26:14.073078Z","submitted_at":"2026-07-20T04:51:20Z","title":"(A)iSpy: Parasitic Trojans for Machine Learning Infrastructure","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:03.790519Z"},"links":{"cited_paper":"/paper/2509.01440","citing_paper":"/paper/2607.17550"},"observation_digest":"sha256:455110f93f6769a63eb228da8cb0edcbdaedf6c5d2c784e6cba85bbebfe37ffd","observation_id":"d3b04c17-064f-4229-9c1d-ccc1dcc9f23c","resolution":{"observed_at":"2026-08-01T17:47:03.790519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.01440","snapshot_observed_at":"2026-08-01T17:32:35.613381Z","title":"Semenov, M","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17620","last_updated":"2026-07-20T07:16:31Z","snapshot_observed_at":"2026-08-06T10:27:53.292028Z","submitted_at":"2026-07-20T07:16:31Z","title":"PoLoRA: A Preconditioned Orthogonalized LoRA Optimizer","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-01T17:32:35.613381Z"},"links":{"cited_paper":"/paper/2509.01440","citing_paper":"/paper/2607.17620"},"observation_digest":"sha256:14388c9b14079543c7a02371878ab2ee4d343ed93a11a30028ac59eddcf4d9cf","observation_id":"d3922175-6ba6-404b-b07c-115aab2d1ab1","resolution":{"observed_at":"2026-08-01T17:32:35.613381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.01440","snapshot_observed_at":"2026-07-30T12:53:41.174828Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23777","last_updated":"2026-07-26T17:55:40Z","snapshot_observed_at":"2026-07-30T23:56:43.497541Z","submitted_at":"2026-07-26T17:55:40Z","title":"Scale Weight Decay and Train Better","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-07-30T12:53:41.174828Z"},"links":{"cited_paper":"/paper/2509.01440","citing_paper":"/paper/2607.23777"},"observation_digest":"sha256:ff4ef32b5358b8cd8e4d46d28b027308857c3372180450cfd551a4fda48607f7","observation_id":"970c7596-d80c-40ac-8060-6449687b52f1","resolution":{"observed_at":"2026-07-30T12:53:41.174828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.01440","snapshot_observed_at":"2026-08-04T06:04:04.927838Z","title":"arXiv preprint arXiv:2509.01440 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02502","last_updated":"2026-08-03T17:04:43Z","snapshot_observed_at":"2026-08-08T01:53:43.616263Z","submitted_at":"2026-08-03T17:04:43Z","title":"CMuon: Accelerating and Stabilizing Diffusion Transformer Training via Chunked Momentum Orthogonalization","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T06:04:04.927838Z"},"links":{"cited_paper":"/paper/2509.01440","citing_paper":"/paper/2608.02502"},"observation_digest":"sha256:d0cc20b9884d274d8ed4c1c23c97797d5f84dfbf4495fd2fce9c6feec31bf4fc","observation_id":"76c7a6db-6cbd-4f13-a74e-2226997896a9","resolution":{"observed_at":"2026-08-04T06:04:04.927838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2509.01440/citation-record","integrity":"/paper/2509.01440/integrity","json":"/paper/2509.01440/citation-record.json","paper":"/paper/2509.01440"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:50.343838Z","title":"Dion: A communication-efficient optimizer for large models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:50.343838Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:097df306d98c8867f1369039795dc73c0bc5f0646bc7980d22c79ff644ba9dbc","observation_id":"f1e3d2e4-6b08-434e-ad32-7d90ef11da41","resolution":{"observed_at":"2026-08-05T12:35:50.343838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:50.353802Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:50.353802Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:f44c9fc19aaa818a0c53cf480b956ecc006e3a3a679ae864466f2cab1d4b4f23","observation_id":"63753a59-3c59-475d-be3d-de886728aeb2","resolution":{"observed_at":"2026-08-05T12:35:50.353802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:50.376510Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:50.376510Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:124a4849f503beae24e39621ee7642cb55160da91fe10854cb8f9a9d770ec656","observation_id":"2d976c51-744f-4ac0-8423-f981979703e6","resolution":{"observed_at":"2026-08-05T12:35:50.376510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:50.385438Z","title":"ASGO: Adaptive structured gradient optimization, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:50.385438Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:5f621de09afcfa6497b59aeb03b295ebb84a4d55451e18b9929e6e86fe601014","observation_id":"3500af33-a6ce-4821-8c65-c2c3dc857f52","resolution":{"observed_at":"2026-08-05T12:35:50.385438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:50.396648Z","title":"Dissecting adam: The sign, magnitude and variance of stochastic gradients, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:50.396648Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:8944c926dd82ca2068dc8a99e2a68f920eb71982a43d7edfa7b286aa8d6f16e6","observation_id":"8ad23d38-276b-4fa0-b950-4e69775ba4f7","resolution":{"observed_at":"2026-08-05T12:35:50.396648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:50.411974Z","title":"Bekas, E","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:50.411974Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:f68ec170e495ae8b0b81bf70d3dd3ab9cf55bcf01b956535790f44a03ea00f0c","observation_id":"d65bb383-339a-4cbf-9f54-5dfddbcd63ef","resolution":{"observed_at":"2026-08-05T12:35:50.411974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:50.430977Z","title":"Straight to zero: Why linearly decaying the learning rate to zero works best for llms, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:50.430977Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:10b32a149deac5cd14f0436aa2cdc1b9ac5d1d7da71a10897519d716259c5d66","observation_id":"99653034-b5f6-463c-8be3-ad2118a1de4c","resolution":{"observed_at":"2026-08-05T12:35:50.430977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:50.443584Z","title":"Old optimizer, new norm: An anthology, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:50.443584Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:e79427dbe2d29ab22a205fa5c24ca87108cddf7dc121cbd62db61ed22be8e1d4","observation_id":"6cb39b0b-ccc6-4f97-8da4-694e1ceb2c73","resolution":{"observed_at":"2026-08-05T12:35:50.443584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:50.461957Z","title":"signsgd: Compressed optimisation for non-convex problems, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:50.461957Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:8a192f0112f9586bbd242f183607ae50bbbdc8c66580cda4f9beb3e7f004dc9c","observation_id":"b232b8d0-7608-44ad-bd59-65bcca0fa84b","resolution":{"observed_at":"2026-08-05T12:35:50.461957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:50.470832Z","title":"Pythia: A suite for analyzing large language models across training and scaling, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:50.470832Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:1096a193e42331a805b466ba7275471ef4af21581d1fd074c654d2730d4d30a9","observation_id":"9da88b8d-b881-4c84-ab66-b87e03d91e37","resolution":{"observed_at":"2026-08-05T12:35:50.470832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:50.480601Z","title":"Prince, Björn Deiseroth, Andres Felipe Cruz-Salinas, Carlo Luschi, Samuel Weinbach, and Douglas Orr","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:50.480601Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:3c7f8972f985c2df9cdd8a1c5cd5c1724f885285e8cee54630e209b29d7d0d7d","observation_id":"ca24bbd4-073f-45d3-8332-faf66c88c7b5","resolution":{"observed_at":"2026-08-05T12:35:50.480601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:50.488446Z","title":"Loss-to- loss prediction: Scaling laws for all datasets, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:50.488446Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:fdda96f2acef04afaffac919ae2fbc74d7dff292942e3934284e2e9233ad6ecb","observation_id":"e8acd836-9d96-4b0f-b589-3a95b51d7fe0","resolution":{"observed_at":"2026-08-05T12:35:50.488446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:50.496417Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:50.496417Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:e5e6dfc27facf5de9df4adbadb2b728f5c060bc0bd99904916ebed60ecda5b5f","observation_id":"48f85189-d84d-4b0b-8315-30ee869344d0","resolution":{"observed_at":"2026-08-05T12:35:50.496417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:50.503429Z","title":"How to scale your ema, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:50.503429Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:e5796e98b120ce13c5da0ac983bc0752bd9984ea59b3b285bbab3ed1481e6d0d","observation_id":"e99a0e4f-801e-4090-8542-f186ea656dfa","resolution":{"observed_at":"2026-08-05T12:35:50.503429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:50.517235Z","title":"Preconditioned spectral descent for deep learning","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:50.517235Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:cf1e99e63919b7ece609f6e17763d84ad33ec9d7217e58e7be88df1aceeb3515","observation_id":"edcf4437-997a-4819-8877-53086dc35559","resolution":{"observed_at":"2026-08-05T12:35:50.517235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:50.525690Z","title":"Communication-efficient language model training scales reliably and robustly: Scaling laws for diloco, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:50.525690Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:c89399be1f89b84db274444ce164e7325400c832fd1a7ae112aa4fd2c9f89754","observation_id":"bfc187f7-6eb5-4361-bf37-c31eec335328","resolution":{"observed_at":"2026-08-05T12:35:50.525690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:50.536046Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:50.536046Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:4dc93e2ce2647478288df0ebf876e8b7e28fb8d8ef1bb4d5e68330be2dae0313","observation_id":"b635442a-42eb-4898-9d20-ebca781a4a6d","resolution":{"observed_at":"2026-08-05T12:35:50.536046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:50.545978Z","title":"Gradient clipping improves adagrad when the noise is heavy-tailed, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:50.545978Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:489a7e8fbaf9055c4584f30441635089888cc043c9546f664c6e4d47aa770859","observation_id":"0218fbe8-da25-4d79-9dd4-28bcb6e12e43","resolution":{"observed_at":"2026-08-05T12:35:50.545978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:50.555425Z","title":"Palm: Scaling language modeling with pathways, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:50.555425Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:e4a3f4f5d3dd85e7cc05f8562d38fea6aae703cf01937db58e234370febd1830","observation_id":"d15f6470-9b39-4ca2-8dd7-05ff919ba841","resolution":{"observed_at":"2026-08-05T12:35:50.555425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:50.580817Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:50.580817Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:cc2a31a18067b200ec0569b2743941bcdc7030f96777c67d2aa751644ad2c718","observation_id":"f8d737d2-f2e1-4aa1-b0dd-5c0eaa05a356","resolution":{"observed_at":"2026-08-05T12:35:50.580817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:50.590632Z","title":"Why do we need weight decay in modern deep learning?, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:50.590632Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:e2d245d6c9429710f252b59347a257cca105483686e9a5f651308ac722477c3e","observation_id":"692e9966-eb88-4cf5-be99-1027a0932bb4","resolution":{"observed_at":"2026-08-05T12:35:50.590632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:50.599608Z","title":"Fu, Stefano Ermon, Atri Rudra, and Christopher Ré","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:50.599608Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:bc27d0e4236f2a41e6a42b1367d0b8dc93e4fe472a06d85e449df655b23ed03d","observation_id":"aa651e1c-ed7c-4aa4-9046-acbf225be9e2","resolution":{"observed_at":"2026-08-05T12:35:50.599608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:50.606542Z","title":"Deepseek llm: Scaling open-source language models with longtermism, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:50.606542Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:a7b2f56d1084ebd2695ec1bd81f8d4b2d77a5e741abfef3faf2323329d7fd6db","observation_id":"3084708e-ad23-42b8-9fc3-7920679b9b97","resolution":{"observed_at":"2026-08-05T12:35:50.606542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:50.618917Z","title":"Deepseek-v3 technical report, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:50.618917Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:d5bdc490e8b4062339dd0c7ddc427885fd99191c3ef2eda67c4fe31a56fec769","observation_id":"2d7c4d5d-fbb7-417a-b303-b8b142ed5d9b","resolution":{"observed_at":"2026-08-05T12:35:50.618917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:50.625839Z","title":"Why gradients rapidly increase near the end of training, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:50.625839Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:312a93b426b2e55c48c0fa9df657440a874af26faacdc4c00af330db903cf0cb","observation_id":"7fe2fc43-b927-4b77-8a4a-7c57bd258c9f","resolution":{"observed_at":"2026-08-05T12:35:50.625839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:50.637129Z","title":"Optimal linear decay learning rate schedules and further refinements, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:50.637129Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:5a6c4c59647383cded6777b1c91a2c0f84e606f40ebf0c6bfc0148f6824d8b41","observation_id":"e0a9cbd7-3d3d-43b0-ab96-743e009cb0ed","resolution":{"observed_at":"2026-08-05T12:35:50.637129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:50.646543Z","title":"The road less scheduled, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:50.646543Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:5d596bde7645a560952f43752582e96b7839f16c18a92b5ae06c447b63939597","observation_id":"0bd0961f-59d0-4736-8b53-fa3953b2643a","resolution":{"observed_at":"2026-08-05T12:35:50.646543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:50.653793Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:50.653793Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:125d61f4a3586ce43bef02eed12c0f10d37b84d1ff16800e4ca0792f44af2cb3","observation_id":"0e9511fb-9e28-475e-acbb-6f7b128a5800","resolution":{"observed_at":"2026-08-05T12:35:50.653793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:50.660661Z","title":"The practitioner’s guide to the maximal update parameterization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:50.660661Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:56d8b175d061223f320d16498cd3989a30c7603a16b2ccf18d05d9eda0aedd25","observation_id":"c586caa8-8625-4451-9055-b8918360c51c","resolution":{"observed_at":"2026-08-05T12:35:50.660661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:50.667043Z","title":"Incorporating Nesterov Momentum into Adam, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:50.667043Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:e13e36626b5983702a9961624a69de28b3e4b06aeda957ac81365cf43f7f0a8f","observation_id":"b33a0093-52e9-41f7-aefe-ae400211107a","resolution":{"observed_at":"2026-08-05T12:35:50.667043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:50.675765Z","title":"Understanding emergent abilities of language models from the loss perspective, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:50.675765Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:bea45ce4d806144de7363efa7326349387ad4669c089cd73ad5baeb9288af4c8","observation_id":"3268a32e-81bb-4e54-a09f-a83543bb1881","resolution":{"observed_at":"2026-08-05T12:35:50.675765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:50.684220Z","title":"Adaptive subgradient methods for online learning and stochastic optimization","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:50.684220Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:dfb8558d2a596c3cd1d69582394764af0657708b9ba53d612332d0aacb7338b5","observation_id":"796c91ff-7051-4894-9d7e-a330a9565ede","resolution":{"observed_at":"2026-08-05T12:35:50.684220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:50.692572Z","title":"A simple convergence proof of adam and adagrad, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:50.692572Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:fa043788caa0c873dfd82278576d92c5eaae83baed31b2ea4597704bbde0442c","observation_id":"a236d56d-8584-43e9-8502-d6f3fba362c5","resolution":{"observed_at":"2026-08-05T12:35:50.692572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:50.699221Z","title":"Data movement bottlenecks to large-scale model training: Scaling past 1e28 flop,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:50.699221Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:894297825ad645da20959a7a3d812d2b26834427c45ddbd1e3df4d687d2b3898","observation_id":"78e07626-7a34-4416-924a-e3bf94d4a431","resolution":{"observed_at":"2026-08-05T12:35:50.699221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:50.716164Z","title":"Switch transformers: Scaling to trillion parameter models with simple and efficient sparsity, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:50.716164Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:070d850ade2ecc0ac9f4465caf2c5e58374692bba0b68ad80ae4daab2181501b","observation_id":"59524814-5713-4ec8-b181-b2e0eabbc3b5","resolution":{"observed_at":"2026-08-05T12:35:50.716164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:50.728738Z","title":"A stable whitening optimizer for efficient neural network training, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:50.728738Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:dc46ae33d1de1bc06d4af271d663ce99c453072995bee86191f74f7b7b496dd1","observation_id":"2772b691-3c1e-4765-86fb-a844a891ac4e","resolution":{"observed_at":"2026-08-05T12:35:50.728738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:50.740367Z","title":"Dimakis, Gabriel Ilharco, Pang Wei Koh, Shuran Song, Thomas Kollar, Yair Carmon, Achal Dave, Reinhard Heckel, Niklas Muennighoff, and Ludwig Schmidt","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:50.740367Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:3982609f0278a655156b8fdfaaa23797669a0d5e0872f495bbc8a5e8cfd36821","observation_id":"1b9f62ea-dde8-4235-878b-87c7d31b8cbb","resolution":{"observed_at":"2026-08-05T12:35:50.740367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00027","last_updated":"2020-12-31T19:00:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-12-31T19:00:10Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00027","snapshot_observed_at":"2026-08-05T12:35:50.748594Z","title":"The Pile: An 800gb dataset of diverse text for language modeling","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:50.748594Z"},"links":{"cited_paper":"/paper/2101.00027","citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:db8d5e3302789c226a871b344e5c7c9ab1a2765c0eccfc5620f4863a59f03122","observation_id":"835f6f7a-b65f-4488-bf9a-02c82ab72dad","resolution":{"observed_at":"2026-08-05T12:35:50.748594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:50.766003Z","title":"The pile: An 800gb dataset of diverse text for language modeling, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:50.766003Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:b66c03b968fb06f52d78d07c9ba1046f69250bf1b1d4dd456e3ffd2d3d8e0b7f","observation_id":"80ad567a-7f6b-4aff-99e4-4ac75f04e1de","resolution":{"observed_at":"2026-08-05T12:35:50.766003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:50.776544Z","title":"Gemini: A family of highly capable multimodal models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:50.776544Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:692b35e77b55113027660c65b51621f7f17c8f2ce2f72e05430bdf0e7428a622","observation_id":"8b0d714c-c4f9-47a8-b0b7-36258def0546","resolution":{"observed_at":"2026-08-05T12:35:50.776544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:50.786424Z","title":"A loss curvature perspective on training instability in deep learning, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:50.786424Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:9bc58afaa4b0450c88d71136f913dd0300af928980a899d64d56f1b82ff517ef","observation_id":"2081e7d5-38c0-4050-b7a7-cfbe7b09e64b","resolution":{"observed_at":"2026-08-05T12:35:50.786424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:50.793612Z","title":"A minimalist optimizer design for llm pretraining, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:50.793612Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:eb8d2cc77643f8c7fd78e116c99ff646ce0dcbbb19a016104c3a90cbb063051c","observation_id":"4af57d0a-2b59-4138-96a3-72aaddd8365a","resolution":{"observed_at":"2026-08-05T12:35:50.793612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:50.802389Z","title":"Generating sequences with recurrent neural networks, 2014","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:50.802389Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:1dbc3172837715cc25157447d455fc91a75038f1c08ae87413e306adb4d22271","observation_id":"0d192b09-2fc4-408a-b2fe-3a1ab03dd7f5","resolution":{"observed_at":"2026-08-05T12:35:50.802389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:50.816714Z","title":"Accelerating newton-schulz iteration for orthogonalization via chebyshev-type polynomials, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:50.816714Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:20cb7f6638daa227c79793eb499cbbb8eb19c9cc7052158d304d8969d674f012","observation_id":"9d8e5927-11b3-4eec-b73c-53b342eb21fe","resolution":{"observed_at":"2026-08-05T12:35:50.816714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:50.825415Z","title":"AdaPlus: Integrating nesterov momentum and precise stepsize adjustment on adamw basis, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:50.825415Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:a5e14976a0d99db16c764dde77e6f5158f5d4c2dbb1ec63812cd406a99648f25","observation_id":"353c38e4-9f8c-496c-83b4-0664eed62531","resolution":{"observed_at":"2026-08-05T12:35:50.825415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:50.838173Z","title":"Shampoo: Preconditioned stochastic tensor optimization, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:50.838173Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:417473155899566efc9005fa5ee7feed4cb563850dc3733689ebac91eab797bb","observation_id":"abceb8a5-5972-4481-b633-7da75869a1a4","resolution":{"observed_at":"2026-08-05T12:35:50.838173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:50.847579Z","title":"Under- standing and minimising outlier features in neural network training, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:50.847579Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:c6aab3579cffb582aa2ea2c3441ec8f52a2838382a1df1ac05574e27d1432139","observation_id":"9a5d9988-1f52-4382-b27a-8af80cf7ebc2","resolution":{"observed_at":"2026-08-05T12:35:50.847579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:50.856289Z","title":"Deep residual learning for image recognition, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:50.856289Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:0864a108803700cbe71752a398574109f10236d943c95fe75e55368c41f054f9","observation_id":"4e150506-03f9-42ca-a4f1-16b9938798fe","resolution":{"observed_at":"2026-08-05T12:35:50.856289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:50.866960Z","title":null,"venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:50.866960Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:81a7a84880a4c3f0bcced4083aec6e75ba2ac2ee0d4fa0922db1a85d93e31609","observation_id":"fa584f48-d9d3-408a-8ea6-1ac6408545d8","resolution":{"observed_at":"2026-08-05T12:35:50.866960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:50.875428Z","title":"Neural networks for machine learning, lecture 6e rmsprop: Divide the gradient by a running average of its recent magnitude, 2012","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:50.875428Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:75ad8b3c4774ef0ea0d3b764fa646952554680f47d273fec73312ca8d33adb27","observation_id":"e80a794b-b7a4-48cf-a3e8-04fe3aeb54f1","resolution":{"observed_at":"2026-08-05T12:35:50.875428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:50.882146Z","title":"Rae, Oriol Vinyals, and Laurent Sifre","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:50.882146Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:3f55546b9d2cf97cf7e6f605c65033acc5aff53e4a2e5af72168108a7bdd8884","observation_id":"b225316f-3228-4134-873c-f2faf6e4d95b","resolution":{"observed_at":"2026-08-05T12:35:50.882146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:50.892741Z","title":"Minicpm: Unveiling the potential of small language models with scalable training strategies, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:50.892741Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:c3532085b53bf81106cf0da49467eef63d78070c1f82342ef014ad75fb4dc96b","observation_id":"73adb6cd-73a3-40a1-9be7-78c6242c9fff","resolution":{"observed_at":"2026-08-05T12:35:50.892741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:50.905305Z","title":"Improving transformer opti- mization through better initialization","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:50.905305Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:ddd84b8280ff02b52c7e2aeaacc390db94158c382c3c25c0fe594543bf402f41","observation_id":"80d4d8db-1738-4952-96b9-346906feed94","resolution":{"observed_at":"2026-08-05T12:35:50.905305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:50.919282Z","title":"Scaling laws and compute-optimal training beyond fixed training durations, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:50.919282Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:a2c25c3024b30ca790162a189e25c65cc4d00ea94b83adb26b6e51bd84d2b00b","observation_id":"a99c433d-c413-4835-b1ba-2d4a94238b8f","resolution":{"observed_at":"2026-08-05T12:35:50.919282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:50.926941Z","title":"Averaging weights leads to wider optima and better generalization, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:50.926941Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:3743d4fa6f0186a83f0ff195cd8cee907d97fc31a4bb78f024a5f3b30d693918","observation_id":"f50c55e8-f38c-4482-9a71-0bc3784b1f17","resolution":{"observed_at":"2026-08-05T12:35:50.926941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:50.938288Z","title":"Intellect-1 technical report, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:50.938288Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:56d5174b25d58d8f7c0dadb80a885bf51ca0ad77d73f67c400dee6db8409f960","observation_id":"13415e75-749f-4321-949c-d87048939e02","resolution":{"observed_at":"2026-08-05T12:35:50.938288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:50.946890Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:50.946890Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:fc4125cb2c08780a160801379e12256bfe48e4109b40f3101d8fca2752491f7e","observation_id":"f9d73ab2-3f1d-43a7-b8df-4e343381632d","resolution":{"observed_at":"2026-08-05T12:35:50.946890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:50.956877Z","title":"modded-nanogpt: Speedrunning the nanogpt baseline, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:50.956877Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:fe4281907e111b36c2a42d278893d72ac9a4a979fe26fb1ee35f5083763e7ea7","observation_id":"d820ecaa-a9fa-4067-a3dc-f4840cd3c4de","resolution":{"observed_at":"2026-08-05T12:35:50.956877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:50.965261Z","title":"Muon: An optimizer for hidden layers in neural networks, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:50.965261Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:aab3b649a8490e654c433cf028c2615995eba075c155ff6174fcfeec789c6b18","observation_id":"38974e3d-c682-4d85-a70a-786b757ad391","resolution":{"observed_at":"2026-08-05T12:35:50.965261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:50.981425Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:50.981425Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:e7e32464a597173971cdd7381489f424a586fa4b1ffd3fa21d1b1f7475b38e49","observation_id":"c16bd359-1f7d-46b2-be05-164a43f14643","resolution":{"observed_at":"2026-08-05T12:35:50.981425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:50.990386Z","title":"Why warmup the learning rate? underlying mechanisms and improvements, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:50.990386Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:9209141b4259f6aa5ea87df53582e54182065ef94ddd7cab74fa59e0e5797b4e","observation_id":"92f7ebe0-b223-439b-9169-aecb5f374815","resolution":{"observed_at":"2026-08-05T12:35:50.990386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:50.998917Z","title":"Brown, Benjamin Chess, Rewon Child, Scott Gray, Alec Radford, Jeffrey Wu, and Dario Amodei","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:50.998917Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:b92fcccc009f2f4cb0ee0f05d48d439312eca00a64810271456b2596c618306f","observation_id":"e13ef9ac-1d10-4655-becb-8e4788c544a7","resolution":{"observed_at":"2026-08-05T12:35:50.998917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:51.007417Z","title":"Error feedback fixes signSGD and other gradient compression schemes","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:51.007417Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:efa78241c9cceed4eae47107ef65992ccb67642b38edeb8640d115580dfdc0de","observation_id":"8a7e8f82-4584-47c5-a4db-6e4e0a4007a0","resolution":{"observed_at":"2026-08-05T12:35:51.007417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:51.016356Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:51.016356Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:9348b519bca7b22c6eee000ff7ab1c055c90d7b3bee26f291d8351572bf60b3f","observation_id":"337c6213-9588-41a8-a388-309d8927b8cc","resolution":{"observed_at":"2026-08-05T12:35:51.016356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:51.023163Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:51.023163Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:70e777144c2d18cd31fa36ab06842d45a03b334accb849f2f84b1546dbbb5c44","observation_id":"b2aa18dd-7536-4971-b794-82731facaa9d","resolution":{"observed_at":"2026-08-05T12:35:51.023163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:51.029750Z","title":"Kingma and Jimmy Ba","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:51.029750Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:c5be24849384d710fd82bf3fa458208352ad542be49d3094b433c2ac57a6201d","observation_id":"8b0ea370-d994-49a5-8950-e8350bee3995","resolution":{"observed_at":"2026-08-05T12:35:51.029750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:51.041783Z","title":"Sign operator for coping with heavy-tailed noise in non-convex optimization: High probability bounds under (l0,l 1)-smoothness, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:51.041783Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:e4d4698b321a3c37466b719ec121e3619925308751d7941d16f8912f340c0427","observation_id":"a3881c39-deb2-4d95-8888-0b1319dfe729","resolution":{"observed_at":"2026-08-05T12:35:51.041783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:51.048805Z","title":"Analyzing & reducing the need for learning rate warmup in gpt training, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:51.048805Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:d2d2c85b95a80e213836f432f3c13418f69baf4772faae182695aa263db24b64","observation_id":"cc26a4d6-5197-4e15-b87b-02d26576d30b","resolution":{"observed_at":"2026-08-05T12:35:51.048805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:51.055398Z","title":"Rotational equilibrium: How weight decay balances learning across neural networks, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:51.055398Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:6ef21cee1fd474292e8aa2c8b8fdd0fbad7a544586e4052c5e719e752623cdc8","observation_id":"9bdf0811-3ca2-4b48-9288-c3cd48b5710d","resolution":{"observed_at":"2026-08-05T12:35:51.055398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:51.060600Z","title":"Understanding gradient orthogonalization for deep learning via non-euclidean trust-region optimization, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:51.060600Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:1ac15e675e50d39e5ebea6925a8aa63565aa0615d0e0be0c9a705b725e094c1b","observation_id":"8398ef5d-ff5e-4bcd-8e36-29e4c59cceaf","resolution":{"observed_at":"2026-08-05T12:35:51.060600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:51.074620Z","title":"Spector, Blake Bordelon, Niklas Muennighoff, Mansheej Paul, Cengiz Pehlevan, Christopher Ré, and Aditi Raghunathan","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:51.074620Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:169242d47759a277b4b7e0aaa02c45cf2c154191b1fac7befdc58e1c7c3c4f82","observation_id":"a4b82c0a-b051-4229-ba82-4f198e4c51e0","resolution":{"observed_at":"2026-08-05T12:35:51.074620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:51.085256Z","title":"Why do machine learning optimizers that work, work? PhD thesis, University of British Columbia, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:51.085256Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:8f140157fbdf936cd0c4436f3b7afd4277646038456cc279a08f85ae841a31b5","observation_id":"0910f1f0-0f14-4d1d-aba3-0f1bdc01d2a5","resolution":{"observed_at":"2026-08-05T12:35:51.085256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:51.098766Z","title":"Noise is not the main factor behind the gap between sgd and adam on transformers, but sign descent might be, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:51.098766Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:b269e74fb14ab1ea9ffc802c8dc41ac607b6145fde34cae9b228416bc0ff0f76","observation_id":"6fa78a03-397b-4db9-bdb9-d6eac5e83b0a","resolution":{"observed_at":"2026-08-05T12:35:51.098766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:51.112981Z","title":"Heavy- tailed class imbalance and why adam outperforms gradient descent on language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:51.112981Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:fc0a9d1bb5269164a4ef83d6f1d0f033615036d68ff088310dd9739217912572","observation_id":"20c8f9dd-e67f-48dd-a6b4-ece308824be8","resolution":{"observed_at":"2026-08-05T12:35:51.112981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:51.120086Z","title":"Farseer: A refined scaling law in large language models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:51.120086Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:9fdac0a1145500958ec348cd6cd7ecede490fc82950fd0b96a77221c187b0f2a","observation_id":"b0fd45ae-a0e1-46aa-b445-6e6e38e53444","resolution":{"observed_at":"2026-08-05T12:35:51.120086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:51.139881Z","title":"Predictable scale: Part i – optimal hyperparameter scaling law in large language model pretraining, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:51.139881Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:35f5475c5a3766e1c0ab750b37fb569fc169ba46ab87e54bce43c0fd0188e456","observation_id":"9d666264-eeb7-4454-822e-29c3b35cf984","resolution":{"observed_at":"2026-08-05T12:35:51.139881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:51.152542Z","title":"Datacomp-lm: In search of the next generation of training sets for language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:51.152542Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:0d217f214e2a95cdd0e7ef2280b5125694c8a3eee06517a57e7424b2192f703a","observation_id":"7299b8a9-a840-4b50-b3df-edbd8a503584","resolution":{"observed_at":"2026-08-05T12:35:51.152542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:51.163892Z","title":"Pytorch distributed: Experiences on accelerating data parallel training, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:51.163892Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:4984cc22ea1497e2a483db393ec14068aaa82f8677cdf987097ecf1be4a99972","observation_id":"5da4ae20-002b-4624-b747-5b594098b239","resolution":{"observed_at":"2026-08-05T12:35:51.163892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:51.172192Z","title":"Sophia: A scalable stochastic second-order optimizer for language model pre-training, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:51.172192Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:63a8dc22ee50aa6ebb6b861c924078c2dc8b6705d0f847be3c420cd83a6f32ce","observation_id":"1c2cf729-c7d3-43ec-8d55-bf9798f8b90f","resolution":{"observed_at":"2026-08-05T12:35:51.172192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:51.180465Z","title":"Same pre-training loss, better downstream: Implicit bias matters for language models, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:51.180465Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:aa785ba9a77836aa9330a4f929b22f5b6c53b946ea177ac581d466c3308290a2","observation_id":"4061f7f4-ef2f-4a11-80c1-fc94bb050377","resolution":{"observed_at":"2026-08-05T12:35:51.180465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:51.191462Z","title":"Muon is scalable for llm training, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:51.191462Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:36d8161528489d68d26219f200d7e25e64e44a05e9a739c1fa8e24e227ed9126","observation_id":"bc4135a7-2505-4875-900b-84de062d0af9","resolution":{"observed_at":"2026-08-05T12:35:51.191462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:51.201700Z","title":"The llama 3 herd of models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:51.201700Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:2127533bc958890248193d45c0faf62abf8a469aa42db17a058f5f0bae2b84be","observation_id":"daaa7974-2a32-4a0b-8a88-d7b69a33f651","resolution":{"observed_at":"2026-08-05T12:35:51.201700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:51.211642Z","title":"Sgdr: Stochastic gradient descent with warm restarts, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:51.211642Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:ff53b9f1463ce73f63ee1a567da386c8a70b108f2758314c9be6455bf28464a5","observation_id":"a16d0fcb-fc91-4260-9bda-8d80a8687569","resolution":{"observed_at":"2026-08-05T12:35:51.211642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:51.224611Z","title":"Decoupled weight decay regularization, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:51.224611Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:77c625ad7f33c87e7fbbdb9e0fcbba0c53b80262dd80e7b4ac455e31a5477a75","observation_id":"22c52868-f616-4c9e-ab23-bd15809fe719","resolution":{"observed_at":"2026-08-05T12:35:51.224611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:51.235207Z","title":"SW AN: SGD with normalization and whitening enables stateless llm training, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:51.235207Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:a49308a17438d8bbef8cf1ee1f16e9da4f8302bd89a11a734c71ef35982f7291","observation_id":"e5d8e998-92e5-4744-aa5a-a4c761ed6385","resolution":{"observed_at":"2026-08-05T12:35:51.235207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:51.242809Z","title":"Small batch size training for language models: When vanilla sgd works, and why gradient accumulation is wasteful, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:51.242809Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:d87e793a1a16e8eccfafb6a59f0cd5ba7c74ea60c2e77157f453db57d6ebc104","observation_id":"5dcd21a0-44d1-42aa-bd47-0b5060f0111c","resolution":{"observed_at":"2026-08-05T12:35:51.242809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:51.248543Z","title":"New insights and perspectives on the natural gradient method, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:51.248543Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:640fd07a03df24e7f928f12cfc6fe85c8d381406d37ab69e17bda1e0907240d7","observation_id":"b3c415c9-f333-43d9-862f-75f9d37f68fb","resolution":{"observed_at":"2026-08-05T12:35:51.248543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:51.255443Z","title":"Effects of parameter norm growth during transformer training: Inductive bias from gradient descent, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:51.255443Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:be4e44a208d6a46e320f9e389320de07f170575a80d4f8da9163311d5c1a64bc","observation_id":"c9e0dec5-84c7-4103-aa90-4253ea486bb8","resolution":{"observed_at":"2026-08-05T12:35:51.255443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:51.261498Z","title":"Mixed precision training, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:51.261498Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:654498919f61473b0676c872768c38fcf4958ce252fc1d2ac2a7052bdb58f436","observation_id":"0c7b8a1c-08c2-4457-8bb3-486055d882cc","resolution":{"observed_at":"2026-08-05T12:35:51.261498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:51.275664Z","title":"Prodigy: An expeditiously adaptive parameter-free learner, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:51.275664Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:30cff1f7009d59f5f767404b10a47f5107047eaf5a9195f8d6b70f2176e105f3","observation_id":"8f1263d3-4151-4df4-bfb7-35b3d19913d9","resolution":{"observed_at":"2026-08-05T12:35:51.275664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:51.358568Z","title":"Connections between schedule-free optimizers, ademamix, and accelerated sgd variants, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:51.358568Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:ab16b8a92694735620da83dcc445f73f3576d8195b2a76d927204da151a00f96","observation_id":"a421d4d2-fa90-4870-84d4-980d0a231179","resolution":{"observed_at":"2026-08-05T12:35:51.358568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:51.419005Z","title":"Nemirovskii and Yu.E","venue":null,"work_id":null,"year":1985},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:51.419005Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:bfffb096b064115353545c9eade568b60a78f223dc7a2a4962a4a7eddecbec29","observation_id":"404f1cf9-6ae6-4461-87eb-25729cb3cdb2","resolution":{"observed_at":"2026-08-05T12:35:51.419005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:51.472058Z","title":"Nesterov and V","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:51.472058Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:f6839aa966d7f768fd20bf9c37e1ec7db047eecc765a8eb6e5f424968c9a4102","observation_id":"c51e241d-6516-4e23-b331-d3ca9c0a86d0","resolution":{"observed_at":"2026-08-05T12:35:51.472058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:51.531481Z","title":"A method for unconstrained convex minimization problem with the rate of convergenceo(1/k2), 1983","venue":null,"work_id":null,"year":1983},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:51.531481Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:f1deb78094e46ab760d150f182da8c50e11b3fa35d1db63219def4cf6209d855","observation_id":"3137ecfe-fb7e-417d-b06a-36dc41aae6f9","resolution":{"observed_at":"2026-08-05T12:35:51.531481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:51.607895Z","title":"Gpt-4 technical report, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:51.607895Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:59d7af01a687d8782b87bb10503b983de6f0107394a48cd99f75ff66783884e0","observation_id":"fa5b3773-9138-402e-ada3-c120a8190b59","resolution":{"observed_at":"2026-08-05T12:35:51.607895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:51.676668Z","title":"Neural networks (maybe) evolved to make adam the best optimizer, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:51.676668Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:39c8ee9f3953819577351194fb0a201d4eda3192ee1ec86e35b89eab238c305d","observation_id":"b5dec2b1-a411-4fd3-8b95-6396e8d915f3","resolution":{"observed_at":"2026-08-05T12:35:51.676668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:36:02.787244Z","title":"Open problem: Parameter-free and scale-free online algorithms","venue":null,"work_id":"d2b23536-bb0a-4528-a74f-572c31f5a5bd","year":2016},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:51.744176Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:955e3ea9c33178b55ffbd1c2185b0f4300e95b7b97c47407a4557603ecf74926","observation_id":"a68501d0-3c31-42a5-a91b-d30c574888f2","resolution":{"observed_at":"2026-08-05T12:36:02.794621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:36:02.758643Z","title":"In search of adam’s secret sauce, 2025","venue":null,"work_id":"edd43397-4729-4119-bb11-bf4358d78e65","year":2025},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:51.807783Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:2ef3b859cdf81c0e5a896f5b2ddedba7c5bada9ee80c194d3c659f452e2197ab","observation_id":"568a1e7d-7e71-4a89-88cc-4b6afea2f98d","resolution":{"observed_at":"2026-08-05T12:36:02.768138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:36:02.726669Z","title":"The ademamix optimizer: Better, faster, older, 2024","venue":null,"work_id":"19f0be29-200c-4115-a501-3ab128b4a7c3","year":2024},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:51.891549Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:98d1d507af12db676c20be07076bf689ccd56cc3abae05dd392cdc5b00264820","observation_id":"a8f6afa5-eb57-45d5-bda7-46bd96386e7a","resolution":{"observed_at":"2026-08-05T12:36:02.733539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:35:51.957442Z","title":"Pytorch: An imperative style, high-performance deep learning library, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-05T12:35:51.957442Z"},"links":{"citing_paper":"/paper/2509.01440"},"observation_digest":"sha256:7e8a5c6a50cafad42be5c8ee14113494d97cb32b781233a71c1544deb2c00a34","observation_id":"f12878bb-536d-4b0f-960d-a3a7eb347cb3","resolution":{"observed_at":"2026-08-05T12:35:51.957442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-05T12:35:34.767594Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":97,"verified_exact":0,"verified_fuzzy":3},"total_outbound_references":176},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 100 of 176 outbound references and 28 inbound Pith citation observations for arXiv:2509.01440."}