Pith. sign in

Paper Citation Record · LEDGER

Benchmarking Optimizers for Large Language Model Pretraining

As of 14 August 2026, this Paper Citation Record lists 100 of 176 outbound references and 28 inbound Pith citation observations for arXiv:2509.01440.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2509.01440 v1

Coverage vector

measured 100 of 176 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-05T12:35:51.957442Z

measured 128 of 128 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-14T06:32:32.682623+00:00

measured 28 of 28 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-05T11:59:49.778357Z

measured 1 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-08-05T02:28:24.338817Z

Reference resolution

100 of 176 outbound references displayed

  • verified exact0
  • verified fuzzy3
  • unresolved97
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

0
arxiv_reference, observed 2026-08-05T02:28:24.338817Z

Outbound references

Observation f1e3d2e4-6b08-434e-ad32-7d90ef11da41 · outbound

This paper cites Dion: A communication-efficient optimizer for large models, 2025.

Benchmarking Optimizers for Large Language Model Pretraining Dion: A communication-efficient optimizer for large models, 2025

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.343838Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.343838Z digest=sha256:13a4a52b0332bf9c8c454191444447e23fc75420c6624cd06cf93b5989a78c46

Observation 63753a59-3c59-475d-be3d-de886728aeb2 · outbound

This paper cites an unresolved cited work.

Benchmarking Optimizers for Large Language Model Pretraining Unresolved cited work

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.353802Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.353802Z digest=sha256:05b39a86cb9d13e1239667f89a5730951a1dea3a71a561749df529afdd6b432b

Observation 2d976c51-744f-4ac0-8423-f981979703e6 · outbound

This paper cites an unresolved cited work.

Benchmarking Optimizers for Large Language Model Pretraining Unresolved cited work

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.376510Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.376510Z digest=sha256:93a15d42bf2be0160f74389c39c1a8398c6b6c2e7da5d674c30d3f485914f382

Observation 3500af33-a6ce-4821-8c65-c2c3dc857f52 · outbound

This paper cites ASGO: Adaptive structured gradient optimization, 2025.

Benchmarking Optimizers for Large Language Model Pretraining ASGO: Adaptive structured gradient optimization, 2025

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.385438Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.385438Z digest=sha256:b77ab6d2c89946fc21eecdb137d898ce91ffd6c4fc98cd2e1abab7197f4b6178

Observation 8ad23d38-276b-4fa0-b950-4e69775ba4f7 · outbound

This paper cites Dissecting adam: The sign, magnitude and variance of stochastic gradients, 2020.

Benchmarking Optimizers for Large Language Model Pretraining Dissecting adam: The sign, magnitude and variance of stochastic gradients, 2020

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.396648Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.396648Z digest=sha256:2bb9482b5c5193f11d6362f031a874251cea3281877d892fb45015192c786285

Observation d65bb383-339a-4cbf-9f54-5dfddbcd63ef · outbound

This paper cites Bekas, E.

Benchmarking Optimizers for Large Language Model Pretraining Bekas, E

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.411974Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.411974Z digest=sha256:b7e287ece4f421ab9f4b571d052b5bb01586eb40064fd484e0a8f110bf91b6bb

Observation 99653034-b5f6-463c-8be3-ad2118a1de4c · outbound

This paper cites Straight to zero: Why linearly decaying the learning rate to zero works best for llms, 2025.

Benchmarking Optimizers for Large Language Model Pretraining Straight to zero: Why linearly decaying the learning rate to zero works best for llms, 2025

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.430977Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.430977Z digest=sha256:3d546fd46ed71a500df8fc82dd222f5c0452ac767b91f3dd0db0c7c7ea5d6b68

Observation 6cb39b0b-ccc6-4f97-8da4-694e1ceb2c73 · outbound

This paper cites Old optimizer, new norm: An anthology, 2024.

Benchmarking Optimizers for Large Language Model Pretraining Old optimizer, new norm: An anthology, 2024

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.443584Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.443584Z digest=sha256:e3db1b8f1fc2bd34ad69604f0d7e6f08c88b6fdbe29d8a6fede1fa509adb4657

Observation b232b8d0-7608-44ad-bd59-65bcca0fa84b · outbound

This paper cites signsgd: Compressed optimisation for non-convex problems, 2018.

Benchmarking Optimizers for Large Language Model Pretraining signsgd: Compressed optimisation for non-convex problems, 2018

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.461957Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.461957Z digest=sha256:2040d39007df483003d2e8f8d532399dce75061c25a294b477e20788896d2b82

Observation 9da88b8d-b881-4c84-ab66-b87e03d91e37 · outbound

This paper cites Pythia: A suite for analyzing large language models across training and scaling, 2023.

Benchmarking Optimizers for Large Language Model Pretraining Pythia: A suite for analyzing large language models across training and scaling, 2023

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.470832Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.470832Z digest=sha256:6b8f20b6e02b0d43c37a7d0fabda7302cc712263b6e70f3984360d6862cb0657

Observation ca24bbd4-073f-45d3-8332-faf66c88c7b5 · outbound

This paper cites Prince, Björn Deiseroth, Andres Felipe Cruz-Salinas, Carlo Luschi, Samuel Weinbach, and Douglas Orr.

Benchmarking Optimizers for Large Language Model Pretraining Prince, Björn Deiseroth, Andres Felipe Cruz-Salinas, Carlo Luschi, Samuel Weinbach, and Douglas Orr

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.480601Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.480601Z digest=sha256:44f9b421a8154aea32264e72b187ea1763a22037ee8ffcab0a8f2e1f5cb08c05

Observation e8acd836-9d96-4b0f-b589-3a95b51d7fe0 · outbound

This paper cites Loss-to- loss prediction: Scaling laws for all datasets, 2024.

Benchmarking Optimizers for Large Language Model Pretraining Loss-to- loss prediction: Scaling laws for all datasets, 2024

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.488446Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.488446Z digest=sha256:f8c844c2e71bd91e7b489a83cff531bffe194e1c133dd4692e441bbbd3430cf2

Observation 48f85189-d84d-4b0b-8315-30ee869344d0 · outbound

This paper cites an unresolved cited work.

Benchmarking Optimizers for Large Language Model Pretraining Unresolved cited work

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.496417Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.496417Z digest=sha256:039f88b522e1c13ee9fb5a2753bace1216f8121dddb592a147961a6c8f43c86c

Observation e99a0e4f-801e-4090-8542-f186ea656dfa · outbound

This paper cites How to scale your ema, 2023.

Benchmarking Optimizers for Large Language Model Pretraining How to scale your ema, 2023

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.503429Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.503429Z digest=sha256:9444b5b354f0c394121a8ce16c3f5ac6de734363b556f67aa63a296a8b4dfaff

Observation edcf4437-997a-4819-8877-53086dc35559 · outbound

This paper cites Preconditioned spectral descent for deep learning.

Benchmarking Optimizers for Large Language Model Pretraining Preconditioned spectral descent for deep learning

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.517235Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.517235Z digest=sha256:c01fd9ded7f7fad6841952319e9e386eb7a442355917f6865dfd9c9bcfa6e52d

Observation bfc187f7-6eb5-4361-bf37-c31eec335328 · outbound

This paper cites Communication-efficient language model training scales reliably and robustly: Scaling laws for diloco, 2025.

Benchmarking Optimizers for Large Language Model Pretraining Communication-efficient language model training scales reliably and robustly: Scaling laws for diloco, 2025

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.525690Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.525690Z digest=sha256:03a97e2e216c90ae70e3a96dc2026dc9bff751593b6e50fff202f932f12e5137

Observation b635442a-42eb-4898-9d20-ebca781a4a6d · outbound

This paper cites an unresolved cited work.

Benchmarking Optimizers for Large Language Model Pretraining Unresolved cited work

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.536046Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.536046Z digest=sha256:ecc9d3b7018c8db86090ff3740d8c31453f73294ed8c1cff33f556b6b9535ebe

Observation 0218fbe8-da25-4d79-9dd4-28bcb6e12e43 · outbound

This paper cites Gradient clipping improves adagrad when the noise is heavy-tailed, 2024.

Benchmarking Optimizers for Large Language Model Pretraining Gradient clipping improves adagrad when the noise is heavy-tailed, 2024

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.545978Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.545978Z digest=sha256:3b088f85a5fdd2e53180f44ae1c8571f1b1ef2fd14fb6daa5712a1dc064e228e

Observation d15f6470-9b39-4ca2-8dd7-05ff919ba841 · outbound

This paper cites Palm: Scaling language modeling with pathways, 2022.

Benchmarking Optimizers for Large Language Model Pretraining Palm: Scaling language modeling with pathways, 2022

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.555425Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.555425Z digest=sha256:56c8004d25e80c12333d4bacafa8e5812ad8b664cec6d6966d863fd0de17b59e

Observation f8d737d2-f2e1-4aa1-b0dd-5c0eaa05a356 · outbound

This paper cites an unresolved cited work.

Benchmarking Optimizers for Large Language Model Pretraining Unresolved cited work

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.580817Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.580817Z digest=sha256:51a99da4d18726e94f1996f51b9d6d1c448c78989b52f9504a696326cdaba905

Observation 692e9966-eb88-4cf5-be99-1027a0932bb4 · outbound

This paper cites Why do we need weight decay in modern deep learning?, 2024.

Benchmarking Optimizers for Large Language Model Pretraining Why do we need weight decay in modern deep learning?, 2024

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.590632Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.590632Z digest=sha256:1906fed6a74f46a539a5e4dc5904feeff174c39b0b41ba537aec9afc1a4e191c

Observation aa651e1c-ed7c-4aa4-9046-acbf225be9e2 · outbound

This paper cites Fu, Stefano Ermon, Atri Rudra, and Christopher Ré.

Benchmarking Optimizers for Large Language Model Pretraining Fu, Stefano Ermon, Atri Rudra, and Christopher Ré

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.599608Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.599608Z digest=sha256:50a6e2a9203e2bd77fe1d5e13aa09e69b1341d2f634570d548377819906973b9

Observation 3084708e-ad23-42b8-9fc3-7920679b9b97 · outbound

This paper cites Deepseek llm: Scaling open-source language models with longtermism, 2024.

Benchmarking Optimizers for Large Language Model Pretraining Deepseek llm: Scaling open-source language models with longtermism, 2024

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.606542Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.606542Z digest=sha256:8105ac879960ad657485e67b8cba88432d1a6ee42e46c66bcf7b6af2f9e08ab3

Observation 2d7c4d5d-fbb7-417a-b303-b8b142ed5d9b · outbound

This paper cites Deepseek-v3 technical report, 2024.

Benchmarking Optimizers for Large Language Model Pretraining Deepseek-v3 technical report, 2024

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.618917Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.618917Z digest=sha256:e6aae009b7f97f61cc2a0988b1ee642cca0b4d632686518f123a44a26f5fad9c

Observation 7fe2fc43-b927-4b77-8a4a-7c57bd258c9f · outbound

This paper cites Why gradients rapidly increase near the end of training, 2025.

Benchmarking Optimizers for Large Language Model Pretraining Why gradients rapidly increase near the end of training, 2025

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.625839Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.625839Z digest=sha256:8ea754bda6b6c49e118d4f2fe0e268ddbf8653780aed483eb0ad630848497a04

Observation e0a9cbd7-3d3d-43b0-ab96-743e009cb0ed · outbound

This paper cites Optimal linear decay learning rate schedules and further refinements, 2024.

Benchmarking Optimizers for Large Language Model Pretraining Optimal linear decay learning rate schedules and further refinements, 2024

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.637129Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.637129Z digest=sha256:44d9dcbf4dc4f0f6ddf17c5ba780ac529c94a31f17f4c23707c5416eab309109

Observation 0bd0961f-59d0-4736-8b53-fa3953b2643a · outbound

This paper cites The road less scheduled, 2024.

Benchmarking Optimizers for Large Language Model Pretraining The road less scheduled, 2024

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.646543Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.646543Z digest=sha256:c29a689eaa34ea55894196bcacb0fd6ec13ec76ba7088775fcbb733fc9313858

Observation 0e9511fb-9e28-475e-acbb-6f7b128a5800 · outbound

This paper cites Bert: Pre-training of deep bidirectional transformers for language understanding, 2019.

Benchmarking Optimizers for Large Language Model Pretraining Bert: Pre-training of deep bidirectional transformers for language understanding, 2019

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.653793Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.653793Z digest=sha256:4440cb567577d6a872275717138ea394346e9a43468a8fad79388dd6f2c07e3f

Observation c586caa8-8625-4451-9055-b8918360c51c · outbound

This paper cites The practitioner’s guide to the maximal update parameterization.

Benchmarking Optimizers for Large Language Model Pretraining The practitioner’s guide to the maximal update parameterization

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.660661Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.660661Z digest=sha256:31ecd4b9033a26d16f8289c9ef63e5bd78db7b5198c682f777ed5800e6831acf

Observation b33a0093-52e9-41f7-aefe-ae400211107a · outbound

This paper cites Incorporating Nesterov Momentum into Adam, 2016.

Benchmarking Optimizers for Large Language Model Pretraining Incorporating Nesterov Momentum into Adam, 2016

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.667043Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.667043Z digest=sha256:d6eae25955f94cd188e00a5d45fcfdc1d35e9ddff2518f0df35880cc7afa3ce1

Observation 3268a32e-81bb-4e54-a09f-a83543bb1881 · outbound

This paper cites Understanding emergent abilities of language models from the loss perspective, 2025.

Benchmarking Optimizers for Large Language Model Pretraining Understanding emergent abilities of language models from the loss perspective, 2025

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.675765Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.675765Z digest=sha256:1590a00b06049ea7603d2f4ce1de700dc65d2e04ac0d19f99d9766215c959a9c

Observation 796c91ff-7051-4894-9d7e-a330a9565ede · outbound

This paper cites Adaptive subgradient methods for online learning and stochastic optimization.

Benchmarking Optimizers for Large Language Model Pretraining Adaptive subgradient methods for online learning and stochastic optimization

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.684220Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.684220Z digest=sha256:5c1c0cb1eec4e5d4ad29d23bb825c96e7b3d03fb040b9ef73dd64b83c4e0c97c

Observation a236d56d-8584-43e9-8502-d6f3fba362c5 · outbound

This paper cites A simple convergence proof of adam and adagrad, 2022.

Benchmarking Optimizers for Large Language Model Pretraining A simple convergence proof of adam and adagrad, 2022

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.692572Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.692572Z digest=sha256:f4f5192ba5a1491be890a897dca4a408b062887f619e0c9ed5fd99d256fa29c7

Observation 78e07626-7a34-4416-924a-e3bf94d4a431 · outbound

This paper cites Data movement bottlenecks to large-scale model training: Scaling past 1e28 flop,.

Benchmarking Optimizers for Large Language Model Pretraining Data movement bottlenecks to large-scale model training: Scaling past 1e28 flop,

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.699221Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.699221Z digest=sha256:22e723aaea992853b5049f75a4d270b7e2d646c352ea4a3221365e483b3f8634

Observation 59524814-5713-4ec8-b181-b2e0eabbc3b5 · outbound

This paper cites Switch transformers: Scaling to trillion parameter models with simple and efficient sparsity, 2022.

Benchmarking Optimizers for Large Language Model Pretraining Switch transformers: Scaling to trillion parameter models with simple and efficient sparsity, 2022

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.716164Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.716164Z digest=sha256:2f88ca8101ae38f210ee8f00d21678c067f5fbcda4e79aad5c8972e3b0becd5d

Observation 2772b691-3c1e-4765-86fb-a844a891ac4e · outbound

This paper cites A stable whitening optimizer for efficient neural network training, 2025.

Benchmarking Optimizers for Large Language Model Pretraining A stable whitening optimizer for efficient neural network training, 2025

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.728738Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.728738Z digest=sha256:52d724d0ddf0e3107c57117275558f1cb22e12bb66294fb2b90563e75010882d

Observation 1b9f62ea-dde8-4235-878b-87c7d31b8cbb · outbound

This paper cites Dimakis, Gabriel Ilharco, Pang Wei Koh, Shuran Song, Thomas Kollar, Yair Carmon, Achal Dave, Reinhard Heckel, Niklas Muennighoff, and Ludwig Schmidt.

Benchmarking Optimizers for Large Language Model Pretraining Dimakis, Gabriel Ilharco, Pang Wei Koh, Shuran Song, Thomas Kollar, Yair Carmon, Achal Dave, Reinhard Heckel, Niklas Muennighoff, and Ludwig Schmidt

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.740367Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.740367Z digest=sha256:f5fd5dd5335968a416382a1bfbbbd77ff749b5f42adbc3bd923cc685cf86e58e

Observation 835f6f7a-b65f-4488-bf9a-02c82ab72dad · outbound

This paper cites The Pile: An 800GB Dataset of Diverse Text for Language Modeling.

Benchmarking Optimizers for Large Language Model Pretraining The Pile: An 800GB Dataset of Diverse Text for Language Modeling

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.748594Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.748594Z digest=sha256:8a6829b6307788625d013df710f68023e4119ee7b4a875cd168a1353d7fda8a9

Observation 80ad567a-7f6b-4aff-99e4-4ac75f04e1de · outbound

This paper cites The pile: An 800gb dataset of diverse text for language modeling, 2020.

Benchmarking Optimizers for Large Language Model Pretraining The pile: An 800gb dataset of diverse text for language modeling, 2020

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.766003Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.766003Z digest=sha256:19532516a027f5365b536367d0cd23add6068723dfd818ffe9d6f73a64ccb0af

Observation 8b0d714c-c4f9-47a8-b0b7-36258def0546 · outbound

This paper cites Gemini: A family of highly capable multimodal models, 2024.

Benchmarking Optimizers for Large Language Model Pretraining Gemini: A family of highly capable multimodal models, 2024

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.776544Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.776544Z digest=sha256:a1ffe63f78a39892af048227520782c15aff74d0b0650d54ffdc1b3b90b5e3fe

Observation 2081e7d5-38c0-4050-b7a7-cfbe7b09e64b · outbound

This paper cites A loss curvature perspective on training instability in deep learning, 2021.

Benchmarking Optimizers for Large Language Model Pretraining A loss curvature perspective on training instability in deep learning, 2021

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.786424Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.786424Z digest=sha256:77cb8d332cbf2fed83f20a5c9c756aa0de54f0b8249f1fd2e1a55fabf2eee7a9

Observation 4af57d0a-2b59-4138-96a3-72aaddd8365a · outbound

This paper cites A minimalist optimizer design for llm pretraining, 2025.

Benchmarking Optimizers for Large Language Model Pretraining A minimalist optimizer design for llm pretraining, 2025

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.793612Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.793612Z digest=sha256:629bc798d533de1d71703a0161ef8965d6bac6a274cd3f00d3d84844f8788291

Observation 0d192b09-2fc4-408a-b2fe-3a1ab03dd7f5 · outbound

This paper cites Generating sequences with recurrent neural networks, 2014.

Benchmarking Optimizers for Large Language Model Pretraining Generating sequences with recurrent neural networks, 2014

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.802389Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.802389Z digest=sha256:b95573805f1d2e720b98db5bce002c94c30af50fbe21c7ea5598118e38c05902

Observation 9d8e5927-11b3-4eec-b73c-53b342eb21fe · outbound

This paper cites Accelerating newton-schulz iteration for orthogonalization via chebyshev-type polynomials, 2025.

Benchmarking Optimizers for Large Language Model Pretraining Accelerating newton-schulz iteration for orthogonalization via chebyshev-type polynomials, 2025

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.816714Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.816714Z digest=sha256:6d5147fef01f1e6b0094ead6b7c5bb9d08ebe005740e4138078bba078091c138

Observation 353c38e4-9f8c-496c-83b4-0664eed62531 · outbound

This paper cites AdaPlus: Integrating nesterov momentum and precise stepsize adjustment on adamw basis, 2023.

Benchmarking Optimizers for Large Language Model Pretraining AdaPlus: Integrating nesterov momentum and precise stepsize adjustment on adamw basis, 2023

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.825415Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.825415Z digest=sha256:32e17412fede31631ff57028dd1f6077e6272956e4aded47a3760b8833c572f4

Observation abceb8a5-5972-4481-b633-7da75869a1a4 · outbound

This paper cites Shampoo: Preconditioned stochastic tensor optimization, 2018.

Benchmarking Optimizers for Large Language Model Pretraining Shampoo: Preconditioned stochastic tensor optimization, 2018

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.838173Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.838173Z digest=sha256:293acd2c991bce0e200a73a9d33df74206d63d623ae7224b6cd788d764671dc0

Observation 9a5d9988-1f52-4382-b27a-8af80cf7ebc2 · outbound

This paper cites Under- standing and minimising outlier features in neural network training, 2024.

Benchmarking Optimizers for Large Language Model Pretraining Under- standing and minimising outlier features in neural network training, 2024

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.847579Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.847579Z digest=sha256:0a613dc265b6c9d2a69857ce6c9a98d3f53ba6bcc719436272e9c1e8605e5634

Observation 4e150506-03f9-42ca-a4f1-16b9938798fe · outbound

This paper cites Deep residual learning for image recognition, 2015.

Benchmarking Optimizers for Large Language Model Pretraining Deep residual learning for image recognition, 2015

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.856289Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.856289Z digest=sha256:4bc55e3296ad500351680c9fef945adb3425a772c4eebeb92e173f8743a9375e

Observation fa584f48-d9d3-408a-8ea6-1ac6408545d8 · outbound

This paper cites an unresolved cited work.

Benchmarking Optimizers for Large Language Model Pretraining Unresolved cited work

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.866960Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.866960Z digest=sha256:8c940c6f54194d37e4d808d1264fbaa53938ad15fd79b860f26d30ad3582c4d9

Observation e80a794b-b7a4-48cf-a3e8-04fe3aeb54f1 · outbound

This paper cites Neural networks for machine learning, lecture 6e rmsprop: Divide the gradient by a running average of its recent magnitude, 2012.

Benchmarking Optimizers for Large Language Model Pretraining Neural networks for machine learning, lecture 6e rmsprop: Divide the gradient by a running average of its recent magnitude, 2012

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.875428Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.875428Z digest=sha256:5c317a3c8ba35a1607aa19819f0f2aa8eb3dc8fa7a73771c6d06321a54a8a36d

Observation b225316f-3228-4134-873c-f2faf6e4d95b · outbound

This paper cites Rae, Oriol Vinyals, and Laurent Sifre.

Benchmarking Optimizers for Large Language Model Pretraining Rae, Oriol Vinyals, and Laurent Sifre

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.882146Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.882146Z digest=sha256:dd9ab4e6ad2ca73f56f5e4a2f478dafc6ede1dcf2fe56fc40b8c8cae4e62511e

Observation 73adb6cd-73a3-40a1-9be7-78c6242c9fff · outbound

This paper cites Minicpm: Unveiling the potential of small language models with scalable training strategies, 2024.

Benchmarking Optimizers for Large Language Model Pretraining Minicpm: Unveiling the potential of small language models with scalable training strategies, 2024

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.892741Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.892741Z digest=sha256:99f9013bccc9c032c8d7619c76b1f60ea84363b17eae38c738c22b16b84b4528

Observation 80d4d8db-1738-4952-96b9-346906feed94 · outbound

This paper cites Improving transformer opti- mization through better initialization.

Benchmarking Optimizers for Large Language Model Pretraining Improving transformer opti- mization through better initialization

Reference 53

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.905305Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.905305Z digest=sha256:f389fb4d4e6343037e92b6d10fe199432fba61eee09c4ff8aa2a95c5e880f44c

Observation a99c433d-c413-4835-b1ba-2d4a94238b8f · outbound

This paper cites Scaling laws and compute-optimal training beyond fixed training durations, 2024.

Benchmarking Optimizers for Large Language Model Pretraining Scaling laws and compute-optimal training beyond fixed training durations, 2024

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.919282Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.919282Z digest=sha256:a729811c4c9586f22afbd28d3aad230f1ce0add34d3ef1fbcc078724ddc9c57e

Observation f50c55e8-f38c-4482-9a71-0bc3784b1f17 · outbound

This paper cites Averaging weights leads to wider optima and better generalization, 2019.

Benchmarking Optimizers for Large Language Model Pretraining Averaging weights leads to wider optima and better generalization, 2019

Reference 55

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.926941Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.926941Z digest=sha256:fc4b8b3d24976fa29f1050119faa03322f720f5e4710888624d8a660aeabe110

Observation 13415e75-749f-4321-949c-d87048939e02 · outbound

This paper cites Intellect-1 technical report, 2024.

Benchmarking Optimizers for Large Language Model Pretraining Intellect-1 technical report, 2024

Reference 56

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.938288Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.938288Z digest=sha256:233b128356d7c26da9e6bf85a8afca6483586a3ccfcc5c25029168592250317d

Observation f9d73ab2-3f1d-43a7-b8df-4e343381632d · outbound

This paper cites an unresolved cited work.

Benchmarking Optimizers for Large Language Model Pretraining Unresolved cited work

Reference 57

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.946890Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.946890Z digest=sha256:4ff7eb8da6280f8625304bb5ca034e5de0dc094977d8f9d920f9c11cd1a70ac6

Observation d820ecaa-a9fa-4067-a3dc-f4840cd3c4de · outbound

This paper cites modded-nanogpt: Speedrunning the nanogpt baseline, 2024.

Benchmarking Optimizers for Large Language Model Pretraining modded-nanogpt: Speedrunning the nanogpt baseline, 2024

Reference 58

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.956877Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.956877Z digest=sha256:4686d00855634c1c2d41ce4c8c329a074c6fd09f3b024e9dfce12360effa563e

Observation 38974e3d-c682-4d85-a70a-786b757ad391 · outbound

This paper cites Muon: An optimizer for hidden layers in neural networks, 2024.

Benchmarking Optimizers for Large Language Model Pretraining Muon: An optimizer for hidden layers in neural networks, 2024

Reference 59

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.965261Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.965261Z digest=sha256:cc9f52386b7b4259c44e89d305fb01d83587d82603c67f1a6a3dbddffe0ab06b

Observation c16bd359-1f7d-46b2-be05-164a43f14643 · outbound

This paper cites an unresolved cited work.

Benchmarking Optimizers for Large Language Model Pretraining Unresolved cited work

Reference 60

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.981425Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.981425Z digest=sha256:89570b7c33470640cc523eb597c76426950b92d0ca40a8e8a47eeb179a1e6a6e

Observation 92f7ebe0-b223-439b-9169-aecb5f374815 · outbound

This paper cites Why warmup the learning rate? underlying mechanisms and improvements, 2024.

Benchmarking Optimizers for Large Language Model Pretraining Why warmup the learning rate? underlying mechanisms and improvements, 2024

Reference 61

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.990386Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.990386Z digest=sha256:9c70ddf05b3a8178ec435266651eaab53c2007ee01b9284bc6312093be355417

Observation e13ef9ac-1d10-4655-becb-8e4788c544a7 · outbound

This paper cites Brown, Benjamin Chess, Rewon Child, Scott Gray, Alec Radford, Jeffrey Wu, and Dario Amodei.

Benchmarking Optimizers for Large Language Model Pretraining Brown, Benjamin Chess, Rewon Child, Scott Gray, Alec Radford, Jeffrey Wu, and Dario Amodei

Reference 62

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.998917Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.998917Z digest=sha256:83e19e909fdc2b194621e39c292d0bffc05c5c17bdda9d816122f90a62bcacf6

Observation 8a7e8f82-4584-47c5-a4db-6e4e0a4007a0 · outbound

This paper cites Error feedback fixes signSGD and other gradient compression schemes.

Benchmarking Optimizers for Large Language Model Pretraining Error feedback fixes signSGD and other gradient compression schemes

Reference 63

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:51.007417Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:51.007417Z digest=sha256:1263b8b8849daff25891f907d9002e6e009d9cb85b83b22df6348cd201158036

Observation 337c6213-9588-41a8-a388-309d8927b8cc · outbound

This paper cites an unresolved cited work.

Benchmarking Optimizers for Large Language Model Pretraining Unresolved cited work

Reference 64

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:51.016356Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:51.016356Z digest=sha256:97231eed1e6ce1b92dac7e9d1610485343f9cf44f7a82fd3781d255bb137aedd

Observation b2aa18dd-7536-4971-b794-82731facaa9d · outbound

This paper cites an unresolved cited work.

Benchmarking Optimizers for Large Language Model Pretraining Unresolved cited work

Reference 65

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:51.023163Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:51.023163Z digest=sha256:ebca18c74e8e9f89d129c2c0f38d0bfd90a9aa205b182c6afd8a0e6a469c5dea

Observation 8b0ea370-d994-49a5-8950-e8350bee3995 · outbound

This paper cites Kingma and Jimmy Ba.

Benchmarking Optimizers for Large Language Model Pretraining Kingma and Jimmy Ba

Reference 66

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:51.029750Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:51.029750Z digest=sha256:7e4b6d98e55b58f341b32c4cb21c0c92210c338e0739922e8fd4382d122d332f

Observation a3881c39-deb2-4d95-8888-0b1319dfe729 · outbound

This paper cites Sign operator for coping with heavy-tailed noise in non-convex optimization: High probability bounds under (l0,l 1)-smoothness, 2025.

Benchmarking Optimizers for Large Language Model Pretraining Sign operator for coping with heavy-tailed noise in non-convex optimization: High probability bounds under (l0,l 1)-smoothness, 2025

Reference 67

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:51.041783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:51.041783Z digest=sha256:5a88ccbd0a59c552af54456fc3b2d59d56d26cc3153273ce267b87ee33caef15

Observation cc26a4d6-5197-4e15-b87b-02d26576d30b · outbound

This paper cites Analyzing & reducing the need for learning rate warmup in gpt training, 2024.

Benchmarking Optimizers for Large Language Model Pretraining Analyzing & reducing the need for learning rate warmup in gpt training, 2024

Reference 68

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:51.048805Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:51.048805Z digest=sha256:2c8f236c9b58219ea4618e0c4404079e5082d169eac196c7701867fbf1a0a3fe

Observation 9bdf0811-3ca2-4b48-9288-c3cd48b5710d · outbound

This paper cites Rotational equilibrium: How weight decay balances learning across neural networks, 2024.

Benchmarking Optimizers for Large Language Model Pretraining Rotational equilibrium: How weight decay balances learning across neural networks, 2024

Reference 69

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:51.055398Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:51.055398Z digest=sha256:1b3ec2bd3b2223459a7bd8cfbd6d6a55369786f5cbc4c5cfd103fc19b72509ed

Observation 8398ef5d-ff5e-4bcd-8e36-29e4c59cceaf · outbound

This paper cites Understanding gradient orthogonalization for deep learning via non-euclidean trust-region optimization, 2025.

Benchmarking Optimizers for Large Language Model Pretraining Understanding gradient orthogonalization for deep learning via non-euclidean trust-region optimization, 2025

Reference 70

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:51.060600Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:51.060600Z digest=sha256:1e84bf85b683ff238ef13e205ae457ae1d913651c8592d07690f64525351e624

Observation a4b82c0a-b051-4229-ba82-4f198e4c51e0 · outbound

This paper cites Spector, Blake Bordelon, Niklas Muennighoff, Mansheej Paul, Cengiz Pehlevan, Christopher Ré, and Aditi Raghunathan.

Benchmarking Optimizers for Large Language Model Pretraining Spector, Blake Bordelon, Niklas Muennighoff, Mansheej Paul, Cengiz Pehlevan, Christopher Ré, and Aditi Raghunathan

Reference 71

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:51.074620Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:51.074620Z digest=sha256:a8ea8c368c6cd3fc5d7e77c5a8d5d21c261f3ea07082a38695635aa333b84cb4

Observation 0910f1f0-0f14-4d1d-aba3-0f1bdc01d2a5 · outbound

This paper cites Why do machine learning optimizers that work, work? PhD thesis, University of British Columbia, 2024.

Benchmarking Optimizers for Large Language Model Pretraining Why do machine learning optimizers that work, work? PhD thesis, University of British Columbia, 2024

Reference 72

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:51.085256Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:51.085256Z digest=sha256:50f7c7ca8be9311f87864defeb710f72e6ac42ba984127fc2fb95b9d7e51c480

Observation 6fa78a03-397b-4db9-bdb9-d6eac5e83b0a · outbound

This paper cites Noise is not the main factor behind the gap between sgd and adam on transformers, but sign descent might be, 2023.

Benchmarking Optimizers for Large Language Model Pretraining Noise is not the main factor behind the gap between sgd and adam on transformers, but sign descent might be, 2023

Reference 73

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:51.098766Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:51.098766Z digest=sha256:1115466fc389643cf90a917827708eeb123fee616d0624b7ccbc9b944c26b694

Observation 20c8f9dd-e67f-48dd-a6b4-ece308824be8 · outbound

This paper cites Heavy- tailed class imbalance and why adam outperforms gradient descent on language models, 2024.

Benchmarking Optimizers for Large Language Model Pretraining Heavy- tailed class imbalance and why adam outperforms gradient descent on language models, 2024

Reference 74

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:51.112981Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:51.112981Z digest=sha256:84e700e3753004476712037399f32148225e8f2e94d78b6bd5428adae616744f

Observation b0fd45ae-a0e1-46aa-b445-6e6e38e53444 · outbound

This paper cites Farseer: A refined scaling law in large language models, 2025.

Benchmarking Optimizers for Large Language Model Pretraining Farseer: A refined scaling law in large language models, 2025

Reference 75

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:51.120086Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:51.120086Z digest=sha256:415afa8784263b88193b74fb365c70edb3fc328617c944bb033f8e3f2dd2052b

Observation 9d666264-eeb7-4454-822e-29c3b35cf984 · outbound

This paper cites Predictable scale: Part i – optimal hyperparameter scaling law in large language model pretraining, 2025.

Benchmarking Optimizers for Large Language Model Pretraining Predictable scale: Part i – optimal hyperparameter scaling law in large language model pretraining, 2025

Reference 76

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:51.139881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:51.139881Z digest=sha256:4472965ab0fde4d0020b6be34726c1858a41dfba9d709945c5631c2ae5ab9a19

Observation 7299b8a9-a840-4b50-b3df-edbd8a503584 · outbound

This paper cites Datacomp-lm: In search of the next generation of training sets for language models.

Benchmarking Optimizers for Large Language Model Pretraining Datacomp-lm: In search of the next generation of training sets for language models

Reference 77

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:51.152542Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:51.152542Z digest=sha256:d20ac844ef6ab5526d9549cc7d085e7f834f05c601f028ffbff915de7114f2a0

Observation 5da4ae20-002b-4624-b747-5b594098b239 · outbound

This paper cites Pytorch distributed: Experiences on accelerating data parallel training, 2020.

Benchmarking Optimizers for Large Language Model Pretraining Pytorch distributed: Experiences on accelerating data parallel training, 2020

Reference 78

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:51.163892Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:51.163892Z digest=sha256:dd66b6355a5650564dd747fbe39c4f3a02a2dc44d0d5c63507c7f84e29662178

Observation 1c2cf729-c7d3-43ec-8d55-bf9798f8b90f · outbound

This paper cites Sophia: A scalable stochastic second-order optimizer for language model pre-training, 2024.

Benchmarking Optimizers for Large Language Model Pretraining Sophia: A scalable stochastic second-order optimizer for language model pre-training, 2024

Reference 79

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:51.172192Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:51.172192Z digest=sha256:c7e35253e3df88a3c849ad9625b329cb7b4963f63216c11a769eb1f6bf7d1514

Observation 4061f7f4-ef2f-4a11-80c1-fc94bb050377 · outbound

This paper cites Same pre-training loss, better downstream: Implicit bias matters for language models, 2022.

Benchmarking Optimizers for Large Language Model Pretraining Same pre-training loss, better downstream: Implicit bias matters for language models, 2022

Reference 80

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:51.180465Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:51.180465Z digest=sha256:db5baec38ab05495909ff0af9a5ad13ff88c2edeb924b7bb2fc3cbc8b29fccd9

Observation bc4135a7-2505-4875-900b-84de062d0af9 · outbound

This paper cites Muon is scalable for llm training, 2025.

Benchmarking Optimizers for Large Language Model Pretraining Muon is scalable for llm training, 2025

Reference 81

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:51.191462Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:51.191462Z digest=sha256:7533d834330fa6132918c7e6b5cf16d96f9400aaeb47da9dddd6a9fbae5decb3

Observation daaa7974-2a32-4a0b-8a88-d7b69a33f651 · outbound

This paper cites The llama 3 herd of models, 2024.

Benchmarking Optimizers for Large Language Model Pretraining The llama 3 herd of models, 2024

Reference 82

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:51.201700Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:51.201700Z digest=sha256:6f500cfe99a05733734c5ee0ab5b516a608d0bf71fe0f55c10a0d3637f104d42

Observation a16d0fcb-fc91-4260-9bda-8d80a8687569 · outbound

This paper cites Sgdr: Stochastic gradient descent with warm restarts, 2017.

Benchmarking Optimizers for Large Language Model Pretraining Sgdr: Stochastic gradient descent with warm restarts, 2017

Reference 83

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:51.211642Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:51.211642Z digest=sha256:a2bc9b18581c18236446ae531957f80f62a06145d688233f68a0e530cfb23ec9

Observation 22c52868-f616-4c9e-ab23-bd15809fe719 · outbound

This paper cites Decoupled weight decay regularization, 2019.

Benchmarking Optimizers for Large Language Model Pretraining Decoupled weight decay regularization, 2019

Reference 84

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:51.224611Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:51.224611Z digest=sha256:4f186262285e5b557a4890f385f934ca47bfe850f0b65e1c2cc8c3a22a23ad54

Observation e5d8e998-92e5-4744-aa5a-a4c761ed6385 · outbound

This paper cites SW AN: SGD with normalization and whitening enables stateless llm training, 2025.

Benchmarking Optimizers for Large Language Model Pretraining SW AN: SGD with normalization and whitening enables stateless llm training, 2025

Reference 85

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:51.235207Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:51.235207Z digest=sha256:d94ad5ec198b266b5178bfc11b969b771550abf0b237530c1683d7838e452dd2

Observation 5dcd21a0-44d1-42aa-bd47-0b5060f0111c · outbound

This paper cites Small batch size training for language models: When vanilla sgd works, and why gradient accumulation is wasteful, 2025.

Benchmarking Optimizers for Large Language Model Pretraining Small batch size training for language models: When vanilla sgd works, and why gradient accumulation is wasteful, 2025

Reference 86

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:51.242809Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:51.242809Z digest=sha256:4d0870208c3c49ca10c2dcbd441501b280631a3aea4a112fd6141551f5b6e557

Observation b3c415c9-f333-43d9-862f-75f9d37f68fb · outbound

This paper cites New insights and perspectives on the natural gradient method, 2020.

Benchmarking Optimizers for Large Language Model Pretraining New insights and perspectives on the natural gradient method, 2020

Reference 87

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:51.248543Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:51.248543Z digest=sha256:925f5d0d977fcc3c265be48b3183ee7594c74203b90172563758fbaff613da33

Observation c9e0dec5-84c7-4103-aa90-4253ea486bb8 · outbound

This paper cites Effects of parameter norm growth during transformer training: Inductive bias from gradient descent, 2023.

Benchmarking Optimizers for Large Language Model Pretraining Effects of parameter norm growth during transformer training: Inductive bias from gradient descent, 2023

Reference 88

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:51.255443Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:51.255443Z digest=sha256:2275098ee97b33ec9157bbee43910ae8b7be5d63e4f25f57f8b648a698ed2a41

Observation 0c7b8a1c-08c2-4457-8bb3-486055d882cc · outbound

This paper cites Mixed precision training, 2018.

Benchmarking Optimizers for Large Language Model Pretraining Mixed precision training, 2018

Reference 89

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:51.261498Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:51.261498Z digest=sha256:08ada5fb96de0ee23b5082513b7c1566d307b504c73b9b94b5e20b1482a28565

Observation 8f1263d3-4151-4df4-bfb7-35b3d19913d9 · outbound

This paper cites Prodigy: An expeditiously adaptive parameter-free learner, 2024.

Benchmarking Optimizers for Large Language Model Pretraining Prodigy: An expeditiously adaptive parameter-free learner, 2024

Reference 90

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:51.275664Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:51.275664Z digest=sha256:3c4746fd24d8eddb56e70bcc0b5de043f4efbb0e4b60c5ab76f5beb3209ea41f

Observation a421d4d2-fa90-4870-84d4-980d0a231179 · outbound

This paper cites Connections between schedule-free optimizers, ademamix, and accelerated sgd variants, 2025.

Benchmarking Optimizers for Large Language Model Pretraining Connections between schedule-free optimizers, ademamix, and accelerated sgd variants, 2025

Reference 91

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:51.358568Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:51.358568Z digest=sha256:b305c9a29ece7701400bcccf0fec7bfeebf549122e84f276f83f3f000d6b246f

Observation 404f1cf9-6ae6-4461-87eb-25729cb3cdb2 · outbound

This paper cites Nemirovskii and Yu.E.

Benchmarking Optimizers for Large Language Model Pretraining Nemirovskii and Yu.E

Reference 92

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:51.419005Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:51.419005Z digest=sha256:cfdbdf8f5af29376e8e208b2b32a8e549770cad2357814e128a533118b47cd31

Observation c51e241d-6516-4e23-b331-d3ca9c0a86d0 · outbound

This paper cites Nesterov and V.

Benchmarking Optimizers for Large Language Model Pretraining Nesterov and V

Reference 93

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:51.472058Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:51.472058Z digest=sha256:06e49273e69ffb8a6f51558cf75d638a38f351403eb381467de090229162b110

Observation 3137ecfe-fb7e-417d-b06a-36dc41aae6f9 · outbound

This paper cites A method for unconstrained convex minimization problem with the rate of convergenceo(1/k2), 1983.

Benchmarking Optimizers for Large Language Model Pretraining A method for unconstrained convex minimization problem with the rate of convergenceo(1/k2), 1983

Reference 94

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:51.531481Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:51.531481Z digest=sha256:9e520ff3bfdf3e95be104958c6ac92caab8f910ad229241ad8b105a23e0d73fa

Observation fa5b3773-9138-402e-ada3-c120a8190b59 · outbound

This paper cites Gpt-4 technical report, 2024.

Benchmarking Optimizers for Large Language Model Pretraining Gpt-4 technical report, 2024

Reference 95

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:51.607895Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:51.607895Z digest=sha256:00a3a7cac63d14ccdfd9e233dc2c8784f91a7929eeeae9cf83413a878de94880

Observation b5dec2b1-a411-4fd3-8b95-6396e8d915f3 · outbound

This paper cites Neural networks (maybe) evolved to make adam the best optimizer, 2020.

Benchmarking Optimizers for Large Language Model Pretraining Neural networks (maybe) evolved to make adam the best optimizer, 2020

Reference 96

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:51.676668Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:51.676668Z digest=sha256:63aa2ce9bebc0102e4478b2d60af2d5e560e7d927bb7adc808d8aa50ff254c68

Observation a68501d0-3c31-42a5-a91b-d30c574888f2 · outbound

This paper cites Open problem: Parameter-free and scale-free online algorithms.

Benchmarking Optimizers for Large Language Model Pretraining Open problem: Parameter-free and scale-free online algorithms

Reference 97

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T12:36:02.794621Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-05T12:35:51.744176Z digest=sha256:f20f1bf8b49a416a3db47660201c92e25ad3551574cf56f2bf715fe4039c20a9

Observation 568a1e7d-7e71-4a89-88cc-4b6afea2f98d · outbound

This paper cites In search of adam’s secret sauce, 2025.

Benchmarking Optimizers for Large Language Model Pretraining In search of adam’s secret sauce, 2025

Reference 98

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T12:36:02.768138Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-05T12:35:51.807783Z digest=sha256:a12c04f0979c356d4aef684ae557e8216bb69a3ef54bf49c440fd2b4effb321b

Observation a8f6afa5-eb57-45d5-bda7-46bd96386e7a · outbound

This paper cites The ademamix optimizer: Better, faster, older, 2024.

Benchmarking Optimizers for Large Language Model Pretraining The ademamix optimizer: Better, faster, older, 2024

Reference 99

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T12:36:02.733539Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-05T12:35:51.891549Z digest=sha256:81c71e239951d6d4307134d136422d578a9782122ee3ac905ef4f591acb7d466

Observation f12878bb-536d-4b0f-960d-a3a7eb347cb3 · outbound

This paper cites Pytorch: An imperative style, high-performance deep learning library, 2019.

Benchmarking Optimizers for Large Language Model Pretraining Pytorch: An imperative style, high-performance deep learning library, 2019

Reference 100

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:51.957442Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:51.957442Z digest=sha256:442e2d3dbc44306acfd148bdac01033b61130b150b624dded7ef581e1f23486f

Pith citing papers

Observation fb443bfe-da23-4701-8a9a-d8ec61521e0f · inbound

Fantastic Pretraining Optimizers and Where to Find Them cites this paper.

Fantastic Pretraining Optimizers and Where to Find Them Benchmarking Optimizers for Large Language Model Pretraining

Reference 2025

Resolution
unresolved
no resolver link, observed 2026-08-05T11:59:49.778357Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T11:59:49.778357Z digest=sha256:01d057371505ebfbdafc4e4667c0be62d372e67364563b5c7b855bcdf221b827

Observation 949e6136-8c02-4f11-92d0-9bccef329228 · inbound

Preconditioned Norms: A Unified Framework for Steepest Descent, Quasi-Newton and Adaptive Methods cites this paper.

Preconditioned Norms: A Unified Framework for Steepest Descent, Quasi-Newton and Adaptive Methods Benchmarking Optimizers for Large Language Model Pretraining

Reference 16

Resolution
verified exact
arxiv_id, observed 2026-05-21T21:10:38.756135Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-21T21:05:49.844436Z digest=sha256:6af1ccc8887c4785619892d5d9a6a8fdf08be8fc281884d1eb849404664bb230

Observation c30db491-0a24-427c-8803-312436a37102 · inbound

Optimal Sample Complexity for Single Time-Scale Actor-Critic with Momentum cites this paper.

Optimal Sample Complexity for Single Time-Scale Actor-Critic with Momentum Benchmarking Optimizers for Large Language Model Pretraining

Reference 50

Resolution
verified exact
arxiv_id, observed 2026-05-16T08:17:36.487221Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-16T08:12:57.430291Z digest=sha256:907e9c9eed8b25a369bc9ef98ef94d7740fdb2f4c198d1bd2c3836723500492b

Observation cb893229-810e-4b4b-a8fb-5b78c166f127 · inbound

LoRDO: Distributed Low-Rank Optimization with Infrequent Communication cites this paper.

LoRDO: Distributed Low-Rank Optimization with Infrequent Communication Benchmarking Optimizers for Large Language Model Pretraining

Reference 2014

Resolution
unresolved
no resolver link, observed 2026-08-03T04:44:56.066179Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T04:44:56.066179Z digest=sha256:722c91221ef5b645035806e0733a7c334824860a172c15f97e4238928ca7a745

Observation bd78ae6a-878b-48cd-961f-806021dbee74 · inbound

HTMuon: Improving Muon via Heavy-Tailed Spectral Correction cites this paper.

HTMuon: Improving Muon via Heavy-Tailed Spectral Correction Benchmarking Optimizers for Large Language Model Pretraining

Reference 21

Resolution
verified exact
arxiv_id, observed 2026-05-25T06:55:26.265757Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-25T06:50:29.893126Z digest=sha256:318159b76d03006e7e69aa4d4c476ea5f00e35e320448cb50a2abcf6983d2bea

Observation c9deeb18-9d70-42b9-8189-95b541cf1845 · inbound

Sharp Capacity Scaling of Spectral Optimizers in Learning Associative Memory cites this paper.

Sharp Capacity Scaling of Spectral Optimizers in Learning Associative Memory Benchmarking Optimizers for Large Language Model Pretraining

Reference 48

Resolution
verified exact
arxiv_id, observed 2026-05-14T23:38:16.407545Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-14T23:37:33.106390Z digest=sha256:85d9a3bed0e09ef4ef551d8c40359b3d5cb5d3b223488d7d40de0cd4cb09e463

Observation 2a8e356d-9410-4f35-93ef-67484520e0cb · inbound

Nexus: Same Pretraining Loss, Better Downstream Generalization via Common Minima cites this paper.

Nexus: Same Pretraining Loss, Better Downstream Generalization via Common Minima Benchmarking Optimizers for Large Language Model Pretraining

Reference 35

Resolution
verified exact
arxiv_id, observed 2026-05-11T05:55:57.177884Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-10T17:53:39.356675Z digest=sha256:19d37435964982d87bc77b5615852dfe9e76790f2abcfeec63b0fa09b2c338a2

Observation e4f7eebb-04aa-417e-872d-8d2b80194fb9 · inbound

Evolution of Optimization Methods: Algorithms, Scenarios, and Evaluations cites this paper.

Evolution of Optimization Methods: Algorithms, Scenarios, and Evaluations Benchmarking Optimizers for Large Language Model Pretraining

Reference 25

Resolution
verified exact
arxiv_id, observed 2026-05-11T10:51:20.489496Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-10T15:16:58.221358Z digest=sha256:e58653ea0c3f51c45df0cebb79ff0a6b4ee620366f3e6c8b76113771a7536866

Observation 32b87b17-45dd-41fe-b844-5e8b4f504424 · inbound

Benchmarking Optimizers for MLPs in Tabular Deep Learning cites this paper.

Benchmarking Optimizers for MLPs in Tabular Deep Learning Benchmarking Optimizers for Large Language Model Pretraining

Reference 11

Resolution
metadata mismatch
arxiv_id, observed 2026-05-10T12:10:22.021599Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-10T12:06:08.798712Z digest=sha256:a9b20e108c5d8ccea6ccc5f833f5d21e61723bfeafe6fc310802eef5c73d3736

Observation 47e8c762-ed4f-428b-87fc-c65a0ce4027a · inbound

StoSignSGD: Unbiased Structural Stochasticity Fixes SignSGD for Training Large Language Models cites this paper.

StoSignSGD: Unbiased Structural Stochasticity Fixes SignSGD for Training Large Language Models Benchmarking Optimizers for Large Language Model Pretraining

Reference 36

Resolution
verified exact
arxiv_id, observed 2026-05-10T12:15:22.218722Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-10T12:10:44.802059Z digest=sha256:b8ef2c3dea4eaef3d2436ba1f2c19cf019413a67c462dff6c7f26aaecf697be3

Observation ab73c9d0-656a-4a0d-a2d1-9c563db4178b · inbound

When and Why SignSGD Outperforms SGD: A Theoretical Study Based on $\ell_1$-norm Lower Bounds cites this paper.

When and Why SignSGD Outperforms SGD: A Theoretical Study Based on $\ell_1$-norm Lower Bounds Benchmarking Optimizers for Large Language Model Pretraining

Reference 29

Resolution
verified exact
arxiv_id, observed 2026-05-11T19:21:07.675545Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-08T12:14:28.866499Z digest=sha256:9524d767b6dccd21695f294bad67d236fb80335c6d1413c5024ee1eae54bb738

Observation c241f457-713a-41f8-9d3e-7a495da4d34b · inbound

Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less cites this paper.

Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less Benchmarking Optimizers for Large Language Model Pretraining

Reference 23

Resolution
verified exact
arxiv_id, observed 2026-05-11T19:26:08.543311Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-08T12:00:49.127471Z digest=sha256:f1dd748b7e07cdb409b0d00c54088b2f8c2048aed12cbf17437510b86077e111

Observation 49fb2eb5-b6a4-4d35-a8c8-2845f077e2c9 · inbound

Navigating LLM Valley: From AdamW to Memory-Efficient and Matrix-Based Optimizers cites this paper.

Navigating LLM Valley: From AdamW to Memory-Efficient and Matrix-Based Optimizers Benchmarking Optimizers for Large Language Model Pretraining

Reference 37

Resolution
verified exact
arxiv_id, observed 2026-05-12T06:41:45.519353Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-12T04:01:32.057022Z digest=sha256:a6a5b75e76c87d993443edc0c07cdf6817d3afc80f73173ba16cb302c33d45f5

Observation 5883819f-1012-4d65-a32d-7cdeca1deba4 · inbound

Rescaled Asynchronous SGD: Optimal Distributed Optimization under Data and System Heterogeneity cites this paper.

Rescaled Asynchronous SGD: Optimal Distributed Optimization under Data and System Heterogeneity Benchmarking Optimizers for Large Language Model Pretraining

Reference 32

Resolution
verified exact
arxiv_id, observed 2026-05-14T19:32:50.855805Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-05-14T19:31:12.149482Z digest=sha256:74b724b9829017ce9085e81e3f723c6b7cab4bd1fe0c83666ad32c0426648dca

Observation 68c55c15-3ee8-495a-88c3-3a8999dc5df4 · inbound

Symmetry-Compatible Principle for Optimizer Design: Embeddings, LM Heads, SwiGLU MLPs, and MoE Routers cites this paper.

Symmetry-Compatible Principle for Optimizer Design: Embeddings, LM Heads, SwiGLU MLPs, and MoE Routers Benchmarking Optimizers for Large Language Model Pretraining

Reference 134

Resolution
verified exact
arxiv_id, observed 2026-05-20T09:38:11.217214Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-20T09:34:45.186929Z digest=sha256:638a8b9521b0c99f0878172ec8cab35131c01d83d5c29987bca70cd668460b0a

Observation 1750ef5d-27b2-4566-848b-b9b4cd74497a · inbound

Symmetry-Compatible Principle for Optimizer Design: Embeddings, LM Heads, SwiGLU MLPs, and MoE Routers cites this paper.

Symmetry-Compatible Principle for Optimizer Design: Embeddings, LM Heads, SwiGLU MLPs, and MoE Routers Benchmarking Optimizers for Large Language Model Pretraining

Reference 136

Resolution
verified exact
arxiv_id, observed 2026-06-30T18:45:00.393205Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-06-30T18:42:01.854481Z digest=sha256:f760325426e70d24ed4bd8433ab0788c02a53e996b23e136aa8c2eee3284bc40

Observation 56fd8440-a43e-42df-ad27-029d1533ea45 · inbound

LionMuon: Alternating Spectral and Sign Descent for Efficient Training cites this paper.

LionMuon: Alternating Spectral and Sign Descent for Efficient Training Benchmarking Optimizers for Large Language Model Pretraining

Reference 23

Resolution
verified exact
arxiv_id, observed 2026-05-20T07:28:06.765568Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-20T07:24:55.516803Z digest=sha256:44b15c953dec477ea537c334f8fd1e9386ec2240637a1d7dbf1d6ab2cf067b1b

Observation 8fd65943-b119-450d-a15c-bc72839058d5 · inbound

LionMuon: Alternating Spectral and Sign Descent for Efficient Training cites this paper.

LionMuon: Alternating Spectral and Sign Descent for Efficient Training Benchmarking Optimizers for Large Language Model Pretraining

Reference 23

Resolution
verified exact
arxiv_id, observed 2026-06-30T18:35:00.435900Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-06-30T18:30:51.719396Z digest=sha256:440a90a2a645e042d9c50048819246aa4ba537a28f0b834d93fae67c03020e3a

Observation cef63c76-0d48-4a8f-ab54-be36c37a7463 · inbound

Why SGD is not Brownian Motion: A New Perspective on Stochastic Dynamics cites this paper.

Why SGD is not Brownian Motion: A New Perspective on Stochastic Dynamics Benchmarking Optimizers for Large Language Model Pretraining

Reference 192

Resolution
verified exact
arxiv_id, observed 2026-05-22T08:11:17.313797Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-05-22T08:06:52.309619Z digest=sha256:e1fff6cff7ace78dfb15c40f313e9309ab728b96449be0bbaf78bd47a5542881

Observation 36e17f08-5a44-462f-b932-356011a2b584 · inbound

Reparametrizing Shampoo and SOAP for Subspace Basis Updates and BFloat16 Storage cites this paper.

Reparametrizing Shampoo and SOAP for Subspace Basis Updates and BFloat16 Storage Benchmarking Optimizers for Large Language Model Pretraining

Reference 22

Resolution
verified exact
arxiv_id, observed 2026-06-29T22:24:00.706903Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-06-29T22:16:53.946499Z digest=sha256:af4532790d9d3740a90ec0a0892fbf1939434fbefad619017b8f468e0ab0b06a

Observation b9670b42-1ecb-444c-bd9d-520367ce8fa4 · inbound

Softsign: Smooth Sign in Your Optimizer For Better Parameter Heterogeneity Handling cites this paper.

Softsign: Smooth Sign in Your Optimizer For Better Parameter Heterogeneity Handling Benchmarking Optimizers for Large Language Model Pretraining

Reference 44

Resolution
verified exact
arxiv_id, observed 2026-06-28T22:52:44.860967Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-06-28T22:51:38.488754Z digest=sha256:25fd81bb33e3032f3cf2c2dd02eb958e281395ebc97218153b5d74f40cbc50e8

Observation 670a7054-6c7e-4b71-b263-8d575561617c · inbound

Denoise First, Orthogonalize Later: Understanding Momentum in Muon via Spectral Filtering cites this paper.

Denoise First, Orthogonalize Later: Understanding Momentum in Muon via Spectral Filtering Benchmarking Optimizers for Large Language Model Pretraining

Reference 46

Resolution
verified exact
arxiv_id, observed 2026-07-02T01:56:27.815268Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-06-28T11:24:38.292078Z digest=sha256:4843096b04d2960baeb275461d24912239272c4d1397325ead32310399f03152

Observation 68a78f89-2c6a-40fe-b4de-9242b71381ca · inbound

Open Problem: Is AdamW Effective Under Heavy-Tailed Noise? cites this paper.

Open Problem: Is AdamW Effective Under Heavy-Tailed Noise? Benchmarking Optimizers for Large Language Model Pretraining

Reference 7

Resolution
verified exact
arxiv_id, observed 2026-07-04T10:09:44.602263Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-06-26T09:08:41.993925Z digest=sha256:00d8ae57ab982e2d06c4b5189291745ef7b57865f5711c1ac1972f934e6da8fe

Observation 9c5e31cf-cfa2-4bc6-ac80-97675cc31922 · inbound

OmniOpt: Taxonomy, Geometry, and Benchmarking of Modern Optimizers cites this paper.

OmniOpt: Taxonomy, Geometry, and Benchmarking of Modern Optimizers Benchmarking Optimizers for Large Language Model Pretraining

Reference 97

Resolution
unresolved
no resolver link, observed 2026-07-11T22:10:49.683444Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T22:10:49.683444Z digest=sha256:b8d10b19777690911a4ac992ff2b866fda71063ecec92d6be1432990dba4f73f

Observation d3b04c17-064f-4229-9c1d-ccc1dcc9f23c · inbound

(A)iSpy: Parasitic Trojans for Machine Learning Infrastructure cites this paper.

(A)iSpy: Parasitic Trojans for Machine Learning Infrastructure Benchmarking Optimizers for Large Language Model Pretraining

Reference 71

Resolution
unresolved
no resolver link, observed 2026-08-01T17:47:03.790519Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T17:47:03.790519Z digest=sha256:02de5bc0a5f339f30250f738b9a845fad475e11a4be1d4c576f2c9d4e60fe2eb

Observation d3922175-6ba6-404b-b07c-115aab2d1ab1 · inbound

PoLoRA: A Preconditioned Orthogonalized LoRA Optimizer cites this paper.

PoLoRA: A Preconditioned Orthogonalized LoRA Optimizer Benchmarking Optimizers for Large Language Model Pretraining

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-01T17:32:35.613381Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T17:32:35.613381Z digest=sha256:924e30d5bfa026fea9e680c0c0491ddbb79c75cddc012a7b98182871d8b6dd95

Observation 970c7596-d80c-40ac-8060-6449687b52f1 · inbound

Scale Weight Decay and Train Better cites this paper.

Scale Weight Decay and Train Better Benchmarking Optimizers for Large Language Model Pretraining

Reference 67

Resolution
unresolved
no resolver link, observed 2026-07-30T12:53:41.174828Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-30T12:53:41.174828Z digest=sha256:9c1ee164700681d519213d0ae64524ac86b82073fdef1201e67a4b2e3b3d7876

Observation 76c7a6db-6cbd-4f13-a74e-2226997896a9 · inbound

CMuon: Accelerating and Stabilizing Diffusion Transformer Training via Chunked Momentum Orthogonalization cites this paper.

CMuon: Accelerating and Stabilizing Diffusion Transformer Training via Chunked Momentum Orthogonalization Benchmarking Optimizers for Large Language Model Pretraining

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-04T06:04:04.927838Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T06:04:04.927838Z digest=sha256:5a66c10ec96e057ee94ee638037021c43b8609bf16313c92aee72e294da30c78