{"as_of":"2026-08-10T03:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:aeb0a8b7a69c4303b3ad5640c4ca1ffc1b4a5dc5f5a05eeaf13656b058e5464a","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T14:37:23.819526Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:35:40.221296Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-13T05:52:21.848754Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-09T03:57:33.421199Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06742","snapshot_observed_at":"2026-08-06T18:35:40.221296Z","title":"Gradient multi-normalization for stateless and scalable llm training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-08T23:54:01.601611Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.221296Z"},"links":{"cited_paper":"/paper/2502.06742","citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:3424ca9efc9faf9ff8a48f58a8796249e2a1e2db0a1526eddc97055e19099ab7","observation_id":"b23d3601-7f59-4904-8d2e-0039c1fa3197","resolution":{"observed_at":"2026-08-06T18:35:40.221296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-09T03:57:33.421199Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"cited_work":{"arxiv_id":"2502.06742","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.06742","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gradient multi-normalization for stateless and scalable LLM training.arXiv preprint arXiv:2502.06742","venue":null,"work_id":"09b4549a-f5c8-443c-9f1e-8b81edc247fa","year":2025},"citing_paper":{"arxiv_id":"2605.04418","last_updated":"2026-05-06T02:22:06Z","snapshot_observed_at":"2026-08-09T01:35:47.502967Z","submitted_at":"2026-05-06T02:22:06Z","title":"Demystifying Manifold Constraints in LLM Pre-training","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-08T17:44:44.438637Z"},"links":{"cited_paper":"/paper/2502.06742","citing_paper":"/paper/2605.04418"},"observation_digest":"sha256:109378e24b0462451515951a1e1b0e2ae9e4e7270e853d99ade522fd68af809d","observation_id":"903bcba7-1617-42cb-b2b1-21f27dad111d","resolution":{"observed_at":"2026-05-11T17:16:08.860137Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-09T03:57:33.421199Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"cited_work":{"arxiv_id":"2502.06742","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.06742","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gradient multi-normalization for stateless and scalable LLM training.arXiv preprint arXiv:2502.06742","venue":null,"work_id":"09b4549a-f5c8-443c-9f1e-8b81edc247fa","year":2025},"citing_paper":{"arxiv_id":"2605.11172","last_updated":"2026-05-11T19:30:47Z","snapshot_observed_at":"2026-07-06T23:23:02.025664Z","submitted_at":"2026-05-11T19:30:47Z","title":"Optimistic Dual Averaging Unifies Modern Optimizers","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-13T05:52:16.805180Z"},"links":{"cited_paper":"/paper/2502.06742","citing_paper":"/paper/2605.11172"},"observation_digest":"sha256:68920ec080fd77d9411f1328866a9f09ee8b9112cacf4d91f856dc8a99e87851","observation_id":"e25f7357-df6e-4089-bfd0-46d14d6b6413","resolution":{"observed_at":"2026-05-13T05:52:21.850767Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.06742/citation-record","integrity":"/paper/2502.06742/integrity","json":"/paper/2502.06742/citation-record.json","paper":"/paper/2502.06742"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-08T14:37:23.413471Z","title":"R., and Hinton, G","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-09T03:57:33.421199Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.413471Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:291e6808053cece0fdab508326fb161a4a769b9ed470b18734e44ab7a576f4c8","observation_id":"b08ad4a5-16fe-4a52-8ad6-c06e6506952c","resolution":{"observed_at":"2026-08-08T14:37:23.413471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:37:24.902675Z","title":"Iterative bregman projections for regularized transportation problems","venue":null,"work_id":"4ebc2f72-b052-4542-aa5f-dd327b3a0b16","year":2015},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-09T03:57:33.421199Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.451252Z"},"links":{"citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:5edabbdd3e13666d69af76e878e79bcfc9c9b38e1a040d4f73ee600f32a3c915","observation_id":"f122e6d1-83f1-4c54-b2a7-b5a8d3177886","resolution":{"observed_at":"2026-08-08T14:37:24.906346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.20325","last_updated":"2024-12-06T14:09:22Z","snapshot_observed_at":"2026-08-03T03:18:47.425243Z","submitted_at":"2024-09-30T14:26:12Z","title":"Old Optimizer, New Norm: An Anthology","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.20325","snapshot_observed_at":"2026-08-08T14:37:23.455661Z","title":"and Newhouse, L","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-09T03:57:33.421199Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.455661Z"},"links":{"cited_paper":"/paper/2409.20325","citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:5322deb28a8323e8cf9abf5c650d0fd3c754d997e7f345a7b456fc3c2b1fce57","observation_id":"4b0d4c41-37f0-483c-943c-122dde9a1987","resolution":{"observed_at":"2026-08-08T14:37:23.455661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:37:23.459883Z","title":"signsgd: Compressed optimisation for non-convex problems","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-09T03:57:33.421199Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.459883Z"},"links":{"citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:8ac83868dffdef7280d7aec5397301ba5aa8ebfeaef8eabf70f647a4d8916687","observation_id":"4a520790-e2ea-4bb8-8431-e9247760aaaa","resolution":{"observed_at":"2026-08-08T14:37:23.459883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:37:24.884200Z","title":"Proximal alternating linearized minimization for nonconvex and nonsmooth problems","venue":null,"work_id":"571305e0-817c-4c58-9e72-b4013ef8cace","year":2014},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-09T03:57:33.421199Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.463975Z"},"links":{"citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:238226490f8d3041c7455912d273bd1ff72dc7d1516fd1a622f7804b4695cc16","observation_id":"2c1c0c26-fcb7-4c9e-abc0-a04d482caf08","resolution":{"observed_at":"2026-08-08T14:37:24.888347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:37:24.872646Z","title":"Distributed optimization and statistical learning via the alternating direction method of multipliers","venue":null,"work_id":"4ddd4deb-f9a2-4e69-b1b5-8fcafbb857c6","year":2011},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-09T03:57:33.421199Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.468048Z"},"links":{"citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:01cac7d0d1580518da55035fd703a6ccff8347b07ae2e7014e35d9d85e39f3ec","observation_id":"8c2f0518-867a-4c4a-9849-f4602c19c6fa","resolution":{"observed_at":"2026-08-08T14:37:24.876277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:37:24.861887Z","title":"Stochastic spectral descent for restricted boltzmann machines","venue":null,"work_id":"94068938-05a2-4301-9bc1-0038eef9347e","year":2015},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-09T03:57:33.421199Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.472410Z"},"links":{"citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:d3d07af6227fa413f6caa72e0af3818a15495aee29871683d6ecc2c4126aac11","observation_id":"6cf160a8-e1af-4778-b2c9-83d0377eb545","resolution":{"observed_at":"2026-08-08T14:37:24.865195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:37:24.850752Z","title":"and Pock, T","venue":null,"work_id":"ea4ff029-5d64-41d2-a0f8-42c0855649e2","year":2011},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-09T03:57:33.421199Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.475776Z"},"links":{"citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:93831b1a052b0beb3f435728d26143a7a28473ba0a64496ccaa79aa9cae9d1b2","observation_id":"bbf7d13b-7496-4394-bab7-87a183480732","resolution":{"observed_at":"2026-08-08T14:37:24.854101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:37:23.482602Z","title":"Fira: Can we achieve full-rank training of llms under low-rank constraint?, 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-09T03:57:33.421199Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.482602Z"},"links":{"citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:f044d3ac8dd8da2ba27b77395a4ed4c11b9582444109df1a8e3d8be1c8fe8950","observation_id":"4299bd35-014a-4e46-b469-d40de0536ef7","resolution":{"observed_at":"2026-08-08T14:37:23.482602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:37:24.840029Z","title":"Symbolic discovery of optimization algorithms","venue":null,"work_id":"71137320-3bbf-469c-9c9e-da8322e3f40f","year":2024},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-09T03:57:33.421199Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.486131Z"},"links":{"citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:e533966665e4ef0e838ff1bdf65fe643430be80b4b641c556eec36f8565a9272","observation_id":"daea1544-84d4-4f64-b7fd-68adce40a54d","resolution":{"observed_at":"2026-08-08T14:37:24.843957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:37:24.828969Z","title":"and Mehta, H","venue":null,"work_id":"a7b7b295-6eeb-4786-807b-9c47b3e90ba6","year":2020},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-09T03:57:33.421199Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.489575Z"},"links":{"citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:39f5572c4cbac0570d31b8079b333d5d80f2ff8039d3152fa24804cfbbc0b837","observation_id":"f3125a71-49a0-4a47-af5e-3d31edbf12e4","resolution":{"observed_at":"2026-08-08T14:37:24.832640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:37:24.817550Z","title":"On hilbert’s metric for simplices","venue":null,"work_id":"c8bc9910-11d2-4258-90cd-57d991e86f01","year":1993},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-09T03:57:33.421199Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.492994Z"},"links":{"citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:09ad3ce9ef2514c154f39db7c96a81b7ae1ecd7c9342efeb8d9c61ed6d9edbb9","observation_id":"bed42d3e-476b-4ee1-bf47-18a02c229b59","resolution":{"observed_at":"2026-08-08T14:37:24.821392Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-08T14:37:23.496672Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-09T03:57:33.421199Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.496672Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:b93d5254ba3aec1054b13a98d7358c109b035080b108272ce153478e5eac34e0","observation_id":"7bf6bb02-4816-494e-a22a-7d422156ceb6","resolution":{"observed_at":"2026-08-08T14:37:23.496672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:37:24.806556Z","title":null,"venue":null,"work_id":"1d184ca5-a27f-4ed9-a8fb-6516a0a5270d","year":1983},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-09T03:57:33.421199Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.500426Z"},"links":{"citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:54563a835ff793f839fac8aa474cac03721781c9c731551dc1f3734b83920821","observation_id":"5a1036d1-bd39-485a-bbb4-42a88518df53","resolution":{"observed_at":"2026-08-08T14:37:24.810400Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:37:24.795649Z","title":"and Lorenz, J","venue":null,"work_id":"d901b2bf-a8d8-4b40-9476-18e1c0bb5c7b","year":1989},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-09T03:57:33.421199Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.504111Z"},"links":{"citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:37cc6154920103bd8cd6f2304997edf610228f9848f11cb95c2ed8d57e707221","observation_id":"807a43a5-376f-44f6-a5ff-ff3e66350ff1","resolution":{"observed_at":"2026-08-08T14:37:24.799506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:37:24.771748Z","title":"Eigenvalue-corrected natural gradient based on a new approximation","venue":null,"work_id":"8323f584-f478-45da-a1b6-47ec54a9e8e1","year":2023},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-09T03:57:33.421199Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.507644Z"},"links":{"citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:ede80c677311478e1e61f5f1d350b75ea306e04ddc94a4c1f5a82ca173448388","observation_id":"0a3d308f-309a-4bda-8ce9-3dee363a3b86","resolution":{"observed_at":"2026-08-08T14:37:24.787737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1802.09568","last_updated":"2018-03-02T00:12:58Z","snapshot_observed_at":"2026-08-08T05:45:32.956312Z","submitted_at":"2018-02-26T19:36:41Z","title":"Shampoo: Preconditioned Stochastic Tensor Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.09568","snapshot_observed_at":"2026-08-08T14:37:23.510817Z","title":"Shampoo: Preconditioned stochastic tensor optimization, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-09T03:57:33.421199Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.510817Z"},"links":{"cited_paper":"/paper/1802.09568","citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:eddc281b9efa63e45179096d3efe72a3b5f0c24e56a855ff82d76c01d1b6a96f","observation_id":"f3a89ebb-4335-405f-ac92-2ae195999eb1","resolution":{"observed_at":"2026-08-08T14:37:23.510817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03293","last_updated":"2024-06-12T22:17:37Z","snapshot_observed_at":"2026-08-05T09:55:40.815776Z","submitted_at":"2024-02-05T18:50:39Z","title":"Flora: Low-Rank Adapters Are Secretly Gradient Compressors","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03293","snapshot_observed_at":"2026-08-08T14:37:23.514931Z","title":"Flora: Low-rank adapters are secretly gradient compressors","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-09T03:57:33.421199Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.514931Z"},"links":{"cited_paper":"/paper/2402.03293","citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:76784fe1af01985318989b6e9f78e7d8b371c0ad94a8d1a73f0f66ce383ed578","observation_id":"bbb83fe5-3150-4ccf-81ac-2e61517b0bdc","resolution":{"observed_at":"2026-08-08T14:37:23.514931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:37:23.518833Z","title":"Beyond convexity: Stochastic quasi-convex optimization","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-09T03:57:33.421199Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.518833Z"},"links":{"citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:fb9fbf325d843631e20395af5fc15234948038e3485f14c79931f8a3c7d5f146","observation_id":"6d529124-8416-4357-8a69-f4d6d4058af4","resolution":{"observed_at":"2026-08-08T14:37:23.518833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-08T14:37:23.522219Z","title":"J., Shen, Y., Wallis, P., Allen-Zhu, Z., Li, Y., Wang, S., Wang, L., and Chen, W","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-09T03:57:33.421199Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.522219Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:682e186a49d66d7d39a7dbaf6b3380bc7a8d748c35f2121e456842c6eecf403f","observation_id":"820b1f11-b874-4e60-a1fb-a7959e808908","resolution":{"observed_at":"2026-08-08T14:37:23.522219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:37:24.710538Z","title":"Iterative normalization: Beyond standardization towards efficient whitening","venue":null,"work_id":"1c10ed95-ebf9-48e6-a4e3-b1ab8467bd64","year":2019},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-09T03:57:33.421199Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.525891Z"},"links":{"citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:21e1f4da134c5a228b1468f5be3119e00feab8200260239a5822363f8f3ebbde","observation_id":"f6927afa-6bcc-4b13-ba94-53b1afe52fe4","resolution":{"observed_at":"2026-08-08T14:37:24.735222Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:37:24.655644Z","title":"Muon: An optimizer for hidden layers in neural networks, 2024","venue":null,"work_id":"e8f4e8f0-901c-4ff9-bcff-fe723376661e","year":2024},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-09T03:57:33.421199Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.529508Z"},"links":{"citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:9424dfbc377c2ec45a3d6e4f5c06a00539ec2161e69f25199e0f2c7b10ba8169","observation_id":"b3245607-4341-4ef3-8480-8707711b816a","resolution":{"observed_at":"2026-08-08T14:37:24.681640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:37:24.595432Z","title":null,"venue":null,"work_id":"fe479fd4-519d-42ee-895d-6213671edbff","year":2015},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-09T03:57:33.421199Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.532971Z"},"links":{"citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:b01e02c4c8b81f31bf86e4272d6ad4ee72a774f7c47f66b4d3d0884a10aafd40","observation_id":"add29701-088d-434a-b17a-76bad058594f","resolution":{"observed_at":"2026-08-08T14:37:24.623494Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:37:23.536830Z","title":"A., Casper, J., Lym, S., McAfee, L., Andersch, M., Shoeybi, M., and Catanzaro, B","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-09T03:57:33.421199Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.536830Z"},"links":{"citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:5647c246e3d440f8d5e82086899a573345c931d8d13ec7fc092a3817e1c49cb4","observation_id":"6080fe88-34be-44b1-8865-08a9657870ae","resolution":{"observed_at":"2026-08-08T14:37:23.536830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13960","last_updated":"2023-04-27T05:41:13Z","snapshot_observed_at":"2026-08-02T07:55:35.655526Z","submitted_at":"2023-04-27T05:41:13Z","title":"Noise Is Not the Main Factor Behind the Gap Between SGD and Adam on Transformers, but Sign Descent Might Be","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.13960","snapshot_observed_at":"2026-08-08T14:37:23.540265Z","title":"W., and Schmidt, M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-09T03:57:33.421199Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.540265Z"},"links":{"cited_paper":"/paper/2304.13960","citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:8957a0670a595381f37b2545ac11da1e2dcbad42712e6625f5f6a2b31b11d7d1","observation_id":"f8d51ea9-6283-4132-a32b-95ef53b7d28e","resolution":{"observed_at":"2026-08-08T14:37:23.540265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19449","last_updated":"2024-07-12T05:10:32Z","snapshot_observed_at":"2026-08-10T01:26:26.520900Z","submitted_at":"2024-02-29T18:47:52Z","title":"Heavy-Tailed Class Imbalance and Why Adam Outperforms Gradient Descent on Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19449","snapshot_observed_at":"2026-08-08T14:37:23.544235Z","title":"Heavy-tailed class imbalance and why adam outperforms gradient descent on language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-09T03:57:33.421199Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.544235Z"},"links":{"cited_paper":"/paper/2402.19449","citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:f60e00eb208157b87ff9a93c57f61532dddc1adb8a5ec5fb585a308e1d4676ab","observation_id":"34a40cd0-c212-4fd7-ab57-f29d81426256","resolution":{"observed_at":"2026-08-08T14:37:23.544235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:37:24.547226Z","title":null,"venue":null,"work_id":"f56946c9-c203-44c6-a9fc-702f227657c9","year":2008},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-09T03:57:33.421199Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.561000Z"},"links":{"citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:462bdc3351d3bf97cc6233a2af7a98b29b26472388b30d1ca45e14b02869cbe8","observation_id":"56561ed3-f3da-4622-bb5c-cde77f1bfe3b","resolution":{"observed_at":"2026-08-08T14:37:24.558644Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:37:24.536145Z","title":"Towards faster training of global covariance pooling networks by iterative matrix square root normalization","venue":null,"work_id":"fa187ece-2266-42d6-a513-2a6fe900ac39","year":2018},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-09T03:57:33.421199Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.586474Z"},"links":{"citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:cecf547d58c87e34486b79f661597dabb9b4aad338289c812b9e322cd12ff6c0","observation_id":"02956aa1-6bba-4a64-b1e0-378a505245c6","resolution":{"observed_at":"2026-08-08T14:37:24.540119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:37:24.525620Z","title":"Relora: High-rank training through low-rank updates","venue":null,"work_id":"572bd047-46be-4866-89f3-4ee345a6924e","year":2023},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-09T03:57:33.421199Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.613591Z"},"links":{"citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:eabc9ae3c01423d4fde09d8af6718b089ff63663aec2fa98b8c9b7f31bb0f7a8","observation_id":"91f59945-4410-454e-9dd0-6fce281b283b","resolution":{"observed_at":"2026-08-08T14:37:24.529355Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13148","last_updated":"2025-02-21T18:59:37Z","snapshot_observed_at":"2026-07-06T20:08:43.596697Z","submitted_at":"2024-12-17T18:13:18Z","title":"SWAN: SGD with Normalization and Whitening Enables Stateless LLM Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13148","snapshot_observed_at":"2026-08-08T14:37:23.643471Z","title":"Swan: Sgd with normalization and whitening enables stateless llm training, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-09T03:57:33.421199Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.643471Z"},"links":{"cited_paper":"/paper/2412.13148","citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:096e1af97a9c8b12351c86319f5dcf1c8e51df4b954b5f1f573528da2eedf50a","observation_id":"5897e39f-a8d8-44e2-863d-cbf31763c4dc","resolution":{"observed_at":"2026-08-08T14:37:23.643471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:37:24.515166Z","title":"Decomposition through formalization in a product space","venue":null,"work_id":"90f61d14-f345-45b2-8e99-dd64c7b4cd18","year":1984},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-09T03:57:33.421199Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.669813Z"},"links":{"citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:7f147090620c326e23371e65fccb61a2164b9c5a523d6929aa1ea50cecd44dca","observation_id":"226a59d9-2e4a-4ced-a9f0-f4b43badc942","resolution":{"observed_at":"2026-08-08T14:37:24.518803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:37:24.504811Z","title":null,"venue":null,"work_id":"a3035ab1-b9ec-45d5-85d5-425188e0566b","year":2020},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-09T03:57:33.421199Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.685068Z"},"links":{"citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:5609f3778f67b67b67456b48330c166a28c5ef1fcb0d139d058a78c706d16dd8","observation_id":"c6aa30c5-ec4d-443b-9791-a2c525b24b47","resolution":{"observed_at":"2026-08-08T14:37:24.508248Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:37:23.713139Z","title":"Zero: Memory optimizations toward training trillion parameter models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-09T03:57:33.421199Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.713139Z"},"links":{"citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:4cd07f5e55fa4c4ebc900acf3428d95df1de891000e63ffed76ecbfaf37d1a51","observation_id":"39ffadbf-194d-4c97-8e4e-3b406d8b9716","resolution":{"observed_at":"2026-08-08T14:37:23.713139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:37:24.487380Z","title":null,"venue":null,"work_id":"38e4e695-58de-45ad-8255-d59dce70b3f9","year":1974},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-09T03:57:33.421199Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.744517Z"},"links":{"citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:2cde27de8dc96340e7db61c0ce3ae392670009e0caeca0e0a1460079b29ba5eb","observation_id":"945ca777-367e-43f9-8627-88b80a777228","resolution":{"observed_at":"2026-08-08T14:37:24.492141Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:37:23.757416Z","title":"A relationship between arbitrary positive matrices and doubly stochastic matrices","venue":null,"work_id":null,"year":1964},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-09T03:57:33.421199Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.757416Z"},"links":{"citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:b80d3cebc1e6e3008cdee8013b6c2106866c96b2d8859e6b5c19852eee6364b8","observation_id":"5dd8a654-35d7-4b34-9180-f3bfd7b25fe4","resolution":{"observed_at":"2026-08-08T14:37:23.757416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:37:23.761340Z","title":"and Knopp, P","venue":null,"work_id":null,"year":1967},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-09T03:57:33.421199Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.761340Z"},"links":{"citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:fee2db5d44b02460d5f4924655daaa47c88e41ab71483b1770c8239883705094","observation_id":"8bbad764-6fb7-4ec2-8bdd-239f32ec1b26","resolution":{"observed_at":"2026-08-08T14:37:23.761340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:37:24.463787Z","title":"Fast differentiable matrix square root and inverse square root","venue":null,"work_id":"f21ceee7-51ec-4904-91c9-30b77c1354b2","year":2022},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-09T03:57:33.421199Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.765130Z"},"links":{"citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:eb4ac25bfb2ffa023f62e75ae818e0e17dad045f5970dde9f7ca3adbdfd12946","observation_id":"b6e29277-8a95-484d-b646-8346a7ffa4bf","resolution":{"observed_at":"2026-08-08T14:37:24.467626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:37:24.453317Z","title":null,"venue":null,"work_id":"45c92aaa-f60d-4471-b315-690b9fd0ad97","year":2017},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-09T03:57:33.421199Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.768652Z"},"links":{"citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:b01cd7169dae9eae001cc5c6d2c6e8eda320a5d22abaf20b9443bce5fa73e7ed","observation_id":"1907b5da-4d76-4ef1-87d2-df117dc1f8e6","resolution":{"observed_at":"2026-08-08T14:37:24.456973Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-08T14:37:23.772296Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-09T03:57:33.421199Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.772296Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:38602718fa4bb334e54e50d6d51ee73abaf91433d5eabb568bbc504d81d81b90","observation_id":"5217120b-dfbe-4c6c-bb3c-8a46fd1c51cd","resolution":{"observed_at":"2026-08-08T14:37:23.772296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:37:24.441708Z","title":"Functional operators: Measures and integrals, volume 1","venue":null,"work_id":"6f87592c-bbbc-4050-9d70-57cd644dd82a","year":1950},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-09T03:57:33.421199Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.776322Z"},"links":{"citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:c09a76c20888f60de8396c265218faf0f006c9ce0270ea703f6bd12f3bb84375","observation_id":"555089af-2e8b-4842-91c8-0301ec813625","resolution":{"observed_at":"2026-08-08T14:37:24.446304Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:37:24.431019Z","title":null,"venue":null,"work_id":"8476c8df-11c2-4dd8-90a4-1ec9cead4549","year":1992},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-09T03:57:33.421199Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.779538Z"},"links":{"citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:760900a6aaa183dfc1c4cd2fb6aa010571b325b38d24e2bb39a24da379b0b4e2","observation_id":"0943772a-8700-42f1-93ce-bd84ff49c3bc","resolution":{"observed_at":"2026-08-08T14:37:24.434492Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.11768","last_updated":"2024-12-17T09:30:44Z","snapshot_observed_at":"2026-07-06T20:07:45.865569Z","submitted_at":"2024-12-16T13:41:37Z","title":"No More Adam: Learning Rate Scaling at Initialization is All You Need","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.11768","snapshot_observed_at":"2026-08-08T14:37:23.786570Z","title":"No more adam: Learning rate scaling at initialization is all you need","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-09T03:57:33.421199Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.786570Z"},"links":{"cited_paper":"/paper/2412.11768","citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:cfff7ef55b851992802ac32e4b731490f007b4a029811278599ce746cab50415","observation_id":"f4028448-fec2-4f51-9294-9d575a3c015a","resolution":{"observed_at":"2026-08-08T14:37:23.786570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1708.03888","last_updated":"2017-09-13T23:25:07Z","snapshot_observed_at":"2026-07-06T05:55:05.946111Z","submitted_at":"2017-08-13T11:01:57Z","title":"Large Batch Training of Convolutional Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1708.03888","snapshot_observed_at":"2026-08-08T14:37:23.789854Z","title":"Large batch training of convolutional networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-09T03:57:33.421199Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.789854Z"},"links":{"cited_paper":"/paper/1708.03888","citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:934485f8702305609c340f787de13767d22e7cd7aa47daf74ac42fbff17badc0","observation_id":"c3dcb6c0-fd3a-4990-ae1b-f914be422b5b","resolution":{"observed_at":"2026-08-08T14:37:23.789854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.00962","last_updated":"2020-01-03T06:53:00Z","snapshot_observed_at":"2026-07-06T07:43:06.427641Z","submitted_at":"2019-04-01T16:53:35Z","title":"Large Batch Optimization for Deep Learning: Training BERT in 76 minutes","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.00962","snapshot_observed_at":"2026-08-08T14:37:23.793583Z","title":"Large batch optimization for deep learning: Training bert in 76 minutes","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-09T03:57:33.421199Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.793583Z"},"links":{"cited_paper":"/paper/1904.00962","citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:864aefc786c54a9ab8a1e1fbe73115ed4ad6bfd946c293e5e66e7c85fdeadda9","observation_id":"e8841d1e-9bc4-4414-bfe0-5f8a69154ff8","resolution":{"observed_at":"2026-08-08T14:37:23.793583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:37:23.797421Z","title":"and Sennrich, R","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-09T03:57:33.421199Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.797421Z"},"links":{"citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:911b5bda7e3cfda2337750d3bfd9a65ae2ba6d903cade4d422b2d3c5cceaf8d5","observation_id":"8a9cfafa-3b90-4834-9d6b-fdada3dad04f","resolution":{"observed_at":"2026-08-08T14:37:23.797421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:37:24.412569Z","title":"P., Veit, A., Kim, S., Reddi, S., Kumar, S., and Sra, S","venue":null,"work_id":"3e3f5d3b-630d-4084-8dc6-3eafdca47bd5","year":2020},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-09T03:57:33.421199Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.801164Z"},"links":{"citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:3b2cd9aac2ac41141970c6e98cc6f55698b2d80bfab31e84ba865b54c02ced2c","observation_id":"47a10613-9aab-45f7-a17a-6476b27fdf96","resolution":{"observed_at":"2026-08-08T14:37:24.417347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16793","last_updated":"2025-02-24T11:29:08Z","snapshot_observed_at":"2026-08-03T23:43:24.359346Z","submitted_at":"2024-06-24T16:56:41Z","title":"Adam-mini: Use Fewer Learning Rates To Gain More","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16793","snapshot_observed_at":"2026-08-08T14:37:23.804426Z","title":"Adam-mini: Use fewer learning rates to gain more","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-09T03:57:33.421199Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.804426Z"},"links":{"cited_paper":"/paper/2406.16793","citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:364d1a2207b273c825c9799562e7decb012d969559afb79fc3704ef7bf84c23c","observation_id":"6d77efdc-e81c-4111-b116-cb3594c20dbf","resolution":{"observed_at":"2026-08-08T14:37:23.804426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03507","last_updated":"2024-06-02T21:24:12Z","snapshot_observed_at":"2026-07-06T17:40:15.746482Z","submitted_at":"2024-03-06T07:29:57Z","title":"GaLore: Memory-Efficient LLM Training by Gradient Low-Rank Projection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03507","snapshot_observed_at":"2026-08-08T14:37:23.808168Z","title":"A., Chen, B., Wang, Z., Anandkumar, A., and Tian, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-09T03:57:33.421199Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.808168Z"},"links":{"cited_paper":"/paper/2403.03507","citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:ef4e3c40549e5d7437ff23e7c003a461624e9ee9dbf2747c71b2e880af62137f","observation_id":"14e30325-302c-4d31-b315-0b89b822b86b","resolution":{"observed_at":"2026-08-08T14:37:23.808168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07972","last_updated":"2025-02-28T01:47:44Z","snapshot_observed_at":"2026-08-09T20:28:46.864757Z","submitted_at":"2024-07-10T18:11:40Z","title":"Deconstructing What Makes a Good Optimizer for Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07972","snapshot_observed_at":"2026-08-08T14:37:23.812206Z","title":"Deconstructing what makes a good optimizer for language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-09T03:57:33.421199Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.812206Z"},"links":{"cited_paper":"/paper/2407.07972","citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:9eadbdda2ba6bb8b804de14b35bb5a9aee4b27b13f0b802b44b5fdf662af1f5b","observation_id":"552f658d-4508-401a-9dea-25d0d0515d53","resolution":{"observed_at":"2026-08-08T14:37:23.812206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05270","last_updated":"2025-02-17T08:27:58Z","snapshot_observed_at":"2026-08-06T09:09:00.082930Z","submitted_at":"2024-12-06T18:55:34Z","title":"APOLLO: SGD-like Memory, AdamW-level Performance","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05270","snapshot_observed_at":"2026-08-08T14:37:23.815685Z","title":"Z., Wang, Z., and Lee, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-09T03:57:33.421199Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.815685Z"},"links":{"cited_paper":"/paper/2412.05270","citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:a10a80b1ea06de2dd1497c6977225faf4d03247632af179b74a430c681eb4cb5","observation_id":"a6b8083a-4cd7-47bb-ad53-6e19cd7f3df8","resolution":{"observed_at":"2026-08-08T14:37:23.815685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:37:23.819526Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-09T03:57:33.421199Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.819526Z"},"links":{"citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:80c9fcafd55c6efbd8124e7f8487a464609f5bef9241fb6465ee41683aa569bc","observation_id":"69ac2474-aae8-426b-a383-655c9cc14123","resolution":{"observed_at":"2026-08-08T14:37:23.819526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T03:57:33.421199Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":33,"verified_exact":0,"verified_fuzzy":18},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 3 inbound Pith citation observations for arXiv:2502.06742."}