{"as_of":"2026-08-14T12:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:09429b692b5d0e7698cc906e63ce328e0fbf08ed11246f62729397c9c48c0bf1","coverage":[{"denominator":77,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":77,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T13:28:29.503764Z","state":"measured"},{"denominator":85,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":85,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T14:37:23.643471Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T14:29:54.502956Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.13148","last_updated":"2025-02-21T18:59:37Z","snapshot_observed_at":"2026-08-13T18:18:58.798878Z","submitted_at":"2024-12-17T18:13:18Z","title":"SWAN: SGD with Normalization and Whitening Enables Stateless LLM Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13148","snapshot_observed_at":"2026-08-08T14:37:23.643471Z","title":"Swan: Sgd with normalization and whitening enables stateless llm training, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-13T13:48:18.741179Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.643471Z"},"links":{"cited_paper":"/paper/2412.13148","citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:9df28a2adfccc701542227229d4a3fa2b31b8ad1654033dc8a882159ca179673","observation_id":"5897e39f-a8d8-44e2-863d-cbf31763c4dc","resolution":{"observed_at":"2026-08-08T14:37:23.643471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13148","last_updated":"2025-02-21T18:59:37Z","snapshot_observed_at":"2026-08-13T18:18:58.798878Z","submitted_at":"2024-12-17T18:13:18Z","title":"SWAN: SGD with Normalization and Whitening Enables Stateless LLM Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13148","snapshot_observed_at":"2026-08-08T11:46:47.751693Z","title":"Swan: Preprocessing sgd enables adam-level performance on llm training with significant memory reduction","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07752","last_updated":"2025-02-20T18:48:58Z","snapshot_observed_at":"2026-08-09T14:50:36.312825Z","submitted_at":"2025-02-11T18:27:19Z","title":"Towards Efficient Optimizer Design for LLM via Structured Fisher Approximation with a Low-Rank Extension","version":2},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-08T11:46:47.751693Z"},"links":{"cited_paper":"/paper/2412.13148","citing_paper":"/paper/2502.07752"},"observation_digest":"sha256:5fd6022e41b3235181dcd61da22fa84b5a4eba5beb4a1ce3844835eeb7f8310f","observation_id":"860c6b52-a841-4eaf-9efe-f4947bd814be","resolution":{"observed_at":"2026-08-08T11:46:47.751693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13148","last_updated":"2025-02-21T18:59:37Z","snapshot_observed_at":"2026-08-13T18:18:58.798878Z","submitted_at":"2024-12-17T18:13:18Z","title":"SWAN: SGD with Normalization and Whitening Enables Stateless LLM Training","version":3},"cited_work":{"arxiv_id":"2412.13148","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.13148","snapshot_observed_at":"2026-07-04T14:29:54.502956Z","title":"SWAN: SGD with normalization and whitening enables stateless LLM training","venue":null,"work_id":"5560d104-9f68-42bf-805d-593cbfa60d87","year":2025},"citing_paper":{"arxiv_id":"2506.16659","last_updated":"2026-05-20T23:37:18Z","snapshot_observed_at":"2026-08-12T19:58:25.804645Z","submitted_at":"2025-06-20T00:10:35Z","title":"Memory-Efficient LLM Pretraining via Minimalist Optimizer Design","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-22T13:23:55.233840Z"},"links":{"cited_paper":"/paper/2412.13148","citing_paper":"/paper/2506.16659"},"observation_digest":"sha256:d0ca18099158225b8662893ae9e7d6d6e4a5fe8a52ae5f38e06c85d82f13f40b","observation_id":"ff737671-9801-4638-be91-b3d68b07fc22","resolution":{"observed_at":"2026-05-22T13:24:53.210558Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13148","last_updated":"2025-02-21T18:59:37Z","snapshot_observed_at":"2026-08-13T18:18:58.798878Z","submitted_at":"2024-12-17T18:13:18Z","title":"SWAN: SGD with Normalization and Whitening Enables Stateless LLM Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13148","snapshot_observed_at":"2026-08-06T18:35:40.196266Z","title":"Swan: Preprocessing sgd enables adam-level performance on llm training with significant memory reduction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-14T06:41:55.088814Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.196266Z"},"links":{"cited_paper":"/paper/2412.13148","citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:a84756c638018ef21c9703eaf8c850d6c3fee971dcff7919490b5a97e8d0709d","observation_id":"b33f2a32-f26b-4cab-bc92-e0b243e5deb4","resolution":{"observed_at":"2026-08-06T18:35:40.196266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13148","last_updated":"2025-02-21T18:59:37Z","snapshot_observed_at":"2026-08-13T18:18:58.798878Z","submitted_at":"2024-12-17T18:13:18Z","title":"SWAN: SGD with Normalization and Whitening Enables Stateless LLM Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13148","snapshot_observed_at":"2026-07-13T10:41:51.251736Z","title":"Swan: Sgd with normalization and whitening enables stateless llm training.arXiv preprint arXiv:2412.13148,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2604.04229","last_updated":"2026-04-05T19:08:51Z","snapshot_observed_at":"2026-08-14T01:09:36.838605Z","submitted_at":"2026-04-05T19:08:51Z","title":"Hierarchical Semantic Correlation-Aware Masked Autoencoder for Unsupervised Audio-Visual Representation Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-13T10:41:51.251736Z"},"links":{"cited_paper":"/paper/2412.13148","citing_paper":"/paper/2604.04229"},"observation_digest":"sha256:e564d4e5f1c804fbe3f80698e4cf4491b79bb0780bb1978da7e638c3c63ba136","observation_id":"7736c809-eda6-4a2d-846a-f5e47244863e","resolution":{"observed_at":"2026-07-13T10:41:51.251736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13148","last_updated":"2025-02-21T18:59:37Z","snapshot_observed_at":"2026-08-13T18:18:58.798878Z","submitted_at":"2024-12-17T18:13:18Z","title":"SWAN: SGD with Normalization and Whitening Enables Stateless LLM Training","version":3},"cited_work":{"arxiv_id":"2412.13148","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.13148","snapshot_observed_at":"2026-07-04T14:29:54.502956Z","title":"SWAN: SGD with normalization and whitening enables stateless LLM training","venue":null,"work_id":"5560d104-9f68-42bf-805d-593cbfa60d87","year":2025},"citing_paper":{"arxiv_id":"2605.04418","last_updated":"2026-05-06T02:22:06Z","snapshot_observed_at":"2026-08-13T03:09:23.849783Z","submitted_at":"2026-05-06T02:22:06Z","title":"Demystifying Manifold Constraints in LLM Pre-training","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-08T17:44:44.438637Z"},"links":{"cited_paper":"/paper/2412.13148","citing_paper":"/paper/2605.04418"},"observation_digest":"sha256:9b6449125b5ee6573f7fb60268409daeea4ac99c488bfb14468a71ca175ee802","observation_id":"a7c1ad9e-fe70-49b7-82be-fedba31a45a1","resolution":{"observed_at":"2026-05-11T17:16:08.611550Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13148","last_updated":"2025-02-21T18:59:37Z","snapshot_observed_at":"2026-08-13T18:18:58.798878Z","submitted_at":"2024-12-17T18:13:18Z","title":"SWAN: SGD with Normalization and Whitening Enables Stateless LLM Training","version":3},"cited_work":{"arxiv_id":"2412.13148","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.13148","snapshot_observed_at":"2026-07-04T14:29:54.502956Z","title":"SWAN: SGD with normalization and whitening enables stateless LLM training","venue":null,"work_id":"5560d104-9f68-42bf-805d-593cbfa60d87","year":2025},"citing_paper":{"arxiv_id":"2606.27216","last_updated":"2026-06-25T16:05:55Z","snapshot_observed_at":"2026-08-02T19:59:39.365261Z","submitted_at":"2026-06-25T16:05:55Z","title":"Hierarchical Muon: Tiled Newton-Schulz Updates for Efficient Muon Optimization","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-06-26T03:33:34.662754Z"},"links":{"cited_paper":"/paper/2412.13148","citing_paper":"/paper/2606.27216"},"observation_digest":"sha256:c6b5387090ae11c05bef8d4b59c4e12d6ab30a0b3432599d332f20378cdaaf0f","observation_id":"a5ef100f-8376-4513-948d-4dc002dbe515","resolution":{"observed_at":"2026-07-04T14:29:54.505468Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13148","last_updated":"2025-02-21T18:59:37Z","snapshot_observed_at":"2026-08-13T18:18:58.798878Z","submitted_at":"2024-12-17T18:13:18Z","title":"SWAN: SGD with Normalization and Whitening Enables Stateless LLM Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13148","snapshot_observed_at":"2026-08-02T01:58:56.668607Z","title":"Chao Ma, Wenbo Gong, Meyer Scetbon, and Edward Meeds","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14536","last_updated":"2026-07-16T03:42:21Z","snapshot_observed_at":"2026-08-14T00:59:23.434969Z","submitted_at":"2026-07-16T03:42:21Z","title":"Muse: Representation Geometry of Muon Beyond Normalized Momentum","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-02T01:58:56.668607Z"},"links":{"cited_paper":"/paper/2412.13148","citing_paper":"/paper/2607.14536"},"observation_digest":"sha256:a6465137f206f681b19d1f9193bd49d2cb2a220f1a665bba847c603ed29ba7fb","observation_id":"76fda286-b3b7-4c75-8c6d-04316cf8a1cb","resolution":{"observed_at":"2026-08-02T01:58:56.668607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2412.13148/citation-record","integrity":"/paper/2412.13148/integrity","json":"/paper/2412.13148/citation-record.json","paper":"/paper/2412.13148"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:28:28.403451Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.13148","last_updated":"2025-02-21T18:59:37Z","snapshot_observed_at":"2026-08-13T18:18:58.798878Z","submitted_at":"2024-12-17T18:13:18Z","title":"SWAN: SGD with Normalization and Whitening Enables Stateless LLM Training","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T13:28:28.403451Z"},"links":{"citing_paper":"/paper/2412.13148"},"observation_digest":"sha256:bbf78340ec3cb01d3d2ea0bbe8e9c159156cac9f2095df0df0263c516ff340c1","observation_id":"fad8d5b4-5ab3-480d-b0b1-ae043dcf7a3b","resolution":{"observed_at":"2026-08-11T13:28:28.403451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.09018","last_updated":"2021-03-05T06:29:48Z","snapshot_observed_at":"2026-08-03T21:55:15.856477Z","submitted_at":"2020-02-20T20:51:33Z","title":"Scalable Second Order Optimization for Deep Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.09018","snapshot_observed_at":"2026-08-11T13:28:28.468777Z","title":"Scalable second order optimization for deep learning, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.13148","last_updated":"2025-02-21T18:59:37Z","snapshot_observed_at":"2026-08-13T18:18:58.798878Z","submitted_at":"2024-12-17T18:13:18Z","title":"SWAN: SGD with Normalization and Whitening Enables Stateless LLM Training","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T13:28:28.468777Z"},"links":{"cited_paper":"/paper/2002.09018","citing_paper":"/paper/2412.13148"},"observation_digest":"sha256:e75478321c3e45f11012813a02e1ae8233443c48d7ada791b50d489dd48c50b9","observation_id":"375f9e7d-20f4-4454-a14d-bc26b8c76ce9","resolution":{"observed_at":"2026-08-11T13:28:28.468777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-08-14T05:15:12.190552Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-11T13:28:28.542452Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.13148","last_updated":"2025-02-21T18:59:37Z","snapshot_observed_at":"2026-08-13T18:18:58.798878Z","submitted_at":"2024-12-17T18:13:18Z","title":"SWAN: SGD with Normalization and Whitening Enables Stateless LLM Training","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T13:28:28.542452Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2412.13148"},"observation_digest":"sha256:ab38b24f203f1ce8cf0ff610f9c36b6c58bb53635e1b223ae4ce563386f9d59e","observation_id":"1b6b617b-414f-4f52-8947-255aaf655679","resolution":{"observed_at":"2026-08-11T13:28:28.542452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-11T13:28:28.548347Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.13148","last_updated":"2025-02-21T18:59:37Z","snapshot_observed_at":"2026-08-13T18:18:58.798878Z","submitted_at":"2024-12-17T18:13:18Z","title":"SWAN: SGD with Normalization and Whitening Enables Stateless LLM Training","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T13:28:28.548347Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2412.13148"},"observation_digest":"sha256:2d4f0cce6389e6109f6272d16ade197eee9031582ddcf297be8d56fec95d99b6","observation_id":"130dbf43-533e-41eb-bfe6-67052f66da7b","resolution":{"observed_at":"2026-08-11T13:28:28.548347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21265","last_updated":"2024-12-06T17:02:28Z","snapshot_observed_at":"2026-08-12T22:13:33.014496Z","submitted_at":"2024-10-28T17:57:31Z","title":"Modular Duality in Deep Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21265","snapshot_observed_at":"2026-08-11T13:28:28.554180Z","title":"Modular duality in deep learning, 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13148","last_updated":"2025-02-21T18:59:37Z","snapshot_observed_at":"2026-08-13T18:18:58.798878Z","submitted_at":"2024-12-17T18:13:18Z","title":"SWAN: SGD with Normalization and Whitening Enables Stateless LLM Training","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T13:28:28.554180Z"},"links":{"cited_paper":"/paper/2410.21265","citing_paper":"/paper/2412.13148"},"observation_digest":"sha256:e8b8195972e472b84eb8c41d50a9f626b19cdedf5fc66cf15e48870fee57f927","observation_id":"8a29298a-891d-4d77-baca-217d986a2364","resolution":{"observed_at":"2026-08-11T13:28:28.554180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.20325","last_updated":"2024-12-06T14:09:22Z","snapshot_observed_at":"2026-08-12T12:26:45.359430Z","submitted_at":"2024-09-30T14:26:12Z","title":"Old Optimizer, New Norm: An Anthology","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.20325","snapshot_observed_at":"2026-08-11T13:28:28.566252Z","title":"Old optimizer, new norm: An anthology, 2024 c","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13148","last_updated":"2025-02-21T18:59:37Z","snapshot_observed_at":"2026-08-13T18:18:58.798878Z","submitted_at":"2024-12-17T18:13:18Z","title":"SWAN: SGD with Normalization and Whitening Enables Stateless LLM Training","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T13:28:28.566252Z"},"links":{"cited_paper":"/paper/2409.20325","citing_paper":"/paper/2412.13148"},"observation_digest":"sha256:8e31aa8151b4d7f3b64c54ac3a67c0c537216f4488b0cf68148090f1b85225d5","observation_id":"7d453c04-24ab-4e5c-b210-1cd9640bcbff","resolution":{"observed_at":"2026-08-11T13:28:28.566252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:28:28.571659Z","title":"signsgd: Compressed optimisation for non-convex problems","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.13148","last_updated":"2025-02-21T18:59:37Z","snapshot_observed_at":"2026-08-13T18:18:58.798878Z","submitted_at":"2024-12-17T18:13:18Z","title":"SWAN: SGD with Normalization and Whitening Enables Stateless LLM Training","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T13:28:28.571659Z"},"links":{"citing_paper":"/paper/2412.13148"},"observation_digest":"sha256:2a33c3069a45f34fd380042e1115e039de61cfdedd9c5b8eccf88f6c0f1400eb","observation_id":"037d451a-1734-4c56-8dcf-c6aecf768210","resolution":{"observed_at":"2026-08-11T13:28:28.571659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02954","last_updated":"2024-01-05T18:59:13Z","snapshot_observed_at":"2026-08-10T17:03:38.042994Z","submitted_at":"2024-01-05T18:59:13Z","title":"DeepSeek LLM: Scaling Open-Source Language Models with Longtermism","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02954","snapshot_observed_at":"2026-08-11T13:28:28.576403Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13148","last_updated":"2025-02-21T18:59:37Z","snapshot_observed_at":"2026-08-13T18:18:58.798878Z","submitted_at":"2024-12-17T18:13:18Z","title":"SWAN: SGD with Normalization and Whitening Enables Stateless LLM Training","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T13:28:28.576403Z"},"links":{"cited_paper":"/paper/2401.02954","citing_paper":"/paper/2412.13148"},"observation_digest":"sha256:d7f53932b6449b79f8c195ebf8ecb956d947cd9638bdd2b0bf7efe7313aac3ea","observation_id":"880f976d-a632-4f37-a7c7-e7a7111df26f","resolution":{"observed_at":"2026-08-11T13:28:28.576403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:28:28.582160Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.13148","last_updated":"2025-02-21T18:59:37Z","snapshot_observed_at":"2026-08-13T18:18:58.798878Z","submitted_at":"2024-12-17T18:13:18Z","title":"SWAN: SGD with Normalization and Whitening Enables Stateless LLM Training","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T13:28:28.582160Z"},"links":{"citing_paper":"/paper/2412.13148"},"observation_digest":"sha256:1b68f567fde528ca3eba1f2623957fe8d7bc3af2a218f0f8f7dcfdd66462ad48","observation_id":"483f8f95-5dd9-4282-80ec-d0140a041dc4","resolution":{"observed_at":"2026-08-11T13:28:28.582160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:28:30.976597Z","title":"Preconditioned spectral descent for deep learning","venue":null,"work_id":"addb12eb-d97b-4757-aa5f-79a81962807e","year":2015},"citing_paper":{"arxiv_id":"2412.13148","last_updated":"2025-02-21T18:59:37Z","snapshot_observed_at":"2026-08-13T18:18:58.798878Z","submitted_at":"2024-12-17T18:13:18Z","title":"SWAN: SGD with Normalization and Whitening Enables Stateless LLM Training","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T13:28:28.586420Z"},"links":{"citing_paper":"/paper/2412.13148"},"observation_digest":"sha256:0803d852bdd19433da07836380edd0646a49f7784cb2e47279b57b84f3ddec33","observation_id":"ad29e9b1-c6f9-46ff-bb4e-a0757af56314","resolution":{"observed_at":"2026-08-11T13:28:30.981713Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:28:30.961318Z","title":null,"venue":null,"work_id":"ce775684-5c2f-4ed7-a493-368fabd53431","year":2023},"citing_paper":{"arxiv_id":"2412.13148","last_updated":"2025-02-21T18:59:37Z","snapshot_observed_at":"2026-08-13T18:18:58.798878Z","submitted_at":"2024-12-17T18:13:18Z","title":"SWAN: SGD with Normalization and Whitening Enables Stateless LLM Training","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T13:28:28.590821Z"},"links":{"citing_paper":"/paper/2412.13148"},"observation_digest":"sha256:157f70f3315f9b7da4a0dcb76c21bf8bf55b21722681b79eac752e412f5dc0f2","observation_id":"43bac816-83fd-4506-9aa9-ab833454669b","resolution":{"observed_at":"2026-08-11T13:28:30.965966Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:28:28.595571Z","title":"Robustness to unbounded smoothness of generalized signsgd","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.13148","last_updated":"2025-02-21T18:59:37Z","snapshot_observed_at":"2026-08-13T18:18:58.798878Z","submitted_at":"2024-12-17T18:13:18Z","title":"SWAN: SGD with Normalization and Whitening Enables Stateless LLM Training","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T13:28:28.595571Z"},"links":{"citing_paper":"/paper/2412.13148"},"observation_digest":"sha256:2f016ea114795309ded22460d6fadee9c419aaf9410af0b63782c01cf1acc983","observation_id":"0b3d67e7-eba6-4e5a-8237-6fdfd2a0b217","resolution":{"observed_at":"2026-08-11T13:28:28.595571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:28:30.933598Z","title":"Momentum improves normalized sgd","venue":null,"work_id":"fd4cc38f-5b2e-4646-86f2-409c95b51a68","year":2020},"citing_paper":{"arxiv_id":"2412.13148","last_updated":"2025-02-21T18:59:37Z","snapshot_observed_at":"2026-08-13T18:18:58.798878Z","submitted_at":"2024-12-17T18:13:18Z","title":"SWAN: SGD with Normalization and Whitening Enables Stateless LLM Training","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T13:28:28.600029Z"},"links":{"citing_paper":"/paper/2412.13148"},"observation_digest":"sha256:f92fcc2c1f3d0c3449f116fdb3f27e433bca7df0177b190e52bb02b4bcce27c7","observation_id":"51bb9488-1910-4ced-a052-97dc5f16e618","resolution":{"observed_at":"2026-08-11T13:28:30.939348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:28:30.916181Z","title":"A general system of differential equations to model first-order adaptive algorithms","venue":null,"work_id":"ba6a92f9-0eae-45e0-8bf6-33f2dda420db","year":2020},"citing_paper":{"arxiv_id":"2412.13148","last_updated":"2025-02-21T18:59:37Z","snapshot_observed_at":"2026-08-13T18:18:58.798878Z","submitted_at":"2024-12-17T18:13:18Z","title":"SWAN: SGD with Normalization and Whitening Enables Stateless LLM Training","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T13:28:28.604662Z"},"links":{"citing_paper":"/paper/2412.13148"},"observation_digest":"sha256:cbea09bbbdf554df99270618ab5fabea11683f7f734d21cd95dfe52a832592ce","observation_id":"2d7a6c7f-9f4c-47e9-93b7-5bae4abb1bbc","resolution":{"observed_at":"2026-08-11T13:28:30.921513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-11T13:28:28.609620Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13148","last_updated":"2025-02-21T18:59:37Z","snapshot_observed_at":"2026-08-13T18:18:58.798878Z","submitted_at":"2024-12-17T18:13:18Z","title":"SWAN: SGD with Normalization and Whitening Enables Stateless LLM Training","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T13:28:28.609620Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2412.13148"},"observation_digest":"sha256:800a76077261944a2490c4239f3ade419d0f8bf02301ed4d9962d4b802cc69a5","observation_id":"297e43fb-e6f9-4af6-a931-464318b052ae","resolution":{"observed_at":"2026-08-11T13:28:28.609620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:28:30.899283Z","title":"Duchi, Elad Hazan, and Yoram Singer","venue":null,"work_id":"da1d3dec-9b2f-4702-a6d6-f7cfc5d03fc4","year":2011},"citing_paper":{"arxiv_id":"2412.13148","last_updated":"2025-02-21T18:59:37Z","snapshot_observed_at":"2026-08-13T18:18:58.798878Z","submitted_at":"2024-12-17T18:13:18Z","title":"SWAN: SGD with Normalization and Whitening Enables Stateless LLM Training","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T13:28:28.614522Z"},"links":{"citing_paper":"/paper/2412.13148"},"observation_digest":"sha256:c6023534f69233da7c7a9609e352f9635e5e7eee0fd0e3ec608a04378904fa55","observation_id":"9f62afd6-8290-4170-b690-05f277f6044b","resolution":{"observed_at":"2026-08-11T13:28:30.904742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:28:30.874444Z","title":"Kronecker-factored approximate curvature for modern neural network architectures","venue":null,"work_id":"8d00bfab-5e04-4ab5-a0a6-807f7d84c704","year":2024},"citing_paper":{"arxiv_id":"2412.13148","last_updated":"2025-02-21T18:59:37Z","snapshot_observed_at":"2026-08-13T18:18:58.798878Z","submitted_at":"2024-12-17T18:13:18Z","title":"SWAN: SGD with Normalization and Whitening Enables Stateless LLM Training","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T13:28:28.619816Z"},"links":{"citing_paper":"/paper/2412.13148"},"observation_digest":"sha256:2c87758375de50a01aa7f2870ce8637434f3901c6d95d0b3858a1262b08af416","observation_id":"3fc39d8d-795a-4fb1-b5e7-0e16756eee74","resolution":{"observed_at":"2026-08-11T13:28:30.888396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:28:30.811750Z","title":"A trace-restricted kronecker-factored approximation to natural gradient","venue":null,"work_id":"536d8cff-acf7-41a2-b2bf-dddb7e7ad9c1","year":2021},"citing_paper":{"arxiv_id":"2412.13148","last_updated":"2025-02-21T18:59:37Z","snapshot_observed_at":"2026-08-13T18:18:58.798878Z","submitted_at":"2024-12-17T18:13:18Z","title":"SWAN: SGD with Normalization and Whitening Enables Stateless LLM Training","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T13:28:28.624173Z"},"links":{"citing_paper":"/paper/2412.13148"},"observation_digest":"sha256:0df3b6f3e9808bbc6d469b595de3ab449334d01eaae1fd1bc248122e021d8657","observation_id":"6616db8b-1b10-40b1-bb1d-985e6fc574c7","resolution":{"observed_at":"2026-08-11T13:28:30.830479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:28:30.794865Z","title":"Eigenvalue-corrected natural gradient based on a new approximation","venue":null,"work_id":"e867af34-5041-46f3-b59a-b725e9184f6e","year":2023},"citing_paper":{"arxiv_id":"2412.13148","last_updated":"2025-02-21T18:59:37Z","snapshot_observed_at":"2026-08-13T18:18:58.798878Z","submitted_at":"2024-12-17T18:13:18Z","title":"SWAN: SGD with Normalization and Whitening Enables Stateless LLM Training","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T13:28:28.628843Z"},"links":{"citing_paper":"/paper/2412.13148"},"observation_digest":"sha256:f2e7039c78f96285f20f17569da2fd9135c169465374bbfe6843db25513ed40d","observation_id":"1d1dc410-000d-4a2a-a607-84d73850b15d","resolution":{"observed_at":"2026-08-11T13:28:30.800073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:28:28.633800Z","title":"Fast approximate natural gradient descent in a kronecker factored eigenbasis","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.13148","last_updated":"2025-02-21T18:59:37Z","snapshot_observed_at":"2026-08-13T18:18:58.798878Z","submitted_at":"2024-12-17T18:13:18Z","title":"SWAN: SGD with Normalization and Whitening Enables Stateless LLM Training","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T13:28:28.633800Z"},"links":{"citing_paper":"/paper/2412.13148"},"observation_digest":"sha256:790f3378c377732ae4a15f524f0f2db78f3671bb497a82c7aedfefa0db89ba5d","observation_id":"62e675b6-ce37-4d73-ad63-51ec6435c85b","resolution":{"observed_at":"2026-08-11T13:28:28.633800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1802.09568","last_updated":"2018-03-02T00:12:58Z","snapshot_observed_at":"2026-08-12T16:58:21.605012Z","submitted_at":"2018-02-26T19:36:41Z","title":"Shampoo: Preconditioned Stochastic Tensor Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.09568","snapshot_observed_at":"2026-08-11T13:28:28.638293Z","title":"Shampoo: Preconditioned stochastic tensor optimization, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.13148","last_updated":"2025-02-21T18:59:37Z","snapshot_observed_at":"2026-08-13T18:18:58.798878Z","submitted_at":"2024-12-17T18:13:18Z","title":"SWAN: SGD with Normalization and Whitening Enables Stateless LLM Training","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T13:28:28.638293Z"},"links":{"cited_paper":"/paper/1802.09568","citing_paper":"/paper/2412.13148"},"observation_digest":"sha256:4d8e7b0be9313731f7d2db3a1e464a75480e37c563efce63a72f73d60dc13502","observation_id":"7d44018d-acef-4d0c-9fe3-adc9af8dc4df","resolution":{"observed_at":"2026-08-11T13:28:28.638293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03293","last_updated":"2024-06-12T22:17:37Z","snapshot_observed_at":"2026-08-14T02:51:44.358086Z","submitted_at":"2024-02-05T18:50:39Z","title":"Flora: Low-Rank Adapters Are Secretly Gradient Compressors","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03293","snapshot_observed_at":"2026-08-11T13:28:28.643348Z","title":"Flora: Low-rank adapters are secretly gradient compressors","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13148","last_updated":"2025-02-21T18:59:37Z","snapshot_observed_at":"2026-08-13T18:18:58.798878Z","submitted_at":"2024-12-17T18:13:18Z","title":"SWAN: SGD with Normalization and Whitening Enables Stateless LLM Training","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T13:28:28.643348Z"},"links":{"cited_paper":"/paper/2402.03293","citing_paper":"/paper/2412.13148"},"observation_digest":"sha256:7f4c69a5ece25c206290d48fdc00c2fb485c7223d80238791b2c3efdc5785c96","observation_id":"7660468d-b3b9-4def-a6d9-b55e2c2d2c3e","resolution":{"observed_at":"2026-08-11T13:28:28.643348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-11T13:28:28.648169Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.13148","last_updated":"2025-02-21T18:59:37Z","snapshot_observed_at":"2026-08-13T18:18:58.798878Z","submitted_at":"2024-12-17T18:13:18Z","title":"SWAN: SGD with Normalization and Whitening Enables Stateless LLM Training","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T13:28:28.648169Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2412.13148"},"observation_digest":"sha256:ebcb7b2584dc4660dc892d34ad81adec6f777873a344d3d57407b23b753cec57","observation_id":"2135bc15-fa3c-4380-beb5-2e1983674a79","resolution":{"observed_at":"2026-08-11T13:28:28.648169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:28:30.768534Z","title":"Decorrelated batch normalization","venue":null,"work_id":"1d0c2eb4-a31a-4a5e-b301-54024b49dcc2","year":2018},"citing_paper":{"arxiv_id":"2412.13148","last_updated":"2025-02-21T18:59:37Z","snapshot_observed_at":"2026-08-13T18:18:58.798878Z","submitted_at":"2024-12-17T18:13:18Z","title":"SWAN: SGD with Normalization and Whitening Enables Stateless LLM Training","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T13:28:28.681920Z"},"links":{"citing_paper":"/paper/2412.13148"},"observation_digest":"sha256:5e1499209122f635e2a036d0f487933f493bc9f76a5ef46c265be1209d123540","observation_id":"b346cecc-1dcb-4502-b4df-4f3f53f9ef8a","resolution":{"observed_at":"2026-08-11T13:28:30.773319Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:28:30.751130Z","title":"Iterative normalization: Beyond standardization towards efficient whitening","venue":null,"work_id":"867788df-2bc1-4a9e-94b1-127d9b2d1dde","year":2019},"citing_paper":{"arxiv_id":"2412.13148","last_updated":"2025-02-21T18:59:37Z","snapshot_observed_at":"2026-08-13T18:18:58.798878Z","submitted_at":"2024-12-17T18:13:18Z","title":"SWAN: SGD with Normalization and Whitening Enables Stateless LLM Training","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T13:28:28.780886Z"},"links":{"citing_paper":"/paper/2412.13148"},"observation_digest":"sha256:d3a5ec3a56ff500d8548d5d205175e923ef9bdd5465c201fa5a03eb0e129b856","observation_id":"687ce154-7c3c-4382-833c-f198c4017be5","resolution":{"observed_at":"2026-08-11T13:28:30.756753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12807","last_updated":"2024-09-03T21:00:39Z","snapshot_observed_at":"2026-08-13T00:02:57.488035Z","submitted_at":"2024-05-21T13:58:17Z","title":"FAdam: Adam is a natural gradient optimizer using diagonal empirical Fisher information","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12807","snapshot_observed_at":"2026-08-11T13:28:28.812838Z","title":"Fadam: Adam is a natural gradient optimizer using diagonal empirical fisher information","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13148","last_updated":"2025-02-21T18:59:37Z","snapshot_observed_at":"2026-08-13T18:18:58.798878Z","submitted_at":"2024-12-17T18:13:18Z","title":"SWAN: SGD with Normalization and Whitening Enables Stateless LLM Training","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T13:28:28.812838Z"},"links":{"cited_paper":"/paper/2405.12807","citing_paper":"/paper/2412.13148"},"observation_digest":"sha256:3498e5693593e40e7d4c1e0fa9eb0430e5215e7b0bb314454db5ac222eafe342","observation_id":"9ddb77ce-a62d-475a-a7f8-239610115fa8","resolution":{"observed_at":"2026-08-11T13:28:28.812838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.12979","last_updated":"2023-07-24T17:56:58Z","snapshot_observed_at":"2026-08-13T10:48:53.070892Z","submitted_at":"2023-07-24T17:56:58Z","title":"An Isometric Stochastic Optimizer","version":1},"cited_work":{"arxiv_id":"2307.12979","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.12979","snapshot_observed_at":"2026-08-11T13:28:29.957361Z","title":"An Isometric Stochastic Optimizer","venue":"cs.LG","work_id":"9e1e19de-e1b0-4e5b-b1f0-b5ae7b3da81c","year":2023},"citing_paper":{"arxiv_id":"2412.13148","last_updated":"2025-02-21T18:59:37Z","snapshot_observed_at":"2026-08-13T18:18:58.798878Z","submitted_at":"2024-12-17T18:13:18Z","title":"SWAN: SGD with Normalization and Whitening Enables Stateless LLM Training","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T13:28:28.841238Z"},"links":{"cited_paper":"/paper/2307.12979","citing_paper":"/paper/2412.13148"},"observation_digest":"sha256:8826f798de0acb7c3039461e218628a8c5026176b99ddcc20272968e2000edb4","observation_id":"3e4cc3cf-6e69-4e06-9f35-4e65fa3a0560","resolution":{"observed_at":"2026-08-11T13:28:29.997271Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.04623","last_updated":"2018-09-13T09:29:55Z","snapshot_observed_at":"2026-07-06T06:09:11.794595Z","submitted_at":"2017-11-13T15:11:56Z","title":"Three Factors Influencing Minima in SGD","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.04623","snapshot_observed_at":"2026-08-11T13:28:28.874045Z","title":"Three factors influencing minima in sgd","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.13148","last_updated":"2025-02-21T18:59:37Z","snapshot_observed_at":"2026-08-13T18:18:58.798878Z","submitted_at":"2024-12-17T18:13:18Z","title":"SWAN: SGD with Normalization and Whitening Enables Stateless LLM Training","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-11T13:28:28.874045Z"},"links":{"cited_paper":"/paper/1711.04623","citing_paper":"/paper/2412.13148"},"observation_digest":"sha256:23d7b91efffd49b9fa7e0d08a0bb432a971d4063095fa967f65a06b88db2ad21","observation_id":"4b192fc3-cabc-4b70-913a-0c737c7d0a76","resolution":{"observed_at":"2026-08-11T13:28:28.874045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:28:28.902305Z","title":"How does adaptive optimization impact local neural network geometry? Advances in Neural Information Processing Systems, 36, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13148","last_updated":"2025-02-21T18:59:37Z","snapshot_observed_at":"2026-08-13T18:18:58.798878Z","submitted_at":"2024-12-17T18:13:18Z","title":"SWAN: SGD with Normalization and Whitening Enables Stateless LLM Training","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T13:28:28.902305Z"},"links":{"citing_paper":"/paper/2412.13148"},"observation_digest":"sha256:44ca225399eab0f4af4083085d2d7ba6ce3139b924d2be2628fb3c6ac9fd3d0f","observation_id":"7b2dc94f-b4ed-4b0a-b1bd-e2fadb99c281","resolution":{"observed_at":"2026-08-11T13:28:28.902305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:28:30.723314Z","title":"Muon: An optimizer for hidden layers in neural networks, 2024","venue":null,"work_id":"86975517-ac53-4273-ae41-50a7cf3dc714","year":2024},"citing_paper":{"arxiv_id":"2412.13148","last_updated":"2025-02-21T18:59:37Z","snapshot_observed_at":"2026-08-13T18:18:58.798878Z","submitted_at":"2024-12-17T18:13:18Z","title":"SWAN: SGD with Normalization and Whitening Enables Stateless LLM Training","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T13:28:28.907199Z"},"links":{"citing_paper":"/paper/2412.13148"},"observation_digest":"sha256:076ef91a6764dad983e17670638bc757ed7296be183a470dbf2aed3f0431ecea","observation_id":"7cb5ec09-42f5-4035-9007-cfea6e913dcc","resolution":{"observed_at":"2026-08-11T13:28:30.728322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:28:30.706561Z","title":"No train no gain: Revisiting efficient training algorithms for transformer-based language models","venue":null,"work_id":"dcc1de60-1dec-4fe7-a618-c08160a90b63","year":2024},"citing_paper":{"arxiv_id":"2412.13148","last_updated":"2025-02-21T18:59:37Z","snapshot_observed_at":"2026-08-13T18:18:58.798878Z","submitted_at":"2024-12-17T18:13:18Z","title":"SWAN: SGD with Normalization and Whitening Enables Stateless LLM Training","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-11T13:28:28.911867Z"},"links":{"citing_paper":"/paper/2412.13148"},"observation_digest":"sha256:41dffb13972e5c46bb2dcdfa781e0834de907482c028d078a6ce0ad1dab4ab14","observation_id":"48896bd7-6170-4848-b749-1ff378b5e378","resolution":{"observed_at":"2026-08-11T13:28:30.712135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.13569","last_updated":"2022-09-27T17:43:45Z","snapshot_observed_at":"2026-08-13T14:18:15.923986Z","submitted_at":"2022-09-27T17:43:45Z","title":"Exploring Low Rank Training of Deep Neural Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.13569","snapshot_observed_at":"2026-08-11T13:28:28.916986Z","title":"Exploring low rank training of deep neural networks","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.13148","last_updated":"2025-02-21T18:59:37Z","snapshot_observed_at":"2026-08-13T18:18:58.798878Z","submitted_at":"2024-12-17T18:13:18Z","title":"SWAN: SGD with Normalization and Whitening Enables Stateless LLM Training","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-11T13:28:28.916986Z"},"links":{"cited_paper":"/paper/2209.13569","citing_paper":"/paper/2412.13148"},"observation_digest":"sha256:80eddfdaf565f12f822befbce391344ac4e9b6b790a22f98131e2d7300df354a","observation_id":"f55ac609-a53b-47bb-b9c0-f03fa3f1cccb","resolution":{"observed_at":"2026-08-11T13:28:28.916986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:28:30.689826Z","title":"Kingma and Jimmy Ba","venue":null,"work_id":"8c8ba7a7-a176-4dc8-aab4-7c0622bc1104","year":2015},"citing_paper":{"arxiv_id":"2412.13148","last_updated":"2025-02-21T18:59:37Z","snapshot_observed_at":"2026-08-13T18:18:58.798878Z","submitted_at":"2024-12-17T18:13:18Z","title":"SWAN: SGD with Normalization and Whitening Enables Stateless LLM Training","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-11T13:28:28.922325Z"},"links":{"citing_paper":"/paper/2412.13148"},"observation_digest":"sha256:9fbd09dcb64f5aded19fd3a583544db0d42cac52526faca20c89c5fbe5ac0838","observation_id":"d6525654-fd46-4476-995f-46c04712cb89","resolution":{"observed_at":"2026-08-11T13:28:30.695028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.10285","last_updated":"2022-10-14T09:21:48Z","snapshot_observed_at":"2026-08-13T16:53:37.166121Z","submitted_at":"2022-01-25T12:56:17Z","title":"Efficient Approximations of the Fisher Matrix in Neural Networks using Kronecker Product Singular Value Decomposition","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.10285","snapshot_observed_at":"2026-08-11T13:28:28.926599Z","title":"Efficient approximations of the fisher matrix in neural networks using kronecker product singular value decomposition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.13148","last_updated":"2025-02-21T18:59:37Z","snapshot_observed_at":"2026-08-13T18:18:58.798878Z","submitted_at":"2024-12-17T18:13:18Z","title":"SWAN: SGD with Normalization and Whitening Enables Stateless LLM Training","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-11T13:28:28.926599Z"},"links":{"cited_paper":"/paper/2201.10285","citing_paper":"/paper/2412.13148"},"observation_digest":"sha256:2502f96c240678fee2288fd9d423f5d60e6938ac54e89a7729a75682e6d1f78f","observation_id":"ed262b40-e69e-451b-a28b-995efa0b4727","resolution":{"observed_at":"2026-08-11T13:28:28.926599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:28:28.931607Z","title":"Reducing activation recomputation in large transformer models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.13148","last_updated":"2025-02-21T18:59:37Z","snapshot_observed_at":"2026-08-13T18:18:58.798878Z","submitted_at":"2024-12-17T18:13:18Z","title":"SWAN: SGD with Normalization and Whitening Enables Stateless LLM Training","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-11T13:28:28.931607Z"},"links":{"citing_paper":"/paper/2412.13148"},"observation_digest":"sha256:7a43e8aefe1c1011e64eeabed22bd75eea54bbd2b15e480c0946ad4b26571c96","observation_id":"c7cc8bfb-00d7-4254-b6a6-ab19965059c3","resolution":{"observed_at":"2026-08-11T13:28:28.931607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13960","last_updated":"2023-04-27T05:41:13Z","snapshot_observed_at":"2026-08-13T11:54:17.209519Z","submitted_at":"2023-04-27T05:41:13Z","title":"Noise Is Not the Main Factor Behind the Gap Between SGD and Adam on Transformers, but Sign Descent Might Be","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.13960","snapshot_observed_at":"2026-08-11T13:28:28.936208Z","title":"Noise is not the main factor behind the gap between sgd and adam on transformers, but sign descent might be","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.13148","last_updated":"2025-02-21T18:59:37Z","snapshot_observed_at":"2026-08-13T18:18:58.798878Z","submitted_at":"2024-12-17T18:13:18Z","title":"SWAN: SGD with Normalization and Whitening Enables Stateless LLM Training","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-11T13:28:28.936208Z"},"links":{"cited_paper":"/paper/2304.13960","citing_paper":"/paper/2412.13148"},"observation_digest":"sha256:ac4e57a36b4b64cc1c9dd661b911a87d460fbe927d2397eddd07f8e98eab7c56","observation_id":"a8342c03-3d74-48e8-83a4-86663878fd95","resolution":{"observed_at":"2026-08-11T13:28:28.936208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19449","last_updated":"2024-07-12T05:10:32Z","snapshot_observed_at":"2026-08-13T23:00:40.138051Z","submitted_at":"2024-02-29T18:47:52Z","title":"Heavy-Tailed Class Imbalance and Why Adam Outperforms Gradient Descent on Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19449","snapshot_observed_at":"2026-08-11T13:28:28.941168Z","title":"Heavy-tailed class imbalance and why adam outperforms gradient descent on language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13148","last_updated":"2025-02-21T18:59:37Z","snapshot_observed_at":"2026-08-13T18:18:58.798878Z","submitted_at":"2024-12-17T18:13:18Z","title":"SWAN: SGD with Normalization and Whitening Enables Stateless LLM Training","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-11T13:28:28.941168Z"},"links":{"cited_paper":"/paper/2402.19449","citing_paper":"/paper/2412.13148"},"observation_digest":"sha256:1ee638aabff8a6c6514e5b4d6bc3dbb0d32be8e329d9b4cfe5ff3828d16ce723","observation_id":"27594f91-5cf2-4a8b-b430-4fbd50d73a4e","resolution":{"observed_at":"2026-08-11T13:28:28.941168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:28:30.663577Z","title":"Towards faster training of global covariance pooling networks by iterative matrix square root normalization","venue":null,"work_id":"322e695f-6e9b-455c-b455-33cb69bda38e","year":2018},"citing_paper":{"arxiv_id":"2412.13148","last_updated":"2025-02-21T18:59:37Z","snapshot_observed_at":"2026-08-13T18:18:58.798878Z","submitted_at":"2024-12-17T18:13:18Z","title":"SWAN: SGD with Normalization and Whitening Enables Stateless LLM Training","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-11T13:28:28.945674Z"},"links":{"citing_paper":"/paper/2412.13148"},"observation_digest":"sha256:319f0fcc8f865ac0bc8f051a51abbff7fb69335a9350738f004a0ffc4256a616","observation_id":"8534924f-03bf-4527-b9ad-9114558c45b8","resolution":{"observed_at":"2026-08-11T13:28:30.668961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:28:30.596214Z","title":"Preconditioned stochastic gradient descent","venue":null,"work_id":"4765e3fd-892e-4573-924d-7211b6e1e692","year":2017},"citing_paper":{"arxiv_id":"2412.13148","last_updated":"2025-02-21T18:59:37Z","snapshot_observed_at":"2026-08-13T18:18:58.798878Z","submitted_at":"2024-12-17T18:13:18Z","title":"SWAN: SGD with Normalization and Whitening Enables Stateless LLM Training","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-11T13:28:28.950402Z"},"links":{"citing_paper":"/paper/2412.13148"},"observation_digest":"sha256:dfbd4976960b0600caa0869faa5d39584f294c44262fee7aa49aa2e669d5d236","observation_id":"5a127efb-8843-4917-87c3-3eab6bac0872","resolution":{"observed_at":"2026-08-11T13:28:30.652212Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:28:30.518497Z","title":"Relora: High-rank training through low-rank updates","venue":null,"work_id":"e714731b-e4a3-4e20-a2b9-c1b279335510","year":2023},"citing_paper":{"arxiv_id":"2412.13148","last_updated":"2025-02-21T18:59:37Z","snapshot_observed_at":"2026-08-13T18:18:58.798878Z","submitted_at":"2024-12-17T18:13:18Z","title":"SWAN: SGD with Normalization and Whitening Enables Stateless LLM Training","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-11T13:28:28.954761Z"},"links":{"citing_paper":"/paper/2412.13148"},"observation_digest":"sha256:697d45c8dfbf6aabcc9fb0905eb9bc10103252dd71778c8fb831bdde559d529b","observation_id":"dbf2de18-9eaf-434f-aa26-493a00180d7f","resolution":{"observed_at":"2026-08-11T13:28:30.558099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03496","last_updated":"2024-10-04T18:49:17Z","snapshot_observed_at":"2026-08-13T16:35:02.854755Z","submitted_at":"2024-02-05T20:15:19Z","title":"Can We Remove the Square-Root in Adaptive Gradient Methods? A Second-Order Perspective","version":10},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03496","snapshot_observed_at":"2026-08-11T13:28:28.959819Z","title":"Can we remove the square-root in adaptive gradient methods? a second-order perspective","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13148","last_updated":"2025-02-21T18:59:37Z","snapshot_observed_at":"2026-08-13T18:18:58.798878Z","submitted_at":"2024-12-17T18:13:18Z","title":"SWAN: SGD with Normalization and Whitening Enables Stateless LLM Training","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-11T13:28:28.959819Z"},"links":{"cited_paper":"/paper/2402.03496","citing_paper":"/paper/2412.13148"},"observation_digest":"sha256:fe16c3c7ac3274d447a12ef65ddad7207e646e4a6cc0e6c055024ee1ff7bf811","observation_id":"b1c10969-318b-4b0e-9838-ba034372db6e","resolution":{"observed_at":"2026-08-11T13:28:28.959819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14342","last_updated":"2024-03-05T17:07:16Z","snapshot_observed_at":"2026-08-14T09:26:47.158041Z","submitted_at":"2023-05-23T17:59:21Z","title":"Sophia: A Scalable Stochastic Second-order Optimizer for Language Model Pre-training","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14342","snapshot_observed_at":"2026-08-11T13:28:28.964729Z","title":"Sophia: A scalable stochastic second-order optimizer for language model pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.13148","last_updated":"2025-02-21T18:59:37Z","snapshot_observed_at":"2026-08-13T18:18:58.798878Z","submitted_at":"2024-12-17T18:13:18Z","title":"SWAN: SGD with Normalization and Whitening Enables Stateless LLM Training","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-11T13:28:28.964729Z"},"links":{"cited_paper":"/paper/2305.14342","citing_paper":"/paper/2412.13148"},"observation_digest":"sha256:4e0acb2abfb57d7fd50aa4aa2a0b9128d534aa2bfd687b4bc168885da5e10ad8","observation_id":"816c38e3-096c-4bc3-8bd0-0af2dfd509f5","resolution":{"observed_at":"2026-08-11T13:28:28.964729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:28:28.969926Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.13148","last_updated":"2025-02-21T18:59:37Z","snapshot_observed_at":"2026-08-13T18:18:58.798878Z","submitted_at":"2024-12-17T18:13:18Z","title":"SWAN: SGD with Normalization and Whitening Enables Stateless LLM Training","version":3},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-11T13:28:28.969926Z"},"links":{"citing_paper":"/paper/2412.13148"},"observation_digest":"sha256:5e99f7b2dbd565b73eb5f4c958105b66c0170381819739bcb764baa2361fbce4","observation_id":"74acc1a3-0091-456c-b28e-b78b8d6d97d8","resolution":{"observed_at":"2026-08-11T13:28:28.969926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:28:28.974524Z","title":"Optimizing neural networks with kronecker-factored approximate curvature","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.13148","last_updated":"2025-02-21T18:59:37Z","snapshot_observed_at":"2026-08-13T18:18:58.798878Z","submitted_at":"2024-12-17T18:13:18Z","title":"SWAN: SGD with Normalization and Whitening Enables Stateless LLM Training","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-11T13:28:28.974524Z"},"links":{"citing_paper":"/paper/2412.13148"},"observation_digest":"sha256:705f6b7c673076763eff5d6766451db15c6d5c8b8d4788c1d318d2cf98ea9d69","observation_id":"90870da8-9c28-444b-a0d4-b680b9f28c53","resolution":{"observed_at":"2026-08-11T13:28:28.974524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:28:30.384128Z","title":"Kronecker-factored curvature approximations for recurrent neural networks","venue":null,"work_id":"526547f3-7719-4f5e-bccf-f27fab20ddcb","year":2018},"citing_paper":{"arxiv_id":"2412.13148","last_updated":"2025-02-21T18:59:37Z","snapshot_observed_at":"2026-08-13T18:18:58.798878Z","submitted_at":"2024-12-17T18:13:18Z","title":"SWAN: SGD with Normalization and Whitening Enables Stateless LLM Training","version":3},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-11T13:28:28.978832Z"},"links":{"citing_paper":"/paper/2412.13148"},"observation_digest":"sha256:4f19a98dda25f638f6295117d4f769f744c81d429722c72de2c20895ca52903c","observation_id":"9ea789dc-f0a1-47b1-804e-691e8b483c9b","resolution":{"observed_at":"2026-08-11T13:28:30.424554Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:28:30.335013Z","title":"Kradagrad: kronecker approximation-domination gradient preconditioned stochastic optimization","venue":null,"work_id":"48e26c59-1841-4779-b6d7-877beb685e3f","year":2023},"citing_paper":{"arxiv_id":"2412.13148","last_updated":"2025-02-21T18:59:37Z","snapshot_observed_at":"2026-08-13T18:18:58.798878Z","submitted_at":"2024-12-17T18:13:18Z","title":"SWAN: SGD with Normalization and Whitening Enables Stateless LLM Training","version":3},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-11T13:28:28.983562Z"},"links":{"citing_paper":"/paper/2412.13148"},"observation_digest":"sha256:3a73054760231c25174f0c9437e26fa83dcae3e6d6db72fc384c1f06c7f463ad","observation_id":"31a91584-c553-4fa0-9209-2bf3f648c475","resolution":{"observed_at":"2026-08-11T13:28:30.340119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.09871","last_updated":"2023-04-25T04:48:47Z","snapshot_observed_at":"2026-08-13T11:59:41.287905Z","submitted_at":"2023-04-19T06:15:11Z","title":"A Theory on Adam Instability in Large-Scale Machine Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.09871","snapshot_observed_at":"2026-08-11T13:28:28.988199Z","title":"A theory on adam instability in large-scale machine learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.13148","last_updated":"2025-02-21T18:59:37Z","snapshot_observed_at":"2026-08-13T18:18:58.798878Z","submitted_at":"2024-12-17T18:13:18Z","title":"SWAN: SGD with Normalization and Whitening Enables Stateless LLM Training","version":3},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-11T13:28:28.988199Z"},"links":{"cited_paper":"/paper/2304.09871","citing_paper":"/paper/2412.13148"},"observation_digest":"sha256:e99a6cb5618149bb24ffe7a958ceed93bb2c0a73837c089158152891a7840c00","observation_id":"d6f21902-5e7a-4295-96b8-7fee0b54d973","resolution":{"observed_at":"2026-08-11T13:28:28.988199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:28:28.993345Z","title":"Introductory lectures on convex optimization: A basic course, volume 87","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2412.13148","last_updated":"2025-02-21T18:59:37Z","snapshot_observed_at":"2026-08-13T18:18:58.798878Z","submitted_at":"2024-12-17T18:13:18Z","title":"SWAN: SGD with Normalization and Whitening Enables Stateless LLM Training","version":3},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-11T13:28:28.993345Z"},"links":{"citing_paper":"/paper/2412.13148"},"observation_digest":"sha256:2ace0538ea6ffa0ec6ec09ff0155ee8ee6c6ae2847dcdc3c3c396849b8cea35a","observation_id":"373bb1a4-8514-41a3-bc60-c5f167e0e9b8","resolution":{"observed_at":"2026-08-11T13:28:28.993345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03137","last_updated":"2024-09-27T18:31:02Z","snapshot_observed_at":"2026-08-12T22:51:08.835615Z","submitted_at":"2024-09-05T00:13:16Z","title":"The AdEMAMix Optimizer: Better, Faster, Older","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03137","snapshot_observed_at":"2026-08-11T13:28:29.021881Z","title":"The ademamix optimizer: Better, faster, older","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13148","last_updated":"2025-02-21T18:59:37Z","snapshot_observed_at":"2026-08-13T18:18:58.798878Z","submitted_at":"2024-12-17T18:13:18Z","title":"SWAN: SGD with Normalization and Whitening Enables Stateless LLM Training","version":3},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-11T13:28:29.021881Z"},"links":{"cited_paper":"/paper/2409.03137","citing_paper":"/paper/2412.13148"},"observation_digest":"sha256:0ff541da84f48bea532148daf3b848d06624ad93837108ca80d5d7fb31026222","observation_id":"ce538f7e-81c3-4510-a8d7-9a0d02364d7d","resolution":{"observed_at":"2026-08-11T13:28:29.021881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:28:30.309018Z","title":"Fishy: Layerwise fisher approximation for higher-order neural network optimization","venue":null,"work_id":"1000c39b-e361-439a-995c-a850d5a9292d","year":2022},"citing_paper":{"arxiv_id":"2412.13148","last_updated":"2025-02-21T18:59:37Z","snapshot_observed_at":"2026-08-13T18:18:58.798878Z","submitted_at":"2024-12-17T18:13:18Z","title":"SWAN: SGD with Normalization and Whitening Enables Stateless LLM Training","version":3},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-11T13:28:29.053316Z"},"links":{"citing_paper":"/paper/2412.13148"},"observation_digest":"sha256:0309bed96048ea96f585eb7b82afeabd76fe0eec4e637308b8d34c6e3684f942","observation_id":"6f93ca78-6eaf-4d4c-b50e-b54a6db651a8","resolution":{"observed_at":"2026-08-11T13:28:30.313668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04553","last_updated":"2024-02-07T03:18:00Z","snapshot_observed_at":"2026-08-13T19:17:58.716694Z","submitted_at":"2024-02-07T03:18:00Z","title":"Curvature-Informed SGD via General Purpose Lie-Group Preconditioners","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04553","snapshot_observed_at":"2026-08-11T13:28:29.100571Z","title":"Curvature-informed sgd via general purpose lie-group preconditioners","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13148","last_updated":"2025-02-21T18:59:37Z","snapshot_observed_at":"2026-08-13T18:18:58.798878Z","submitted_at":"2024-12-17T18:13:18Z","title":"SWAN: SGD with Normalization and Whitening Enables Stateless LLM Training","version":3},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-11T13:28:29.100571Z"},"links":{"cited_paper":"/paper/2402.04553","citing_paper":"/paper/2412.13148"},"observation_digest":"sha256:3c6e6f17cc0150c13225b0bfb4417418bc6393984948b39e5aad5363d57922d7","observation_id":"5721afeb-b1a6-4472-bfef-5dd3671c81f8","resolution":{"observed_at":"2026-08-11T13:28:29.100571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:28:29.131888Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.13148","last_updated":"2025-02-21T18:59:37Z","snapshot_observed_at":"2026-08-13T18:18:58.798878Z","submitted_at":"2024-12-17T18:13:18Z","title":"SWAN: SGD with Normalization and Whitening Enables Stateless LLM Training","version":3},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-11T13:28:29.131888Z"},"links":{"citing_paper":"/paper/2412.13148"},"observation_digest":"sha256:8267c7acf604c24837aa526e15aa8ecb55b53c240f93d63c96cebca39885d24a","observation_id":"10beb0ba-f15c-48e7-a456-43d095ef6c0e","resolution":{"observed_at":"2026-08-11T13:28:29.131888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:28:30.284163Z","title":"Adafactor: Adaptive learning rates with sublinear memory cost","venue":null,"work_id":"c01c8680-a6e5-4eb7-819d-6a696d8610b0","year":2018},"citing_paper":{"arxiv_id":"2412.13148","last_updated":"2025-02-21T18:59:37Z","snapshot_observed_at":"2026-08-13T18:18:58.798878Z","submitted_at":"2024-12-17T18:13:18Z","title":"SWAN: SGD with Normalization and Whitening Enables Stateless LLM Training","version":3},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-11T13:28:29.137351Z"},"links":{"citing_paper":"/paper/2412.13148"},"observation_digest":"sha256:6dd130dd6722ba44460a35d2a034ed7ec692911355f38112dcf159a103c2c75e","observation_id":"69378cf6-8b94-4ca7-9808-c9d3df570ddb","resolution":{"observed_at":"2026-08-11T13:28:30.288834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06497","last_updated":"2023-09-12T18:11:10Z","snapshot_observed_at":"2026-08-13T10:14:56.794756Z","submitted_at":"2023-09-12T18:11:10Z","title":"A Distributed Data-Parallel PyTorch Implementation of the Distributed Shampoo Optimizer for Training Neural Networks At-Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.06497","snapshot_observed_at":"2026-08-11T13:28:29.142246Z","title":"A distributed data-parallel pytorch implementation of the distributed shampoo optimizer for training neural networks at-scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.13148","last_updated":"2025-02-21T18:59:37Z","snapshot_observed_at":"2026-08-13T18:18:58.798878Z","submitted_at":"2024-12-17T18:13:18Z","title":"SWAN: SGD with Normalization and Whitening Enables Stateless LLM Training","version":3},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-11T13:28:29.142246Z"},"links":{"cited_paper":"/paper/2309.06497","citing_paper":"/paper/2412.13148"},"observation_digest":"sha256:71026694b3a55c496431a14851917333eb1f773f3f566a01ec7e3a8c69629365","observation_id":"50362495-f249-4a7d-bd41-0e1ed9c1767d","resolution":{"observed_at":"2026-08-11T13:28:29.142246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:28:30.268539Z","title":"Fast differentiable matrix square root and inverse square root","venue":null,"work_id":"82e34b95-669c-4484-bfe4-06ff16b6c994","year":2022},"citing_paper":{"arxiv_id":"2412.13148","last_updated":"2025-02-21T18:59:37Z","snapshot_observed_at":"2026-08-13T18:18:58.798878Z","submitted_at":"2024-12-17T18:13:18Z","title":"SWAN: SGD with Normalization and Whitening Enables Stateless LLM Training","version":3},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-11T13:28:29.147087Z"},"links":{"citing_paper":"/paper/2412.13148"},"observation_digest":"sha256:212685fd06b9d59e287260e11770810216daa238fb2ef6d938380a664b674fa2","observation_id":"e7722d98-497e-4693-8d11-9e5252a4494a","resolution":{"observed_at":"2026-08-11T13:28:30.273781Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00535","last_updated":"2024-03-15T02:03:21Z","snapshot_observed_at":"2026-08-13T10:00:44.641103Z","submitted_at":"2023-10-01T01:21:35Z","title":"JoMA: Demystifying Multilayer Transformers via JOint Dynamics of MLP and Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00535","snapshot_observed_at":"2026-08-11T13:28:29.151686Z","title":"Joma: Demystifying multilayer transformers via joint dynamics of mlp and attention","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.13148","last_updated":"2025-02-21T18:59:37Z","snapshot_observed_at":"2026-08-13T18:18:58.798878Z","submitted_at":"2024-12-17T18:13:18Z","title":"SWAN: SGD with Normalization and Whitening Enables Stateless LLM Training","version":3},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-11T13:28:29.151686Z"},"links":{"cited_paper":"/paper/2310.00535","citing_paper":"/paper/2412.13148"},"observation_digest":"sha256:43489c3c3ac514a3388cdc4d0f44394fa653ab884018f22aa4db943ce8bd2a88","observation_id":"e99ac229-0fe9-4cdf-a4fd-197fe7b6e2be","resolution":{"observed_at":"2026-08-11T13:28:29.151686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:28:30.252217Z","title":"Lecture 6.5-rmsprop: Divide the gradient by a running average of its recent magnitude","venue":null,"work_id":"915669b2-4ece-4fdf-97bf-2ab2ef4d08cf","year":2012},"citing_paper":{"arxiv_id":"2412.13148","last_updated":"2025-02-21T18:59:37Z","snapshot_observed_at":"2026-08-13T18:18:58.798878Z","submitted_at":"2024-12-17T18:13:18Z","title":"SWAN: SGD with Normalization and Whitening Enables Stateless LLM Training","version":3},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-11T13:28:29.157060Z"},"links":{"citing_paper":"/paper/2412.13148"},"observation_digest":"sha256:89fe6924e2ce5765ab1eab102f57d4127c320de3a9dd8334d278b0e1a4ef7b07","observation_id":"b2f6baea-eee4-487b-9d2a-3207e91d89f3","resolution":{"observed_at":"2026-08-11T13:28:30.257689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-11T13:28:29.161798Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.13148","last_updated":"2025-02-21T18:59:37Z","snapshot_observed_at":"2026-08-13T18:18:58.798878Z","submitted_at":"2024-12-17T18:13:18Z","title":"SWAN: SGD with Normalization and Whitening Enables Stateless LLM Training","version":3},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-11T13:28:29.161798Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2412.13148"},"observation_digest":"sha256:19bb0ee3ae7f867a9ddaa460af9c0e9f9792f3e36d7301a542aa9f16069dcd90","observation_id":"5f96d0d0-39bf-4a1f-8fcb-22feb894ac6c","resolution":{"observed_at":"2026-08-11T13:28:29.161798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-11T13:28:29.166823Z","title":"Llama 2: Open foundation and fine-tuned chat models, 2023 b","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.13148","last_updated":"2025-02-21T18:59:37Z","snapshot_observed_at":"2026-08-13T18:18:58.798878Z","submitted_at":"2024-12-17T18:13:18Z","title":"SWAN: SGD with Normalization and Whitening Enables Stateless LLM Training","version":3},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-11T13:28:29.166823Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2412.13148"},"observation_digest":"sha256:476c0fd2b07124e37a177bc6ed6f3ae19077368008523b7c708d187530a05728","observation_id":"d981dbb4-8874-4227-884a-969946d17287","resolution":{"observed_at":"2026-08-11T13:28:29.166823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07052","last_updated":"2022-02-14T21:46:07Z","snapshot_observed_at":"2026-08-13T16:40:49.922693Z","submitted_at":"2022-02-14T21:46:07Z","title":"Orthogonalising gradients to speed up neural network optimisation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.07052","snapshot_observed_at":"2026-08-11T13:28:29.172170Z","title":"Orthogonalising gradients to speed up neural network optimisation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.13148","last_updated":"2025-02-21T18:59:37Z","snapshot_observed_at":"2026-08-13T18:18:58.798878Z","submitted_at":"2024-12-17T18:13:18Z","title":"SWAN: SGD with Normalization and Whitening Enables Stateless LLM Training","version":3},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-11T13:28:29.172170Z"},"links":{"cited_paper":"/paper/2202.07052","citing_paper":"/paper/2412.13148"},"observation_digest":"sha256:b997c6431a699f5bea1963f70c3bf9316e0d933cd0e4ff2332dd903475f90686","observation_id":"33285297-0730-4f02-98af-685372b2a3d2","resolution":{"observed_at":"2026-08-11T13:28:29.172170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11321","last_updated":"2025-01-31T18:52:42Z","snapshot_observed_at":"2026-07-06T19:16:51.512681Z","submitted_at":"2024-09-17T16:18:05Z","title":"SOAP: Improving and Stabilizing Shampoo using Adam","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11321","snapshot_observed_at":"2026-08-11T13:28:29.177761Z","title":"Soap: Improving and stabilizing shampoo using adam","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13148","last_updated":"2025-02-21T18:59:37Z","snapshot_observed_at":"2026-08-13T18:18:58.798878Z","submitted_at":"2024-12-17T18:13:18Z","title":"SWAN: SGD with Normalization and Whitening Enables Stateless LLM Training","version":3},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-11T13:28:29.177761Z"},"links":{"cited_paper":"/paper/2409.11321","citing_paper":"/paper/2412.13148"},"observation_digest":"sha256:d530c0819ee8005d9f75cda68691fbc5ef2633115d6ff69a12f7391a07bfa0a0","observation_id":"360f6a6e-38c1-4698-8e1b-8a7ce24975dd","resolution":{"observed_at":"2026-08-11T13:28:29.177761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18144","last_updated":"2025-01-10T07:22:12Z","snapshot_observed_at":"2026-08-12T23:56:11.591922Z","submitted_at":"2024-05-28T13:02:56Z","title":"4-bit Shampoo for Memory-Efficient Network Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18144","snapshot_observed_at":"2026-08-11T13:28:29.182673Z","title":"4-bit shampoo for memory-efficient network training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13148","last_updated":"2025-02-21T18:59:37Z","snapshot_observed_at":"2026-08-13T18:18:58.798878Z","submitted_at":"2024-12-17T18:13:18Z","title":"SWAN: SGD with Normalization and Whitening Enables Stateless LLM Training","version":3},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-11T13:28:29.182673Z"},"links":{"cited_paper":"/paper/2405.18144","citing_paper":"/paper/2412.13148"},"observation_digest":"sha256:dd8c54c7233d4b2d136ff06eb9438a54200b13bb00398571cf72db5d41c61a51","observation_id":"d810eae4-64ff-4333-8d25-24231d45a8c2","resolution":{"observed_at":"2026-08-11T13:28:29.182673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.11768","last_updated":"2024-12-17T09:30:44Z","snapshot_observed_at":"2026-08-11T14:58:47.107932Z","submitted_at":"2024-12-16T13:41:37Z","title":"No More Adam: Learning Rate Scaling at Initialization is All You Need","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.11768","snapshot_observed_at":"2026-08-11T13:28:29.191879Z","title":"No more adam: Learning rate scaling at initialization is all you need","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13148","last_updated":"2025-02-21T18:59:37Z","snapshot_observed_at":"2026-08-13T18:18:58.798878Z","submitted_at":"2024-12-17T18:13:18Z","title":"SWAN: SGD with Normalization and Whitening Enables Stateless LLM Training","version":3},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-11T13:28:29.191879Z"},"links":{"cited_paper":"/paper/2412.11768","citing_paper":"/paper/2412.13148"},"observation_digest":"sha256:364a51c549985b1b8ea427f3b99fdd380527409c1bc1d862c23cffd0225a53d6","observation_id":"42800392-4b12-4e39-aad4-2377e9ba907e","resolution":{"observed_at":"2026-08-11T13:28:29.191879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:28:30.234578Z","title":"Principal whitened gradient for information geometry","venue":null,"work_id":"c1afa209-0e62-45b2-910a-a81a58d156ac","year":2008},"citing_paper":{"arxiv_id":"2412.13148","last_updated":"2025-02-21T18:59:37Z","snapshot_observed_at":"2026-08-13T18:18:58.798878Z","submitted_at":"2024-12-17T18:13:18Z","title":"SWAN: SGD with Normalization and Whitening Enables Stateless LLM Training","version":3},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-11T13:28:29.196373Z"},"links":{"citing_paper":"/paper/2412.13148"},"observation_digest":"sha256:b9a924cfae6c6a1299b3d7ab358e1f51917ec0c44862c4cc46a343ca7a57a428","observation_id":"bd1cc1d3-5c7d-4581-a3b4-e827aa1919e5","resolution":{"observed_at":"2026-08-11T13:28:30.240879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.00962","last_updated":"2020-01-03T06:53:00Z","snapshot_observed_at":"2026-07-06T07:43:06.427641Z","submitted_at":"2019-04-01T16:53:35Z","title":"Large Batch Optimization for Deep Learning: Training BERT in 76 minutes","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.00962","snapshot_observed_at":"2026-08-11T13:28:29.200920Z","title":"Large batch optimization for deep learning: Training bert in 76 minutes","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2412.13148","last_updated":"2025-02-21T18:59:37Z","snapshot_observed_at":"2026-08-13T18:18:58.798878Z","submitted_at":"2024-12-17T18:13:18Z","title":"SWAN: SGD with Normalization and Whitening Enables Stateless LLM Training","version":3},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-11T13:28:29.200920Z"},"links":{"cited_paper":"/paper/1904.00962","citing_paper":"/paper/2412.13148"},"observation_digest":"sha256:323f16e9c8839a2f7a887bfe43fc988b55ea38546ccd3e20c1ac32adf5c8f9d3","observation_id":"c3ce154d-4c22-4367-9712-890425faea5a","resolution":{"observed_at":"2026-08-11T13:28:29.200920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:28:29.206050Z","title":"Root mean square layer normalization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.13148","last_updated":"2025-02-21T18:59:37Z","snapshot_observed_at":"2026-08-13T18:18:58.798878Z","submitted_at":"2024-12-17T18:13:18Z","title":"SWAN: SGD with Normalization and Whitening Enables Stateless LLM Training","version":3},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-11T13:28:29.206050Z"},"links":{"citing_paper":"/paper/2412.13148"},"observation_digest":"sha256:65153895990dc3d2b4e4757cf832a99581e3f258e2b6b78fb7012e49d97c3622","observation_id":"deaf2b4f-0d60-45c4-be8e-0e094577709d","resolution":{"observed_at":"2026-08-11T13:28:29.206050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:28:29.210374Z","title":"Why are adaptive methods good for attention models? Advances in Neural Information Processing Systems, 33: 0 15383--15393, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.13148","last_updated":"2025-02-21T18:59:37Z","snapshot_observed_at":"2026-08-13T18:18:58.798878Z","submitted_at":"2024-12-17T18:13:18Z","title":"SWAN: SGD with Normalization and Whitening Enables Stateless LLM Training","version":3},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-11T13:28:29.210374Z"},"links":{"citing_paper":"/paper/2412.13148"},"observation_digest":"sha256:32daa50f0d87946a1fde6c51582450b3b0cafdfde7d3f7b51f3123f535ca481e","observation_id":"67a1919a-af36-4aa3-a511-2361c4d54eee","resolution":{"observed_at":"2026-08-11T13:28:29.210374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-11T13:28:29.232812Z","title":"Opt: Open pre-trained transformer language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.13148","last_updated":"2025-02-21T18:59:37Z","snapshot_observed_at":"2026-08-13T18:18:58.798878Z","submitted_at":"2024-12-17T18:13:18Z","title":"SWAN: SGD with Normalization and Whitening Enables Stateless LLM Training","version":3},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-11T13:28:29.232812Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2412.13148"},"observation_digest":"sha256:48d12ca6a476acd0093438a5835988c89975c3035f5ba96b2e89858be4efa0a2","observation_id":"fe381d5a-8155-4bd1-8787-fb38cd144f1a","resolution":{"observed_at":"2026-08-11T13:28:29.232812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16788","last_updated":"2024-10-21T08:27:23Z","snapshot_observed_at":"2026-08-13T04:09:49.790420Z","submitted_at":"2024-02-26T18:01:41Z","title":"Why Transformers Need Adam: A Hessian Perspective","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16788","snapshot_observed_at":"2026-08-11T13:28:29.314973Z","title":"Why transformers need adam: A hessian perspective","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13148","last_updated":"2025-02-21T18:59:37Z","snapshot_observed_at":"2026-08-13T18:18:58.798878Z","submitted_at":"2024-12-17T18:13:18Z","title":"SWAN: SGD with Normalization and Whitening Enables Stateless LLM Training","version":3},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-11T13:28:29.314973Z"},"links":{"cited_paper":"/paper/2402.16788","citing_paper":"/paper/2412.13148"},"observation_digest":"sha256:cfe8a3c27d68909cc5d0cb694ddf7baef21e56ad016eb57b006a441885a8ed78","observation_id":"10b9c2ff-b849-46d1-b73a-0bb669575807","resolution":{"observed_at":"2026-08-11T13:28:29.314973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16793","last_updated":"2025-02-24T11:29:08Z","snapshot_observed_at":"2026-08-12T23:35:57.084703Z","submitted_at":"2024-06-24T16:56:41Z","title":"Adam-mini: Use Fewer Learning Rates To Gain More","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16793","snapshot_observed_at":"2026-08-11T13:28:29.340070Z","title":"Adam-mini: Use fewer learning rates to gain more","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13148","last_updated":"2025-02-21T18:59:37Z","snapshot_observed_at":"2026-08-13T18:18:58.798878Z","submitted_at":"2024-12-17T18:13:18Z","title":"SWAN: SGD with Normalization and Whitening Enables Stateless LLM Training","version":3},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-11T13:28:29.340070Z"},"links":{"cited_paper":"/paper/2406.16793","citing_paper":"/paper/2412.13148"},"observation_digest":"sha256:d199d07df7479c9771d1c2e8c895c35d1f18a03881385c627e3566206e91320c","observation_id":"c8ef6745-d8a0-4b4d-a5a6-c269d390b9ee","resolution":{"observed_at":"2026-08-11T13:28:29.340070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03507","last_updated":"2024-06-02T21:24:12Z","snapshot_observed_at":"2026-07-06T17:40:15.746482Z","submitted_at":"2024-03-06T07:29:57Z","title":"GaLore: Memory-Efficient LLM Training by Gradient Low-Rank Projection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03507","snapshot_observed_at":"2026-08-11T13:28:29.400702Z","title":"Galore: Memory-efficient llm training by gradient low-rank projection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13148","last_updated":"2025-02-21T18:59:37Z","snapshot_observed_at":"2026-08-13T18:18:58.798878Z","submitted_at":"2024-12-17T18:13:18Z","title":"SWAN: SGD with Normalization and Whitening Enables Stateless LLM Training","version":3},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-11T13:28:29.400702Z"},"links":{"cited_paper":"/paper/2403.03507","citing_paper":"/paper/2412.13148"},"observation_digest":"sha256:40ed9d726f30885d50aa88fcc35da59e6508b55f7758d9bdf4f19b928bded6f2","observation_id":"3de82ffc-8709-4fda-99e0-56ad1c91c1b2","resolution":{"observed_at":"2026-08-11T13:28:29.400702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07972","last_updated":"2025-02-28T01:47:44Z","snapshot_observed_at":"2026-08-12T23:24:44.132599Z","submitted_at":"2024-07-10T18:11:40Z","title":"Deconstructing What Makes a Good Optimizer for Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07972","snapshot_observed_at":"2026-08-11T13:28:29.479284Z","title":"Deconstructing what makes a good optimizer for language models, 2024 c","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13148","last_updated":"2025-02-21T18:59:37Z","snapshot_observed_at":"2026-08-13T18:18:58.798878Z","submitted_at":"2024-12-17T18:13:18Z","title":"SWAN: SGD with Normalization and Whitening Enables Stateless LLM Training","version":3},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-11T13:28:29.479284Z"},"links":{"cited_paper":"/paper/2407.07972","citing_paper":"/paper/2412.13148"},"observation_digest":"sha256:e762fcb8141493c46375e198af664eb5177532603a586d6b3b79c12f67b46cf7","observation_id":"e65589d3-b5f4-4b86-9757-59787ff81fe7","resolution":{"observed_at":"2026-08-11T13:28:29.479284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05270","last_updated":"2025-02-17T08:27:58Z","snapshot_observed_at":"2026-08-11T20:47:03.266207Z","submitted_at":"2024-12-06T18:55:34Z","title":"APOLLO: SGD-like Memory, AdamW-level Performance","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05270","snapshot_observed_at":"2026-08-11T13:28:29.483763Z","title":"Apollo: Sgd-like memory, adamw-level performance","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13148","last_updated":"2025-02-21T18:59:37Z","snapshot_observed_at":"2026-08-13T18:18:58.798878Z","submitted_at":"2024-12-17T18:13:18Z","title":"SWAN: SGD with Normalization and Whitening Enables Stateless LLM Training","version":3},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-11T13:28:29.483763Z"},"links":{"cited_paper":"/paper/2412.05270","citing_paper":"/paper/2412.13148"},"observation_digest":"sha256:aa3b97056fb971483f3794427098fc6e2b394f644e3a67d518074476ca1feec1","observation_id":"4a38ff1a-5543-4da6-9d7f-a057b390944b","resolution":{"observed_at":"2026-08-11T13:28:29.483763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.00195","last_updated":"2019-06-10T05:19:32Z","snapshot_observed_at":"2026-07-06T06:26:01.372123Z","submitted_at":"2018-03-01T03:46:36Z","title":"The Anisotropic Noise in Stochastic Gradient Descent: Its Behavior of Escaping from Sharp Minima and Regularization Effects","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.00195","snapshot_observed_at":"2026-08-11T13:28:29.488725Z","title":"The anisotropic noise in stochastic gradient descent: Its behavior of escaping from sharp minima and regularization effects","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.13148","last_updated":"2025-02-21T18:59:37Z","snapshot_observed_at":"2026-08-13T18:18:58.798878Z","submitted_at":"2024-12-17T18:13:18Z","title":"SWAN: SGD with Normalization and Whitening Enables Stateless LLM Training","version":3},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-11T13:28:29.488725Z"},"links":{"cited_paper":"/paper/1803.00195","citing_paper":"/paper/2412.13148"},"observation_digest":"sha256:ab924baa87178c9259405b76074c5287f75292772e41c7b35186e3b9228304b2","observation_id":"d48760b1-3cb5-477d-a3c9-2a160f539ca6","resolution":{"observed_at":"2026-08-11T13:28:29.488725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:28:29.493867Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.13148","last_updated":"2025-02-21T18:59:37Z","snapshot_observed_at":"2026-08-13T18:18:58.798878Z","submitted_at":"2024-12-17T18:13:18Z","title":"SWAN: SGD with Normalization and Whitening Enables Stateless LLM Training","version":3},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-11T13:28:29.493867Z"},"links":{"citing_paper":"/paper/2412.13148"},"observation_digest":"sha256:96f504efa82dbb9291bbb934e9ed7e9a9e6cc2d145dc1432370cf9ab8cc3f5a5","observation_id":"0ba84744-5121-4f25-9c76-0ff64573fdfb","resolution":{"observed_at":"2026-08-11T13:28:29.493867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:28:29.498996Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.13148","last_updated":"2025-02-21T18:59:37Z","snapshot_observed_at":"2026-08-13T18:18:58.798878Z","submitted_at":"2024-12-17T18:13:18Z","title":"SWAN: SGD with Normalization and Whitening Enables Stateless LLM Training","version":3},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-11T13:28:29.498996Z"},"links":{"citing_paper":"/paper/2412.13148"},"observation_digest":"sha256:9b1fca737295f27d4330a73ae3acd2eab8e996ec4d7a1ff092e7cc2071c6a123","observation_id":"2c0553f1-7cad-4189-8e31-66f0d1f92661","resolution":{"observed_at":"2026-08-11T13:28:29.498996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:28:29.503764Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.13148","last_updated":"2025-02-21T18:59:37Z","snapshot_observed_at":"2026-08-13T18:18:58.798878Z","submitted_at":"2024-12-17T18:13:18Z","title":"SWAN: SGD with Normalization and Whitening Enables Stateless LLM Training","version":3},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-11T13:28:29.503764Z"},"links":{"citing_paper":"/paper/2412.13148"},"observation_digest":"sha256:53492cd4a8907764c8bdc0aa468a666ca4435ba1fae7f770c33a41d8859d878f","observation_id":"40712ffe-5059-4790-bab5-9e0e781f6725","resolution":{"observed_at":"2026-08-11T13:28:29.503764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.13148","last_updated":"2025-02-21T18:59:37Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-13T18:18:58.798878Z","submitted_at":"2024-12-17T18:13:18Z","title":"SWAN: SGD with Normalization and Whitening Enables Stateless LLM Training"},"reference_resolution":{"displayed":77,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":54,"verified_exact":1,"verified_fuzzy":22},"total_outbound_references":77},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 77 of 77 outbound references and 8 inbound Pith citation observations for arXiv:2412.13148."}