{"as_of":"2026-08-09T11:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:91408b12458804f6f912d16115a50a85ad0012220ec4ecb67a372a8889b048ad","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T12:40:42.772228Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T15:16:58.221358Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T10:51:21.208174Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.07488","last_updated":"2025-02-11T11:48:04Z","snapshot_observed_at":"2026-08-09T07:29:37.710010Z","submitted_at":"2025-02-11T11:48:04Z","title":"Improving Adaptive Moment Optimization via Preconditioner Diagonalization","version":1},"cited_work":{"arxiv_id":"2502.07488","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.07488","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A method of solving a convex programming problem with convergence rate O( 1 k2 ).Sov","venue":null,"work_id":"470d901f-e17b-4165-a4bb-4354ed180c42","year":1983},"citing_paper":{"arxiv_id":"2604.12968","last_updated":"2026-04-14T17:01:36Z","snapshot_observed_at":"2026-07-06T23:01:05.634599Z","submitted_at":"2026-04-14T17:01:36Z","title":"Evolution of Optimization Methods: Algorithms, Scenarios, and Evaluations","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T15:16:58.221358Z"},"links":{"cited_paper":"/paper/2502.07488","citing_paper":"/paper/2604.12968"},"observation_digest":"sha256:f6c9dc522284ca78cb5906a8d7c1b03094583fd09f4d3b3e11acba2d8ee5f6ef","observation_id":"e1060d59-b93e-4c5d-ab10-06d97084637f","resolution":{"observed_at":"2026-05-11T10:51:21.226714Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.07488/citation-record","integrity":"/paper/2502.07488/integrity","json":"/paper/2502.07488/citation-record.json","paper":"/paper/2502.07488"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:40:43.200455Z","title":"Fisher information and natural gradient learning in random deep networks","venue":null,"work_id":"9748861f-db51-466b-9f46-8c8883012651","year":2019},"citing_paper":{"arxiv_id":"2502.07488","last_updated":"2025-02-11T11:48:04Z","snapshot_observed_at":"2026-08-09T07:29:37.710010Z","submitted_at":"2025-02-11T11:48:04Z","title":"Improving Adaptive Moment Optimization via Preconditioner Diagonalization","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-08T12:40:42.138133Z"},"links":{"citing_paper":"/paper/2502.07488"},"observation_digest":"sha256:addbdb9a1cd5676bb4764da9b189f2bac1a8ffc1044d923b0005465bb9b625d6","observation_id":"9ff3673c-00bf-43f4-9a38-8e1ba1a324fa","resolution":{"observed_at":"2026-08-08T12:40:43.204735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.09018","last_updated":"2021-03-05T06:29:48Z","snapshot_observed_at":"2026-08-03T21:55:15.856477Z","submitted_at":"2020-02-20T20:51:33Z","title":"Scalable Second Order Optimization for Deep Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.09018","snapshot_observed_at":"2026-08-08T12:40:42.155942Z","title":"Scalable second order optimization for deep learning","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2502.07488","last_updated":"2025-02-11T11:48:04Z","snapshot_observed_at":"2026-08-09T07:29:37.710010Z","submitted_at":"2025-02-11T11:48:04Z","title":"Improving Adaptive Moment Optimization via Preconditioner Diagonalization","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-08T12:40:42.155942Z"},"links":{"cited_paper":"/paper/2002.09018","citing_paper":"/paper/2502.07488"},"observation_digest":"sha256:9e7c498ac19720e31e97981a566461d17fa17be5d3fd84ee23374905f9a4043b","observation_id":"a1faf0f7-6720-4769-9149-368f6fb422e5","resolution":{"observed_at":"2026-08-08T12:40:42.155942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:40:43.188665Z","title":"Numerical optimization: theoretical and practical aspects","venue":null,"work_id":"5955f51e-04d9-44f2-b1b1-bf1ceb64d653","year":2006},"citing_paper":{"arxiv_id":"2502.07488","last_updated":"2025-02-11T11:48:04Z","snapshot_observed_at":"2026-08-09T07:29:37.710010Z","submitted_at":"2025-02-11T11:48:04Z","title":"Improving Adaptive Moment Optimization via Preconditioner Diagonalization","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-08T12:40:42.166592Z"},"links":{"citing_paper":"/paper/2502.07488"},"observation_digest":"sha256:31a1ec5ea8c285a0f00145094c7b92dad6c78335fc1a86244f498767945f5766","observation_id":"0b42b222-d8a5-4361-90a6-d3e3bbef40fb","resolution":{"observed_at":"2026-08-08T12:40:43.193082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:40:43.177902Z","title":"Practical gauss-newton optimisation for deep learning","venue":null,"work_id":"9cfb4dda-46e2-4dcd-9775-39374a75265d","year":2017},"citing_paper":{"arxiv_id":"2502.07488","last_updated":"2025-02-11T11:48:04Z","snapshot_observed_at":"2026-08-09T07:29:37.710010Z","submitted_at":"2025-02-11T11:48:04Z","title":"Improving Adaptive Moment Optimization via Preconditioner Diagonalization","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-08T12:40:42.181235Z"},"links":{"citing_paper":"/paper/2502.07488"},"observation_digest":"sha256:cd286191e21b63556a173330dd627ac16777c26617457f6338f08202809d613d","observation_id":"19311ef6-1f96-40d6-8143-6e36827dd755","resolution":{"observed_at":"2026-08-08T12:40:43.181798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05898","last_updated":"2025-07-01T15:59:19Z","snapshot_observed_at":"2026-07-06T16:29:55.892584Z","submitted_at":"2023-10-09T17:41:29Z","title":"Lion Secretly Solves Constrained Optimization: As Lyapunov Predicts","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05898","snapshot_observed_at":"2026-08-08T12:40:42.189563Z","title":"Lion secretly solves constrained optimization: As lyapunov predicts","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07488","last_updated":"2025-02-11T11:48:04Z","snapshot_observed_at":"2026-08-09T07:29:37.710010Z","submitted_at":"2025-02-11T11:48:04Z","title":"Improving Adaptive Moment Optimization via Preconditioner Diagonalization","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-08T12:40:42.189563Z"},"links":{"cited_paper":"/paper/2310.05898","citing_paper":"/paper/2502.07488"},"observation_digest":"sha256:ab255eaf51e2d07a07cd8a92584123f145f2e1963971f236110c0123c960ee50","observation_id":"d80d7340-773c-4fc8-947f-5f75f5656915","resolution":{"observed_at":"2026-08-08T12:40:42.189563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:40:43.166981Z","title":"Symbolic discovery of optimization algorithms","venue":null,"work_id":"6b078016-0e8f-404d-a484-89a3cc62df19","year":2024},"citing_paper":{"arxiv_id":"2502.07488","last_updated":"2025-02-11T11:48:04Z","snapshot_observed_at":"2026-08-09T07:29:37.710010Z","submitted_at":"2025-02-11T11:48:04Z","title":"Improving Adaptive Moment Optimization via Preconditioner Diagonalization","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-08T12:40:42.201534Z"},"links":{"citing_paper":"/paper/2502.07488"},"observation_digest":"sha256:69cecd491dcb8b3eff6ef33145bed6d9197b61aa3237da07309b747c1840dea6","observation_id":"6574f7c3-4993-4272-a8ee-6f89730b2b15","resolution":{"observed_at":"2026-08-08T12:40:43.171270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:40:43.157925Z","title":null,"venue":null,"work_id":"004937a3-26dc-4108-a724-1c153b1422b8","year":2020},"citing_paper":{"arxiv_id":"2502.07488","last_updated":"2025-02-11T11:48:04Z","snapshot_observed_at":"2026-08-09T07:29:37.710010Z","submitted_at":"2025-02-11T11:48:04Z","title":"Improving Adaptive Moment Optimization via Preconditioner Diagonalization","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-08T12:40:42.208031Z"},"links":{"citing_paper":"/paper/2502.07488"},"observation_digest":"sha256:25453a57ed80fb3f5aa9f7cf0bc2939396ea991090eea96428353729cdc22178","observation_id":"4ceb3334-28c6-41de-98e4-2de2786b8804","resolution":{"observed_at":"2026-08-08T12:40:43.160693Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:40:42.218356Z","title":"Adaptive subgradient methods for online learning and stochastic optimization","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2502.07488","last_updated":"2025-02-11T11:48:04Z","snapshot_observed_at":"2026-08-09T07:29:37.710010Z","submitted_at":"2025-02-11T11:48:04Z","title":"Improving Adaptive Moment Optimization via Preconditioner Diagonalization","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-08T12:40:42.218356Z"},"links":{"citing_paper":"/paper/2502.07488"},"observation_digest":"sha256:58a18e316d396cbd5935df89d4c3dd3dae59acf554ac66bf4815091a121b29af","observation_id":"9c457a4a-7eaa-41c9-983f-a551320b8fd9","resolution":{"observed_at":"2026-08-08T12:40:42.218356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:40:42.228124Z","title":"Model-agnostic meta-learning for fast adaptation of deep networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.07488","last_updated":"2025-02-11T11:48:04Z","snapshot_observed_at":"2026-08-09T07:29:37.710010Z","submitted_at":"2025-02-11T11:48:04Z","title":"Improving Adaptive Moment Optimization via Preconditioner Diagonalization","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-08T12:40:42.228124Z"},"links":{"citing_paper":"/paper/2502.07488"},"observation_digest":"sha256:b9be4e0c206c6edfd75ddce501d06fbea8c24b48f91803bc0bc9505b8704ea7b","observation_id":"4d74f84b-e6f9-47f4-a236-c160e529e279","resolution":{"observed_at":"2026-08-08T12:40:42.228124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:40:42.233646Z","title":"Practical methods of optimization","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2502.07488","last_updated":"2025-02-11T11:48:04Z","snapshot_observed_at":"2026-08-09T07:29:37.710010Z","submitted_at":"2025-02-11T11:48:04Z","title":"Improving Adaptive Moment Optimization via Preconditioner Diagonalization","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-08T12:40:42.233646Z"},"links":{"citing_paper":"/paper/2502.07488"},"observation_digest":"sha256:63808000b04840430c9322088d0faf0d42393e2eb2fd580eac53c22bf442b962","observation_id":"739f93e1-af6b-446d-b3c2-9cd88cdc9b72","resolution":{"observed_at":"2026-08-08T12:40:42.233646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:40:43.129704Z","title":"Global convergence of stochastic gradient hamiltonian monte carlo for nonconvex stochastic optimization: Nonasymptotic performance bounds and momentum-based acceleration","venue":null,"work_id":"50119879-bc5b-4262-9736-fe95d3fd0970","year":2022},"citing_paper":{"arxiv_id":"2502.07488","last_updated":"2025-02-11T11:48:04Z","snapshot_observed_at":"2026-08-09T07:29:37.710010Z","submitted_at":"2025-02-11T11:48:04Z","title":"Improving Adaptive Moment Optimization via Preconditioner Diagonalization","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-08T12:40:42.239916Z"},"links":{"citing_paper":"/paper/2502.07488"},"observation_digest":"sha256:9bb02c2ad3f2ed401082beb52916c3208aa1540dfc66bd2c2b500758b560bdff","observation_id":"db6573a3-3b95-4023-89ee-e5a2e404548b","resolution":{"observed_at":"2026-08-08T12:40:43.134162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:40:43.118675Z","title":"Fast approximate natural gradient descent in a kronecker factored eigenbasis","venue":null,"work_id":"b6d47cf3-6ef9-4fae-90f6-e42b42ce50a4","year":2018},"citing_paper":{"arxiv_id":"2502.07488","last_updated":"2025-02-11T11:48:04Z","snapshot_observed_at":"2026-08-09T07:29:37.710010Z","submitted_at":"2025-02-11T11:48:04Z","title":"Improving Adaptive Moment Optimization via Preconditioner Diagonalization","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-08T12:40:42.243228Z"},"links":{"citing_paper":"/paper/2502.07488"},"observation_digest":"sha256:53592278e9de62cc94203126c952ccf61ef193fe02cf7b83b4aad0da5c0ef2f7","observation_id":"ee8bbd5f-4502-4309-8150-a4e8a838e64e","resolution":{"observed_at":"2026-08-08T12:40:43.122673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:40:43.107325Z","title":"Low-rank gradient approximation for memory-efficient on-device training of deep neural network","venue":null,"work_id":"608c9524-da2f-45be-9174-3c70cabc2da7","year":2020},"citing_paper":{"arxiv_id":"2502.07488","last_updated":"2025-02-11T11:48:04Z","snapshot_observed_at":"2026-08-09T07:29:37.710010Z","submitted_at":"2025-02-11T11:48:04Z","title":"Improving Adaptive Moment Optimization via Preconditioner Diagonalization","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-08T12:40:42.246592Z"},"links":{"citing_paper":"/paper/2502.07488"},"observation_digest":"sha256:3c13d4bfefa60388f7fa9a51c636339a4acfdea232693c3bc88e5b53ba2ed54f","observation_id":"d6aa1a4c-2a00-4a35-947a-52939f3a1752","resolution":{"observed_at":"2026-08-08T12:40:43.111751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:40:42.249746Z","title":"A kronecker-factored approximate fisher matrix for convolution layers","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.07488","last_updated":"2025-02-11T11:48:04Z","snapshot_observed_at":"2026-08-09T07:29:37.710010Z","submitted_at":"2025-02-11T11:48:04Z","title":"Improving Adaptive Moment Optimization via Preconditioner Diagonalization","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-08T12:40:42.249746Z"},"links":{"citing_paper":"/paper/2502.07488"},"observation_digest":"sha256:f8b1dd864aeabb22ab3e105068d621da846c6c45f0faf38ebe509cf1c48a93ef","observation_id":"f1c07a84-fd80-4865-88ff-db80c54f2a29","resolution":{"observed_at":"2026-08-08T12:40:42.249746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:40:42.252968Z","title":"Shampoo: Preconditioned stochastic tensor optimization","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.07488","last_updated":"2025-02-11T11:48:04Z","snapshot_observed_at":"2026-08-09T07:29:37.710010Z","submitted_at":"2025-02-11T11:48:04Z","title":"Improving Adaptive Moment Optimization via Preconditioner Diagonalization","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-08T12:40:42.252968Z"},"links":{"citing_paper":"/paper/2502.07488"},"observation_digest":"sha256:3cd333ff931fa203d50c7ae49f62c6372339a8bfb843d43086a52b73d10503de","observation_id":"4362436c-8008-4cb4-a035-3faa035aafaa","resolution":{"observed_at":"2026-08-08T12:40:42.252968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.04754","last_updated":"2018-12-12T00:36:17Z","snapshot_observed_at":"2026-07-06T07:20:39.525340Z","submitted_at":"2018-12-12T00:36:17Z","title":"Gradient Descent Happens in a Tiny Subspace","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.04754","snapshot_observed_at":"2026-08-08T12:40:42.256046Z","title":"Gradient descent happens in a tiny subspace","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.07488","last_updated":"2025-02-11T11:48:04Z","snapshot_observed_at":"2026-08-09T07:29:37.710010Z","submitted_at":"2025-02-11T11:48:04Z","title":"Improving Adaptive Moment Optimization via Preconditioner Diagonalization","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-08T12:40:42.256046Z"},"links":{"cited_paper":"/paper/1812.04754","citing_paper":"/paper/2502.07488"},"observation_digest":"sha256:8753e5b8e222f7c6ac89c2734b41f1dfec8f1a007a6cbb897f20b4af396149ca","observation_id":"efc383d0-48fd-45d1-9082-178b65955821","resolution":{"observed_at":"2026-08-08T12:40:42.256046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-08T12:40:42.259693Z","title":"Adam: A method for stochastic optimization","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2502.07488","last_updated":"2025-02-11T11:48:04Z","snapshot_observed_at":"2026-08-09T07:29:37.710010Z","submitted_at":"2025-02-11T11:48:04Z","title":"Improving Adaptive Moment Optimization via Preconditioner Diagonalization","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-08T12:40:42.259693Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2502.07488"},"observation_digest":"sha256:47bf456f81d9b8806a633e59126db0bfe3b11c6c92c10ddb8b2fc95123849b43","observation_id":"cbd4949f-d459-4d3f-b64a-27ad3c22c975","resolution":{"observed_at":"2026-08-08T12:40:42.259693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1610.02527","last_updated":"2016-10-08T13:25:15Z","snapshot_observed_at":"2026-07-06T05:13:51.685562Z","submitted_at":"2016-10-08T13:25:15Z","title":"Federated Optimization: Distributed Machine Learning for On-Device Intelligence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1610.02527","snapshot_observed_at":"2026-08-08T12:40:42.263049Z","title":"Federated optimization: Distributed machine learning for on-device intelligence","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.07488","last_updated":"2025-02-11T11:48:04Z","snapshot_observed_at":"2026-08-09T07:29:37.710010Z","submitted_at":"2025-02-11T11:48:04Z","title":"Improving Adaptive Moment Optimization via Preconditioner Diagonalization","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-08T12:40:42.263049Z"},"links":{"cited_paper":"/paper/1610.02527","citing_paper":"/paper/2502.07488"},"observation_digest":"sha256:ab8e4b2ad4762132b31857d131541068e4784ffa1da8691feea0d742695a6297","observation_id":"4a56218b-9d7a-4914-8271-0d1a1ef6e4bc","resolution":{"observed_at":"2026-08-08T12:40:42.263049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19449","last_updated":"2024-07-12T05:10:32Z","snapshot_observed_at":"2026-07-06T17:37:39.610989Z","submitted_at":"2024-02-29T18:47:52Z","title":"Heavy-Tailed Class Imbalance and Why Adam Outperforms Gradient Descent on Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19449","snapshot_observed_at":"2026-08-08T12:40:42.267822Z","title":"Heavy-tailed class imbalance and why adam outperforms gradient descent on language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07488","last_updated":"2025-02-11T11:48:04Z","snapshot_observed_at":"2026-08-09T07:29:37.710010Z","submitted_at":"2025-02-11T11:48:04Z","title":"Improving Adaptive Moment Optimization via Preconditioner Diagonalization","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-08T12:40:42.267822Z"},"links":{"cited_paper":"/paper/2402.19449","citing_paper":"/paper/2502.07488"},"observation_digest":"sha256:7226e7e91c2492f63ff3f15d9800673d4320dc0a3b197f1185e94aedb7d1bbb1","observation_id":"4ee2ef16-3de8-498f-9667-616dc150ad73","resolution":{"observed_at":"2026-08-08T12:40:42.267822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:40:43.083028Z","title":"Federated learning: Challenges, methods, and future directions","venue":null,"work_id":"e97eb1f4-545a-4780-814a-6999ab14b565","year":2020},"citing_paper":{"arxiv_id":"2502.07488","last_updated":"2025-02-11T11:48:04Z","snapshot_observed_at":"2026-08-09T07:29:37.710010Z","submitted_at":"2025-02-11T11:48:04Z","title":"Improving Adaptive Moment Optimization via Preconditioner Diagonalization","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-08T12:40:42.271382Z"},"links":{"citing_paper":"/paper/2502.07488"},"observation_digest":"sha256:7199123485fa4b7a60fa1f60cda0794bfa662200ed3cd3b6db487cd3896f8f27","observation_id":"d301ac9e-e0c3-4471-8e02-27667e5696b4","resolution":{"observed_at":"2026-08-08T12:40:43.087643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12857","last_updated":"2024-08-23T05:54:53Z","snapshot_observed_at":"2026-08-02T03:25:18.261713Z","submitted_at":"2024-08-23T05:54:53Z","title":"Memory-Efficient LLM Training with Online Subspace Descent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12857","snapshot_observed_at":"2026-08-08T12:40:42.274506Z","title":"Memory-efficient llm training with online subspace descent","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07488","last_updated":"2025-02-11T11:48:04Z","snapshot_observed_at":"2026-08-09T07:29:37.710010Z","submitted_at":"2025-02-11T11:48:04Z","title":"Improving Adaptive Moment Optimization via Preconditioner Diagonalization","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-08T12:40:42.274506Z"},"links":{"cited_paper":"/paper/2408.12857","citing_paper":"/paper/2502.07488"},"observation_digest":"sha256:d052bf8698a11203ba2c85dbced8dc999bee69d6585c3409716831f95a52197c","observation_id":"0e4a53f3-10b6-493e-b57e-f85a8a3f113d","resolution":{"observed_at":"2026-08-08T12:40:42.274506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14342","last_updated":"2024-03-05T17:07:16Z","snapshot_observed_at":"2026-08-08T09:25:28.224090Z","submitted_at":"2023-05-23T17:59:21Z","title":"Sophia: A Scalable Stochastic Second-order Optimizer for Language Model Pre-training","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14342","snapshot_observed_at":"2026-08-08T12:40:42.278139Z","title":"Sophia: A scalable stochastic second-order optimizer for language model pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07488","last_updated":"2025-02-11T11:48:04Z","snapshot_observed_at":"2026-08-09T07:29:37.710010Z","submitted_at":"2025-02-11T11:48:04Z","title":"Improving Adaptive Moment Optimization via Preconditioner Diagonalization","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-08T12:40:42.278139Z"},"links":{"cited_paper":"/paper/2305.14342","citing_paper":"/paper/2502.07488"},"observation_digest":"sha256:4e48bac78de978c437f734eb72e26d94a8dd3aa71da00209087d979f5d7d0a30","observation_id":"7e82254b-2dae-417a-a908-44bf23178cdc","resolution":{"observed_at":"2026-08-08T12:40:42.278139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:40:43.074463Z","title":"Rotate your networks: Better weight consolidation and less catastrophic forgetting","venue":null,"work_id":"195f7779-a3d3-4305-8403-a3d19c0ccb92","year":2018},"citing_paper":{"arxiv_id":"2502.07488","last_updated":"2025-02-11T11:48:04Z","snapshot_observed_at":"2026-08-09T07:29:37.710010Z","submitted_at":"2025-02-11T11:48:04Z","title":"Improving Adaptive Moment Optimization via Preconditioner Diagonalization","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-08T12:40:42.281195Z"},"links":{"citing_paper":"/paper/2502.07488"},"observation_digest":"sha256:9f24f97288df56dbe0cd622ca8b5e9e0ecd6f69a2d9b220ae490052bfac245a5","observation_id":"3e7889d9-cf31-4f79-99d8-4259ffa823c1","resolution":{"observed_at":"2026-08-08T12:40:43.077676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-08T12:40:42.284368Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.07488","last_updated":"2025-02-11T11:48:04Z","snapshot_observed_at":"2026-08-09T07:29:37.710010Z","submitted_at":"2025-02-11T11:48:04Z","title":"Improving Adaptive Moment Optimization via Preconditioner Diagonalization","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-08T12:40:42.284368Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2502.07488"},"observation_digest":"sha256:899430e9ad94784175bb5ba571a1ec0edd75ccfcf3cddf366efcb38762a9f9ba","observation_id":"029ceef8-ab5d-4aca-b05b-4e2f4b180344","resolution":{"observed_at":"2026-08-08T12:40:42.284368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.05042","last_updated":"2018-09-13T16:21:11Z","snapshot_observed_at":"2026-07-06T07:02:02.624968Z","submitted_at":"2018-09-13T16:21:11Z","title":"Hamiltonian Descent Methods","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.05042","snapshot_observed_at":"2026-08-08T12:40:42.287659Z","title":"Hamiltonian descent methods","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.07488","last_updated":"2025-02-11T11:48:04Z","snapshot_observed_at":"2026-08-09T07:29:37.710010Z","submitted_at":"2025-02-11T11:48:04Z","title":"Improving Adaptive Moment Optimization via Preconditioner Diagonalization","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-08T12:40:42.287659Z"},"links":{"cited_paper":"/paper/1809.05042","citing_paper":"/paper/2502.07488"},"observation_digest":"sha256:af5c4430bc9b5c91e3f294c1296b89aab148f3a77fb7447e98407e615ba419ad","observation_id":"e8cf7dd5-e2d9-4a41-a976-cdaca4afda18","resolution":{"observed_at":"2026-08-08T12:40:42.287659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:40:42.312933Z","title":"New insights and perspectives on the natural gradient method","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.07488","last_updated":"2025-02-11T11:48:04Z","snapshot_observed_at":"2026-08-09T07:29:37.710010Z","submitted_at":"2025-02-11T11:48:04Z","title":"Improving Adaptive Moment Optimization via Preconditioner Diagonalization","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-08T12:40:42.312933Z"},"links":{"citing_paper":"/paper/2502.07488"},"observation_digest":"sha256:d2d162f575d993b754379458a7965829562bdb47bc92f489693493e3a5076627","observation_id":"eef32fcf-6c65-4a70-8af7-aff3bea8de8e","resolution":{"observed_at":"2026-08-08T12:40:42.312933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:40:43.060572Z","title":"Optimizing neural networks with kronecker-factored approximate curvature","venue":null,"work_id":"4fa3e906-bb82-4f79-b9a4-282e58da6216","year":2015},"citing_paper":{"arxiv_id":"2502.07488","last_updated":"2025-02-11T11:48:04Z","snapshot_observed_at":"2026-08-09T07:29:37.710010Z","submitted_at":"2025-02-11T11:48:04Z","title":"Improving Adaptive Moment Optimization via Preconditioner Diagonalization","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-08T12:40:42.347622Z"},"links":{"citing_paper":"/paper/2502.07488"},"observation_digest":"sha256:92863f374a72b99c7c8f055bb211b0dce7adb363677e0add61c4ef511b65c54e","observation_id":"e76b30be-105c-4f14-baba-1295bb6c8e89","resolution":{"observed_at":"2026-08-08T12:40:43.063560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09958","last_updated":"2024-10-17T06:33:05Z","snapshot_observed_at":"2026-07-06T18:30:59.857334Z","submitted_at":"2024-06-14T12:05:17Z","title":"Memory-Efficient Optimization with Factorized Hamiltonian Descent","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09958","snapshot_observed_at":"2026-08-08T12:40:42.374967Z","title":"H-fac: Memory-efficient optimization with factorized hamiltonian descent","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07488","last_updated":"2025-02-11T11:48:04Z","snapshot_observed_at":"2026-08-09T07:29:37.710010Z","submitted_at":"2025-02-11T11:48:04Z","title":"Improving Adaptive Moment Optimization via Preconditioner Diagonalization","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-08T12:40:42.374967Z"},"links":{"cited_paper":"/paper/2406.09958","citing_paper":"/paper/2502.07488"},"observation_digest":"sha256:366f2789134bc8f8f9b818743533669560d096387cc02e2a18b86bb9cde7256a","observation_id":"9bce9ba0-b666-4026-8659-30882c7e084f","resolution":{"observed_at":"2026-08-08T12:40:42.374967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:40:42.402836Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.07488","last_updated":"2025-02-11T11:48:04Z","snapshot_observed_at":"2026-08-09T07:29:37.710010Z","submitted_at":"2025-02-11T11:48:04Z","title":"Improving Adaptive Moment Optimization via Preconditioner Diagonalization","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-08T12:40:42.402836Z"},"links":{"citing_paper":"/paper/2502.07488"},"observation_digest":"sha256:230b3f3863359dd418420f2156f6201ca0b8cc66b8e079553e8103ea736e011c","observation_id":"ebfacd26-ae79-436e-bd40-bb24d510028c","resolution":{"observed_at":"2026-08-08T12:40:42.402836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09237","last_updated":"2019-04-19T16:21:38Z","snapshot_observed_at":"2026-08-03T03:50:23.110540Z","submitted_at":"2019-04-19T16:21:38Z","title":"On the Convergence of Adam and Beyond","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09237","snapshot_observed_at":"2026-08-08T12:40:42.419046Z","title":"On the convergence of adam and beyond","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2502.07488","last_updated":"2025-02-11T11:48:04Z","snapshot_observed_at":"2026-08-09T07:29:37.710010Z","submitted_at":"2025-02-11T11:48:04Z","title":"Improving Adaptive Moment Optimization via Preconditioner Diagonalization","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-08T12:40:42.419046Z"},"links":{"cited_paper":"/paper/1904.09237","citing_paper":"/paper/2502.07488"},"observation_digest":"sha256:1130b0871a882e07c4f58fc36db5f4742e36f92c250bd08a4b6e509bb3ae4e31","observation_id":"4c273979-9323-4434-b003-6b635919f17e","resolution":{"observed_at":"2026-08-08T12:40:42.419046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.05202","last_updated":"2020-02-12T19:57:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-02-12T19:57:13Z","title":"GLU Variants Improve Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.05202","snapshot_observed_at":"2026-08-08T12:40:42.449148Z","title":"Glu variants improve transformer","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2502.07488","last_updated":"2025-02-11T11:48:04Z","snapshot_observed_at":"2026-08-09T07:29:37.710010Z","submitted_at":"2025-02-11T11:48:04Z","title":"Improving Adaptive Moment Optimization via Preconditioner Diagonalization","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-08T12:40:42.449148Z"},"links":{"cited_paper":"/paper/2002.05202","citing_paper":"/paper/2502.07488"},"observation_digest":"sha256:1d64e1bb1c7a4c62074a0cd2a2ae8d2e92f9634d963dcd10dc1aed088494b625","observation_id":"14d8ddb4-6d87-478f-9b8b-32a33b1b6277","resolution":{"observed_at":"2026-08-08T12:40:42.449148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:40:42.485495Z","title":"Adafactor: Adaptive learning rates with sublinear memory cost","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.07488","last_updated":"2025-02-11T11:48:04Z","snapshot_observed_at":"2026-08-09T07:29:37.710010Z","submitted_at":"2025-02-11T11:48:04Z","title":"Improving Adaptive Moment Optimization via Preconditioner Diagonalization","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-08T12:40:42.485495Z"},"links":{"citing_paper":"/paper/2502.07488"},"observation_digest":"sha256:3277d7f731ba1124cdc217e8f024005d3f2e801bdd5dfb242b2aa181ed7188f5","observation_id":"76ef8fd9-bd9d-4880-a84b-7cf82267a834","resolution":{"observed_at":"2026-08-08T12:40:42.485495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.00018","last_updated":"2019-11-29T16:56:02Z","snapshot_observed_at":"2026-07-06T08:40:59.491813Z","submitted_at":"2019-11-29T16:56:02Z","title":"On the Heavy-Tailed Theory of Stochastic Gradient Descent for Deep Neural Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.00018","snapshot_observed_at":"2026-08-08T12:40:42.523157Z","title":"u rb \\\"u zbalaban, Thanh Huy Nguyen, Ga \\","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2502.07488","last_updated":"2025-02-11T11:48:04Z","snapshot_observed_at":"2026-08-09T07:29:37.710010Z","submitted_at":"2025-02-11T11:48:04Z","title":"Improving Adaptive Moment Optimization via Preconditioner Diagonalization","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-08T12:40:42.523157Z"},"links":{"cited_paper":"/paper/1912.00018","citing_paper":"/paper/2502.07488"},"observation_digest":"sha256:e622c9de503de6bd87d06f2610c7063ab19decabc0c7696a337c8ca4a8355ef8","observation_id":"c03ac2ed-81f4-4cef-8001-8964a1fe084f","resolution":{"observed_at":"2026-08-08T12:40:42.523157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.12176","last_updated":"2021-01-28T18:32:14Z","snapshot_observed_at":"2026-08-04T15:33:31.839842Z","submitted_at":"2021-01-28T18:32:14Z","title":"On the Origin of Implicit Regularization in Stochastic Gradient Descent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.12176","snapshot_observed_at":"2026-08-08T12:40:42.527482Z","title":"On the origin of implicit regularization in stochastic gradient descent","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.07488","last_updated":"2025-02-11T11:48:04Z","snapshot_observed_at":"2026-08-09T07:29:37.710010Z","submitted_at":"2025-02-11T11:48:04Z","title":"Improving Adaptive Moment Optimization via Preconditioner Diagonalization","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-08T12:40:42.527482Z"},"links":{"cited_paper":"/paper/2101.12176","citing_paper":"/paper/2502.07488"},"observation_digest":"sha256:ce818f3bbbee2417fc50fb8a30a0c781af29ebbc334c5ebbab2300c05bbf3e4e","observation_id":"07613736-b5c4-4731-872c-95b963c63c15","resolution":{"observed_at":"2026-08-08T12:40:42.527482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:40:42.531440Z","title":"Rethinking the inception architecture for computer vision","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.07488","last_updated":"2025-02-11T11:48:04Z","snapshot_observed_at":"2026-08-09T07:29:37.710010Z","submitted_at":"2025-02-11T11:48:04Z","title":"Improving Adaptive Moment Optimization via Preconditioner Diagonalization","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-08T12:40:42.531440Z"},"links":{"citing_paper":"/paper/2502.07488"},"observation_digest":"sha256:5980dc7eda3d9f99d6cc199ca991f703d3c780d7e506c5415851281ee75d35e7","observation_id":"aa28a64b-0392-4235-a35e-cf3d0223a4f9","resolution":{"observed_at":"2026-08-08T12:40:42.531440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:40:43.035245Z","title":"Recent advances in stochastic gradient descent in deep learning","venue":null,"work_id":"7a258120-37c5-4077-8de3-d668c6c7b209","year":2023},"citing_paper":{"arxiv_id":"2502.07488","last_updated":"2025-02-11T11:48:04Z","snapshot_observed_at":"2026-08-09T07:29:37.710010Z","submitted_at":"2025-02-11T11:48:04Z","title":"Improving Adaptive Moment Optimization via Preconditioner Diagonalization","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-08T12:40:42.535692Z"},"links":{"citing_paper":"/paper/2502.07488"},"observation_digest":"sha256:cee39f5e208f181fd281bab8544f36cf791546e4a06dc2484cfed88518965feb","observation_id":"da615b9c-8a5f-450f-ac68-904309ce080b","resolution":{"observed_at":"2026-08-08T12:40:43.038273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-08T12:40:42.539056Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07488","last_updated":"2025-02-11T11:48:04Z","snapshot_observed_at":"2026-08-09T07:29:37.710010Z","submitted_at":"2025-02-11T11:48:04Z","title":"Improving Adaptive Moment Optimization via Preconditioner Diagonalization","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-08T12:40:42.539056Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2502.07488"},"observation_digest":"sha256:228e03f6e31478716a9f3686a535046457f53bf4315d04c67f576cfe13ec0d00","observation_id":"7b21e59c-053e-42b9-99a5-bfdbe53db156","resolution":{"observed_at":"2026-08-08T12:40:42.539056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11321","last_updated":"2025-01-31T18:52:42Z","snapshot_observed_at":"2026-07-06T19:16:51.512681Z","submitted_at":"2024-09-17T16:18:05Z","title":"SOAP: Improving and Stabilizing Shampoo using Adam","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11321","snapshot_observed_at":"2026-08-08T12:40:42.542090Z","title":"Soap: Improving and stabilizing shampoo using adam","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07488","last_updated":"2025-02-11T11:48:04Z","snapshot_observed_at":"2026-08-09T07:29:37.710010Z","submitted_at":"2025-02-11T11:48:04Z","title":"Improving Adaptive Moment Optimization via Preconditioner Diagonalization","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-08T12:40:42.542090Z"},"links":{"cited_paper":"/paper/2409.11321","citing_paper":"/paper/2502.07488"},"observation_digest":"sha256:c849453fe5e495da6812c04af7008bfe92f0e38f8ad40b06a8a776d931bada10","observation_id":"85f06c53-e8cb-48e6-8f05-71f606f0d17c","resolution":{"observed_at":"2026-08-08T12:40:42.542090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:40:42.594954Z","title":"Root mean square layer normalization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.07488","last_updated":"2025-02-11T11:48:04Z","snapshot_observed_at":"2026-08-09T07:29:37.710010Z","submitted_at":"2025-02-11T11:48:04Z","title":"Improving Adaptive Moment Optimization via Preconditioner Diagonalization","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-08T12:40:42.594954Z"},"links":{"citing_paper":"/paper/2502.07488"},"observation_digest":"sha256:d45dcb4bc747b2464e5234b197e58bd2dd869980cc58ab1154f7b324f452db64","observation_id":"c1c76ea2-26c3-4e6e-a6a4-a345fe1028d1","resolution":{"observed_at":"2026-08-08T12:40:42.594954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1710.09412","last_updated":"2018-04-27T21:39:25Z","snapshot_observed_at":"2026-08-08T10:28:19.597631Z","submitted_at":"2017-10-25T18:30:49Z","title":"mixup: Beyond Empirical Risk Minimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.09412","snapshot_observed_at":"2026-08-08T12:40:42.712127Z","title":"mixup: Beyond empirical risk minimization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.07488","last_updated":"2025-02-11T11:48:04Z","snapshot_observed_at":"2026-08-09T07:29:37.710010Z","submitted_at":"2025-02-11T11:48:04Z","title":"Improving Adaptive Moment Optimization via Preconditioner Diagonalization","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-08T12:40:42.712127Z"},"links":{"cited_paper":"/paper/1710.09412","citing_paper":"/paper/2502.07488"},"observation_digest":"sha256:98722ebe5eaf9f494774cb03d77adab667a71962982c3ae5a2b686b602326f1f","observation_id":"c919e508-7103-45e9-9caa-f3bf0e7be8d6","resolution":{"observed_at":"2026-08-08T12:40:42.712127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:40:43.020320Z","title":"Why are adaptive methods good for attention models? Advances in Neural Information Processing Systems, 33: 0 15383--15393, 2020","venue":null,"work_id":"b733cb1d-de5f-4e4d-bc07-d2833345b78c","year":2020},"citing_paper":{"arxiv_id":"2502.07488","last_updated":"2025-02-11T11:48:04Z","snapshot_observed_at":"2026-08-09T07:29:37.710010Z","submitted_at":"2025-02-11T11:48:04Z","title":"Improving Adaptive Moment Optimization via Preconditioner Diagonalization","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-08T12:40:42.756600Z"},"links":{"citing_paper":"/paper/2502.07488"},"observation_digest":"sha256:61b8866c2f00a8dbddb7ee05d63482b413f4a16e747dffc3c519674a1b0b3626","observation_id":"c6255f01-01fc-4fc8-804e-e9dc9e45100b","resolution":{"observed_at":"2026-08-08T12:40:43.024078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:40:43.008885Z","title":"Adam can converge without any modification on update rules","venue":null,"work_id":"29e51e30-af0f-4ea0-b24b-c937b277ea70","year":2022},"citing_paper":{"arxiv_id":"2502.07488","last_updated":"2025-02-11T11:48:04Z","snapshot_observed_at":"2026-08-09T07:29:37.710010Z","submitted_at":"2025-02-11T11:48:04Z","title":"Improving Adaptive Moment Optimization via Preconditioner Diagonalization","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-08T12:40:42.759926Z"},"links":{"citing_paper":"/paper/2502.07488"},"observation_digest":"sha256:09d029ae78f402efab76246e7fb8fb4cbe9a26158e6df18f00af945d73a45f10","observation_id":"f8377d3a-7a91-4b77-8ca3-1083b32cc39e","resolution":{"observed_at":"2026-08-08T12:40:43.013528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16788","last_updated":"2024-10-21T08:27:23Z","snapshot_observed_at":"2026-07-06T17:35:41.168780Z","submitted_at":"2024-02-26T18:01:41Z","title":"Why Transformers Need Adam: A Hessian Perspective","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16788","snapshot_observed_at":"2026-08-08T12:40:42.763594Z","title":"Why transformers need adam: A hessian perspective","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07488","last_updated":"2025-02-11T11:48:04Z","snapshot_observed_at":"2026-08-09T07:29:37.710010Z","submitted_at":"2025-02-11T11:48:04Z","title":"Improving Adaptive Moment Optimization via Preconditioner Diagonalization","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-08T12:40:42.763594Z"},"links":{"cited_paper":"/paper/2402.16788","citing_paper":"/paper/2502.07488"},"observation_digest":"sha256:127de5f1d2487116f593886413f137ca0d3dfe857b4eab7bd1707760ee463cd6","observation_id":"7a7411e0-c16f-4ab8-84f3-1b891eecdaa3","resolution":{"observed_at":"2026-08-08T12:40:42.763594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03507","last_updated":"2024-06-02T21:24:12Z","snapshot_observed_at":"2026-07-06T17:40:15.746482Z","submitted_at":"2024-03-06T07:29:57Z","title":"GaLore: Memory-Efficient LLM Training by Gradient Low-Rank Projection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03507","snapshot_observed_at":"2026-08-08T12:40:42.767627Z","title":"Galore: Memory-efficient llm training by gradient low-rank projection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07488","last_updated":"2025-02-11T11:48:04Z","snapshot_observed_at":"2026-08-09T07:29:37.710010Z","submitted_at":"2025-02-11T11:48:04Z","title":"Improving Adaptive Moment Optimization via Preconditioner Diagonalization","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-08T12:40:42.767627Z"},"links":{"cited_paper":"/paper/2403.03507","citing_paper":"/paper/2502.07488"},"observation_digest":"sha256:d717508fa57639c1ef8a16097281c348b8855ff1f2379930756fbb108be06e23","observation_id":"5d7ab80c-32a2-4b23-b766-31a4adc02603","resolution":{"observed_at":"2026-08-08T12:40:42.767627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:40:42.996128Z","title":"Towards theoretically understanding why sgd generalizes better than adam in deep learning","venue":null,"work_id":"6570e85a-f365-40cb-a7db-157c74fd5f9c","year":2020},"citing_paper":{"arxiv_id":"2502.07488","last_updated":"2025-02-11T11:48:04Z","snapshot_observed_at":"2026-08-09T07:29:37.710010Z","submitted_at":"2025-02-11T11:48:04Z","title":"Improving Adaptive Moment Optimization via Preconditioner Diagonalization","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-08T12:40:42.772228Z"},"links":{"citing_paper":"/paper/2502.07488"},"observation_digest":"sha256:bd332fa0bdaacb2a15176ab6cdf444ffbf00fa7b7ca5b776a041425efa9375cc","observation_id":"48ae89c5-412a-4f97-b9fe-72f49e1e412f","resolution":{"observed_at":"2026-08-08T12:40:43.001783Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.07488","last_updated":"2025-02-11T11:48:04Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T07:29:37.710010Z","submitted_at":"2025-02-11T11:48:04Z","title":"Improving Adaptive Moment Optimization via Preconditioner Diagonalization"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":0,"verified_fuzzy":14},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 1 inbound Pith citation observation for arXiv:2502.07488."}