{"as_of":"2026-08-21T20:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3f75b9e71db21507dd71e37faf97c78efb77ed48adaeb4e122732bdb968bdcb3","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T11:25:45.073914Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":14,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T22:20:05.658343Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T23:47:28.482161Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-17T08:28:41.290969Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.02981","snapshot_observed_at":"2026-08-03T22:20:05.658343Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.11466","last_updated":"2026-06-22T13:35:19Z","snapshot_observed_at":"2026-08-13T05:16:19.109873Z","submitted_at":"2025-11-14T16:38:15Z","title":"Non-Euclidean SGD for Structured Optimization: Unified Analysis and Improved Rates","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-03T22:20:05.658343Z"},"links":{"cited_paper":"/paper/2509.02981","citing_paper":"/paper/2511.11466"},"observation_digest":"sha256:ade529566275ead29796b522457ca7a765a67e2857f50b3fabe71918de489f11","observation_id":"32ae49ab-8f42-473f-9fe0-449c888be26f","resolution":{"observed_at":"2026-08-03T22:20:05.658343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-17T08:28:41.290969Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.02981","snapshot_observed_at":"2026-08-03T03:56:43.342273Z","title":"Adagrad meets muon: Adaptive stepsizes for orthogonal updates","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.06880","last_updated":"2026-05-26T21:42:43Z","snapshot_observed_at":"2026-08-08T13:17:56.363673Z","submitted_at":"2026-02-06T17:06:42Z","title":"Decoupling Variance and Scale-Invariant Updates in Adaptive Gradient Descent for Unified Vector and Matrix Optimization","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:43.342273Z"},"links":{"cited_paper":"/paper/2509.02981","citing_paper":"/paper/2602.06880"},"observation_digest":"sha256:1f92b3f918092328b2125d96eef292921f9156ea72ff3c76a54dc1ac2822d622","observation_id":"e544531f-c17e-4347-9f5e-ca0051463067","resolution":{"observed_at":"2026-08-03T03:56:43.342273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-17T08:28:41.290969Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"cited_work":{"arxiv_id":"2509.02981","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.02981","snapshot_observed_at":"2026-07-02T23:47:28.482161Z","title":"Zhang, Y","venue":null,"work_id":"9995c05a-6c9b-4ecb-bcc4-80d76fb6a360","year":2025},"citing_paper":{"arxiv_id":"2604.04726","last_updated":"2026-04-06T14:47:46Z","snapshot_observed_at":"2026-08-13T16:17:00.410877Z","submitted_at":"2026-04-06T14:47:46Z","title":"A Muon-Accelerated Algorithm for Low Separation Rank Tensor Generalized Linear Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T19:16:35.992399Z"},"links":{"cited_paper":"/paper/2509.02981","citing_paper":"/paper/2604.04726"},"observation_digest":"sha256:88348b28edc065ab6d4d7af215691c7f05378fb02f5237df76f11f02f91c6351","observation_id":"fd6f0977-1c6f-4093-a8ea-5d90d224067d","resolution":{"observed_at":"2026-05-10T23:15:48.166522Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-17T08:28:41.290969Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"cited_work":{"arxiv_id":"2509.02981","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.02981","snapshot_observed_at":"2026-07-02T23:47:28.482161Z","title":"Zhang, Y","venue":null,"work_id":"9995c05a-6c9b-4ecb-bcc4-80d76fb6a360","year":2025},"citing_paper":{"arxiv_id":"2604.17423","last_updated":"2026-05-01T14:46:49Z","snapshot_observed_at":"2026-08-15T05:11:08.912410Z","submitted_at":"2026-04-19T13:07:51Z","title":"A unified convergence theory for adaptive first-order methods in the nonconvex case, including AdaNorm, full and diagonal AdaGrad, Shampoo and Muo","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-10T07:19:59.335184Z"},"links":{"cited_paper":"/paper/2509.02981","citing_paper":"/paper/2604.17423"},"observation_digest":"sha256:98ac66bb2efa3c92a045aa0134b53493deeda5eb213763d9e66043e5ccdbd65b","observation_id":"b0b29b19-5f65-409e-971f-16aa5d966827","resolution":{"observed_at":"2026-05-10T07:26:59.872983Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-17T08:28:41.290969Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"cited_work":{"arxiv_id":"2509.02981","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.02981","snapshot_observed_at":"2026-07-02T23:47:28.482161Z","title":"Zhang, Y","venue":null,"work_id":"9995c05a-6c9b-4ecb-bcc4-80d76fb6a360","year":2025},"citing_paper":{"arxiv_id":"2605.06615","last_updated":"2026-05-07T17:32:09Z","snapshot_observed_at":"2026-08-11T12:51:56.931920Z","submitted_at":"2026-05-07T17:32:09Z","title":"When and Why SignSGD Outperforms SGD: A Theoretical Study Based on $\\ell_1$-norm Lower Bounds","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-08T12:14:28.866499Z"},"links":{"cited_paper":"/paper/2509.02981","citing_paper":"/paper/2605.06615"},"observation_digest":"sha256:6fcf7f16891a7532867974399b1a7928ea84e4e7a383586f943a0dbf025b44c1","observation_id":"6f50d3b1-3977-4a91-a665-4f8b875caea9","resolution":{"observed_at":"2026-05-11T19:21:07.613631Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-17T08:28:41.290969Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"cited_work":{"arxiv_id":"2509.02981","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.02981","snapshot_observed_at":"2026-07-02T23:47:28.482161Z","title":"Zhang, Y","venue":null,"work_id":"9995c05a-6c9b-4ecb-bcc4-80d76fb6a360","year":2025},"citing_paper":{"arxiv_id":"2605.11850","last_updated":"2026-05-12T09:36:13Z","snapshot_observed_at":"2026-08-11T10:43:39.565980Z","submitted_at":"2026-05-12T09:36:13Z","title":"Constrained Stochastic Spectral Preconditioning Converges for Nonconvex Objectives","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-13T05:34:48.195468Z"},"links":{"cited_paper":"/paper/2509.02981","citing_paper":"/paper/2605.11850"},"observation_digest":"sha256:d90cec3cd3faac8cc59a0bd29e793c7aeb71b26d7cb5db204a545e479309b5d0","observation_id":"ed0728bf-7b80-471f-9ac7-d8e870a6c70f","resolution":{"observed_at":"2026-05-13T05:37:19.206102Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-17T08:28:41.290969Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"cited_work":{"arxiv_id":"2509.02981","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.02981","snapshot_observed_at":"2026-07-02T23:47:28.482161Z","title":"Zhang, Y","venue":null,"work_id":"9995c05a-6c9b-4ecb-bcc4-80d76fb6a360","year":2025},"citing_paper":{"arxiv_id":"2605.18106","last_updated":"2026-06-22T06:06:33Z","snapshot_observed_at":"2026-08-14T08:05:42.459480Z","submitted_at":"2026-05-18T09:17:26Z","title":"Symmetry-Compatible Principle for Optimizer Design: Embeddings, LM Heads, SwiGLU MLPs, and MoE Routers","version":1},"reference_index":169,"source":"pdf_text","source_observed_at":"2026-05-20T09:34:45.186929Z"},"links":{"cited_paper":"/paper/2509.02981","citing_paper":"/paper/2605.18106"},"observation_digest":"sha256:ab6d29a59f0b884f0d919086038810bf633b0b2d4b3c7137e2f1eaf47838b48f","observation_id":"e98ccdb7-2b2f-4223-8cfa-623898a476a7","resolution":{"observed_at":"2026-05-20T09:38:11.104524Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-17T08:28:41.290969Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"cited_work":{"arxiv_id":"2509.02981","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.02981","snapshot_observed_at":"2026-07-02T23:47:28.482161Z","title":"Zhang, Y","venue":null,"work_id":"9995c05a-6c9b-4ecb-bcc4-80d76fb6a360","year":2025},"citing_paper":{"arxiv_id":"2605.18106","last_updated":"2026-06-22T06:06:33Z","snapshot_observed_at":"2026-08-14T08:05:42.459480Z","submitted_at":"2026-05-18T09:17:26Z","title":"Symmetry-Compatible Principle for Optimizer Design: Embeddings, LM Heads, SwiGLU MLPs, and MoE Routers","version":4},"reference_index":173,"source":"pdf_text","source_observed_at":"2026-06-30T18:42:01.854481Z"},"links":{"cited_paper":"/paper/2509.02981","citing_paper":"/paper/2605.18106"},"observation_digest":"sha256:79613d4b3220fd979c1a6287002beb64dd187965027381624a848b365b0ee086","observation_id":"bc1d7d9b-c1e4-4e90-9bef-dd9f040e430a","resolution":{"observed_at":"2026-06-30T18:45:00.286419Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-17T08:28:41.290969Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"cited_work":{"arxiv_id":"2509.02981","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.02981","snapshot_observed_at":"2026-07-02T23:47:28.482161Z","title":"Zhang, Y","venue":null,"work_id":"9995c05a-6c9b-4ecb-bcc4-80d76fb6a360","year":2025},"citing_paper":{"arxiv_id":"2605.26977","last_updated":"2026-05-26T13:02:49Z","snapshot_observed_at":"2026-08-15T10:11:54.337387Z","submitted_at":"2026-05-26T13:02:49Z","title":"Convergence of Spectral Descent for Non-smooth Optimization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-29T19:30:04.244636Z"},"links":{"cited_paper":"/paper/2509.02981","citing_paper":"/paper/2605.26977"},"observation_digest":"sha256:f6990ce2c52ae560c03eb362f70f538d4404d404ee10c70b5bea91018e74f703","observation_id":"4103e5d2-051a-4811-9fb0-0f87cf3b8bca","resolution":{"observed_at":"2026-06-29T19:33:53.992973Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-17T08:28:41.290969Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"cited_work":{"arxiv_id":"2509.02981","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.02981","snapshot_observed_at":"2026-07-02T23:47:28.482161Z","title":"Zhang, Y","venue":null,"work_id":"9995c05a-6c9b-4ecb-bcc4-80d76fb6a360","year":2025},"citing_paper":{"arxiv_id":"2606.01787","last_updated":"2026-06-01T07:08:32Z","snapshot_observed_at":"2026-08-02T19:16:44.439836Z","submitted_at":"2026-06-01T07:08:32Z","title":"Stochastic convergence of parallel asynchronous adaptive first-order methods","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-28T14:27:48.433313Z"},"links":{"cited_paper":"/paper/2509.02981","citing_paper":"/paper/2606.01787"},"observation_digest":"sha256:84bae407bfff01ef77eba706a7321b7aa4c231465e59c7e3d1e9ce1e6f58d042","observation_id":"d82ffd97-af17-4e69-94f2-0dc282420f62","resolution":{"observed_at":"2026-07-01T23:16:24.936029Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-17T08:28:41.290969Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"cited_work":{"arxiv_id":"2509.02981","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.02981","snapshot_observed_at":"2026-07-02T23:47:28.482161Z","title":"Zhang, Y","venue":null,"work_id":"9995c05a-6c9b-4ecb-bcc4-80d76fb6a360","year":2025},"citing_paper":{"arxiv_id":"2606.08783","last_updated":"2026-06-26T09:55:08Z","snapshot_observed_at":"2026-07-06T23:48:11.819398Z","submitted_at":"2026-06-07T18:59:24Z","title":"OptMuon: Closed-Loop Orthogonalized Momentum Methods for Stochastic Optimization with Zero-Noise Optimality","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-06-27T17:47:21.377462Z"},"links":{"cited_paper":"/paper/2509.02981","citing_paper":"/paper/2606.08783"},"observation_digest":"sha256:d5edface068f22ad3601ac1cf749b7227766dab38fa5560faeed0e12d50dd46d","observation_id":"dab43c79-82ed-4ba4-9a22-fe0bde0473ab","resolution":{"observed_at":"2026-07-02T23:47:28.483723Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-17T08:28:41.290969Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"cited_work":{"arxiv_id":"2509.02981","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.02981","snapshot_observed_at":"2026-07-02T23:47:28.482161Z","title":"Zhang, Y","venue":null,"work_id":"9995c05a-6c9b-4ecb-bcc4-80d76fb6a360","year":2025},"citing_paper":{"arxiv_id":"2606.08783","last_updated":"2026-06-26T09:55:08Z","snapshot_observed_at":"2026-07-06T23:48:11.819398Z","submitted_at":"2026-06-07T18:59:24Z","title":"OptMuon: Closed-Loop Orthogonalized Momentum Methods for Stochastic Optimization with Zero-Noise Optimality","version":2},"reference_index":195,"source":"arxiv_source","source_observed_at":"2026-06-29T05:33:27.870787Z"},"links":{"cited_paper":"/paper/2509.02981","citing_paper":"/paper/2606.08783"},"observation_digest":"sha256:e95134181c6f389f52642a1024880692b2f973ddf2c48b3b1cc9ddc00278e347","observation_id":"48e55a4b-3dbd-4517-b1b2-e9c40e0f19ea","resolution":{"observed_at":"2026-06-29T05:43:08.867247Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-17T08:28:41.290969Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.02981","snapshot_observed_at":"2026-07-11T22:10:49.683444Z","title":"Adagrad meets muon: Adaptive stepsizes for orthogonal updates.arXiv preprint arXiv:2509.02981, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04033","last_updated":"2026-07-04T21:27:05Z","snapshot_observed_at":"2026-08-07T05:07:10.107694Z","submitted_at":"2026-07-04T21:27:05Z","title":"OmniOpt: Taxonomy, Geometry, and Benchmarking of Modern Optimizers","version":1},"reference_index":133,"source":"pdf_text","source_observed_at":"2026-07-11T22:10:49.683444Z"},"links":{"cited_paper":"/paper/2509.02981","citing_paper":"/paper/2607.04033"},"observation_digest":"sha256:1fafb17443a4ca7e319ee0b799b57ff82872196e517b3db90fecb75a9f560c8c","observation_id":"8f607fc3-1577-41df-8aeb-72df68af1289","resolution":{"observed_at":"2026-07-11T22:10:49.683444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-17T08:28:41.290969Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.02981","snapshot_observed_at":"2026-08-02T01:58:58.812108Z","title":"Adagrad meets muon: Adaptive stepsizes for orthogonal updates.arXiv preprint arXiv:2509.02981,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14536","last_updated":"2026-07-16T03:42:21Z","snapshot_observed_at":"2026-08-14T00:59:23.434969Z","submitted_at":"2026-07-16T03:42:21Z","title":"Muse: Representation Geometry of Muon Beyond Normalized Momentum","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T01:58:58.812108Z"},"links":{"cited_paper":"/paper/2509.02981","citing_paper":"/paper/2607.14536"},"observation_digest":"sha256:556bd7e22042da0699b7e1f503a9eb2328a543dabec4fe8526360283d9f38f4c","observation_id":"146bd240-389c-4007-9005-e49d4b5bbaec","resolution":{"observed_at":"2026-08-02T01:58:58.812108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2509.02981/citation-record","integrity":"/paper/2509.02981/integrity","json":"/paper/2509.02981/citation-record.json","paper":"/paper/2509.02981"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:25:44.958820Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-17T08:28:41.290969Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T11:25:44.958820Z"},"links":{"citing_paper":"/paper/2509.02981"},"observation_digest":"sha256:fea5cf4885be07c11a30919c02c52de9117a1ec170e06c9de1dca1d67ed20542","observation_id":"55228883-d60d-4b28-99af-e41cc39ba88f","resolution":{"observed_at":"2026-08-05T11:25:44.958820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:25:45.821583Z","title":"Arjevani, Y","venue":null,"work_id":"d8043a93-ba20-48c7-8122-8f063e84c9b5","year":2023},"citing_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-17T08:28:41.290969Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T11:25:44.962363Z"},"links":{"citing_paper":"/paper/2509.02981"},"observation_digest":"sha256:ab647d23a0bedc4db588fc1ebc7864454021584d1fc67284f8d6af5339bc1dd9","observation_id":"932413bd-43a6-4c71-a84e-1d5998d8bea8","resolution":{"observed_at":"2026-08-05T11:25:45.824727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:25:45.811607Z","title":"Bernstein","venue":null,"work_id":"c5debae7-b0ea-4b58-96e0-67984dc68a99","year":2025},"citing_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-17T08:28:41.290969Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T11:25:44.965832Z"},"links":{"citing_paper":"/paper/2509.02981"},"observation_digest":"sha256:7e5c9128721da8527b5245bd2abf850a73908c616a20d6b16aa822b89c2764bc","observation_id":"3d4cd85a-8500-4f38-b0b2-98ab8d173e44","resolution":{"observed_at":"2026-08-05T11:25:45.814693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.20325","last_updated":"2024-12-06T14:09:22Z","snapshot_observed_at":"2026-08-12T12:26:45.359430Z","submitted_at":"2024-09-30T14:26:12Z","title":"Old Optimizer, New Norm: An Anthology","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.20325","snapshot_observed_at":"2026-08-05T11:25:44.969093Z","title":"Bernstein and L","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-17T08:28:41.290969Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T11:25:44.969093Z"},"links":{"cited_paper":"/paper/2409.20325","citing_paper":"/paper/2509.02981"},"observation_digest":"sha256:c148ac4f0287ee4d186b9d6765bf9fb0e28507f1ed49e7f868a4a3940bf24c95","observation_id":"98caf305-b7df-43f8-8a63-f5e5000050ed","resolution":{"observed_at":"2026-08-05T11:25:44.969093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:25:45.800657Z","title":null,"venue":null,"work_id":"959a1e2d-f41a-4c8a-9f79-e67be51ea0c4","year":2015},"citing_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-17T08:28:41.290969Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T11:25:44.972625Z"},"links":{"citing_paper":"/paper/2509.02981"},"observation_digest":"sha256:8af81be0c1a792d185f0f89295a1a8f7e8ac232725d3ed9cb1011bf0d12a8e4d","observation_id":"470cdbe4-31f9-48d5-8580-f9102fd90435","resolution":{"observed_at":"2026-08-05T11:25:45.804282Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:25:45.789933Z","title":"Carmon, J","venue":null,"work_id":"6f11f71e-2879-4954-83d8-d727e5ca05ed","year":2020},"citing_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-17T08:28:41.290969Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T11:25:44.975773Z"},"links":{"citing_paper":"/paper/2509.02981"},"observation_digest":"sha256:481a16bcb71592c2d94004782642fdfef202ee6011ad55a2ef66eaf57df218ed","observation_id":"9cf5a8a6-542c-4a04-9a2d-32b45a59117d","resolution":{"observed_at":"2026-08-05T11:25:45.793077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:25:44.979371Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-17T08:28:41.290969Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T11:25:44.979371Z"},"links":{"citing_paper":"/paper/2509.02981"},"observation_digest":"sha256:6db969345c846478e17ba94739275b9ac623a7b74c2f69fdb205cd2c12e3986b","observation_id":"451cb1a4-bc9f-4670-ac37-b982642a0bd8","resolution":{"observed_at":"2026-08-05T11:25:44.979371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:25:45.778847Z","title":"Cutkosky and H","venue":null,"work_id":"1385c416-7503-498d-93a8-a8e9370d05f5","year":2020},"citing_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-17T08:28:41.290969Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T11:25:44.982382Z"},"links":{"citing_paper":"/paper/2509.02981"},"observation_digest":"sha256:de0ad457c4cd8b618629c72e2f48c9ef9a5c9c7517b3f6d9d0ef4698ac1b4b27","observation_id":"9038939d-eeab-4981-93bf-2bfe9c9c8eda","resolution":{"observed_at":"2026-08-05T11:25:45.782053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2003.02395","last_updated":"2022-10-17T13:20:40Z","snapshot_observed_at":"2026-08-06T18:53:35.682332Z","submitted_at":"2020-03-05T01:56:17Z","title":"A Simple Convergence Proof of Adam and Adagrad","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.02395","snapshot_observed_at":"2026-08-05T11:25:44.985418Z","title":"D´ efossez, L","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-17T08:28:41.290969Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T11:25:44.985418Z"},"links":{"cited_paper":"/paper/2003.02395","citing_paper":"/paper/2509.02981"},"observation_digest":"sha256:bb0cf36391bfb75fe0ab6334207261a2131bf4fb7736c87793bce56708256ea9","observation_id":"7f41d6dc-93ed-43c9-b1b3-f139ef5955cc","resolution":{"observed_at":"2026-08-05T11:25:44.985418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:25:45.767782Z","title":"Duchi, E","venue":null,"work_id":"b7e9683b-5d84-42f8-9fbd-10f792adaeea","year":2011},"citing_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-17T08:28:41.290969Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T11:25:44.988720Z"},"links":{"citing_paper":"/paper/2509.02981"},"observation_digest":"sha256:77040e0fb08ddb432e4624a54020d5a29bc6298c0b25b2c2af4084e62b989b07","observation_id":"317c9c3b-b84a-4b4e-90e2-4630f2af1af6","resolution":{"observed_at":"2026-08-05T11:25:45.771227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:25:44.991897Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-17T08:28:41.290969Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T11:25:44.991897Z"},"links":{"citing_paper":"/paper/2509.02981"},"observation_digest":"sha256:2146c29209bf082565390e3e267461c54059c96d855800e2d4ca0f42dfd3dee2","observation_id":"3cc3a2c7-db9d-4660-8d21-762ca44dcb30","resolution":{"observed_at":"2026-08-05T11:25:44.991897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:25:45.757115Z","title":null,"venue":null,"work_id":"bb1372c5-e462-44a6-ab6a-1922d50674f1","year":2022},"citing_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-17T08:28:41.290969Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T11:25:44.994885Z"},"links":{"citing_paper":"/paper/2509.02981"},"observation_digest":"sha256:dcfc9b32df7611be7e5cc7ae91262b6afe0d35f8bb897dfc657c594c0e3c26cd","observation_id":"5c186fa8-79f9-4ab8-b0a7-3c48e857bf70","resolution":{"observed_at":"2026-08-05T11:25:45.760388Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:25:45.746254Z","title":"Gupta, T","venue":null,"work_id":"56ebb51a-7039-4d6e-86f7-75fd2819f993","year":2018},"citing_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-17T08:28:41.290969Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T11:25:44.997866Z"},"links":{"citing_paper":"/paper/2509.02981"},"observation_digest":"sha256:a3dc03adeef035854a598a952182a79fa2f84f0fafbf4252c3337a5c97c9e28f","observation_id":"ae365134-7745-4d1d-b093-bd5228c2ee4b","resolution":{"observed_at":"2026-08-05T11:25:45.749838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:25:45.000733Z","title":null,"venue":null,"work_id":null,"year":1986},"citing_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-17T08:28:41.290969Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T11:25:45.000733Z"},"links":{"citing_paper":"/paper/2509.02981"},"observation_digest":"sha256:582ebbcd3c9b4d588515f36107268b704d817cc73a3f6be7f816d45be7a48e02","observation_id":"ebb3e4d2-2544-4082-9cba-df92d13ada89","resolution":{"observed_at":"2026-08-05T11:25:45.000733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:25:45.727400Z","title":"Jordan, Y","venue":null,"work_id":"032de7a7-81cb-464c-b683-92f2a7305361","year":2024},"citing_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-17T08:28:41.290969Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T11:25:45.003704Z"},"links":{"citing_paper":"/paper/2509.02981"},"observation_digest":"sha256:b8963cf6f48635031f0e9117c71778113c6cfdb090982e326c18dcb32c8e6a14","observation_id":"6b42fc69-1414-4047-8ba9-73c6273a0f74","resolution":{"observed_at":"2026-08-05T11:25:45.730644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:25:45.716594Z","title":"Jordan, Y","venue":null,"work_id":"72ab357d-a6c4-4427-8660-8b7285250d96","year":2024},"citing_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-17T08:28:41.290969Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T11:25:45.006637Z"},"links":{"citing_paper":"/paper/2509.02981"},"observation_digest":"sha256:8dbfd304b391e93a7a5a1fe2641688750c2b8938890a75e0f378379496964427","observation_id":"4cf7353b-9d99-4648-8717-f88eaf0387e6","resolution":{"observed_at":"2026-08-05T11:25:45.719994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-17T19:26:44.032537Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-05T11:25:45.009548Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-17T08:28:41.290969Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T11:25:45.009548Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2509.02981"},"observation_digest":"sha256:be923bd99bff5ae1cd4a8aa2db9c67da87101d8a2efd25fc2782d07622bc041e","observation_id":"47772327-da82-4098-b2d0-99eb4f9539a0","resolution":{"observed_at":"2026-08-05T11:25:45.009548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23803","last_updated":"2025-06-30T12:47:10Z","snapshot_observed_at":"2026-08-13T19:01:04.086144Z","submitted_at":"2025-06-30T12:47:10Z","title":"SGD with Adaptive Preconditioning: Unified Analysis and Momentum Acceleration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.23803","snapshot_observed_at":"2026-08-05T11:25:45.012797Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-17T08:28:41.290969Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T11:25:45.012797Z"},"links":{"cited_paper":"/paper/2506.23803","citing_paper":"/paper/2509.02981"},"observation_digest":"sha256:292cb7a68078f281abf2b746d068c654205cb3cfe62693093078c6b5ac7d3682","observation_id":"9dc0d79f-39bd-4637-bbcc-d4781fe1d75c","resolution":{"observed_at":"2026-08-05T11:25:45.012797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12645","last_updated":"2025-04-08T16:47:42Z","snapshot_observed_at":"2026-08-18T11:39:27.990371Z","submitted_at":"2025-03-16T20:49:34Z","title":"Understanding Gradient Orthogonalization for Deep Learning via Non-Euclidean Trust-Region Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12645","snapshot_observed_at":"2026-08-05T11:25:45.016558Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-17T08:28:41.290969Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T11:25:45.016558Z"},"links":{"cited_paper":"/paper/2503.12645","citing_paper":"/paper/2509.02981"},"observation_digest":"sha256:7e98e2f8df0e065280f2bc7cc47de4591f4d37a7b7475f3a138c717ebab183b7","observation_id":"2a56226a-725f-4d22-b5f4-0a573f71370d","resolution":{"observed_at":"2026-08-05T11:25:45.016558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:25:45.019816Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-17T08:28:41.290969Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T11:25:45.019816Z"},"links":{"citing_paper":"/paper/2509.02981"},"observation_digest":"sha256:2bf1967bd8f925cf504bfee0acf3417465ef4b5e02d5f4f2107b8b144f2e992f","observation_id":"c3f6f2e9-119f-4758-ba8a-b248b01f9266","resolution":{"observed_at":"2026-08-05T11:25:45.019816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02900","last_updated":"2025-06-01T18:46:31Z","snapshot_observed_at":"2026-08-09T10:38:54.874245Z","submitted_at":"2025-02-05T05:44:22Z","title":"A Note on the Convergence of Muon","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02900","snapshot_observed_at":"2026-08-05T11:25:45.022770Z","title":"Li and M","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-17T08:28:41.290969Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T11:25:45.022770Z"},"links":{"cited_paper":"/paper/2502.02900","citing_paper":"/paper/2509.02981"},"observation_digest":"sha256:b058b26a578214c8011ce5480a0d8bf4a2916b992abdcf38e58ec3df7ec96981","observation_id":"99f74c96-b6a2-4132-a03b-32b9a53398a6","resolution":{"observed_at":"2026-08-05T11:25:45.022770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:25:45.705883Z","title":"Li and F","venue":null,"work_id":"12360787-1804-46ca-83f2-42d474ee7378","year":2019},"citing_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-17T08:28:41.290969Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T11:25:45.026395Z"},"links":{"citing_paper":"/paper/2509.02981"},"observation_digest":"sha256:94afd4d2e9c6f1f05dfd3a62dc61b84b36913a6f089f033080da1d4f972bf33a","observation_id":"db938f75-4bbe-4141-bd41-fa720d787685","resolution":{"observed_at":"2026-08-05T11:25:45.709299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-16T22:48:15.725816Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T11:25:45.029375Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-17T08:28:41.290969Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T11:25:45.029375Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2509.02981"},"observation_digest":"sha256:5738868e3c70c15bb8b5ef0482dc9aff71eae5380ed75607480221df4b2a136c","observation_id":"3fac7c75-f065-4159-a85f-474f3a8b141d","resolution":{"observed_at":"2026-08-05T11:25:45.029375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:25:45.032619Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-17T08:28:41.290969Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T11:25:45.032619Z"},"links":{"citing_paper":"/paper/2509.02981"},"observation_digest":"sha256:edbe9fae97e4c0807b99da9a4e33e86202b3f08bb058643d5d5ddb0b5cff5948","observation_id":"358c797a-54e0-40d0-a210-2bf71f49bd99","resolution":{"observed_at":"2026-08-05T11:25:45.032619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.05621","last_updated":"2023-08-10T15:10:08Z","snapshot_observed_at":"2026-08-16T16:05:28.745337Z","submitted_at":"2023-08-10T15:10:08Z","title":"Normalized Gradients for All","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.05621","snapshot_observed_at":"2026-08-05T11:25:45.035920Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-17T08:28:41.290969Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T11:25:45.035920Z"},"links":{"cited_paper":"/paper/2308.05621","citing_paper":"/paper/2509.02981"},"observation_digest":"sha256:1eb75cfdeed7ae2684b9f2db34fc2f599dbd12ceb6cfc84e935999b005e786ce","observation_id":"11e49d20-8ae1-448d-863e-01dd7de3ab65","resolution":{"observed_at":"2026-08-05T11:25:45.035920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07529","last_updated":"2025-06-06T13:42:19Z","snapshot_observed_at":"2026-08-16T22:34:28.103547Z","submitted_at":"2025-02-11T13:10:34Z","title":"Training Deep Learning Models with Norm-Constrained LMOs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07529","snapshot_observed_at":"2026-08-05T11:25:45.039083Z","title":"Pethick, W","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-17T08:28:41.290969Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T11:25:45.039083Z"},"links":{"cited_paper":"/paper/2502.07529","citing_paper":"/paper/2509.02981"},"observation_digest":"sha256:9ef8606fa4c556ee48906947c62b1e6258822f577126d3e9b4c97fd0cf8d5b1d","observation_id":"2c29e27d-20b5-49b8-8018-aa827ec51cea","resolution":{"observed_at":"2026-08-05T11:25:45.039083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01598","last_updated":"2026-06-08T02:38:54Z","snapshot_observed_at":"2026-08-16T23:33:31.313167Z","submitted_at":"2025-07-02T11:03:13Z","title":"Convergence Bound and Critical Batch Size of Muon Optimizer","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.01598","snapshot_observed_at":"2026-08-05T11:25:45.042343Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-17T08:28:41.290969Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T11:25:45.042343Z"},"links":{"cited_paper":"/paper/2507.01598","citing_paper":"/paper/2509.02981"},"observation_digest":"sha256:cc476bfc354ec829668ef99603ee420a23e7924ffd896a27fe963b221444a93e","observation_id":"d9dc9d94-6ed4-496f-910e-3bc4e89aeacf","resolution":{"observed_at":"2026-08-05T11:25:45.042343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02222","last_updated":"2025-05-20T01:04:35Z","snapshot_observed_at":"2026-08-17T11:38:13.930266Z","submitted_at":"2025-05-04T19:14:43Z","title":"Practical Efficiency of Muon for Pretraining","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02222","snapshot_observed_at":"2026-08-05T11:25:45.045809Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-17T08:28:41.290969Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T11:25:45.045809Z"},"links":{"cited_paper":"/paper/2505.02222","citing_paper":"/paper/2509.02981"},"observation_digest":"sha256:e3daa056ba7f58590cedda1d4166b0d55917c795a6f8c9497169009d188aba7d","observation_id":"86af1c9f-556c-48ca-943c-896c458b9206","resolution":{"observed_at":"2026-08-05T11:25:45.045809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23737","last_updated":"2026-07-28T01:40:23Z","snapshot_observed_at":"2026-08-17T04:14:11.630903Z","submitted_at":"2025-05-29T17:58:01Z","title":"On the Convergence Analysis of Muon","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23737","snapshot_observed_at":"2026-08-05T11:25:45.048933Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-17T08:28:41.290969Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T11:25:45.048933Z"},"links":{"cited_paper":"/paper/2505.23737","citing_paper":"/paper/2509.02981"},"observation_digest":"sha256:1ec9db17371501db69a7a22f1bd50ff7490f491bbb6b2033fc8845f8784b4c93","observation_id":"c89b774f-4cf3-4d07-9406-092269749fe2","resolution":{"observed_at":"2026-08-05T11:25:45.048933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:25:45.052149Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-17T08:28:41.290969Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T11:25:45.052149Z"},"links":{"citing_paper":"/paper/2509.02981"},"observation_digest":"sha256:5d401fa4daed89457a603ce9a6b4ae6fdfbbc7ca89d6063751eb85cae8ac0586","observation_id":"17927f12-7546-4e0d-a082-f57a71bdea97","resolution":{"observed_at":"2026-08-05T11:25:45.052149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1002.4862","last_updated":"2010-02-25T20:31:05Z","snapshot_observed_at":"2026-08-15T05:25:31.056048Z","submitted_at":"2010-02-25T20:31:05Z","title":"Less Regret via Online Conditioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1002.4862","snapshot_observed_at":"2026-08-05T11:25:45.055019Z","title":"Streeter and H","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-17T08:28:41.290969Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T11:25:45.055019Z"},"links":{"cited_paper":"/paper/1002.4862","citing_paper":"/paper/2509.02981"},"observation_digest":"sha256:13f52f0d55d399942d5d5bc54c40fe2ac765c505acc2496bdbbddde6d8714e58","observation_id":"a67ceb89-d8a0-4b31-97a8-52e5742e30c5","resolution":{"observed_at":"2026-08-05T11:25:45.055019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11321","last_updated":"2025-01-31T18:52:42Z","snapshot_observed_at":"2026-08-15T04:58:58.957938Z","submitted_at":"2024-09-17T16:18:05Z","title":"SOAP: Improving and Stabilizing Shampoo using Adam","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11321","snapshot_observed_at":"2026-08-05T11:25:45.058459Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-17T08:28:41.290969Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T11:25:45.058459Z"},"links":{"cited_paper":"/paper/2409.11321","citing_paper":"/paper/2509.02981"},"observation_digest":"sha256:cb5627c8e4bd77a9542867c758ffc055d940c3d244fdf8bca4d9c9537fb8eff7","observation_id":"45e08aee-5a25-4200-ae20-e33f4c61d9d4","resolution":{"observed_at":"2026-08-05T11:25:45.058459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:25:45.695299Z","title":null,"venue":null,"work_id":"8f799b01-9f5c-4cc3-8289-3127db9e0f1a","year":2023},"citing_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-17T08:28:41.290969Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T11:25:45.061548Z"},"links":{"citing_paper":"/paper/2509.02981"},"observation_digest":"sha256:9579d86e77cf04d8be7fbf54e978977716df34395a0473c43428f6fcabd5d918","observation_id":"0d49f263-a9da-4c28-ad90-c16023b6feee","resolution":{"observed_at":"2026-08-05T11:25:45.698483Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:25:45.064464Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-17T08:28:41.290969Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T11:25:45.064464Z"},"links":{"citing_paper":"/paper/2509.02981"},"observation_digest":"sha256:b8f932721c56a7b06ca57c77dc92da04406e1b7d30bdcabebcb4c5b551b60a8d","observation_id":"370eee7e-1f41-471f-9e03-33d73b41d59f","resolution":{"observed_at":"2026-08-05T11:25:45.064464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10537","last_updated":"2025-07-15T06:22:08Z","snapshot_observed_at":"2026-08-21T19:00:30.713643Z","submitted_at":"2025-03-13T16:51:59Z","title":"Structured Preconditioners in Adaptive Optimization: A Unified Analysis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10537","snapshot_observed_at":"2026-08-05T11:25:45.067509Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-17T08:28:41.290969Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T11:25:45.067509Z"},"links":{"cited_paper":"/paper/2503.10537","citing_paper":"/paper/2509.02981"},"observation_digest":"sha256:d7c8834211bd5843f8555fa23b7dcd7f08e9a71458229710f5b0e3cd11d2d6d9","observation_id":"9f74e983-5f39-4106-b7f8-2cc79cf604ba","resolution":{"observed_at":"2026-08-05T11:25:45.067509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.14940","last_updated":"2025-07-20T12:29:14Z","snapshot_observed_at":"2026-08-18T01:37:55.568877Z","submitted_at":"2025-07-20T12:29:14Z","title":"Sharp perturbation bounds on the Frobenius norm of subunitary and positive polar factor","version":1},"cited_work":{"arxiv_id":"2507.14940","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.14940","snapshot_observed_at":"2026-08-05T11:25:45.116336Z","title":"Sharp perturbation bounds on the Frobenius norm of subunitary and positive polar factor","venue":"math.FA","work_id":"606d6ffe-1440-44d8-831d-8dfab8b1d951","year":2025},"citing_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-17T08:28:41.290969Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T11:25:45.070762Z"},"links":{"cited_paper":"/paper/2507.14940","citing_paper":"/paper/2509.02981"},"observation_digest":"sha256:eeb080e033a6f6340fee39e83f4c9061a6a472b2623c29184e1e2fc5ec79f4e5","observation_id":"38273555-bdb7-4194-acbf-c247a59ad0b0","resolution":{"observed_at":"2026-08-05T11:25:45.121899Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1808.05671","last_updated":"2024-06-20T16:13:13Z","snapshot_observed_at":"2026-08-14T18:40:13.013175Z","submitted_at":"2018-08-16T20:25:28Z","title":"On the Convergence of Adaptive Gradient Methods for Nonconvex Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.05671","snapshot_observed_at":"2026-08-05T11:25:45.073914Z","title":"t−1X τ=0 µτ ˜Et+1−τ ∗ # +µL t−1X τ=0 µτ E[max{ϵ, ηαt−τ }] ≤ µtκ√r√ b + (1−µ) √rE","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-17T08:28:41.290969Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T11:25:45.073914Z"},"links":{"cited_paper":"/paper/1808.05671","citing_paper":"/paper/2509.02981"},"observation_digest":"sha256:deabec4d86ffe8f21fc11bc47d874014e24a3bb8f3f58713d1e3882ba8fe590f","observation_id":"450a164b-d7cd-4752-8a10-00037206b6d5","resolution":{"observed_at":"2026-08-05T11:25:45.073914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-17T08:28:41.290969Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":1,"verified_fuzzy":9},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 14 inbound Pith citation observations for arXiv:2509.02981."}