{"as_of":"2026-08-20T03:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a13e2c83df4dec170175db97da8ce4f0fa1c7745c93d192f4f998b70eb5a6eab","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-20T08:10:14.711735Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T04:19:37.724140Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.19619","snapshot_observed_at":"2026-08-01T21:13:38.712209Z","title":"Jordan, K.; Jin, Y.; Boza, V.; You, J.; Cesista, F.; Newhouse, L.; and Bernstein, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16169","last_updated":"2026-08-02T14:51:38Z","snapshot_observed_at":"2026-08-18T02:02:01.039134Z","submitted_at":"2026-07-17T17:49:05Z","title":"When Does Muon Help Agentic Reinforcement Learning?","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T21:13:38.712209Z"},"links":{"cited_paper":"/paper/2605.19619","citing_paper":"/paper/2607.16169"},"observation_digest":"sha256:26a335abc509eadc148bc135b41651afde14dcc9f755fdc4c017f1f445330c50","observation_id":"e7de550a-ad9b-4509-9823-f6686917e6e7","resolution":{"observed_at":"2026-08-01T21:13:38.712209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.19619","snapshot_observed_at":"2026-08-04T04:19:37.724140Z","title":"Jordan, K.; Jin, Y.; Boza, V.; You, J.; Cesista, F.; Newhouse, L.; and Bernstein, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16169","last_updated":"2026-08-02T14:51:38Z","snapshot_observed_at":"2026-08-18T02:02:01.039134Z","submitted_at":"2026-07-17T17:49:05Z","title":"When Does Muon Help Agentic Reinforcement Learning?","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T04:19:37.724140Z"},"links":{"cited_paper":"/paper/2605.19619","citing_paper":"/paper/2607.16169"},"observation_digest":"sha256:f6928e6bc76d81e4fa2be2114d2417f34a17b56ae7e95d3ddc37a2ae7c0926cc","observation_id":"480bcf6f-b36b-4529-b349-a8c5530ef28b","resolution":{"observed_at":"2026-08-04T04:19:37.724140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.19619/citation-record","integrity":"/paper/2605.19619/integrity","json":"/paper/2605.19619/citation-record.json","paper":"/paper/2605.19619"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SIAM","venue":null,"work_id":"575a07c2-f51e-4b11-8d14-61ae40be0d89","year":2017},"citing_paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-20T08:10:14.711735Z"},"links":{"citing_paper":"/paper/2605.19619"},"observation_digest":"sha256:59fe9f5b740e5c9a4a9776b6978f63a19be19a30a713b29c704386f2f51226da","observation_id":"29e4659d-ca7a-4b95-8fa2-0f212eb30ae4","resolution":{"observed_at":"2026-05-20T08:13:24.842739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.20325","last_updated":"2024-12-06T14:09:22Z","snapshot_observed_at":"2026-08-12T12:26:45.359430Z","submitted_at":"2024-09-30T14:26:12Z","title":"Old Optimizer, New Norm: An Anthology","version":2},"cited_work":{"arxiv_id":"2409.20325","doi":"10.48550/arxiv.2409.20325","metadata_source":"pith","pith_arxiv_id":"2409.20325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Old Optimizer, New Norm: An Anthology","venue":"cs.LG","work_id":"c0089db6-7349-44fd-b103-0d7b36142bab","year":2024},"citing_paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-20T08:10:14.711735Z"},"links":{"cited_paper":"/paper/2409.20325","citing_paper":"/paper/2605.19619"},"observation_digest":"sha256:0126dcdcd9d43b63dd430fab608e6553551a4ed7a88c468319483cdab618f5fe","observation_id":"9e0f1fe8-18a4-4f45-96f5-e968fd446dfe","resolution":{"observed_at":"2026-05-20T08:13:08.260499Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Optimization methods for large-scale machine learning.SIAM review, 60(2):223–311","venue":null,"work_id":"2925d763-7c3a-42ee-8d5c-896e8fa36266","year":2018},"citing_paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-20T08:10:14.711735Z"},"links":{"citing_paper":"/paper/2605.19619"},"observation_digest":"sha256:6bcdd7eba5ea9451c5e1d0905cebc9eee4674352889e986149dccf9ca5422722","observation_id":"e6c8271c-ccf0-4c31-aee0-a2bfd1ddac67","resolution":{"observed_at":"2026-05-20T08:13:24.865568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.15816","last_updated":"2026-05-10T06:58:46Z","snapshot_observed_at":"2026-08-18T20:56:42.898921Z","submitted_at":"2025-09-19T09:43:37Z","title":"On the Convergence of Muon and Beyond","version":5},"cited_work":{"arxiv_id":"2509.15816","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.15816","snapshot_observed_at":"2026-07-04T07:29:38.596450Z","title":"On the Convergence of Muon and Beyond","venue":"cs.LG","work_id":"4a43859c-1056-4934-bc0b-1d3e33bbc5b0","year":2025},"citing_paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-20T08:10:14.711735Z"},"links":{"cited_paper":"/paper/2509.15816","citing_paper":"/paper/2605.19619"},"observation_digest":"sha256:c043f223ae47ca894e32234a9f77c86580bec03941905a536a7776cacdd81d98","observation_id":"3f5f8f4b-4061-41bf-86b8-fe023b42d8e6","resolution":{"observed_at":"2026-05-20T08:13:08.263494Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Symbolic discovery of optimization algorithms","venue":null,"work_id":"18e96fc3-3894-4643-963c-5f7bf5679191","year":2023},"citing_paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-20T08:10:14.711735Z"},"links":{"citing_paper":"/paper/2605.19619"},"observation_digest":"sha256:94075e02f41265a2b0cd692265cb97d019ef9a50cc09cba5aa6331cb56f2ceda","observation_id":"2dffdd8b-bc04-4d98-abf3-dc0db2a50054","resolution":{"observed_at":"2026-05-20T08:13:24.876384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.00742","last_updated":"2026-06-29T14:07:01Z","snapshot_observed_at":"2026-08-14T11:57:16.637647Z","submitted_at":"2026-02-28T17:37:15Z","title":"To Use or not to Use Muon: How Simplicity Bias in Optimizers Matters","version":2},"cited_work":{"arxiv_id":"2603.00742","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.00742","snapshot_observed_at":"2026-07-03T00:27:30.119812Z","title":"To use or not to use muon: How simplicity bias in optimizers matters","venue":"cs.LG","work_id":"6cd8d5da-36e4-4803-8fa3-8a1d50875091","year":2026},"citing_paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-20T08:10:14.711735Z"},"links":{"cited_paper":"/paper/2603.00742","citing_paper":"/paper/2605.19619"},"observation_digest":"sha256:0379df248c9165b4eabda56b12518fa6098bddd9f8b417b0ac324f77a14db0f4","observation_id":"d39fbfda-e927-44e0-8779-953b4bfeb699","resolution":{"observed_at":"2026-06-30T03:18:06.554181Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Combining axes precondi- tioners through kronecker approximation for deep learning","venue":null,"work_id":"ba66760c-1e9a-44ae-9b8a-37f4812bf83a","year":2024},"citing_paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-20T08:10:14.711735Z"},"links":{"citing_paper":"/paper/2605.19619"},"observation_digest":"sha256:239c4213af3a22155a403984060959ebd978d88f4da54983f433348ded357118","observation_id":"3b3e3e53-423b-423b-a7e5-7ddacf91d1fc","resolution":{"observed_at":"2026-05-20T08:13:24.850530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Shampoo: Preconditioned stochastic tensor optimization","venue":null,"work_id":"6aae5137-dc4d-422b-9126-cc1945364764","year":2018},"citing_paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-20T08:10:14.711735Z"},"links":{"citing_paper":"/paper/2605.19619"},"observation_digest":"sha256:4140e6fe91b154780c2a0d7c35252b80cb06b78df1efe2b017b932163fd9e2f7","observation_id":"53c48c25-8f64-4b10-a3e5-0979bb03224d","resolution":{"observed_at":"2026-05-20T08:13:24.853947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Trainfaster,generalizebetter: Stabilityofstochasticgradientdescent","venue":null,"work_id":"c203fd1e-1952-4a86-a1cd-8e9fd22ddcd4","year":2016},"citing_paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-20T08:10:14.711735Z"},"links":{"citing_paper":"/paper/2605.19619"},"observation_digest":"sha256:5d191686f131f266ab1ba3ede88031a718de7a49aca5fc1e9fecf05db7316435","observation_id":"45b08244-b4ed-4b46-b466-5c88cf28e743","resolution":{"observed_at":"2026-05-20T08:13:24.853728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Variance-reduced and projection-free stochastic optimization","venue":null,"work_id":"c834df41-fabb-4583-a1eb-4aca15f60a14","year":2016},"citing_paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-20T08:10:14.711735Z"},"links":{"citing_paper":"/paper/2605.19619"},"observation_digest":"sha256:1e995fae7ee517c34356eb615cf60809e7efe31404b560fda0c1c4726754915c","observation_id":"82874cdc-20ce-45d2-82fc-df4f5ef33ab2","resolution":{"observed_at":"2026-05-20T08:13:24.832148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.11983","last_updated":"2026-04-19T16:56:37Z","snapshot_observed_at":"2026-08-13T05:15:24.130541Z","submitted_at":"2025-09-15T14:28:53Z","title":"Low-rank Orthogonalization for Large-scale Matrix Optimization with Applications to Foundation Model Training","version":2},"cited_work":{"arxiv_id":"2509.11983","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.11983","snapshot_observed_at":"2026-07-04T07:29:38.557965Z","title":"Low-rank Orthogonalization for Large-scale Matrix Optimization with Applications to Foundation Model Training","venue":"cs.LG","work_id":"837753d0-a1f6-45b8-92f2-d83dfcc7f9ed","year":2025},"citing_paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-20T08:10:14.711735Z"},"links":{"cited_paper":"/paper/2509.11983","citing_paper":"/paper/2605.19619"},"observation_digest":"sha256:408280e0ce1099bae00688cacf6bdf9b82bd50d068dbc67d9adb0836fb9d45c6","observation_id":"0c05e2db-2d5e-4018-9d94-75dc16ace877","resolution":{"observed_at":"2026-05-20T08:13:08.314267Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.14562","last_updated":"2026-07-24T13:07:17Z","snapshot_observed_at":"2026-08-16T22:35:10.348502Z","submitted_at":"2025-09-18T02:49:27Z","title":"LiMuon: Light and Fast Muon Optimizer for Large Models","version":5},"cited_work":{"arxiv_id":"2509.14562","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.14562","snapshot_observed_at":"2026-07-04T07:29:38.590843Z","title":"Huang, Y","venue":"cs.LG","work_id":"8d242626-c2ae-4a0d-b443-bbb01cc766ed","year":2025},"citing_paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-20T08:10:14.711735Z"},"links":{"cited_paper":"/paper/2509.14562","citing_paper":"/paper/2605.19619"},"observation_digest":"sha256:24a4c6143b3f5e0e3db287182cb4ab55f85a5e60a499cbf216f1e65429b52588","observation_id":"0f29fe57-6b63-479a-8779-8821bcf5f848","resolution":{"observed_at":"2026-06-01T02:02:18.613734Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Muon: An optimizer for hidden layers in neural networks.URL https://kellerjordan","venue":null,"work_id":"25f73f9a-ec88-4c45-8a4c-8aa491b79a7f","year":2024},"citing_paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-20T08:10:14.711735Z"},"links":{"citing_paper":"/paper/2605.19619"},"observation_digest":"sha256:dde8a9ab7e80723c8be3e2cf8fd3c37b57de530c86de3e992a7371d6e0b6b0a9","observation_id":"e7fad70b-c5b6-4117-aa24-4d1886edd039","resolution":{"observed_at":"2026-05-20T08:13:24.847105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.19156","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T06:29:38.158764Z","title":"Convergence of muon with newton-schulz","venue":null,"work_id":"2f290040-1932-48e9-8781-4d40f61448f1","year":2026},"citing_paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-20T08:10:14.711735Z"},"links":{"citing_paper":"/paper/2605.19619"},"observation_digest":"sha256:aee27de97bc73990e4e6b245c8600d23fde208d03350d0d10a727256f43dc399","observation_id":"1ca2b02e-d262-4591-817e-d13fbbed18d8","resolution":{"observed_at":"2026-05-20T08:13:08.326652Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-17T19:26:44.032537Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":"1412.6980","doi":"10.1002/mrm.28086","metadata_source":"pith","pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Adam: A Method for Stochastic Optimization","venue":"cs.LG","work_id":"1910796d-9b52-4683-bf5c-de9632c1028b","year":2014},"citing_paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-20T08:10:14.711735Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2605.19619"},"observation_digest":"sha256:bfb49bf4fe382444b64229d36b5dab18885ba7201c4d94d80bd72c13331f6adc","observation_id":"a4872cac-673e-4c5b-83c4-08d1716e881f","resolution":{"observed_at":"2026-05-20T08:13:08.329300Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12645","last_updated":"2025-04-08T16:47:42Z","snapshot_observed_at":"2026-08-18T11:39:27.990371Z","submitted_at":"2025-03-16T20:49:34Z","title":"Understanding Gradient Orthogonalization for Deep Learning via Non-Euclidean Trust-Region Optimization","version":2},"cited_work":{"arxiv_id":"2503.12645","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.12645","snapshot_observed_at":"2026-07-04T07:29:38.574824Z","title":"arXiv preprint arXiv:2503.12645 , year=","venue":null,"work_id":"fe62cb1b-f9dc-4379-8586-5c2f591ba7e5","year":2025},"citing_paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-20T08:10:14.711735Z"},"links":{"cited_paper":"/paper/2503.12645","citing_paper":"/paper/2605.19619"},"observation_digest":"sha256:d4d694af87f2e312746afcc8db15657c430e3eeca6610efe1d0a43c15ebdf394","observation_id":"e5bdcb5e-c7a0-4ad1-9652-0246994ced76","resolution":{"observed_at":"2026-05-20T08:13:08.332905Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Imagenet classification with deep convolutional neural networks.Communications of the ACM, 60(6):84–90","venue":null,"work_id":"f0e00718-29e2-4645-8a9f-d38737a6f4cf","year":2017},"citing_paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-20T08:10:14.711735Z"},"links":{"citing_paper":"/paper/2605.19619"},"observation_digest":"sha256:35a66bb07735f686bcf207d6c2605568264b7365fe170e0394a1e8aa9201fe19","observation_id":"359ddfdb-a869-4929-a407-f12365b40b55","resolution":{"observed_at":"2026-05-20T08:13:24.843826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.17155","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T15:37:05.748310Z","title":"arXiv preprint arXiv:2602.17155 , year=","venue":null,"work_id":"1df1b796-c9ea-4b58-b17c-8f31c1b5c547","year":2026},"citing_paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-20T08:10:14.711735Z"},"links":{"citing_paper":"/paper/2605.19619"},"observation_digest":"sha256:2e4fb635651fa86ea65b6a476a72ed1a97e5a7a175d3e4ea071484afd552766d","observation_id":"ff660517-b6cf-42a8-9ee6-9596fbf743a8","resolution":{"observed_at":"2026-05-20T08:13:08.320442Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Stability and generalization of stochastic optimization with nonconvex and nonsmooth problems","venue":null,"work_id":"9bda2949-8dac-4e44-b12f-2455ce3a1c28","year":2023},"citing_paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-20T08:10:14.711735Z"},"links":{"citing_paper":"/paper/2605.19619"},"observation_digest":"sha256:0567c82fae112be32cfc5a26d254439a63a7eedd84c4a23ac9d8e4bd31373cb3","observation_id":"8372ee1a-e25c-4766-b828-08256756f8e2","resolution":{"observed_at":"2026-05-20T08:13:24.860032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fine-grainedanalysisofstabilityandgeneralizationforstochasticgradientdescent","venue":null,"work_id":"6963a635-0b62-402e-9dbe-52d49a10dd13","year":2020},"citing_paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-20T08:10:14.711735Z"},"links":{"citing_paper":"/paper/2605.19619"},"observation_digest":"sha256:60ff05f74cee4079295a4890806e13468be3b45b6bb53a4fea46fbc5c0242067","observation_id":"0577ffeb-98ea-4f82-8d82-b19c0ea44193","resolution":{"observed_at":"2026-05-20T08:13:24.868003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02900","last_updated":"2025-06-01T18:46:31Z","snapshot_observed_at":"2026-08-09T10:38:54.874245Z","submitted_at":"2025-02-05T05:44:22Z","title":"A Note on the Convergence of Muon","version":2},"cited_work":{"arxiv_id":"2502.02900","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.02900","snapshot_observed_at":"2026-07-01T14:55:48.649763Z","title":"Li and M","venue":null,"work_id":"be3f1424-323d-44e4-9ebc-c38289176866","year":2025},"citing_paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-20T08:10:14.711735Z"},"links":{"cited_paper":"/paper/2502.02900","citing_paper":"/paper/2605.19619"},"observation_digest":"sha256:79e8f2f50830993b022986e2b2208ad9b2ba98b2aee014ec9b6cc6c9ca0c7272","observation_id":"c707ac7f-1707-4829-b40b-80accbec84ce","resolution":{"observed_at":"2026-05-20T08:13:08.311412Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-16T22:48:15.725816Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-20T08:10:14.711735Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2605.19619"},"observation_digest":"sha256:c79817abc3b7f343e9212629f5aa8384126dc126d29f45a3e4a14bfa25fc64f0","observation_id":"7e5e0ac7-5f69-452b-b20c-7eea6194db59","resolution":{"observed_at":"2026-05-20T08:13:08.317153Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.21800","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T18:45:00.331118Z","title":"Mars-m: When variance reduction meets matrices","venue":null,"work_id":"de336b48-579a-4978-9675-ba8ad53169d8","year":2025},"citing_paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-20T08:10:14.711735Z"},"links":{"citing_paper":"/paper/2605.19619"},"observation_digest":"sha256:2678b2a475aa5488f89afdd605824895dd7faa10f336960373df33096a7bda03","observation_id":"87f06778-4073-42dc-9f80-495df0fcf78a","resolution":{"observed_at":"2026-05-20T08:13:08.323747Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":"1711.05101","doi":"10.1137/1.9781611972825.47","metadata_source":"pith","pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Decoupled Weight Decay Regularization","venue":"cs.LG","work_id":"07ef7360-d385-4033-83f7-8384a6325204","year":2017},"citing_paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-20T08:10:14.711735Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2605.19619"},"observation_digest":"sha256:6f270e593ae1dbf0a6fccd6d662c6ffcf88d3fb7ea63a6522c46fc08bf600ddc","observation_id":"703c1601-ec4b-4212-970a-60548504c453","resolution":{"observed_at":"2026-05-20T08:13:08.335795Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.13474","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T06:29:38.166830Z","title":"Charles H Martin and Christopher Hinrichs","venue":null,"work_id":"c78cf2a1-55f8-45ba-8922-f30f990616be","year":2026},"citing_paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-20T08:10:14.711735Z"},"links":{"citing_paper":"/paper/2605.19619"},"observation_digest":"sha256:af97d9938292d66987836ad2812cb190d159183333f4307d5271dde549fb1779","observation_id":"bc4f9095-d838-4956-a4ad-1ee6682b71e8","resolution":{"observed_at":"2026-05-20T08:13:08.304003Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07529","last_updated":"2025-06-06T13:42:19Z","snapshot_observed_at":"2026-08-16T22:34:28.103547Z","submitted_at":"2025-02-11T13:10:34Z","title":"Training Deep Learning Models with Norm-Constrained LMOs","version":2},"cited_work":{"arxiv_id":"2502.07529","doi":"10.48550/arxiv.2502.07529","metadata_source":"pith","pith_arxiv_id":"2502.07529","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Training Deep Learning Models with Norm-Constrained LMOs","venue":"cs.LG","work_id":"4f1b774a-8ada-4d79-a90b-520511fce5d0","year":2025},"citing_paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-20T08:10:14.711735Z"},"links":{"cited_paper":"/paper/2502.07529","citing_paper":"/paper/2605.19619"},"observation_digest":"sha256:6a6ab7ebcbd0e05603222e3ef71b734d2e4a1c9d5a6813b460e72fa34ef0880b","observation_id":"90f930fd-0532-4e7a-a872-0ca1648d556e","resolution":{"observed_at":"2026-05-21T21:22:37.653978Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.01913","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2506.01913 (2025)","venue":null,"work_id":"057cb508-3699-43d9-8723-0fbd5d1fc0c9","year":2025},"citing_paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-20T08:10:14.711735Z"},"links":{"citing_paper":"/paper/2605.19619"},"observation_digest":"sha256:f67a2fe8bdf8836e60670eef605d3a2c7797333b4c8ffded1f120de90f3bce36","observation_id":"4ae2af87-42de-4908-ace7-25402a579c69","resolution":{"observed_at":"2026-05-20T08:13:08.296247Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.16598","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T07:29:38.572251Z","title":"Muon is provably faster with momentum variance reduction","venue":null,"work_id":"37153aaa-19e8-485a-a601-5824a36737ce","year":2025},"citing_paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-20T08:10:14.711735Z"},"links":{"citing_paper":"/paper/2605.19619"},"observation_digest":"sha256:2d10245d699a23a5a052e92dcd15a68213be535037eca8dbbd0a89529cd52bfb","observation_id":"f1bc9b73-db33-4f91-b28d-5277c38fbb71","resolution":{"observed_at":"2026-05-20T08:13:08.288942Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On the gener- alization of stochastic gradient descent with momentum.Journal of Machine Learning Research, 25(22):1–56","venue":null,"work_id":"c52849bb-e40e-4827-bf0e-04cf24785d39","year":2024},"citing_paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-20T08:10:14.711735Z"},"links":{"citing_paper":"/paper/2605.19619"},"observation_digest":"sha256:9501cbaf0088a55bcf290403d7849a3346f9137452f8a5cc32125fa52aecc712","observation_id":"20cddf3c-2cc1-4687-8ae2-39c328c1fa4c","resolution":{"observed_at":"2026-05-20T08:13:24.865973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.24749","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sumo: Subspace-aware moment- orthogonalization for accelerating memory-efficient llm training","venue":null,"work_id":"a9f97689-cda1-4b3e-b2be-f9d9d6ab5a8f","year":2025},"citing_paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-20T08:10:14.711735Z"},"links":{"citing_paper":"/paper/2605.19619"},"observation_digest":"sha256:df1d3d14c92d28da3bca5aed6629c16514d5bd4272a24f6de10e95f2a02c8623","observation_id":"c5846eea-cb46-4c82-bf10-5b95795708ec","resolution":{"observed_at":"2026-05-20T08:13:08.292289Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13416","last_updated":"2025-05-19T17:50:45Z","snapshot_observed_at":"2026-08-17T21:25:27.735163Z","submitted_at":"2025-05-19T17:50:45Z","title":"Gluon: Making Muon & Scion Great Again! (Bridging Theory and Practice of LMO-based Optimizers for LLMs)","version":1},"cited_work":{"arxiv_id":"2505.13416","doi":"10.48550/arxiv.2505.13416","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.13416","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gluon: Making muon & scion great again! (bridging theory and practice of lmo-based optimizers for llms).arXiv preprint arXiv:2505.13416","venue":"ArXiv.org","work_id":"2c6f1a84-0bed-4e77-b4e0-760a8296a5c9","year":2025},"citing_paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-20T08:10:14.711735Z"},"links":{"cited_paper":"/paper/2505.13416","citing_paper":"/paper/2605.19619"},"observation_digest":"sha256:f7fc0ff94b6472e0ea1d87327dafdcc45da6f017553894ad74140a7362cb1a61","observation_id":"66c05d6b-7ffb-47a8-9121-8ac607731255","resolution":{"observed_at":"2026-05-20T08:13:08.300435Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A stochastic approximation method.The annals of mathematical statistics, pages 400–407","venue":null,"work_id":"41262d21-f032-41aa-8487-97811652c93a","year":1951},"citing_paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-20T08:10:14.711735Z"},"links":{"citing_paper":"/paper/2605.19619"},"observation_digest":"sha256:b1550555897e4e5c7acfd642f4df1079490c91627d5f72f325cfd670c8e3b4a4","observation_id":"e7922a00-ffb3-4f26-987b-84805401ee22","resolution":{"observed_at":"2026-05-20T08:13:24.871133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.25164","doi":"10.48550/arxiv.2509.25164","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Yolo26: Key architectural enhancements and performance bench- marking for real-time object detection","venue":"Open MIND","work_id":"d7d3b2c6-bdeb-4143-b9c1-15ee21c8a254","year":2025},"citing_paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-20T08:10:14.711735Z"},"links":{"citing_paper":"/paper/2605.19619"},"observation_digest":"sha256:8a8c30151751a5ca49d9b6ac589057f7a6f775839f4a396e0896559012a25ba8","observation_id":"10f0c8a5-014f-484e-b69a-7ed177258383","resolution":{"observed_at":"2026-05-20T08:13:08.282484Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-07-16T22:51:55.558502+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-16T22:51:55.558502+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04192","last_updated":"2026-07-24T19:09:15Z","snapshot_observed_at":"2026-08-15T12:46:58.369811Z","submitted_at":"2025-06-04T17:39:03Z","title":"Lions and Muons: Optimization via Stochastic Frank-Wolfe under Heavy-Tailed Noise","version":3},"cited_work":{"arxiv_id":"2506.04192","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.04192","snapshot_observed_at":"2026-07-28T01:21:32.152085Z","title":"Lionsandmuons: Optimizationviastochasticfrank-wolfe.arXivpreprint","venue":null,"work_id":"e3ffc6e0-4027-4843-89b2-9027a609d6ea","year":2025},"citing_paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-20T08:10:14.711735Z"},"links":{"cited_paper":"/paper/2506.04192","citing_paper":"/paper/2605.19619"},"observation_digest":"sha256:f0d9d4459717ec7a541d85ec2a9e9334d1b42a51ba82c50bb6a3f466ebf02812","observation_id":"bc2425e5-1e27-4a6a-9a0e-9887c8b8e84a","resolution":{"observed_at":"2026-07-28T01:21:32.152085Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learnability, stability and uniform convergence.The Journal of Machine Learning Research, 11:2635–2670","venue":null,"work_id":"cb8d3c94-4c98-4d6a-8c3e-6c576f670653","year":2010},"citing_paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-20T08:10:14.711735Z"},"links":{"citing_paper":"/paper/2605.19619"},"observation_digest":"sha256:48f178a732bfd2c512947ba63976f360ede14a7e1799e61529f22f1959f593fa","observation_id":"b731ffab-e136-4ad3-9687-b9caeb8714b3","resolution":{"observed_at":"2026-05-20T08:13:24.862172Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23737","last_updated":"2026-07-28T01:40:23Z","snapshot_observed_at":"2026-08-17T04:14:11.630903Z","submitted_at":"2025-05-29T17:58:01Z","title":"On the Convergence Analysis of Muon","version":3},"cited_work":{"arxiv_id":"2505.23737","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.23737","snapshot_observed_at":"2026-07-04T18:40:03.190709Z","title":"On the Convergence Analysis of Muon","venue":"stat.ML","work_id":"fe8817f3-ca08-4ed5-a8fd-c2bfdaf1a459","year":2025},"citing_paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-20T08:10:14.711735Z"},"links":{"cited_paper":"/paper/2505.23737","citing_paper":"/paper/2605.19619"},"observation_digest":"sha256:845423fe4dfef944b46e3784436191c225deaeddbbce20d911c8586e8a359aa0","observation_id":"7d5818ff-b8a7-4cc7-b377-e88ce7c4f8db","resolution":{"observed_at":"2026-05-20T08:13:08.275659Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.00674","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T06:29:38.165345Z","title":"ArXiv Preprint: 2511.00674 , Year =","venue":null,"work_id":"5e0fa664-f7a6-4ce3-934b-dd6d242ac7c6","year":2025},"citing_paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-20T08:10:14.711735Z"},"links":{"citing_paper":"/paper/2605.19619"},"observation_digest":"sha256:33073f6f147692a263446fcc88a53116079fdbdfc81052f205e85b075463f57f","observation_id":"97cd6aae-58ab-4769-8f50-0209e025a0d1","resolution":{"observed_at":"2026-05-20T08:13:08.279033Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On the importance of initialization and momentum in deep learning","venue":null,"work_id":"74c63dcf-30ae-4182-bc38-c266887769c0","year":2013},"citing_paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-20T08:10:14.711735Z"},"links":{"citing_paper":"/paper/2605.19619"},"observation_digest":"sha256:22fdd3b8508eb4cc947cebe8eed6980057a0546887a60d223b8251a66364828a","observation_id":"52afabd6-c6f6-4945-8ffd-b1c186882b94","resolution":{"observed_at":"2026-05-20T08:13:24.826636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T16:16:21.111301Z","title":"Qwen3 technical report","venue":null,"work_id":"d95873d5-9f2e-4813-aee5-72264f679d9c","year":2025},"citing_paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-20T08:10:14.711735Z"},"links":{"citing_paper":"/paper/2605.19619"},"observation_digest":"sha256:e44c6ff930cc82d94deb15d67d0ab0ff83ccc2fab50ee69ec58c5ef3ac1cc4b3","observation_id":"4d6629f2-cbaa-496f-9f65-4068e0ee4718","resolution":{"observed_at":"2026-05-20T08:13:24.879436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On generalization of spectral gradient descent: A case study on imbalanced data","venue":null,"work_id":"ae2c59fa-6c6c-4675-b484-ac07481cdfc4","year":2025},"citing_paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-20T08:10:14.711735Z"},"links":{"citing_paper":"/paper/2605.19619"},"observation_digest":"sha256:bc713fb5b986c2f047371951f8bcd3e1be4f32fc01347490192803c809f0687d","observation_id":"afc05cc5-941a-4ac4-ae45-b99e3a68dc92","resolution":{"observed_at":"2026-05-20T08:13:24.859455Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T15:47:23.567466Z","title":"Attention is all you need.Advances in neural information processing systems, 30","venue":null,"work_id":"751efe07-5e91-415c-b3d1-f4734aa26960","year":2017},"citing_paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-20T08:10:14.711735Z"},"links":{"citing_paper":"/paper/2605.19619"},"observation_digest":"sha256:049477dcc48d3fe7870f411d92d036c3a879b54a150d6b489c0b9590c59c6358","observation_id":"ad2cc4d3-cf6c-42e6-a0e9-394152973a61","resolution":{"observed_at":"2026-05-20T08:13:24.835563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.07425","last_updated":"2026-05-08T15:36:59Z","snapshot_observed_at":"2026-07-06T22:44:56.252955Z","submitted_at":"2026-02-07T07:47:14Z","title":"Sign-Based Optimizers Are Effective Under Heavy-Tailed Noise","version":2},"cited_work":{"arxiv_id":"2602.07425","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.07425","snapshot_observed_at":"2026-07-03T03:27:35.760207Z","title":"Sign-Based Optimizers Are Effective Under Heavy-Tailed Noise","venue":"cs.LG","work_id":"70c90fb5-976f-4771-8045-e810d6c5cc12","year":2026},"citing_paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-20T08:10:14.711735Z"},"links":{"cited_paper":"/paper/2602.07425","citing_paper":"/paper/2605.19619"},"observation_digest":"sha256:5c986998d4b9282d2ad190eb8d433e7d0b90bbd04f59878a3bbe182da1c97faa","observation_id":"269e7726-0e5d-42e7-b26d-39531eb72668","resolution":{"observed_at":"2026-05-20T08:13:08.272996Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A useful variant of the davis–kahan theorem for statisticians","venue":null,"work_id":"c1302e49-bc81-4da1-8a67-c8e296e0ec6e","year":2015},"citing_paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-20T08:10:14.711735Z"},"links":{"citing_paper":"/paper/2605.19619"},"observation_digest":"sha256:6b5c723ad4d6840cae21430c99a4cb98eca60917909a12cb049bfb95b89dc6d6","observation_id":"639ad069-f14b-4806-820e-dbdd88484d83","resolution":{"observed_at":"2026-05-20T08:13:24.873896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cambridge University Press","venue":null,"work_id":"b3bec7ef-2113-49c5-98aa-a4a076a54335","year":2023},"citing_paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-20T08:10:14.711735Z"},"links":{"citing_paper":"/paper/2605.19619"},"observation_digest":"sha256:b004d0ffea82c03b9dd578d46db936ac37c0a68c27f7a86e33030db9c420043e","observation_id":"c03b6f8d-ab4d-4adf-a0b4-9a15bf5af4de","resolution":{"observed_at":"2026-05-20T08:13:24.856417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":0,"verified_exact":20,"verified_fuzzy":20},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 2 inbound Pith citation observations for arXiv:2605.19619."}