{"as_of":"2026-08-17T16:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6fa8bbfaaa00a8ae802c5b5a6d75c4dd0ece2015dc5d362c350cb17fe603b5c6","coverage":[{"denominator":30,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:50:30.649181Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T09:38:48.446865Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.12543","last_updated":"2025-06-14T15:37:31Z","snapshot_observed_at":"2026-08-17T11:52:29.103954Z","submitted_at":"2025-06-14T15:37:31Z","title":"Is your batch size the problem? Revisiting the Adam-SGD gap in language modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.12543","snapshot_observed_at":"2026-08-04T09:38:48.446865Z","title":"Is your batch size the problem? revisiting the adam-sgd gap in language modeling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.14717","last_updated":"2026-07-27T17:12:10Z","snapshot_observed_at":"2026-08-15T03:52:36.821423Z","submitted_at":"2025-10-16T14:17:38Z","title":"Seesaw: Accelerating Training by Balancing Learning Rate and Batch Size Scheduling","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-04T09:38:48.446865Z"},"links":{"cited_paper":"/paper/2506.12543","citing_paper":"/paper/2510.14717"},"observation_digest":"sha256:cf897411e482f143370a333530864dfc257ed256f6e6808532db3b52f11eeb8f","observation_id":"34bb4621-ccf2-4792-bf5c-1e3ccfebbc71","resolution":{"observed_at":"2026-08-04T09:38:48.446865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.12543","last_updated":"2025-06-14T15:37:31Z","snapshot_observed_at":"2026-08-17T11:52:29.103954Z","submitted_at":"2025-06-14T15:37:31Z","title":"Is your batch size the problem? Revisiting the Adam-SGD gap in language modeling","version":1},"cited_work":{"arxiv_id":"2506.12543","doi":"10.48550/arxiv.2506.12543","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.12543","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Is your batch size the problem? revisiting the adam-sgd gap in language modeling","venue":"ArXiv.org","work_id":"cab94819-0edb-417c-9a11-971473b0d098","year":2025},"citing_paper":{"arxiv_id":"2605.14200","last_updated":"2026-05-13T23:32:00Z","snapshot_observed_at":"2026-07-06T23:25:39.415637Z","submitted_at":"2026-05-13T23:32:00Z","title":"How to Scale Mixture-of-Experts: From muP to the Maximally Scale-Stable Parameterization","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-05-15T04:45:20.091598Z"},"links":{"cited_paper":"/paper/2506.12543","citing_paper":"/paper/2605.14200"},"observation_digest":"sha256:3b4dfab3fe01c010f10305e3f2a9edab638ff1b80a401b46b6f80377d96aff0e","observation_id":"0d414ffe-531d-4c19-a57a-892ac77a246f","resolution":{"observed_at":"2026-05-15T04:49:44.656518Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.12543","last_updated":"2025-06-14T15:37:31Z","snapshot_observed_at":"2026-08-17T11:52:29.103954Z","submitted_at":"2025-06-14T15:37:31Z","title":"Is your batch size the problem? Revisiting the Adam-SGD gap in language modeling","version":1},"cited_work":{"arxiv_id":"2506.12543","doi":"10.48550/arxiv.2506.12543","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.12543","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Is your batch size the problem? revisiting the adam-sgd gap in language modeling","venue":"ArXiv.org","work_id":"cab94819-0edb-417c-9a11-971473b0d098","year":2025},"citing_paper":{"arxiv_id":"2605.17787","last_updated":"2026-05-18T03:09:50Z","snapshot_observed_at":"2026-08-15T17:34:10.084048Z","submitted_at":"2026-05-18T03:09:50Z","title":"Revisiting the Adam-SGD Gap in LLM Pre-Training: The Role of Large Effective Learning Rates","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-20T13:34:09.129379Z"},"links":{"cited_paper":"/paper/2506.12543","citing_paper":"/paper/2605.17787"},"observation_digest":"sha256:4f2d1f72605db7a4620f7845f2fba95e4f83f3e85579e1458694b9e86f52ff74","observation_id":"01bd3cbc-d651-4a8c-bf5a-ad2e192dce3d","resolution":{"observed_at":"2026-05-20T13:38:19.427606Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.12543","last_updated":"2025-06-14T15:37:31Z","snapshot_observed_at":"2026-08-17T11:52:29.103954Z","submitted_at":"2025-06-14T15:37:31Z","title":"Is your batch size the problem? Revisiting the Adam-SGD gap in language modeling","version":1},"cited_work":{"arxiv_id":"2506.12543","doi":"10.48550/arxiv.2506.12543","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.12543","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Is your batch size the problem? revisiting the adam-sgd gap in language modeling","venue":"ArXiv.org","work_id":"cab94819-0edb-417c-9a11-971473b0d098","year":2025},"citing_paper":{"arxiv_id":"2605.22644","last_updated":"2026-05-21T15:50:40Z","snapshot_observed_at":"2026-08-16T20:55:32.393949Z","submitted_at":"2026-05-21T15:50:40Z","title":"Why SGD is not Brownian Motion: A New Perspective on Stochastic Dynamics","version":1},"reference_index":235,"source":"arxiv_source","source_observed_at":"2026-05-22T08:06:52.309619Z"},"links":{"cited_paper":"/paper/2506.12543","citing_paper":"/paper/2605.22644"},"observation_digest":"sha256:ee760e39d83f5d10b01a01a1ec5ce844702db999453b0c3a51f450eb82f1f6d4","observation_id":"53449721-9569-4766-a9a1-050f989768bf","resolution":{"observed_at":"2026-05-22T08:11:17.363127Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.12543","last_updated":"2025-06-14T15:37:31Z","snapshot_observed_at":"2026-08-17T11:52:29.103954Z","submitted_at":"2025-06-14T15:37:31Z","title":"Is your batch size the problem? Revisiting the Adam-SGD gap in language modeling","version":1},"cited_work":{"arxiv_id":"2506.12543","doi":"10.48550/arxiv.2506.12543","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.12543","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Is your batch size the problem? revisiting the adam-sgd gap in language modeling","venue":"ArXiv.org","work_id":"cab94819-0edb-417c-9a11-971473b0d098","year":2025},"citing_paper":{"arxiv_id":"2605.29273","last_updated":"2026-05-28T02:48:19Z","snapshot_observed_at":"2026-08-04T17:48:43.946338Z","submitted_at":"2026-05-28T02:48:19Z","title":"A Theoretical and Experimental Study of a Novel Adaptive Learning Algorithm","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-29T09:18:31.526770Z"},"links":{"cited_paper":"/paper/2506.12543","citing_paper":"/paper/2605.29273"},"observation_digest":"sha256:76a84492f589b837ed9d05b122fca7ce6a9ad8462d0eba4fbd553ed7a1eb5bda","observation_id":"3aa9feae-5033-46d6-8a2e-f130184609b1","resolution":{"observed_at":"2026-06-29T09:23:16.439125Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.12543","last_updated":"2025-06-14T15:37:31Z","snapshot_observed_at":"2026-08-17T11:52:29.103954Z","submitted_at":"2025-06-14T15:37:31Z","title":"Is your batch size the problem? Revisiting the Adam-SGD gap in language modeling","version":1},"cited_work":{"arxiv_id":"2506.12543","doi":"10.48550/arxiv.2506.12543","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.12543","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Is your batch size the problem? revisiting the adam-sgd gap in language modeling","venue":"ArXiv.org","work_id":"cab94819-0edb-417c-9a11-971473b0d098","year":2025},"citing_paper":{"arxiv_id":"2606.23591","last_updated":"2026-06-22T17:00:04Z","snapshot_observed_at":"2026-08-16T03:31:08.842158Z","submitted_at":"2026-06-22T17:00:04Z","title":"Quantifying the Agreement Between Data-Influence and Data-Similarity to Understand LLM Behavior","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-06-26T08:45:34.884703Z"},"links":{"cited_paper":"/paper/2506.12543","citing_paper":"/paper/2606.23591"},"observation_digest":"sha256:257cc3479930d2ca6b0f25db78c52897bfc20fa322b44a86b45ce8586c6f4b3b","observation_id":"e9e7170e-6db5-4851-b0e2-92c553ad4910","resolution":{"observed_at":"2026-06-26T08:49:14.928649Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.12543/citation-record","integrity":"/paper/2506.12543/integrity","json":"/paper/2506.12543/citation-record.json","paper":"/paper/2506.12543"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2002.11803","last_updated":"2020-02-26T21:42:49Z","snapshot_observed_at":"2026-08-12T17:50:20.963411Z","submitted_at":"2020-02-26T21:42:49Z","title":"Disentangling Adaptive Gradient Methods from Learning Rates","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.11803","snapshot_observed_at":"2026-08-07T00:50:29.766980Z","title":"Agarwal, R","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2506.12543","last_updated":"2025-06-14T15:37:31Z","snapshot_observed_at":"2026-08-17T11:52:29.103954Z","submitted_at":"2025-06-14T15:37:31Z","title":"Is your batch size the problem? Revisiting the Adam-SGD gap in language modeling","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:29.766980Z"},"links":{"cited_paper":"/paper/2002.11803","citing_paper":"/paper/2506.12543"},"observation_digest":"sha256:25ec27d20d0027be953f85d4b91f014005362da059860743f586a05239ed0550","observation_id":"a21bd626-5831-4ece-acb5-d4840f36f7b9","resolution":{"observed_at":"2026-08-07T00:50:29.766980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:31.044935Z","title":"As before, the gap decreases the longer we train, and SGD can eventually outperform Adam","venue":null,"work_id":"c965b783-ea18-49cb-9133-8cf973578ce3","year":null},"citing_paper":{"arxiv_id":"2506.12543","last_updated":"2025-06-14T15:37:31Z","snapshot_observed_at":"2026-08-17T11:52:29.103954Z","submitted_at":"2025-06-14T15:37:31Z","title":"Is your batch size the problem? Revisiting the Adam-SGD gap in language modeling","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:30.645921Z"},"links":{"citing_paper":"/paper/2506.12543"},"observation_digest":"sha256:8e01edd3245b8076d077dc8232e053016b41debe8023e763d2ec6248b1ae068a","observation_id":"49d4b4c9-e468-4c4f-b591-c01e47235889","resolution":{"observed_at":"2026-08-07T00:50:31.048280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00181","last_updated":"2026-05-22T19:40:10Z","snapshot_observed_at":"2026-08-16T06:23:55.569221Z","submitted_at":"2025-05-30T19:35:15Z","title":"On the Interaction of Batch Noise, Adaptivity, and Compression, under $(L_0,L_1)$-Smoothness: An SDE Approach","version":2},"cited_work":{"arxiv_id":"2506.00181","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.00181","snapshot_observed_at":"2026-08-07T00:50:30.992429Z","title":"On the Interaction of Batch Noise, Adaptivity, and Compression, under $(L_0,L_1)$-Smoothness: An SDE Approach","venue":"cs.LG","work_id":"b5889595-c08d-4594-b59b-bddc35dfcb95","year":2025},"citing_paper":{"arxiv_id":"2506.12543","last_updated":"2025-06-14T15:37:31Z","snapshot_observed_at":"2026-08-17T11:52:29.103954Z","submitted_at":"2025-06-14T15:37:31Z","title":"Is your batch size the problem? Revisiting the Adam-SGD gap in language modeling","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:30.238100Z"},"links":{"cited_paper":"/paper/2506.00181","citing_paper":"/paper/2506.12543"},"observation_digest":"sha256:030894a8cd6adeecd126f14a80f92dd49fe030b3fab50a345102df15e509a0b5","observation_id":"42de01fd-13d3-4930-a9bc-9a2017e833c3","resolution":{"observed_at":"2026-08-07T00:50:30.995734Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18392","last_updated":"2024-10-17T12:01:15Z","snapshot_observed_at":"2026-08-16T13:48:31.034274Z","submitted_at":"2024-05-28T17:33:54Z","title":"Scaling Laws and Compute-Optimal Training Beyond Fixed Training Durations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18392","snapshot_observed_at":"2026-08-07T00:50:30.555421Z","title":"org/abs/2405.18392","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.12543","last_updated":"2025-06-14T15:37:31Z","snapshot_observed_at":"2026-08-17T11:52:29.103954Z","submitted_at":"2025-06-14T15:37:31Z","title":"Is your batch size the problem? Revisiting the Adam-SGD gap in language modeling","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:30.555421Z"},"links":{"cited_paper":"/paper/2405.18392","citing_paper":"/paper/2506.12543"},"observation_digest":"sha256:5e7bf4308235bb3ad9bdd6ad70e897ae92ff4eecf22b321155dbdf2674d0f7d8","observation_id":"bbf646a2-602d-4105-bf75-187a47e1043a","resolution":{"observed_at":"2026-08-07T00:50:30.555421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.02254","last_updated":"2022-11-04T04:05:57Z","snapshot_observed_at":"2026-08-16T16:18:41.251497Z","submitted_at":"2022-11-04T04:05:57Z","title":"How Does Adaptive Optimization Impact Local Neural Network Geometry?","version":1},"cited_work":{"arxiv_id":"2211.02254","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.02254","snapshot_observed_at":"2026-08-07T00:50:30.945471Z","title":"How Does Adaptive Optimization Impact Local Neural Network Geometry?","venue":"cs.LG","work_id":"ab285d51-24ea-451d-8804-20b4865de21b","year":2022},"citing_paper":{"arxiv_id":"2506.12543","last_updated":"2025-06-14T15:37:31Z","snapshot_observed_at":"2026-08-17T11:52:29.103954Z","submitted_at":"2025-06-14T15:37:31Z","title":"Is your batch size the problem? Revisiting the Adam-SGD gap in language modeling","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:30.563102Z"},"links":{"cited_paper":"/paper/2211.02254","citing_paper":"/paper/2506.12543"},"observation_digest":"sha256:9b2267c3161d7619bc1de3d6c3d19edc24defccd3566753b5e813813d8b5e9eb","observation_id":"faba8271-5cc9-4dd9-a404-e1ec57e7b9b5","resolution":{"observed_at":"2026-08-07T00:50:30.948721Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-14T18:51:16.666127Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-07T00:50:30.570637Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.12543","last_updated":"2025-06-14T15:37:31Z","snapshot_observed_at":"2026-08-17T11:52:29.103954Z","submitted_at":"2025-06-14T15:37:31Z","title":"Is your batch size the problem? Revisiting the Adam-SGD gap in language modeling","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:30.570637Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2506.12543"},"observation_digest":"sha256:5e8b87961e3c21d3c3931d26f24eafba775ee169dc61cfb59688ae8bc9b93207","observation_id":"3ed2fc01-02dd-4f7e-831e-dbf28261e37e","resolution":{"observed_at":"2026-08-07T00:50:30.570637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19449","last_updated":"2024-07-12T05:10:32Z","snapshot_observed_at":"2026-08-16T14:14:00.607790Z","submitted_at":"2024-02-29T18:47:52Z","title":"Heavy-Tailed Class Imbalance and Why Adam Outperforms Gradient Descent on Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19449","snapshot_observed_at":"2026-08-07T00:50:30.584903Z","title":"arXiv:2402.19449 [cs, math, stat]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.12543","last_updated":"2025-06-14T15:37:31Z","snapshot_observed_at":"2026-08-17T11:52:29.103954Z","submitted_at":"2025-06-14T15:37:31Z","title":"Is your batch size the problem? Revisiting the Adam-SGD gap in language modeling","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:30.584903Z"},"links":{"cited_paper":"/paper/2402.19449","citing_paper":"/paper/2506.12543"},"observation_digest":"sha256:ccd7557cc2e9e7be0aaf2e7e335ddead3cd294a8c0e00502189b2161939839ff","observation_id":"93b8ace5-b1e8-41e7-976f-b4ee1f3a29da","resolution":{"observed_at":"2026-08-07T00:50:30.584903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-16T22:48:15.725816Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-07T00:50:30.594639Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.12543","last_updated":"2025-06-14T15:37:31Z","snapshot_observed_at":"2026-08-17T11:52:29.103954Z","submitted_at":"2025-06-14T15:37:31Z","title":"Is your batch size the problem? Revisiting the Adam-SGD gap in language modeling","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:30.594639Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2506.12543"},"observation_digest":"sha256:cad3a8de1e56a62d6727d306066d38e88bb18a581f9963c57a06de315e347415","observation_id":"e4f2a746-919f-4dfd-9dad-d458551d844e","resolution":{"observed_at":"2026-08-07T00:50:30.594639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.10287","last_updated":"2024-11-01T02:01:18Z","snapshot_observed_at":"2026-08-16T16:58:51.251814Z","submitted_at":"2022-05-20T16:39:03Z","title":"On the SDEs and Scaling Rules for Adaptive Gradient Algorithms","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.10287","snapshot_observed_at":"2026-08-07T00:50:30.606742Z","title":"arXiv:2205.10287 [cs]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.12543","last_updated":"2025-06-14T15:37:31Z","snapshot_observed_at":"2026-08-17T11:52:29.103954Z","submitted_at":"2025-06-14T15:37:31Z","title":"Is your batch size the problem? Revisiting the Adam-SGD gap in language modeling","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:30.606742Z"},"links":{"cited_paper":"/paper/2205.10287","citing_paper":"/paper/2506.12543"},"observation_digest":"sha256:5906248637667abd8ea398cf53ede6033a97e1380163528374d4196917a1ca7d","observation_id":"cf808663-47b5-4c1a-9afc-7e27f355ba34","resolution":{"observed_at":"2026-08-07T00:50:30.606742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:30.612924Z","title":"Orvieto and R","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.12543","last_updated":"2025-06-14T15:37:31Z","snapshot_observed_at":"2026-08-17T11:52:29.103954Z","submitted_at":"2025-06-14T15:37:31Z","title":"Is your batch size the problem? Revisiting the Adam-SGD gap in language modeling","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:30.612924Z"},"links":{"citing_paper":"/paper/2506.12543"},"observation_digest":"sha256:e8e310e8b465ce4d3f6133a4e69dc21adab99779e59f55bb92d06c3127c1ec07","observation_id":"3c264e59-9a2c-40dd-b301-bfb40bb9ea61","resolution":{"observed_at":"2026-08-07T00:50:30.612924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00204","last_updated":"2023-05-31T21:49:44Z","snapshot_observed_at":"2026-08-16T15:27:44.526321Z","submitted_at":"2023-05-31T21:49:44Z","title":"Toward Understanding Why Adam Converges Faster Than SGD for Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00204","snapshot_observed_at":"2026-08-07T00:50:30.615997Z","title":"arXiv:2306.00204 [cs]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.12543","last_updated":"2025-06-14T15:37:31Z","snapshot_observed_at":"2026-08-17T11:52:29.103954Z","submitted_at":"2025-06-14T15:37:31Z","title":"Is your batch size the problem? Revisiting the Adam-SGD gap in language modeling","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:30.615997Z"},"links":{"cited_paper":"/paper/2306.00204","citing_paper":"/paper/2506.12543"},"observation_digest":"sha256:03539155ecfe910968752cb45b0d31cd3d736172eca47017f39f90f530efb1ed","observation_id":"c90daf0d-ba2c-4c9c-8d1c-cfba25a472cb","resolution":{"observed_at":"2026-08-07T00:50:30.615997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:30.624491Z","title":"arXiv:2502.00213 [cs]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.12543","last_updated":"2025-06-14T15:37:31Z","snapshot_observed_at":"2026-08-17T11:52:29.103954Z","submitted_at":"2025-06-14T15:37:31Z","title":"Is your batch size the problem? Revisiting the Adam-SGD gap in language modeling","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:30.624491Z"},"links":{"citing_paper":"/paper/2506.12543"},"observation_digest":"sha256:cee64cfaeb648eac4098b430f0e7730ce2d3131af6fb3a1d1a2811642279968a","observation_id":"69e7fee2-9ad5-4733-b8d8-8f7515dc23f4","resolution":{"observed_at":"2026-08-07T00:50:30.624491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08198","last_updated":"2025-06-11T16:28:30Z","snapshot_observed_at":"2026-08-16T13:10:34.948333Z","submitted_at":"2024-10-10T17:58:53Z","title":"Adam Exploits $\\ell_\\infty$-geometry of Loss Landscape via Coordinate-wise Adaptivity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08198","snapshot_observed_at":"2026-08-07T00:50:30.627480Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.12543","last_updated":"2025-06-14T15:37:31Z","snapshot_observed_at":"2026-08-17T11:52:29.103954Z","submitted_at":"2025-06-14T15:37:31Z","title":"Is your batch size the problem? Revisiting the Adam-SGD gap in language modeling","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:30.627480Z"},"links":{"cited_paper":"/paper/2410.08198","citing_paper":"/paper/2506.12543"},"observation_digest":"sha256:efd960de7c7da20a3657b8e3d7cc561b04c4bfcae8fc9f281950101b2d96c480","observation_id":"ff2174f1-3d25-4dac-8c73-a60ed35c049d","resolution":{"observed_at":"2026-08-07T00:50:30.627480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21676","last_updated":"2025-04-21T04:19:56Z","snapshot_observed_at":"2026-08-16T13:05:08.265484Z","submitted_at":"2024-10-29T02:54:06Z","title":"How Does Critical Batch Size Scale in Pre-training?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21676","snapshot_observed_at":"2026-08-07T00:50:30.630441Z","title":"arXiv:2410.21676 [cs]","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2506.12543","last_updated":"2025-06-14T15:37:31Z","snapshot_observed_at":"2026-08-17T11:52:29.103954Z","submitted_at":"2025-06-14T15:37:31Z","title":"Is your batch size the problem? Revisiting the Adam-SGD gap in language modeling","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:30.630441Z"},"links":{"cited_paper":"/paper/2410.21676","citing_paper":"/paper/2506.12543"},"observation_digest":"sha256:c959f0cb5d0dfc11e0d6d959048ad407414c9c4dd028fa18b9e553d1c06c71b1","observation_id":"37a5bffc-f69f-4701-ab14-eb9cf9c9450d","resolution":{"observed_at":"2026-08-07T00:50:30.630441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16788","last_updated":"2024-10-21T08:27:23Z","snapshot_observed_at":"2026-08-16T14:15:12.845765Z","submitted_at":"2024-02-26T18:01:41Z","title":"Why Transformers Need Adam: A Hessian Perspective","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16788","snapshot_observed_at":"2026-08-07T00:50:30.633781Z","title":"arXiv:2402.16788 [cs]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.12543","last_updated":"2025-06-14T15:37:31Z","snapshot_observed_at":"2026-08-17T11:52:29.103954Z","submitted_at":"2025-06-14T15:37:31Z","title":"Is your batch size the problem? Revisiting the Adam-SGD gap in language modeling","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:30.633781Z"},"links":{"cited_paper":"/paper/2402.16788","citing_paper":"/paper/2506.12543"},"observation_digest":"sha256:08fe808a28f65f70bd161c4e9c0a0bd9f7f8982c9ef6ca82fdea7830311136a6","observation_id":"f7dcaf01-f68f-4aad-a8d0-86ec4ad73dc9","resolution":{"observed_at":"2026-08-07T00:50:30.633781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07972","last_updated":"2025-02-28T01:47:44Z","snapshot_observed_at":"2026-08-16T13:35:19.050691Z","submitted_at":"2024-07-10T18:11:40Z","title":"Deconstructing What Makes a Good Optimizer for Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07972","snapshot_observed_at":"2026-08-07T00:50:30.636520Z","title":"arXiv:2407.07972 [cs]","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.12543","last_updated":"2025-06-14T15:37:31Z","snapshot_observed_at":"2026-08-17T11:52:29.103954Z","submitted_at":"2025-06-14T15:37:31Z","title":"Is your batch size the problem? Revisiting the Adam-SGD gap in language modeling","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:30.636520Z"},"links":{"cited_paper":"/paper/2407.07972","citing_paper":"/paper/2506.12543"},"observation_digest":"sha256:a6b87ccbb3ef7ae401dbd1e9e45a4f478cf8dfeefd0633b81412f05835c11ed3","observation_id":"d6d36155-b1fa-4519-8f90-785c1d93fa03","resolution":{"observed_at":"2026-08-07T00:50:30.636520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:31.062369Z","title":null,"venue":null,"work_id":"f4b61737-52bc-445e-950e-ecbadadc36f6","year":2023},"citing_paper":{"arxiv_id":"2506.12543","last_updated":"2025-06-14T15:37:31Z","snapshot_observed_at":"2026-08-17T11:52:29.103954Z","submitted_at":"2025-06-14T15:37:31Z","title":"Is your batch size the problem? Revisiting the Adam-SGD gap in language modeling","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:30.639985Z"},"links":{"citing_paper":"/paper/2506.12543"},"observation_digest":"sha256:669c465ef7919ad8f37ee57e6b697a50efae14c20c366b0fc10abed4c287302a","observation_id":"a976dd82-e9e3-4506-b999-0f76593a6436","resolution":{"observed_at":"2026-08-07T00:50:31.065026Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:31.036397Z","title":"[2024], and uses the codebase of Orvieto and Gower [2025]","venue":null,"work_id":"8f9079bc-414c-4e76-804e-1d9e35632ac0","year":2024},"citing_paper":{"arxiv_id":"2506.12543","last_updated":"2025-06-14T15:37:31Z","snapshot_observed_at":"2026-08-17T11:52:29.103954Z","submitted_at":"2025-06-14T15:37:31Z","title":"Is your batch size the problem? Revisiting the Adam-SGD gap in language modeling","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:30.649181Z"},"links":{"citing_paper":"/paper/2506.12543"},"observation_digest":"sha256:1aa30a7d3117077f16ce38a2f7868e549ba17a930cb4bb25098c6e5c3d14bd23","observation_id":"08b0145f-91e0-48b2-ae3e-3a5593e047d9","resolution":{"observed_at":"2026-08-07T00:50:31.039339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:31.053720Z","title":null,"venue":null,"work_id":"5f9ac329-51a2-4150-8464-d661b1937a8a","year":2023},"citing_paper":{"arxiv_id":"2506.12543","last_updated":"2025-06-14T15:37:31Z","snapshot_observed_at":"2026-08-17T11:52:29.103954Z","submitted_at":"2025-06-14T15:37:31Z","title":"Is your batch size the problem? Revisiting the Adam-SGD gap in language modeling","version":1},"reference_index":1024,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:30.642968Z"},"links":{"citing_paper":"/paper/2506.12543"},"observation_digest":"sha256:3a5d517660f71a8c45478a24641675ee01085c12084d7dbd6782932a323a4c21","observation_id":"f34f1c0d-9218-4ca8-aec6-2a8131c3d5ec","resolution":{"observed_at":"2026-08-07T00:50:31.056492Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.05895","last_updated":"2019-12-30T03:53:04Z","snapshot_observed_at":"2026-08-07T19:31:58.707080Z","submitted_at":"2019-10-14T02:23:43Z","title":"Transformers without Tears: Improving the Normalization of Self-Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.05895","snapshot_observed_at":"2026-08-07T00:50:30.609473Z","title":null,"venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2506.12543","last_updated":"2025-06-14T15:37:31Z","snapshot_observed_at":"2026-08-17T11:52:29.103954Z","submitted_at":"2025-06-14T15:37:31Z","title":"Is your batch size the problem? Revisiting the Adam-SGD gap in language modeling","version":1},"reference_index":1986,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:30.609473Z"},"links":{"cited_paper":"/paper/1910.05895","citing_paper":"/paper/2506.12543"},"observation_digest":"sha256:80d064a415d0d5fba18149807f7c20f3b88919208f4a95754703fe43b8b90a29","observation_id":"f176b608-2526-4295-95c2-1538cb7575ee","resolution":{"observed_at":"2026-08-07T00:50:30.609473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09359","last_updated":"2023-10-10T05:31:01Z","snapshot_observed_at":"2026-08-16T16:15:29.579004Z","submitted_at":"2022-11-17T06:18:45Z","title":"How to Fine-Tune Vision Models with SGD","version":2},"cited_work":{"arxiv_id":"2211.09359","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.09359","snapshot_observed_at":"2026-08-07T00:50:30.920804Z","title":"How to Fine-Tune Vision Models with SGD","venue":"cs.CV","work_id":"7bafd919-f3d0-447f-8169-1fc5dde2da05","year":2022},"citing_paper":{"arxiv_id":"2506.12543","last_updated":"2025-06-14T15:37:31Z","snapshot_observed_at":"2026-08-17T11:52:29.103954Z","submitted_at":"2025-06-14T15:37:31Z","title":"Is your batch size the problem? Revisiting the Adam-SGD gap in language modeling","version":1},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:30.576108Z"},"links":{"cited_paper":"/paper/2211.09359","citing_paper":"/paper/2506.12543"},"observation_digest":"sha256:6ca6af535ff97e880e180f07b3ab9326824cb76c946b221a1941085a9ed4bb3a","observation_id":"6799d912-962d-42ed-bda7-de130b44a4a0","resolution":{"observed_at":"2026-08-07T00:50:30.926338Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T00:50:30.548431Z","title":"Grattafiori, A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.12543","last_updated":"2025-06-14T15:37:31Z","snapshot_observed_at":"2026-08-17T11:52:29.103954Z","submitted_at":"2025-06-14T15:37:31Z","title":"Is your batch size the problem? Revisiting the Adam-SGD gap in language modeling","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:30.548431Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.12543"},"observation_digest":"sha256:d11c4626a75ffbe16cc1fbc3dc717aa1824850d783b77d71afe68051ebf79adb","observation_id":"c597f601-3722-465a-851c-2e2ab7b14dcb","resolution":{"observed_at":"2026-08-07T00:50:30.548431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1802.04434","last_updated":"2018-08-07T18:55:19Z","snapshot_observed_at":"2026-08-14T19:46:33.101156Z","submitted_at":"2018-02-13T02:14:35Z","title":"signSGD: Compressed Optimisation for Non-Convex Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.04434","snapshot_observed_at":"2026-08-07T00:50:29.980013Z","title":"arXiv:1802.04434 [cs, math]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.12543","last_updated":"2025-06-14T15:37:31Z","snapshot_observed_at":"2026-08-17T11:52:29.103954Z","submitted_at":"2025-06-14T15:37:31Z","title":"Is your batch size the problem? Revisiting the Adam-SGD gap in language modeling","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:29.980013Z"},"links":{"cited_paper":"/paper/1802.04434","citing_paper":"/paper/2506.12543"},"observation_digest":"sha256:7f7634ab6d9073bbf04de29867847c579cd0e997d441d8fe68c3c0f8994a0248","observation_id":"c4d8fd51-e618-4b44-9367-f940273b414c","resolution":{"observed_at":"2026-08-07T00:50:29.980013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02222","last_updated":"2025-05-20T01:04:35Z","snapshot_observed_at":"2026-08-17T11:38:13.930266Z","submitted_at":"2025-05-04T19:14:43Z","title":"Practical Efficiency of Muon for Pretraining","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02222","snapshot_observed_at":"2026-08-07T00:50:30.618825Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.12543","last_updated":"2025-06-14T15:37:31Z","snapshot_observed_at":"2026-08-17T11:52:29.103954Z","submitted_at":"2025-06-14T15:37:31Z","title":"Is your batch size the problem? Revisiting the Adam-SGD gap in language modeling","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:30.618825Z"},"links":{"cited_paper":"/paper/2505.02222","citing_paper":"/paper/2506.12543"},"observation_digest":"sha256:8e78567a7c2999ef8d2499a34db6c730f632ee17ad6508ac8d9f01673f0eb5b9","observation_id":"ef191c64-b70d-4e05-a88f-27d993caa9c9","resolution":{"observed_at":"2026-08-07T00:50:30.618825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.02677","last_updated":"2018-04-30T21:53:41Z","snapshot_observed_at":"2026-08-09T05:23:26.365677Z","submitted_at":"2017-06-08T16:51:53Z","title":"Accurate, Large Minibatch SGD: Training ImageNet in 1 Hour","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.02677","snapshot_observed_at":"2026-08-07T00:50:30.464304Z","title":"Goyal, P","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.12543","last_updated":"2025-06-14T15:37:31Z","snapshot_observed_at":"2026-08-17T11:52:29.103954Z","submitted_at":"2025-06-14T15:37:31Z","title":"Is your batch size the problem? Revisiting the Adam-SGD gap in language modeling","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:30.464304Z"},"links":{"cited_paper":"/paper/1706.02677","citing_paper":"/paper/2506.12543"},"observation_digest":"sha256:839b5f9a4e432953d6ae9eb01c725598a001abc327b402b4d562e32af8fdd41a","observation_id":"4f04113b-7173-4087-a8fc-853e94d5a18b","resolution":{"observed_at":"2026-08-07T00:50:30.464304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1608.03983","last_updated":"2017-05-03T16:28:09Z","snapshot_observed_at":"2026-07-06T05:06:55.589962Z","submitted_at":"2016-08-13T13:46:05Z","title":"SGDR: Stochastic Gradient Descent with Warm Restarts","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1608.03983","snapshot_observed_at":"2026-08-07T00:50:30.603923Z","title":"Loshchilov and F","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.12543","last_updated":"2025-06-14T15:37:31Z","snapshot_observed_at":"2026-08-17T11:52:29.103954Z","submitted_at":"2025-06-14T15:37:31Z","title":"Is your batch size the problem? Revisiting the Adam-SGD gap in language modeling","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:30.603923Z"},"links":{"cited_paper":"/paper/1608.03983","citing_paper":"/paper/2506.12543"},"observation_digest":"sha256:4c7940106f8ab0c7b39a2d4b31505a178ef52c7ece9b5af32b8d9edf12ae4df0","observation_id":"72b5ec18-fdd9-4bf8-b615-731d1aa0231f","resolution":{"observed_at":"2026-08-07T00:50:30.603923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-07T00:50:30.348876Z","title":"Dosovitskiy, L","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.12543","last_updated":"2025-06-14T15:37:31Z","snapshot_observed_at":"2026-08-17T11:52:29.103954Z","submitted_at":"2025-06-14T15:37:31Z","title":"Is your batch size the problem? Revisiting the Adam-SGD gap in language modeling","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:30.348876Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2506.12543"},"observation_digest":"sha256:174742c0c79824ca1b4b00f7ed684bd4434c2672a0b1808cb803821d6c02d3a4","observation_id":"a959df74-d31d-472b-b5f2-150c36d047b8","resolution":{"observed_at":"2026-08-07T00:50:30.348876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06745","last_updated":"2022-04-14T04:00:27Z","snapshot_observed_at":"2026-08-13T14:54:27.001192Z","submitted_at":"2022-04-14T04:00:27Z","title":"GPT-NeoX-20B: An Open-Source Autoregressive Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06745","snapshot_observed_at":"2026-08-07T00:50:30.096081Z","title":"Black, S","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.12543","last_updated":"2025-06-14T15:37:31Z","snapshot_observed_at":"2026-08-17T11:52:29.103954Z","submitted_at":"2025-06-14T15:37:31Z","title":"Is your batch size the problem? Revisiting the Adam-SGD gap in language modeling","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:30.096081Z"},"links":{"cited_paper":"/paper/2204.06745","citing_paper":"/paper/2506.12543"},"observation_digest":"sha256:33b1e87c5aa92c9b0abb404da17e4158b787f9940d50e4d5d890c7d5b39ea019","observation_id":"6cec26bc-75cf-40f6-8c17-d216703fe868","resolution":{"observed_at":"2026-08-07T00:50:30.096081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01082","last_updated":"2024-03-13T16:48:27Z","snapshot_observed_at":"2026-08-16T14:55:55.412977Z","submitted_at":"2023-10-02T10:48:42Z","title":"Linear attention is (maybe) all you need (to understand transformer optimization)","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01082","snapshot_observed_at":"2026-08-07T00:50:29.838100Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.12543","last_updated":"2025-06-14T15:37:31Z","snapshot_observed_at":"2026-08-17T11:52:29.103954Z","submitted_at":"2025-06-14T15:37:31Z","title":"Is your batch size the problem? Revisiting the Adam-SGD gap in language modeling","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:29.838100Z"},"links":{"cited_paper":"/paper/2310.01082","citing_paper":"/paper/2506.12543"},"observation_digest":"sha256:1297a2de77607319d0c2984ec1e39af95932ca97e4b526b1b76c972a5bf5251b","observation_id":"3c56be0f-8610-4504-8510-4e9111b6f761","resolution":{"observed_at":"2026-08-07T00:50:29.838100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.05202","last_updated":"2020-02-12T19:57:13Z","snapshot_observed_at":"2026-08-11T06:21:56.129166Z","submitted_at":"2020-02-12T19:57:13Z","title":"GLU Variants Improve Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.05202","snapshot_observed_at":"2026-08-07T00:50:30.621589Z","title":null,"venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2506.12543","last_updated":"2025-06-14T15:37:31Z","snapshot_observed_at":"2026-08-17T11:52:29.103954Z","submitted_at":"2025-06-14T15:37:31Z","title":"Is your batch size the problem? Revisiting the Adam-SGD gap in language modeling","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:30.621589Z"},"links":{"cited_paper":"/paper/2002.05202","citing_paper":"/paper/2506.12543"},"observation_digest":"sha256:8334bfbc102d8efaf8508ea17915023b7e7834032691b474451d766f711d5d5d","observation_id":"0da4f519-d61b-47a1-8033-3430a73bbbff","resolution":{"observed_at":"2026-08-07T00:50:30.621589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.12543","last_updated":"2025-06-14T15:37:31Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-17T11:52:29.103954Z","submitted_at":"2025-06-14T15:37:31Z","title":"Is your batch size the problem? Revisiting the Adam-SGD gap in language modeling"},"reference_resolution":{"displayed":30,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":25,"verified_exact":2,"verified_fuzzy":2},"total_outbound_references":30},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 30 of 30 outbound references and 6 inbound Pith citation observations for arXiv:2506.12543."}