{"as_of":"2026-08-17T21:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b26b947f98654887840d2ea15d059d861f297080d556b94f9b21fac8e1e10cac","coverage":[{"denominator":56,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:30:29.286244Z","state":"measured"},{"denominator":56,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":56,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.21651/citation-record","integrity":"/paper/2505.21651/integrity","json":"/paper/2505.21651/citation-record.json","paper":"/paper/2505.21651"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.03126","last_updated":"2024-10-20T11:36:13Z","snapshot_observed_at":"2026-08-16T14:21:22.737242Z","submitted_at":"2024-02-05T15:51:49Z","title":"How Free is Parameter-Free Stochastic Optimization?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03126","snapshot_observed_at":"2026-08-07T13:30:23.064115Z","title":"How free is parameter-free stochastic optimization? arXiv:2402.03126 , 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-16T04:31:31.429766Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:23.064115Z"},"links":{"cited_paper":"/paper/2402.03126","citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:414e38ccf02c512dd80d04b1ab9c0d8c382df8cac6f078191a5b76b630fb8938","observation_id":"4ddf0f5f-4ee3-4ef8-8117-8dfa3e70f1be","resolution":{"observed_at":"2026-08-07T13:30:23.064115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:38.244747Z","title":"Calculus , volume 1","venue":null,"work_id":"a566dedb-b601-4931-8dc3-2606034113a9","year":1967},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-16T04:31:31.429766Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:23.187262Z"},"links":{"citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:3f4639cdc44330d8f72914cae41b1fb020add1de299ddeb4badfc6d9f1e43bcc","observation_id":"aee387a0-0d2a-4cc7-9874-868a878da780","resolution":{"observed_at":"2026-08-07T13:30:38.322528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:38.014755Z","title":"Gradient descent converges linearly for logistic regression on separable data","venue":null,"work_id":"81d47062-09ed-45c4-95c1-ee2b3be8933c","year":2023},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-16T04:31:31.429766Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:23.284766Z"},"links":{"citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:9d4f4eba140a663a9a7fa7e7a2634b8fdfba929ce29b3e192e70de1df30f571a","observation_id":"fd78edb9-5eaa-446c-be1a-9cf9327857e3","resolution":{"observed_at":"2026-08-07T13:30:38.105432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:37.798378Z","title":"Julia: A fresh approach to numerical computing","venue":null,"work_id":"3795d3be-d4d6-4cab-a09a-bddd02e38cb5","year":2017},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-16T04:31:31.429766Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:23.335801Z"},"links":{"citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:9051f852ab848e1418fcde877cefbf8a5738fa4f69a4f705dd0c6dbfb95121f8","observation_id":"204a1cdd-8cea-4e8b-a5b1-2ac44fe571ee","resolution":{"observed_at":"2026-08-07T13:30:37.889146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:37.607389Z","title":"Making SGD parameter-free","venue":null,"work_id":"906a0993-3a4b-4551-8646-54e348a205e8","year":2022},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-16T04:31:31.429766Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:23.434935Z"},"links":{"citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:3af8d4cacef42d09c3d6f5ca012de38fe1718bf3f4341bcc7aeff1361faf7af3","observation_id":"dc942eac-f20d-4881-9c73-6ccf8118e61b","resolution":{"observed_at":"2026-08-07T13:30:37.708704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:37.409221Z","title":"Understanding and detecting convergence for stochastic gradient descent with momentum","venue":null,"work_id":"d922e7d2-8ce3-432a-a08d-f11e7000c9dd","year":2020},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-16T04:31:31.429766Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:23.514854Z"},"links":{"citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:9c1bade355a8e9747796c842745a308d9f958b4a155a3e060f5c5846b6654d0e","observation_id":"649b4055-4bd7-4127-91ae-22caed5799c1","resolution":{"observed_at":"2026-08-07T13:30:37.455861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.06382","last_updated":"2018-02-23T04:31:07Z","snapshot_observed_at":"2026-08-14T20:22:51.324581Z","submitted_at":"2017-10-17T16:51:16Z","title":"Convergence diagnostics for stochastic gradient descent with constant step size","version":2},"cited_work":{"arxiv_id":"1710.06382","doi":null,"metadata_source":"pith","pith_arxiv_id":"1710.06382","snapshot_observed_at":"2026-08-07T13:30:29.821389Z","title":"Convergence diagnostics for stochastic gradient descent with constant step size","venue":"stat.ML","work_id":"6a37aa15-9604-49c5-ba90-251c836141e1","year":2017},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-16T04:31:31.429766Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:23.643611Z"},"links":{"cited_paper":"/paper/1710.06382","citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:bc8cc6d5215c1b5bc24cdafe08863fea6cbd084f67b56ee832b217e2431f5ddb","observation_id":"bfe847ce-4044-43d8-bb02-0ea0237f626a","resolution":{"observed_at":"2026-08-07T13:30:29.874881Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:37.111342Z","title":"Automatically constructing a corpus of sentential paraphrases","venue":null,"work_id":"2b1d579f-2012-482a-b784-930af3131b49","year":2005},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-16T04:31:31.429766Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:23.724831Z"},"links":{"citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:3c4e45cbc43356b947074e85173ebb47d06974f66c5cafd60682c31ebb28872a","observation_id":"42083acd-ec66-4610-9a39-1d291963493f","resolution":{"observed_at":"2026-08-07T13:30:37.288214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:36.904388Z","title":"Robust, accurate stochastic optimization for variational inference","venue":null,"work_id":"a2268f73-04d2-4019-b416-9ded2fa9c5e8","year":2020},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-16T04:31:31.429766Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:23.809334Z"},"links":{"citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:076bde243f1cfb6997e46abe65540eef3d0250e0215d4a8869773e40517f16bc","observation_id":"9a2ecdec-5fd7-49f3-80ca-fc787084035f","resolution":{"observed_at":"2026-08-07T13:30:36.998998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:23.876555Z","title":"Adaptive subgradient methods for online learning and stochastic optimization","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-16T04:31:31.429766Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:23.876555Z"},"links":{"citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:4f86d5b09c461969d78efb9fcd9d8deea73f5d020a74761a17923ecbb4eac1cc","observation_id":"4171f955-c560-453a-a9de-dfcea1481669","resolution":{"observed_at":"2026-08-07T13:30:23.876555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:36.709238Z","title":"Learning-rate-free learning by D - A daptation","venue":null,"work_id":"cba41ebb-c457-4544-8f87-0a7eafe40036","year":2023},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-16T04:31:31.429766Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:23.965152Z"},"links":{"citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:8b96359536ace5b5d6739ab56429336bc3284a32064e66f5e4bd39dc2db6e843","observation_id":"574adbda-bd38-4bb3-94fa-ad42f88a16f6","resolution":{"observed_at":"2026-08-07T13:30:36.763690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:36.547155Z","title":"Markov Chains","venue":null,"work_id":"d2104096-ebb1-409b-98f7-a9297068b9c3","year":2018},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-16T04:31:31.429766Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:24.009501Z"},"links":{"citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:ea7b32a436b063140c4d624a509649e5ab54350dbe305e0abc8465d2a983c9cb","observation_id":"af7dafda-77e2-414a-8acb-756552a0c142","resolution":{"observed_at":"2026-08-07T13:30:36.610874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:36.353874Z","title":"Probability: Theory and Examples","venue":null,"work_id":"2cb7b786-1a46-412d-a1d3-41a7d784a415","year":2010},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-16T04:31:31.429766Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:24.084769Z"},"links":{"citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:737df11b9f5231f37b80a50fe861a8a1d7437d68c7b1c2f5de1a0d6b3b99f7ad","observation_id":"aa54e8af-cc3b-455b-9b0e-3665668e6992","resolution":{"observed_at":"2026-08-07T13:30:36.444990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:36.124737Z","title":"The road less scheduled","venue":null,"work_id":"e4752c58-a07c-4869-94cb-8d25a6b230ad","year":2024},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-16T04:31:31.429766Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:24.161205Z"},"links":{"citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:f5feaa2540238f160c1175243deeb8d42f4c70c3b279ec3553c6340ec27f55c0","observation_id":"b622ca89-67b0-408d-b08e-385de1e777df","resolution":{"observed_at":"2026-08-07T13:30:36.211598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:35.918970Z","title":"Bayesian Data Analysis","venue":null,"work_id":"67cd1c95-a8c9-4ed3-8fc9-4c820de7b78c","year":2013},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-16T04:31:31.429766Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:24.217374Z"},"links":{"citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:6c0b1ed6879463c19c1762827540068ae1c6f1bd25fe33b004615583f148afef","observation_id":"abd233f5-8329-4f89-8b88-1d11de747c4e","resolution":{"observed_at":"2026-08-07T13:30:36.005226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.11235","last_updated":"2024-03-09T13:28:29Z","snapshot_observed_at":"2026-08-16T15:59:56.095916Z","submitted_at":"2023-01-26T17:18:36Z","title":"Handbook of Convergence Theorems for (Stochastic) Gradient Methods","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.11235","snapshot_observed_at":"2026-08-07T13:30:24.271122Z","title":"Handbook of convergence theorems for (stochastic) gradient methods","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-16T04:31:31.429766Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:24.271122Z"},"links":{"cited_paper":"/paper/2301.11235","citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:1e2b31a1a0cffc9647842d2e4ed1c69a3e8919e232e683b2fddabfdf252d0088","observation_id":"7d99c6f7-0b53-42b8-a1aa-b86f26760ca8","resolution":{"observed_at":"2026-08-07T13:30:24.271122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:35.766032Z","title":"Inference from iterative simulation using multiple sequences","venue":null,"work_id":"fbcd7482-f064-4411-ad6f-ed553b6057ad","year":1992},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-16T04:31:31.429766Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:24.344053Z"},"links":{"citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:49a99eb652e12acf7d4a1b43822a090b4a7f6d323e4546c0b5000cbd103cf67c","observation_id":"f3906197-8710-4483-afbb-550483e6c94e","resolution":{"observed_at":"2026-08-07T13:30:35.833611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:35.640744Z","title":"Don't be so monotone: R elaxing stochastic line search in over-parameterized models","venue":null,"work_id":"0fe9c8c7-c927-44b4-bec8-62693f706305","year":2023},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-16T04:31:31.429766Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:24.514784Z"},"links":{"citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:b79481dbc18cacde692d4d2f6b5219859a9e376a7be0748601e351ee9fadbe79","observation_id":"f269af48-9b48-43d1-983c-85bc5d2e6d37","resolution":{"observed_at":"2026-08-07T13:30:35.705094Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:35.388975Z","title":"Variance-reduced methods for machine learning","venue":null,"work_id":"4f78e54f-71d4-4000-af18-05fd5ec40b40","year":1968},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-16T04:31:31.429766Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:24.644887Z"},"links":{"citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:94b06533842539cb68a2ffca32ae19ab5bbd336ea1d401886f28eca73aff65c9","observation_id":"0380042f-3f8f-460a-a8b9-8bc45ae1a90f","resolution":{"observed_at":"2026-08-07T13:30:35.526086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:35.203538Z","title":"Srivastava, and K","venue":null,"work_id":"e52f4489-b68d-4f05-b876-12e728a55c2f","year":2012},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-16T04:31:31.429766Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:24.734965Z"},"links":{"citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:951191192da9bec27e0190412f85cd6d717bf2fd8475e5a41bd96fab342bbbe8","observation_id":"36e6b8fe-9663-4636-b810-db23e70870ae","resolution":{"observed_at":"2026-08-07T13:30:35.292698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:24.804785Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-16T04:31:31.429766Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:24.804785Z"},"links":{"citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:f95a065b9a8f1b7c10896dad5303ac90038ae47de82632a7e3fa798f8989670b","observation_id":"fb0b79d0-6103-4375-8ba0-994978c72d94","resolution":{"observed_at":"2026-08-07T13:30:24.804785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:34.993698Z","title":"DoG is SGD 's best friend: A parameter-free dynamic step size schedule","venue":null,"work_id":"320c6c6a-005f-4d73-b4e3-09b4724508bd","year":2023},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-16T04:31:31.429766Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:24.917999Z"},"links":{"citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:4281b417c84c1ca7f39b3acf1b130f4703e6929d4d74638c19d6585f45d909b4","observation_id":"e243249d-3c26-45c5-80ad-d1392bbc1618","resolution":{"observed_at":"2026-08-07T13:30:35.106516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:34.820664Z","title":"Parallelizing stochastic gradient descent for least squares regression: mini-batching, averaging, and model misspecification","venue":null,"work_id":"dcd626c0-67b7-4b72-a418-840eae71ca4e","year":2018},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-16T04:31:31.429766Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:25.014606Z"},"links":{"citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:fd131643dd253e318342353bbc07f6fcb832ac6bcbb8751d43fe442d95d5de13","observation_id":"a7c3fab8-dca2-42b3-b1d3-4e9e0e683339","resolution":{"observed_at":"2026-08-07T13:30:34.900072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-17T19:26:44.032537Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-07T13:30:25.236602Z","title":"Adam: A method for stochastic optimization","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-16T04:31:31.429766Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:25.236602Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:bf238247c572c8d96b67e76f7592774da2c155f6d9fbefaf0db04612d143ea9b","observation_id":"8c143f95-dbd4-4722-969e-b57ec402f1a1","resolution":{"observed_at":"2026-08-07T13:30:25.236602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:34.596043Z","title":"Accelerated parameter-free stochastic optimization","venue":null,"work_id":"40d4f15f-c90e-418e-b9a3-38814c21e27e","year":2024},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-16T04:31:31.429766Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:25.364739Z"},"links":{"citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:4ecc741d1d611f57636c4ae9e3a1827234e4dd9bea610557c600feb562b4f93e","observation_id":"e9f5da1e-7290-4058-a06b-8bc3a8160200","resolution":{"observed_at":"2026-08-07T13:30:34.699088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07793","last_updated":"2024-03-18T20:19:43Z","snapshot_observed_at":"2026-08-16T14:19:16.408582Z","submitted_at":"2024-02-12T16:59:06Z","title":"Tuning-Free Stochastic Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07793","snapshot_observed_at":"2026-08-07T13:30:25.644802Z","title":"Tuning-free stochastic optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-16T04:31:31.429766Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:25.644802Z"},"links":{"cited_paper":"/paper/2402.07793","citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:db494c6b1b8ac84a2da34bb573d21d9c189748f10bfb397db8197e7efe1b3021","observation_id":"f1dbf6ab-fc57-427a-9682-0f28089a6926","resolution":{"observed_at":"2026-08-07T13:30:25.644802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:34.411623Z","title":"Linear convergence of black-box variational inference: S hould we stick the landing? In International Conference on Artificial Intelligence and Statistics , pages 235--243","venue":null,"work_id":"c48378a7-52c9-4b0c-9af8-5f49bda2072d","year":2024},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-16T04:31:31.429766Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:25.815236Z"},"links":{"citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:11b335983d93ea4145faa8ef420af09c9df1e31a68f54903e658d0326e952c6f","observation_id":"332916ce-44bc-4a4c-a515-c14d1a4eabfb","resolution":{"observed_at":"2026-08-07T13:30:34.500231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:34.248117Z","title":"DoWG unleashed: A n efficient universal parameter-free gradient descent method","venue":null,"work_id":"b75606ac-9dab-4508-842e-abacaa5cef31","year":2023},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-16T04:31:31.429766Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:25.935152Z"},"links":{"citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:e63c923b6ee70c3541b56e5caf9a26c42f9e307ad1daae12bb9f88dacf81f641","observation_id":"cc97eaae-22fe-433a-a526-03e65b9c99e0","resolution":{"observed_at":"2026-08-07T13:30:34.345067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:26.009608Z","title":"Learning multiple layers of features from tiny images","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-16T04:31:31.429766Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:26.009608Z"},"links":{"citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:745e371f3ab7739a58b90f184c9a93fc864a4f4db6ec4eeb8406ce99f5c73502","observation_id":"3d872e16-63cf-40c7-8062-5de2ee988c80","resolution":{"observed_at":"2026-08-07T13:30:26.009608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-08-16T14:33:50.657682Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-07T13:30:26.125015Z","title":"RoBERTa : A robustly optimized BERT pretraining approach","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-16T04:31:31.429766Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:26.125015Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:85389d2a2300162a271999f5881ab4612afb8fd44751f1358c39ed46aa5bac56","observation_id":"3a8ed22e-5ebb-4893-875d-715a7d6c99ab","resolution":{"observed_at":"2026-08-07T13:30:26.125015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:33.999278Z","title":"Stochastic polyak step-size for SGD : A n adaptive learning rate for fast convergence","venue":null,"work_id":"820ebdd1-8efa-4486-b836-e1277f3bbce2","year":2021},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-16T04:31:31.429766Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:26.255069Z"},"links":{"citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:b877cfc1f2746d0bf24980b463b0447216609167a3aebc1a778dbf2c885cf03c","observation_id":"8666a607-6920-4c21-8721-f33055dabb10","resolution":{"observed_at":"2026-08-07T13:30:34.051792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:33.817358Z","title":"Using statistics to automate stochastic optimization","venue":null,"work_id":"a49defef-4290-47cc-9af2-d6ed0b3da6da","year":2019},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-16T04:31:31.429766Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:26.386965Z"},"links":{"citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:5f4ce60ae42b8e2b2aed5be023099b9d25281771e7c910a23361adbc281a74bc","observation_id":"6bb0fb86-b258-49aa-aa2b-d30b47fdaf7e","resolution":{"observed_at":"2026-08-07T13:30:33.896297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.06101","last_updated":"2024-03-19T23:01:06Z","snapshot_observed_at":"2026-08-16T19:18:54.990265Z","submitted_at":"2023-06-09T17:59:35Z","title":"Prodigy: An Expeditiously Adaptive Parameter-Free Learner","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.06101","snapshot_observed_at":"2026-08-07T13:30:26.479605Z","title":"Prodigy: A n expeditiously adaptive parameter-free learner","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-16T04:31:31.429766Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:26.479605Z"},"links":{"cited_paper":"/paper/2306.06101","citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:b6780469dbe10aa926769f3afd4a4be2bffef62e116e94f687c0322a33322ea6","observation_id":"ea3a5ea4-6857-4233-9231-459089494ea2","resolution":{"observed_at":"2026-08-07T13:30:26.479605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.09529","last_updated":"2020-08-15T20:00:34Z","snapshot_observed_at":"2026-08-15T11:12:42.728397Z","submitted_at":"2019-10-21T17:49:29Z","title":"Adaptive Gradient Descent without Descent","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.09529","snapshot_observed_at":"2026-08-07T13:30:26.665057Z","title":"Adaptive gradient descent without descent","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-16T04:31:31.429766Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:26.665057Z"},"links":{"cited_paper":"/paper/1910.09529","citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:9307265342a7834cd2649758b6033c86c87b3661c82abf79f1cd49e04d4ada20","observation_id":"62a50b7a-aa01-4eb5-a9bc-605cdc44fc4f","resolution":{"observed_at":"2026-08-07T13:30:26.665057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:33.661451Z","title":"Beating SGD saturation with tail-averaging and minibatching","venue":null,"work_id":"33437d73-e811-4f1d-b42d-857adeb7ee23","year":2019},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-16T04:31:31.429766Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:26.964874Z"},"links":{"citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:586f574270376162b7859f07045f989b9c7accaf9d75a8000583729424bc885a","observation_id":"23103646-e9af-4aaf-8a31-f8b19b14b154","resolution":{"observed_at":"2026-08-07T13:30:33.733177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:33.466114Z","title":"Let's make block coordinate descent converge faster: F aster greedy rules, message-passing, active-set complexity, and superlinear convergence","venue":null,"work_id":"e96dc81d-9180-468b-9065-a1dcde4a0abf","year":2022},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-16T04:31:31.429766Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:27.065084Z"},"links":{"citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:f9c0361f3ab6506efbed07e4508aaeace33008ffe8fc54586d2645d5d14244f6","observation_id":"662b3f75-7b27-4b96-8588-01f6aa9ba61f","resolution":{"observed_at":"2026-08-07T13:30:33.571767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:33.258723Z","title":"Dynamics of SGD with stochastic P olyak stepsizes: T ruly adaptive variants and convergence to exact solution","venue":null,"work_id":"149704f5-7241-4eb7-ae4b-f021483b63f1","year":2022},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-16T04:31:31.429766Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:27.182224Z"},"links":{"citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:f9646ba3cdee046dff3a854f04c833e054ceaf9dd1ce8e736dbb488eb483e73c","observation_id":"fcb7d2fb-32de-4f7e-a141-c063f88ba817","resolution":{"observed_at":"2026-08-07T13:30:33.370986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:32.976074Z","title":"Training deep networks without learning rates through coin betting","venue":null,"work_id":"ea4edc94-35a3-4731-baf9-58baf6f530eb","year":2017},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-16T04:31:31.429766Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:27.414972Z"},"links":{"citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:9934851be7479d125a84d8b4958b0c3f0acaae44a3e1224e5b862dbbca37bc43","observation_id":"efce4528-360d-4278-8025-944fffac552d","resolution":{"observed_at":"2026-08-07T13:30:33.098648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:32.750917Z","title":"On convergence-diagnostic based step sizes for stochastic gradient descent","venue":null,"work_id":"a68e361f-fb04-445d-88e9-4ee3236cd2aa","year":2020},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-16T04:31:31.429766Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:27.584877Z"},"links":{"citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:d9586ad93cfd921988ee074688f561c416018adae276e67849efe155af6fe548","observation_id":"b1f77e31-f3f6-4b17-aa45-471c6eeaebac","resolution":{"observed_at":"2026-08-07T13:30:32.885767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:32.551659Z","title":"On the determination of the step size in stochastic quasigradient methods","venue":null,"work_id":"687718c0-07f9-4f0c-bd1a-809b49af4bde","year":1983},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-16T04:31:31.429766Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:27.666340Z"},"links":{"citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:5db5fe01e74e75095e77a0c03faeb78e53606c9c8be00c8d5dd781e2e46a1028","observation_id":"c25f0525-7fc9-440f-9ef4-81f3c216a59f","resolution":{"observed_at":"2026-08-07T13:30:32.639217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:32.315153Z","title":"Non-asymptotic confidence bounds for stochastic approximation algorithms with constant step size","venue":null,"work_id":"be01cb80-a933-4349-8144-bae3d6b61541","year":1990},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-16T04:31:31.429766Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:27.774917Z"},"links":{"citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:3a1a1f25c1e89afb7c9faff12306bc21a7763c89f3fd711299fff1051ce0fbc7","observation_id":"b6ffb9cd-dac4-46c0-8cec-a7c171abf7f7","resolution":{"observed_at":"2026-08-07T13:30:32.392834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:32.115072Z","title":"Py T orch: A n imperative style, high-performance deep learning library","venue":null,"work_id":"4f104921-dd87-4f76-99b4-1375bd6522a8","year":2019},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-16T04:31:31.429766Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:27.905036Z"},"links":{"citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:ab865ed8533d13351d4667b47d4eef73ea0d4f823963d7e9bef4c943607372ac","observation_id":"359e5e04-282e-4398-89dc-05087705d8ab","resolution":{"observed_at":"2026-08-07T13:30:32.241807Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:31.903550Z","title":"https://huggingface.co/microsoft/resnet-18, 2025","venue":null,"work_id":"a46f5626-ad03-44b7-ac99-b7c095567eaf","year":2025},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-16T04:31:31.429766Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:28.010649Z"},"links":{"citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:b31888686e08ccbc5890133609736c6965f2c7ca19a0a16fb91d914237ef3234","observation_id":"acf787f1-2a75-4fed-967d-d50e6342a6a0","resolution":{"observed_at":"2026-08-07T13:30:32.018044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:31.652589Z","title":"A stochastic approximation method","venue":null,"work_id":"d257af64-9ed2-434a-8499-0f47d46e3c14","year":1951},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-16T04:31:31.429766Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:28.121239Z"},"links":{"citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:20c317d7cb34fa7c2bba8b129bb1309ca498ce0d2d255796da8774b332754cc4","observation_id":"6454f534-0c17-463f-9b38-3a1d916d3ddc","resolution":{"observed_at":"2026-08-07T13:30:31.783988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:31.446072Z","title":"https://huggingface.co/FacebookAI/roberta-base, 2025","venue":null,"work_id":"31e1e4b2-566d-4589-8c19-8f92282fed36","year":2025},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-16T04:31:31.429766Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:28.463148Z"},"links":{"citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:16fa4600b6ec6d45db0eee733872ae950f4e2ad958fb94f5ad673151d9bba6f0","observation_id":"4a60d70a-43fc-4b69-9cd4-e010c9f1012e","resolution":{"observed_at":"2026-08-07T13:30:31.514873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1902.05083","last_updated":"2019-02-19T19:00:20Z","snapshot_observed_at":"2026-08-14T17:16:43.079248Z","submitted_at":"2019-02-13T19:00:25Z","title":"Anytime Tail Averaging","version":2},"cited_work":{"arxiv_id":"1902.05083","doi":null,"metadata_source":"pith","pith_arxiv_id":"1902.05083","snapshot_observed_at":"2026-08-07T13:30:29.463937Z","title":"Anytime Tail Averaging","venue":"cs.LG","work_id":"ce6eecf5-4338-4d25-bff3-a25802e7aaf3","year":2019},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-16T04:31:31.429766Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:28.540616Z"},"links":{"cited_paper":"/paper/1902.05083","citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:aa2f6647a8a576d8d7f2718ee7432b652eb9e42ca39f2f4adb35f625132235c1","observation_id":"7927b180-2727-410e-b59e-a6b26519e75e","resolution":{"observed_at":"2026-08-07T13:30:29.584753Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1109.5647","last_updated":"2012-12-09T21:19:27Z","snapshot_observed_at":"2026-08-15T04:34:09.911130Z","submitted_at":"2011-09-26T17:24:52Z","title":"Making Gradient Descent Optimal for Strongly Convex Stochastic Optimization","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1109.5647","snapshot_observed_at":"2026-08-07T13:30:28.585346Z","title":"Making gradient descent optimal for strongly convex stochastic optimization","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-16T04:31:31.429766Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:28.585346Z"},"links":{"cited_paper":"/paper/1109.5647","citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:b4f03a9f5846bb6596c1d0ae93c99df325906c2c197e3fc0c34f3adef57f1228","observation_id":"dbfa0b42-1d36-4900-9839-ef3ce529f51a","resolution":{"observed_at":"2026-08-07T13:30:28.585346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:31.238227Z","title":"Sticking the landing: S imple, lower-variance gradient estimators for variational inference","venue":null,"work_id":"1713d519-c6e7-4128-ab4a-de4655684828","year":2017},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-16T04:31:31.429766Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:28.687107Z"},"links":{"citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:b88a52c155760f00f03f81bc078b08ce497333af8e7da9f1fd0e67765660eacb","observation_id":"2f10f48c-f16a-44cb-941d-d5d633ef795d","resolution":{"observed_at":"2026-08-07T13:30:31.347644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:31.043109Z","title":"SQuAD : 100,000+ questions for machine comprehension of text","venue":null,"work_id":"a3442975-fa35-4830-9100-e7c0755187b2","year":2016},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-16T04:31:31.429766Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:28.737065Z"},"links":{"citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:a3c5717c50c954bcfe38e9d6bb30500bca743f4941a5fc1746c86c16ae0598fe","observation_id":"14442b01-b4df-40e7-b73f-8a897ade788d","resolution":{"observed_at":"2026-08-07T13:30:31.130714Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:30.904748Z","title":"Virtual library of simulation experiments: T est functions and datasets, 2013","venue":null,"work_id":"a0cf04c8-df59-442a-ba9b-b9e63c9a84d2","year":2013},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-16T04:31:31.429766Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:28.815036Z"},"links":{"citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:bacf78fd35ae8a989f8a4cd4ef392a4c2d3ef080350c4efb18f6c4ee7a0bf7b0","observation_id":"8d42f786-343b-4ec1-8444-9576d3126183","resolution":{"observed_at":"2026-08-07T13:30:30.933615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:30.691010Z","title":"Recursive deep models for semantic compositionality over a sentiment treebank","venue":null,"work_id":"82ddda2e-733e-483f-a7ea-287f4091e6e2","year":2013},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-16T04:31:31.429766Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:28.856405Z"},"links":{"citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:3b210d67f7d3391b62ad3db904fef94a55b5860aa7a39cbf40336bc99a766cd6","observation_id":"0acc27dd-ad8a-41c7-8cbe-df18780bf2d4","resolution":{"observed_at":"2026-08-07T13:30:30.762131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:30.498515Z","title":"Stochastic gradient descent for non-smooth optimization: C onvergence results and optimal averaging schemes","venue":null,"work_id":"af98fa55-6619-4777-b0e8-f9b0177cadaf","year":2013},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-16T04:31:31.429766Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:28.911294Z"},"links":{"citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:ef27f26a2d6bb0fc41ae6c5102cf4ff5601bbb728197052d943e13e2f13ded51","observation_id":"b597a55d-446a-46dd-83f6-c4175b93c23b","resolution":{"observed_at":"2026-08-07T13:30:30.583910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:30.340795Z","title":"Painless stochastic gradient: I nterpolation, line-search, and convergence rates","venue":null,"work_id":"5a788a95-7761-4c4f-a72f-13cb07f9ca6e","year":2019},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-16T04:31:31.429766Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:28.941336Z"},"links":{"citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:6a6fd7340fd561509bc2a163869703f5fd533ca830a0ed040cb2cd18953076d5","observation_id":"f81a50cd-0413-41b8-9408-88f6d4dd081f","resolution":{"observed_at":"2026-08-07T13:30:30.444768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:30.205962Z","title":"A framework for improving the reliability of black-box variational inference","venue":null,"work_id":"b96d3fab-fd1b-4d00-8850-a2d3cfb9a0f8","year":2024},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-16T04:31:31.429766Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:29.073747Z"},"links":{"citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:d42003ca73ded764bbd0907c9b78e49aa44f1c70487c0f4fb7458dfdf63299ee","observation_id":"19139d0b-134b-46c5-a154-68bf21d15add","resolution":{"observed_at":"2026-08-07T13:30:30.280853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:30.011232Z","title":"GLUE : A multi-task benchmark and analysis platform for natural language understanding","venue":null,"work_id":"3165a0ad-dcaa-4296-a795-2422325ef401","year":2019},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-16T04:31:31.429766Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:29.175993Z"},"links":{"citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:9b791ee75015ffdade7d446ec67db7445e0b86f359695f4448c1ba278cba37fe","observation_id":"f258329d-7b20-498c-a848-44bc1f716d5b","resolution":{"observed_at":"2026-08-07T13:30:30.093008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.00004","last_updated":"2018-12-21T16:09:27Z","snapshot_observed_at":"2026-08-14T18:21:56.930627Z","submitted_at":"2018-09-28T18:00:00Z","title":"Fluctuation-dissipation relations for stochastic gradient descent","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.00004","snapshot_observed_at":"2026-08-07T13:30:29.286244Z","title":"Fluctuation-dissipation relations for stochastic gradient descent","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","snapshot_observed_at":"2026-08-16T04:31:31.429766Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T13:30:29.286244Z"},"links":{"cited_paper":"/paper/1810.00004","citing_paper":"/paper/2505.21651"},"observation_digest":"sha256:0b225f828d8fab7006e7f985b92254b223a485fd6382ac64b24e0e59bb394c68","observation_id":"563ed8bc-d756-4a3a-a11e-8f9e3f48bb71","resolution":{"observed_at":"2026-08-07T13:30:29.286244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.21651","last_updated":"2025-05-27T18:25:21Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T04:31:31.429766Z","submitted_at":"2025-05-27T18:25:21Z","title":"AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent"},"reference_resolution":{"displayed":56,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":12,"verified_exact":2,"verified_fuzzy":42},"total_outbound_references":56},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 0 inbound Pith citation observations for arXiv:2505.21651."}