{"as_of":"2026-08-15T18:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f9a787ab702107f2dbe363f443942e8f1d01acf0f6a8b96287555d159802874b","coverage":[{"denominator":72,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":72,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:10:18.346914Z","state":"measured"},{"denominator":74,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":74,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:35:24.103094Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-18T18:46:45.040439Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-10T15:27:55.230768Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23081","snapshot_observed_at":"2026-08-06T23:35:24.103094Z","title":"Gradient methods with online scaling part i","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17650","last_updated":"2025-06-21T09:20:30Z","snapshot_observed_at":"2026-08-15T00:11:55.773963Z","submitted_at":"2025-06-21T09:20:30Z","title":"Enhanced PDHG for Linear Programming with Online Preconditioning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:24.103094Z"},"links":{"cited_paper":"/paper/2505.23081","citing_paper":"/paper/2506.17650"},"observation_digest":"sha256:c255c29186c6a3660cb1e4d8d155fc637e07ad3509018279e61ecc86b114c0e0","observation_id":"ff55bcce-22c1-47d3-8546-124f443adfee","resolution":{"observed_at":"2026-08-06T23:35:24.103094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-10T15:27:55.230768Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"cited_work":{"arxiv_id":"2505.23081","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23081","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gradient methods with online scaling part i","venue":null,"work_id":"c67ab1fc-21de-4939-89c5-d833c45ac7c8","year":2025},"citing_paper":{"arxiv_id":"2509.05288","last_updated":"2026-04-14T06:59:33Z","snapshot_observed_at":"2026-07-06T22:24:42.849960Z","submitted_at":"2025-09-05T17:55:22Z","title":"Learning to accelerate distributed ADMM using graph neural networks","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-18T18:46:36.084583Z"},"links":{"cited_paper":"/paper/2505.23081","citing_paper":"/paper/2509.05288"},"observation_digest":"sha256:6698019d7c096d3c0e9415dc9f5ef328a1e19727eefcb3d2b66c185555956ce7","observation_id":"d0b4f173-62f7-41a0-89ae-6cc9a6d201e3","resolution":{"observed_at":"2026-05-18T18:46:45.043079Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.23081/citation-record","integrity":"/paper/2505.23081/integrity","json":"/paper/2505.23081/citation-record.json","paper":"/paper/2505.23081"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2002.11803","last_updated":"2020-02-26T21:42:49Z","snapshot_observed_at":"2026-08-12T17:50:20.963411Z","submitted_at":"2020-02-26T21:42:49Z","title":"Disentangling Adaptive Gradient Methods from Learning Rates","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.11803","snapshot_observed_at":"2026-08-07T13:10:06.894473Z","title":"Disentangling adaptive gradient methods from learning rates.CoRR, abs/2002.11803, 2020","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-10T15:27:55.230768Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:06.894473Z"},"links":{"cited_paper":"/paper/2002.11803","citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:538abb6214b17e5ef27cfaccc513c47b6e4566a10cd9b8b4dc988d6e0b6c93a8","observation_id":"582a86a0-fd6c-4ea8-b92a-5d0679058bde","resolution":{"observed_at":"2026-08-07T13:10:06.894473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:33.029777Z","title":"Parameter adaptation in stochastic optimization","venue":null,"work_id":"9a1a058b-0da6-46dc-81bd-b603b184e4dc","year":1999},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-10T15:27:55.230768Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:06.990413Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:61ad66c5f4a0fb72f8c52b5832522ef161fbd93a90fe12cf188d171181c01e48","observation_id":"211f7c72-ff18-4c09-98d4-96bdf3d248f3","resolution":{"observed_at":"2026-08-07T13:10:33.100819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:32.824543Z","title":"Acceleration by stepsize hedging: Silver stepsize schedule for smooth convex optimization.Mathematical Programming, pages 1–14, 2024","venue":null,"work_id":"4e955f75-bfaa-48a4-8fd4-d556f4fa0f70","year":2024},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-10T15:27:55.230768Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:07.143282Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:b711de5b61bd25ff673a50169c71e61cd143c0df9912b147a7a03efd1469ee70","observation_id":"599fe075-96bd-486d-81b3-a6cdd78f65b6","resolution":{"observed_at":"2026-08-07T13:10:32.891809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:32.649821Z","title":"Acceleration by stepsize hedging: Multi-step descent and the silver stepsize schedule.Journal of the ACM, 72(2):1–38, 2025","venue":null,"work_id":"bf6b0d6a-6717-4ffb-a76d-42ec544c743e","year":2025},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-10T15:27:55.230768Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:07.264191Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:c195688b75fc92918a18af3f34b337ca09e20fdc89f2e97e3bae3720db146101","observation_id":"97a905fd-c4f7-41c4-8a17-67139bb6e03d","resolution":{"observed_at":"2026-08-07T13:10:32.749701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:32.379118Z","title":"Practical large-scale linear programming using primal-dual hybrid gradient.Advances in Neural Information Processing Systems, 34:20243–20257, 2021","venue":null,"work_id":"42b03eb5-7fd4-45bc-b935-caeec2c681f5","year":2021},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-10T15:27:55.230768Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:07.400967Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:173698a6891d77b8c47e10d5a6b429c6843fbd1b5ed7c887ed3eb89fba1aa495","observation_id":"c5b313fa-e5df-4908-9b14-6441dfa666ba","resolution":{"observed_at":"2026-08-07T13:10:32.470056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:32.135525Z","title":"Two-point step size gradient methods.IMA journal of numerical analysis, 8(1):141–148, 1988","venue":null,"work_id":"9ccf283e-c054-4f02-8500-b91853b2cc1c","year":1988},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-10T15:27:55.230768Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:07.573874Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:ca20766c48ee57d6f5b62f0116f68109dd40ae3f1e0dbe961c4d7a3fdb687801","observation_id":"685e8275-53dd-47c0-af85-624b89fa7cc4","resolution":{"observed_at":"2026-08-07T13:10:32.237528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:31.905875Z","title":"Online learning rate adaptation with hypergradient descent","venue":null,"work_id":"6f132f0e-e2c2-42de-9c33-1f57155e231d","year":2018},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-10T15:27:55.230768Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:07.744515Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:04108e14dbaaf54c2be7b4b289234fb0105e5115157a8d32af7ce6493cc8d1a2","observation_id":"e00dd785-aae5-44e8-8e37-adb003f682b6","resolution":{"observed_at":"2026-08-07T13:10:31.987009Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:31.610966Z","title":"Gradient descent: The ultimate optimizer.Advances in Neural Information Processing Systems, 35:8214–8225, 2022","venue":null,"work_id":"05c4fc25-aa57-49e2-87d6-02e84fcb51ce","year":2022},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-10T15:27:55.230768Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:07.900330Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:704bac781f1cb791af79ad5e8abe3d281550dddb309065a67cd6544494fa210f","observation_id":"e0b9c6f3-bd1d-4b8a-9d02-fa5d750a7e55","resolution":{"observed_at":"2026-08-07T13:10:31.773172Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11229","last_updated":"2025-03-16T21:17:53Z","snapshot_observed_at":"2026-08-14T12:26:13.093377Z","submitted_at":"2025-02-16T18:49:02Z","title":"Provable and Practical Online Learning Rate Adaptation with Hypergradient Descent","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11229","snapshot_observed_at":"2026-08-07T13:10:07.974495Z","title":"Provable and practical online learning rate adaptation with hypergradient descent.arXiv preprint arXiv:2502.11229, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-10T15:27:55.230768Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:07.974495Z"},"links":{"cited_paper":"/paper/2502.11229","citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:c289ff7b5552dcee604d9fd8de7a4e75f54ac5501708218417e3c5476a3a3234","observation_id":"08be7905-0102-40c6-a315-5309d64fbfbe","resolution":{"observed_at":"2026-08-07T13:10:07.974495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:31.376217Z","title":"Non-monotonebehavioroftheheavyballmethod","venue":null,"work_id":"ec740093-238c-4a0e-981b-cab2795d62c1","year":2018},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-10T15:27:55.230768Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:08.166282Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:c57f9c6650982bef1b99a494da8dd3e6ab5e21ee984883db216257cc22648fd2","observation_id":"cc825b92-a85e-441e-ac2f-0b5ca3016d0c","resolution":{"observed_at":"2026-08-07T13:10:31.467420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:31.188771Z","title":"An enhanced alternating direction method of multipliers-based interior point method for linear and conic optimization.INFORMS Journal on Computing, 2024","venue":null,"work_id":"01a61fa0-6478-4c03-a2bd-cb49de55e0ce","year":2024},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-10T15:27:55.230768Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:08.339118Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:b9f4e5a377a4d6c3ac5db0412d7a13bbec80ed03ee6c2ebb30716ac6c09f2bbe","observation_id":"698dab72-3f8c-4753-9886-28607abc2b74","resolution":{"observed_at":"2026-08-07T13:10:31.295597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06319","last_updated":"2026-04-16T15:15:47Z","snapshot_observed_at":"2026-08-15T16:02:41.300430Z","submitted_at":"2024-12-09T09:13:54Z","title":"Uniformly Optimal and Parameter-free First-order Methods for Convex and Function-constrained Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06319","snapshot_observed_at":"2026-08-07T13:10:08.488432Z","title":"Uniformly optimal and parameter-free first-order methods for convex and function-constrained optimization.arXiv preprint arXiv:2412.06319, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-10T15:27:55.230768Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:08.488432Z"},"links":{"cited_paper":"/paper/2412.06319","citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:1f732e7125bf67367d10d9448ef5f645bde3dc4ec25ef35a0ec6a5bbee8e0d36","observation_id":"ad823aab-24c0-474f-b3ef-d0b9e2921766","resolution":{"observed_at":"2026-08-07T13:10:08.488432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:30.958476Z","title":"Adaptive subgradient methods for online learning and stochas- tic optimization.Journal of machine learning research, 12(7), 2011","venue":null,"work_id":"62379173-d010-41e3-af9c-063b214c28ee","year":2011},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-10T15:27:55.230768Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:08.656273Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:5f905c2963242798cfe76d06fca5489a579a5699a4a94333a0bb6ad12e721d3e","observation_id":"700875c0-508d-452e-81d6-ddfa3eec3544","resolution":{"observed_at":"2026-08-07T13:10:31.076594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:30.628692Z","title":"John Wiley & Sons, 2000","venue":null,"work_id":"86f75c70-f6eb-4259-afd6-0da9e1efa280","year":2000},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-10T15:27:55.230768Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:08.809382Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:030952612c8babd6790b7f985c503acde4dd39b678d44022825d2fc75a3dffd2","observation_id":"36c42a4e-7125-48b8-9783-19a765fb6ca4","resolution":{"observed_at":"2026-08-07T13:10:30.834841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01803","last_updated":"2024-11-05T21:16:44Z","snapshot_observed_at":"2026-08-12T22:08:36.636522Z","submitted_at":"2024-11-04T05:04:18Z","title":"Gradient Methods with Online Scaling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01803","snapshot_observed_at":"2026-08-07T13:10:09.008540Z","title":"Gradient methods with online scaling.arXiv preprint arXiv:2411.01803, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-10T15:27:55.230768Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:09.008540Z"},"links":{"cited_paper":"/paper/2411.01803","citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:a29199914c4ced76da7ead39c52f340e4a289baf7b13fe2abf76402ac9ad82de","observation_id":"3ea42a4d-5fdf-4220-b05e-a03902fc660f","resolution":{"observed_at":"2026-08-07T13:10:09.008540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15594","last_updated":"2024-11-05T21:38:35Z","snapshot_observed_at":"2026-08-13T04:54:22.852834Z","submitted_at":"2023-12-25T03:05:09Z","title":"Scalable Approximate Optimal Diagonal Preconditioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15594","snapshot_observed_at":"2026-08-07T13:10:09.165212Z","title":"Scalable approximate optimal diagonal pre- conditioning.arXiv preprint arXiv:2312.15594, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-10T15:27:55.230768Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:09.165212Z"},"links":{"cited_paper":"/paper/2312.15594","citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:d515cdc2a639d0845bfd4bada9c0daddfadec91b8680a366140fb2e93e86817b","observation_id":"e3cc866c-4d62-4b8a-b00e-b6e99c6b6d3f","resolution":{"observed_at":"2026-08-07T13:10:09.165212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12762","last_updated":"2024-05-21T13:15:19Z","snapshot_observed_at":"2026-08-13T00:02:59.948350Z","submitted_at":"2024-05-21T13:15:19Z","title":"Clarabel: An interior-point solver for conic programs with quadratic objectives","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12762","snapshot_observed_at":"2026-08-07T13:10:09.347627Z","title":"Clarabel: An interior-point solver for conic programs with quadratic objectives.arXiv preprint arXiv:2405.12762, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-10T15:27:55.230768Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:09.347627Z"},"links":{"cited_paper":"/paper/2405.12762","citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:da9cd3ec545e9d333088f56882881d9b7ee5c3e1d6fe874a37513621aaf358df","observation_id":"d7242c41-90e9-4302-98c0-6a9148e4e5ac","resolution":{"observed_at":"2026-08-07T13:10:09.347627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:30.428398Z","title":"Shampoo: Preconditioned stochastic tensor optimization","venue":null,"work_id":"161376e4-0769-4efc-a3f5-e5c18b6ab57a","year":2018},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-10T15:27:55.230768Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:09.577230Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:fcd2b60761c61636ce323acbf48f1de9ea0e5caefe68438b0ec119578a886ddc","observation_id":"34e87645-c7c9-4b16-a7d6-cb95dde4dbfd","resolution":{"observed_at":"2026-08-07T13:10:30.552063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:30.096306Z","title":"Introduction to online convex optimization.Foundations and Trends®in Optimization, 2(3-4):157–325, 2016","venue":null,"work_id":"8dbbd75b-863f-4ae1-9328-d7b769745209","year":2016},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-10T15:27:55.230768Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:09.773950Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:aadbf118efa0624f37b57589e147293d05f92c5c9b26621a96682c3c72bd6ec4","observation_id":"e82d314b-437f-4135-a23d-8f672afdbcf5","resolution":{"observed_at":"2026-08-07T13:10:30.256654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.00313","last_updated":"2022-08-02T17:48:25Z","snapshot_observed_at":"2026-08-14T16:38:47.494236Z","submitted_at":"2019-05-01T13:47:40Z","title":"Revisiting the Polyak step size","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.00313","snapshot_observed_at":"2026-08-07T13:10:09.962195Z","title":"Revisiting the polyak step size.arXiv preprint arXiv:1905.00313, 2019","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-10T15:27:55.230768Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:09.962195Z"},"links":{"cited_paper":"/paper/1905.00313","citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:7d0956363592f7bd392673f9c99dcc77ec2ab1cf4192a9181841b3ce39ab5893","observation_id":"830e8eff-9523-47ee-986c-3c8d79cc32c5","resolution":{"observed_at":"2026-08-07T13:10:09.962195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:29.804878Z","title":"Adaptive online gradient descent.Advances in neural information processing systems, 20, 2007","venue":null,"work_id":"87fddb71-7421-44bf-af96-28f94abbdb52","year":2007},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-10T15:27:55.230768Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:10.093964Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:13f8abe6fe8e85f46b8bd81fddb545f69da4952285cda354e840f97895c5f48e","observation_id":"da8727a2-61f7-4d95-a314-16abdb8e8882","resolution":{"observed_at":"2026-08-07T13:10:29.949825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:29.477866Z","title":"Neural networks for machine learning lecture 6a overview of mini-batch gradient descent.Cited on, 14(8):2, 2012","venue":null,"work_id":"2bfbc853-019e-4c31-9aa4-2a2d4cddc3bb","year":2012},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-10T15:27:55.230768Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:10.226107Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:b4b9860aac7f4e0b6e16bce8b64d563d22637a7d77b5da70e7aeb686a98f106b","observation_id":"c3541b60-4e1e-4b6e-bb89-7d2e4984a221","resolution":{"observed_at":"2026-08-07T13:10:29.627509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16160","last_updated":"2024-10-05T18:27:53Z","snapshot_observed_at":"2026-08-12T23:58:12.122465Z","submitted_at":"2024-05-25T09:59:39Z","title":"Restarted Primal-Dual Hybrid Conjugate Gradient Method for Large-Scale Quadratic Programming","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16160","snapshot_observed_at":"2026-08-07T13:10:10.367209Z","title":"Restarted primal-dual hybrid conjugate gradient method for large-scale quadratic programming.arXiv preprint arXiv:2405.16160, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-10T15:27:55.230768Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:10.367209Z"},"links":{"cited_paper":"/paper/2405.16160","citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:e3cc17df6bd234a7d99db2ed54e8a1d57ea6de3d3f286b77c9fdb7a45cb38611","observation_id":"e6011afc-fe50-4103-97f7-d1c2d57e712e","resolution":{"observed_at":"2026-08-07T13:10:10.367209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:29.222791Z","title":"Increased rates of convergence through learning rate adaptation.Neural networks, 1(4):295–307, 1988","venue":null,"work_id":"fb6b0b7a-356f-4c1b-b1bd-06be078e1606","year":1988},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-10T15:27:55.230768Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:10.441402Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:15f440bc5125cd779893c5a9aa4c72f7ac90a22a70da4e559aafd8ab3d8cf0a9","observation_id":"242d1643-d6d3-4f2e-a90a-ef7b5f1ef31c","resolution":{"observed_at":"2026-08-07T13:10:29.321487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:29.085833Z","title":"Unconstrained online learning with unbounded losses","venue":null,"work_id":"be8e7dfe-cd9d-4f51-839f-5bb3a3008c99","year":2023},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-10T15:27:55.230768Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:10.614661Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:6d48fce3d606f9b7675025af2ae20a349b7395e718b9998eb56e1061b4fd771b","observation_id":"d1204d1f-fbf2-41b4-ab6e-d79bf1ea9980","resolution":{"observed_at":"2026-08-07T13:10:29.152637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:28.854155Z","title":"Online learning guided curvature approximation: A quasi-newton method with global non-asymptotic superlinear convergence","venue":null,"work_id":"0287d85f-c36e-410a-80ea-6dd614fc2c2f","year":1962},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-10T15:27:55.230768Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:10.776182Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:51755f316ebd78499411bfb0aacc232cf5bc335b5abb2f6ad1238d29672825c0","observation_id":"21918e13-066d-48bb-9e7c-8b7f63fc7b0b","resolution":{"observed_at":"2026-08-07T13:10:28.917531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02626","last_updated":"2024-10-03T16:08:16Z","snapshot_observed_at":"2026-08-14T18:47:19.227100Z","submitted_at":"2024-10-03T16:08:16Z","title":"Online Learning Guided Quasi-Newton Methods with Global Non-Asymptotic Convergence","version":1},"cited_work":{"arxiv_id":"2410.02626","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.02626","snapshot_observed_at":"2026-08-07T13:10:18.878295Z","title":"Online Learning Guided Quasi-Newton Methods with Global Non-Asymptotic Convergence","venue":"math.OC","work_id":"d29c4cd3-5b8d-418c-a40c-d06e53c015b3","year":2024},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-10T15:27:55.230768Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:10.986354Z"},"links":{"cited_paper":"/paper/2410.02626","citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:463d7c5eb1a564ebdd2de7798df03e34428be895d38bf9b6a70cef0fda0e73d0","observation_id":"e4d11c3a-afaf-4ef0-bdf8-fd298e008b85","resolution":{"observed_at":"2026-08-07T13:10:19.028351Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:28.702424Z","title":"Adaptive hierarchical hyper-gradient descent.International Journal of Machine Learning and Cybernetics, 13(12):3785–3805, 2022","venue":null,"work_id":"b88d481f-d654-4a76-8b32-108ce0e2961b","year":2022},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-10T15:27:55.230768Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:11.149792Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:1e6788c0cf49c975444cc8c08fa9442d8ddfe0696f3c29cfebd149bee84c6a33","observation_id":"1a392729-b1cc-4389-b592-503af395f9af","resolution":{"observed_at":"2026-08-07T13:10:28.781008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16731","last_updated":"2025-01-08T01:41:29Z","snapshot_observed_at":"2026-08-15T04:18:10.471507Z","submitted_at":"2024-04-25T16:41:57Z","title":"Non-asymptotic Global Convergence Analysis of BFGS with the Armijo-Wolfe Line Search","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16731","snapshot_observed_at":"2026-08-07T13:10:11.348183Z","title":"Non-asymptotic global convergence analysis of bfgs with the armijo-wolfe line search.arXiv preprint arXiv:2404.16731, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-10T15:27:55.230768Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:11.348183Z"},"links":{"cited_paper":"/paper/2404.16731","citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:edff6f835396438b33c5d8ace09fe80ec105ccc8dc6c8aa165a32744eb3ab2a2","observation_id":"b509697c-f221-4fff-983a-ed592bab0dd8","resolution":{"observed_at":"2026-08-07T13:10:11.348183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01267","last_updated":"2025-07-15T00:34:40Z","snapshot_observed_at":"2026-08-13T00:39:56.487209Z","submitted_at":"2024-04-01T17:44:07Z","title":"Non-asymptotic Global Convergence Rates of BFGS with Exact Line Search","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01267","snapshot_observed_at":"2026-08-07T13:10:11.500660Z","title":"Non-asymptotic global convergence rates of bfgs with exact line search.arXiv preprint arXiv:2404.01267, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-10T15:27:55.230768Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:11.500660Z"},"links":{"cited_paper":"/paper/2404.01267","citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:673bd88c36d3cafd1bde2f0bc2e660f3d30c592b163dde7cd19177ec48418bde","observation_id":"e0306c6a-5ece-4e3e-996c-773dbf121f8e","resolution":{"observed_at":"2026-08-07T13:10:11.500660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:28.463198Z","title":"Non-asymptotic superlinear convergence of standard quasi-newton methods.Mathematical Programming, 200(1):425–473, 2023","venue":null,"work_id":"890c22d9-a842-4cc7-8b29-7d75a5e1e67b","year":2023},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-10T15:27:55.230768Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:11.664806Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:28ea5aeedd1c9e073b5c2a4d512a5758096921c09bc9def4b6494867d641a744","observation_id":"2b6fc337-097e-43af-b5ff-a957bed4e696","resolution":{"observed_at":"2026-08-07T13:10:28.586015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-14T18:51:16.666127Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-07T13:10:11.796601Z","title":"Adam: A method for stochastic optimization.arXiv preprint arXiv:1412.6980, 2014","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-10T15:27:55.230768Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:11.796601Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:05ed06a43172a47897ca819b90bfaa85454e07c6f1861a441c391b7bb53b50df","observation_id":"fd73d695-ef08-4ce8-833b-5df61ebae305","resolution":{"observed_at":"2026-08-07T13:10:11.796601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:28.225160Z","title":"Searching for optimal per-coordinate step-sizes with multidimensional backtracking.Advances in Neural Information Processing Systems, 36, 2024","venue":null,"work_id":"94db2d01-b4a8-4114-bdfe-beab812e5b15","year":2024},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-10T15:27:55.230768Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:11.949488Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:2a6931b7cabd599141fb45aaac0d3f4d53f241dc1e7de528539b1ed8a630281a","observation_id":"cda76596-1567-42f0-935a-41cdfc408c9f","resolution":{"observed_at":"2026-08-07T13:10:28.347020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12139","last_updated":"2024-11-15T12:23:42Z","snapshot_observed_at":"2026-08-14T17:36:49.941779Z","submitted_at":"2023-10-18T17:50:13Z","title":"Optimal and parameter-free gradient minimization methods for convex and nonconvex optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12139","snapshot_observed_at":"2026-08-07T13:10:12.138443Z","title":"Optimal and parameter-free gradient minimization methods for smooth optimization.arXiv preprint arXiv:2310.12139, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-10T15:27:55.230768Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:12.138443Z"},"links":{"cited_paper":"/paper/2310.12139","citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:569523d201ff0fe4bdc97cbf58b392ad8c92c0f56623c3628d77d07c65754f1e","observation_id":"2f51d06b-a0fb-4662-b0ab-143ebea5d09d","resolution":{"observed_at":"2026-08-07T13:10:12.138443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10082","last_updated":"2024-08-17T03:06:14Z","snapshot_observed_at":"2026-08-13T22:26:32.905743Z","submitted_at":"2023-10-16T05:26:03Z","title":"A simple uniformly optimal method without line search for convex optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10082","snapshot_observed_at":"2026-08-07T13:10:12.329475Z","title":"A simple uniformly optimal method without line search for convex opti- mization.arXiv preprint arXiv:2310.10082, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-10T15:27:55.230768Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:12.329475Z"},"links":{"cited_paper":"/paper/2310.10082","citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:40df42744aa4070c3febf368bfb4d30f3c1b2ebf5428e1f3ef27410f6f7e6716","observation_id":"5f05fe23-b761-4118-9756-402baffd1343","resolution":{"observed_at":"2026-08-07T13:10:12.329475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:27.924457Z","title":"A second look at exponential and cosine step sizes: Simplicity, adaptivity, and performance","venue":null,"work_id":"0ecbc6e3-f5bc-499c-b31e-0d282522f925","year":null},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-10T15:27:55.230768Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:12.491677Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:81dbcfad17385744e23cbf12efd15139e5649ee1cfcd55475229b8a60ebafe7a","observation_id":"22afb333-41fb-4049-a4ec-f93bc7ff20bc","resolution":{"observed_at":"2026-08-07T13:10:28.024072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:27.357164Z","title":"An admm-based interior-point method for large-scale linear programming.Optimization Methods and Software, 36(2-3):389–424, 2021","venue":null,"work_id":"53a695de-bc72-47ff-a265-7dac336deee3","year":2021},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-10T15:27:55.230768Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:12.806062Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:221efbee5b66b92a8ab9b57ce9b41a85b639fb85b44091fe3b04915f0e7dfba7","observation_id":"58b31885-133b-402d-846b-f502f5e517c4","resolution":{"observed_at":"2026-08-07T13:10:27.490108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:13.017954Z","title":"Pdcs: A primal-dual large-scale conic programming solver with gpu enhancements.arXiv preprint arXiv:2505.00311, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-10T15:27:55.230768Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:13.017954Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:412267ea2cf0471e780789c790978c44bee6553067ef271619ba09f315afac0b","observation_id":"10ffd99f-c795-4c93-9a25-2bc8a81907fd","resolution":{"observed_at":"2026-08-07T13:10:13.017954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12180","last_updated":"2024-06-07T16:51:52Z","snapshot_observed_at":"2026-08-13T22:15:18.275057Z","submitted_at":"2023-11-20T20:50:49Z","title":"cuPDLP.jl: A GPU Implementation of Restarted Primal-Dual Hybrid Gradient for Linear Programming in Julia","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12180","snapshot_observed_at":"2026-08-07T13:10:13.221669Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-10T15:27:55.230768Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:13.221669Z"},"links":{"cited_paper":"/paper/2311.12180","citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:55542e035a10d721051a2772b1acc369fd189b0b49cb7439f9610540e0d5e1a4","observation_id":"13043e44-b86d-454d-b3e1-a3d1cf0a2a7e","resolution":{"observed_at":"2026-08-07T13:10:13.221669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14832","last_updated":"2024-01-07T06:52:56Z","snapshot_observed_at":"2026-08-13T04:55:07.778551Z","submitted_at":"2023-12-22T17:07:50Z","title":"cuPDLP-C: A Strengthened Implementation of cuPDLP for Linear Programming by C language","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14832","snapshot_observed_at":"2026-08-07T13:10:13.373008Z","title":"cupdlp-c: A strengthened implementation of cupdlp for linear programming by c language.arXiv preprint arXiv:2312.14832, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-10T15:27:55.230768Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:13.373008Z"},"links":{"cited_paper":"/paper/2312.14832","citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:d2323d076d18037b2977d0540217bc969e4f38c01e7de4d06f4ecec75cc4e723","observation_id":"86ae7d01-ff31-4cda-8697-9c946a456fef","resolution":{"observed_at":"2026-08-07T13:10:13.373008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:26.888478Z","title":"Tuning-freestep-size adaptation","venue":null,"work_id":"6042875f-7f7a-4698-8ded-c175448accd0","year":2012},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-10T15:27:55.230768Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:13.492046Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:595f1d9bc5fea8ce6ddf25b2e877ce1cac95f2ede4629599c889c3f942bc11d5","observation_id":"8cb11ec2-df2b-4407-8d46-3c97fdc6e0e8","resolution":{"observed_at":"2026-08-07T13:10:27.135518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:26.498775Z","title":"Adaptive gradient descent without descent","venue":null,"work_id":"546e5490-4cc4-418f-b3f6-1a2a0f45a7c2","year":2020},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-10T15:27:55.230768Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:13.621772Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:55b24a363e6e6f61438cab3c84250d68bef80153fc0895de99778f45cb37dc50","observation_id":"d537402d-9002-461e-9a01-fd926b69f4ad","resolution":{"observed_at":"2026-08-07T13:10:26.619015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:26.175119Z","title":"Adaptive proximal gradient method for convex optimization","venue":null,"work_id":"f616902d-1750-43ae-ab9c-7f98295789c0","year":2024},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-10T15:27:55.230768Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:13.774680Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:581ba16629dfeda1cb5b81ec4886e31dec1c132679bc3fbc1ff9a2818b137f33","observation_id":"690cc81a-7386-4bb0-b398-2d4fd274d894","resolution":{"observed_at":"2026-08-07T13:10:26.349459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1002.4908","last_updated":"2010-07-07T19:07:16Z","snapshot_observed_at":"2026-08-15T05:25:29.252288Z","submitted_at":"2010-02-26T01:36:34Z","title":"Adaptive Bound Optimization for Online Convex Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1002.4908","snapshot_observed_at":"2026-08-07T13:10:13.932005Z","title":"Adaptive bound optimization for online convex optimization","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-10T15:27:55.230768Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:13.932005Z"},"links":{"cited_paper":"/paper/1002.4908","citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:737fd1b90267d95ac7d2b6584da2520599b62ab3096995a1aec75a5c57b23928","observation_id":"405bcadf-473c-4c53-892d-48321954815b","resolution":{"observed_at":"2026-08-07T13:10:13.932005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:25.872299Z","title":null,"venue":null,"work_id":"0b863517-c060-4504-9f0e-8f295afb53d5","year":2004},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-10T15:27:55.230768Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:14.074627Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:093f5b394d08d78b45bd3a644b832fcc0dee6b96435eab9c741a98f9dc256bb0","observation_id":"3eea46ed-ab74-43c5-9a9f-6f1a7e1fb9f5","resolution":{"observed_at":"2026-08-07T13:10:26.037314Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:25.563493Z","title":"Linear convergence of first order methods for non-strongly convex optimization.Mathematical Programming, 175:69–107, 2019","venue":null,"work_id":"0b4566f3-94d3-4365-88b9-72794b9631a3","year":2019},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-10T15:27:55.230768Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:14.243941Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:3834ce110be361c267509850f509c04aaa86dce6465aa46d5c91acdae20f0071","observation_id":"cda48efa-20d9-41cb-84ca-4dcc1c763e04","resolution":{"observed_at":"2026-08-07T13:10:25.725934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:25.268859Z","title":"A method for solving the convex programming problem with convergence rate o (1/k2)","venue":null,"work_id":"a75906b9-eb2c-4787-bf0e-f327f5bfed27","year":1983},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-10T15:27:55.230768Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:14.377838Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:4169148dd8a6f1504ee913a2019d07cd2a2ad2ab9c1a19a1f9c5441391a04b0a","observation_id":"a97f9952-f43a-4b26-ab3b-4bad7f9a6d42","resolution":{"observed_at":"2026-08-07T13:10:25.422538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:24.982451Z","title":"Springer Science & Business Media, 2013","venue":null,"work_id":"7ce925b4-c21f-4507-8aac-0cd3583fdb12","year":2013},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-10T15:27:55.230768Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:14.540097Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:c0a20034e5af7cd0d69f1839acfcdf84854681179b52ad32a1ac148707c66c9e","observation_id":"af122e1a-fd8f-45d9-8581-b8e70602774c","resolution":{"observed_at":"2026-08-07T13:10:25.146817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:24.718253Z","title":"Springer, 1999","venue":null,"work_id":"0cbb2c04-ecc1-4d36-8a10-bf1da2a4cffc","year":1999},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-10T15:27:55.230768Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:14.688071Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:db30c44ed14725c58dfb67d4f864315517268d5c083c2b334090dad67772d6dd","observation_id":"b6fd424a-635e-4a24-b603-d5275a7a25a8","resolution":{"observed_at":"2026-08-07T13:10:24.847880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:24.474661Z","title":"Conic optimization via operator splitting and homogeneous self-dual embedding.Journal of Optimization Theory and Applications, 169:1042–1068,","venue":null,"work_id":"e4e0a20e-f31d-4cd6-ad30-b514b0270098","year":null},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-10T15:27:55.230768Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:14.887592Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:6ffcf19cda6e9c0cc02800324b4e7e5bcedbf0beffd234324da34c1709810bd7","observation_id":"073b82e1-a03a-4f53-9384-b6868aad5493","resolution":{"observed_at":"2026-08-07T13:10:24.596628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.13213","last_updated":"2026-06-21T08:13:27Z","snapshot_observed_at":"2026-08-15T05:32:55.984958Z","submitted_at":"2019-12-31T08:16:31Z","title":"Online Learning: A Modern Introduction Using Convex Optimization","version":10},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.13213","snapshot_observed_at":"2026-08-07T13:10:15.037964Z","title":"A modern introduction to online learning.arXiv preprint arXiv:1912.13213, 2019","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-10T15:27:55.230768Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:15.037964Z"},"links":{"cited_paper":"/paper/1912.13213","citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:6193a56c11217e08227a0dd1bcd220e04543fd5a7429389a6ea01d6b47519c5e","observation_id":"8fad7c9b-8518-43ef-9b02-cd5c18cbbc9c","resolution":{"observed_at":"2026-08-07T13:10:15.037964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:24.176378Z","title":"Coin betting and parameter-free online learning.Advances in Neural Information Processing Systems, 29, 2016","venue":null,"work_id":"fc226b45-6de2-4b24-8766-ecd7684fb41f","year":2016},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-10T15:27:55.230768Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:15.203695Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:9bd3926d23ca1c8cec9559f125b1dcabc606832dfa7a53df353b8d66e6e4cd57","observation_id":"11c62399-0f76-4282-9aeb-3c8a61671e7f","resolution":{"observed_at":"2026-08-07T13:10:24.353932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:23.803472Z","title":"MADA: Meta-adaptive optimizers through hyper-gradient descent","venue":null,"work_id":"c4710ea3-4b71-4f17-88f0-4b1c86bfe187","year":2024},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-10T15:27:55.230768Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:15.404845Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:b0f4d54c0bdb89db77aca55dedc7e6b93943629cc93512eb01a58487da43bd25","observation_id":"a2d47ced-c099-4894-b9ba-99dab4fdbcd4","resolution":{"observed_at":"2026-08-07T13:10:23.997951Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:23.329703Z","title":"Introduction to optimization","venue":null,"work_id":"1ecd8d45-7f62-4de1-9983-d786fd978265","year":1987},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-10T15:27:55.230768Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:15.614007Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:840e35baa3e17367ff55583877605c32536c7bdbfe005ed0a3f98c8a6a472387","observation_id":"7d629dba-c740-40a2-b598-0f19e07ecefa","resolution":{"observed_at":"2026-08-07T13:10:23.506836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:23.011310Z","title":"Optimal diagonal precondi- tioning.Operations Research, 2024","venue":null,"work_id":"1bae0e56-66e1-433a-a575-bab0bb89c329","year":2024},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-10T15:27:55.230768Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:15.729222Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:2423d030c4c99e6265472596e46821cf08395403c95fce677526abe239fa998c","observation_id":"0473bbe0-f075-45ac-a88c-d90e57b30df4","resolution":{"observed_at":"2026-08-07T13:10:23.187929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:22.765811Z","title":"Lecture notes on online learning draft, 2009","venue":null,"work_id":"00f42701-cbda-43dc-9475-8597147b5dfc","year":2009},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-10T15:27:55.230768Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:15.885167Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:34f6bb3b4284b12662c778cd3a59f2de8f6e2ee9d69cb3301ba69ef7f2a6562d","observation_id":"e227455b-df14-4f60-8c1d-8ac694052ba0","resolution":{"observed_at":"2026-08-07T13:10:22.888468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09237","last_updated":"2019-04-19T16:21:38Z","snapshot_observed_at":"2026-08-14T16:43:55.734754Z","submitted_at":"2019-04-19T16:21:38Z","title":"On the Convergence of Adam and Beyond","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09237","snapshot_observed_at":"2026-08-07T13:10:16.063965Z","title":"On the convergence of adam and beyond.arXiv preprint arXiv:1904.09237, 2019","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-10T15:27:55.230768Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:16.063965Z"},"links":{"cited_paper":"/paper/1904.09237","citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:4b4ca139a97cdb2ae6f72d4511741cc1c85c47819b0d01569e7fd24c82852c0b","observation_id":"deef3e93-5088-46c0-b9e4-f524ea99ca99","resolution":{"observed_at":"2026-08-07T13:10:16.063965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:22.581689Z","title":"Greedy quasi-newton methods with explicit superlinear conver- gence.SIAM Journal on Optimization, 31(1):785–811, 2021","venue":null,"work_id":"e1fdcb75-7b70-4b81-888a-e7799c4b9164","year":2021},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-10T15:27:55.230768Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:16.251549Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:993c926554ca20a0947bb1957829998f3458f35c98d7f0dcf12e889ba0de157c","observation_id":"07821767-069b-4dad-ada2-b1eb6a819236","resolution":{"observed_at":"2026-08-07T13:10:22.657859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:22.360902Z","title":"New results on superlinear convergence of classical quasi-newton methods.Journal of optimization theory and applications, 188:744–769, 2021","venue":null,"work_id":"ef8bb264-cb10-4877-a2ad-e75b15d40887","year":2021},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-10T15:27:55.230768Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:16.373687Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:a27b63bafaa92ae9b87ab08043c1921f85bdb4f3add3063a95d23bbb610441b6","observation_id":"fcd11103-fce6-4d6e-9177-588f55060dc1","resolution":{"observed_at":"2026-08-07T13:10:22.492178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:22.019409Z","title":"Ratesofsuperlinearconvergenceforclassicalquasi-newtonmethods","venue":null,"work_id":"05dc4859-d054-459d-8475-0a114910c43b","year":2022},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-10T15:27:55.230768Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:16.529064Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:87d04478e9e70fbe11f6ef9688dadc9debe40885ecdd7eedd564ac2570134d0d","observation_id":"50bcfa29-c047-477c-aa49-627546b67153","resolution":{"observed_at":"2026-08-07T13:10:22.203383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:21.756489Z","title":"Convergence analysis of an adaptive method of gradient descent.University of Oxford, Oxford, M","venue":null,"work_id":"1bacef58-34e9-4b75-a56d-32a3e0f58c90","year":2017},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-10T15:27:55.230768Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:16.744234Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:ae438822257f27af1534005488e9b02ba145cad66cab5e0296fea1c310cc8da2","observation_id":"28a70dfa-4977-4735-8bce-83f2423e0fd4","resolution":{"observed_at":"2026-08-07T13:10:21.869002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:21.414813Z","title":"Local gain adaptation in stochastic gradient descent","venue":null,"work_id":"f3ab5add-34cf-4e79-88f5-df9393f1d570","year":1999},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-10T15:27:55.230768Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:16.855472Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:71b1cc060950156adfeb0151173522f3f3e23fe9a65ac042e0cb69783c830be2","observation_id":"86f09eaa-efb1-48da-a833-c69adcb76bb9","resolution":{"observed_at":"2026-08-07T13:10:21.591671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:21.088991Z","title":"Adapting bias by gradient descent: An incremental version of delta-bar-delta","venue":null,"work_id":"604b6b0d-6fd1-4444-b44e-91969849d0e2","year":1992},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-10T15:27:55.230768Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:17.038377Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:146d9954a87846eba194f21ccf01dcd6e5c5695bf4ce0bb798efcba9cd377167","observation_id":"6a17c6f7-b9c3-4b92-853e-850ce34d27e5","resolution":{"observed_at":"2026-08-07T13:10:21.248493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:20.758455Z","title":"No-regret dynamics in the fenchel game: A unified framework for algorithmic convex optimization.Mathematical Programming, 205(1):203–268, 2024","venue":null,"work_id":"8327d995-cbc8-44fb-9d6f-83a928e5f33a","year":2024},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-10T15:27:55.230768Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:17.226881Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:573dd7f4988767180d2be5523cc50166b6cf520d300909b77d7b5c29ca296bf6","observation_id":"c4be4a74-e36d-4bec-be13-b0d9120ff377","resolution":{"observed_at":"2026-08-07T13:10:20.916902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:20.471188Z","title":"On the convergence of stochastic gradient descent with bandwidth-based step size.Journal of Machine Learning Research, 24(48):1–49, 2023","venue":null,"work_id":"8cde7b23-4d78-479b-8db8-5b4c2c0d44eb","year":2023},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-10T15:27:55.230768Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:17.431702Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:0ff6f457edee64f2559309ba0e3db5c52d3afc65ddaf56c853dddc6715f75af3","observation_id":"2b5126e1-b40e-4efb-b46c-ee6866f94cb9","resolution":{"observed_at":"2026-08-07T13:10:20.605338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01942","last_updated":"2024-07-15T17:51:31Z","snapshot_observed_at":"2026-08-13T15:22:31.124745Z","submitted_at":"2024-06-04T03:50:12Z","title":"The Role of Level-Set Geometry on the Performance of PDHG for Conic Linear Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01942","snapshot_observed_at":"2026-08-07T13:10:17.588000Z","title":"The role of level-set geometry on the performance of pdhg for conic linear optimization.arXiv preprint arXiv:2406.01942, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-10T15:27:55.230768Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:17.588000Z"},"links":{"cited_paper":"/paper/2406.01942","citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:4db3706f83582288a4c9f244cb807694a0cce34b60e4df4cb1954dd2ac84207a","observation_id":"81a47c91-72de-40b5-8262-7b20494b7c7e","resolution":{"observed_at":"2026-08-07T13:10:17.588000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:20.178968Z","title":"Adaptive powerball stochastic conjugate gradient for large-scale learning.IEEE Transactions on Big Data, 9(6):1598–1606, 2023","venue":null,"work_id":"69edaf7d-926f-461c-a26a-e42d669f2303","year":2023},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-10T15:27:55.230768Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:17.719711Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:d52bdaf7cc56c95f128e7a13fafa6be5b76a9fbc9c4b764d3d40676039263cfb","observation_id":"09a18a02-c2b9-413e-a58c-08ea1777735d","resolution":{"observed_at":"2026-08-07T13:10:20.317776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16793","last_updated":"2025-02-24T11:29:08Z","snapshot_observed_at":"2026-08-12T23:35:57.084703Z","submitted_at":"2024-06-24T16:56:41Z","title":"Adam-mini: Use Fewer Learning Rates To Gain More","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16793","snapshot_observed_at":"2026-08-07T13:10:17.855272Z","title":"Adam-mini: Use fewer learning rates to gain more.arXiv preprint arXiv:2406.16793, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-10T15:27:55.230768Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:17.855272Z"},"links":{"cited_paper":"/paper/2406.16793","citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:988b6a16878c6e59675ef30c99a15e2dd3ad769e44a28160fb2645ffdf923aeb","observation_id":"ccd1611f-fda8-426f-b2c8-293a42ac63b6","resolution":{"observed_at":"2026-08-07T13:10:17.855272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:19.807561Z","title":"Algorithm 778: L-bfgs-b: Fortran sub- routines for large-scale bound-constrained optimization.ACM Transactions on mathematical software (TOMS), 23(4):550–560, 1997","venue":null,"work_id":"7b82dcf6-0f86-4875-ab1d-d238c7166f64","year":1997},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-10T15:27:55.230768Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:18.009345Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:ade15e39732ca1bb25f09dffcf351054ac3f8148071415096f2f74169491bf44","observation_id":"acf4447c-13d9-48d8-bdf1-9b7663236653","resolution":{"observed_at":"2026-08-07T13:10:20.001214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:19.570867Z","title":"Adabelief optimizer: Adapting stepsizes by the belief in observed gradients.Advances in neural information processing systems, 33:18795–18806, 2020","venue":null,"work_id":"01c2327c-39a4-4798-8c90-36d7565b9a3d","year":2020},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-10T15:27:55.230768Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:18.193092Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:a24ef86c5bbff84ded285b53e67899a2d756de375644ceb4edd7a2145dec6be7","observation_id":"1caf9fe7-598d-494a-a3d9-884a50a16de7","resolution":{"observed_at":"2026-08-07T13:10:19.729131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:19.250294Z","title":"Surrogate losses for online learning of stepsizes in stochastic non-convex optimization","venue":null,"work_id":"1275130e-ef4b-4b11-8699-c33b1202637b","year":2019},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-10T15:27:55.230768Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:18.346914Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:4b4f3a8ac2a65b477c32535aeb781fc49311c643ea30eeb88e04de401a08f135","observation_id":"f8f4b0a7-8547-4732-9036-7ad4c23feadd","resolution":{"observed_at":"2026-08-07T13:10:19.409231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:27.623133Z","title":"(cited on 17)","venue":null,"work_id":"4f64d5d7-8663-4119-8253-bfcd384d680d","year":2021},"citing_paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","snapshot_observed_at":"2026-08-10T15:27:55.230768Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations","version":2},"reference_index":6564,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:12.619868Z"},"links":{"citing_paper":"/paper/2505.23081"},"observation_digest":"sha256:263e5a87f87e97a10eb0c41a46efc0f038bbe67a7c8c3f35fda94f4260cbc4b0","observation_id":"9400cacb-1509-4471-be06-d6ca5c05c077","resolution":{"observed_at":"2026-08-07T13:10:27.789881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.23081","last_updated":"2025-09-05T02:19:47Z","latest_version":2,"primary_category":"math.OC","snapshot_observed_at":"2026-08-10T15:27:55.230768Z","submitted_at":"2025-05-29T04:35:21Z","title":"Gradient Methods with Online Scaling Part I. Theoretical Foundations"},"reference_resolution":{"displayed":72,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":1,"verified_fuzzy":49},"total_outbound_references":72},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 72 of 72 outbound references and 2 inbound Pith citation observations for arXiv:2505.23081."}