{"as_of":"2026-08-10T06:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bb5bbcfd9c77e432b8109f72d5321fdfd3f963c1be0de097b75bf0fa2cf69210","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:32:09.807584Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T13:37:44.255971Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T00:06:23.864619Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-09T16:41:26.377195Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"cited_work":{"arxiv_id":"2505.24399","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.24399","snapshot_observed_at":"2026-07-02T00:06:23.864619Z","title":"Lightsam: Parameter-agnostic sharpness-aware mini- mization.arXiv preprint arXiv:2505.24399,","venue":null,"work_id":"36ea6be7-e888-4c88-936a-7abd38c40646","year":null},"citing_paper":{"arxiv_id":"2606.01827","last_updated":"2026-06-01T07:42:01Z","snapshot_observed_at":"2026-08-06T22:37:29.644562Z","submitted_at":"2026-06-01T07:42:01Z","title":"Adaptive Sharpness-Aware Minimization with a Polyak-type Step size: A Theory-Grounded Scheduler","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T13:37:44.255971Z"},"links":{"cited_paper":"/paper/2505.24399","citing_paper":"/paper/2606.01827"},"observation_digest":"sha256:3a1d5d220e9e543dc9dd2fc25781e4e3a88f089a66cb98602eb985b4783ebe27","observation_id":"72befb5e-07a6-4d00-abde-e4adf9eb8d24","resolution":{"observed_at":"2026-07-02T00:06:23.867165Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.24399/citation-record","integrity":"/paper/2505.24399/integrity","json":"/paper/2505.24399/citation-record.json","paper":"/paper/2505.24399"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1609.04836","last_updated":"2017-02-09T20:38:16Z","snapshot_observed_at":"2026-07-06T05:10:58.923264Z","submitted_at":"2016-09-15T20:03:06Z","title":"On Large-Batch Training for Deep Learning: Generalization Gap and Sharp Minima","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04836","snapshot_observed_at":"2026-08-07T12:32:03.705161Z","title":"On large-batch training for deep learning: Generalization gap and sharp minima,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-09T16:41:26.377195Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:03.705161Z"},"links":{"cited_paper":"/paper/1609.04836","citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:3831fc853f572d7959da673ed373c5cdb45ffb2d834c8dbe8242c5e87449f73f","observation_id":"ca909f6a-1e6a-43fa-986d-e5ed93729900","resolution":{"observed_at":"2026-08-07T12:32:03.705161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:16.355784Z","title":"Explor- ing generalization in deep learning,","venue":null,"work_id":"03c2586c-2482-4eb9-9cf1-de71d93eefc3","year":2017},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-09T16:41:26.377195Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:03.838257Z"},"links":{"citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:3444bba496523d0b29905887cb2f5fef6361e8448f807fbdcc504488b11a652c","observation_id":"a69f7403-0ac3-4dce-a48e-d3aee9736030","resolution":{"observed_at":"2026-08-07T12:32:16.399158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:16.281795Z","title":"Sharpness-aware minimization for efficiently improving generalization,","venue":null,"work_id":"4f33cb65-09ff-4572-93e4-1fd2f34e6198","year":2020},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-09T16:41:26.377195Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:04.015856Z"},"links":{"citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:0193ddbc549c7ac0b44defe7ac0972c4206006ff88e1b49a35f06ef9ffc33dba","observation_id":"6d0acfcc-1710-4d8c-ac02-74f3e73b13cd","resolution":{"observed_at":"2026-08-07T12:32:16.313610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:04.134769Z","title":"Towards understanding sharpness-aware minimization,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-09T16:41:26.377195Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:04.134769Z"},"links":{"citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:7fbc54a882ac2235a2026f3683352dd4593f0a1471e802d60ecbf07b820089ed","observation_id":"3d1c9cfa-773c-4279-88eb-ddee91cd26a7","resolution":{"observed_at":"2026-08-07T12:32:04.134769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:16.133614Z","title":"Make sharpness-aware minimization stronger: A sparsified perturbation ap- proach,","venue":null,"work_id":"be49b633-a81a-4fec-a346-cdf1a687f32f","year":2022},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-09T16:41:26.377195Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:04.346485Z"},"links":{"citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:ee93a01d3c1adbd64f975853b01e4c750ad0ff24768c2a143c4a0494feef26aa","observation_id":"51ca9150-ba24-442a-ad94-bc4d3d10d720","resolution":{"observed_at":"2026-08-07T12:32:16.180995Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17539","last_updated":"2025-06-13T06:18:23Z","snapshot_observed_at":"2026-08-09T16:41:55.161000Z","submitted_at":"2023-11-29T11:19:50Z","title":"Critical Influence of Overparameterization on Sharpness-aware Minimization","version":5},"cited_work":{"arxiv_id":"2311.17539","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.17539","snapshot_observed_at":"2026-08-07T12:32:10.954644Z","title":"Critical Influence of Overparameterization on Sharpness-aware Minimization","venue":"cs.LG","work_id":"aec240f7-3b3e-4ae2-8036-97684b524c61","year":2023},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-09T16:41:26.377195Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:04.469847Z"},"links":{"cited_paper":"/paper/2311.17539","citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:9cbfd63b4e7727054343cdb7aaa3ac0b1a1f43233956adc5841c9a70643ad5be","observation_id":"63bbc9b3-83c5-40d1-be02-ec0b4ca133c4","resolution":{"observed_at":"2026-08-07T12:32:11.066310Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:16.030575Z","title":"Adasam: Boosting sharpness-aware minimization with adaptive learning rate and momentum for training deep neural networks,","venue":null,"work_id":"7b2f98c0-c361-43e9-ab3e-311a078c9d55","year":2024},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-09T16:41:26.377195Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:04.577430Z"},"links":{"citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:10d0515ac8f29ca3ca628f977c5a080a76763d79ffbf609498f161aaf521d2e4","observation_id":"b248054c-b17d-4c29-905b-4fbc431d1218","resolution":{"observed_at":"2026-08-07T12:32:16.076479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15287","last_updated":"2023-10-23T16:12:38Z","snapshot_observed_at":"2026-07-06T15:32:39.787935Z","submitted_at":"2023-05-24T16:09:41Z","title":"The Crucial Role of Normalization in Sharpness-Aware Minimization","version":2},"cited_work":{"arxiv_id":"2305.15287","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.15287","snapshot_observed_at":"2026-08-07T12:32:10.813953Z","title":"The Crucial Role of Normalization in Sharpness-Aware Minimization","venue":"cs.LG","work_id":"458f2277-8c12-47e9-a06d-b8ca2042ca2f","year":2023},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-09T16:41:26.377195Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:04.680024Z"},"links":{"cited_paper":"/paper/2305.15287","citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:6c48585e5585e408a224c9f4499f47f29f255951e92a5a7be7653096247acc23","observation_id":"1562b4a7-b3f6-49a4-bd05-78dcb526760d","resolution":{"observed_at":"2026-08-07T12:32:10.878494Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.15146","last_updated":"2024-03-22T11:57:51Z","snapshot_observed_at":"2026-07-06T17:48:59.440247Z","submitted_at":"2024-03-22T11:57:51Z","title":"On the Convergence of Adam under Non-uniform Smoothness: Separability from SGDM and Beyond","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.15146","snapshot_observed_at":"2026-08-07T12:32:04.824071Z","title":"On the convergence of adam under non-uniform smoothness: Separability from sgdm and beyond,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-09T16:41:26.377195Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:04.824071Z"},"links":{"cited_paper":"/paper/2403.15146","citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:5c31d2c31b8bb57b5771dcf682b0fdf4b2c9fd8ec2d08f1cbd0d19d5c36b42e6","observation_id":"d0f52cb7-2a7d-43b9-b5fa-d5811c97be26","resolution":{"observed_at":"2026-08-07T12:32:04.824071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:15.873806Z","title":"Parameter-agnostic optimization under relaxed smoothness,","venue":null,"work_id":"00a3c80e-866c-41d1-8e12-04242e42aaf9","year":2024},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-09T16:41:26.377195Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:04.980252Z"},"links":{"citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:d9eb3d02439a344e2a972a5daffada2fbfd05047e1b6bd655eaca1a48657e55f","observation_id":"67b5be73-9c6f-4d6a-bb63-c2c5204006f2","resolution":{"observed_at":"2026-08-07T12:32:15.938783Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:15.768953Z","title":"Simultaneous model selection and optimization through parameter-free stochastic learning,","venue":null,"work_id":"b350a46b-f2a5-4226-82c7-e90d165dfbdf","year":2014},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-09T16:41:26.377195Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:05.073942Z"},"links":{"citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:3677fe745e363f4138455e147ec23a8efe4021869ebd8c39ecad1af391c51b69","observation_id":"fc7d315c-9a45-44f2-9343-6f87fc19b812","resolution":{"observed_at":"2026-08-07T12:32:15.817089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:15.668012Z","title":"Online learning without prior informa- tion,","venue":null,"work_id":"1bd3deb3-8459-4e7e-9a4c-27cb72916f6c","year":2017},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-09T16:41:26.377195Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:05.166582Z"},"links":{"citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:f0bbb4225fc7344d76c0c98c13a9df0471876c957ba9fd48ef6595c8a4d6be92","observation_id":"7c0e89ba-fbe8-42e5-902d-35f146a5837b","resolution":{"observed_at":"2026-08-07T12:32:15.728899Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:15.559591Z","title":"Training deep networks without learning rates through coin betting,","venue":null,"work_id":"a7978caa-9738-48b5-b0e8-bf4faf8529fb","year":2017},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-09T16:41:26.377195Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:05.315244Z"},"links":{"citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:9ea307ff02e7761f4cb19373b0b068252754e64a045cbc93b76b524f5898daa2","observation_id":"820afd49-a75c-449d-af02-41d4515c9077","resolution":{"observed_at":"2026-08-07T12:32:15.610779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.07733","last_updated":"2023-07-07T19:08:18Z","snapshot_observed_at":"2026-07-06T14:42:35.005646Z","submitted_at":"2023-01-18T19:00:50Z","title":"Learning-Rate-Free Learning by D-Adaptation","version":5},"cited_work":{"arxiv_id":"2301.07733","doi":null,"metadata_source":"pith","pith_arxiv_id":"2301.07733","snapshot_observed_at":"2026-08-07T12:32:10.618583Z","title":"Learning-Rate-Free Learning by D-Adaptation","venue":"cs.LG","work_id":"1ec01fa3-bfde-4c8f-be7c-1656742d42d3","year":2023},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-09T16:41:26.377195Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:05.479935Z"},"links":{"cited_paper":"/paper/2301.07733","citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:6247da8711ede4ce8dd545f26d137b62335b6c37ad03b4f5e3fd48b23a256985","observation_id":"9ec614e7-4656-4c12-80ca-7b17578911b3","resolution":{"observed_at":"2026-08-07T12:32:10.696383Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:15.457456Z","title":"Convergence of adagrad for non-convex objectives: Simple proofs and relaxed assumptions,","venue":null,"work_id":"2147feba-91fd-434a-87f1-02060895b732","year":2023},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-09T16:41:26.377195Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:05.578138Z"},"links":{"citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:1762d50238a96c799116af969d10f84e2c4f1ec548dbfaec28c7c38dfcee3147","observation_id":"8cc501da-ef48-42be-a7ab-5a3fb93a5128","resolution":{"observed_at":"2026-08-07T12:32:15.483915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:15.302265Z","title":"Closing the gap be- tween the upper bound and lower bound of adam’s iteration complexity,","venue":null,"work_id":"3b5a8f83-4cb0-4ee5-a129-ff309854c135","year":2023},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-09T16:41:26.377195Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:05.694388Z"},"links":{"citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:cb7965c22b2accbf85cd504fa92233b61324805854868a6fde717ba9a9403fa7","observation_id":"00fc0edf-80a8-43c3-893f-30991de5455d","resolution":{"observed_at":"2026-08-07T12:32:15.366567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:15.163652Z","title":"How sharpness-aware minimization mini- mizes sharpness?","venue":null,"work_id":"4afbb5b5-1d84-478b-96e3-389588e886f0","year":2023},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-09T16:41:26.377195Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:05.834616Z"},"links":{"citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:cad80763f5fcfd7c09015293364330cf0867fd31b331199b933b4d191150c0dd","observation_id":"fc93b36c-e876-4c93-9bf9-7dc158409f87","resolution":{"observed_at":"2026-08-07T12:32:15.211429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:14.974816Z","title":"Asam: Adaptive sharpness- aware minimization for scale-invariant learning of deep neural net- works,","venue":null,"work_id":"cfefd72a-ee1f-46ce-90a4-ac5a6298f13d","year":2021},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-09T16:41:26.377195Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:05.961223Z"},"links":{"citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:71828c1472ea2327de1bc53a4ee8423d75a591d744cd1f089e3ec40c449d0c10","observation_id":"4a7ca0fb-8f49-4afc-a00b-5ea02bff8f3f","resolution":{"observed_at":"2026-08-07T12:32:15.086434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:14.780615Z","title":"Ran- dom sharpness-aware minimization,","venue":null,"work_id":"799a1a89-5ef9-41b4-aa5f-be76a851fdfc","year":2022},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-09T16:41:26.377195Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:06.089369Z"},"links":{"citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:2c4ee2be266d7637191c05ac339081f47a19145ce3272a5bf970acc38782402f","observation_id":"d8b8b287-76d0-4de8-b872-62be1ccb634f","resolution":{"observed_at":"2026-08-07T12:32:14.896107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:14.588075Z","title":"Sharpness-aware training for free,","venue":null,"work_id":"527677f8-025e-40ae-91b7-62cbb684aad6","year":2022},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-09T16:41:26.377195Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:06.226590Z"},"links":{"citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:87692e240be10b9289b0c2990c72f5f5c26863edf0892738cb7d92bd80d05141","observation_id":"3c431750-e484-45d7-bd2a-e6d843f297d4","resolution":{"observed_at":"2026-08-07T12:32:14.667063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.08065","last_updated":"2022-03-19T15:56:32Z","snapshot_observed_at":"2026-07-06T12:48:13.087800Z","submitted_at":"2022-03-15T16:57:59Z","title":"Surrogate Gap Minimization Improves Sharpness-Aware Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.08065","snapshot_observed_at":"2026-08-07T12:32:06.318865Z","title":"Surrogate gap minimization improves sharpness-aware training,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-09T16:41:26.377195Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:06.318865Z"},"links":{"cited_paper":"/paper/2203.08065","citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:4dc1a276832c87d1fbd5365e8d655279414d4ec98ca5fed5eb28744f624ec99a","observation_id":"ff3ca6c2-8d02-4bc4-8df5-2e27826da636","resolution":{"observed_at":"2026-08-07T12:32:06.318865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16854","last_updated":"2024-12-22T04:40:02Z","snapshot_observed_at":"2026-08-07T17:34:52.815662Z","submitted_at":"2024-12-22T04:40:02Z","title":"Sharpness-Aware Minimization with Adaptive Regularization for Training Deep Neural Networks","version":1},"cited_work":{"arxiv_id":"2412.16854","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.16854","snapshot_observed_at":"2026-08-07T12:32:10.377062Z","title":"Sharpness-Aware Minimization with Adaptive Regularization for Training Deep Neural Networks","venue":"cs.LG","work_id":"96dd4505-c226-4c24-b179-5b31d5b34963","year":2024},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-09T16:41:26.377195Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:06.484361Z"},"links":{"cited_paper":"/paper/2412.16854","citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:9c323f583e8335f875cbc0dff77518839fa19df87fdce0591f065ca74cbfe827","observation_id":"ab012672-d34c-472e-98f9-ad6716cbbf86","resolution":{"observed_at":"2026-08-07T12:32:10.443643Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10683","last_updated":"2024-10-14T16:21:23Z","snapshot_observed_at":"2026-08-08T11:45:12.726914Z","submitted_at":"2024-10-14T16:21:23Z","title":"SAMPa: Sharpness-aware Minimization Parallelized","version":1},"cited_work":{"arxiv_id":"2410.10683","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.10683","snapshot_observed_at":"2026-08-07T12:32:10.223472Z","title":"SAMPa: Sharpness-aware Minimization Parallelized","venue":"cs.LG","work_id":"e727df07-5179-43df-bbfa-f4f5201a4459","year":2024},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-09T16:41:26.377195Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:06.649614Z"},"links":{"cited_paper":"/paper/2410.10683","citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:a608b3e6b2cad51dcafe77f73f87265d9b57d43fc130b1bf054022657639ca1d","observation_id":"e90f502e-041b-411d-b595-be93f69a8d76","resolution":{"observed_at":"2026-08-07T12:32:10.282995Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:14.452503Z","title":"Sharpness-aware lookahead for accelerating convergence and improving generalization,","venue":null,"work_id":"fc37a74c-f53c-4326-b023-27b08472fdc0","year":2024},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-09T16:41:26.377195Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:06.780027Z"},"links":{"citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:d3cabd5b346631a4a1aa9fb065b970bb49f039ec403804a94767ea7fad278b57","observation_id":"06b071f4-4c84-4d54-b86e-2030e642ad63","resolution":{"observed_at":"2026-08-07T12:32:14.508401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09237","last_updated":"2019-04-19T16:21:38Z","snapshot_observed_at":"2026-08-03T03:50:23.110540Z","submitted_at":"2019-04-19T16:21:38Z","title":"On the Convergence of Adam and Beyond","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09237","snapshot_observed_at":"2026-08-07T12:32:06.895107Z","title":"On the convergence of adam and beyond,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-09T16:41:26.377195Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:06.895107Z"},"links":{"cited_paper":"/paper/1904.09237","citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:4d9636d860166d05a87c73b75f594fb1e7978b964ccaf18561f5cdf224fdd05d","observation_id":"1cf6545d-ea36-42f6-9d40-957561a54bd9","resolution":{"observed_at":"2026-08-07T12:32:06.895107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:14.278997Z","title":"Adaptive subgradient methods for online learning and stochastic optimization","venue":null,"work_id":"c9b31aed-8c2c-4bf5-b93e-edf9870e2728","year":2011},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-09T16:41:26.377195Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:06.992142Z"},"links":{"citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:d7e6a09633c46123dc51bcb3032c4c715728559288edd6030eccd705d180562e","observation_id":"e4e3051a-28d9-4fef-9629-a3ce144d219b","resolution":{"observed_at":"2026-08-07T12:32:14.370236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:14.127848Z","title":"Lecture 6.5-rmsprop: Divide the gradient by a running average of its recent magnitude,","venue":null,"work_id":"8522391c-3cf8-4338-9c91-aaa4c651f088","year":2012},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-09T16:41:26.377195Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:07.160082Z"},"links":{"citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:26090f9cf55e3d1be600f6907594e9ec56df2cc4c52ab6f0e3e24b4f9d4c16ed","observation_id":"770e4398-2fc1-433a-8c0e-fef26ffee7a0","resolution":{"observed_at":"2026-08-07T12:32:14.157089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-07T12:32:07.276622Z","title":"Adam: A method for stochastic optimization,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-09T16:41:26.377195Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:07.276622Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:beed5371f435265f72e4d5c463d371b165861ed478dc76fd827af768075fd8ef","observation_id":"2d99ec0b-0153-4e2d-8b1c-8c251697b69a","resolution":{"observed_at":"2026-08-07T12:32:07.276622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:14.021567Z","title":"On the convergence of stochastic gradient descent with adaptive stepsizes,","venue":null,"work_id":"6d39a060-9718-4dbe-8564-a3b8466057ac","year":2019},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-09T16:41:26.377195Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:07.425989Z"},"links":{"citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:74e6abf5a686b639fca2f98bdbfce0f1667a6faee14aa04152796a634c4f3daa","observation_id":"e59726d7-d0f1-40e6-bc7c-b85903cc39fe","resolution":{"observed_at":"2026-08-07T12:32:14.078444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1808.02941","last_updated":"2019-03-10T00:48:35Z","snapshot_observed_at":"2026-08-07T09:56:34.669633Z","submitted_at":"2018-08-08T21:14:07Z","title":"On the Convergence of A Class of Adam-Type Algorithms for Non-Convex Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.02941","snapshot_observed_at":"2026-08-07T12:32:07.535100Z","title":"On the convergence of a class of adam-type algorithms for non-convex optimization,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-09T16:41:26.377195Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:07.535100Z"},"links":{"cited_paper":"/paper/1808.02941","citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:bb2c19d4bdbaf562ddc037f4a0e7b2e0e645cf0fa637f895a7f111a9695935eb","observation_id":"986975bc-62a6-4394-a596-7304f9a316a5","resolution":{"observed_at":"2026-08-07T12:32:07.535100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1808.05671","last_updated":"2024-06-20T16:13:13Z","snapshot_observed_at":"2026-08-10T02:19:11.168415Z","submitted_at":"2018-08-16T20:25:28Z","title":"On the Convergence of Adaptive Gradient Methods for Nonconvex Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.05671","snapshot_observed_at":"2026-08-07T12:32:07.720112Z","title":"On the convergence of adaptive gradient methods for nonconvex optimization,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-09T16:41:26.377195Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:07.720112Z"},"links":{"cited_paper":"/paper/1808.05671","citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:c793065e38e7d5daf68e896b3a69dc89c9b635971a34b9d81468ffb1e92761bd","observation_id":"3f164c29-be32-4d24-9a0b-52ed3180529c","resolution":{"observed_at":"2026-08-07T12:32:07.720112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2003.02395","last_updated":"2022-10-17T13:20:40Z","snapshot_observed_at":"2026-08-06T18:53:35.682332Z","submitted_at":"2020-03-05T01:56:17Z","title":"A Simple Convergence Proof of Adam and Adagrad","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.02395","snapshot_observed_at":"2026-08-07T12:32:07.840556Z","title":"A simple convergence proof of adam and adagrad,","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-09T16:41:26.377195Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:07.840556Z"},"links":{"cited_paper":"/paper/2003.02395","citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:d1eb9614fdde88018a3ef8aa71d091b79cd225e39bc3a0d24e9dc82d06dec645","observation_id":"57d2264f-77a7-4bf9-bd75-b8ece43c1613","resolution":{"observed_at":"2026-08-07T12:32:07.840556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:13.845120Z","title":"A unified analysis of adagrad with weighted aggregation and momentum acceleration,","venue":null,"work_id":"56910125-a972-43b3-8d62-6cd064e56efc","year":2023},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-09T16:41:26.377195Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:07.977662Z"},"links":{"citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:d75dca5f41352eac1a62c750336f7aee80926c82c119189b5a925fa7966afd8c","observation_id":"9260927b-c685-47ac-9a55-ba0cf1c737f3","resolution":{"observed_at":"2026-08-07T12:32:13.927465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:13.732825Z","title":"Rmsprop converges with proper hyperparameter,","venue":null,"work_id":"95685068-4cf4-4e48-a3fb-43f80c75c448","year":2021},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-09T16:41:26.377195Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:08.053316Z"},"links":{"citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:98534cbf9c057da0caf4c717500232ae02060e090e0e26b13a91f40e93485f90","observation_id":"ecab6659-bcd9-4830-b22c-fc8806bb7690","resolution":{"observed_at":"2026-08-07T12:32:13.796724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:13.577665Z","title":"Adam can converge without any modification on update rules,","venue":null,"work_id":"e2498213-b8be-4253-a3c0-79221129cd00","year":2022},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-09T16:41:26.377195Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:08.160780Z"},"links":{"citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:ffb1a3be3892f7881c6742f5181bd3e51e62495b21c2d1b5c5f05d648d49ae67","observation_id":"e352ead6-1c47-41b3-bc03-eb2b45a03bd6","resolution":{"observed_at":"2026-08-07T12:32:13.638004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:13.489132Z","title":"Dimension-free exponentiated gradient,","venue":null,"work_id":"387b56f3-1786-454f-9dc9-4cb175c0c8ca","year":2013},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-09T16:41:26.377195Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:08.289944Z"},"links":{"citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:dd22124a3a052721b692abc588952752e105371586bda6d2bc9c18c061b04590","observation_id":"271324d1-7365-438e-bde2-96e3958a4331","resolution":{"observed_at":"2026-08-07T12:32:13.527662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:13.369927Z","title":"Unconstrained online linear learning in hilbert spaces: Minimax algorithms and normal approximations,","venue":null,"work_id":"8edf240f-38e7-4f89-849a-300dc55db7f7","year":2014},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-09T16:41:26.377195Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:08.377162Z"},"links":{"citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:4531e7bb2cc0bd473aff79cd09154ef18746c208c5b8e5e5d3ff35555e83f01c","observation_id":"d8304df5-bea4-4a43-a352-5fe597d5a3fa","resolution":{"observed_at":"2026-08-07T12:32:13.428361Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:13.207586Z","title":"Coin betting and parameter-free online learn- ing,","venue":null,"work_id":"523f469c-0228-4857-9dac-9a843546d191","year":2016},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-09T16:41:26.377195Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:08.454456Z"},"links":{"citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:3835bcb09802af52e41fbac6ab97fb69304f29000565a2b3a61ff6c27d5d9b46","observation_id":"ccd6f11a-1e90-4ef1-9ac7-e83d20f66abd","resolution":{"observed_at":"2026-08-07T12:32:13.275341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:13.063226Z","title":"Making sgd parameter-free,","venue":null,"work_id":"580ac93c-30a6-4b4f-9b68-6e65aaf25804","year":2022},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-09T16:41:26.377195Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:08.536441Z"},"links":{"citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:bf58db09a65acf95adebdbf73d201794f5fba6753ff2f5bbf63d032a7d4bc36d","observation_id":"5d85a160-287b-4016-a495-e53b40f41126","resolution":{"observed_at":"2026-08-07T12:32:13.163077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:12.834602Z","title":"Dog is sgd’s best friend: A parameter-free dynamic step size schedule,","venue":null,"work_id":"141c5839-0e70-4119-9551-2823b33b771c","year":2023},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-09T16:41:26.377195Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:08.636490Z"},"links":{"citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:e385e7c8f08c4e50747597c6e76f36905740208eb01ff0f1973589b56d5b1690","observation_id":"b222335b-bb1b-4b56-a626-52ef6ff1dc97","resolution":{"observed_at":"2026-08-07T12:32:12.941014Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:12.632859Z","title":"Dowg unleashed: An efficient universal parameter-free gradient descent method,","venue":null,"work_id":"13d4dffc-be75-4518-af4e-238ffde48407","year":2023},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-09T16:41:26.377195Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:08.717996Z"},"links":{"citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:37695a4e234621a1fcd308300b5573d3806074b5c9dac2e0f92c11c9c609cff6","observation_id":"584ff79f-a319-43c9-949d-b04eb10a058b","resolution":{"observed_at":"2026-08-07T12:32:12.706506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19444","last_updated":"2026-05-31T16:34:26Z","snapshot_observed_at":"2026-08-09T10:26:16.535213Z","submitted_at":"2024-12-27T04:22:02Z","title":"Towards Simple and Provable Parameter-Free Adaptive Gradient Methods","version":2},"cited_work":{"arxiv_id":"2412.19444","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.19444","snapshot_observed_at":"2026-08-07T12:32:09.949912Z","title":"Towards Simple and Provable Parameter-Free Adaptive Gradient Methods","venue":"cs.LG","work_id":"0c6cf786-562b-4dc9-9661-dd9398c3436c","year":2024},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-09T16:41:26.377195Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:08.793867Z"},"links":{"cited_paper":"/paper/2412.19444","citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:307a3587773fc49c10b852874670eabfc5a6040b118142ac534803be4bb007f1","observation_id":"78bc8145-df67-48db-b8aa-820041ac313a","resolution":{"observed_at":"2026-08-07T12:32:10.057644Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:12.433269Z","title":"Sgd and hogwild! convergence without the bounded gra- dients assumption,","venue":null,"work_id":"7e441d1d-aa52-475b-a4c3-7fe93a30f827","year":2018},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-09T16:41:26.377195Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:08.857984Z"},"links":{"citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:0644c47abc0c7583d4b2e0e14b375e11586ec107bdf4404e9ac5b1b11b0a262a","observation_id":"f8208e1a-3ae7-4b5c-953b-7cbea32ddb01","resolution":{"observed_at":"2026-08-07T12:32:12.559912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:12.242683Z","title":"Smoothness- adaptive sharpness-aware minimization for finding flatter minima,","venue":null,"work_id":"09524e7d-df0a-412b-b7e5-d4c8178e62bc","year":null},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-09T16:41:26.377195Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:08.955070Z"},"links":{"citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:f4a61ed60cdb4f1842ba3db83f9b6f83cf43ec4dee56156a1822dae177ed6fd6","observation_id":"6d5b7cc0-36d0-49a5-b056-15b24638ebc9","resolution":{"observed_at":"2026-08-07T12:32:12.303888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:12.009148Z","title":"Online to offline conversions, universality and adaptive minibatch sizes,","venue":null,"work_id":"c4e18aef-f977-4c06-8c66-a634c8affa7a","year":2017},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-09T16:41:26.377195Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:09.039195Z"},"links":{"citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:1438d4e92dde9a700481ba3bbdc3b56158bdea32ce7616f44492600609717827","observation_id":"baefaa49-6c9a-4aad-a1ed-a5605369138d","resolution":{"observed_at":"2026-08-07T12:32:12.107206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:11.881396Z","title":"Adagrad stepsizes: Sharp conver- gence over nonconvex landscapes,","venue":null,"work_id":"8509c81b-380c-4cff-8a25-852f38af5c2a","year":2020},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-09T16:41:26.377195Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:09.118026Z"},"links":{"citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:62e67a6aa6c6498bd1bc1b52b4a24617f433c2a84bd2a4169fab61ed64077d80","observation_id":"c216cb0c-b19d-43eb-97b5-752ebc2472cd","resolution":{"observed_at":"2026-08-07T12:32:11.926845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:09.168263Z","title":"A sufficient condition for convergences of adam and rmsprop,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-09T16:41:26.377195Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:09.168263Z"},"links":{"citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:fa1766319da7938314ebf9327259cebceb92a475f7c6c26e62beccda488c3752","observation_id":"bcdace04-800e-4a28-90c6-85e2170d6709","resolution":{"observed_at":"2026-08-07T12:32:09.168263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:11.677775Z","title":"Iteration complexity of randomized block- coordinate descent methods for minimizing a composite function,","venue":null,"work_id":"d166ebda-5220-4e39-a2ab-14c4f151f66a","year":2014},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-09T16:41:26.377195Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:09.266884Z"},"links":{"citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:ea0851c77ac479b162baca2e0563a6d53929dc17e06ecc7253376d043840c5ee","observation_id":"b37270b4-21e6-44a6-9b64-748782f9bcc2","resolution":{"observed_at":"2026-08-07T12:32:11.750407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07114","last_updated":"2024-02-11T06:21:18Z","snapshot_observed_at":"2026-07-06T17:28:31.413289Z","submitted_at":"2024-02-11T06:21:18Z","title":"Towards Quantifying the Preconditioning Effect of Adam","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07114","snapshot_observed_at":"2026-08-07T12:32:09.342636Z","title":"Towards quantifying the preconditioning effect of adam,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-09T16:41:26.377195Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:09.342636Z"},"links":{"cited_paper":"/paper/2402.07114","citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:bdc74859979911087f530227b65c7e663f1ad578a56835318931bceca022c5cd","observation_id":"d405c03b-d678-4e81-8188-b51250455d11","resolution":{"observed_at":"2026-08-07T12:32:09.342636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:11.490869Z","title":"Robust- ness to unbounded smoothness of generalized signsgd,","venue":null,"work_id":"565f83ee-02a5-432d-a064-27dd0df1a37d","year":2022},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-09T16:41:26.377195Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:09.421215Z"},"links":{"citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:7b1e1881ec2c3f23401b58a27492ecd767056133b2ff65ec7d75e47d7c2e60de","observation_id":"af036d5b-075c-4143-88e5-2d06c5aee956","resolution":{"observed_at":"2026-08-07T12:32:11.575857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:09.512342Z","title":"Gradient-based learning applied to document recognition,","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-09T16:41:26.377195Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:09.512342Z"},"links":{"citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:96b253cd9765487db88352f5ad219d819f9c7933bdbab9577559a76e74eb4dd4","observation_id":"ab517c8a-c1e3-4390-8037-74d41a710ed5","resolution":{"observed_at":"2026-08-07T12:32:09.512342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:09.605342Z","title":"Training data-efficient image transformers & distillation through attention,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-09T16:41:26.377195Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:09.605342Z"},"links":{"citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:e1355071b7545d0cc4f2970e4edca365f2d3479c1fad2f4a9428a8f659d72b2e","observation_id":"ecface3b-421c-4b41-a51b-b716c654e726","resolution":{"observed_at":"2026-08-07T12:32:09.605342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:11.196853Z","title":"Why are adaptive methods good for attention models?","venue":null,"work_id":"ef6b40ae-9917-475c-96d0-cc01432c2530","year":2020},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-09T16:41:26.377195Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:09.710987Z"},"links":{"citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:139d67f7aa4abf442dfd6eb530469b918c55f1c9c9f09211900bef6b8af4afde","observation_id":"8b85ff26-7427-4fc5-a9bd-5d5712ba7017","resolution":{"observed_at":"2026-08-07T12:32:11.340852Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-07-31T22:31:37.910868Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-07T12:32:09.807584Z","title":"Roberta: A robustly optimized bert pretraining approach,","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-09T16:41:26.377195Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:09.807584Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:c1cc69498cf0245fd16263879117d508d1c0b57d6dd51f1d57a9518d9e76ae74","observation_id":"acf80601-11ef-404c-9cb6-8441dd8ca7e4","resolution":{"observed_at":"2026-08-07T12:32:09.807584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T16:41:26.377195Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":6,"verified_fuzzy":34},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 1 inbound Pith citation observation for arXiv:2505.24399."}