{"as_of":"2026-08-10T07:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c2a55a9643e4c60e2e2cd718ebbcbba3dbd55d60c82b0301f6dec25d9d297473","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:20:49.832951Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T10:09:36.912553Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T07:29:38.373231Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-09T05:34:59.359159Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22085","snapshot_observed_at":"2026-08-03T10:09:36.912553Z","title":"Jentzen, A., Kranz, J., and Riekert, A","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12238","last_updated":"2026-07-24T03:23:33Z","snapshot_observed_at":"2026-08-03T10:09:34.130928Z","submitted_at":"2026-01-18T03:27:21Z","title":"On the Provable Suboptimality of Momentum SGD in Nonstationary Stochastic Optimization","version":5},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T10:09:36.912553Z"},"links":{"cited_paper":"/paper/2505.22085","citing_paper":"/paper/2601.12238"},"observation_digest":"sha256:18376afc281ed34e4a29edc9a5350688313c6e72266a260104c8eec4ea28f4cd","observation_id":"c4250ee0-78b1-45b3-8508-61ed43f75d3c","resolution":{"observed_at":"2026-08-03T10:09:36.912553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-09T05:34:59.359159Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"cited_work":{"arxiv_id":"2505.22085","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22085","snapshot_observed_at":"2026-07-04T07:29:38.373231Z","title":"PADAM: Parallel averaged Adam re- duces the error for stochastic optimization in scientific machine learning.arXiv:2505.22085; Revision requested from J","venue":null,"work_id":"b78cdc23-63fd-4b10-b394-f808b3362450","year":2024},"citing_paper":{"arxiv_id":"2606.21433","last_updated":"2026-06-19T13:49:42Z","snapshot_observed_at":"2026-07-06T23:56:26.805329Z","submitted_at":"2026-06-19T13:49:42Z","title":"Central limit theorem for the averaged Adam optimizer","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-26T13:29:08.750421Z"},"links":{"cited_paper":"/paper/2505.22085","citing_paper":"/paper/2606.21433"},"observation_digest":"sha256:1e9e0071baf4f793ca97f9fa2303e8bb9e8a4e5e455950f95e107899bec07c9b","observation_id":"b0941b4b-8e5c-49ff-ba18-6a59519f5548","resolution":{"observed_at":"2026-07-04T07:29:38.374677Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.22085/citation-record","integrity":"/paper/2505.22085/integrity","json":"/paper/2505.22085/citation-record.json","paper":"/paper/2505.22085"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2405.18199","last_updated":"2024-10-30T17:51:28Z","snapshot_observed_at":"2026-08-04T20:53:21.315273Z","submitted_at":"2024-05-28T14:08:04Z","title":"Adam with model exponential moving average is effective for nonconvex optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18199","snapshot_observed_at":"2026-08-07T13:20:44.027164Z","title":"Adam with model exponential moving average is effective for nonconvex optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-09T05:34:59.359159Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:44.027164Z"},"links":{"cited_paper":"/paper/2405.18199","citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:657ea9604adb3f69a15499f21e059e5347402f2ad8c7a88656d2d3abc800ccb6","observation_id":"0ede2bde-50d0-4e6b-b914-b26768d3a5f4","resolution":{"observed_at":"2026-08-07T13:20:44.027164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.07061","last_updated":"2024-11-11T15:25:48Z","snapshot_observed_at":"2026-08-06T06:15:19.216332Z","submitted_at":"2024-11-11T15:25:48Z","title":"General framework for online-to-nonconvex conversion: Schedule-free SGD is also effective for nonconvex optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.07061","snapshot_observed_at":"2026-08-07T13:20:44.103140Z","title":"General framework for online-to- nonconvex conversion: Schedule-free SGD is also effective for nonconvex optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-09T05:34:59.359159Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:44.103140Z"},"links":{"cited_paper":"/paper/2411.07061","citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:379480fa2d021037a9e7b65d80c64f1308d3f358a2bab419a52564a6b9a580df","observation_id":"ce1f34b2-c3bc-4452-a082-0e5e2cfea8f5","resolution":{"observed_at":"2026-08-07T13:20:44.103140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:59.319682Z","title":null,"venue":null,"work_id":"43f5d181-76db-444e-b06b-1b2049d333a0","year":2019},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-09T05:34:59.359159Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:44.251006Z"},"links":{"citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:dfc87dcb86ab90fa9d4838bd6ceb5422b8d7ca06b736d41954d3e483f8c81c04","observation_id":"dbc51ba4-6467-4b70-b652-51e18dec4760","resolution":{"observed_at":"2026-08-07T13:20:59.424343Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:58.934536Z","title":"Learning Theory from First Principles","venue":null,"work_id":"807b1f0a-3ada-4ec8-b7fb-054993596bb0","year":2024},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-09T05:34:59.359159Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:44.335953Z"},"links":{"citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:5fed5cad642b8a65d70b3b4aba5f820da69b38b068af875088134bc2d40749ce","observation_id":"f655e2b0-de84-4ab0-aca7-6b406d49b244","resolution":{"observed_at":"2026-08-07T13:20:59.101490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:58.535530Z","title":"Convergence and dynamical behavior of the Adam algorithm for nonconvex stochastic optimization","venue":null,"work_id":"4cc5a24a-80ce-4328-b6b1-53bee3372b8c","year":2021},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-09T05:34:59.359159Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:44.420377Z"},"links":{"citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:f35e1544a7c017ab76856d3b4b9a24bc0c20f85889584233dd0dd953e923f387","observation_id":"003918ea-9e35-4d1e-ac82-3ef4f2fff3e5","resolution":{"observed_at":"2026-08-07T13:20:58.683762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:58.259044Z","title":"Solving the Kolmogorov PDE by means of deep learning","venue":null,"work_id":"f2726a2c-9a9a-41c2-a8a8-e71a29947ad3","year":2021},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-09T05:34:59.359159Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:44.520870Z"},"links":{"citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:67aa0c48262c7f1f242bbd03d0af471f303325e73970df033ff2b612e830cbb3","observation_id":"66f837b2-360b-4c7a-9b98-1a88ab5c6eb6","resolution":{"observed_at":"2026-08-07T13:20:58.425929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:57.978432Z","title":"An overview on deep learning-based approximation methods for partial differential equations","venue":null,"work_id":"3c51d0d7-fba7-4b6c-8455-63530c85f055","year":2023},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-09T05:34:59.359159Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:44.587912Z"},"links":{"citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:3bcd99c895ed96c8809dd3e6e4f28283719882818360711fce012943d99ca1d8","observation_id":"603fecab-d84e-4768-8b14-0f59c951ab3d","resolution":{"observed_at":"2026-08-07T13:20:58.111151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:57.731638Z","title":"Solving high-dimensional optimal stopping problems using deep learning","venue":null,"work_id":"0318f682-130b-416a-bfce-a0bf26ab29f6","year":2021},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-09T05:34:59.359159Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:44.675429Z"},"links":{"citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:7684ac704cd113b37288812fece04261e8cfc8882dcca11cb353d1609d1fc576","observation_id":"a9c69ac5-8cb3-460f-9215-91f249d6b530","resolution":{"observed_at":"2026-08-07T13:20:57.837111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:57.447420Z","title":null,"venue":null,"work_id":"8bead533-2572-4ee7-8288-a61adaafe084","year":2020},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-09T05:34:59.359159Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:44.774332Z"},"links":{"citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:89fee671802c4fa345f8be3f404ad1257756a024d4ea1a5e9c0bfb737b272493","observation_id":"fb6639ea-405b-44e7-a370-97f4dd87b3ba","resolution":{"observed_at":"2026-08-07T13:20:57.565534Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:57.149117Z","title":"G., Suau Cuadros, X., and Webb, R","venue":null,"work_id":"7e136c79-2098-4d76-9ef3-887e79e1d212","year":2023},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-09T05:34:59.359159Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:44.911287Z"},"links":{"citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:42081bcf9f53bcf12d7931cedaa54daf2ff2d0ffd6f197219fbe252d44be808a","observation_id":"10695ec8-d505-4f1c-ab3c-475bc9ce6d2b","resolution":{"observed_at":"2026-08-07T13:20:57.266491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:56.876896Z","title":"Scientific machine learning through physics-informed neural networks: where we are and what’s next","venue":null,"work_id":"717ac0a6-5df6-48df-8bb5-d738a2c85743","year":2022},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-09T05:34:59.359159Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:45.018646Z"},"links":{"citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:4fd6de0a8d0e2f971ca68fc48230b7269ab26ddb5a4b814a1e9caff55cb019d4","observation_id":"0cf9b7d8-f3cb-4c5b-b55e-232ad0c71007","resolution":{"observed_at":"2026-08-07T13:20:56.991187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15682","last_updated":"2024-10-29T22:40:23Z","snapshot_observed_at":"2026-07-06T18:19:25.869339Z","submitted_at":"2024-05-24T16:20:46Z","title":"The Road Less Scheduled","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15682","snapshot_observed_at":"2026-08-07T13:20:45.123106Z","title":"A., Mehta, H., Mishchenko, K., Khaled, A., and Cutkosky, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-09T05:34:59.359159Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:45.123106Z"},"links":{"cited_paper":"/paper/2405.15682","citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:b4327d92b8b8bf7b993f80afe36e757be16720fafadf271a765f3901cab195ae","observation_id":"a8dddf37-23af-43f4-b8ac-005545f927e8","resolution":{"observed_at":"2026-08-07T13:20:45.123106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:56.561092Z","title":"A Simple Convergence Proof of Adam and Adagrad","venue":null,"work_id":"1618047b-95a7-4eab-9688-ad2bfe308436","year":2022},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-09T05:34:59.359159Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:45.226863Z"},"links":{"citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:5250aaea969397fa09ae71c9bb45e1b1dc9e116d8e6820104e7249c56c41b969","observation_id":"51a48e79-e6d9-435a-9995-498bf0e27a9b","resolution":{"observed_at":"2026-08-07T13:20:56.670464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:56.224798Z","title":"General multilevel adaptations for stochastic approximation algorithms II: CLTs","venue":null,"work_id":"6df39008-bca3-48d9-b14b-fbd1e0e1801f","year":2021},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-09T05:34:59.359159Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:45.364610Z"},"links":{"citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:6bc65c4ce608d4e75f34550b07bf6febc17c681649a4a09f1a86487f4cb76339","observation_id":"c3cb9ab0-2fc9-45ed-ad59-5f53b7904919","resolution":{"observed_at":"2026-08-07T13:20:56.382981Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21078","last_updated":"2024-07-29T22:49:04Z","snapshot_observed_at":"2026-07-06T18:54:41.705593Z","submitted_at":"2024-07-29T22:49:04Z","title":"Convergence rates for the Adam optimizer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21078","snapshot_observed_at":"2026-08-07T13:20:45.494765Z","title":"Convergence rates for the Adam optimizer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-09T05:34:59.359159Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:45.494765Z"},"links":{"cited_paper":"/paper/2407.21078","citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:d2277eeb7894d57d37b8decd5f6f7b43a009812170a9afcc2ffd08ec5b46fa0d","observation_id":"7561269f-221b-42ab-b3e7-386f24565866","resolution":{"observed_at":"2026-08-07T13:20:45.494765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:55.957715Z","title":"On the existence of minimizers in shallow residual relu neural network optimization landscapes","venue":null,"work_id":"a094fdc7-5c8f-45d8-bb90-5e1ce4fa21c5","year":2024},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-09T05:34:59.359159Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:45.533294Z"},"links":{"citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:c91e966067acde1fb67c747a253155186914d01fba648248f776d79516aa47ec","observation_id":"48240a19-5a1f-4a6d-9ae4-a7e6e0a34b9d","resolution":{"observed_at":"2026-08-07T13:20:56.058509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06081","last_updated":"2025-01-10T16:15:25Z","snapshot_observed_at":"2026-07-06T20:19:21.142837Z","submitted_at":"2025-01-10T16:15:25Z","title":"Averaged Adam accelerates stochastic optimization in the training of deep neural network approximations for partial differential equation and optimal control problems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06081","snapshot_observed_at":"2026-08-07T13:20:45.699370Z","title":"Averaged adam accelerates stochastic optimization in the training of deep neural network approximations for partial differential equation and optimal control problems","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-09T05:34:59.359159Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:45.699370Z"},"links":{"cited_paper":"/paper/2501.06081","citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:127b9c82c353178dc2c4d14d905d08fd2f6e36e4f2231755447ff6d5e6df7ea3","observation_id":"87d7e869-f19e-427e-8c0a-7b832eba50bc","resolution":{"observed_at":"2026-08-07T13:20:45.699370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:55.700384Z","title":"Central limit theorems for stochastic gradient descent with averaging for stable manifolds","venue":null,"work_id":"e1144d2b-5de8-49c3-9a86-e50777faa3c6","year":2023},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-09T05:34:59.359159Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:45.799000Z"},"links":{"citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:070f2292e7fbe14a103fa4d0a8335da1ee545ced2cecb5c5df4d5f73a84fe75c","observation_id":"080081b6-b3f0-4147-9f37-997a168118e0","resolution":{"observed_at":"2026-08-07T13:20:55.827850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:55.403286Z","title":"On the existence of optimal shallow feedforward networks with ReLU activation","venue":null,"work_id":"93f367b3-3a10-4658-8502-ff5ed0202a1e","year":2024},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-09T05:34:59.359159Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:45.895036Z"},"links":{"citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:a1443151961cf1bc3a7dc72c0ee398592b77bfb1a1d11e781e70f9dc97af29b3","observation_id":"e29d8abd-3823-40d6-97db-4159f880da90","resolution":{"observed_at":"2026-08-07T13:20:55.531121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:55.104742Z","title":"General multilevel adaptations for stochastic approximation algorithms of Robbins-Monro and Polyak-Ruppert type.Numer","venue":null,"work_id":"053c9574-6e85-4098-894f-25ce6a3d632e","year":2019},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-09T05:34:59.359159Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:46.038818Z"},"links":{"citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:b7795de2d63f7eff97c4b1e64bb79a29342625ef0b82e6c0362f6721dcfa8017","observation_id":"a998fdc4-adee-4388-aae0-cab3df4962ea","resolution":{"observed_at":"2026-08-07T13:20:55.228206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:54.743600Z","title":"Uniform convergence guarantees for the deep ritz method for nonlinear problems","venue":null,"work_id":"f401d25d-da32-4cbc-9117-225c8bd22dc4","year":2022},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-09T05:34:59.359159Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:46.144661Z"},"links":{"citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:38fdf20d3f19a3d84a6bf637a0ff37d59992a405fefd4be008dda0e5d7b8dfed","observation_id":"7765285a-e5f8-44e7-8862-38d86e513211","resolution":{"observed_at":"2026-08-07T13:20:54.928881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:54.442755Z","title":"Deep learning-based numerical methods for high- dimensional parabolic partial differential equations and backward stochastic differential equations","venue":null,"work_id":"ecb8686b-2793-4543-b943-4b624731d01d","year":2017},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-09T05:34:59.359159Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:46.247445Z"},"links":{"citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:dec53b49db2d904dcd2d37bd1cbaa42c69929741cc1e5f1f23f025bb4d213421","observation_id":"2e25f9d3-d276-4245-8d69-89a207cbf049","resolution":{"observed_at":"2026-08-07T13:20:54.610718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:54.174787Z","title":"Algorithms for solving high dimensional PDEs: from nonlinear Monte Carlo to machine learning","venue":null,"work_id":"737a209e-f990-4788-958a-4163652e1925","year":2021},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-09T05:34:59.359159Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:46.383740Z"},"links":{"citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:286a72d7f658f987a6628d0d8578ecdeccb695ddcc9450bae2e85e95632ebe71","observation_id":"dd51ade3-a143-42ee-869d-c433c46f5dce","resolution":{"observed_at":"2026-08-07T13:20:54.327060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:53.894006Z","title":"The deep Ritz method: a deep learning-based numerical algorithm for solving variational problems","venue":null,"work_id":"2a75f70a-6faf-4326-bb4e-a986e7c387b8","year":2018},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-09T05:34:59.359159Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:46.481643Z"},"links":{"citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:3e4163780100aa095ccc983aa9fb08a944fd09f3b2f5bdc7c4119c0cb96e2491","observation_id":"e4bdcae6-5852-49e7-afb1-ee27a3958610","resolution":{"observed_at":"2026-08-07T13:20:54.005662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1709.03342","last_updated":"2017-09-11T11:49:19Z","snapshot_observed_at":"2026-07-06T05:59:03.911368Z","submitted_at":"2017-09-11T11:49:19Z","title":"Optimal non-asymptotic bound of the Ruppert-Polyak averaging without strong convexity","version":1},"cited_work":{"arxiv_id":"1709.03342","doi":null,"metadata_source":"pith","pith_arxiv_id":"1709.03342","snapshot_observed_at":"2026-08-07T13:20:51.137834Z","title":"Optimal non-asymptotic bound of the Ruppert-Polyak averaging without strong convexity","venue":"math.ST","work_id":"74bb9d2a-9374-4a04-9ab6-09bb2d4329b2","year":2017},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-09T05:34:59.359159Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:46.576139Z"},"links":{"cited_paper":"/paper/1709.03342","citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:3bba329852f76b30e5c67eaf7215c656ab8fb5e476d685d756ceaf0bb64778c8","observation_id":"91ddcca1-97a5-4f04-9fca-01d5749814f3","resolution":{"observed_at":"2026-08-07T13:20:51.292006Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.15641","last_updated":"2022-11-28T18:49:09Z","snapshot_observed_at":"2026-08-09T05:34:32.474947Z","submitted_at":"2022-11-28T18:49:09Z","title":"Blow up phenomena for gradient descent optimization methods in the training of artificial neural networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.15641","snapshot_observed_at":"2026-08-07T13:20:46.654207Z","title":"Blow up phenomena for gradient de- scent optimization methods in the training of artificial neural networks","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-09T05:34:59.359159Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:46.654207Z"},"links":{"cited_paper":"/paper/2211.15641","citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:e7b751930cb638bf4f0e894a9c4b3c79a6464cd31e0578bcc62fed6d1e4c89cf","observation_id":"3df7c9c6-1abd-410a-bfde-b0a24629b2e4","resolution":{"observed_at":"2026-08-07T13:20:46.654207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.08068","last_updated":"2021-04-16T08:03:23Z","snapshot_observed_at":"2026-08-07T08:22:33.614391Z","submitted_at":"2021-01-20T11:06:23Z","title":"Neural networks-based algorithms for stochastic control and PDEs in finance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.08068","snapshot_observed_at":"2026-08-07T13:20:46.707687Z","title":"Neural networks-based algorithms for stochastic control and PDEs in finance","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-09T05:34:59.359159Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:46.707687Z"},"links":{"cited_paper":"/paper/2101.08068","citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:ec82f7eeb1c33a163934034edd28b0980fae36c986ea60b7b73ed7c6ff27caae","observation_id":"40721e7e-24dd-4a0c-856e-320d5fdbda52","resolution":{"observed_at":"2026-08-07T13:20:46.707687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:53.622390Z","title":"Stochastic weight averaging revisited","venue":null,"work_id":"6b3efb5c-a32f-4a45-85bd-5ae712d17e92","year":2023},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-09T05:34:59.359159Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:46.832622Z"},"links":{"citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:016b98bdd7237d605ce84b1695367a6a5a06c33f0238591c44fb2da4c5358540","observation_id":"911bee71-a7b2-49a9-87b7-2c8b01730968","resolution":{"observed_at":"2026-08-07T13:20:53.734446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:53.288662Z","title":null,"venue":null,"work_id":"df868715-55e1-43ba-b301-615f783df8a1","year":2018},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-09T05:34:59.359159Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:46.957269Z"},"links":{"citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:283ec3bd141f47943749076db9ec7273a385704b88902541774961135af02157","observation_id":"74dad194-4c96-4a2f-844e-990a800d4b01","resolution":{"observed_at":"2026-08-07T13:20:53.453359Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:52.958947Z","title":"Recent developments in machine learning methods for stochastic control and games","venue":null,"work_id":"08eb654e-a7b8-45c4-ba0c-a98cb716261a","year":2024},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-09T05:34:59.359159Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:47.034083Z"},"links":{"citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:496ecc9f5406504ff17599c48864d376c340857706a6ad5902057379d9555548","observation_id":"dd6775d0-2b8e-4823-ac1a-76cdd95391a3","resolution":{"observed_at":"2026-08-07T13:20:53.089257Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05407","last_updated":"2019-02-25T14:18:11Z","snapshot_observed_at":"2026-07-31T19:09:21.589864Z","submitted_at":"2018-03-14T17:09:27Z","title":"Averaging Weights Leads to Wider Optima and Better Generalization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05407","snapshot_observed_at":"2026-08-07T13:20:47.187971Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-09T05:34:59.359159Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:47.187971Z"},"links":{"cited_paper":"/paper/1803.05407","citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:88a19cfa4443d4f9daeea020e858efddca5f7d6840866635c713abbc69d9f835","observation_id":"f24dec9c-4fdd-40dd-a4a8-135a1fe8edcd","resolution":{"observed_at":"2026-08-07T13:20:47.187971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20360","last_updated":"2025-07-15T18:49:51Z","snapshot_observed_at":"2026-08-09T09:47:43.721767Z","submitted_at":"2023-10-31T11:01:23Z","title":"Mathematical Introduction to Deep Learning: Methods, Implementations, and Theory","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.20360","snapshot_observed_at":"2026-08-07T13:20:47.254649Z","title":"Mathematical Introduc- tion to Deep Learning: Methods, Implementations, and Theory","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-09T05:34:59.359159Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:47.254649Z"},"links":{"cited_paper":"/paper/2310.20360","citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:8e33cda68992e27d8b92e1ceac3cc1df823384d443ae078b6343dca68b5291cc","observation_id":"8916bea2-64ea-48d1-b5c0-54fa55f3d09e","resolution":{"observed_at":"2026-08-07T13:20:47.254649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:52.743163Z","title":"On the existence of global minima and convergence analyses for gradient descent methods in the training of deep neural networks","venue":null,"work_id":"e4ba3224-4d75-4f08-9ee5-e9710b23dd4d","year":2022},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-09T05:34:59.359159Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:47.384573Z"},"links":{"citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:d7e830543f1c6f1bf47aef93288a40b0aab0f8e9c6d351405c15a2e2d728af0f","observation_id":"e75e8d49-a8c5-49ac-91b3-de4e0cc451f8","resolution":{"observed_at":"2026-08-07T13:20:52.838309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-07T13:20:47.424978Z","title":"P., and Ba, J","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-09T05:34:59.359159Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:47.424978Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:ffce44ae41ed31a1d7f340aa2462f92e9b5337d74e38c4e9c8a49592049e2e50","observation_id":"71cdcc58-6054-416f-b9c1-e954c0495dd4","resolution":{"observed_at":"2026-08-07T13:20:47.424978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.09572","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:50.798165Z","title":"SAD Neural Net- works: Divergent Gradient Flows and Asymptotic Optimality via o-minimal Structures","venue":null,"work_id":"a3f9ea68-983a-4407-b06e-3648015c4d17","year":2025},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-09T05:34:59.359159Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:47.515572Z"},"links":{"citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:d8277ada3834e08d1ec15886cd27803968a7973672314042b38ed325349f9a6c","observation_id":"d50492e0-b898-4191-a8c6-b43068b2341c","resolution":{"observed_at":"2026-08-07T13:20:50.894625Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13972","last_updated":"2023-11-07T03:12:49Z","snapshot_observed_at":"2026-07-06T15:20:37.222868Z","submitted_at":"2023-04-27T06:27:37Z","title":"Convergence of Adam Under Relaxed Assumptions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.13972","snapshot_observed_at":"2026-08-07T13:20:47.571118Z","title":"Convergence of Adam Under Relaxed As- sumptions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-09T05:34:59.359159Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:47.571118Z"},"links":{"cited_paper":"/paper/2304.13972","citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:57da3be214bb29e3b854a458e89245142697472398ae909231a15c58632f3944","observation_id":"4b85d118-57fa-461d-80bd-5ab60eaed08c","resolution":{"observed_at":"2026-08-07T13:20:47.571118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14123","last_updated":"2025-02-19T21:55:11Z","snapshot_observed_at":"2026-08-07T18:03:33.324388Z","submitted_at":"2025-02-19T21:55:11Z","title":"Understanding SGD with Exponential Moving Average: A Case Study in Linear Regression","version":1},"cited_work":{"arxiv_id":"2502.14123","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.14123","snapshot_observed_at":"2026-08-07T13:20:50.443612Z","title":"Understanding SGD with Exponential Moving Average: A Case Study in Linear Regression","venue":"cs.LG","work_id":"9daddbdb-1804-4c20-86f8-35ad83f55862","year":2025},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-09T05:34:59.359159Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:47.643359Z"},"links":{"cited_paper":"/paper/2502.14123","citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:4b92a306326dfbb8772749dad126cba2d251ad71bcce960fec8a129ef22ab0a2","observation_id":"8102fa5d-3cb1-4def-8a85-973b59d35ec3","resolution":{"observed_at":"2026-08-07T13:20:50.561668Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.01852","last_updated":"2023-08-22T03:18:43Z","snapshot_observed_at":"2026-07-06T15:12:07.431442Z","submitted_at":"2023-04-04T15:01:06Z","title":"Summary of ChatGPT-Related Research and Perspective Towards the Future of Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.01852","snapshot_observed_at":"2026-08-07T13:20:47.730894Z","title":"Summary of ChatGPT-related research and perspective towards the future of large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-09T05:34:59.359159Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:47.730894Z"},"links":{"cited_paper":"/paper/2304.01852","citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:d507fe76d2c28f75be8acfd2dd6f8127b60f379ca776dd74c68d2030b77aea74","observation_id":"e11fa63e-2b52-4fda-8849-89de09810771","resolution":{"observed_at":"2026-08-07T13:20:47.730894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-07T13:20:47.787142Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-09T05:34:59.359159Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:47.787142Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:e6584becb38abfa9fbdd3067b799a6250800b38006fd1d78268a8b3d658e8045","observation_id":"dd8c1174-40ba-4975-a786-50ceab7bdbc9","resolution":{"observed_at":"2026-08-07T13:20:47.787142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.05890","last_updated":"2020-12-29T05:33:37Z","snapshot_observed_at":"2026-07-06T08:00:13.822686Z","submitted_at":"2019-06-13T18:52:00Z","title":"Gradient Descent Maximizes the Margin of Homogeneous Neural Networks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.05890","snapshot_observed_at":"2026-08-07T13:20:47.870928Z","title":"Gradient Descent Maximizes the Margin of Homogeneous Neural Networks","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-09T05:34:59.359159Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:47.870928Z"},"links":{"cited_paper":"/paper/1906.05890","citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:b4d748c407f46ebbabd19667df32c4aa01754983d7be82b60e144c2ed98ad600","observation_id":"ff0b6f8b-69f6-458d-8324-e607f2d38ff7","resolution":{"observed_at":"2026-08-07T13:20:47.870928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1704.04289","last_updated":"2018-01-19T21:07:09Z","snapshot_observed_at":"2026-07-06T05:37:49.239583Z","submitted_at":"2017-04-13T22:17:30Z","title":"Stochastic Gradient Descent as Approximate Bayesian Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.04289","snapshot_observed_at":"2026-08-07T13:20:47.962359Z","title":"D., and Blei, D","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-09T05:34:59.359159Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:47.962359Z"},"links":{"cited_paper":"/paper/1704.04289","citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:d0e35b6aa1241dd2e4039c8f319095dbf87b11fc63bb4f305be5fce7bf739331","observation_id":"f5a2318d-ef61-414c-80ee-bb1a7df5a500","resolution":{"observed_at":"2026-08-07T13:20:47.962359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:52.509110Z","title":"Exponential moving average of weights in deep learning: Dynamics and benefits","venue":null,"work_id":"c827fc31-17c6-4a87-b9d3-32fb3cf545e9","year":2024},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-09T05:34:59.359159Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:48.034105Z"},"links":{"citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:9ee41b87842d9cbc7c3f292d073c571251eae74bd83336ff7a64cab16477c5de","observation_id":"5c447aaa-cef6-4293-a0f0-4205e3852af2","resolution":{"observed_at":"2026-08-07T13:20:52.605227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:52.324773Z","title":"Topological properties of the set of functions generated by neural networks of fixed size","venue":null,"work_id":"6f823bec-c191-42f9-83f4-f31f576b5e91","year":2021},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-09T05:34:59.359159Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:48.183493Z"},"links":{"citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:1396e6503f7efd46591bcddf0570b9c97fc27f28815b1f864c43e5f6565f87f6","observation_id":"394582bf-e2c6-4e71-8955-e6c29c87a6dd","resolution":{"observed_at":"2026-08-07T13:20:52.390186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:52.097940Z","title":"Continuous-time stochastic control and optimization with financial applications, vol","venue":null,"work_id":"e088e9b0-40de-4402-902b-f45de88cb55f","year":2009},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-09T05:34:59.359159Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:48.301435Z"},"links":{"citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:c4d349158fc901bd53d392d62dd2798c44967d986d90d1ad73eee723881a91a3","observation_id":"0d60ffcf-2a5e-498c-96fa-3b4ddff012c6","resolution":{"observed_at":"2026-08-07T13:20:52.189882Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:51.946845Z","title":null,"venue":null,"work_id":"f4ceecbd-0035-41ae-be2a-cfd7a9b7b961","year":1990},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-09T05:34:59.359159Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:48.411360Z"},"links":{"citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:c3d16825c97f9a10a625c1c1f663a02ca446a8f6d652a89ea703e40f82e44bc2","observation_id":"20f15452-6034-473a-ba11-f349d65d8dc8","resolution":{"observed_at":"2026-08-07T13:20:52.012419Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:51.729774Z","title":"T., and Juditsky, A","venue":null,"work_id":"fc99edcf-1100-43a4-ad77-97febdc40363","year":1992},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-09T05:34:59.359159Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:48.626059Z"},"links":{"citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:dbc21d8031f4714cf7a63c874fe45e269e2d58d8521a648937dc9ad8eec9ebab","observation_id":"dd5bac77-c224-42ca-91f4-df1fe0e02d0c","resolution":{"observed_at":"2026-08-07T13:20:51.839610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-07T13:20:48.749797Z","title":"Zero-shot text-to-image generation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-09T05:34:59.359159Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:48.749797Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:c0ebfca7e8a0176cb02390f26bc30b926b5b23e40f81647a68ad3d5695cac3c4","observation_id":"821a4347-7511-40bb-aac1-0a49b15ef796","resolution":{"observed_at":"2026-08-07T13:20:48.749797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09237","last_updated":"2019-04-19T16:21:38Z","snapshot_observed_at":"2026-08-03T03:50:23.110540Z","submitted_at":"2019-04-19T16:21:38Z","title":"On the Convergence of Adam and Beyond","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09237","snapshot_observed_at":"2026-08-07T13:20:48.882281Z","title":"J., Kale, S., and Kumar, S","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-09T05:34:59.359159Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:48.882281Z"},"links":{"cited_paper":"/paper/1904.09237","citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:4ef48234b6f4a3cfc3c33fe1fbe15459220cfcdd37c0a6d9549e67706ad02daf","observation_id":"8de2a81c-251e-457e-ad7f-3f692c0d2f2d","resolution":{"observed_at":"2026-08-07T13:20:48.882281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10752","last_updated":"2022-04-13T11:38:44Z","snapshot_observed_at":"2026-07-06T12:20:47.369918Z","submitted_at":"2021-12-20T18:55:25Z","title":"High-Resolution Image Synthesis with Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10752","snapshot_observed_at":"2026-08-07T13:20:49.032440Z","title":"High- resolution image synthesis with latent diffusion models.arXiv:2112.10752 (2022), 45 pages","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-09T05:34:59.359159Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:49.032440Z"},"links":{"cited_paper":"/paper/2112.10752","citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:e9ec65ec81cca3ae3d416cf0274162940c7260d9dee15892591a36d915478319","observation_id":"5ceea0a7-d7e6-42e1-83a8-f50dc56cd332","resolution":{"observed_at":"2026-08-07T13:20:49.032440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-04T02:05:40.539691Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-07T13:20:49.150415Z","title":"An overview of gradient descent optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-09T05:34:59.359159Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:49.150415Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:8bee61fc6f1ff16b7d055f7c3f017f95e118d49d4e7def309206b118d97e8cd1","observation_id":"08ca1edf-a5b2-41d6-998e-8c2c25e34313","resolution":{"observed_at":"2026-08-07T13:20:49.150415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:51.529056Z","title":"Efficient estimations from a slowly convergent Robbins-Monro process.Cor- nell University Operations Research and Industrial Engineering, hdl.handle.net/1813/8664 (1988), 1–34","venue":null,"work_id":"a978fd5b-8800-4f1b-be7b-828c3e52f83c","year":1988},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-09T05:34:59.359159Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:49.266841Z"},"links":{"citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:d82d70787856e23b7d929174f048942604a16b32d4624cf7b58a8da6a0bffa30","observation_id":"b7389969-55b8-4b52-9f5c-8df99e018d28","resolution":{"observed_at":"2026-08-07T13:20:51.601182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.11487","last_updated":"2022-05-23T17:42:53Z","snapshot_observed_at":"2026-07-06T13:12:59.688989Z","submitted_at":"2022-05-23T17:42:53Z","title":"Photorealistic Text-to-Image Diffusion Models with Deep Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.11487","snapshot_observed_at":"2026-08-07T13:20:49.372617Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-09T05:34:59.359159Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:49.372617Z"},"links":{"cited_paper":"/paper/2205.11487","citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:10d20e839aed57b466b42f3a8e7db7afe4889e3b48dd5b9b5b6235292c60a458","observation_id":"9ae9a0e3-f7c2-4cd3-a529-38c93cbaaf54","resolution":{"observed_at":"2026-08-07T13:20:49.372617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02312","last_updated":"2023-02-01T07:08:58Z","snapshot_observed_at":"2026-07-06T14:37:56.945127Z","submitted_at":"2023-01-05T21:58:46Z","title":"Training trajectories, mini-batch losses and the curious role of the learning rate","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02312","snapshot_observed_at":"2026-08-07T13:20:49.539468Z","title":"Training tra- jectories, mini-batch losses and the curious role of the learning rate","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-09T05:34:59.359159Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:49.539468Z"},"links":{"cited_paper":"/paper/2301.02312","citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:53f926cd23eecb216112a4b3bc56c0e587713ead6721a0354672e5b2975c0738","observation_id":"59a99ae4-2b76-4bb0-ad7f-ecea03b0c639","resolution":{"observed_at":"2026-08-07T13:20:49.539468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02732","last_updated":"2022-10-02T10:33:53Z","snapshot_observed_at":"2026-08-06T02:24:02.564596Z","submitted_at":"2021-10-06T13:27:23Z","title":"On Margin Maximization in Linear and ReLU Networks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.02732","snapshot_observed_at":"2026-08-07T13:20:49.699637Z","title":"On Margin Maximization in Linear and ReLU Networks","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-09T05:34:59.359159Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:49.699637Z"},"links":{"cited_paper":"/paper/2110.02732","citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:271db3f25a8af3e7a4b4fc97dfe2a7c2a1e47a7065755c44eb3e58494a6d3b7b","observation_id":"503a1d71-526c-4b3a-8797-e03a34ddf718","resolution":{"observed_at":"2026-08-07T13:20:49.699637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6651","last_updated":"2015-10-25T12:12:52Z","snapshot_observed_at":"2026-08-04T14:14:16.864745Z","submitted_at":"2014-12-20T13:22:23Z","title":"Deep learning with Elastic Averaging SGD","version":8},"cited_work":{"arxiv_id":"1412.6651","doi":null,"metadata_source":"pith","pith_arxiv_id":"1412.6651","snapshot_observed_at":"2026-08-07T13:20:50.047593Z","title":"Deep learning with Elastic Averaging SGD","venue":"cs.LG","work_id":"b855016e-c36b-454b-bd79-34650ff0a2d3","year":2014},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-09T05:34:59.359159Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:49.832951Z"},"links":{"cited_paper":"/paper/1412.6651","citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:0598810e697df1f7be95b745d1d61fa3c00d000bb3c509a0de05b68247f1b3ff","observation_id":"de806598-2911-43d2-bd22-b44927348aae","resolution":{"observed_at":"2026-08-07T13:20:50.167971Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","latest_version":1,"primary_category":"math.OC","snapshot_observed_at":"2026-08-09T05:34:59.359159Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":4,"verified_fuzzy":25},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 2 inbound Pith citation observations for arXiv:2505.22085."}