{"as_of":"2026-08-08T20:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:81e8dc4d2626014441d4da301cefa147b07b9c65700e5758fd824b2dff916155","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T06:11:29.730991Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-13T16:04:03.659837Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-04T14:19:53.595449Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2602.00334","last_updated":"2026-06-26T15:42:22Z","snapshot_observed_at":"2026-08-04T12:23:15.813163Z","submitted_at":"2026-01-30T21:35:55Z","title":"Adaptive Momentum and Nonlinear Damping for Neural Network Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.00334","snapshot_observed_at":"2026-07-13T16:04:03.659837Z","title":"Adaptive momentum and nonlinear damping for neural network training.arXiv preprint arXiv:2602.00334, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.28919","last_updated":"2026-06-21T23:22:45Z","snapshot_observed_at":"2026-08-06T10:24:01.964126Z","submitted_at":"2026-03-30T18:51:50Z","title":"Why That Robot? A Qualitative Analysis of Justification Strategies for Robot Color Selection Across Occupational Contexts","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-13T16:04:03.659837Z"},"links":{"cited_paper":"/paper/2602.00334","citing_paper":"/paper/2603.28919"},"observation_digest":"sha256:0f3bdbb0ad90afce275cfb658ed06debb7be9d836c19dcdf8856d7e0bf73256f","observation_id":"fd97828f-68bb-4ca8-a6a1-a0558726bbbf","resolution":{"observed_at":"2026-07-13T16:04:03.659837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.00334","last_updated":"2026-06-26T15:42:22Z","snapshot_observed_at":"2026-08-04T12:23:15.813163Z","submitted_at":"2026-01-30T21:35:55Z","title":"Adaptive Momentum and Nonlinear Damping for Neural Network Training","version":2},"cited_work":{"arxiv_id":"2602.00334","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.00334","snapshot_observed_at":"2026-07-04T14:19:53.595449Z","title":"Adaptive momentum and nonlinear damping for neural network training","venue":"cs.LG","work_id":"ff6f1749-ba9b-45fe-ba88-b53c09d7ce67","year":2026},"citing_paper":{"arxiv_id":"2603.28921","last_updated":"2026-07-12T21:16:07Z","snapshot_observed_at":"2026-08-06T21:37:30.086736Z","submitted_at":"2026-03-30T18:53:03Z","title":"Critical Damping as a Momentum Schedule: Multi-Seed Validation, a Hybrid Recipe, and an Exhaustive Negative Result on Surgical Layer Selection","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-14T21:37:07.118251Z"},"links":{"cited_paper":"/paper/2602.00334","citing_paper":"/paper/2603.28921"},"observation_digest":"sha256:1ed6a27d1bb51324e4a6f8f1caeac1d433fa314faf31c7f5213b7668f4ffb3fb","observation_id":"00166406-e7ae-4a48-b390-31fbd9891b79","resolution":{"observed_at":"2026-06-29T02:14:52.586729Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.00334","last_updated":"2026-06-26T15:42:22Z","snapshot_observed_at":"2026-08-04T12:23:15.813163Z","submitted_at":"2026-01-30T21:35:55Z","title":"Adaptive Momentum and Nonlinear Damping for Neural Network Training","version":2},"cited_work":{"arxiv_id":"2602.00334","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.00334","snapshot_observed_at":"2026-07-04T14:19:53.595449Z","title":"Adaptive momentum and nonlinear damping for neural network training","venue":"cs.LG","work_id":"ff6f1749-ba9b-45fe-ba88-b53c09d7ce67","year":2026},"citing_paper":{"arxiv_id":"2606.26881","last_updated":"2026-06-25T11:09:22Z","snapshot_observed_at":"2026-08-06T22:27:18.085075Z","submitted_at":"2026-06-25T11:09:22Z","title":"Accelerated sampling using SamAdams variable timesteps and position-adaptive Langevin dynamics","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-26T04:20:03.240204Z"},"links":{"cited_paper":"/paper/2602.00334","citing_paper":"/paper/2606.26881"},"observation_digest":"sha256:86eb23e34ccf34fcab14961d78ed43a1ad59661e3bb3877d4f9e05a74e4e9411","observation_id":"45411261-81ed-4260-83c2-36c78c06ca4c","resolution":{"observed_at":"2026-07-04T14:19:53.597036Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2602.00334/citation-record","integrity":"/paper/2602.00334/integrity","json":"/paper/2602.00334/citation-record.json","paper":"/paper/2602.00334"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:11:29.592986Z","title":"Babister","venue":null,"work_id":null,"year":1976},"citing_paper":{"arxiv_id":"2602.00334","last_updated":"2026-06-26T15:42:22Z","snapshot_observed_at":"2026-08-04T12:23:15.813163Z","submitted_at":"2026-01-30T21:35:55Z","title":"Adaptive Momentum and Nonlinear Damping for Neural Network Training","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T06:11:29.592986Z"},"links":{"citing_paper":"/paper/2602.00334"},"observation_digest":"sha256:a17118cb1472679796378039b9e3fb0d7722c18fcde45b695a94ffdce23ca70e","observation_id":"2f0c6035-00f9-4c95-9be7-34e48281ff2e","resolution":{"observed_at":"2026-08-03T06:11:29.592986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:11:29.598487Z","title":"Shallue, Zachary Nado, Jaehoon Lee, Chris J","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.00334","last_updated":"2026-06-26T15:42:22Z","snapshot_observed_at":"2026-08-04T12:23:15.813163Z","submitted_at":"2026-01-30T21:35:55Z","title":"Adaptive Momentum and Nonlinear Damping for Neural Network Training","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T06:11:29.598487Z"},"links":{"citing_paper":"/paper/2602.00334"},"observation_digest":"sha256:935f6b32994ff2c5421f256d1b4f433cbf1a3e2b0c8e68d7337c88be5898c815","observation_id":"6a84bdaa-253c-45fe-ae89-ca0acc9bb4f0","resolution":{"observed_at":"2026-08-03T06:11:29.598487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:11:29.602279Z","title":"The Loss Surfaces of Multilayer Networks","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2602.00334","last_updated":"2026-06-26T15:42:22Z","snapshot_observed_at":"2026-08-04T12:23:15.813163Z","submitted_at":"2026-01-30T21:35:55Z","title":"Adaptive Momentum and Nonlinear Damping for Neural Network Training","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T06:11:29.602279Z"},"links":{"citing_paper":"/paper/2602.00334"},"observation_digest":"sha256:26d14e5cadbdabc94658b7cfd00f1769ab988cb48ff1f4bc0e8ab12fe94f5353","observation_id":"597268a4-c664-4755-93d8-a88646b627d7","resolution":{"observed_at":"2026-08-03T06:11:29.602279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:11:29.606013Z","title":"A general system of differential equations to model first-order adaptive algorithms.The Journal of Machine Learning Research, 21(1):5072–5113, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.00334","last_updated":"2026-06-26T15:42:22Z","snapshot_observed_at":"2026-08-04T12:23:15.813163Z","submitted_at":"2026-01-30T21:35:55Z","title":"Adaptive Momentum and Nonlinear Damping for Neural Network Training","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T06:11:29.606013Z"},"links":{"citing_paper":"/paper/2602.00334"},"observation_digest":"sha256:480f0a646190568ff03b0cdeb23991f7588690837ce8f1e8fe68f41b88e15761","observation_id":"31f4efd1-e758-48a4-8eaf-321c926e13a6","resolution":{"observed_at":"2026-08-03T06:11:29.606013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:11:29.609393Z","title":"Skeel, and Hartmut Neven","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2602.00334","last_updated":"2026-06-26T15:42:22Z","snapshot_observed_at":"2026-08-04T12:23:15.813163Z","submitted_at":"2026-01-30T21:35:55Z","title":"Adaptive Momentum and Nonlinear Damping for Neural Network Training","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T06:11:29.609393Z"},"links":{"citing_paper":"/paper/2602.00334"},"observation_digest":"sha256:adf6a0efe92d438fdd21c7ea89e326ee651da1dbb675db7f69909fb2754fcdb1","observation_id":"cb46836d-1686-43e3-a44c-0d2d3343a5c4","resolution":{"observed_at":"2026-08-03T06:11:29.609393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.08658","last_updated":"2024-05-20T11:42:43Z","snapshot_observed_at":"2026-08-06T17:51:23.074751Z","submitted_at":"2023-05-15T14:03:16Z","title":"On the connections between optimization algorithms, Lyapunov functions, and differential equations: theory and insights","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.08658","snapshot_observed_at":"2026-08-03T06:11:29.613412Z","title":"On the connections between optimization algorithms, lyapunov functions, and differential equations: theory and insights.arXiv preprint arXiv:2305.08658, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.00334","last_updated":"2026-06-26T15:42:22Z","snapshot_observed_at":"2026-08-04T12:23:15.813163Z","submitted_at":"2026-01-30T21:35:55Z","title":"Adaptive Momentum and Nonlinear Damping for Neural Network Training","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T06:11:29.613412Z"},"links":{"cited_paper":"/paper/2305.08658","citing_paper":"/paper/2602.00334"},"observation_digest":"sha256:f4e7230406f26655c67eab2e272552fdc0404b66dff40b39a2a535bb34987c4d","observation_id":"7c76e864-a014-44e8-beff-6c62150cd4cf","resolution":{"observed_at":"2026-08-03T06:11:29.613412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:11:29.619445Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2602.00334","last_updated":"2026-06-26T15:42:22Z","snapshot_observed_at":"2026-08-04T12:23:15.813163Z","submitted_at":"2026-01-30T21:35:55Z","title":"Adaptive Momentum and Nonlinear Damping for Neural Network Training","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T06:11:29.619445Z"},"links":{"citing_paper":"/paper/2602.00334"},"observation_digest":"sha256:3877144b1f89ee45bc7addfa49488698b9647735c6b411ebc8548a80df27f402","observation_id":"42ffdc63-1221-4cb6-9304-54b1e49c24d8","resolution":{"observed_at":"2026-08-03T06:11:29.619445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:11:29.622864Z","title":"PhD thesis, The University of Edinburgh, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.00334","last_updated":"2026-06-26T15:42:22Z","snapshot_observed_at":"2026-08-04T12:23:15.813163Z","submitted_at":"2026-01-30T21:35:55Z","title":"Adaptive Momentum and Nonlinear Damping for Neural Network Training","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T06:11:29.622864Z"},"links":{"citing_paper":"/paper/2602.00334"},"observation_digest":"sha256:01a04415e6d7f7a4f0889bd6662b917ec0951a045cb8145079cf56f76d2f5e75","observation_id":"60156c92-b602-416a-8497-3f24f36a0648","resolution":{"observed_at":"2026-08-03T06:11:29.622864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:11:29.626073Z","title":"Friction-adaptive descent: A family of dynamics- based optimization methods.Journal of Computational Dynamics, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.00334","last_updated":"2026-06-26T15:42:22Z","snapshot_observed_at":"2026-08-04T12:23:15.813163Z","submitted_at":"2026-01-30T21:35:55Z","title":"Adaptive Momentum and Nonlinear Damping for Neural Network Training","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T06:11:29.626073Z"},"links":{"citing_paper":"/paper/2602.00334"},"observation_digest":"sha256:c015458458792e23d7634522e2ff8fcc2dfaeab25e2d150f1c1baa1ec8912c6e","observation_id":"989dcf78-4e79-4859-b6f0-31bd854e8045","resolution":{"observed_at":"2026-08-03T06:11:29.626073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:11:29.629454Z","title":"nanogpt: The simplest, fastest repository for training/finetuning medium-sized gpts","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.00334","last_updated":"2026-06-26T15:42:22Z","snapshot_observed_at":"2026-08-04T12:23:15.813163Z","submitted_at":"2026-01-30T21:35:55Z","title":"Adaptive Momentum and Nonlinear Damping for Neural Network Training","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T06:11:29.629454Z"},"links":{"citing_paper":"/paper/2602.00334"},"observation_digest":"sha256:c25bd29b7cf4553b8f818e6455a9962d6fec75f6bcc2ab229a75f2a7eddecb4a","observation_id":"979d6269-7061-41da-9717-46941a9374dd","resolution":{"observed_at":"2026-08-03T06:11:29.629454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:11:29.632805Z","title":"Kingma and Jimmy Ba","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2602.00334","last_updated":"2026-06-26T15:42:22Z","snapshot_observed_at":"2026-08-04T12:23:15.813163Z","submitted_at":"2026-01-30T21:35:55Z","title":"Adaptive Momentum and Nonlinear Damping for Neural Network Training","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T06:11:29.632805Z"},"links":{"citing_paper":"/paper/2602.00334"},"observation_digest":"sha256:a34c3c20c967500db52ff464f10f24031dad81c4fcbc6a93158823e44681b134","observation_id":"aca7b679-9af8-4154-851e-4e6c13d33a78","resolution":{"observed_at":"2026-08-03T06:11:29.632805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:11:29.636657Z","title":"Learning multiple layers of features from tiny images","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2602.00334","last_updated":"2026-06-26T15:42:22Z","snapshot_observed_at":"2026-08-04T12:23:15.813163Z","submitted_at":"2026-01-30T21:35:55Z","title":"Adaptive Momentum and Nonlinear Damping for Neural Network Training","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T06:11:29.636657Z"},"links":{"citing_paper":"/paper/2602.00334"},"observation_digest":"sha256:1c9cbdbdb241652d5087d914ebbc7ed04b4804630873af3f8fe10913897ff493","observation_id":"7628a4d8-b3fd-462a-bdf7-24fa093ed350","resolution":{"observed_at":"2026-08-03T06:11:29.636657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13960","last_updated":"2023-04-27T05:41:13Z","snapshot_observed_at":"2026-08-02T07:55:35.655526Z","submitted_at":"2023-04-27T05:41:13Z","title":"Noise Is Not the Main Factor Behind the Gap Between SGD and Adam on Transformers, but Sign Descent Might Be","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.13960","snapshot_observed_at":"2026-08-03T06:11:29.640167Z","title":"Noise is not the main factor behind the gap between sgd and adam on transformers, but sign descent might be.arXiv preprint arXiv:2304.13960, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.00334","last_updated":"2026-06-26T15:42:22Z","snapshot_observed_at":"2026-08-04T12:23:15.813163Z","submitted_at":"2026-01-30T21:35:55Z","title":"Adaptive Momentum and Nonlinear Damping for Neural Network Training","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T06:11:29.640167Z"},"links":{"cited_paper":"/paper/2304.13960","citing_paper":"/paper/2602.00334"},"observation_digest":"sha256:a0f8d97345eb277bb3f9a4a34bfb9d749af618fb953e5ac8dda8072a932fa2d5","observation_id":"e9ce34c1-f83e-49e6-bccc-c494205e3a2b","resolution":{"observed_at":"2026-08-03T06:11:29.640167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:11:29.643972Z","title":"Cambridge Monographs on Applied and Computational Mathematics","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2602.00334","last_updated":"2026-06-26T15:42:22Z","snapshot_observed_at":"2026-08-04T12:23:15.813163Z","submitted_at":"2026-01-30T21:35:55Z","title":"Adaptive Momentum and Nonlinear Damping for Neural Network Training","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T06:11:29.643972Z"},"links":{"citing_paper":"/paper/2602.00334"},"observation_digest":"sha256:ebe0c6ef5e49114691beda46921b30d08ea38c0c3737d89a40f6cf6a2614a16d","observation_id":"fa31be18-bd17-4b5b-bff8-8d2439163b1f","resolution":{"observed_at":"2026-08-03T06:11:29.643972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:11:29.648521Z","title":"Visualizing the loss landscape of neural nets.Advances in neural information processing systems, 31, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2602.00334","last_updated":"2026-06-26T15:42:22Z","snapshot_observed_at":"2026-08-04T12:23:15.813163Z","submitted_at":"2026-01-30T21:35:55Z","title":"Adaptive Momentum and Nonlinear Damping for Neural Network Training","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T06:11:29.648521Z"},"links":{"citing_paper":"/paper/2602.00334"},"observation_digest":"sha256:024ac9e9560d5f5a6899c846cb76e3f85dd96bf6f050cb7dc96bfd5ebb14b89a","observation_id":"cc94bf1f-ad23-46ea-837b-a61c82b58945","resolution":{"observed_at":"2026-08-03T06:11:29.648521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.05042","last_updated":"2018-09-13T16:21:11Z","snapshot_observed_at":"2026-07-06T07:02:02.624968Z","submitted_at":"2018-09-13T16:21:11Z","title":"Hamiltonian Descent Methods","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.05042","snapshot_observed_at":"2026-08-03T06:11:29.653044Z","title":"Maddison, D","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2602.00334","last_updated":"2026-06-26T15:42:22Z","snapshot_observed_at":"2026-08-04T12:23:15.813163Z","submitted_at":"2026-01-30T21:35:55Z","title":"Adaptive Momentum and Nonlinear Damping for Neural Network Training","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T06:11:29.653044Z"},"links":{"cited_paper":"/paper/1809.05042","citing_paper":"/paper/2602.00334"},"observation_digest":"sha256:8ee460a4829bc961a78483d506f85601edb29a63edbd3d8609018a47932bbeb6","observation_id":"960dec9c-15fb-41b1-bfaf-83ca10712a24","resolution":{"observed_at":"2026-08-03T06:11:29.653044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:11:29.657818Z","title":"Small batch size training for language models: When vanilla SGD works, and why gradient accumulation is wasteful","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.00334","last_updated":"2026-06-26T15:42:22Z","snapshot_observed_at":"2026-08-04T12:23:15.813163Z","submitted_at":"2026-01-30T21:35:55Z","title":"Adaptive Momentum and Nonlinear Damping for Neural Network Training","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T06:11:29.657818Z"},"links":{"citing_paper":"/paper/2602.00334"},"observation_digest":"sha256:0057254182f49b9673efcfed39bad1343385406d8f69bda639429223220b841e","observation_id":"0af9ca39-85c2-4a47-afa5-7c2c06c164c6","resolution":{"observed_at":"2026-08-03T06:11:29.657818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:11:29.661515Z","title":"Mattingly, A.M","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2602.00334","last_updated":"2026-06-26T15:42:22Z","snapshot_observed_at":"2026-08-04T12:23:15.813163Z","submitted_at":"2026-01-30T21:35:55Z","title":"Adaptive Momentum and Nonlinear Damping for Neural Network Training","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T06:11:29.661515Z"},"links":{"citing_paper":"/paper/2602.00334"},"observation_digest":"sha256:9292fa186f396fa6ef457c0d4016e1525304d1c7e167d1e82a09d66c86ffcfb4","observation_id":"06e89cca-4bc2-4705-a479-ba3d86eb1f7f","resolution":{"observed_at":"2026-08-03T06:11:29.661515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:11:29.665621Z","title":"A systematic approach to Lyapunov analyses of continuous-time models in convex optimization.SIAM Journal on Optimization, 33(3):1558–1586, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.00334","last_updated":"2026-06-26T15:42:22Z","snapshot_observed_at":"2026-08-04T12:23:15.813163Z","submitted_at":"2026-01-30T21:35:55Z","title":"Adaptive Momentum and Nonlinear Damping for Neural Network Training","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T06:11:29.665621Z"},"links":{"citing_paper":"/paper/2602.00334"},"observation_digest":"sha256:cc106f5d58511e8e5b12098815820ae8bf6f83cc3eb532e2df44ba8648c025a6","observation_id":"68bdde7a-164a-495a-ab3b-c01d1a571320","resolution":{"observed_at":"2026-08-03T06:11:29.665621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:11:29.670210Z","title":"A method of solving a convex programming problem with convergence rate o( 1 k2 ).Doklady Akademii Nauk SSSR, 269(3):543, 1983","venue":null,"work_id":null,"year":1983},"citing_paper":{"arxiv_id":"2602.00334","last_updated":"2026-06-26T15:42:22Z","snapshot_observed_at":"2026-08-04T12:23:15.813163Z","submitted_at":"2026-01-30T21:35:55Z","title":"Adaptive Momentum and Nonlinear Damping for Neural Network Training","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T06:11:29.670210Z"},"links":{"citing_paper":"/paper/2602.00334"},"observation_digest":"sha256:7e59d3f0914139dfdcbeb781ba75fa4a9dbc2991fcdb0b8b61654148c8559905","observation_id":"97851a62-e045-492c-943f-639e9cf15731","resolution":{"observed_at":"2026-08-03T06:11:29.670210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:11:29.674273Z","title":"Springer Science & Business Media, 2013","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2602.00334","last_updated":"2026-06-26T15:42:22Z","snapshot_observed_at":"2026-08-04T12:23:15.813163Z","submitted_at":"2026-01-30T21:35:55Z","title":"Adaptive Momentum and Nonlinear Damping for Neural Network Training","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T06:11:29.674273Z"},"links":{"citing_paper":"/paper/2602.00334"},"observation_digest":"sha256:13950c927fa3289288003c230b7b4c7e94a4821e96f0a8637a951ae2ce6c152c","observation_id":"9fa46088-cc97-489a-9746-ecd2372b0931","resolution":{"observed_at":"2026-08-03T06:11:29.674273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:11:29.677825Z","title":"Adaptive restart for accelerated gradient schemes.Found","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2602.00334","last_updated":"2026-06-26T15:42:22Z","snapshot_observed_at":"2026-08-04T12:23:15.813163Z","submitted_at":"2026-01-30T21:35:55Z","title":"Adaptive Momentum and Nonlinear Damping for Neural Network Training","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T06:11:29.677825Z"},"links":{"citing_paper":"/paper/2602.00334"},"observation_digest":"sha256:b6544bbe3aa4413d7d16fab400166798b1d866714f9e685e6d9f5578b97daf53","observation_id":"5450dca8-5bf9-4fc2-8d0e-ed8b3ddf8d4e","resolution":{"observed_at":"2026-08-03T06:11:29.677825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:11:29.681358Z","title":"Panananda, N.S","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2602.00334","last_updated":"2026-06-26T15:42:22Z","snapshot_observed_at":"2026-08-04T12:23:15.813163Z","submitted_at":"2026-01-30T21:35:55Z","title":"Adaptive Momentum and Nonlinear Damping for Neural Network Training","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T06:11:29.681358Z"},"links":{"citing_paper":"/paper/2602.00334"},"observation_digest":"sha256:7e73fb1a12bbbcebc0309a44bd62f61226566bd361350588a6ec8e02f8900192","observation_id":"1c16d9ac-7ef8-450b-94e5-46db364bcb33","resolution":{"observed_at":"2026-08-03T06:11:29.681358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:11:29.684766Z","title":null,"venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2602.00334","last_updated":"2026-06-26T15:42:22Z","snapshot_observed_at":"2026-08-04T12:23:15.813163Z","submitted_at":"2026-01-30T21:35:55Z","title":"Adaptive Momentum and Nonlinear Damping for Neural Network Training","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T06:11:29.684766Z"},"links":{"citing_paper":"/paper/2602.00334"},"observation_digest":"sha256:1bf24840ddfa6afb279c9e5a0a077d7a1a1225fc02ff1a1b01c95f04ebedf1d4","observation_id":"2a57f5cb-a81e-41c9-bf5d-9fbda553ab63","resolution":{"observed_at":"2026-08-03T06:11:29.684766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:11:29.688080Z","title":null,"venue":null,"work_id":null,"year":1964},"citing_paper":{"arxiv_id":"2602.00334","last_updated":"2026-06-26T15:42:22Z","snapshot_observed_at":"2026-08-04T12:23:15.813163Z","submitted_at":"2026-01-30T21:35:55Z","title":"Adaptive Momentum and Nonlinear Damping for Neural Network Training","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T06:11:29.688080Z"},"links":{"citing_paper":"/paper/2602.00334"},"observation_digest":"sha256:2e49d81618272bceb0aa32404ac454cf9d62877ff98c7b9b5d8c50543ea6c972","observation_id":"ac3b1b45-2135-495f-802f-758c5fad9a41","resolution":{"observed_at":"2026-08-03T06:11:29.688080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:11:29.691489Z","title":"Covariance-controlled adaptive langevin thermostat for large-scale bayesian sampling","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2602.00334","last_updated":"2026-06-26T15:42:22Z","snapshot_observed_at":"2026-08-04T12:23:15.813163Z","submitted_at":"2026-01-30T21:35:55Z","title":"Adaptive Momentum and Nonlinear Damping for Neural Network Training","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T06:11:29.691489Z"},"links":{"citing_paper":"/paper/2602.00334"},"observation_digest":"sha256:6086e286053e8413a02b7d7a4a2b2bcaf6d46b17dcdbfaee597f599dfa4a8782","observation_id":"74e0610e-8409-4c9d-bfc7-a591fffae82a","resolution":{"observed_at":"2026-08-03T06:11:29.691489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04274","last_updated":"2025-04-05T20:07:34Z","snapshot_observed_at":"2026-08-07T16:08:19.854833Z","submitted_at":"2025-04-05T20:07:34Z","title":"Randomised Splitting Methods and Stochastic Gradient Descent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.04274","snapshot_observed_at":"2026-08-03T06:11:29.695100Z","title":"Randomised splitting methods and stochastic gradient descent","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.00334","last_updated":"2026-06-26T15:42:22Z","snapshot_observed_at":"2026-08-04T12:23:15.813163Z","submitted_at":"2026-01-30T21:35:55Z","title":"Adaptive Momentum and Nonlinear Damping for Neural Network Training","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T06:11:29.695100Z"},"links":{"cited_paper":"/paper/2504.04274","citing_paper":"/paper/2602.00334"},"observation_digest":"sha256:a54c4213cfdc0ea8ab6a6f06fe4b64b41359196cae97fb23457930daee945d84","observation_id":"4381d484-4cc2-44d5-be3a-fb2f38af0e6c","resolution":{"observed_at":"2026-08-03T06:11:29.695100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:11:29.699339Z","title":"Simsekli, L","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.00334","last_updated":"2026-06-26T15:42:22Z","snapshot_observed_at":"2026-08-04T12:23:15.813163Z","submitted_at":"2026-01-30T21:35:55Z","title":"Adaptive Momentum and Nonlinear Damping for Neural Network Training","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T06:11:29.699339Z"},"links":{"citing_paper":"/paper/2602.00334"},"observation_digest":"sha256:b4cd8d7f664afc0a2591d968336fef550a42d8277cf1efa413cd4d03a14e94f3","observation_id":"46e04104-aa7b-450e-bc1a-2d6c53f78218","resolution":{"observed_at":"2026-08-03T06:11:29.699339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:11:29.703604Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2602.00334","last_updated":"2026-06-26T15:42:22Z","snapshot_observed_at":"2026-08-04T12:23:15.813163Z","submitted_at":"2026-01-30T21:35:55Z","title":"Adaptive Momentum and Nonlinear Damping for Neural Network Training","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T06:11:29.703604Z"},"links":{"citing_paper":"/paper/2602.00334"},"observation_digest":"sha256:7aa1d363e3d8cc6d6fd1c4fee0137e14b0bb1f4ffd59854ad6919a09c4e5606c","observation_id":"a8757a58-df64-492b-97a9-6632d214630c","resolution":{"observed_at":"2026-08-03T06:11:29.703604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:11:29.707358Z","title":"On the importance of initialization and momentum in deep learning","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2602.00334","last_updated":"2026-06-26T15:42:22Z","snapshot_observed_at":"2026-08-04T12:23:15.813163Z","submitted_at":"2026-01-30T21:35:55Z","title":"Adaptive Momentum and Nonlinear Damping for Neural Network Training","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T06:11:29.707358Z"},"links":{"citing_paper":"/paper/2602.00334"},"observation_digest":"sha256:14cf75d1647b7a384304b0a10186f17c797817d9c767de8900af419a20334fc4","observation_id":"6041bf79-8a56-4074-b659-de221b57f55a","resolution":{"observed_at":"2026-08-03T06:11:29.707358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:11:29.710755Z","title":"Understanding why adam outperforms sgd: Gradient heterogeneity in transformers.arXiv preprint arXiv:2502.00213, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.00334","last_updated":"2026-06-26T15:42:22Z","snapshot_observed_at":"2026-08-04T12:23:15.813163Z","submitted_at":"2026-01-30T21:35:55Z","title":"Adaptive Momentum and Nonlinear Damping for Neural Network Training","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T06:11:29.710755Z"},"links":{"citing_paper":"/paper/2602.00334"},"observation_digest":"sha256:cddda7da72eb56aee377a6754aab8c5de40c75d8ac266b0b5aed82ccc3605e44","observation_id":"0c62b798-9db9-44db-842f-21de740082f1","resolution":{"observed_at":"2026-08-03T06:11:29.710755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.07461","last_updated":"2019-02-22T23:53:34Z","snapshot_observed_at":"2026-07-06T06:34:26.609892Z","submitted_at":"2018-04-20T06:35:04Z","title":"GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.07461","snapshot_observed_at":"2026-08-03T06:11:29.714104Z","title":"Glue: A multi-task benchmark and analysis platform for natural language understanding.arXiv preprint arXiv:1804.07461, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2602.00334","last_updated":"2026-06-26T15:42:22Z","snapshot_observed_at":"2026-08-04T12:23:15.813163Z","submitted_at":"2026-01-30T21:35:55Z","title":"Adaptive Momentum and Nonlinear Damping for Neural Network Training","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T06:11:29.714104Z"},"links":{"cited_paper":"/paper/1804.07461","citing_paper":"/paper/2602.00334"},"observation_digest":"sha256:0663de572000551aae891ee76d7181978511c5c8da72451d8c21cc0360230582","observation_id":"098513e5-c832-4046-a10e-3981e94b86d2","resolution":{"observed_at":"2026-08-03T06:11:29.714104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:11:29.718055Z","title":"Tinyvit: Fast pretraining distillation for small vision transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.00334","last_updated":"2026-06-26T15:42:22Z","snapshot_observed_at":"2026-08-04T12:23:15.813163Z","submitted_at":"2026-01-30T21:35:55Z","title":"Adaptive Momentum and Nonlinear Damping for Neural Network Training","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T06:11:29.718055Z"},"links":{"citing_paper":"/paper/2602.00334"},"observation_digest":"sha256:103f5c7978f62acb238581710ce356f0fb50329822163d51228dcbd62fea9630","observation_id":"ca109e73-eacb-49d1-bff7-64bb68d521e2","resolution":{"observed_at":"2026-08-03T06:11:29.718055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:11:29.722380Z","title":"Why are adaptive methods good for attention models?Advances in Neural Information Processing Systems, 33:15383–15393, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.00334","last_updated":"2026-06-26T15:42:22Z","snapshot_observed_at":"2026-08-04T12:23:15.813163Z","submitted_at":"2026-01-30T21:35:55Z","title":"Adaptive Momentum and Nonlinear Damping for Neural Network Training","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T06:11:29.722380Z"},"links":{"citing_paper":"/paper/2602.00334"},"observation_digest":"sha256:fe70a96d051e5d9119d6b23463d6db99ee79538264c0780e29574d9a47060022","observation_id":"c27e3161-a93f-4585-abbb-83c4d7513771","resolution":{"observed_at":"2026-08-03T06:11:29.722380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:11:29.726157Z","title":"Why transformers need adam: A hessian perspective","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.00334","last_updated":"2026-06-26T15:42:22Z","snapshot_observed_at":"2026-08-04T12:23:15.813163Z","submitted_at":"2026-01-30T21:35:55Z","title":"Adaptive Momentum and Nonlinear Damping for Neural Network Training","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T06:11:29.726157Z"},"links":{"citing_paper":"/paper/2602.00334"},"observation_digest":"sha256:eb939b3690bc8a3ecf65de00927f7dfcb64e204bc21c49839353c4f2e034ef23","observation_id":"1dd202e5-12ed-4bc8-b37f-d669aa3a4512","resolution":{"observed_at":"2026-08-03T06:11:29.726157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:11:29.730991Z","title":"artificial","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.00334","last_updated":"2026-06-26T15:42:22Z","snapshot_observed_at":"2026-08-04T12:23:15.813163Z","submitted_at":"2026-01-30T21:35:55Z","title":"Adaptive Momentum and Nonlinear Damping for Neural Network Training","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T06:11:29.730991Z"},"links":{"citing_paper":"/paper/2602.00334"},"observation_digest":"sha256:74ca5bf8140f42cbdcefe65b0ce20e1b5fbf70a0ccb4df6c119ec77af3189998","observation_id":"edc59ee7-5dee-40ed-a4e6-1e2b0c788f10","resolution":{"observed_at":"2026-08-03T06:11:29.730991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2602.00334","last_updated":"2026-06-26T15:42:22Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-04T12:23:15.813163Z","submitted_at":"2026-01-30T21:35:55Z","title":"Adaptive Momentum and Nonlinear Damping for Neural Network Training"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":36,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 3 inbound Pith citation observations for arXiv:2602.00334."}