{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:BRWM2Y7ZXJDNYXCRPWX4DOAIYN","short_pith_number":"pith:BRWM2Y7Z","schema_version":"1.0","canonical_sha256":"0c6ccd63f9ba46dc5c517dafc1b808c373edf914be2fcce2333f8d5d1dcb1580","source":{"kind":"arxiv","id":"2412.02153","version":2},"attestation_state":"computed","paper":{"title":"Revisiting the Initial Steps in Adaptive Gradient Descent Optimization","license":"http://creativecommons.org/publicdomain/zero/1.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.LG","authors_text":"Abulikemu Abuduweili, Changliu Liu","submitted_at":"2024-12-03T04:28:14Z","abstract_excerpt":"Adaptive gradient optimization methods, such as Adam, are prevalent in training deep neural networks across diverse machine learning tasks due to their ability to achieve faster convergence. However, these methods often suffer from suboptimal generalization compared to stochastic gradient descent (SGD) and exhibit instability, particularly when training Transformer models. In this work, we show the standard initialization of the second-order moment estimation ($v_0 =0$) as a significant factor contributing to these limitations. We introduce simple yet effective solutions: initializing the seco"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2412.02153","kind":"arxiv","version":2},"metadata":{"license":"http://creativecommons.org/publicdomain/zero/1.0/","primary_cat":"cs.LG","submitted_at":"2024-12-03T04:28:14Z","cross_cats_sorted":["cs.AI"],"title_canon_sha256":"e59624e331ffee9e2e6bd64aa1fa8b62785243cc2bf4fe3c65c5c93f0ede94ba","abstract_canon_sha256":"85ef16b46b6fb28b36e3aed403d4bd67580a9952d1254f1cc934e04772f81f8b"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:12:50.400929Z","signature_b64":"OipAKN985JjUVI3i3Jg3uY9TUhpt+IYhQpAvqKm7GKoKnae7aZtC531/Pmht48kreq0OigCaj14Ru0tY9nzHBg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"0c6ccd63f9ba46dc5c517dafc1b808c373edf914be2fcce2333f8d5d1dcb1580","last_reissued_at":"2026-07-05T10:12:50.400449Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:12:50.400449Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Revisiting the Initial Steps in Adaptive Gradient Descent Optimization","license":"http://creativecommons.org/publicdomain/zero/1.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.LG","authors_text":"Abulikemu Abuduweili, Changliu Liu","submitted_at":"2024-12-03T04:28:14Z","abstract_excerpt":"Adaptive gradient optimization methods, such as Adam, are prevalent in training deep neural networks across diverse machine learning tasks due to their ability to achieve faster convergence. However, these methods often suffer from suboptimal generalization compared to stochastic gradient descent (SGD) and exhibit instability, particularly when training Transformer models. In this work, we show the standard initialization of the second-order moment estimation ($v_0 =0$) as a significant factor contributing to these limitations. We introduce simple yet effective solutions: initializing the seco"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2412.02153","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2412.02153/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2412.02153","created_at":"2026-07-05T10:12:50.400511+00:00"},{"alias_kind":"arxiv_version","alias_value":"2412.02153v2","created_at":"2026-07-05T10:12:50.400511+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2412.02153","created_at":"2026-07-05T10:12:50.400511+00:00"},{"alias_kind":"pith_short_12","alias_value":"BRWM2Y7ZXJDN","created_at":"2026-07-05T10:12:50.400511+00:00"},{"alias_kind":"pith_short_16","alias_value":"BRWM2Y7ZXJDNYXCR","created_at":"2026-07-05T10:12:50.400511+00:00"},{"alias_kind":"pith_short_8","alias_value":"BRWM2Y7Z","created_at":"2026-07-05T10:12:50.400511+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":1,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2604.26481","citing_title":"A Provably Robust Multi-Jet Framework applied to Active Flow Control of an Airfoil in Weakly Compressible Flow","ref_index":58,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/BRWM2Y7ZXJDNYXCRPWX4DOAIYN","json":"https://pith.science/pith/BRWM2Y7ZXJDNYXCRPWX4DOAIYN.json","graph_json":"https://pith.science/api/pith-number/BRWM2Y7ZXJDNYXCRPWX4DOAIYN/graph.json","events_json":"https://pith.science/api/pith-number/BRWM2Y7ZXJDNYXCRPWX4DOAIYN/events.json","paper":"https://pith.science/paper/BRWM2Y7Z"},"agent_actions":{"view_html":"https://pith.science/pith/BRWM2Y7ZXJDNYXCRPWX4DOAIYN","download_json":"https://pith.science/pith/BRWM2Y7ZXJDNYXCRPWX4DOAIYN.json","view_paper":"https://pith.science/paper/BRWM2Y7Z","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2412.02153&json=true","fetch_graph":"https://pith.science/api/pith-number/BRWM2Y7ZXJDNYXCRPWX4DOAIYN/graph.json","fetch_events":"https://pith.science/api/pith-number/BRWM2Y7ZXJDNYXCRPWX4DOAIYN/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/BRWM2Y7ZXJDNYXCRPWX4DOAIYN/action/timestamp_anchor","attest_storage":"https://pith.science/pith/BRWM2Y7ZXJDNYXCRPWX4DOAIYN/action/storage_attestation","attest_author":"https://pith.science/pith/BRWM2Y7ZXJDNYXCRPWX4DOAIYN/action/author_attestation","sign_citation":"https://pith.science/pith/BRWM2Y7ZXJDNYXCRPWX4DOAIYN/action/citation_signature","submit_replication":"https://pith.science/pith/BRWM2Y7ZXJDNYXCRPWX4DOAIYN/action/replication_record"}},"created_at":"2026-07-05T10:12:50.400511+00:00","updated_at":"2026-07-05T10:12:50.400511+00:00"}