{"as_of":"2026-08-20T04:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9e9b8ae54079f5528f5adee0f2653876df005f85590b7680e264833fe7b403a8","coverage":[{"denominator":61,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":61,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:18:01.484321Z","state":"measured"},{"denominator":62,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":62,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T15:16:58.221358Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T10:51:20.335706Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-19T18:09:32.703042Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"cited_work":{"arxiv_id":"2504.16020","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.16020","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Alphagrad: Non-linear gradient normaliza- tion optimizer","venue":null,"work_id":"776d7209-efd8-466f-83c2-98630346d348","year":2025},"citing_paper":{"arxiv_id":"2604.12968","last_updated":"2026-04-14T17:01:36Z","snapshot_observed_at":"2026-08-13T03:34:38.365145Z","submitted_at":"2026-04-14T17:01:36Z","title":"Evolution of Optimization Methods: Algorithms, Scenarios, and Evaluations","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T15:16:58.221358Z"},"links":{"cited_paper":"/paper/2504.16020","citing_paper":"/paper/2604.12968"},"observation_digest":"sha256:a4d5a71f9af81a13684b817c31324e62f6c9cd6d33be6ccbc504add9b864ea36","observation_id":"cd69f85d-8f87-465c-b112-f26a6ae7068f","resolution":{"observed_at":"2026-05-11T10:51:20.376166Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2504.16020/citation-record","integrity":"/paper/2504.16020/integrity","json":"/paper/2504.16020/citation-record.json","paper":"/paper/2504.16020"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1512.03385","last_updated":"2015-12-10T19:51:55Z","snapshot_observed_at":"2026-07-06T04:39:28.429064Z","submitted_at":"2015-12-10T19:51:55Z","title":"Deep Residual Learning for Image Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1512.03385","snapshot_observed_at":"2026-08-16T11:18:01.192380Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-19T18:09:32.703042Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.192380Z"},"links":{"cited_paper":"/paper/1512.03385","citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:e37b319cfad34c9166fdecd39083ecbd4732ffd8ccc94af7155628d9cd0355ad","observation_id":"fdcf8736-834a-40ce-87ec-b7aa8f592c36","resolution":{"observed_at":"2026-08-16T11:18:01.192380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-08-14T18:16:28.847993Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-16T11:18:01.197775Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-19T18:09:32.703042Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.197775Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:31548b010ddf0c1335f37157a82d1f811025450d9dbcdc09b3614cb6948582b1","observation_id":"c32a567b-d648-491d-813f-f666ce7592e0","resolution":{"observed_at":"2026-08-16T11:18:01.197775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:18:02.388305Z","title":"A., Veness, J., Bellemare, M","venue":null,"work_id":"2e5462cb-c472-4a77-8fd3-ca8f2bbe73ef","year":2015},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-19T18:09:32.703042Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.202353Z"},"links":{"citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:be4e7a25102698334adfe3343a1ae37efe2169f3f85dba2e75d4548f75cf70f0","observation_id":"df8681bb-cf01-4d5e-841a-fd23a31b71cc","resolution":{"observed_at":"2026-08-16T11:18:02.392735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-17T19:26:44.032537Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-16T11:18:01.207128Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-19T18:09:32.703042Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.207128Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:e5232dd94a37eac42fe2919c99f00f971dc870ddf9b90bb9686e1f3a711bea62","observation_id":"864628e3-ec9f-4f8a-b404-62fcce5d302c","resolution":{"observed_at":"2026-08-16T11:18:01.207128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-16T11:18:01.212175Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-19T18:09:32.703042Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.212175Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:538b8776c75fd79e38e49c7979226da2cb7a7d1f852cd9d93ece800982e095f4","observation_id":"b9af3f5e-22ba-4e4d-afd8-44cd4c145b01","resolution":{"observed_at":"2026-08-16T11:18:01.212175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.08292","last_updated":"2018-05-22T00:10:53Z","snapshot_observed_at":"2026-08-14T20:58:45.586325Z","submitted_at":"2017-05-23T14:11:34Z","title":"The Marginal Value of Adaptive Gradient Methods in Machine Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.08292","snapshot_observed_at":"2026-08-16T11:18:01.217918Z","title":"C., Roelofs, R., Stern, M., Srebro, N., and Recht, B","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-19T18:09:32.703042Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.217918Z"},"links":{"cited_paper":"/paper/1705.08292","citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:e9bf8e3b6a89facc1bf6360b2e35c7b80b35acbe61dda39144943bf4255c52e1","observation_id":"59a15f8f-7661-4e11-be65-a15f602d715f","resolution":{"observed_at":"2026-08-16T11:18:01.217918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:18:02.374303Z","title":null,"venue":null,"work_id":"834fdbe4-280a-46ef-a333-1dbeab28652c","year":2013},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-19T18:09:32.703042Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.223815Z"},"links":{"citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:5b520de47c088aa9ad4fb57a0728a3a311cee26da9c3c81cf8c76ceded58c776","observation_id":"2116e4c4-73ba-498f-812e-f62bac900004","resolution":{"observed_at":"2026-08-16T11:18:02.378742Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1708.03888","last_updated":"2017-09-13T23:25:07Z","snapshot_observed_at":"2026-08-14T20:41:41.185318Z","submitted_at":"2017-08-13T11:01:57Z","title":"Large Batch Training of Convolutional Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1708.03888","snapshot_observed_at":"2026-08-16T11:18:01.229883Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-19T18:09:32.703042Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.229883Z"},"links":{"cited_paper":"/paper/1708.03888","citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:357091953eb78f56adac8281045d7614ce068fc824384e2f94f1395bb1472453","observation_id":"3c9929a5-936b-4ef6-9c0e-968db3c26adc","resolution":{"observed_at":"2026-08-16T11:18:01.229883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.00962","last_updated":"2020-01-03T06:53:00Z","snapshot_observed_at":"2026-08-19T04:31:12.196632Z","submitted_at":"2019-04-01T16:53:35Z","title":"Large Batch Optimization for Deep Learning: Training BERT in 76 minutes","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.00962","snapshot_observed_at":"2026-08-16T11:18:01.234957Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-19T18:09:32.703042Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.234957Z"},"links":{"cited_paper":"/paper/1904.00962","citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:1dc4e3abdcfdd2bd5ad7ea42ec60afd8b70bf5b8464e530253181ec3a5b61d1a","observation_id":"d4e93ed4-6877-48e9-a736-d9e2e4e5aeca","resolution":{"observed_at":"2026-08-16T11:18:01.234957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1802.04434","last_updated":"2018-08-07T18:55:19Z","snapshot_observed_at":"2026-08-14T19:46:33.101156Z","submitted_at":"2018-02-13T02:14:35Z","title":"signSGD: Compressed Optimisation for Non-Convex Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.04434","snapshot_observed_at":"2026-08-16T11:18:01.240035Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-19T18:09:32.703042Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.240035Z"},"links":{"cited_paper":"/paper/1802.04434","citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:c40f47b2d0c9a2bea5ca87063647660088e41dcf086f13401d03728745c47a8c","observation_id":"ea8a4d8a-26da-456a-812b-c8ab152c5af3","resolution":{"observed_at":"2026-08-16T11:18:01.240035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1802.09477","last_updated":"2018-10-22T17:37:07Z","snapshot_observed_at":"2026-08-17T01:05:22.671331Z","submitted_at":"2018-02-26T17:54:49Z","title":"Addressing Function Approximation Error in Actor-Critic Methods","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.09477","snapshot_observed_at":"2026-08-16T11:18:01.244858Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-19T18:09:32.703042Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.244858Z"},"links":{"cited_paper":"/paper/1802.09477","citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:9a7e49ef1e765d4643f3680daf66b0ca71e1addee4c4518ee79619ef6b79203a","observation_id":"b5a27ab1-e55a-404e-8139-af6f2ffdc3aa","resolution":{"observed_at":"2026-08-16T11:18:01.244858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-16T11:18:01.249735Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-19T18:09:32.703042Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.249735Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:290af6a398819a8563c993e8aa08f0b414a5c1df6fdd355e44cff299a04295d0","observation_id":"dfe05031-dd73-452c-8ca0-2fe51ac607da","resolution":{"observed_at":"2026-08-16T11:18:01.249735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:18:02.359786Z","title":null,"venue":null,"work_id":"32191f7e-ec79-4392-a8f4-19af73719e56","year":1997},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-19T18:09:32.703042Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.254337Z"},"links":{"citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:d033656545b5f454a25179d2141eabe04018414644cc3600d4622bdc38324777","observation_id":"89a86ce0-f75b-4aa9-8e0c-98b1cd0b5762","resolution":{"observed_at":"2026-08-16T11:18:02.364202Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:18:02.345261Z","title":"(2018).High-Dimensional Probability: An Introduction with Applications in Data Science","venue":null,"work_id":"67af25c9-65ba-4df1-b657-4c6f63c58c08","year":2018},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-19T18:09:32.703042Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.259277Z"},"links":{"citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:b77f40a6a98b557f3dc52371ce894fdc54ae22152869c5bea41267f43d6513de","observation_id":"1a387490-6bea-4477-a19c-e9b954d4a9f4","resolution":{"observed_at":"2026-08-16T11:18:02.350048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:18:01.263858Z","title":"(2016).Deep Learning","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-19T18:09:32.703042Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.263858Z"},"links":{"citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:bb5b04527cf24559eaaab96fb07bf5b591fc7622e4d6c8564e082eb793e8029c","observation_id":"5a21bcd8-ec90-4547-894e-fb0a07929cd3","resolution":{"observed_at":"2026-08-16T11:18:01.263858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:18:02.322156Z","title":"(2004).Introductory Lectures on Convex Optimization: A Basic Course","venue":null,"work_id":"f56bddcf-0f0c-4e83-9fd5-001d27c03e76","year":2004},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-19T18:09:32.703042Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.268355Z"},"links":{"citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:baff58ea443f51926e165ad65d886785dcd37055ba91d7bf3202ea0784339fc4","observation_id":"b702c0a7-9827-4788-b0bc-c5044632c2ed","resolution":{"observed_at":"2026-08-16T11:18:02.326777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:18:02.308212Z","title":null,"venue":null,"work_id":"9cebe34c-084f-482f-8045-4878d110b0bb","year":2015},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-19T18:09:32.703042Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.272817Z"},"links":{"citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:addf12e91e8f4f1038a403fe34f5134a5d6f590661a000b405f0c443bd7231c9","observation_id":"7881c160-0733-4395-b9f4-ecb982106294","resolution":{"observed_at":"2026-08-16T11:18:02.312476Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:18:02.293980Z","title":null,"venue":null,"work_id":"07d16ec7-70e4-4d8d-ae03-1fc8f5fe77b5","year":1963},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-19T18:09:32.703042Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.277507Z"},"links":{"citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:39209652d795b0f698781d1e3b8aebabe050f56e00a2b6bf7f597b4d3ecce472","observation_id":"7df63c61-200f-4d29-bda3-be91c12f7e44","resolution":{"observed_at":"2026-08-16T11:18:02.298588Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:18:02.279960Z","title":null,"venue":null,"work_id":"33205b23-52f7-4787-a9aa-9d1872e611bf","year":2016},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-19T18:09:32.703042Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.281956Z"},"links":{"citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:6472968b1807f9d2620c158a0f6125191b352a159df9f6b44a0caf2a41a1a9ef","observation_id":"54cb98e1-ec24-4fb3-a671-60f128e2054b","resolution":{"observed_at":"2026-08-16T11:18:02.284253Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:18:02.265646Z","title":null,"venue":null,"work_id":"5e31a6f1-68ff-4608-88b9-0b75fd7aad25","year":2013},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-19T18:09:32.703042Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.286429Z"},"links":{"citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:669fdb77421c8f332a23c4b2a408adede87f3f3f7cad869ef6ac938c780ce0e0","observation_id":"2b02adda-a284-4d7e-93ed-5ec32c1f3f8d","resolution":{"observed_at":"2026-08-16T11:18:02.270207Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:18:02.251789Z","title":"and Lan, G","venue":null,"work_id":"44c6e778-72bc-4c41-a407-d973902963dd","year":2013},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-19T18:09:32.703042Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.291060Z"},"links":{"citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:9513507932e4841e16397f1c728b24e692beca689bffdcac5b1642cb8d230b1a","observation_id":"00a2ecde-7d5f-42e3-8d87-a39bc5f1789a","resolution":{"observed_at":"2026-08-16T11:18:02.256181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09237","last_updated":"2019-04-19T16:21:38Z","snapshot_observed_at":"2026-08-14T16:43:55.734754Z","submitted_at":"2019-04-19T16:21:38Z","title":"On the Convergence of Adam and Beyond","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09237","snapshot_observed_at":"2026-08-16T11:18:01.295605Z","title":"J., Kale, S., and Kumar, S","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-19T18:09:32.703042Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.295605Z"},"links":{"cited_paper":"/paper/1904.09237","citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:6a7cb271cd10262265b20146b16e5b3d7f66c370695413e2ec96234391d93f51","observation_id":"27714245-442f-446d-9718-7bf59209d292","resolution":{"observed_at":"2026-08-16T11:18:01.295605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:18:02.236887Z","title":"E., and Nocedal, J","venue":null,"work_id":"481c266b-b597-4e4c-93f0-4b024642343c","year":2018},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-19T18:09:32.703042Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.300327Z"},"links":{"citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:6bd535a612c3b21552a9537fd6b1c98b5d2b3f0fe0c2ab006deec3fdb303006d","observation_id":"8a6cedfd-0751-4456-812b-730ddbbd2c55","resolution":{"observed_at":"2026-08-16T11:18:02.242222Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:18:02.223080Z","title":"and Keshet, J","venue":null,"work_id":"11ccb60b-4267-4539-a8ff-900392bac678","year":2018},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-19T18:09:32.703042Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.304598Z"},"links":{"citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:981603ef23555ea0fafd0df4ea260e1c495f9def907438adb448e1eaa4ee51a8","observation_id":"2999a6ae-7825-448d-a58f-47e578c1e157","resolution":{"observed_at":"2026-08-16T11:18:02.227548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:18:02.208758Z","title":"S., Courville, A., and Bellemare, M","venue":null,"work_id":"efd3e756-1d48-4c5e-b2a3-f09965344905","year":2021},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-19T18:09:32.703042Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.309386Z"},"links":{"citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:04eea9715de1873ce7dab755ae70f5f3371be0653cf114d3959d61e6048d55e1","observation_id":"383e3cd5-f801-4fe6-a19f-43a319a6c00f","resolution":{"observed_at":"2026-08-16T11:18:02.213421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:18:02.194779Z","title":"and Hinton, G","venue":null,"work_id":"9da9021e-b738-439b-bd23-85db9597f30e","year":2012},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-19T18:09:32.703042Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.314013Z"},"links":{"citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:2c96f05baf0660158116c284131faa74c2b5961114aedddd5b90231afbf613e9","observation_id":"1a08e5a3-10dc-4b43-b7e5-9a9e70a252b3","resolution":{"observed_at":"2026-08-16T11:18:02.199297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:18:02.180873Z","title":null,"venue":null,"work_id":"328ad2f1-2583-402c-b971-137812062678","year":2013},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-19T18:09:32.703042Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.318636Z"},"links":{"citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:e3c002e7e1d57c7016893656b860f0af2c8224b85ac1ea3548c53ceaf95d9fea","observation_id":"4d016d55-7824-42bf-a8f7-dfd6d680ae68","resolution":{"observed_at":"2026-08-16T11:18:02.185139Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:18:02.166766Z","title":null,"venue":null,"work_id":"5b7977df-5b44-4fdd-96cf-b935ebc33339","year":2001},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-19T18:09:32.703042Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.323989Z"},"links":{"citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:91f50501dd98f694161e01e5c112ddc5abc3c8a79fb83988586ba67ff8f286df","observation_id":"a4a7b033-5bd5-496e-a7be-8b2e34b6b99d","resolution":{"observed_at":"2026-08-16T11:18:02.171265Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:18:02.152840Z","title":null,"venue":null,"work_id":"4f324480-02f7-4ec2-aa0b-88117e00051c","year":2022},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-19T18:09:32.703042Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.328864Z"},"links":{"citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:23d25ed048b903274fc00d0719c2f231d53c18f1ecd10d6ac273a0784bf78246","observation_id":"b8a62a3e-f58c-4485-912e-802970f4af48","resolution":{"observed_at":"2026-08-16T11:18:02.157360Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:18:02.139283Z","title":null,"venue":null,"work_id":"80f6283d-13cc-4fcb-8bad-0beb4016ad20","year":2012},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-19T18:09:32.703042Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.333553Z"},"links":{"citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:5e1992feedd8882e8292b225cd45b3ec8531ddb7f89db95e1ade08c0bcd6c8b1","observation_id":"70ab40f6-8b7f-41a2-94b8-7d57c263f512","resolution":{"observed_at":"2026-08-16T11:18:02.143700Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:18:02.125277Z","title":null,"venue":null,"work_id":"9c68e931-f43d-4a4b-a549-b6e2020f8ec8","year":2023},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-19T18:09:32.703042Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.338200Z"},"links":{"citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:43b661fc09ab5029bf86fba16e938c3263252081e8c4b6cb955e097fc5d902a3","observation_id":"becd3253-59c5-4dc6-adb7-d04ed6470ea2","resolution":{"observed_at":"2026-08-16T11:18:02.129772Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:18:02.111156Z","title":null,"venue":null,"work_id":"f9ce1110-78ae-4935-906c-c80cd86ed8bb","year":2018},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-19T18:09:32.703042Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.342654Z"},"links":{"citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:e0af25bf509632d95f1a3f2f5c31a90b591d3c49d0a0685ca2fc5318acf901d0","observation_id":"1cd5768d-2cf3-429d-8262-5202cbf61822","resolution":{"observed_at":"2026-08-16T11:18:02.115533Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:18:02.096535Z","title":null,"venue":null,"work_id":"62f8ebe0-5d36-49a2-973f-83b9bd7a4157","year":2019},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-19T18:09:32.703042Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.348236Z"},"links":{"citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:d9847fe4c89c9ef41335d6843a1ab7d63386e2f8b72a1bb95bf54f72bce9dfae","observation_id":"aeb06ff0-ef64-4fda-8ae2-4060c9d1553e","resolution":{"observed_at":"2026-08-16T11:18:02.101135Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:18:02.082450Z","title":"S., Davis, A., Dean, J., Devin, M., et al","venue":null,"work_id":"709c3ae0-3db1-4dc7-ab50-c700958cf1d1","year":2016},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-19T18:09:32.703042Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.352881Z"},"links":{"citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:87eb44df96b8d73971501c53e45ce33175861fd8a4e27bcefbaf33bfa288726e","observation_id":"4ffbbde6-a392-4ee3-9a95-3d855f23b30a","resolution":{"observed_at":"2026-08-16T11:18:02.086890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:18:02.068300Z","title":"A., and Peters, J","venue":null,"work_id":"e16929c1-77e1-4a4b-81a3-11402483dff6","year":2013},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-19T18:09:32.703042Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.357278Z"},"links":{"citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:885416f5e361fe94e39503514e21b4aa1009c4508cc7a1fe442db382340f3ae8","observation_id":"8854dce0-c0ef-4df1-894d-4c2b7cf8a46d","resolution":{"observed_at":"2026-08-16T11:18:02.072872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:18:02.054158Z","title":"I., Kemker, R., Part, J","venue":null,"work_id":"43e6d527-f62a-48b2-b708-712e842a6ac1","year":2019},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-19T18:09:32.703042Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.362145Z"},"links":{"citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:ca9ca897bd247b82cec41e910626f722caf4d6e454ac5f1ba95d3ffdb9f0be72","observation_id":"0a9e3969-ac9d-4771-b745-e7f2a22b41ba","resolution":{"observed_at":"2026-08-16T11:18:02.058722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1806.05393","last_updated":"2018-07-10T16:09:39Z","snapshot_observed_at":"2026-08-19T18:08:03.363372Z","submitted_at":"2018-06-14T07:04:15Z","title":"Dynamical Isometry and a Mean Field Theory of CNNs: How to Train 10,000-Layer Vanilla Convolutional Neural Networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.05393","snapshot_observed_at":"2026-08-16T11:18:01.366994Z","title":"S., and Pennington, J","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-19T18:09:32.703042Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.366994Z"},"links":{"cited_paper":"/paper/1806.05393","citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:4d928ed1bdd2636228e49179c0d6093dc6c02350cd7d45e8acd16d41744395c8","observation_id":"96be1891-8836-4e0f-85f3-478587f87be4","resolution":{"observed_at":"2026-08-16T11:18:01.366994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:18:02.039945Z","title":null,"venue":null,"work_id":"8de1f462-9c6e-430c-a325-4791c8b83db2","year":2018},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-19T18:09:32.703042Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.371700Z"},"links":{"citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:7ce9d4dfc454e8eda2d8ea19c68bf59bc0421dbf3179bc36a0edfdbf27c34d9d","observation_id":"30e46975-d771-4ff1-8717-96d61b19ca25","resolution":{"observed_at":"2026-08-16T11:18:02.044363Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:18:02.026044Z","title":"and Hutter, F","venue":null,"work_id":"394add10-45e1-4bb2-a2e1-3233c241b418","year":2017},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-19T18:09:32.703042Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.376031Z"},"links":{"citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:fdcd04db4493f9661cbe23d51c07c5a9f979588e52a5750c65ac7eb0cd2cb235","observation_id":"09458751-0902-448f-bd28-340330a6bd42","resolution":{"observed_at":"2026-08-16T11:18:02.030429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:18:02.010436Z","title":"J., Fu, P., Saparov, A., Choudhury, S., Huang, W., Hurtado, J., Khailany, B., Lien, H.-H","venue":null,"work_id":"010eb988-9cfa-4261-af5f-8b32e09cec6f","year":2021},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-19T18:09:32.703042Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.380537Z"},"links":{"citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:02806905821c9365dbb5f588b3a9d4fd64197a07525e843b476e4c4d90502573","observation_id":"90221d8b-d0b6-4691-a795-15e654911064","resolution":{"observed_at":"2026-08-16T11:18:02.015412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1502.02551","last_updated":"2015-02-09T16:37:29Z","snapshot_observed_at":"2026-08-14T23:00:47.962201Z","submitted_at":"2015-02-09T16:37:29Z","title":"Deep Learning with Limited Numerical Precision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1502.02551","snapshot_observed_at":"2026-08-16T11:18:01.385699Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-19T18:09:32.703042Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.385699Z"},"links":{"cited_paper":"/paper/1502.02551","citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:897fa1f8fff85a80b6259a2d16e78528f212f51602141910e96fbede27070e24","observation_id":"37028641-d1fa-4dc1-b3a8-e5d0306ffcae","resolution":{"observed_at":"2026-08-16T11:18:01.385699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:18:01.995780Z","title":null,"venue":null,"work_id":"472cf463-eb45-4b5e-89c3-50b5e8733c50","year":2018},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-19T18:09:32.703042Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.390517Z"},"links":{"citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:6775cf85697d886d340aa4af70fed6a724272e8755237badad76e21b4dad47cd","observation_id":"eec2c4e2-72e3-4f30-9e07-83186d30731d","resolution":{"observed_at":"2026-08-16T11:18:02.000403Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-16T11:18:01.395281Z","title":"B., Chess, B., Child, R., Gray, S., Radford, A., Wu, J., and Amodei, D","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-19T18:09:32.703042Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.395281Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:9f235e3de06199ed31bc1938c7349b84150d43a82b90d90a7195b0cfdabb7dcc","observation_id":"a06d0522-c458-45c1-b760-e75944f896ee","resolution":{"observed_at":"2026-08-16T11:18:01.395281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:18:01.981461Z","title":null,"venue":null,"work_id":"ff2b8adf-727a-4311-82ca-b40f61087df4","year":2018},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-19T18:09:32.703042Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.400260Z"},"links":{"citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:e702cf3b315e5b6dd18540c9651531446706f46a3d05543873b8fb47cf9a8fb7","observation_id":"567df801-2cab-409d-a076-d10c7e22814c","resolution":{"observed_at":"2026-08-16T11:18:01.986209Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:18:01.967234Z","title":null,"venue":null,"work_id":"2e1d2b46-a907-432b-806f-d4a0b2693c0c","year":1998},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-19T18:09:32.703042Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.406351Z"},"links":{"citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:cfc1d5b88d7ee0c4a764934817f3ca7bded1549ac5ea6ba50f20e0d49b679fc0","observation_id":"3d57606f-7823-4446-ae7a-61bbcbc8c431","resolution":{"observed_at":"2026-08-16T11:18:01.971908Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:18:01.953130Z","title":null,"venue":null,"work_id":"8c04a8ed-17ed-4161-9a3e-4d37b2ca591f","year":2009},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-19T18:09:32.703042Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.412028Z"},"links":{"citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:5843a1504d55d831d0e76b8c47bd833f89d172b77316029e0c3a09b638d81df9","observation_id":"0ce88c0a-4458-4604-999f-e324083952ee","resolution":{"observed_at":"2026-08-16T11:18:01.957405Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:18:01.938751Z","title":null,"venue":null,"work_id":"995346c6-b54a-4186-aaaf-debdaf2bc1f5","year":2009},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-19T18:09:32.703042Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.416393Z"},"links":{"citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:1cd66b32a64691847cff9a828d0f721c33cebd72d7b97b2b02589d0a6d5491fe","observation_id":"5c972fb9-5fb2-4502-94d3-089a23e7ec4f","resolution":{"observed_at":"2026-08-16T11:18:01.943153Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1902.10811","last_updated":"2019-06-12T17:42:33Z","snapshot_observed_at":"2026-08-17T11:06:50.023408Z","submitted_at":"2019-02-13T20:35:44Z","title":"Do ImageNet Classifiers Generalize to ImageNet?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1902.10811","snapshot_observed_at":"2026-08-16T11:18:01.420967Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-19T18:09:32.703042Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.420967Z"},"links":{"cited_paper":"/paper/1902.10811","citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:5bb64fa88eb801b55f119d4719e6c3f9d22fb7dec78a1729c58bc1516706ee7c","observation_id":"09fe3cc9-8b1e-4005-a0a7-e852b3d78d00","resolution":{"observed_at":"2026-08-16T11:18:01.420967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1806.03822","last_updated":"2018-06-11T06:10:11Z","snapshot_observed_at":"2026-08-14T19:05:25.482398Z","submitted_at":"2018-06-11T06:10:11Z","title":"Know What You Don't Know: Unanswerable Questions for SQuAD","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.03822","snapshot_observed_at":"2026-08-16T11:18:01.426437Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-19T18:09:32.703042Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.426437Z"},"links":{"cited_paper":"/paper/1806.03822","citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:048b39f148083e089678c6ae901398e307979329091f40337434f3ea28d8c1c0","observation_id":"0c90e99a-8f34-4575-ad20-8e25723f422a","resolution":{"observed_at":"2026-08-16T11:18:01.426437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.12901","last_updated":"2019-04-29T18:40:15Z","snapshot_observed_at":"2026-08-14T16:39:48.171461Z","submitted_at":"2019-04-29T18:40:15Z","title":"Challenges of Real-World Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.12901","snapshot_observed_at":"2026-08-16T11:18:01.431511Z","title":"J., Li, J., Paduraru, C., Gowal, S., and Hester, T","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-19T18:09:32.703042Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.431511Z"},"links":{"cited_paper":"/paper/1904.12901","citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:b62b3530390a6429fe1100af6f48cdef7d880dbaa0f3d8fa0a70a0fd478ea174","observation_id":"4c04338e-ad1a-4ba5-8fbb-a49be745b5a2","resolution":{"observed_at":"2026-08-16T11:18:01.431511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:18:01.923756Z","title":null,"venue":null,"work_id":"bb69c968-4237-4da2-b67b-536e7300759a","year":2018},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-19T18:09:32.703042Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.436371Z"},"links":{"citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:f8e529e0e0e4ea141e162b08ec4ec1b171dfc722188823ee6a67b2a708431be8","observation_id":"95337990-c905-4a2f-8c79-4e71df2c3ceb","resolution":{"observed_at":"2026-08-16T11:18:01.928589Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.06565","last_updated":"2016-07-25T17:23:29Z","snapshot_observed_at":"2026-07-06T05:00:46.434335Z","submitted_at":"2016-06-21T13:37:05Z","title":"Concrete Problems in AI Safety","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.06565","snapshot_observed_at":"2026-08-16T11:18:01.441025Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-19T18:09:32.703042Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.441025Z"},"links":{"cited_paper":"/paper/1606.06565","citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:5ec7928f1cc4bb7374c26242bacc85f7f1aff5bb0699998e8076793739e9063d","observation_id":"d3ac973f-4e3f-4776-a158-1c5e65de5e0a","resolution":{"observed_at":"2026-08-16T11:18:01.441025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:18:01.909471Z","title":"J., and R´ e, C","venue":null,"work_id":"ae7f25fa-1f43-45ef-8965-0e46db3f1c3d","year":2022},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-19T18:09:32.703042Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.446192Z"},"links":{"citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:5cf623724b86ada8dd86f187156f3c1ad7368f7978e0fbcc4cf545c15f8f932b","observation_id":"ae8b443a-37fc-4514-9b25-e4b20d548b43","resolution":{"observed_at":"2026-08-16T11:18:01.913978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:18:01.893849Z","title":"U., Cordonnier, J.-B., and Jaggi, M","venue":null,"work_id":"6283a5a5-53e1-4e2f-9f2e-d129da4dc38c","year":2019},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-19T18:09:32.703042Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.450931Z"},"links":{"citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:cc879a331ead6ffd4938bc9687ca9756dcfb8b0b3f3383c96c408009acff2673","observation_id":"aa65037d-4d14-4cdb-a123-66f3feb6063c","resolution":{"observed_at":"2026-08-16T11:18:01.898829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:18:01.877783Z","title":"and Stern, M","venue":null,"work_id":"dc9068d1-03c3-4566-a1f7-5110dc424fe5","year":2018},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-19T18:09:32.703042Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.455438Z"},"links":{"citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:c9e52319d81ab49337200cbfac7b5dd2f90d6c7625246a19896f4ec4c4f6b32d","observation_id":"7973f228-ed72-4e90-af0c-c083ab7ac2f9","resolution":{"observed_at":"2026-08-16T11:18:01.882440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.03669","last_updated":"2025-05-07T13:57:44Z","snapshot_observed_at":"2026-08-16T15:57:46.655111Z","submitted_at":"2023-02-04T02:49:12Z","title":"Deep Reinforcement Learning for Traffic Light Control in Intelligent Transportation Systems","version":4},"cited_work":{"arxiv_id":"2302.03669","doi":null,"metadata_source":"pith","pith_arxiv_id":"2302.03669","snapshot_observed_at":"2026-08-16T11:18:01.539652Z","title":"Deep Reinforcement Learning for Traffic Light Control in Intelligent Transportation Systems","venue":"cs.LG","work_id":"57b2056f-2c81-4ba4-8b3c-75f8ca418e11","year":2023},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-19T18:09:32.703042Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.460823Z"},"links":{"cited_paper":"/paper/2302.03669","citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:1e6ba6cf486aefc3684cba6bbd66cabefefafaadd103301f4256d377a6d536ab","observation_id":"7e4e37fe-3768-46e1-b4ca-b9372b95d0a3","resolution":{"observed_at":"2026-08-16T11:18:01.546739Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14342","last_updated":"2024-03-05T17:07:16Z","snapshot_observed_at":"2026-08-16T15:30:30.483704Z","submitted_at":"2023-05-23T17:59:21Z","title":"Sophia: A Scalable Stochastic Second-order Optimizer for Language Model Pre-training","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14342","snapshot_observed_at":"2026-08-16T11:18:01.465897Z","title":"H., Ma, T., Anandkumar, A., and R´ e, C","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-19T18:09:32.703042Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.465897Z"},"links":{"cited_paper":"/paper/2305.14342","citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:34d0eaf811b098d60990e1ebeb40edc79221c305072710075bf375c65df39633","observation_id":"28103d01-4a27-4def-af13-4ab16277a96d","resolution":{"observed_at":"2026-08-16T11:18:01.465897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:18:01.863522Z","title":null,"venue":null,"work_id":"1a44cef4-810f-4a0c-acc6-183141fbca80","year":2021},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-19T18:09:32.703042Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.470486Z"},"links":{"citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:3ff1967f62ca6ebe39c14c2822b1c3943ed749a98e8984cbc9b73a6565fb0b13","observation_id":"30dd5669-af2d-42a6-8992-15f7917acbac","resolution":{"observed_at":"2026-08-16T11:18:01.868048Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:18:01.849056Z","title":null,"venue":null,"work_id":"45625518-f25f-4c01-9489-1aebc34bf042","year":2023},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-19T18:09:32.703042Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.474816Z"},"links":{"citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:ea8d6c0e12671854a29488d32da1fd75b3ad144b9b421bb70fb3058aeef0927e","observation_id":"4f1562ad-8792-4d3c-a1dc-f46089c9b454","resolution":{"observed_at":"2026-08-16T11:18:01.853771Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:18:01.833890Z","title":"and Bengio, Y","venue":null,"work_id":"7b538077-3d1b-439e-845a-c2933f735bc7","year":2010},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-19T18:09:32.703042Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.479361Z"},"links":{"citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:dc772673d37ff04930084858c9e487f82cae7a16fdcd5befc65f83b9daad0e5b","observation_id":"5910f499-5aa3-4660-bb11-6ca57debbfcc","resolution":{"observed_at":"2026-08-16T11:18:01.838628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:18:01.817538Z","title":null,"venue":null,"work_id":"a7f22dbf-ec7f-475b-b4a5-2f423734a7e4","year":2015},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-19T18:09:32.703042Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.484321Z"},"links":{"citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:5945d676da708357213edcda88d11f06a902a457f6ce59147d05658dc0d39106","observation_id":"44b289fb-2766-4a17-ba0f-1dea3548e4fd","resolution":{"observed_at":"2026-08-16T11:18:01.822759Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-19T18:09:32.703042Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer"},"reference_resolution":{"displayed":61,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":43,"verified_exact":1,"verified_fuzzy":17},"total_outbound_references":61},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 61 of 61 outbound references and 1 inbound Pith citation observation for arXiv:2504.16020."}