{"as_of":"2026-08-21T08:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b7e6f1281fba3d2fb348287a2ebb56fc06be568a3b6019182e326be3bba26aa2","coverage":[{"denominator":12,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T14:28:07.436964Z","state":"measured"},{"denominator":75,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":75,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":63,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":63,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T05:39:43.033568Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":608,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"1908.03265","last_updated":"2021-10-26T02:48:30Z","snapshot_observed_at":"2026-08-19T14:20:48.530093Z","submitted_at":"2019-08-08T20:51:17Z","title":"On the Variance of the Adaptive Learning Rate and Beyond","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.03265","snapshot_observed_at":"2026-08-14T13:20:19.628026Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"1908.05344","last_updated":"2019-08-14T20:50:14Z","snapshot_observed_at":"2026-08-19T14:21:28.904727Z","submitted_at":"2019-08-14T20:50:14Z","title":"Raw-to-End Name Entity Recognition in Social Media","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-14T13:20:19.628026Z"},"links":{"cited_paper":"/paper/1908.03265","citing_paper":"/paper/1908.05344"},"observation_digest":"sha256:98dd43c4431cde61d65d0f0d67ae9420afdf19bd628296356687084764430195","observation_id":"9bb73dcc-e9fd-4371-ab76-5469c992a53c","resolution":{"observed_at":"2026-08-14T13:20:19.628026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03265","last_updated":"2021-10-26T02:48:30Z","snapshot_observed_at":"2026-08-19T14:20:48.530093Z","submitted_at":"2019-08-08T20:51:17Z","title":"On the Variance of the Adaptive Learning Rate and Beyond","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.03265","snapshot_observed_at":"2026-08-14T10:18:08.719361Z","title":null,"venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"1908.11472","last_updated":"2020-10-28T12:44:17Z","snapshot_observed_at":"2026-08-19T14:21:29.331553Z","submitted_at":"2019-08-29T22:38:28Z","title":"Kinematic Single Vehicle Trajectory Prediction Baselines and Applications with the NGSIM Dataset","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-14T10:18:08.719361Z"},"links":{"cited_paper":"/paper/1908.03265","citing_paper":"/paper/1908.11472"},"observation_digest":"sha256:622a2a882f7d7931d5d051d9462f86393d37684ae13696c273b6ed5e80dc8a93","observation_id":"1d4ed142-b2db-4c7d-8e9a-e1023b444557","resolution":{"observed_at":"2026-08-14T10:18:08.719361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03265","last_updated":"2021-10-26T02:48:30Z","snapshot_observed_at":"2026-08-19T14:20:48.530093Z","submitted_at":"2019-08-08T20:51:17Z","title":"On the Variance of the Adaptive Learning Rate and Beyond","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.03265","snapshot_observed_at":"2026-08-14T04:48:03.852071Z","title":"On the variance of the adaptive learning rate and beyond","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"1909.02702","last_updated":"2019-09-06T03:31:40Z","snapshot_observed_at":"2026-08-19T14:22:06.711400Z","submitted_at":"2019-09-06T03:31:40Z","title":"Port-Hamiltonian Approach to Neural Network Training","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-14T04:48:03.852071Z"},"links":{"cited_paper":"/paper/1908.03265","citing_paper":"/paper/1909.02702"},"observation_digest":"sha256:bc4865cf5e40ecb4d0d558c3906f25fa038dd17502578fca32e4a9df05cafdcc","observation_id":"43ec225f-5dfe-4f7b-9cc2-091a0ccb5c79","resolution":{"observed_at":"2026-08-14T04:48:03.852071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03265","last_updated":"2021-10-26T02:48:30Z","snapshot_observed_at":"2026-08-19T14:20:48.530093Z","submitted_at":"2019-08-08T20:51:17Z","title":"On the Variance of the Adaptive Learning Rate and Beyond","version":4},"cited_work":{"arxiv_id":"1908.03265","doi":"10.48550/arxiv.1908.03265","metadata_source":"arxiv_reference","pith_arxiv_id":"1908.03265","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"On the variance of the adaptive learning rate and beyond.arXiv preprint arXiv:1908.03265","venue":"arXiv (Cornell University)","work_id":"7acbf612-b1e2-43af-bfe5-3a9d75e45cb6","year":1908},"citing_paper":{"arxiv_id":"2303.01469","last_updated":"2023-05-31T06:17:10Z","snapshot_observed_at":"2026-08-15T07:00:23.337991Z","submitted_at":"2023-03-02T18:30:16Z","title":"Consistency Models","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-05-13T15:47:28.598205Z"},"links":{"cited_paper":"/paper/1908.03265","citing_paper":"/paper/2303.01469"},"observation_digest":"sha256:e38f1700167aad2969046a92bbef1dc2c657040947ec1cb6e64408483203cf7a","observation_id":"43527666-8bab-44bb-b011-16202f68355f","resolution":{"observed_at":"2026-05-13T15:47:28.659081Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-03T18:08:20.655659+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T18:08:20.655659+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03265","last_updated":"2021-10-26T02:48:30Z","snapshot_observed_at":"2026-08-19T14:20:48.530093Z","submitted_at":"2019-08-08T20:51:17Z","title":"On the Variance of the Adaptive Learning Rate and Beyond","version":4},"cited_work":{"arxiv_id":"1908.03265","doi":"10.48550/arxiv.1908.03265","metadata_source":"arxiv_reference","pith_arxiv_id":"1908.03265","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"On the variance of the adaptive learning rate and beyond.arXiv preprint arXiv:1908.03265","venue":"arXiv (Cornell University)","work_id":"7acbf612-b1e2-43af-bfe5-3a9d75e45cb6","year":1908},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-08-20T21:36:51.212852Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"cited_paper":"/paper/1908.03265","citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:05b8249f6e87593a037e3cfc673b6bee422faed70dca021f6e1b3f06f36a7759","observation_id":"760fe633-d1de-41b2-9955-934cca7e5fef","resolution":{"observed_at":"2026-05-17T18:00:50.197627Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-03T18:08:20.655659+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T18:08:20.655659+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03265","last_updated":"2021-10-26T02:48:30Z","snapshot_observed_at":"2026-08-19T14:20:48.530093Z","submitted_at":"2019-08-08T20:51:17Z","title":"On the Variance of the Adaptive Learning Rate and Beyond","version":4},"cited_work":{"arxiv_id":"1908.03265","doi":"10.48550/arxiv.1908.03265","metadata_source":"arxiv_reference","pith_arxiv_id":"1908.03265","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"On the variance of the adaptive learning rate and beyond.arXiv preprint arXiv:1908.03265","venue":"arXiv (Cornell University)","work_id":"7acbf612-b1e2-43af-bfe5-3a9d75e45cb6","year":1908},"citing_paper":{"arxiv_id":"2310.04378","last_updated":"2023-10-06T17:11:58Z","snapshot_observed_at":"2026-08-20T13:49:06.053430Z","submitted_at":"2023-10-06T17:11:58Z","title":"Latent Consistency Models: Synthesizing High-Resolution Images with Few-Step Inference","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-05-13T04:15:54.681913Z"},"links":{"cited_paper":"/paper/1908.03265","citing_paper":"/paper/2310.04378"},"observation_digest":"sha256:c4573ed548bbef447acfce4d0760e15fe86073a854c73679e9a69d2ec1502744","observation_id":"216fd231-8fdc-4802-a6af-9bb99ed6622e","resolution":{"observed_at":"2026-05-13T04:15:54.867502Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-03T18:08:20.655659+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T18:08:20.655659+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03265","last_updated":"2021-10-26T02:48:30Z","snapshot_observed_at":"2026-08-19T14:20:48.530093Z","submitted_at":"2019-08-08T20:51:17Z","title":"On the Variance of the Adaptive Learning Rate and Beyond","version":4},"cited_work":{"arxiv_id":"1908.03265","doi":"10.48550/arxiv.1908.03265","metadata_source":"arxiv_reference","pith_arxiv_id":"1908.03265","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"On the variance of the adaptive learning rate and beyond.arXiv preprint arXiv:1908.03265","venue":"arXiv (Cornell University)","work_id":"7acbf612-b1e2-43af-bfe5-3a9d75e45cb6","year":1908},"citing_paper":{"arxiv_id":"2310.14189","last_updated":"2023-10-22T05:33:38Z","snapshot_observed_at":"2026-08-17T19:16:27.766862Z","submitted_at":"2023-10-22T05:33:38Z","title":"Improved Techniques for Training Consistency Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-21T05:04:10.600062Z"},"links":{"cited_paper":"/paper/1908.03265","citing_paper":"/paper/2310.14189"},"observation_digest":"sha256:976bdaa3e7c40a4e4181f005863c2b680f12c83e017a136056c46bf246b766b8","observation_id":"18eb65d8-34fc-45ea-a560-afdec281900c","resolution":{"observed_at":"2026-05-21T05:04:10.662000Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-03T18:08:20.655659+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T18:08:20.655659+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03265","last_updated":"2021-10-26T02:48:30Z","snapshot_observed_at":"2026-08-19T14:20:48.530093Z","submitted_at":"2019-08-08T20:51:17Z","title":"On the Variance of the Adaptive Learning Rate and Beyond","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.03265","snapshot_observed_at":"2026-08-12T14:11:16.550216Z","title":"On the variance of the adaptive learning rate and beyond","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2411.15638","last_updated":"2025-03-26T22:36:18Z","snapshot_observed_at":"2026-08-19T14:21:31.955280Z","submitted_at":"2024-11-23T19:30:56Z","title":"Learning state and proposal dynamics in state-space models using differentiable particle filters and neural networks","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T14:11:16.550216Z"},"links":{"cited_paper":"/paper/1908.03265","citing_paper":"/paper/2411.15638"},"observation_digest":"sha256:32e7e04d3b30eece598a003397df65b19cc02ae16a207458a3b3cebb87b9e752","observation_id":"ab8f389a-b751-480d-901d-8f36cad52591","resolution":{"observed_at":"2026-08-12T14:11:16.550216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03265","last_updated":"2021-10-26T02:48:30Z","snapshot_observed_at":"2026-08-19T14:20:48.530093Z","submitted_at":"2019-08-08T20:51:17Z","title":"On the Variance of the Adaptive Learning Rate and Beyond","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.03265","snapshot_observed_at":"2026-08-12T14:02:39.847015Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.15795","last_updated":"2024-12-16T11:06:00Z","snapshot_observed_at":"2026-08-20T05:25:03.040965Z","submitted_at":"2024-11-24T11:46:47Z","title":"Beyond adaptive gradient: Fast-Controlled Minibatch Algorithm for large-scale optimization","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T14:02:39.847015Z"},"links":{"cited_paper":"/paper/1908.03265","citing_paper":"/paper/2411.15795"},"observation_digest":"sha256:41ceed133635b295cd1c461443a3dec1d0a0e68e7cef8cc194c03ecf0cf84062","observation_id":"e000a8d5-f4b0-4d2b-88e4-efff3ef24cd6","resolution":{"observed_at":"2026-08-12T14:02:39.847015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03265","last_updated":"2021-10-26T02:48:30Z","snapshot_observed_at":"2026-08-19T14:20:48.530093Z","submitted_at":"2019-08-08T20:51:17Z","title":"On the Variance of the Adaptive Learning Rate and Beyond","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.03265","snapshot_observed_at":"2026-08-12T21:29:22.668886Z","title":"Liu , author H","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2411.17709","last_updated":"2024-11-13T16:15:48Z","snapshot_observed_at":"2026-08-19T21:18:39.057947Z","submitted_at":"2024-11-13T16:15:48Z","title":"Quantity versus Diversity: Influence of Data on Detecting EEG Pathology with Advanced ML Models","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-12T21:29:22.668886Z"},"links":{"cited_paper":"/paper/1908.03265","citing_paper":"/paper/2411.17709"},"observation_digest":"sha256:20ddbd88ce7463dadb900ece7c1256ee1272dd7961198939cff72cd2d879ea26","observation_id":"4a93ff98-854e-4555-9890-62befd0919e2","resolution":{"observed_at":"2026-08-12T21:29:22.668886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03265","last_updated":"2021-10-26T02:48:30Z","snapshot_observed_at":"2026-08-19T14:20:48.530093Z","submitted_at":"2019-08-08T20:51:17Z","title":"On the Variance of the Adaptive Learning Rate and Beyond","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.03265","snapshot_observed_at":"2026-08-12T06:03:51.315324Z","title":"On the variance of the adaptive learning rate and beyond","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2411.19647","last_updated":"2025-06-04T14:58:21Z","snapshot_observed_at":"2026-08-19T14:21:31.651985Z","submitted_at":"2024-11-29T12:00:27Z","title":"CAdam: Confidence-Based Optimization for Online Learning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T06:03:51.315324Z"},"links":{"cited_paper":"/paper/1908.03265","citing_paper":"/paper/2411.19647"},"observation_digest":"sha256:1f1b2308bf4f0c4e10134902b56a022b14aedf42a7f8e942ab05e3bbb542efb7","observation_id":"7e4ce5f8-ae17-43a7-a779-efda4c0986a0","resolution":{"observed_at":"2026-08-12T06:03:51.315324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03265","last_updated":"2021-10-26T02:48:30Z","snapshot_observed_at":"2026-08-19T14:20:48.530093Z","submitted_at":"2019-08-08T20:51:17Z","title":"On the Variance of the Adaptive Learning Rate and Beyond","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.03265","snapshot_observed_at":"2026-08-12T05:26:44.820508Z","title":", Jiang, H","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.00486","last_updated":"2024-11-30T13:58:41Z","snapshot_observed_at":"2026-08-17T19:38:43.204535Z","submitted_at":"2024-11-30T13:58:41Z","title":"Automatic Differentiation-based Full Waveform Inversion with Flexible Workflows","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-12T05:26:44.820508Z"},"links":{"cited_paper":"/paper/1908.03265","citing_paper":"/paper/2412.00486"},"observation_digest":"sha256:df205b7e30aaadb6743c0644b3efe0644eb4d57f72f58f11242da38163a1ce31","observation_id":"f72ffc1a-e400-4bde-a3a1-d8ddbcfa11fe","resolution":{"observed_at":"2026-08-12T05:26:44.820508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03265","last_updated":"2021-10-26T02:48:30Z","snapshot_observed_at":"2026-08-19T14:20:48.530093Z","submitted_at":"2019-08-08T20:51:17Z","title":"On the Variance of the Adaptive Learning Rate and Beyond","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.03265","snapshot_observed_at":"2026-08-11T19:24:03.709142Z","title":"On the variance of the adaptive learning rate and beyond","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.06686","last_updated":"2024-12-09T17:28:29Z","snapshot_observed_at":"2026-08-18T12:17:46.968841Z","submitted_at":"2024-12-09T17:28:29Z","title":"Some Best Practices in Operator Learning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T19:24:03.709142Z"},"links":{"cited_paper":"/paper/1908.03265","citing_paper":"/paper/2412.06686"},"observation_digest":"sha256:30bf800b3e087bce05f2e75297860c1a3f4898b5ed9679e49c9b9f61103fcff3","observation_id":"355fd820-b7cc-4138-a443-29807ff5ffbf","resolution":{"observed_at":"2026-08-11T19:24:03.709142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03265","last_updated":"2021-10-26T02:48:30Z","snapshot_observed_at":"2026-08-19T14:20:48.530093Z","submitted_at":"2019-08-08T20:51:17Z","title":"On the Variance of the Adaptive Learning Rate and Beyond","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.03265","snapshot_observed_at":"2026-08-11T14:41:00.366975Z","title":"On the variance of the adaptive learning rate and beyond","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2412.11768","last_updated":"2024-12-17T09:30:44Z","snapshot_observed_at":"2026-08-20T03:32:56.816946Z","submitted_at":"2024-12-16T13:41:37Z","title":"No More Adam: Learning Rate Scaling at Initialization is All You Need","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-11T14:41:00.366975Z"},"links":{"cited_paper":"/paper/1908.03265","citing_paper":"/paper/2412.11768"},"observation_digest":"sha256:2e6f7131b47c7c111aa418688218d50597e1876f6f7fcc2663646fd67b1d5615","observation_id":"ddff11e7-46f3-4f80-83da-3fa88889e118","resolution":{"observed_at":"2026-08-11T14:41:00.366975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03265","last_updated":"2021-10-26T02:48:30Z","snapshot_observed_at":"2026-08-19T14:20:48.530093Z","submitted_at":"2019-08-08T20:51:17Z","title":"On the Variance of the Adaptive Learning Rate and Beyond","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.03265","snapshot_observed_at":"2026-08-11T11:32:54.039495Z","title":"On the variance of the adaptive learning rate and beyond","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2412.16243","last_updated":"2024-12-19T20:52:10Z","snapshot_observed_at":"2026-08-14T08:18:59.579433Z","submitted_at":"2024-12-19T20:52:10Z","title":"Bag of Tricks for Multimodal AutoML with Image, Text, and Tabular Data","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T11:32:54.039495Z"},"links":{"cited_paper":"/paper/1908.03265","citing_paper":"/paper/2412.16243"},"observation_digest":"sha256:b0d7954a4d159424f1cb0a1da40b765850123228c217a5821b5ed1eea974b39d","observation_id":"7aa1e192-1da6-423c-b252-6cab0852ad95","resolution":{"observed_at":"2026-08-11T11:32:54.039495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03265","last_updated":"2021-10-26T02:48:30Z","snapshot_observed_at":"2026-08-19T14:20:48.530093Z","submitted_at":"2019-08-08T20:51:17Z","title":"On the Variance of the Adaptive Learning Rate and Beyond","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.03265","snapshot_observed_at":"2026-08-11T10:24:04.385407Z","title":"On the vari- ance of the adaptive learning rate and beyond.arXiv preprint arXiv:1908.03265, 2019","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2412.16715","last_updated":"2024-12-21T17:57:12Z","snapshot_observed_at":"2026-08-19T14:21:27.370819Z","submitted_at":"2024-12-21T17:57:12Z","title":"From Histopathology Images to Cell Clouds: Learning Slide Representations with Hierarchical Cell Transformer","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T10:24:04.385407Z"},"links":{"cited_paper":"/paper/1908.03265","citing_paper":"/paper/2412.16715"},"observation_digest":"sha256:321e6dc876c6288b694af8a8947a98056554137931b314725010c660f1e78d86","observation_id":"128c70fd-0c9b-4d1b-8255-ca8d832252b5","resolution":{"observed_at":"2026-08-11T10:24:04.385407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03265","last_updated":"2021-10-26T02:48:30Z","snapshot_observed_at":"2026-08-19T14:20:48.530093Z","submitted_at":"2019-08-08T20:51:17Z","title":"On the Variance of the Adaptive Learning Rate and Beyond","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.03265","snapshot_observed_at":"2026-08-10T23:14:17.622839Z","title":"On the variance of the adaptive learning rate and beyond,","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2412.20830","last_updated":"2024-12-30T09:53:26Z","snapshot_observed_at":"2026-08-19T14:21:28.438266Z","submitted_at":"2024-12-30T09:53:26Z","title":"ReFlow6D: Refraction-Guided Transparent Object 6D Pose Estimation via Intermediate Representation Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T23:14:17.622839Z"},"links":{"cited_paper":"/paper/1908.03265","citing_paper":"/paper/2412.20830"},"observation_digest":"sha256:71b4de7434f303904598f5e52559cb682f81797589c8402d5334f3ab9ef0ea30","observation_id":"9d0f8ad0-3632-4a27-9641-b8111129220b","resolution":{"observed_at":"2026-08-10T23:14:17.622839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03265","last_updated":"2021-10-26T02:48:30Z","snapshot_observed_at":"2026-08-19T14:20:48.530093Z","submitted_at":"2019-08-08T20:51:17Z","title":"On the Variance of the Adaptive Learning Rate and Beyond","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.03265","snapshot_observed_at":"2026-08-10T17:01:13.908163Z","title":"On the variance of the adaptive learning rate and beyond","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2501.12670","last_updated":"2025-06-19T15:01:04Z","snapshot_observed_at":"2026-08-17T22:51:52.134879Z","submitted_at":"2025-01-22T06:10:27Z","title":"Celo: Training Versatile Learned Optimizers on a Compute Diet","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-10T17:01:13.908163Z"},"links":{"cited_paper":"/paper/1908.03265","citing_paper":"/paper/2501.12670"},"observation_digest":"sha256:5f2b54603f714d59e8e7264afd56ee4adbc997368dc8afb208438a07bd92df62","observation_id":"101104e3-08fe-4b5d-b2a8-05102d73849c","resolution":{"observed_at":"2026-08-10T17:01:13.908163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03265","last_updated":"2021-10-26T02:48:30Z","snapshot_observed_at":"2026-08-19T14:20:48.530093Z","submitted_at":"2019-08-08T20:51:17Z","title":"On the Variance of the Adaptive Learning Rate and Beyond","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.03265","snapshot_observed_at":"2026-08-10T16:51:20.102451Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.12815","last_updated":"2025-01-22T11:46:28Z","snapshot_observed_at":"2026-08-17T23:50:34.488886Z","submitted_at":"2025-01-22T11:46:28Z","title":"Certified Guidance for Planning with Deep Generative Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T16:51:20.102451Z"},"links":{"cited_paper":"/paper/1908.03265","citing_paper":"/paper/2501.12815"},"observation_digest":"sha256:1ee7cd9056cb1b25d090ad222e6fa2f3bcdb2ba94f015086aaa8fa6f3131e98c","observation_id":"41337159-851c-4c38-8ebb-f4896e234754","resolution":{"observed_at":"2026-08-10T16:51:20.102451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03265","last_updated":"2021-10-26T02:48:30Z","snapshot_observed_at":"2026-08-19T14:20:48.530093Z","submitted_at":"2019-08-08T20:51:17Z","title":"On the Variance of the Adaptive Learning Rate and Beyond","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.03265","snapshot_observed_at":"2026-08-10T15:46:20.139219Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.13683","last_updated":"2025-01-23T14:10:02Z","snapshot_observed_at":"2026-08-18T18:04:10.799214Z","submitted_at":"2025-01-23T14:10:02Z","title":"Unlearning Clients, Features and Samples in Vertical Federated Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T15:46:20.139219Z"},"links":{"cited_paper":"/paper/1908.03265","citing_paper":"/paper/2501.13683"},"observation_digest":"sha256:0e44d127ec655f8d9fe5627286134dd5417a99e2043bf0cb2aff1f3243ac7cde","observation_id":"6c36cb10-3e04-4742-978e-6ea2c9d7138b","resolution":{"observed_at":"2026-08-10T15:46:20.139219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03265","last_updated":"2021-10-26T02:48:30Z","snapshot_observed_at":"2026-08-19T14:20:48.530093Z","submitted_at":"2019-08-08T20:51:17Z","title":"On the Variance of the Adaptive Learning Rate and Beyond","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.03265","snapshot_observed_at":"2026-08-09T20:27:53.458185Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.19364","last_updated":"2025-07-26T09:31:22Z","snapshot_observed_at":"2026-08-16T18:11:13.345551Z","submitted_at":"2025-01-31T18:14:28Z","title":"CoSTI: Consistency Models for (a faster) Spatio-Temporal Imputation","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-09T20:27:53.458185Z"},"links":{"cited_paper":"/paper/1908.03265","citing_paper":"/paper/2501.19364"},"observation_digest":"sha256:8a6eb2842d763ba3ecee789377561aa3b1fffa15512d32f68f934689217eda96","observation_id":"f125ef0f-c08d-4f99-a0e3-9afff26d105e","resolution":{"observed_at":"2026-08-09T20:27:53.458185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03265","last_updated":"2021-10-26T02:48:30Z","snapshot_observed_at":"2026-08-19T14:20:48.530093Z","submitted_at":"2019-08-08T20:51:17Z","title":"On the Variance of the Adaptive Learning Rate and Beyond","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.03265","snapshot_observed_at":"2026-08-16T05:39:43.033568Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.20250","last_updated":"2025-04-28T20:42:24Z","snapshot_observed_at":"2026-08-20T17:26:00.416237Z","submitted_at":"2025-04-28T20:42:24Z","title":"Financial Data Analysis with Robust Federated Logistic Regression","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T05:39:43.033568Z"},"links":{"cited_paper":"/paper/1908.03265","citing_paper":"/paper/2504.20250"},"observation_digest":"sha256:d317fa11f105890bef006c32ce5816b7c546e7f19f7ac46152126dd4387c4461","observation_id":"e9a33574-bd16-48cc-873d-846c532b0f7a","resolution":{"observed_at":"2026-08-16T05:39:43.033568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03265","last_updated":"2021-10-26T02:48:30Z","snapshot_observed_at":"2026-08-19T14:20:48.530093Z","submitted_at":"2019-08-08T20:51:17Z","title":"On the Variance of the Adaptive Learning Rate and Beyond","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.03265","snapshot_observed_at":"2026-08-15T23:02:43.805122Z","title":"arXiv preprint arXiv:1908.03265 (2019) Title Suppressed Due to Excessive Length 15","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.05714","last_updated":"2025-05-09T01:31:02Z","snapshot_observed_at":"2026-08-19T14:22:14.376534Z","submitted_at":"2025-05-09T01:31:02Z","title":"TopicVD: A Topic-Based Dataset of Video-Guided Multimodal Machine Translation for Documentaries","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T23:02:43.805122Z"},"links":{"cited_paper":"/paper/1908.03265","citing_paper":"/paper/2505.05714"},"observation_digest":"sha256:7c2ae03d4b724e4bebcc9f0ca4612aca2255b0b3a510699363ca7e3b6002f3ac","observation_id":"b219a8ae-9827-4f9a-adb3-fbfa6549f7a3","resolution":{"observed_at":"2026-08-15T23:02:43.805122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03265","last_updated":"2021-10-26T02:48:30Z","snapshot_observed_at":"2026-08-19T14:20:48.530093Z","submitted_at":"2019-08-08T20:51:17Z","title":"On the Variance of the Adaptive Learning Rate and Beyond","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.03265","snapshot_observed_at":"2026-08-15T22:25:31.076238Z","title":"On the variance of the adaptive learning rate and beyond","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2505.07447","last_updated":"2025-05-20T12:27:53Z","snapshot_observed_at":"2026-08-18T02:13:44.077914Z","submitted_at":"2025-05-12T11:15:39Z","title":"Unified Continuous Generative Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:31.076238Z"},"links":{"cited_paper":"/paper/1908.03265","citing_paper":"/paper/2505.07447"},"observation_digest":"sha256:299552cc3df7118d09b6953c297a5ae5a3c14c8b2ecac56a349961e101a0221f","observation_id":"2544e12b-bf62-438b-bdca-1dcf81fcfbba","resolution":{"observed_at":"2026-08-15T22:25:31.076238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03265","last_updated":"2021-10-26T02:48:30Z","snapshot_observed_at":"2026-08-19T14:20:48.530093Z","submitted_at":"2019-08-08T20:51:17Z","title":"On the Variance of the Adaptive Learning Rate and Beyond","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.03265","snapshot_observed_at":"2026-08-15T20:53:40.655389Z","title":"On the variance of the adaptive learning rate and beyond,","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2505.13515","last_updated":"2025-05-17T04:11:17Z","snapshot_observed_at":"2026-08-18T09:40:40.071176Z","submitted_at":"2025-05-17T04:11:17Z","title":"LoRASuite: Efficient LoRA Adaptation Across Large Language Model Upgrades","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T20:53:40.655389Z"},"links":{"cited_paper":"/paper/1908.03265","citing_paper":"/paper/2505.13515"},"observation_digest":"sha256:7eed476e2bf72e4481073c36c913b8d29addc3fb6a800b6f2765346e6d7fa02a","observation_id":"79aa1f88-a06f-44a5-9600-d996fb18e693","resolution":{"observed_at":"2026-08-15T20:53:40.655389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03265","last_updated":"2021-10-26T02:48:30Z","snapshot_observed_at":"2026-08-19T14:20:48.530093Z","submitted_at":"2019-08-08T20:51:17Z","title":"On the Variance of the Adaptive Learning Rate and Beyond","version":4},"cited_work":{"arxiv_id":"1908.03265","doi":"10.48550/arxiv.1908.03265","metadata_source":"arxiv_reference","pith_arxiv_id":"1908.03265","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"On the variance of the adaptive learning rate and beyond.arXiv preprint arXiv:1908.03265","venue":"arXiv (Cornell University)","work_id":"7acbf612-b1e2-43af-bfe5-3a9d75e45cb6","year":1908},"citing_paper":{"arxiv_id":"2506.06558","last_updated":"2026-03-02T10:41:47Z","snapshot_observed_at":"2026-08-19T04:22:20.357274Z","submitted_at":"2025-06-06T22:10:05Z","title":"Rapid training of Hamiltonian graph networks using random features","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-19T10:17:00.343410Z"},"links":{"cited_paper":"/paper/1908.03265","citing_paper":"/paper/2506.06558"},"observation_digest":"sha256:54dd850361ddfd929440ef798f401eabadb04cf979b6337eace679092871b9d1","observation_id":"9b8548ed-6392-44bd-aba0-c0307459498a","resolution":{"observed_at":"2026-05-19T10:17:15.702752Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-03T18:08:20.655659+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T18:08:20.655659+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03265","last_updated":"2021-10-26T02:48:30Z","snapshot_observed_at":"2026-08-19T14:20:48.530093Z","submitted_at":"2019-08-08T20:51:17Z","title":"On the Variance of the Adaptive Learning Rate and Beyond","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.03265","snapshot_observed_at":"2026-08-06T20:07:26.301836Z","title":"2019, arXiv e-prints, arXiv:1908.03265, 10.48550/arXiv.1908.03265","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.03742","last_updated":"2025-08-04T14:23:51Z","snapshot_observed_at":"2026-08-14T21:36:58.922011Z","submitted_at":"2025-07-04T18:00:00Z","title":"Deep Potential: Recovering the gravitational potential and local pattern speed in the solar neighborhood with GDR3 using normalizing flows","version":2},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-06T20:07:26.301836Z"},"links":{"cited_paper":"/paper/1908.03265","citing_paper":"/paper/2507.03742"},"observation_digest":"sha256:7a95b235c804ec867c85fc040fae147105f990301c740b6ba27974b0f09ceb61","observation_id":"05fd9f67-538a-4a5b-975b-c91c9b65fd08","resolution":{"observed_at":"2026-08-06T20:07:26.301836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03265","last_updated":"2021-10-26T02:48:30Z","snapshot_observed_at":"2026-08-19T14:20:48.530093Z","submitted_at":"2019-08-08T20:51:17Z","title":"On the Variance of the Adaptive Learning Rate and Beyond","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.03265","snapshot_observed_at":"2026-08-06T19:10:16.591929Z","title":"On the variance of the adaptive learning rate and beyond,","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2507.06464","last_updated":"2025-07-09T00:47:37Z","snapshot_observed_at":"2026-08-13T07:37:39.690725Z","submitted_at":"2025-07-09T00:47:37Z","title":"SoftSignSGD(S3): An Enhanced Optimizer for Practical DNN Training and Loss Spikes Minimization Beyond Adam","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T19:10:16.591929Z"},"links":{"cited_paper":"/paper/1908.03265","citing_paper":"/paper/2507.06464"},"observation_digest":"sha256:82cfe976d05fd411ad54396bf2de4c0bb0aef5a791c5fccca47e781f451a89fb","observation_id":"218ef676-cdc5-4fff-9afb-a88f3cad0e79","resolution":{"observed_at":"2026-08-06T19:10:16.591929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03265","last_updated":"2021-10-26T02:48:30Z","snapshot_observed_at":"2026-08-19T14:20:48.530093Z","submitted_at":"2019-08-08T20:51:17Z","title":"On the Variance of the Adaptive Learning Rate and Beyond","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.03265","snapshot_observed_at":"2026-08-06T16:43:51.780376Z","title":"On the variance of the adaptive learning rate and beyond","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2507.12828","last_updated":"2025-07-23T02:14:58Z","snapshot_observed_at":"2026-08-21T06:55:44.691879Z","submitted_at":"2025-07-17T06:37:45Z","title":"Feature-Enhanced TResNet for Fine-Grained Food Image Classification","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T16:43:51.780376Z"},"links":{"cited_paper":"/paper/1908.03265","citing_paper":"/paper/2507.12828"},"observation_digest":"sha256:1e76fac552d986d60feb601d35e745ee9a7d041fe658b57f6516a68442aa2744","observation_id":"9e6a5159-a688-48c3-9649-7e32726407b1","resolution":{"observed_at":"2026-08-06T16:43:51.780376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03265","last_updated":"2021-10-26T02:48:30Z","snapshot_observed_at":"2026-08-19T14:20:48.530093Z","submitted_at":"2019-08-08T20:51:17Z","title":"On the Variance of the Adaptive Learning Rate and Beyond","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.03265","snapshot_observed_at":"2026-08-06T06:01:11.597771Z","title":"On the variance of the adaptive learning rate and beyond,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.01001","last_updated":"2025-08-01T18:10:49Z","snapshot_observed_at":"2026-08-09T20:22:50.977080Z","submitted_at":"2025-08-01T18:10:49Z","title":"Criticality analysis of nuclear binding energy neural networks","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T06:01:11.597771Z"},"links":{"cited_paper":"/paper/1908.03265","citing_paper":"/paper/2508.01001"},"observation_digest":"sha256:9d87a5ec1b9bdd21aa84ef051df2b766e103892653b3afe150c25b0a2220d4e5","observation_id":"80f58d11-afa8-4b7e-b467-8b8a79d71466","resolution":{"observed_at":"2026-08-06T06:01:11.597771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03265","last_updated":"2021-10-26T02:48:30Z","snapshot_observed_at":"2026-08-19T14:20:48.530093Z","submitted_at":"2019-08-08T20:51:17Z","title":"On the Variance of the Adaptive Learning Rate and Beyond","version":4},"cited_work":{"arxiv_id":"1908.03265","doi":"10.48550/arxiv.1908.03265","metadata_source":"arxiv_reference","pith_arxiv_id":"1908.03265","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"On the variance of the adaptive learning rate and beyond.arXiv preprint arXiv:1908.03265","venue":"arXiv (Cornell University)","work_id":"7acbf612-b1e2-43af-bfe5-3a9d75e45cb6","year":1908},"citing_paper":{"arxiv_id":"2509.13389","last_updated":"2026-05-25T16:41:30Z","snapshot_observed_at":"2026-08-13T14:39:51.899030Z","submitted_at":"2025-09-16T14:03:58Z","title":"From Next Token Prediction to (STRIPS) World Models","version":6},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-18T16:21:22.805473Z"},"links":{"cited_paper":"/paper/1908.03265","citing_paper":"/paper/2509.13389"},"observation_digest":"sha256:4e639b04811f77e7a4667e25d716c905cc5f59c04d5ff523eb06d6bcd4917e34","observation_id":"d42c4cf1-b7c5-41ff-983f-823e41ef7f6f","resolution":{"observed_at":"2026-05-18T16:21:36.462305Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-03T18:08:20.655659+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T18:08:20.655659+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03265","last_updated":"2021-10-26T02:48:30Z","snapshot_observed_at":"2026-08-19T14:20:48.530093Z","submitted_at":"2019-08-08T20:51:17Z","title":"On the Variance of the Adaptive Learning Rate and Beyond","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.03265","snapshot_observed_at":"2026-08-04T16:41:18.775357Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.13389","last_updated":"2026-05-25T16:41:30Z","snapshot_observed_at":"2026-08-13T14:39:51.899030Z","submitted_at":"2025-09-16T14:03:58Z","title":"From Next Token Prediction to (STRIPS) World Models","version":7},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-04T16:41:18.775357Z"},"links":{"cited_paper":"/paper/1908.03265","citing_paper":"/paper/2509.13389"},"observation_digest":"sha256:3c1f8b9e18df9f24cfeb2f525c0cec1baa26d1e46397d6ab768616c597d1a027","observation_id":"37157420-cf3a-4228-9c3f-f79600f54f5b","resolution":{"observed_at":"2026-08-04T16:41:18.775357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03265","last_updated":"2021-10-26T02:48:30Z","snapshot_observed_at":"2026-08-19T14:20:48.530093Z","submitted_at":"2019-08-08T20:51:17Z","title":"On the Variance of the Adaptive Learning Rate and Beyond","version":4},"cited_work":{"arxiv_id":"1908.03265","doi":"10.48550/arxiv.1908.03265","metadata_source":"arxiv_reference","pith_arxiv_id":"1908.03265","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"On the variance of the adaptive learning rate and beyond.arXiv preprint arXiv:1908.03265","venue":"arXiv (Cornell University)","work_id":"7acbf612-b1e2-43af-bfe5-3a9d75e45cb6","year":1908},"citing_paper":{"arxiv_id":"2509.15816","last_updated":"2026-05-10T06:58:46Z","snapshot_observed_at":"2026-08-18T20:56:42.898921Z","submitted_at":"2025-09-19T09:43:37Z","title":"On the Convergence of Muon and Beyond","version":5},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-05-18T15:56:30.602824Z"},"links":{"cited_paper":"/paper/1908.03265","citing_paper":"/paper/2509.15816"},"observation_digest":"sha256:1b8354cb32796e6930ae280f974404e017216d2b8ab0e93874cd0b7ccab94921","observation_id":"53416c7b-10c1-493a-a408-472c2dd13e13","resolution":{"observed_at":"2026-05-18T15:56:34.102980Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-03T18:08:20.655659+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T18:08:20.655659+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03265","last_updated":"2021-10-26T02:48:30Z","snapshot_observed_at":"2026-08-19T14:20:48.530093Z","submitted_at":"2019-08-08T20:51:17Z","title":"On the Variance of the Adaptive Learning Rate and Beyond","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.03265","snapshot_observed_at":"2026-08-04T12:38:58.819676Z","title":"On the variance of the adaptive learning rate and beyond","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2510.03164","last_updated":"2026-06-28T16:14:54Z","snapshot_observed_at":"2026-08-20T15:41:20.803850Z","submitted_at":"2025-10-03T16:35:56Z","title":"Why Do We Need Warm-up? A Theoretical Perspective","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-04T12:38:58.819676Z"},"links":{"cited_paper":"/paper/1908.03265","citing_paper":"/paper/2510.03164"},"observation_digest":"sha256:3f3a77079b5c13e9630539aa926b55fbca32f4c63796f78b92032a17d178f8d6","observation_id":"4a969c6c-cba2-4130-8c93-7308ff18d135","resolution":{"observed_at":"2026-08-04T12:38:58.819676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03265","last_updated":"2021-10-26T02:48:30Z","snapshot_observed_at":"2026-08-19T14:20:48.530093Z","submitted_at":"2019-08-08T20:51:17Z","title":"On the Variance of the Adaptive Learning Rate and Beyond","version":4},"cited_work":{"arxiv_id":"1908.03265","doi":"10.48550/arxiv.1908.03265","metadata_source":"arxiv_reference","pith_arxiv_id":"1908.03265","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"On the variance of the adaptive learning rate and beyond.arXiv preprint arXiv:1908.03265","venue":"arXiv (Cornell University)","work_id":"7acbf612-b1e2-43af-bfe5-3a9d75e45cb6","year":1908},"citing_paper":{"arxiv_id":"2601.15133","last_updated":"2026-05-20T17:50:47Z","snapshot_observed_at":"2026-07-06T22:42:36.961014Z","submitted_at":"2026-01-21T16:07:17Z","title":"Building Deep Graph Predictors with Graph Imitation Learning","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-21T15:44:58.327091Z"},"links":{"cited_paper":"/paper/1908.03265","citing_paper":"/paper/2601.15133"},"observation_digest":"sha256:5f79ef0aab45a90a7ce60d468b8a73453ae361b8056579a35d3f767ab0f8b808","observation_id":"8606aaef-40c8-497f-ba60-d25e8cb2dc9c","resolution":{"observed_at":"2026-05-21T15:45:18.726240Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-03T18:08:20.655659+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T18:08:20.655659+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03265","last_updated":"2021-10-26T02:48:30Z","snapshot_observed_at":"2026-08-19T14:20:48.530093Z","submitted_at":"2019-08-08T20:51:17Z","title":"On the Variance of the Adaptive Learning Rate and Beyond","version":4},"cited_work":{"arxiv_id":"1908.03265","doi":"10.48550/arxiv.1908.03265","metadata_source":"arxiv_reference","pith_arxiv_id":"1908.03265","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"On the variance of the adaptive learning rate and beyond.arXiv preprint arXiv:1908.03265","venue":"arXiv (Cornell University)","work_id":"7acbf612-b1e2-43af-bfe5-3a9d75e45cb6","year":1908},"citing_paper":{"arxiv_id":"2602.01665","last_updated":"2026-05-27T04:20:45Z","snapshot_observed_at":"2026-08-19T14:51:27.917066Z","submitted_at":"2026-02-02T05:34:38Z","title":"TABX: A High-Throughput Sandbox Battle Simulator for Multi-Agent Reinforcement Learning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-25T07:41:48.634351Z"},"links":{"cited_paper":"/paper/1908.03265","citing_paper":"/paper/2602.01665"},"observation_digest":"sha256:832231d6c24844603b4821a2107fec08111585030cde13be20d1d91131b35b55","observation_id":"1cceda00-a532-4936-a3b8-d125000f1e9a","resolution":{"observed_at":"2026-05-25T07:45:29.768850Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-03T18:08:20.655659+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T18:08:20.655659+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03265","last_updated":"2021-10-26T02:48:30Z","snapshot_observed_at":"2026-08-19T14:20:48.530093Z","submitted_at":"2019-08-08T20:51:17Z","title":"On the Variance of the Adaptive Learning Rate and Beyond","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.03265","snapshot_observed_at":"2026-08-03T05:37:38.449157Z","title":"On the variance of the adaptive learning rate and beyond.arXiv preprint arXiv:1908.03265,","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2602.01665","last_updated":"2026-05-27T04:20:45Z","snapshot_observed_at":"2026-08-19T14:51:27.917066Z","submitted_at":"2026-02-02T05:34:38Z","title":"TABX: A High-Throughput Sandbox Battle Simulator for Multi-Agent Reinforcement Learning","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T05:37:38.449157Z"},"links":{"cited_paper":"/paper/1908.03265","citing_paper":"/paper/2602.01665"},"observation_digest":"sha256:0e9b020ec3f9e0025ccc2de44b6868a8510cef5e640a918807e8da66aa5a5d2d","observation_id":"6999988d-3e60-41a8-b3a6-590f5e3cf82e","resolution":{"observed_at":"2026-08-03T05:37:38.449157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03265","last_updated":"2021-10-26T02:48:30Z","snapshot_observed_at":"2026-08-19T14:20:48.530093Z","submitted_at":"2019-08-08T20:51:17Z","title":"On the Variance of the Adaptive Learning Rate and Beyond","version":4},"cited_work":{"arxiv_id":"1908.03265","doi":"10.48550/arxiv.1908.03265","metadata_source":"arxiv_reference","pith_arxiv_id":"1908.03265","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"On the variance of the adaptive learning rate and beyond.arXiv preprint arXiv:1908.03265","venue":"arXiv (Cornell University)","work_id":"7acbf612-b1e2-43af-bfe5-3a9d75e45cb6","year":1908},"citing_paper":{"arxiv_id":"2603.09178","last_updated":"2026-04-13T02:12:38Z","snapshot_observed_at":"2026-08-18T11:53:10.074768Z","submitted_at":"2026-03-10T04:32:43Z","title":"Characterizing the Instrumental Profile of LAMOST","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-15T14:09:12.016309Z"},"links":{"cited_paper":"/paper/1908.03265","citing_paper":"/paper/2603.09178"},"observation_digest":"sha256:9fc50b83b0fe89232e84e0f31d55d61c6f138c3a37030ebfbcfbb0b3b3fccdef","observation_id":"becc2260-cb50-4253-b2ff-542c3fcc3f4b","resolution":{"observed_at":"2026-05-15T14:10:03.181485Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-03T18:08:20.655659+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T18:08:20.655659+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03265","last_updated":"2021-10-26T02:48:30Z","snapshot_observed_at":"2026-08-19T14:20:48.530093Z","submitted_at":"2019-08-08T20:51:17Z","title":"On the Variance of the Adaptive Learning Rate and Beyond","version":4},"cited_work":{"arxiv_id":"1908.03265","doi":"10.48550/arxiv.1908.03265","metadata_source":"arxiv_reference","pith_arxiv_id":"1908.03265","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"On the variance of the adaptive learning rate and beyond.arXiv preprint arXiv:1908.03265","venue":"arXiv (Cornell University)","work_id":"7acbf612-b1e2-43af-bfe5-3a9d75e45cb6","year":1908},"citing_paper":{"arxiv_id":"2604.06789","last_updated":"2026-04-08T07:57:05Z","snapshot_observed_at":"2026-08-17T12:41:51.325497Z","submitted_at":"2026-04-08T07:57:05Z","title":"Video-guided Machine Translation with Global Video Context","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-10T18:02:31.374359Z"},"links":{"cited_paper":"/paper/1908.03265","citing_paper":"/paper/2604.06789"},"observation_digest":"sha256:a537ed3ddb026db1e4cb2765b3e7b0e6d76175eacfcb8076a8b0d0bfa9d62f75","observation_id":"6b7d67b1-d767-4ff2-851f-29266263f10f","resolution":{"observed_at":"2026-05-11T05:36:01.141997Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-03T18:08:20.655659+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T18:08:20.655659+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03265","last_updated":"2021-10-26T02:48:30Z","snapshot_observed_at":"2026-08-19T14:20:48.530093Z","submitted_at":"2019-08-08T20:51:17Z","title":"On the Variance of the Adaptive Learning Rate and Beyond","version":4},"cited_work":{"arxiv_id":"1908.03265","doi":"10.48550/arxiv.1908.03265","metadata_source":"arxiv_reference","pith_arxiv_id":"1908.03265","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"On the variance of the adaptive learning rate and beyond.arXiv preprint arXiv:1908.03265","venue":"arXiv (Cornell University)","work_id":"7acbf612-b1e2-43af-bfe5-3a9d75e45cb6","year":1908},"citing_paper":{"arxiv_id":"2604.08939","last_updated":"2026-04-10T04:15:31Z","snapshot_observed_at":"2026-08-15T00:10:54.110329Z","submitted_at":"2026-04-10T04:15:31Z","title":"Delve into the Applicability of Advanced Optimizers for Multi-Task Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T16:42:48.902337Z"},"links":{"cited_paper":"/paper/1908.03265","citing_paper":"/paper/2604.08939"},"observation_digest":"sha256:aa051248678b5d668a5628dfe13977df73ea868cc9fe286412bedc1bc35573a6","observation_id":"e23ddd4e-e4dc-4372-856d-6bf8144e9d3e","resolution":{"observed_at":"2026-05-11T08:20:59.066359Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-03T18:08:20.655659+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T18:08:20.655659+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03265","last_updated":"2021-10-26T02:48:30Z","snapshot_observed_at":"2026-08-19T14:20:48.530093Z","submitted_at":"2019-08-08T20:51:17Z","title":"On the Variance of the Adaptive Learning Rate and Beyond","version":4},"cited_work":{"arxiv_id":"1908.03265","doi":"10.48550/arxiv.1908.03265","metadata_source":"arxiv_reference","pith_arxiv_id":"1908.03265","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"On the variance of the adaptive learning rate and beyond.arXiv preprint arXiv:1908.03265","venue":"arXiv (Cornell University)","work_id":"7acbf612-b1e2-43af-bfe5-3a9d75e45cb6","year":1908},"citing_paper":{"arxiv_id":"2604.09809","last_updated":"2026-04-10T18:33:27Z","snapshot_observed_at":"2026-08-02T06:33:22.153300Z","submitted_at":"2026-04-10T18:33:27Z","title":"Particle transformers for identifying Lorentz-boosted Higgs bosons decaying to a pair of W bosons","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-10T16:18:12.735038Z"},"links":{"cited_paper":"/paper/1908.03265","citing_paper":"/paper/2604.09809"},"observation_digest":"sha256:3f43f7adae05f337bacb0f3bd25a141c393ba02301d1563d75b0cf3db1e1fead","observation_id":"c01c0deb-37e6-4e97-bab7-0c246942c6dc","resolution":{"observed_at":"2026-05-11T09:01:00.835334Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-03T18:08:20.655659+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T18:08:20.655659+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03265","last_updated":"2021-10-26T02:48:30Z","snapshot_observed_at":"2026-08-19T14:20:48.530093Z","submitted_at":"2019-08-08T20:51:17Z","title":"On the Variance of the Adaptive Learning Rate and Beyond","version":4},"cited_work":{"arxiv_id":"1908.03265","doi":"10.48550/arxiv.1908.03265","metadata_source":"arxiv_reference","pith_arxiv_id":"1908.03265","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"On the variance of the adaptive learning rate and beyond.arXiv preprint arXiv:1908.03265","venue":"arXiv (Cornell University)","work_id":"7acbf612-b1e2-43af-bfe5-3a9d75e45cb6","year":1908},"citing_paper":{"arxiv_id":"2604.22838","last_updated":"2026-04-21T06:27:18Z","snapshot_observed_at":"2026-08-20T15:55:17.278205Z","submitted_at":"2026-04-21T06:27:18Z","title":"Neural Network Optimization Reimagined: Decoupled Techniques for Scratch and Fine-Tuning","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-10T03:26:09.751493Z"},"links":{"cited_paper":"/paper/1908.03265","citing_paper":"/paper/2604.22838"},"observation_digest":"sha256:c2dfc8b17005215748e3404a8acd1fc060b4981c54444156c499fe6c4828d563","observation_id":"8ae7bd9e-455d-4181-9297-823f6433ac9f","resolution":{"observed_at":"2026-05-10T03:29:22.069640Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-03T18:08:20.655659+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T18:08:20.655659+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03265","last_updated":"2021-10-26T02:48:30Z","snapshot_observed_at":"2026-08-19T14:20:48.530093Z","submitted_at":"2019-08-08T20:51:17Z","title":"On the Variance of the Adaptive Learning Rate and Beyond","version":4},"cited_work":{"arxiv_id":"1908.03265","doi":"10.48550/arxiv.1908.03265","metadata_source":"arxiv_reference","pith_arxiv_id":"1908.03265","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"On the variance of the adaptive learning rate and beyond.arXiv preprint arXiv:1908.03265","venue":"arXiv (Cornell University)","work_id":"7acbf612-b1e2-43af-bfe5-3a9d75e45cb6","year":1908},"citing_paper":{"arxiv_id":"2605.00650","last_updated":"2026-05-01T13:31:35Z","snapshot_observed_at":"2026-08-12T12:26:48.658869Z","submitted_at":"2026-05-01T13:31:35Z","title":"AdaMeZO: Adam-style Zeroth-Order Optimizer for LLM Fine-tuning Without Maintaining the Moments","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-05-09T19:50:50.653184Z"},"links":{"cited_paper":"/paper/1908.03265","citing_paper":"/paper/2605.00650"},"observation_digest":"sha256:1b2cb517b40f39e7cc3aba99395eee910ea83a1cbe84a987cf0d7bb2f1b592a9","observation_id":"59fe7434-96b1-48a5-8a05-df485960b583","resolution":{"observed_at":"2026-05-11T15:31:07.615287Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-03T18:08:20.655659+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T18:08:20.655659+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03265","last_updated":"2021-10-26T02:48:30Z","snapshot_observed_at":"2026-08-19T14:20:48.530093Z","submitted_at":"2019-08-08T20:51:17Z","title":"On the Variance of the Adaptive Learning Rate and Beyond","version":4},"cited_work":{"arxiv_id":"1908.03265","doi":"10.48550/arxiv.1908.03265","metadata_source":"arxiv_reference","pith_arxiv_id":"1908.03265","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"On the variance of the adaptive learning rate and beyond.arXiv preprint arXiv:1908.03265","venue":"arXiv (Cornell University)","work_id":"7acbf612-b1e2-43af-bfe5-3a9d75e45cb6","year":1908},"citing_paper":{"arxiv_id":"2605.01667","last_updated":"2026-05-03T01:38:37Z","snapshot_observed_at":"2026-08-19T15:11:58.529065Z","submitted_at":"2026-05-03T01:38:37Z","title":"Deep neural networks with Fisher vector encoding for medical image classification","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-10T16:22:00.015928Z"},"links":{"cited_paper":"/paper/1908.03265","citing_paper":"/paper/2605.01667"},"observation_digest":"sha256:2f96e06142cbddc3c19a558e2bca24aed763ab5959ddc2733373c597b07387b6","observation_id":"e984c67a-2fbf-4c5a-a644-babd64eadc37","resolution":{"observed_at":"2026-05-11T09:00:58.899036Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-03T18:08:20.655659+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T18:08:20.655659+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03265","last_updated":"2021-10-26T02:48:30Z","snapshot_observed_at":"2026-08-19T14:20:48.530093Z","submitted_at":"2019-08-08T20:51:17Z","title":"On the Variance of the Adaptive Learning Rate and Beyond","version":4},"cited_work":{"arxiv_id":"1908.03265","doi":"10.48550/arxiv.1908.03265","metadata_source":"arxiv_reference","pith_arxiv_id":"1908.03265","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"On the variance of the adaptive learning rate and beyond.arXiv preprint arXiv:1908.03265","venue":"arXiv (Cornell University)","work_id":"7acbf612-b1e2-43af-bfe5-3a9d75e45cb6","year":1908},"citing_paper":{"arxiv_id":"2605.02317","last_updated":"2026-05-06T13:42:00Z","snapshot_observed_at":"2026-08-21T01:00:19.436555Z","submitted_at":"2026-05-04T08:14:51Z","title":"Anon: Extrapolating Adaptivity Beyond SGD and Adam","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-09T16:25:36.073417Z"},"links":{"cited_paper":"/paper/1908.03265","citing_paper":"/paper/2605.02317"},"observation_digest":"sha256:165b6abff278d376be8434dd0e75b5617410e7f0138e6d8765a5f550a8e4d809","observation_id":"4e6ec95d-267c-4f21-8d9a-e2e9a6cd9a9c","resolution":{"observed_at":"2026-05-11T16:31:09.614347Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-03T18:08:20.655659+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T18:08:20.655659+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03265","last_updated":"2021-10-26T02:48:30Z","snapshot_observed_at":"2026-08-19T14:20:48.530093Z","submitted_at":"2019-08-08T20:51:17Z","title":"On the Variance of the Adaptive Learning Rate and Beyond","version":4},"cited_work":{"arxiv_id":"1908.03265","doi":"10.48550/arxiv.1908.03265","metadata_source":"arxiv_reference","pith_arxiv_id":"1908.03265","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"On the variance of the adaptive learning rate and beyond.arXiv preprint arXiv:1908.03265","venue":"arXiv (Cornell University)","work_id":"7acbf612-b1e2-43af-bfe5-3a9d75e45cb6","year":1908},"citing_paper":{"arxiv_id":"2605.05115","last_updated":"2026-05-06T16:46:03Z","snapshot_observed_at":"2026-08-07T10:12:24.411121Z","submitted_at":"2026-05-06T16:46:03Z","title":"Manifold Steering Reveals the Shared Geometry of Neural Network Representation and Behavior","version":1},"reference_index":297,"source":"arxiv_source","source_observed_at":"2026-05-08T17:47:09.591001Z"},"links":{"cited_paper":"/paper/1908.03265","citing_paper":"/paper/2605.05115"},"observation_digest":"sha256:16fd870fb099b55c85277f76881a629e5f157f2d2dadcf6d111664ab195ef9c3","observation_id":"00736419-3d20-4b7a-a440-5d677ac61205","resolution":{"observed_at":"2026-05-11T17:16:06.693844Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-03T18:08:20.655659+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T18:08:20.655659+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03265","last_updated":"2021-10-26T02:48:30Z","snapshot_observed_at":"2026-08-19T14:20:48.530093Z","submitted_at":"2019-08-08T20:51:17Z","title":"On the Variance of the Adaptive Learning Rate and Beyond","version":4},"cited_work":{"arxiv_id":"1908.03265","doi":"10.48550/arxiv.1908.03265","metadata_source":"arxiv_reference","pith_arxiv_id":"1908.03265","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"On the variance of the adaptive learning rate and beyond.arXiv preprint arXiv:1908.03265","venue":"arXiv (Cornell University)","work_id":"7acbf612-b1e2-43af-bfe5-3a9d75e45cb6","year":1908},"citing_paper":{"arxiv_id":"2605.12230","last_updated":"2026-05-12T15:05:32Z","snapshot_observed_at":"2026-08-11T15:46:37.563863Z","submitted_at":"2026-05-12T15:05:32Z","title":"Neural Network-Based Virtual Wheel-Speed Sensor for Enhanced Low-Velocity State Estimation","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-13T04:32:39.053186Z"},"links":{"cited_paper":"/paper/1908.03265","citing_paper":"/paper/2605.12230"},"observation_digest":"sha256:f4957f5506aa601b7fb97a7616d5c910971d36811559c6f52153c85e5884e340","observation_id":"2918b059-9733-48f5-a3cd-47bd6101ba2e","resolution":{"observed_at":"2026-05-13T04:37:15.837211Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-03T18:08:20.655659+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T18:08:20.655659+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03265","last_updated":"2021-10-26T02:48:30Z","snapshot_observed_at":"2026-08-19T14:20:48.530093Z","submitted_at":"2019-08-08T20:51:17Z","title":"On the Variance of the Adaptive Learning Rate and Beyond","version":4},"cited_work":{"arxiv_id":"1908.03265","doi":"10.48550/arxiv.1908.03265","metadata_source":"arxiv_reference","pith_arxiv_id":"1908.03265","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"On the variance of the adaptive learning rate and beyond.arXiv preprint arXiv:1908.03265","venue":"arXiv (Cornell University)","work_id":"7acbf612-b1e2-43af-bfe5-3a9d75e45cb6","year":1908},"citing_paper":{"arxiv_id":"2605.21557","last_updated":"2026-06-04T12:29:12Z","snapshot_observed_at":"2026-08-13T19:32:24.413172Z","submitted_at":"2026-05-20T13:46:22Z","title":"Scalable Reinforcement Learning via Adaptive Batch Scaling","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-22T00:21:15.933174Z"},"links":{"cited_paper":"/paper/1908.03265","citing_paper":"/paper/2605.21557"},"observation_digest":"sha256:b3c83c14baba199d28aac688d030fff8422997e9f305964d3e1cb6eab6d2c368","observation_id":"59e925a4-f420-47fe-a40e-8169504af7f9","resolution":{"observed_at":"2026-05-22T00:24:27.799007Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-03T18:08:20.655659+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T18:08:20.655659+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03265","last_updated":"2021-10-26T02:48:30Z","snapshot_observed_at":"2026-08-19T14:20:48.530093Z","submitted_at":"2019-08-08T20:51:17Z","title":"On the Variance of the Adaptive Learning Rate and Beyond","version":4},"cited_work":{"arxiv_id":"1908.03265","doi":"10.48550/arxiv.1908.03265","metadata_source":"arxiv_reference","pith_arxiv_id":"1908.03265","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"On the variance of the adaptive learning rate and beyond.arXiv preprint arXiv:1908.03265","venue":"arXiv (Cornell University)","work_id":"7acbf612-b1e2-43af-bfe5-3a9d75e45cb6","year":1908},"citing_paper":{"arxiv_id":"2605.21557","last_updated":"2026-06-04T12:29:12Z","snapshot_observed_at":"2026-08-13T19:32:24.413172Z","submitted_at":"2026-05-20T13:46:22Z","title":"Scalable Reinforcement Learning via Adaptive Batch Scaling","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-30T17:17:59.698127Z"},"links":{"cited_paper":"/paper/1908.03265","citing_paper":"/paper/2605.21557"},"observation_digest":"sha256:f0e963eb1001734cccbf8dfa9751579d51c3b7f348a6a29f171de595d38ebcd3","observation_id":"200df501-70ac-4759-a340-d81bee41b7fe","resolution":{"observed_at":"2026-06-30T17:24:57.664358Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-03T18:08:20.655659+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T18:08:20.655659+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03265","last_updated":"2021-10-26T02:48:30Z","snapshot_observed_at":"2026-08-19T14:20:48.530093Z","submitted_at":"2019-08-08T20:51:17Z","title":"On the Variance of the Adaptive Learning Rate and Beyond","version":4},"cited_work":{"arxiv_id":"1908.03265","doi":"10.48550/arxiv.1908.03265","metadata_source":"arxiv_reference","pith_arxiv_id":"1908.03265","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"On the variance of the adaptive learning rate and beyond.arXiv preprint arXiv:1908.03265","venue":"arXiv (Cornell University)","work_id":"7acbf612-b1e2-43af-bfe5-3a9d75e45cb6","year":1908},"citing_paper":{"arxiv_id":"2606.04662","last_updated":"2026-06-03T09:40:30Z","snapshot_observed_at":"2026-08-21T04:14:31.253279Z","submitted_at":"2026-06-03T09:40:30Z","title":"Why Muon Outperforms Adam: A Curvature Perspective","version":1},"reference_index":169,"source":"arxiv_source","source_observed_at":"2026-06-28T07:04:21.012269Z"},"links":{"cited_paper":"/paper/1908.03265","citing_paper":"/paper/2606.04662"},"observation_digest":"sha256:cbdfd35be953847c8e1a7c674b42b16e5e12912af4fff7cb5a6b8df0ac492722","observation_id":"431879f9-244d-4bb3-bfd4-38146499c5ea","resolution":{"observed_at":"2026-07-02T07:06:44.922851Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-03T18:08:20.655659+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T18:08:20.655659+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03265","last_updated":"2021-10-26T02:48:30Z","snapshot_observed_at":"2026-08-19T14:20:48.530093Z","submitted_at":"2019-08-08T20:51:17Z","title":"On the Variance of the Adaptive Learning Rate and Beyond","version":4},"cited_work":{"arxiv_id":"1908.03265","doi":"10.48550/arxiv.1908.03265","metadata_source":"arxiv_reference","pith_arxiv_id":"1908.03265","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"On the variance of the adaptive learning rate and beyond.arXiv preprint arXiv:1908.03265","venue":"arXiv (Cornell University)","work_id":"7acbf612-b1e2-43af-bfe5-3a9d75e45cb6","year":1908},"citing_paper":{"arxiv_id":"2606.09658","last_updated":"2026-06-08T15:42:54Z","snapshot_observed_at":"2026-08-12T20:25:49.594664Z","submitted_at":"2026-06-08T15:42:54Z","title":"Muon Learns More Robust and Transferable Features than Adam","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-06-27T17:08:30.717799Z"},"links":{"cited_paper":"/paper/1908.03265","citing_paper":"/paper/2606.09658"},"observation_digest":"sha256:2a59ea94c40dba305b036c5c4190b6df56a76cfec37e7e862c73b52cdfa87ecf","observation_id":"a73ac89d-0f45-4267-a7d4-3024d2c63041","resolution":{"observed_at":"2026-07-03T00:27:30.094776Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-03T18:08:20.655659+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T18:08:20.655659+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03265","last_updated":"2021-10-26T02:48:30Z","snapshot_observed_at":"2026-08-19T14:20:48.530093Z","submitted_at":"2019-08-08T20:51:17Z","title":"On the Variance of the Adaptive Learning Rate and Beyond","version":4},"cited_work":{"arxiv_id":"1908.03265","doi":"10.48550/arxiv.1908.03265","metadata_source":"arxiv_reference","pith_arxiv_id":"1908.03265","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"On the variance of the adaptive learning rate and beyond.arXiv preprint arXiv:1908.03265","venue":"arXiv (Cornell University)","work_id":"7acbf612-b1e2-43af-bfe5-3a9d75e45cb6","year":1908},"citing_paper":{"arxiv_id":"2606.14187","last_updated":"2026-06-16T11:02:08Z","snapshot_observed_at":"2026-08-15T23:23:22.379045Z","submitted_at":"2026-06-12T07:10:17Z","title":"Zeta: Dual Whitening for Matrix Optimization via Coordinate-Adaptive Preconditioning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-27T05:03:06.472027Z"},"links":{"cited_paper":"/paper/1908.03265","citing_paper":"/paper/2606.14187"},"observation_digest":"sha256:6637e5f68d1107af06536112577300f053837dc24ec80048bbdd84c9f209e1d3","observation_id":"5b67d29d-83ba-4c55-af17-ac27193e4821","resolution":{"observed_at":"2026-07-03T16:38:41.024926Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-03T18:08:20.655659+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T18:08:20.655659+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03265","last_updated":"2021-10-26T02:48:30Z","snapshot_observed_at":"2026-08-19T14:20:48.530093Z","submitted_at":"2019-08-08T20:51:17Z","title":"On the Variance of the Adaptive Learning Rate and Beyond","version":4},"cited_work":{"arxiv_id":"1908.03265","doi":"10.48550/arxiv.1908.03265","metadata_source":"arxiv_reference","pith_arxiv_id":"1908.03265","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"On the variance of the adaptive learning rate and beyond.arXiv preprint arXiv:1908.03265","venue":"arXiv (Cornell University)","work_id":"7acbf612-b1e2-43af-bfe5-3a9d75e45cb6","year":1908},"citing_paper":{"arxiv_id":"2606.25971","last_updated":"2026-07-17T13:42:08Z","snapshot_observed_at":"2026-08-02T10:13:56.529128Z","submitted_at":"2026-06-24T15:40:26Z","title":"Improving Neural Network Training by Decoupling the Magnitude and Direction of Weight Vectors","version":1},"reference_index":166,"source":"arxiv_source","source_observed_at":"2026-06-25T20:05:09.179627Z"},"links":{"cited_paper":"/paper/1908.03265","citing_paper":"/paper/2606.25971"},"observation_digest":"sha256:8124fd28722b4d89e52958f527a51d983413bb55e356538409be767ca89e5cbe","observation_id":"8e1790d6-d0bb-4204-a2d9-f13af6cbcd0c","resolution":{"observed_at":"2026-07-04T20:30:07.698743Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-03T18:08:20.655659+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T18:08:20.655659+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03265","last_updated":"2021-10-26T02:48:30Z","snapshot_observed_at":"2026-08-19T14:20:48.530093Z","submitted_at":"2019-08-08T20:51:17Z","title":"On the Variance of the Adaptive Learning Rate and Beyond","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.03265","snapshot_observed_at":"2026-08-02T10:14:08.871888Z","title":"On the variance of the adaptive learning rate and beyond","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.25971","last_updated":"2026-07-17T13:42:08Z","snapshot_observed_at":"2026-08-02T10:13:56.529128Z","submitted_at":"2026-06-24T15:40:26Z","title":"Improving Neural Network Training by Decoupling the Magnitude and Direction of Weight Vectors","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-02T10:14:08.871888Z"},"links":{"cited_paper":"/paper/1908.03265","citing_paper":"/paper/2606.25971"},"observation_digest":"sha256:bfacaee0958c10b185f67b98713e9947566e9b803dc4827fed946632f30d2399","observation_id":"bf816f9e-848a-4f3d-a30e-92ee06128d26","resolution":{"observed_at":"2026-08-02T10:14:08.871888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03265","last_updated":"2021-10-26T02:48:30Z","snapshot_observed_at":"2026-08-19T14:20:48.530093Z","submitted_at":"2019-08-08T20:51:17Z","title":"On the Variance of the Adaptive Learning Rate and Beyond","version":4},"cited_work":{"arxiv_id":"1908.03265","doi":"10.48550/arxiv.1908.03265","metadata_source":"arxiv_reference","pith_arxiv_id":"1908.03265","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"On the variance of the adaptive learning rate and beyond.arXiv preprint arXiv:1908.03265","venue":"arXiv (Cornell University)","work_id":"7acbf612-b1e2-43af-bfe5-3a9d75e45cb6","year":1908},"citing_paper":{"arxiv_id":"2606.29255","last_updated":"2026-06-28T07:53:16Z","snapshot_observed_at":"2026-08-02T15:16:00.907137Z","submitted_at":"2026-06-28T07:53:16Z","title":"Confidence-feedback-weighted graph matching network: online-offline laser-induced damage site matching under complex interference","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-30T08:09:50.192952Z"},"links":{"cited_paper":"/paper/1908.03265","citing_paper":"/paper/2606.29255"},"observation_digest":"sha256:b287bfd3909369484be70ac255bd4653ef2b3ec7b220410078854cf8e9496bdc","observation_id":"8aa828d9-8e2a-41c4-81a9-a577794beac8","resolution":{"observed_at":"2026-06-30T08:14:25.179388Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-03T18:08:20.655659+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T18:08:20.655659+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03265","last_updated":"2021-10-26T02:48:30Z","snapshot_observed_at":"2026-08-19T14:20:48.530093Z","submitted_at":"2019-08-08T20:51:17Z","title":"On the Variance of the Adaptive Learning Rate and Beyond","version":4},"cited_work":{"arxiv_id":"1908.03265","doi":"10.48550/arxiv.1908.03265","metadata_source":"arxiv_reference","pith_arxiv_id":"1908.03265","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"On the variance of the adaptive learning rate and beyond.arXiv preprint arXiv:1908.03265","venue":"arXiv (Cornell University)","work_id":"7acbf612-b1e2-43af-bfe5-3a9d75e45cb6","year":1908},"citing_paper":{"arxiv_id":"2607.01032","last_updated":"2026-07-01T15:00:21Z","snapshot_observed_at":"2026-08-02T08:29:05.462200Z","submitted_at":"2026-07-01T15:00:21Z","title":"Point spread function wavefront recovery from in-focus stellar observations","version":1},"reference_index":187,"source":"arxiv_source","source_observed_at":"2026-07-02T05:34:06.325999Z"},"links":{"cited_paper":"/paper/1908.03265","citing_paper":"/paper/2607.01032"},"observation_digest":"sha256:a9955247ca9079b9d2173b0b8110789080ed13d3dc707a68ab55cc708a616442","observation_id":"3909f6fb-bb73-4b1a-8d41-6a0245ba64c8","resolution":{"observed_at":"2026-07-02T05:36:40.238509Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-03T18:08:20.655659+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T18:08:20.655659+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03265","last_updated":"2021-10-26T02:48:30Z","snapshot_observed_at":"2026-08-19T14:20:48.530093Z","submitted_at":"2019-08-08T20:51:17Z","title":"On the Variance of the Adaptive Learning Rate and Beyond","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.03265","snapshot_observed_at":"2026-07-11T22:10:49.683444Z","title":"On the variance of the adaptive learning rate and beyond.arXiv preprint arXiv:1908.03265, 2019","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2607.04033","last_updated":"2026-07-04T21:27:05Z","snapshot_observed_at":"2026-08-07T05:07:10.107694Z","submitted_at":"2026-07-04T21:27:05Z","title":"OmniOpt: Taxonomy, Geometry, and Benchmarking of Modern Optimizers","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-07-11T22:10:49.683444Z"},"links":{"cited_paper":"/paper/1908.03265","citing_paper":"/paper/2607.04033"},"observation_digest":"sha256:cbd45ca57b98322ddcc9947fcc93e7342304f776b941c0af2d3658d560a772d5","observation_id":"9acfc265-1011-43dd-a2a7-b148e9610e63","resolution":{"observed_at":"2026-07-11T22:10:49.683444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03265","last_updated":"2021-10-26T02:48:30Z","snapshot_observed_at":"2026-08-19T14:20:48.530093Z","submitted_at":"2019-08-08T20:51:17Z","title":"On the Variance of the Adaptive Learning Rate and Beyond","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.03265","snapshot_observed_at":"2026-07-11T20:46:05.467029Z","title":"On the Variance of the Adaptive Learning Rate and Beyond","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2607.04233","last_updated":"2026-07-05T11:11:40Z","snapshot_observed_at":"2026-08-16T20:56:16.792561Z","submitted_at":"2026-07-05T11:11:40Z","title":"Unified convergence analysis for gradient descent optimization methods in the training of deep neural networks","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-07-11T20:46:05.467029Z"},"links":{"cited_paper":"/paper/1908.03265","citing_paper":"/paper/2607.04233"},"observation_digest":"sha256:d0d2d1640c09816f04b2982247b51153f92a6ac4c1ac0fb7f0855174bc1a8055","observation_id":"e6b32ccb-1afa-420f-801f-d94cfd168b29","resolution":{"observed_at":"2026-07-11T20:46:05.467029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03265","last_updated":"2021-10-26T02:48:30Z","snapshot_observed_at":"2026-08-19T14:20:48.530093Z","submitted_at":"2019-08-08T20:51:17Z","title":"On the Variance of the Adaptive Learning Rate and Beyond","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.03265","snapshot_observed_at":"2026-08-01T16:19:27.144952Z","title":null,"venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2607.18058","last_updated":"2026-07-20T15:26:50Z","snapshot_observed_at":"2026-08-14T01:48:04.518283Z","submitted_at":"2026-07-20T15:26:50Z","title":"A machine-learned probability distribution in the phase space of turbulent channel flow for synthetic turbulence and flow reconstruction","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-01T16:19:27.144952Z"},"links":{"cited_paper":"/paper/1908.03265","citing_paper":"/paper/2607.18058"},"observation_digest":"sha256:17bb5ba327e2729403fc3d092a7f7dcc3a6538e19325026340ca84d7f3021307","observation_id":"f9e1f0fb-c62e-4366-b4a9-d290f097a92e","resolution":{"observed_at":"2026-08-01T16:19:27.144952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03265","last_updated":"2021-10-26T02:48:30Z","snapshot_observed_at":"2026-08-19T14:20:48.530093Z","submitted_at":"2019-08-08T20:51:17Z","title":"On the Variance of the Adaptive Learning Rate and Beyond","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.03265","snapshot_observed_at":"2026-08-01T08:51:11.204445Z","title":"arXiv preprint arXiv:1908.03265 , year=","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2607.21009","last_updated":"2026-07-23T07:47:31Z","snapshot_observed_at":"2026-08-13T15:49:20.667949Z","submitted_at":"2026-07-23T07:47:31Z","title":"GCR Spectra Reconstructed with Neutron Monitor Yield Function and Artificial Neural Networks: Comparison of Two Methods","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-01T08:51:11.204445Z"},"links":{"cited_paper":"/paper/1908.03265","citing_paper":"/paper/2607.21009"},"observation_digest":"sha256:3156f1808d3f721f01a38b7431f865da6b0df766f9756d53c8ebca996ddc6ffd","observation_id":"a8553a71-a379-47ab-a86f-bd17140d0fb5","resolution":{"observed_at":"2026-08-01T08:51:11.204445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03265","last_updated":"2021-10-26T02:48:30Z","snapshot_observed_at":"2026-08-19T14:20:48.530093Z","submitted_at":"2019-08-08T20:51:17Z","title":"On the Variance of the Adaptive Learning Rate and Beyond","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.03265","snapshot_observed_at":"2026-08-01T04:40:18.200294Z","title":null,"venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2607.22499","last_updated":"2026-07-24T17:11:47Z","snapshot_observed_at":"2026-08-18T11:13:19.545765Z","submitted_at":"2026-07-24T17:11:47Z","title":"Payne4GAIN: NLTE Corrections for Red Giants in Milky Way Mapper using H-Band Neural Network Emulators","version":1},"reference_index":152,"source":"arxiv_source","source_observed_at":"2026-08-01T04:40:18.200294Z"},"links":{"cited_paper":"/paper/1908.03265","citing_paper":"/paper/2607.22499"},"observation_digest":"sha256:1ec277bc1f41ea6985f77314f66b40e518dbb605dcbfe1b9f05bb90558fbae68","observation_id":"4aa982dc-4ad3-4a8a-aace-348d101318c1","resolution":{"observed_at":"2026-08-01T04:40:18.200294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03265","last_updated":"2021-10-26T02:48:30Z","snapshot_observed_at":"2026-08-19T14:20:48.530093Z","submitted_at":"2019-08-08T20:51:17Z","title":"On the Variance of the Adaptive Learning Rate and Beyond","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.03265","snapshot_observed_at":"2026-07-30T18:58:28.223966Z","title":"arXiv preprint arXiv:1908.03265 , year=","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2607.26860","last_updated":"2026-07-29T12:44:19Z","snapshot_observed_at":"2026-08-12T23:39:20.547745Z","submitted_at":"2026-07-29T12:44:19Z","title":"Amortized Moment Matching for Visual Generation","version":1},"reference_index":104,"source":"arxiv_source","source_observed_at":"2026-07-30T18:58:28.223966Z"},"links":{"cited_paper":"/paper/1908.03265","citing_paper":"/paper/2607.26860"},"observation_digest":"sha256:02b52f3dbf40f7d2e4c91158d29a097ec47ddd2179cd8915183ee4f2c71e6998","observation_id":"320d20e7-082b-4fe6-a440-833a7c068a46","resolution":{"observed_at":"2026-07-30T18:58:28.223966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03265","last_updated":"2021-10-26T02:48:30Z","snapshot_observed_at":"2026-08-19T14:20:48.530093Z","submitted_at":"2019-08-08T20:51:17Z","title":"On the Variance of the Adaptive Learning Rate and Beyond","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.03265","snapshot_observed_at":"2026-08-01T04:27:10.763773Z","title":"On the variance of the adaptive learning rate and beyond,","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2607.27635","last_updated":"2026-07-30T03:45:38Z","snapshot_observed_at":"2026-08-17T04:02:41.143007Z","submitted_at":"2026-07-30T03:45:38Z","title":"HealthCAT: An Interpretable Encoder-only Transformer Framework for Health Indicator Prediction and Temporal Interpretation of Wearable Sensor Data","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-01T04:27:10.763773Z"},"links":{"cited_paper":"/paper/1908.03265","citing_paper":"/paper/2607.27635"},"observation_digest":"sha256:1a7999138a0522544dac6d7ddbbcd4db1f0f3fca3901e7ee7d21d10cd74f6dde","observation_id":"30ab29ce-e1d7-4d81-a48a-c360c4b99e42","resolution":{"observed_at":"2026-08-01T04:27:10.763773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/1908.03265/citation-record","integrity":"/paper/1908.03265/integrity","json":"/paper/1908.03265/citation-record.json","paper":"/paper/1908.03265"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-08-15T04:53:45.483331Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-14T14:28:07.396921Z","title":"Layer normalization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"1908.03265","last_updated":"2021-10-26T02:48:30Z","snapshot_observed_at":"2026-08-19T14:20:48.530093Z","submitted_at":"2019-08-08T20:51:17Z","title":"On the Variance of the Adaptive Learning Rate and Beyond","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-14T14:28:07.396921Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/1908.03265"},"observation_digest":"sha256:fec9af014192a43627d1188a822c1a5312867c3cbd5f407ef26c3c30e4bf93d0","observation_id":"269d722e-495f-4336-9488-0203991af3f0","resolution":{"observed_at":"2026-08-14T14:28:07.396921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:28:07.541597Z","title":null,"venue":null,"work_id":"0d732167-7786-4be4-b0fa-ef12c1a0ddd3","year":2020},"citing_paper":{"arxiv_id":"1908.03265","last_updated":"2021-10-26T02:48:30Z","snapshot_observed_at":"2026-08-19T14:20:48.530093Z","submitted_at":"2019-08-08T20:51:17Z","title":"On the Variance of the Adaptive Learning Rate and Beyond","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-14T14:28:07.426485Z"},"links":{"citing_paper":"/paper/1908.03265"},"observation_digest":"sha256:aa95e04e17e3d5794d47a0c811cd3bdc78996ad1a6dea067d142379dca29fcf2","observation_id":"15f1a38e-20cf-4bea-abba-01cb525356b5","resolution":{"observed_at":"2026-08-14T14:28:07.545148Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:28:07.561892Z","title":"Taylor series methods","venue":null,"work_id":"fae82833-be20-4e08-a3d3-57099e035f69","year":2020},"citing_paper":{"arxiv_id":"1908.03265","last_updated":"2021-10-26T02:48:30Z","snapshot_observed_at":"2026-08-19T14:20:48.530093Z","submitted_at":"2019-08-08T20:51:17Z","title":"On the Variance of the Adaptive Learning Rate and Beyond","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-14T14:28:07.416170Z"},"links":{"citing_paper":"/paper/1908.03265"},"observation_digest":"sha256:ef9698ecb34c4a90320f79a9fbd6ccfcb54262fa5f82004ad12d59aff4c2a6d7","observation_id":"87c0e687-3b0d-4ea7-9322-1399296c4a71","resolution":{"observed_at":"2026-08-14T14:28:07.565493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1212.5701","last_updated":"2012-12-22T15:46:49Z","snapshot_observed_at":"2026-08-19T05:19:50.480481Z","submitted_at":"2012-12-22T15:46:49Z","title":"ADADELTA: An Adaptive Learning Rate Method","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.5701","snapshot_observed_at":"2026-08-14T14:28:07.419627Z","title":"Adadelta: an adaptive learning rate method","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"1908.03265","last_updated":"2021-10-26T02:48:30Z","snapshot_observed_at":"2026-08-19T14:20:48.530093Z","submitted_at":"2019-08-08T20:51:17Z","title":"On the Variance of the Adaptive Learning Rate and Beyond","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-14T14:28:07.419627Z"},"links":{"cited_paper":"/paper/1212.5701","citing_paper":"/paper/1908.03265"},"observation_digest":"sha256:c788b39e0ae3a453045e2b448a52f65af6c3e5b4b2049b916270ac485dc9406a","observation_id":"602da088-cebb-4951-b49f-8e457b676686","resolution":{"observed_at":"2026-08-14T14:28:07.419627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:28:07.551840Z","title":null,"venue":null,"work_id":"2a9902f2-0229-4659-ac31-08c09a1a657a","year":2020},"citing_paper":{"arxiv_id":"1908.03265","last_updated":"2021-10-26T02:48:30Z","snapshot_observed_at":"2026-08-19T14:20:48.530093Z","submitted_at":"2019-08-08T20:51:17Z","title":"On the Variance of the Adaptive Learning Rate and Beyond","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-14T14:28:07.423191Z"},"links":{"citing_paper":"/paper/1908.03265"},"observation_digest":"sha256:18aeec3fb9605eb4c5c989d5346b9d753b96e58d2f1fe7f886b93f41ee7af7cf","observation_id":"71763c4f-5d5f-4b41-8b3a-93478d91d605","resolution":{"observed_at":"2026-08-14T14:28:07.555175Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:28:07.529778Z","title":"Speciﬁcally, we use two-layer LSTMs with 2048 hidden states with adaptive softmax to conduct experiments on the one billion words dataset","venue":null,"work_id":"2f1d8720-1560-4de0-8d7c-225f35b81779","year":2018},"citing_paper":{"arxiv_id":"1908.03265","last_updated":"2021-10-26T02:48:30Z","snapshot_observed_at":"2026-08-19T14:20:48.530093Z","submitted_at":"2019-08-08T20:51:17Z","title":"On the Variance of the Adaptive Learning Rate and Beyond","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-14T14:28:07.429935Z"},"links":{"citing_paper":"/paper/1908.03265"},"observation_digest":"sha256:b824dc0bedf64e64a8db31a79ec3ddbaed7a4dc6c7584acaa530b8a0dededd72","observation_id":"0c791f5f-41e4-4148-9413-35784ff1c924","resolution":{"observed_at":"2026-08-14T14:28:07.534816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:28:07.519678Z","title":null,"venue":null,"work_id":"b71524c2-77fa-4e76-b228-9eb89c42cb72","year":2019},"citing_paper":{"arxiv_id":"1908.03265","last_updated":"2021-10-26T02:48:30Z","snapshot_observed_at":"2026-08-19T14:20:48.530093Z","submitted_at":"2019-08-08T20:51:17Z","title":"On the Variance of the Adaptive Learning Rate and Beyond","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-14T14:28:07.433100Z"},"links":{"citing_paper":"/paper/1908.03265"},"observation_digest":"sha256:4192edf549bf565b6767eb4b78345d387898cb15c33b02a61633da07f5d45279","observation_id":"e3bd9a61-e2bd-45ca-85a3-b08e6377c96f","resolution":{"observed_at":"2026-08-14T14:28:07.523189Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1806.06763","last_updated":"2020-06-23T06:47:00Z","snapshot_observed_at":"2026-08-19T14:19:07.002118Z","submitted_at":"2018-06-18T15:17:01Z","title":"Closing the Generalization Gap of Adaptive Gradient Methods in Training Deep Neural Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.06763","snapshot_observed_at":"2026-08-14T14:28:07.404944Z","title":"Closing the generalization gap of adaptive gradient methods in training deep neural networks","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"1908.03265","last_updated":"2021-10-26T02:48:30Z","snapshot_observed_at":"2026-08-19T14:20:48.530093Z","submitted_at":"2019-08-08T20:51:17Z","title":"On the Variance of the Adaptive Learning Rate and Beyond","version":4},"reference_index":2013,"source":"pdf_text","source_observed_at":"2026-08-14T14:28:07.404944Z"},"links":{"cited_paper":"/paper/1806.06763","citing_paper":"/paper/1908.03265"},"observation_digest":"sha256:9d9a90d74991f2c72a5e53239a5579245372a938f9d2ed315894c4f8b290cfd5","observation_id":"982da36c-afa4-4f91-bb9b-8a1690968aa5","resolution":{"observed_at":"2026-08-14T14:28:07.404944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:28:07.571997Z","title":"Advances in optimizing recurrent networks","venue":null,"work_id":"385a878a-7db2-442f-80cb-671ddbae3600","year":2013},"citing_paper":{"arxiv_id":"1908.03265","last_updated":"2021-10-26T02:48:30Z","snapshot_observed_at":"2026-08-19T14:20:48.530093Z","submitted_at":"2019-08-08T20:51:17Z","title":"On the Variance of the Adaptive Learning Rate and Beyond","version":4},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-14T14:28:07.401429Z"},"links":{"citing_paper":"/paper/1908.03265"},"observation_digest":"sha256:9665cba4d94c5cc6eed6d9714fde70ca6559d5d31cf9932011a40332331c103e","observation_id":"2d26b5b2-40e0-4306-8e35-50f07e2ac403","resolution":{"observed_at":"2026-08-14T14:28:07.575739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-08-16T14:33:50.657682Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-14T14:28:07.412371Z","title":"Roberta: A robustly optimized bert pretraining approach","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"1908.03265","last_updated":"2021-10-26T02:48:30Z","snapshot_observed_at":"2026-08-19T14:20:48.530093Z","submitted_at":"2019-08-08T20:51:17Z","title":"On the Variance of the Adaptive Learning Rate and Beyond","version":4},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-14T14:28:07.412371Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/1908.03265"},"observation_digest":"sha256:be0376061f80a4e320f3d0bb34c57235e70bf925bc2c0ea27a54aa16d23d4574","observation_id":"171e4bee-62fa-47a7-ba21-135b5701fd6f","resolution":{"observed_at":"2026-08-14T14:28:07.412371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.02677","last_updated":"2018-04-30T21:53:41Z","snapshot_observed_at":"2026-08-09T05:23:26.365677Z","submitted_at":"2017-06-08T16:51:53Z","title":"Accurate, Large Minibatch SGD: Training ImageNet in 1 Hour","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.02677","snapshot_observed_at":"2026-08-14T14:28:07.408678Z","title":"Accurate, large minibatch sgd: Training imagenet in 1 hour","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"1908.03265","last_updated":"2021-10-26T02:48:30Z","snapshot_observed_at":"2026-08-19T14:20:48.530093Z","submitted_at":"2019-08-08T20:51:17Z","title":"On the Variance of the Adaptive Learning Rate and Beyond","version":4},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-14T14:28:07.408678Z"},"links":{"cited_paper":"/paper/1706.02677","citing_paper":"/paper/1908.03265"},"observation_digest":"sha256:87775183661a4f4c2bc5a2da1476ed7cee8a7bc8ea2b6dbd2e8dd1b7a69326b1","observation_id":"5c73596d-2d4a-4e58-8042-726d0ef29b30","resolution":{"observed_at":"2026-08-14T14:28:07.408678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:28:07.508402Z","title":null,"venue":null,"work_id":"0bce7e92-1078-47e3-ad1c-08bbb9088f3b","year":2020},"citing_paper":{"arxiv_id":"1908.03265","last_updated":"2021-10-26T02:48:30Z","snapshot_observed_at":"2026-08-19T14:20:48.530093Z","submitted_at":"2019-08-08T20:51:17Z","title":"On the Variance of the Adaptive Learning Rate and Beyond","version":4},"reference_index":8196,"source":"pdf_text","source_observed_at":"2026-08-14T14:28:07.436964Z"},"links":{"citing_paper":"/paper/1908.03265"},"observation_digest":"sha256:fe128133fb9c811d0a4752f771dc0e7575ece34a85c7775d4ff5139f08e7b49e","observation_id":"06f93314-7402-4f5b-83e1-f3d9cd89158f","resolution":{"observed_at":"2026-08-14T14:28:07.512790Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"1908.03265","last_updated":"2021-10-26T02:48:30Z","latest_version":4,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-19T14:20:48.530093Z","submitted_at":"2019-08-08T20:51:17Z","title":"On the Variance of the Adaptive Learning Rate and Beyond"},"reference_resolution":{"displayed":12,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":9,"verified_exact":0,"verified_fuzzy":3},"total_outbound_references":12},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 12 of 12 outbound references and 63 inbound Pith citation observations for arXiv:1908.03265."}