{"as_of":"2026-08-21T02:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b736419540cd5120475ff5a81e8c4fd62779456a75373700ad2af86fc93f383b","coverage":[{"denominator":68,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":68,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:18:23.157124Z","state":"measured"},{"denominator":69,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":69,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T18:59:08.087421Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-10T23:35:52.053423Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.13397","last_updated":"2025-05-19T17:34:32Z","snapshot_observed_at":"2026-08-20T05:17:37.987687Z","submitted_at":"2025-05-19T17:34:32Z","title":"Learning by solving differential equations","version":1},"cited_work":{"arxiv_id":"2505.13397","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.13397","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning by solving differential equations","venue":null,"work_id":"42d3b60c-702e-4f8f-9097-71c9788045a4","year":2025},"citing_paper":{"arxiv_id":"2604.06652","last_updated":"2026-04-08T03:57:52Z","snapshot_observed_at":"2026-08-17T08:50:27.778533Z","submitted_at":"2026-04-08T03:57:52Z","title":"FlowAdam: Implicit Regularization via Geometry-Aware Soft Momentum Injection","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T18:59:08.087421Z"},"links":{"cited_paper":"/paper/2505.13397","citing_paper":"/paper/2604.06652"},"observation_digest":"sha256:b38a3db43b04708462acb25752f19acebcb0bb7a06807f4804a94ef5237537f9","observation_id":"80868c1c-b999-4999-9040-dd58d0d0c9f4","resolution":{"observed_at":"2026-05-10T23:35:52.059328Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.13397/citation-record","integrity":"/paper/2505.13397/integrity","json":"/paper/2505.13397/citation-record.json","paper":"/paper/2505.13397"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:27.106334Z","title":"Natural gradient works efficiently in learning.Neural computation, 10(2):251– 276, 1998","venue":null,"work_id":"50968052-cc3d-4234-a257-1459b1947579","year":1998},"citing_paper":{"arxiv_id":"2505.13397","last_updated":"2025-05-19T17:34:32Z","snapshot_observed_at":"2026-08-20T05:17:37.987687Z","submitted_at":"2025-05-19T17:34:32Z","title":"Learning by solving differential equations","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:22.455945Z"},"links":{"citing_paper":"/paper/2505.13397"},"observation_digest":"sha256:1f3b3178b2e4b459f4bd0a2fb5c8196ffb6c4a8e9f85effaea575da9eae8762e","observation_id":"03ff58f4-532d-42e4-9463-dbc88d8e310d","resolution":{"observed_at":"2026-08-15T20:18:27.115884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.09018","last_updated":"2021-03-05T06:29:48Z","snapshot_observed_at":"2026-08-20T11:15:02.831518Z","submitted_at":"2020-02-20T20:51:33Z","title":"Scalable Second Order Optimization for Deep Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.09018","snapshot_observed_at":"2026-08-15T20:18:22.462622Z","title":"Scalable second order optimization for deep learning","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2505.13397","last_updated":"2025-05-19T17:34:32Z","snapshot_observed_at":"2026-08-20T05:17:37.987687Z","submitted_at":"2025-05-19T17:34:32Z","title":"Learning by solving differential equations","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:22.462622Z"},"links":{"cited_paper":"/paper/2002.09018","citing_paper":"/paper/2505.13397"},"observation_digest":"sha256:3fcafe7464cb39d2f1e467ef533272a8ec9903a9d2781748b4364c9c3cd53ecd","observation_id":"66a905be-88ab-4cea-ac70-eaf68543fd31","resolution":{"observed_at":"2026-08-15T20:18:22.462622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:26.880242Z","title":"Stochastic runge-kutta methods and adaptive sgd-g2 stochastic gradient descent","venue":null,"work_id":"68162f4c-aaa4-43ea-a2b0-2003e2f43993","year":2020},"citing_paper":{"arxiv_id":"2505.13397","last_updated":"2025-05-19T17:34:32Z","snapshot_observed_at":"2026-08-20T05:17:37.987687Z","submitted_at":"2025-05-19T17:34:32Z","title":"Learning by solving differential equations","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:22.470716Z"},"links":{"citing_paper":"/paper/2505.13397"},"observation_digest":"sha256:17ccf6d9ecb29836f2def6009c1439a4407c6677d794d8968b9f44f5d72900db","observation_id":"968aa42d-18f9-4ede-bc35-327e4a18d8bd","resolution":{"observed_at":"2026-08-15T20:18:26.964886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:26.853797Z","title":"Liapunov Functions and Stability in Control Theory","venue":null,"work_id":"4476774a-5b07-47c4-b050-499448b81203","year":2001},"citing_paper":{"arxiv_id":"2505.13397","last_updated":"2025-05-19T17:34:32Z","snapshot_observed_at":"2026-08-20T05:17:37.987687Z","submitted_at":"2025-05-19T17:34:32Z","title":"Learning by solving differential equations","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:22.476981Z"},"links":{"citing_paper":"/paper/2505.13397"},"observation_digest":"sha256:9d3cab38a9af4a835f56ee1df335b87379330502fc817271a791e2f0d5f40914","observation_id":"fece649c-6fff-4736-b912-aca9a8ecd5e9","resolution":{"observed_at":"2026-08-15T20:18:26.868201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:26.657618Z","title":"Barrett and Benoit Dherin","venue":null,"work_id":"add49356-b801-48a5-8c85-498ca26713ff","year":2021},"citing_paper":{"arxiv_id":"2505.13397","last_updated":"2025-05-19T17:34:32Z","snapshot_observed_at":"2026-08-20T05:17:37.987687Z","submitted_at":"2025-05-19T17:34:32Z","title":"Learning by solving differential equations","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:22.483828Z"},"links":{"citing_paper":"/paper/2505.13397"},"observation_digest":"sha256:96f44d9899ed36d436547bfa66272a5963b24ee3858bd8d6e416c685b392c0a6","observation_id":"6027926c-3884-42ec-805c-850d9d679cdf","resolution":{"observed_at":"2026-08-15T20:18:26.773425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21265","last_updated":"2024-12-06T17:02:28Z","snapshot_observed_at":"2026-08-20T05:17:00.607177Z","submitted_at":"2024-10-28T17:57:31Z","title":"Modular Duality in Deep Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21265","snapshot_observed_at":"2026-08-15T20:18:22.495835Z","title":"Modular duality in deep learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13397","last_updated":"2025-05-19T17:34:32Z","snapshot_observed_at":"2026-08-20T05:17:37.987687Z","submitted_at":"2025-05-19T17:34:32Z","title":"Learning by solving differential equations","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:22.495835Z"},"links":{"cited_paper":"/paper/2410.21265","citing_paper":"/paper/2505.13397"},"observation_digest":"sha256:79a06a1076af6f38ed16d7fda3c52c1d4c946fc97cb8e2ac34dd7c90f7562a4e","observation_id":"a961ea67-c89f-43cf-98c2-d5e6ab5e16ad","resolution":{"observed_at":"2026-08-15T20:18:22.495835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1802.03653","last_updated":"2018-02-15T16:40:22Z","snapshot_observed_at":"2026-08-14T19:47:09.156231Z","submitted_at":"2018-02-10T21:45:46Z","title":"On Symplectic Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.03653","snapshot_observed_at":"2026-08-15T20:18:22.502533Z","title":"On symplectic optimization","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.13397","last_updated":"2025-05-19T17:34:32Z","snapshot_observed_at":"2026-08-20T05:17:37.987687Z","submitted_at":"2025-05-19T17:34:32Z","title":"Learning by solving differential equations","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:22.502533Z"},"links":{"cited_paper":"/paper/1802.03653","citing_paper":"/paper/2505.13397"},"observation_digest":"sha256:143e82fa89c267e2b164c94813d605d759353ef8c69b91c6afc2270cddd72f62","observation_id":"1144f997-7b1a-4f97-a460-76939126bbca","resolution":{"observed_at":"2026-08-15T20:18:22.502533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:26.608537Z","title":null,"venue":null,"work_id":"0f8f1ac2-2efd-4ac7-a103-e8c98080b71e","year":1989},"citing_paper":{"arxiv_id":"2505.13397","last_updated":"2025-05-19T17:34:32Z","snapshot_observed_at":"2026-08-20T05:17:37.987687Z","submitted_at":"2025-05-19T17:34:32Z","title":"Learning by solving differential equations","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:22.508440Z"},"links":{"citing_paper":"/paper/2505.13397"},"observation_digest":"sha256:18c03add06ca19c26d44d72339d41a7aa79d678fbfd0f2aee51cf987aa0b2101","observation_id":"1c4519c5-fc5d-4739-b1bd-4be0f93a4d7b","resolution":{"observed_at":"2026-08-15T20:18:26.614998Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00079","last_updated":"2024-06-16T10:29:01Z","snapshot_observed_at":"2026-08-19T23:06:18.671139Z","submitted_at":"2023-08-31T18:33:05Z","title":"On the Implicit Bias of Adam","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00079","snapshot_observed_at":"2026-08-15T20:18:22.514491Z","title":"On the implicit bias of adam","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13397","last_updated":"2025-05-19T17:34:32Z","snapshot_observed_at":"2026-08-20T05:17:37.987687Z","submitted_at":"2025-05-19T17:34:32Z","title":"Learning by solving differential equations","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:22.514491Z"},"links":{"cited_paper":"/paper/2309.00079","citing_paper":"/paper/2505.13397"},"observation_digest":"sha256:a6a5c5b50e959d23c0e2ccdb70f67dad4d0e76f33b5fbac566b5b6f43c769493","observation_id":"5954805a-8ba4-47a8-92a0-f26812abb3d0","resolution":{"observed_at":"2026-08-15T20:18:22.514491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:26.591320Z","title":null,"venue":null,"work_id":"36832f8c-543f-43c5-b205-fe6c76fddcab","year":1993},"citing_paper":{"arxiv_id":"2505.13397","last_updated":"2025-05-19T17:34:32Z","snapshot_observed_at":"2026-08-20T05:17:37.987687Z","submitted_at":"2025-05-19T17:34:32Z","title":"Learning by solving differential equations","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:22.521432Z"},"links":{"citing_paper":"/paper/2505.13397"},"observation_digest":"sha256:5650c0c4b50e41555450a5c3e026cad7ca11168642f1861faece241738bff462","observation_id":"9267039f-a465-4c74-a838-08dcc625da2e","resolution":{"observed_at":"2026-08-15T20:18:26.597168Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07179","last_updated":"2025-06-18T11:00:36Z","snapshot_observed_at":"2026-08-16T15:24:33.812156Z","submitted_at":"2023-06-12T15:21:02Z","title":"Benchmarking Neural Network Training Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07179","snapshot_observed_at":"2026-08-15T20:18:22.530022Z","title":"Dahl, Frank Schneider, Peter Mattson, et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13397","last_updated":"2025-05-19T17:34:32Z","snapshot_observed_at":"2026-08-20T05:17:37.987687Z","submitted_at":"2025-05-19T17:34:32Z","title":"Learning by solving differential equations","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:22.530022Z"},"links":{"cited_paper":"/paper/2306.07179","citing_paper":"/paper/2505.13397"},"observation_digest":"sha256:676cbc75e800d283330bdd96839796b5bc1dda0a1dddab5c99eaed0bf7ad47a2","observation_id":"65de98a4-5126-4390-a8a0-f687433b8724","resolution":{"observed_at":"2026-08-15T20:18:22.530022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15682","last_updated":"2024-10-29T22:40:23Z","snapshot_observed_at":"2026-08-16T13:49:41.180584Z","submitted_at":"2024-05-24T16:20:46Z","title":"The Road Less Scheduled","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15682","snapshot_observed_at":"2026-08-15T20:18:22.536336Z","title":"The road less scheduled","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13397","last_updated":"2025-05-19T17:34:32Z","snapshot_observed_at":"2026-08-20T05:17:37.987687Z","submitted_at":"2025-05-19T17:34:32Z","title":"Learning by solving differential equations","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:22.536336Z"},"links":{"cited_paper":"/paper/2405.15682","citing_paper":"/paper/2505.13397"},"observation_digest":"sha256:1b8ea5f7ef491dc7709b55aabc00db4f01d182824f4c4bea80bc0284b7ea8b4c","observation_id":"b5a52664-5c03-405c-a1e1-c5e739163673","resolution":{"observed_at":"2026-08-15T20:18:22.536336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:26.535133Z","title":"Why neural networks find simple solutions: The many regularizers of geometric complexity","venue":null,"work_id":"cd8b5468-6633-40fe-9d83-9f9cff7579ec","year":2022},"citing_paper":{"arxiv_id":"2505.13397","last_updated":"2025-05-19T17:34:32Z","snapshot_observed_at":"2026-08-20T05:17:37.987687Z","submitted_at":"2025-05-19T17:34:32Z","title":"Learning by solving differential equations","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:22.542331Z"},"links":{"citing_paper":"/paper/2505.13397"},"observation_digest":"sha256:cd595b5cfaae34cbb92770f15ef0b56e23fa69b3618bc691a1d1e659a0231803","observation_id":"4dff64c8-755a-4cd9-874d-00be4f54c548","resolution":{"observed_at":"2026-08-15T20:18:26.574556Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:26.473631Z","title":"Corridor geometry in gradient-based optimization, 2024","venue":null,"work_id":"d323be93-8de6-4094-9d1f-106fb4eea3b2","year":2024},"citing_paper":{"arxiv_id":"2505.13397","last_updated":"2025-05-19T17:34:32Z","snapshot_observed_at":"2026-08-20T05:17:37.987687Z","submitted_at":"2025-05-19T17:34:32Z","title":"Learning by solving differential equations","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:22.564763Z"},"links":{"citing_paper":"/paper/2505.13397"},"observation_digest":"sha256:58b92388a13cfaec7caf46e13b1371933c76831dd7fbdeb28fa45e124eba63d1","observation_id":"41d13a17-e9dd-4397-bd9d-931f91cbf094","resolution":{"observed_at":"2026-08-15T20:18:26.479314Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:22.596538Z","title":"Adam: A method for stochastic optimization","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.13397","last_updated":"2025-05-19T17:34:32Z","snapshot_observed_at":"2026-08-20T05:17:37.987687Z","submitted_at":"2025-05-19T17:34:32Z","title":"Learning by solving differential equations","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:22.596538Z"},"links":{"citing_paper":"/paper/2505.13397"},"observation_digest":"sha256:a71aeae60a10905f006e9cd29b211c647fbf4040b952cd954070f42c9f43d9e9","observation_id":"02d38264-98ed-43b8-8142-41b91a35acd0","resolution":{"observed_at":"2026-08-15T20:18:22.596538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-15T20:18:22.609049Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.13397","last_updated":"2025-05-19T17:34:32Z","snapshot_observed_at":"2026-08-20T05:17:37.987687Z","submitted_at":"2025-05-19T17:34:32Z","title":"Learning by solving differential equations","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:22.609049Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2505.13397"},"observation_digest":"sha256:db8771df9711782d746ad41f3ee76544eff7ed735307696a32d7b3622f3880f2","observation_id":"be601e57-6a6b-4741-99a1-7306b9e29c5c","resolution":{"observed_at":"2026-08-15T20:18:22.609049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:26.445537Z","title":"Incorporating nesterov momentum into adam","venue":null,"work_id":"b04971b5-a9da-4499-b307-812299922fc5","year":2016},"citing_paper":{"arxiv_id":"2505.13397","last_updated":"2025-05-19T17:34:32Z","snapshot_observed_at":"2026-08-20T05:17:37.987687Z","submitted_at":"2025-05-19T17:34:32Z","title":"Learning by solving differential equations","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:22.614440Z"},"links":{"citing_paper":"/paper/2505.13397"},"observation_digest":"sha256:101ee591703f76555540797a8f981e5b9b015c5570d024e77877a6486f62bdfb","observation_id":"9f8b9bcb-0b4c-49d9-8070-f17ff1e9ab26","resolution":{"observed_at":"2026-08-15T20:18:26.450800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:26.369835Z","title":"Adaptive subgradient methods for online learning and stochastic optimization","venue":null,"work_id":"d7b266ae-3c80-4b0f-b678-f78ed8286dd9","year":2011},"citing_paper":{"arxiv_id":"2505.13397","last_updated":"2025-05-19T17:34:32Z","snapshot_observed_at":"2026-08-20T05:17:37.987687Z","submitted_at":"2025-05-19T17:34:32Z","title":"Learning by solving differential equations","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:22.619895Z"},"links":{"citing_paper":"/paper/2505.13397"},"observation_digest":"sha256:b8a207941ea29f80145a5c3c3fbde66e84efced5950fab465e4f4bfd5f35c193","observation_id":"62e6ef9f-0f5c-4a8a-9227-6ba6fcb67dc8","resolution":{"observed_at":"2026-08-15T20:18:26.407359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.13901","last_updated":"2023-10-21T03:45:13Z","snapshot_observed_at":"2026-08-16T14:50:12.985810Z","submitted_at":"2023-10-21T03:45:13Z","title":"Towards Hyperparameter-Agnostic DNN Training via Dynamical System Insights","version":1},"cited_work":{"arxiv_id":"2310.13901","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.13901","snapshot_observed_at":"2026-08-15T20:18:23.452362Z","title":"Towards Hyperparameter-Agnostic DNN Training via Dynamical System Insights","venue":"cs.LG","work_id":"20302d46-dd7a-4109-84a6-2b162063c232","year":2023},"citing_paper":{"arxiv_id":"2505.13397","last_updated":"2025-05-19T17:34:32Z","snapshot_observed_at":"2026-08-20T05:17:37.987687Z","submitted_at":"2025-05-19T17:34:32Z","title":"Learning by solving differential equations","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:22.626687Z"},"links":{"cited_paper":"/paper/2310.13901","citing_paper":"/paper/2505.13397"},"observation_digest":"sha256:030cd6fa61f36164f1b98d9b6a1b7e1718fbd77223f93b894717f2881c9205b1","observation_id":"ff67d33b-0a82-4bd0-9c5d-0c1394632215","resolution":{"observed_at":"2026-08-15T20:18:23.457767Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:26.352192Z","title":"Conformal symplectic and relativistic optimization","venue":null,"work_id":"9a506d20-23b7-4062-b27a-2ae4282793eb","year":2020},"citing_paper":{"arxiv_id":"2505.13397","last_updated":"2025-05-19T17:34:32Z","snapshot_observed_at":"2026-08-20T05:17:37.987687Z","submitted_at":"2025-05-19T17:34:32Z","title":"Learning by solving differential equations","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:22.632682Z"},"links":{"citing_paper":"/paper/2505.13397"},"observation_digest":"sha256:5cb65e6868c689e55888b4c3a6f935efba165ab6733b7d558bfd302b8468a80b","observation_id":"e02f8997-fa1c-405f-b915-d8b49ac6576a","resolution":{"observed_at":"2026-08-15T20:18:26.357211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:26.332393Z","title":"Admm and accelerated admm as continuous dynamical systems","venue":null,"work_id":"13c68c1d-0762-4cb6-8be4-42bec54ac165","year":2018},"citing_paper":{"arxiv_id":"2505.13397","last_updated":"2025-05-19T17:34:32Z","snapshot_observed_at":"2026-08-20T05:17:37.987687Z","submitted_at":"2025-05-19T17:34:32Z","title":"Learning by solving differential equations","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:22.645754Z"},"links":{"citing_paper":"/paper/2505.13397"},"observation_digest":"sha256:13ac6586d2d798248dcc04a48b27011e775691f66a3f1951e1712daa53a87df7","observation_id":"a1d4824e-4f46-493c-9250-23cefa338b9e","resolution":{"observed_at":"2026-08-15T20:18:26.338224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:26.315555Z","title":"Gradient flows and proximal splitting methods: A unified view on accelerated and stochastic optimization","venue":null,"work_id":"c6ce490e-5b9f-4b0d-adbd-aa0a154d0480","year":2021},"citing_paper":{"arxiv_id":"2505.13397","last_updated":"2025-05-19T17:34:32Z","snapshot_observed_at":"2026-08-20T05:17:37.987687Z","submitted_at":"2025-05-19T17:34:32Z","title":"Learning by solving differential equations","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:22.663898Z"},"links":{"citing_paper":"/paper/2505.13397"},"observation_digest":"sha256:c3df38e11f1e5b0d8985f055d9fb5ea2a49651198075c7defdad970cef60e0dc","observation_id":"81aa9ba0-673d-492f-ac36-30866188db16","resolution":{"observed_at":"2026-08-15T20:18:26.321056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:26.155727Z","title":"Implicit regularization in heavy-ball momentum accelerated stochastic gradient descent","venue":null,"work_id":"d4743025-f393-4c23-be09-afd1029d377c","year":2023},"citing_paper":{"arxiv_id":"2505.13397","last_updated":"2025-05-19T17:34:32Z","snapshot_observed_at":"2026-08-20T05:17:37.987687Z","submitted_at":"2025-05-19T17:34:32Z","title":"Learning by solving differential equations","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:22.669203Z"},"links":{"citing_paper":"/paper/2505.13397"},"observation_digest":"sha256:2c0f3fc1c5f6afa06ff56683952932089303fd3d9c83e6359af118dcea2a10ae","observation_id":"b352cc6e-6dbe-4308-a0e4-8512149143ce","resolution":{"observed_at":"2026-08-15T20:18:26.267017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:26.140429Z","title":"Gilmer, George E","venue":null,"work_id":"e83aa886-8508-427c-ae53-5487aa444e30","year":2023},"citing_paper":{"arxiv_id":"2505.13397","last_updated":"2025-05-19T17:34:32Z","snapshot_observed_at":"2026-08-20T05:17:37.987687Z","submitted_at":"2025-05-19T17:34:32Z","title":"Learning by solving differential equations","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:22.674554Z"},"links":{"citing_paper":"/paper/2505.13397"},"observation_digest":"sha256:8d67878edd55ff65f8318cb688c4b92f009415bc71cbc2e1d28f1e17daa5b981","observation_id":"a9ed09a9-fb5f-4f1d-b75f-1eb55743b672","resolution":{"observed_at":"2026-08-15T20:18:26.144894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:22.680348Z","title":"Shampoo: Preconditioned stochastic tensor optimization","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.13397","last_updated":"2025-05-19T17:34:32Z","snapshot_observed_at":"2026-08-20T05:17:37.987687Z","submitted_at":"2025-05-19T17:34:32Z","title":"Learning by solving differential equations","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:22.680348Z"},"links":{"citing_paper":"/paper/2505.13397"},"observation_digest":"sha256:d8cb57a9ae263fa09a86bb87042175e0e036695e5781fe28d0c3ca587d5d8cdb","observation_id":"b380030d-8c46-4d52-a068-fe44ae6bed73","resolution":{"observed_at":"2026-08-15T20:18:22.680348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:22.686446Z","title":"Geometric numerical integration","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2505.13397","last_updated":"2025-05-19T17:34:32Z","snapshot_observed_at":"2026-08-20T05:17:37.987687Z","submitted_at":"2025-05-19T17:34:32Z","title":"Learning by solving differential equations","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:22.686446Z"},"links":{"citing_paper":"/paper/2505.13397"},"observation_digest":"sha256:64ffe175e1ea51f985ac9f6cb14e12fdeecb9c2eec6b1757ec1ced530431ce56","observation_id":"005d1f2f-5782-46d3-a6f0-80df2cc5d829","resolution":{"observed_at":"2026-08-15T20:18:22.686446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:25.910210Z","title":"Solving Ordinary Differential Equations I: Nonstiff Problems, volume 8 of Springer Series in Computational Mathematics","venue":null,"work_id":"241af577-a632-4ee2-b772-abf9cfc77e0f","year":1993},"citing_paper":{"arxiv_id":"2505.13397","last_updated":"2025-05-19T17:34:32Z","snapshot_observed_at":"2026-08-20T05:17:37.987687Z","submitted_at":"2025-05-19T17:34:32Z","title":"Learning by solving differential equations","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:22.691818Z"},"links":{"citing_paper":"/paper/2505.13397"},"observation_digest":"sha256:af83fe6be34433866666168b859c4713526051c1adb111144087d03b3e661abe","observation_id":"825d7c72-d1d5-4de2-b98d-f99c87701c55","resolution":{"observed_at":"2026-08-15T20:18:26.051326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:25.885765Z","title":"Solving Ordinary Differential Equations II: Stiff and Differential-Algebraic Problems, volume 14 of Springer Series in Computational Mathematics","venue":null,"work_id":"c07c73e8-9d4c-4950-8f92-492d5fb2fa23","year":1996},"citing_paper":{"arxiv_id":"2505.13397","last_updated":"2025-05-19T17:34:32Z","snapshot_observed_at":"2026-08-20T05:17:37.987687Z","submitted_at":"2025-05-19T17:34:32Z","title":"Learning by solving differential equations","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:22.696731Z"},"links":{"citing_paper":"/paper/2505.13397"},"observation_digest":"sha256:0c9756e7ef8aaa68eb0011bacefb3b1f86a348e9db3ac79d255b5e885cd97e85","observation_id":"da5fbaa1-8257-432a-a4ce-7b6647e9484d","resolution":{"observed_at":"2026-08-15T20:18:25.891932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:22.705987Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.13397","last_updated":"2025-05-19T17:34:32Z","snapshot_observed_at":"2026-08-20T05:17:37.987687Z","submitted_at":"2025-05-19T17:34:32Z","title":"Learning by solving differential equations","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:22.705987Z"},"links":{"citing_paper":"/paper/2505.13397"},"observation_digest":"sha256:851dfbf479e563c39b21711fd8e514fdb0ff59212488a3763ad97fddf7f2d462","observation_id":"8fb229f3-2c41-4d97-b68d-2b2d287b3ec5","resolution":{"observed_at":"2026-08-15T20:18:22.705987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:25.673616Z","title":"Optax: composable gradient transformation and optimisation, in jax!, 2020","venue":null,"work_id":"2745edc9-f3a0-4499-884e-fc0f026c4c60","year":2020},"citing_paper":{"arxiv_id":"2505.13397","last_updated":"2025-05-19T17:34:32Z","snapshot_observed_at":"2026-08-20T05:17:37.987687Z","submitted_at":"2025-05-19T17:34:32Z","title":"Learning by solving differential equations","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:22.716185Z"},"links":{"citing_paper":"/paper/2505.13397"},"observation_digest":"sha256:8a8f47169f8871e8b6f43a7e43ff281ca67d4187006c9392f0018e8c9dacf3c2","observation_id":"bb5452b8-6cf0-4fd8-84f0-df47d6ae182d","resolution":{"observed_at":"2026-08-15T20:18:25.837132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:25.657133Z","title":"Yang, Zachary Nado, Sourabh Medapati, Philipp Hennig, Michael Rabbat, and George E","venue":null,"work_id":"5b279155-26ef-4835-a717-cfa916fbbfc4","year":2025},"citing_paper":{"arxiv_id":"2505.13397","last_updated":"2025-05-19T17:34:32Z","snapshot_observed_at":"2026-08-20T05:17:37.987687Z","submitted_at":"2025-05-19T17:34:32Z","title":"Learning by solving differential equations","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:22.722002Z"},"links":{"citing_paper":"/paper/2505.13397"},"observation_digest":"sha256:1d07debf4df9f1cc5811112c236f628f3e05943e4cbd04ae5f7482f955b5d7ba","observation_id":"6ca52cf0-208f-4658-a2a5-81b9e43458cf","resolution":{"observed_at":"2026-08-15T20:18:25.662218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:22.728100Z","title":"Kingma and Jimmy Ba","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.13397","last_updated":"2025-05-19T17:34:32Z","snapshot_observed_at":"2026-08-20T05:17:37.987687Z","submitted_at":"2025-05-19T17:34:32Z","title":"Learning by solving differential equations","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:22.728100Z"},"links":{"citing_paper":"/paper/2505.13397"},"observation_digest":"sha256:0384b669866cca00181d53bbd0df614209ab12200ea4ca96751c896a9f2af753","observation_id":"ccae3fc9-fd20-4f4a-b14d-fe7a295c9eb2","resolution":{"observed_at":"2026-08-15T20:18:22.728100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:25.518245Z","title":"Continuous time analysis of momentum methods","venue":null,"work_id":"17bc2694-21c8-4402-a6fd-4fa210d597b9","year":2021},"citing_paper":{"arxiv_id":"2505.13397","last_updated":"2025-05-19T17:34:32Z","snapshot_observed_at":"2026-08-20T05:17:37.987687Z","submitted_at":"2025-05-19T17:34:32Z","title":"Learning by solving differential equations","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:22.732826Z"},"links":{"citing_paper":"/paper/2505.13397"},"observation_digest":"sha256:7a93f2c424e512fd36dfaf23c0a4e1de596f1500f268da0adedcb80e39abfa7b","observation_id":"7710a172-794c-456c-95c1-405b61a7971a","resolution":{"observed_at":"2026-08-15T20:18:25.595776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:25.497027Z","title":"Learning multiple layers of features from tiny images","venue":null,"work_id":"ac915ec8-9bab-446c-ba49-62dcd320fd72","year":2009},"citing_paper":{"arxiv_id":"2505.13397","last_updated":"2025-05-19T17:34:32Z","snapshot_observed_at":"2026-08-20T05:17:37.987687Z","submitted_at":"2025-05-19T17:34:32Z","title":"Learning by solving differential equations","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:22.738060Z"},"links":{"citing_paper":"/paper/2505.13397"},"observation_digest":"sha256:4579471af00f12b399460e4ccbf0309e42a7b809c2b3105649c9d4770718b56b","observation_id":"f51f446d-5990-429f-92e2-df3c769212fd","resolution":{"observed_at":"2026-08-15T20:18:25.504048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:25.353494Z","title":null,"venue":null,"work_id":"c7ce8c2f-a88c-4ad1-a7e1-f95b2d4afa94","year":2012},"citing_paper":{"arxiv_id":"2505.13397","last_updated":"2025-05-19T17:34:32Z","snapshot_observed_at":"2026-08-20T05:17:37.987687Z","submitted_at":"2025-05-19T17:34:32Z","title":"Learning by solving differential equations","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:22.742569Z"},"links":{"citing_paper":"/paper/2505.13397"},"observation_digest":"sha256:ddc51d894e36fa78648489da3c092766212e82aaebd6d483fe2e6a081cfc9730","observation_id":"d2300d01-58d7-4969-b0f9-0a08aaf9907e","resolution":{"observed_at":"2026-08-15T20:18:25.428099Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:25.336139Z","title":"Visualizing the loss landscape of neural nets","venue":null,"work_id":"1c124aee-de0c-48df-99de-14cb86352834","year":2018},"citing_paper":{"arxiv_id":"2505.13397","last_updated":"2025-05-19T17:34:32Z","snapshot_observed_at":"2026-08-20T05:17:37.987687Z","submitted_at":"2025-05-19T17:34:32Z","title":"Learning by solving differential equations","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:22.747530Z"},"links":{"citing_paper":"/paper/2505.13397"},"observation_digest":"sha256:379f65c4ca7ab6dfa80da0ec3e0f7b6be2f3e05056a43559087ad75877244b27","observation_id":"6d440c03-489e-4881-87ce-0da4730b3a1e","resolution":{"observed_at":"2026-08-15T20:18:25.341088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01767","last_updated":"2023-03-03T08:17:47Z","snapshot_observed_at":"2026-08-21T01:17:35.237460Z","submitted_at":"2023-03-03T08:17:47Z","title":"Implicit Stochastic Gradient Descent for Training Physics-informed Neural Networks","version":1},"cited_work":{"arxiv_id":"2303.01767","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.01767","snapshot_observed_at":"2026-08-15T20:18:23.429532Z","title":"Implicit Stochastic Gradient Descent for Training Physics-informed Neural Networks","venue":"cs.LG","work_id":"b9cf0ee9-4134-400e-8ed9-be8dd65f4313","year":2023},"citing_paper":{"arxiv_id":"2505.13397","last_updated":"2025-05-19T17:34:32Z","snapshot_observed_at":"2026-08-20T05:17:37.987687Z","submitted_at":"2025-05-19T17:34:32Z","title":"Learning by solving differential equations","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:22.753246Z"},"links":{"cited_paper":"/paper/2303.01767","citing_paper":"/paper/2505.13397"},"observation_digest":"sha256:192ec50af799ec14098c2338074fe8200563732e5a215e7d207e760a24da69ea","observation_id":"a080bbe2-1ff5-411b-b18c-48fc7dc8612d","resolution":{"observed_at":"2026-08-15T20:18:23.434886Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:25.257650Z","title":"Understanding the difficulty of training transformers","venue":null,"work_id":"9440c26b-dddb-4f63-962e-e10866ed65ed","year":2020},"citing_paper":{"arxiv_id":"2505.13397","last_updated":"2025-05-19T17:34:32Z","snapshot_observed_at":"2026-08-20T05:17:37.987687Z","submitted_at":"2025-05-19T17:34:32Z","title":"Learning by solving differential equations","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:22.758099Z"},"links":{"citing_paper":"/paper/2505.13397"},"observation_digest":"sha256:55c9589c678ba8e2265e5cbe539e0312c9b2ed277798cebf25ce39247762cc7c","observation_id":"21f9ccff-3735-4c1f-aaf9-e0f38d913326","resolution":{"observed_at":"2026-08-15T20:18:25.324462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-15T20:18:22.763757Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.13397","last_updated":"2025-05-19T17:34:32Z","snapshot_observed_at":"2026-08-20T05:17:37.987687Z","submitted_at":"2025-05-19T17:34:32Z","title":"Learning by solving differential equations","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:22.763757Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2505.13397"},"observation_digest":"sha256:42af43540d44bf67318f4f364a6220fbd41c6f5f0e46c860a782251e85340d8b","observation_id":"60c78eab-7265-494d-bad3-c9a333464496","resolution":{"observed_at":"2026-08-15T20:18:22.763757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:22.769025Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.13397","last_updated":"2025-05-19T17:34:32Z","snapshot_observed_at":"2026-08-20T05:17:37.987687Z","submitted_at":"2025-05-19T17:34:32Z","title":"Learning by solving differential equations","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:22.769025Z"},"links":{"citing_paper":"/paper/2505.13397"},"observation_digest":"sha256:b0141877bb3a65824984bcb35824717659ad2a9c145604b52c33039a135b0c12","observation_id":"1a5dcf76-a5f6-41d3-8184-2bc2e92a9d50","resolution":{"observed_at":"2026-08-15T20:18:22.769025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:25.126262Z","title":"Aggregated momentum: Stability through passive damping","venue":null,"work_id":"06aa3318-5206-4095-91d8-84dfcb9b0931","year":2019},"citing_paper":{"arxiv_id":"2505.13397","last_updated":"2025-05-19T17:34:32Z","snapshot_observed_at":"2026-08-20T05:17:37.987687Z","submitted_at":"2025-05-19T17:34:32Z","title":"Learning by solving differential equations","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:22.773979Z"},"links":{"citing_paper":"/paper/2505.13397"},"observation_digest":"sha256:b48cb6aee252b6846acf962ec1fbe61219245f2c308613f4d8d0ba72197e0240","observation_id":"0fe631f6-533f-4922-91aa-518e67826b17","resolution":{"observed_at":"2026-08-15T20:18:25.130972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:25.071662Z","title":"Optimizing neural networks with kronecker-factored approx- imate curvature","venue":null,"work_id":"835014ea-620c-4989-b7cd-793857053c82","year":2015},"citing_paper":{"arxiv_id":"2505.13397","last_updated":"2025-05-19T17:34:32Z","snapshot_observed_at":"2026-08-20T05:17:37.987687Z","submitted_at":"2025-05-19T17:34:32Z","title":"Learning by solving differential equations","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:22.779905Z"},"links":{"citing_paper":"/paper/2505.13397"},"observation_digest":"sha256:57e93eb5a530a4197da80ae97ae710f1419b06bc0e7fd8ff52ac0e2675f92cb1","observation_id":"e867cff2-9c37-4fc3-9944-ee29e09f1303","resolution":{"observed_at":"2026-08-15T20:18:25.091802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.06162","last_updated":"2018-12-14T20:49:09Z","snapshot_observed_at":"2026-08-20T11:22:33.275550Z","submitted_at":"2018-12-14T20:49:09Z","title":"An Empirical Model of Large-Batch Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.06162","snapshot_observed_at":"2026-08-15T20:18:22.784730Z","title":"An empirical model of large-batch training","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.13397","last_updated":"2025-05-19T17:34:32Z","snapshot_observed_at":"2026-08-20T05:17:37.987687Z","submitted_at":"2025-05-19T17:34:32Z","title":"Learning by solving differential equations","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:22.784730Z"},"links":{"cited_paper":"/paper/1812.06162","citing_paper":"/paper/2505.13397"},"observation_digest":"sha256:52d2ee6fd7019eebeb438c9962649c7bc295f54b9e72446829261cc607b888e4","observation_id":"73e701cf-276a-4022-85a7-d8bf1afe6abf","resolution":{"observed_at":"2026-08-15T20:18:22.784730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:25.047443Z","title":"A dynamical systems perspective on nesterov acceleration","venue":null,"work_id":"fcc344b2-9c18-467e-b34b-8ab011e0b416","year":2019},"citing_paper":{"arxiv_id":"2505.13397","last_updated":"2025-05-19T17:34:32Z","snapshot_observed_at":"2026-08-20T05:17:37.987687Z","submitted_at":"2025-05-19T17:34:32Z","title":"Learning by solving differential equations","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:22.790085Z"},"links":{"citing_paper":"/paper/2505.13397"},"observation_digest":"sha256:3d3dcd42a9b77d6ccd09d12ebea2c54efe788b938e05cee7829394df325af6f3","observation_id":"92dac4d5-cfa1-41a4-846f-7049edd2814e","resolution":{"observed_at":"2026-08-15T20:18:25.060613Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:24.919345Z","title":"Dynamics of sgd with stochastic polyak stepsizes: Truly adaptive variants and convergence to exact solution","venue":null,"work_id":"f8a6d89f-d6a5-47e2-989d-36d299ce898f","year":2022},"citing_paper":{"arxiv_id":"2505.13397","last_updated":"2025-05-19T17:34:32Z","snapshot_observed_at":"2026-08-20T05:17:37.987687Z","submitted_at":"2025-05-19T17:34:32Z","title":"Learning by solving differential equations","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:22.795738Z"},"links":{"citing_paper":"/paper/2505.13397"},"observation_digest":"sha256:58717774b0e3960082e9465dfb8d8f7ab832738be62782a80ce9a5fa4378e59f","observation_id":"69e15b79-db64-494c-aced-63dec3dd6178","resolution":{"observed_at":"2026-08-15T20:18:25.013224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04358","last_updated":"2024-07-05T08:53:06Z","snapshot_observed_at":"2026-08-16T13:36:52.207136Z","submitted_at":"2024-07-05T08:53:06Z","title":"An Adaptive Stochastic Gradient Method with Non-negative Gauss-Newton Stepsizes","version":1},"cited_work":{"arxiv_id":"2407.04358","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.04358","snapshot_observed_at":"2026-08-15T20:18:23.364311Z","title":"An Adaptive Stochastic Gradient Method with Non-negative Gauss-Newton Stepsizes","venue":"math.OC","work_id":"b69b1681-2edb-4203-9448-deb1820b1db2","year":2024},"citing_paper":{"arxiv_id":"2505.13397","last_updated":"2025-05-19T17:34:32Z","snapshot_observed_at":"2026-08-20T05:17:37.987687Z","submitted_at":"2025-05-19T17:34:32Z","title":"Learning by solving differential equations","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:22.801326Z"},"links":{"cited_paper":"/paper/2407.04358","citing_paper":"/paper/2505.13397"},"observation_digest":"sha256:c009f52acefb2791894c975795a9469641422e81d6dcc02a674d656abfff8b32","observation_id":"32608d8a-48ce-452f-8f8e-de7ac191902b","resolution":{"observed_at":"2026-08-15T20:18:23.371801Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:22.806754Z","title":null,"venue":null,"work_id":null,"year":1964},"citing_paper":{"arxiv_id":"2505.13397","last_updated":"2025-05-19T17:34:32Z","snapshot_observed_at":"2026-08-20T05:17:37.987687Z","submitted_at":"2025-05-19T17:34:32Z","title":"Learning by solving differential equations","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:22.806754Z"},"links":{"citing_paper":"/paper/2505.13397"},"observation_digest":"sha256:1eea66af86b9a151f2b08d8ead404878ec3d41d140d2049151a655eb58bbafdd","observation_id":"65e8e5e7-7ab2-4c42-a946-f9f4a720007a","resolution":{"observed_at":"2026-08-15T20:18:22.806754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04719","last_updated":"2023-07-10T17:31:39Z","snapshot_observed_at":"2026-08-16T15:17:23.436496Z","submitted_at":"2023-07-10T17:31:39Z","title":"On the curvature of the loss landscape","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04719","snapshot_observed_at":"2026-08-15T20:18:22.818487Z","title":"On the curvature of the loss landscape","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13397","last_updated":"2025-05-19T17:34:32Z","snapshot_observed_at":"2026-08-20T05:17:37.987687Z","submitted_at":"2025-05-19T17:34:32Z","title":"Learning by solving differential equations","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:22.818487Z"},"links":{"cited_paper":"/paper/2307.04719","citing_paper":"/paper/2505.13397"},"observation_digest":"sha256:568b3b7052b78af87dc80f60ddd165f738fb11905fc7f7205e8d20eb1190afcb","observation_id":"a039634c-082a-46fc-91bc-a3b3e2466a4d","resolution":{"observed_at":"2026-08-15T20:18:22.818487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:24.755847Z","title":"Training generative adversarial networks by solving ordinary differential equations","venue":null,"work_id":"d50f3c9e-33fa-458a-8e70-edf5cbaa2262","year":2020},"citing_paper":{"arxiv_id":"2505.13397","last_updated":"2025-05-19T17:34:32Z","snapshot_observed_at":"2026-08-20T05:17:37.987687Z","submitted_at":"2025-05-19T17:34:32Z","title":"Learning by solving differential equations","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:22.825290Z"},"links":{"citing_paper":"/paper/2505.13397"},"observation_digest":"sha256:aed407f51a593a4b462c8ed97c7f3a066a40464402921beb36ee84c4e83e573c","observation_id":"208203fc-063a-4209-b90f-bd5f8aedeb41","resolution":{"observed_at":"2026-08-15T20:18:24.805055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:24.729292Z","title":null,"venue":null,"work_id":"cb0aba68-0fab-40f3-8703-48f0681b2ff8","year":2021},"citing_paper":{"arxiv_id":"2505.13397","last_updated":"2025-05-19T17:34:32Z","snapshot_observed_at":"2026-08-20T05:17:37.987687Z","submitted_at":"2025-05-19T17:34:32Z","title":"Learning by solving differential equations","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:22.830636Z"},"links":{"citing_paper":"/paper/2505.13397"},"observation_digest":"sha256:c9fdc6d010e898604d3e6d6565a61503f1632435316d40149c708a426d5a9c0b","observation_id":"4793e944-c548-4cd8-b2a9-874e8e2f6435","resolution":{"observed_at":"2026-08-15T20:18:24.735471Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:24.627810Z","title":"On a continuous time model of gradient descent dynamics and instability in deep learning","venue":null,"work_id":"249409ac-0b2c-43ab-899e-da516e92ca80","year":2023},"citing_paper":{"arxiv_id":"2505.13397","last_updated":"2025-05-19T17:34:32Z","snapshot_observed_at":"2026-08-20T05:17:37.987687Z","submitted_at":"2025-05-19T17:34:32Z","title":"Learning by solving differential equations","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:22.838255Z"},"links":{"citing_paper":"/paper/2505.13397"},"observation_digest":"sha256:8ac1db4e18355778905a47b8be102a7325b6a5fcaef309f482784af024b1ff13","observation_id":"dce8106a-5a2a-4131-a0ed-16311e8d0802","resolution":{"observed_at":"2026-08-15T20:18:24.714675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:22.850188Z","title":"Rumelhart, Geoffrey E","venue":null,"work_id":null,"year":1986},"citing_paper":{"arxiv_id":"2505.13397","last_updated":"2025-05-19T17:34:32Z","snapshot_observed_at":"2026-08-20T05:17:37.987687Z","submitted_at":"2025-05-19T17:34:32Z","title":"Learning by solving differential equations","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:22.850188Z"},"links":{"citing_paper":"/paper/2505.13397"},"observation_digest":"sha256:06cde04fafe8f4218b3b9044a7e468ccf26f2acbe47ec5111c86794affa4004c","observation_id":"bcab1e9b-fb10-4a76-8bd8-08460345daaf","resolution":{"observed_at":"2026-08-15T20:18:22.850188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:24.579835Z","title":"Acceleration via symplectic discretiza- tion of high-resolution differential equations","venue":null,"work_id":"be320fb5-8a6b-4c6a-be54-e0d52f7f40d8","year":2019},"citing_paper":{"arxiv_id":"2505.13397","last_updated":"2025-05-19T17:34:32Z","snapshot_observed_at":"2026-08-20T05:17:37.987687Z","submitted_at":"2025-05-19T17:34:32Z","title":"Learning by solving differential equations","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:22.858319Z"},"links":{"citing_paper":"/paper/2505.13397"},"observation_digest":"sha256:0166837fe6669b9fb351988a2db3feeae9aaad9d2cd86d58eb767adcc59597ad","observation_id":"7da91aca-d7b6-4b8d-a42c-32dc4107e708","resolution":{"observed_at":"2026-08-15T20:18:24.588064Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06497","last_updated":"2023-09-12T18:11:10Z","snapshot_observed_at":"2026-08-19T05:42:54.006296Z","submitted_at":"2023-09-12T18:11:10Z","title":"A Distributed Data-Parallel PyTorch Implementation of the Distributed Shampoo Optimizer for Training Neural Networks At-Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.06497","snapshot_observed_at":"2026-08-15T20:18:22.869640Z","title":"A distributed data-parallel pytorch implementation of the distributed shampoo optimizer for training neural networks at-scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13397","last_updated":"2025-05-19T17:34:32Z","snapshot_observed_at":"2026-08-20T05:17:37.987687Z","submitted_at":"2025-05-19T17:34:32Z","title":"Learning by solving differential equations","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:22.869640Z"},"links":{"cited_paper":"/paper/2309.06497","citing_paper":"/paper/2505.13397"},"observation_digest":"sha256:d0339110be758c1d364911ff0fd7162705d5911eeedc439e45c4d34d659b74cb","observation_id":"774ec820-ea2a-42c4-9cb4-74490d2ff5f8","resolution":{"observed_at":"2026-08-15T20:18:22.869640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:24.390308Z","title":"Improving optimizers by runge-kutta method: A case study of sgd and adam","venue":null,"work_id":"fabc3a20-861c-4cc5-94c8-e17cf5127c03","year":2024},"citing_paper":{"arxiv_id":"2505.13397","last_updated":"2025-05-19T17:34:32Z","snapshot_observed_at":"2026-08-20T05:17:37.987687Z","submitted_at":"2025-05-19T17:34:32Z","title":"Learning by solving differential equations","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:22.875960Z"},"links":{"citing_paper":"/paper/2505.13397"},"observation_digest":"sha256:0f5d54515d378a9210ac0c33fd6ae0a8765adb3cc8dd184d0c7bd40eee827c5a","observation_id":"5868b212-3cfe-4715-bf46-8d654632addb","resolution":{"observed_at":"2026-08-15T20:18:24.547762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:24.342117Z","title":"A differential equation for modeling nes- terov’s accelerated gradient method: theory and insights.Journal of Machine Learning Research, 17:1–43, 2016","venue":null,"work_id":"172dbd62-d928-4d1a-b731-50e1fd300ec6","year":2016},"citing_paper":{"arxiv_id":"2505.13397","last_updated":"2025-05-19T17:34:32Z","snapshot_observed_at":"2026-08-20T05:17:37.987687Z","submitted_at":"2025-05-19T17:34:32Z","title":"Learning by solving differential equations","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:22.880941Z"},"links":{"citing_paper":"/paper/2505.13397"},"observation_digest":"sha256:8857483ca8633d7ac12ff562c3390063b07883194b228cb3e83143894214118f","observation_id":"8584df0f-d513-4458-9908-f29a12901bdb","resolution":{"observed_at":"2026-08-15T20:18:24.347360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:24.325996Z","title":"On the importance of initial- ization and momentum in deep learning","venue":null,"work_id":"f311291c-9594-44f6-8353-678e826a3a71","year":2013},"citing_paper":{"arxiv_id":"2505.13397","last_updated":"2025-05-19T17:34:32Z","snapshot_observed_at":"2026-08-20T05:17:37.987687Z","submitted_at":"2025-05-19T17:34:32Z","title":"Learning by solving differential equations","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:22.885742Z"},"links":{"citing_paper":"/paper/2505.13397"},"observation_digest":"sha256:f7c27d82dc89f14ed0284dc01e0015ccbd0f0bf3801156f09d245dd6a7488a6e","observation_id":"430f1dd9-6eb2-48c8-bb4a-8fecc4cf9925","resolution":{"observed_at":"2026-08-15T20:18:24.330830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:24.276973Z","title":"Spike no more: Stabilizing the pre-training of large language models, 2025","venue":null,"work_id":"b5bdfe08-97fa-4ee7-ac17-a57ded1b77e8","year":2025},"citing_paper":{"arxiv_id":"2505.13397","last_updated":"2025-05-19T17:34:32Z","snapshot_observed_at":"2026-08-20T05:17:37.987687Z","submitted_at":"2025-05-19T17:34:32Z","title":"Learning by solving differential equations","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:22.932623Z"},"links":{"citing_paper":"/paper/2505.13397"},"observation_digest":"sha256:9b9ef3b530ff45037b6a707d3bd331ffa6c8ed6758609b19425dbe22d0c40b81","observation_id":"82bcacb4-e48a-491a-9d34-f2b1c28d41ef","resolution":{"observed_at":"2026-08-15T20:18:24.313927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:24.107397Z","title":"Rmsprop: Divide the gradient by a running average of its recent magnitude","venue":null,"work_id":"a5223466-4f8a-4d87-b466-dd5bd1fc18fe","year":2012},"citing_paper":{"arxiv_id":"2505.13397","last_updated":"2025-05-19T17:34:32Z","snapshot_observed_at":"2026-08-20T05:17:37.987687Z","submitted_at":"2025-05-19T17:34:32Z","title":"Learning by solving differential equations","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:23.013615Z"},"links":{"citing_paper":"/paper/2505.13397"},"observation_digest":"sha256:7d65b70a4ea44368ceddc3fe07e59bfdb3acb8b6bfdc09b20b4d996c0fc388f4","observation_id":"d5bae36d-cbaf-45b7-b1ae-1ea8afb4afe0","resolution":{"observed_at":"2026-08-15T20:18:24.164832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:24.068667Z","title":"Understanding and mitigating gradient flow pathologies in physics-informed neural networks","venue":null,"work_id":"778ac3a6-7f24-44b4-a071-1ad822ae00f8","year":2021},"citing_paper":{"arxiv_id":"2505.13397","last_updated":"2025-05-19T17:34:32Z","snapshot_observed_at":"2026-08-20T05:17:37.987687Z","submitted_at":"2025-05-19T17:34:32Z","title":"Learning by solving differential equations","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:23.086544Z"},"links":{"citing_paper":"/paper/2505.13397"},"observation_digest":"sha256:c74f52c3ee27f6635bff96ee9adb9cd129b109027258a638619f66f4e99bc1e2","observation_id":"d92ae326-9fa7-4c84-af77-c998b112ff03","resolution":{"observed_at":"2026-08-15T20:18:24.084746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:23.920753Z","title":"Small-scale proxies for large-scale transformer training instabilities","venue":null,"work_id":"70c378f3-281e-45ec-8f7f-a74a4ab1e6d4","year":2024},"citing_paper":{"arxiv_id":"2505.13397","last_updated":"2025-05-19T17:34:32Z","snapshot_observed_at":"2026-08-20T05:17:37.987687Z","submitted_at":"2025-05-19T17:34:32Z","title":"Learning by solving differential equations","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:23.122833Z"},"links":{"citing_paper":"/paper/2505.13397"},"observation_digest":"sha256:25ee13aa00075377925179990a5841143c21d1502f802a09917f4227881ba88c","observation_id":"88d6b176-d1f3-4c4d-bbe4-029cefcfebe0","resolution":{"observed_at":"2026-08-15T20:18:24.014201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10537","last_updated":"2025-07-15T06:22:08Z","snapshot_observed_at":"2026-08-16T12:50:18.277375Z","submitted_at":"2025-03-13T16:51:59Z","title":"Structured Preconditioners in Adaptive Optimization: A Unified Analysis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10537","snapshot_observed_at":"2026-08-15T20:18:23.127819Z","title":"Structured pre- conditioners in adaptive optimization: A unified analysis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13397","last_updated":"2025-05-19T17:34:32Z","snapshot_observed_at":"2026-08-20T05:17:37.987687Z","submitted_at":"2025-05-19T17:34:32Z","title":"Learning by solving differential equations","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:23.127819Z"},"links":{"cited_paper":"/paper/2503.10537","citing_paper":"/paper/2505.13397"},"observation_digest":"sha256:e0ceec95823d8bba7e9f707696e9714f107eeec637ac571948eb33ce49f93ad3","observation_id":"8a680dac-4912-4dee-b999-c4a336e1a62a","resolution":{"observed_at":"2026-08-15T20:18:23.127819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1605.07146","last_updated":"2017-06-14T06:06:48Z","snapshot_observed_at":"2026-08-16T07:54:28.918946Z","submitted_at":"2016-05-23T19:27:13Z","title":"Wide Residual Networks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1605.07146","snapshot_observed_at":"2026-08-15T20:18:23.132324Z","title":"Wide residual networks","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.13397","last_updated":"2025-05-19T17:34:32Z","snapshot_observed_at":"2026-08-20T05:17:37.987687Z","submitted_at":"2025-05-19T17:34:32Z","title":"Learning by solving differential equations","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:23.132324Z"},"links":{"cited_paper":"/paper/1605.07146","citing_paper":"/paper/2505.13397"},"observation_digest":"sha256:3ce7b679b809a2d7095a339317058731dd2075b6a24b822e9ccb6300f45af71a","observation_id":"17d3b554-adc8-4394-9c8f-a9a4c4c2344c","resolution":{"observed_at":"2026-08-15T20:18:23.132324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1212.5701","last_updated":"2012-12-22T15:46:49Z","snapshot_observed_at":"2026-08-19T05:19:50.480481Z","submitted_at":"2012-12-22T15:46:49Z","title":"ADADELTA: An Adaptive Learning Rate Method","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.5701","snapshot_observed_at":"2026-08-15T20:18:23.136809Z","title":null,"venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2505.13397","last_updated":"2025-05-19T17:34:32Z","snapshot_observed_at":"2026-08-20T05:17:37.987687Z","submitted_at":"2025-05-19T17:34:32Z","title":"Learning by solving differential equations","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:23.136809Z"},"links":{"cited_paper":"/paper/1212.5701","citing_paper":"/paper/2505.13397"},"observation_digest":"sha256:983e565a1fa89c969d6dc20e7b79ed9be9ab38c602a8439c35fcd0b8ea5adb2e","observation_id":"193ccf0a-bb3b-40a9-bb77-6e202b44a1de","resolution":{"observed_at":"2026-08-15T20:18:23.136809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:23.830997Z","title":"Direct runge-kutta discretiza- tion achieves acceleration","venue":null,"work_id":"4105f4f0-91fb-486a-9738-7622da6d6dfc","year":2018},"citing_paper":{"arxiv_id":"2505.13397","last_updated":"2025-05-19T17:34:32Z","snapshot_observed_at":"2026-08-20T05:17:37.987687Z","submitted_at":"2025-05-19T17:34:32Z","title":"Learning by solving differential equations","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:23.142424Z"},"links":{"citing_paper":"/paper/2505.13397"},"observation_digest":"sha256:87ada61c785183d5e3b8540cdd032850eb16dc946ceb88032a48f0fd34525057","observation_id":"80ae47f4-847e-41f2-a022-00f993663354","resolution":{"observed_at":"2026-08-15T20:18:23.846012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:23.711725Z","title":"Lookahead optimizer: k steps forward, 1 step back","venue":null,"work_id":"ef0aa848-859b-409c-af08-cf17dd4ec306","year":2019},"citing_paper":{"arxiv_id":"2505.13397","last_updated":"2025-05-19T17:34:32Z","snapshot_observed_at":"2026-08-20T05:17:37.987687Z","submitted_at":"2025-05-19T17:34:32Z","title":"Learning by solving differential equations","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:23.147237Z"},"links":{"citing_paper":"/paper/2505.13397"},"observation_digest":"sha256:ae9e339db2e8ed278174434ab2c0debaa968c5ecc4419d16b91347938fb9a67e","observation_id":"3046b463-b1e2-4d26-a58f-ed605b9dc44f","resolution":{"observed_at":"2026-08-15T20:18:23.732983Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:23.695913Z","title":"In the main paper, we benchmarked RK4, which is the classical 4th order method, and it has an error of sizeO(h5)","venue":null,"work_id":"723f8e4d-47f1-4651-8a88-c3c5960eb8fb","year":null},"citing_paper":{"arxiv_id":"2505.13397","last_updated":"2025-05-19T17:34:32Z","snapshot_observed_at":"2026-08-20T05:17:37.987687Z","submitted_at":"2025-05-19T17:34:32Z","title":"Learning by solving differential equations","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:23.151672Z"},"links":{"citing_paper":"/paper/2505.13397"},"observation_digest":"sha256:b6d764561986887facf19e67b6ce796eacf8a020053fb13901a3735a0cb0c767","observation_id":"6125e1de-952e-45f7-9c37-fa49cc82570c","resolution":{"observed_at":"2026-08-15T20:18:23.700864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:23.609861Z","title":"Therefore, the correct way to write the gradient flow ODE is with the help of an underlying metric tensorG(θ) on the parameter space given by ˙θ(t) = G(θ(t))−1∇L(θ(t))","venue":null,"work_id":"528c2513-14bd-4b0b-a543-2abc7de63b86","year":null},"citing_paper":{"arxiv_id":"2505.13397","last_updated":"2025-05-19T17:34:32Z","snapshot_observed_at":"2026-08-20T05:17:37.987687Z","submitted_at":"2025-05-19T17:34:32Z","title":"Learning by solving differential equations","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:23.157124Z"},"links":{"citing_paper":"/paper/2505.13397"},"observation_digest":"sha256:715e3c4ec3fab4177a35327e78a3167f42df5f4525d48a281a93544dd6d49874","observation_id":"9145da29-6785-4019-a8f4-76a610a7d4b7","resolution":{"observed_at":"2026-08-15T20:18:23.660964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.13397","last_updated":"2025-05-19T17:34:32Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-20T05:17:37.987687Z","submitted_at":"2025-05-19T17:34:32Z","title":"Learning by solving differential equations"},"reference_resolution":{"displayed":68,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":3,"verified_fuzzy":39},"total_outbound_references":68},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 68 of 68 outbound references and 1 inbound Pith citation observation for arXiv:2505.13397."}