{"as_of":"2026-08-23T21:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:22a09f4edb987279c16f6452db9c20037b67aa4508dcb3986eaeeb73b973797d","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T14:10:55.394691Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.15646/citation-record","integrity":"/paper/2501.15646/integrity","json":"/paper/2501.15646/citation-record.json","paper":"/paper/2501.15646"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1603.04467","last_updated":"2016-03-16T16:57:12Z","snapshot_observed_at":"2026-08-14T22:06:04.800050Z","submitted_at":"2016-03-14T20:50:20Z","title":"TensorFlow: Large-Scale Machine Learning on Heterogeneous Distributed Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1603.04467","snapshot_observed_at":"2026-08-10T14:10:55.075137Z","title":"S., Davis, A., Dean, J., Devin, M., Ghemawat, S., Goodfell ow, I","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-14T12:46:39.320894Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.075137Z"},"links":{"cited_paper":"/paper/1603.04467","citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:6e99caa75da77e7c95126ba48ffef8359cd031a9e741cd3878ff8b4a81ff27e3","observation_id":"c4197251-d85e-4647-b255-13d763e15d4b","resolution":{"observed_at":"2026-08-10T14:10:55.075137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:10:55.079600Z","title":"Learning Theory from First Principles","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-14T12:46:39.320894Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.079600Z"},"links":{"citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:b60fd07011348b8f7a98d54d3eb4e9c9b541f70b8b4dc916d8f78dfc1033ab60","observation_id":"2cd1384d-7819-49a9-8206-f4fb72d35904","resolution":{"observed_at":"2026-08-10T14:10:55.079600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:10:56.232120Z","title":"J., and Zhang, Y","venue":null,"work_id":"bab810a2-defa-4bdc-b782-64948fdae40d","year":2024},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-14T12:46:39.320894Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.083893Z"},"links":{"citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:528967e4c5e6f84d3beb005dcd3c364ae8ce39ddde1c34363df2734207aa59ad","observation_id":"07e570e5-81b0-4bba-81a4-327baf331d8f","resolution":{"observed_at":"2026-08-10T14:10:56.236616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.01730","last_updated":"2023-02-06T16:34:38Z","snapshot_observed_at":"2026-08-16T16:56:05.033021Z","submitted_at":"2022-06-01T08:43:35Z","title":"On the complexity of nonsmooth automatic differentiation","version":2},"cited_work":{"arxiv_id":"2206.01730","doi":null,"metadata_source":"pith","pith_arxiv_id":"2206.01730","snapshot_observed_at":"2026-08-10T14:10:55.893289Z","title":"On the complexity of nonsmooth automatic differentiation","venue":"math.NA","work_id":"c7d33202-f829-481f-b613-0bcb0ffbc019","year":2022},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-14T12:46:39.320894Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.087847Z"},"links":{"cited_paper":"/paper/2206.01730","citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:43591559a6986b357d83901cd6e1d3a44f986dd2c3af541b140dc4fad1f1e5f3","observation_id":"0bd24e4a-9259-4986-82f1-e79ec3902d01","resolution":{"observed_at":"2026-08-10T14:10:55.897472Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:10:56.219952Z","title":"The /suppress lojasiewicz inequality for nonsmooth subanalytic functions with applications to subgradient dynamical systems","venue":null,"work_id":"d98d0d4e-d27f-4549-ae94-c3ca18ba2570","year":2006},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-14T12:46:39.320894Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.092333Z"},"links":{"citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:fe18b8d40a1d79612024ce5612ebdae13e1790c2e2d7f44a78b4f9b651390280","observation_id":"386b18a8-919b-4bbd-98d3-137ca1f53ccf","resolution":{"observed_at":"2026-08-10T14:10:56.224193Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.02080","last_updated":"2020-10-29T15:11:30Z","snapshot_observed_at":"2026-08-14T12:47:28.175561Z","submitted_at":"2020-06-03T07:33:29Z","title":"A mathematical model for automatic differentiation in machine learning","version":2},"cited_work":{"arxiv_id":"2006.02080","doi":null,"metadata_source":"pith","pith_arxiv_id":"2006.02080","snapshot_observed_at":"2026-08-10T14:10:55.877110Z","title":"A mathematical model for automatic differentiation in machine learning","venue":"cs.LG","work_id":"fc7abc90-6f23-4f8f-8c80-9b72cbe6cc0b","year":2020},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-14T12:46:39.320894Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.096392Z"},"links":{"cited_paper":"/paper/2006.02080","citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:d08bcc628b0338cd0aebeb4bf92621628ea7f80ff38c17064fc960dcbadd66ef","observation_id":"38756945-2ca7-4bfe-a275-52d5d8f00612","resolution":{"observed_at":"2026-08-10T14:10:55.881349Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:10:56.208105Z","title":"Conservative set valued ﬁelds, automatic diﬀerentiation, stochastic gradient methods and deep learning","venue":null,"work_id":"ced43518-ce7b-4dab-957c-83747411666c","year":2021},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-14T12:46:39.320894Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.101003Z"},"links":{"citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:9f6e99c1308c70fad2566de7775f57811b0c4d713004081494e352eb0ff9f86c","observation_id":"b8e90943-66f2-42a2-9cd8-2fee265ddf93","resolution":{"observed_at":"2026-08-10T14:10:56.212131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:10:56.195213Z","title":"Diﬀerentiating nonsmooth solutions to parametric monotone inclusion problems","venue":null,"work_id":"6ca1295c-be0c-4cf7-9d75-8c9015d6bf2b","year":2024},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-14T12:46:39.320894Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.104409Z"},"links":{"citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:eb17053d75cdee71eb5cf5e7181f0b2b51fdee62c75428352658c7943a22e39c","observation_id":"eec2a3c5-b9d9-47db-bffd-d581aebd50e8","resolution":{"observed_at":"2026-08-10T14:10:56.199136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.00457","last_updated":"2022-05-31T07:58:37Z","snapshot_observed_at":"2026-08-18T21:01:37.813746Z","submitted_at":"2022-05-31T07:58:37Z","title":"Automatic differentiation of nonsmooth iterative algorithms","version":1},"cited_work":{"arxiv_id":"2206.00457","doi":null,"metadata_source":"pith","pith_arxiv_id":"2206.00457","snapshot_observed_at":"2026-08-10T14:10:55.861080Z","title":"Automatic differentiation of nonsmooth iterative algorithms","venue":"math.OC","work_id":"b3654713-9502-4b54-9d46-091194069c8c","year":2022},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-14T12:46:39.320894Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.108574Z"},"links":{"cited_paper":"/paper/2206.00457","citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:a13fd7dc63085cd347e3b1787ace957af66ca9f8e26062f33ff34fced0d19265","observation_id":"7de81cdc-eaaf-45fa-adcf-190e8cac1a6e","resolution":{"observed_at":"2026-08-10T14:10:55.865319Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:10:56.181590Z","title":"A proof of conver- gence for gradient descent in the training of artiﬁcial neur al networks for constant target functions","venue":null,"work_id":"077b8e63-48e0-4e0b-96f8-7a11a3d58da6","year":2022},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-14T12:46:39.320894Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.112707Z"},"links":{"citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:3230fbdb09b9f619550c9edb245920f0e6fc494a2aabf3435c2e725b270b1a11","observation_id":"981b5c36-5e7a-45cf-9ba0-d2ec49606f72","resolution":{"observed_at":"2026-08-10T14:10:56.186067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:10:56.169421Z","title":"Non-convergence of stochastic gradient descent in the training of deep neural networks","venue":null,"work_id":"a02e1ddb-2dfe-4a52-843e-826350bb1de9","year":2021},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-14T12:46:39.320894Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.116780Z"},"links":{"citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:0a64f79bec6d713910ec8aeefbfb93c9ba48b975aceba3dead75e159a65c762f","observation_id":"67f90682-0a80-4db7-96cc-8f883e6cd23d","resolution":{"observed_at":"2026-08-10T14:10:56.173592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:10:56.157762Z","title":"Landscape analysis for shallow neural networks: complete classiﬁcation of critical point s for aﬃne target functions","venue":null,"work_id":"f2deb8bb-e8a5-404a-a359-2387ac7c227e","year":2022},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-14T12:46:39.320894Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.121575Z"},"links":{"citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:6f2de5a493f6eb3e7c3917962f86f0988ada99d090dd46147364b0204490e2a1","observation_id":"96174e1b-66a5-43e1-9f10-caec25de07ed","resolution":{"observed_at":"2026-08-10T14:10:56.161634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:10:56.146156Z","title":"On the mathematical foundations of learning","venue":null,"work_id":"13da44e9-3c52-427d-b860-d3c9ead59c19","year":2002},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-14T12:46:39.320894Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.125374Z"},"links":{"citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:7439da60246cabdd122a240fa6b89dbdba151f35c3b3e9c8156650f35dfcde5a","observation_id":"298ebf6c-13f7-4d44-af12-ecf75480c4d6","resolution":{"observed_at":"2026-08-10T14:10:56.149980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:10:56.133283Z","title":"Conservative and semismooth derivatives are equiv- alent for semialgebraic maps","venue":null,"work_id":"f8013c03-e6c5-432f-959b-c1a642429079","year":2022},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-14T12:46:39.320894Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.128887Z"},"links":{"citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:3ec32eae037e6d4ab337dd870a258063789754e2b1440e9f2cfc289175b72017","observation_id":"c4d9f116-ace4-4096-9460-39d1965ca551","resolution":{"observed_at":"2026-08-10T14:10:56.137872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:10:56.120758Z","title":null,"venue":null,"work_id":"3fbd1c47-fe72-4d38-9b9f-a6800a83e53d","year":2020},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-14T12:46:39.320894Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.132991Z"},"links":{"citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:a6fe373765225bd5d9c85e4feb3bbbbe06c2efce1a30649cfd4131d287f97e63","observation_id":"4dbe2bae-0527-4de1-a815-73e8aa838dae","resolution":{"observed_at":"2026-08-10T14:10:56.125431Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08100","last_updated":"2024-07-11T00:10:35Z","snapshot_observed_at":"2026-08-16T13:35:15.470140Z","submitted_at":"2024-07-11T00:10:35Z","title":"Non-convergence of Adam and other adaptive stochastic gradient descent optimization methods for non-vanishing learning rates","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08100","snapshot_observed_at":"2026-08-10T14:10:55.137201Z","title":"Non-convergence of Adam and other adaptive stochastic gradient descent optimization methods for non-vanishing learning rates","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-14T12:46:39.320894Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.137201Z"},"links":{"cited_paper":"/paper/2407.08100","citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:b1507f117a62c970927e48461f56136f7e5a9f0efca343a102d72231728c1cce","observation_id":"f9aaa7f2-7500-4db6-b94c-683116f86386","resolution":{"observed_at":"2026-08-10T14:10:55.137201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.09385","last_updated":"2024-01-09T16:01:17Z","snapshot_observed_at":"2026-08-21T02:47:52.304951Z","submitted_at":"2021-02-16T12:42:25Z","title":"Convergence of stochastic gradient descent schemes for Lojasiewicz-landscapes","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.09385","snapshot_observed_at":"2026-08-10T14:10:55.140914Z","title":"Convergence of stochastic gradient descent schemes for Lojasiewicz-landscapes","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-14T12:46:39.320894Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.140914Z"},"links":{"cited_paper":"/paper/2102.09385","citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:93c5e7ad2040f83ae9d8d63e08a2cf17202748b0e9eee6b07f3aae2c93b68ef8","observation_id":"c4232203-5f03-46fa-aed2-d4310676e10d","resolution":{"observed_at":"2026-08-10T14:10:55.140914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08858","last_updated":"2023-10-13T04:59:44Z","snapshot_observed_at":"2026-08-16T14:52:28.063361Z","submitted_at":"2023-10-13T04:59:44Z","title":"Adam-family Methods with Decoupled Weight Decay in Deep Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08858","snapshot_observed_at":"2026-08-10T14:10:55.144839Z","title":"Adam-family Methods with Decoupled Weight Decay in Deep Learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-14T12:46:39.320894Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.144839Z"},"links":{"cited_paper":"/paper/2310.08858","citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:3f7a66480701bb658801df01b472cf739257eeff5b0cee9051e7108aa106b2f5","observation_id":"8a76bc57-5b4e-49be-acea-7ad9090d1fc4","resolution":{"observed_at":"2026-08-10T14:10:55.144839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.01413","last_updated":"2020-11-14T17:05:52Z","snapshot_observed_at":"2026-08-11T08:57:11.560069Z","submitted_at":"2019-11-04T18:56:58Z","title":"Sub-Optimal Local Minima Exist for Neural Networks with Almost All Non-Linear Activations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.01413","snapshot_observed_at":"2026-08-10T14:10:55.149307Z","title":"Sub-Optimal Local Minima Exist for Neural Networks with Almost All Non-Linear Activations","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-14T12:46:39.320894Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.149307Z"},"links":{"cited_paper":"/paper/1911.01413","citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:6b437db7e337030497b16dda7febb8ddc9b3d61a5fc819b810d9c5a0542b06f6","observation_id":"45dc87df-2ace-4e74-80f8-32e5a802df13","resolution":{"observed_at":"2026-08-10T14:10:55.149307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.10713","last_updated":"2020-12-07T23:36:20Z","snapshot_observed_at":"2026-08-12T11:27:30.709881Z","submitted_at":"2020-09-22T17:55:47Z","title":"Towards a Mathematical Understanding of Neural Network-Based Machine Learning: what we know and what we don't","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.10713","snapshot_observed_at":"2026-08-10T14:10:55.153180Z","title":"Towards a Mathematical Under- standing of Neural Network-Based Machine Learning: what we know and what we don’t","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-14T12:46:39.320894Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.153180Z"},"links":{"cited_paper":"/paper/2009.10713","citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:5af1c03590aad8f9bf81318748ad834991cccdaedb07115ef519e9beb9ad68b9","observation_id":"237b81ec-86ee-4ab1-a3c2-a32df0fd1f55","resolution":{"observed_at":"2026-08-10T14:10:55.153180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:10:56.108894Z","title":null,"venue":null,"work_id":"05dc41c1-134c-4269-9d85-7dc7e08993be","year":1998},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-14T12:46:39.320894Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.157102Z"},"links":{"citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:e06b9167753059673fe40b109af45b1bb77bff6cca366fddb86582d4cd6ec0d6","observation_id":"0b27e058-fa9f-4ea2-a1b0-eacf244f4589","resolution":{"observed_at":"2026-08-10T14:10:56.112630Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.15641","last_updated":"2022-11-28T18:49:09Z","snapshot_observed_at":"2026-08-19T08:08:13.097350Z","submitted_at":"2022-11-28T18:49:09Z","title":"Blow up phenomena for gradient descent optimization methods in the training of artificial neural networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.15641","snapshot_observed_at":"2026-08-10T14:10:55.160595Z","title":"Blow up phenomena for gradient descent optimization methods in the training of artiﬁcial neural networks","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-14T12:46:39.320894Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.160595Z"},"links":{"cited_paper":"/paper/2211.15641","citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:843dc14e98ccd4b477cd8510f27248c26375bd8afd0737799358d7bb366dd2b8","observation_id":"d3d9e9cc-cec9-4211-a353-d84650cddd89","resolution":{"observed_at":"2026-08-10T14:10:55.160595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.11235","last_updated":"2024-03-09T13:28:29Z","snapshot_observed_at":"2026-08-19T11:16:43.629164Z","submitted_at":"2023-01-26T17:18:36Z","title":"Handbook of Convergence Theorems for (Stochastic) Gradient Methods","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.11235","snapshot_observed_at":"2026-08-10T14:10:55.164695Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-14T12:46:39.320894Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.164695Z"},"links":{"cited_paper":"/paper/2301.11235","citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:32efa4f6f0a8df75e8a2278d39b582f040a96687b2a59e55986c44f284919269","observation_id":"01304cc6-e5b7-404b-a619-5801727b4eb9","resolution":{"observed_at":"2026-08-10T14:10:55.164695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.08399","last_updated":"2022-09-17T20:26:19Z","snapshot_observed_at":"2026-08-20T15:32:35.404576Z","submitted_at":"2022-09-17T20:26:19Z","title":"Approximation results for Gradient Descent trained Shallow Neural Networks in $1d$","version":1},"cited_work":{"arxiv_id":"2209.08399","doi":null,"metadata_source":"pith","pith_arxiv_id":"2209.08399","snapshot_observed_at":"2026-08-10T14:10:55.764603Z","title":"Approximation results for Gradient Descent trained Shallow Neural Networks in $1d$","venue":"cs.LG","work_id":"8136acc3-0801-44f1-bb2a-4b5a7d527c3f","year":2022},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-14T12:46:39.320894Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.168292Z"},"links":{"cited_paper":"/paper/2209.08399","citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:23c5e20844c18a582d6b1e1918df83c07544966aecf47bc52d5ed926f12dbac9","observation_id":"34356b5b-423a-401e-be69-5d66b7e03ae3","resolution":{"observed_at":"2026-08-10T14:10:55.769225Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10533","last_updated":"2025-02-15T04:17:23Z","snapshot_observed_at":"2026-08-21T02:47:24.737232Z","submitted_at":"2024-10-14T14:11:37Z","title":"Non-convergence to global minimizers in data driven supervised deep learning: Adam and stochastic gradient descent optimization provably fail to converge to global minimizers in the training of deep neural networks with ReLU activation","version":2},"cited_work":{"arxiv_id":"2410.10533","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.10533","snapshot_observed_at":"2026-08-10T14:10:55.748563Z","title":"Non-convergence to global minimizers in data driven supervised deep learning: Adam and stochastic gradient descent optimization provably fail to converge to global minimizers in the training of deep neural networks with ReLU activation","venue":"cs.LG","work_id":"8c0916f3-08aa-4adb-a531-f651568abf44","year":2024},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-14T12:46:39.320894Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.171951Z"},"links":{"cited_paper":"/paper/2410.10533","citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:e6cbbbfd86681f1474cda2e28545f4f7f87fc8dd3ebcd78f45ae2ead6f951f22","observation_id":"7d58f89a-2b2c-4fde-92c0-aca6e4701d44","resolution":{"observed_at":"2026-08-10T14:10:55.752584Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.07369","last_updated":"2023-06-22T18:05:01Z","snapshot_observed_at":"2026-08-17T14:09:17.200340Z","submitted_at":"2021-12-13T11:45:36Z","title":"Convergence proof for stochastic gradient descent in the training of deep neural networks with ReLU activation for constant target functions","version":2},"cited_work":{"arxiv_id":"2112.07369","doi":null,"metadata_source":"pith","pith_arxiv_id":"2112.07369","snapshot_observed_at":"2026-08-10T14:10:55.733702Z","title":"Convergence proof for stochastic gradient descent in the training of deep neural networks with ReLU activation for constant target functions","venue":"cs.LG","work_id":"a5862223-25f9-487b-aa62-c7fa71ba09cb","year":2021},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-14T12:46:39.320894Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.176028Z"},"links":{"cited_paper":"/paper/2112.07369","citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:588f572381803d51a110fc7342ec9eb382280c2ad68953d876101e9a85954901","observation_id":"65143bab-0e87-4d47-b350-06063f650409","resolution":{"observed_at":"2026-08-10T14:10:55.737848Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.13111","last_updated":"2025-08-28T23:18:51Z","snapshot_observed_at":"2026-08-16T16:05:59.765443Z","submitted_at":"2022-12-26T12:29:12Z","title":"Convergence to good non-optimal critical points in the training of neural networks: Gradient descent optimization with one random initialization overcomes all bad non-global local minima with high probability","version":2},"cited_work":{"arxiv_id":"2212.13111","doi":null,"metadata_source":"pith","pith_arxiv_id":"2212.13111","snapshot_observed_at":"2026-08-10T14:10:55.717638Z","title":"Convergence to good non-optimal critical points in the training of neural networks: Gradient descent optimization with one random initialization overcomes all bad non-global local minima with high probability","venue":"math.OC","work_id":"0f1655f0-8e07-48b3-a97d-2ff2c89ecee8","year":2022},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-14T12:46:39.320894Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.180503Z"},"links":{"cited_paper":"/paper/2212.13111","citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:5ef8c389a9328aaeaa19b6dd65980282c79a24c92149c08c59598de598aa6181","observation_id":"af440117-6d22-4089-a733-751858c2023f","resolution":{"observed_at":"2026-08-10T14:10:55.721846Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20360","last_updated":"2025-07-15T18:49:51Z","snapshot_observed_at":"2026-08-21T02:47:29.046095Z","submitted_at":"2023-10-31T11:01:23Z","title":"Mathematical Introduction to Deep Learning: Methods, Implementations, and Theory","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.20360","snapshot_observed_at":"2026-08-10T14:10:55.184143Z","title":"Mathematical Introduction to Deep Learning: Methods, Implementations, and Theory","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-14T12:46:39.320894Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.184143Z"},"links":{"cited_paper":"/paper/2310.20360","citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:86dd829d1a704e2fed447a3e374533a65263c0a327555d4267643b02418f31e6","observation_id":"23c3f78c-f589-4871-bc95-8213a9807e5f","resolution":{"observed_at":"2026-08-10T14:10:55.184143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.09684","last_updated":"2022-07-13T15:12:38Z","snapshot_observed_at":"2026-08-16T17:33:42.463301Z","submitted_at":"2021-12-17T18:55:40Z","title":"On the existence of global minima and convergence analyses for gradient descent methods in the training of deep neural networks","version":2},"cited_work":{"arxiv_id":"2112.09684","doi":null,"metadata_source":"pith","pith_arxiv_id":"2112.09684","snapshot_observed_at":"2026-08-10T14:10:55.689224Z","title":"On the existence of global minima and convergence analyses for gradient descent methods in the training of deep neural networks","venue":"math.OC","work_id":"e052ff39-40fd-467f-8a4a-c648a258e421","year":2021},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-14T12:46:39.320894Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.187721Z"},"links":{"cited_paper":"/paper/2112.09684","citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:8b1ed7711d5cb4ac4ff591b1c7779f338fc623372bd352bfd82a4c9a1754274d","observation_id":"56865051-e276-4cac-8445-25a6fb17bf8d","resolution":{"observed_at":"2026-08-10T14:10:55.693711Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:10:56.097046Z","title":"On the existence of global minima and convergence analyses for gradient descent methods in the training of dee p neural networks","venue":null,"work_id":"cbf29579-ad15-4741-b6dc-0b70591acbfb","year":2022},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-14T12:46:39.320894Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.191988Z"},"links":{"citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:62a6518a811d569b272230350b98124a125a33f23a85b31faa82b827c2b132c0","observation_id":"77ca3d51-68d6-42d2-9cb2-b1b4cb6e0829","resolution":{"observed_at":"2026-08-10T14:10:56.101057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:10:56.084590Z","title":"A proof of convergence for stochastic gradient descent in the training of artiﬁcial neural networks with ReLU activation for constant target functions","venue":null,"work_id":"308ea9e6-7206-4c73-84e2-2270b0421312","year":2022},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-14T12:46:39.320894Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.196026Z"},"links":{"citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:f9003a1f66805b74300f10890dac86345629f708a4743b8cb894dfacabc94066","observation_id":"730c4d9f-1152-4a86-943e-3dc45a151caa","resolution":{"observed_at":"2026-08-10T14:10:56.089558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:10:56.072386Z","title":"Convergence analysis for gradient ﬂows in the training of artiﬁcial neural networks with ReLU activation","venue":null,"work_id":"a5e0f78c-9229-488a-968e-2eadb71bffc2","year":2023},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-14T12:46:39.320894Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.200155Z"},"links":{"citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:c1a869d44a67eb274086efb418349831d2f9b93ddc86021f4b49602d4a172334","observation_id":"4766fd9e-0563-4699-8fc0-cedf26672fda","resolution":{"observed_at":"2026-08-10T14:10:56.076929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05155","last_updated":"2024-02-07T16:14:04Z","snapshot_observed_at":"2026-08-16T14:20:32.593954Z","submitted_at":"2024-02-07T16:14:04Z","title":"Non-convergence to global minimizers for Adam and stochastic gradient descent optimization and constructions of local minimizers in the training of artificial neural networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05155","snapshot_observed_at":"2026-08-10T14:10:55.203554Z","title":"Non-convergence to global minimizers for Adam and stochastic gradient descent optimization and constructio ns of local minimizers in the training of artiﬁcial neural networks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-14T12:46:39.320894Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.203554Z"},"links":{"cited_paper":"/paper/2402.05155","citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:32c0b6061160f27a53fe02339abcd65d9ddc69c6cb377221d08344ce3d2a4ede","observation_id":"4eedb1c9-c93b-4322-95cf-0880eaeeb427","resolution":{"observed_at":"2026-08-10T14:10:55.203554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:10:56.059588Z","title":"M., and Lee, J","venue":null,"work_id":"28a83009-fade-4e73-833a-2fdccb7d9468","year":2018},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-14T12:46:39.320894Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.207272Z"},"links":{"citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:195ac2e8d1aa27b218673e4bb367ca001cc6c0deb7925c09e08eb3df9eeb209a","observation_id":"69f09e38-d5c9-4b34-a18e-2ce0ddbe999e","resolution":{"observed_at":"2026-08-10T14:10:56.064425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02666","last_updated":"2023-12-05T08:53:25Z","snapshot_observed_at":"2026-08-16T15:26:38.419358Z","submitted_at":"2023-06-05T08:01:50Z","title":"Does a sparse ReLU network training problem always admit an optimum?","version":2},"cited_work":{"arxiv_id":"2306.02666","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.02666","snapshot_observed_at":"2026-08-10T14:10:55.660302Z","title":"Does a sparse ReLU network training problem always admit an optimum?","venue":"cs.NE","work_id":"129d302a-9fd1-49a1-a7fe-b4f1cdef4bbe","year":2023},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-14T12:46:39.320894Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.211624Z"},"links":{"cited_paper":"/paper/2306.02666","citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:3c25a0a6e32c4964745fe79ec9ca7f0f4fe5e0fbb0a8944e370aee961ad1556b","observation_id":"34629051-9f5a-49aa-8680-06075f1cd961","resolution":{"observed_at":"2026-08-10T14:10:55.664692Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:10:56.048032Z","title":"On correctness of automatic diﬀerentiation for non-diﬀerentiable functions","venue":null,"work_id":"ee9e3ef0-1dfb-4aa9-93d2-6a7275aa3774","year":2020},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-14T12:46:39.320894Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.215356Z"},"links":{"citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:a6ce0a3f440faf4c1b4258c07374c94284093cac19ca4431c910efb660f6ce95","observation_id":"fee10728-e53e-4f3a-9771-574812d91ad8","resolution":{"observed_at":"2026-08-10T14:10:56.052008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:10:56.036242Z","title":"S., and Tian, T","venue":null,"work_id":"2f9555b9-fac2-4dba-aef6-8ee6760e5601","year":2021},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-14T12:46:39.320894Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.219333Z"},"links":{"citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:feb76dbcf189748074d33f3140d20f24e10a77db15d4984b7ec45c7e1cd9cb88","observation_id":"59c9386c-576d-46db-b028-18257b59b67d","resolution":{"observed_at":"2026-08-10T14:10:56.040243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:10:56.024142Z","title":null,"venue":null,"work_id":"66e402cf-eb94-4900-ad5d-66c50580e622","year":2020},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-14T12:46:39.320894Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.223509Z"},"links":{"citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:4d7204ea8ad3bb3fb2c7c4991810a6b1c95a71fe02d16596cffdddf71f717d14","observation_id":"a2a99617-256c-44a6-ac47-bcdbedb122a8","resolution":{"observed_at":"2026-08-10T14:10:56.028119Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:10:56.011174Z","title":"Introductory lectures on convex optimization , vol","venue":null,"work_id":"be5bbbde-6af3-4c31-8e37-cc7435b5b425","year":2004},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-14T12:46:39.320894Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.227077Z"},"links":{"citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:97b6cd90bbfd8b3f35a453abe1eecbcda31408448cbeedcca71d34fdb54e263b","observation_id":"d9636a0d-b071-4e95-835d-0f5b0a7940b7","resolution":{"observed_at":"2026-08-10T14:10:56.015946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:10:55.999430Z","title":"Automatic diﬀerentiation in PyTorch","venue":null,"work_id":"53fa9336-9726-4352-8045-532dd9a16a03","year":2017},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-14T12:46:39.320894Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.230372Z"},"links":{"citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:f36be4a1c488572a052f753965a6c264ce9329597d0dc64da4b464279af40b6c","observation_id":"e73bedc5-766f-4a3e-9074-5399620c1a26","resolution":{"observed_at":"2026-08-10T14:10:56.003282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.01703","last_updated":"2019-12-03T22:06:05Z","snapshot_observed_at":"2026-07-06T08:41:49.632205Z","submitted_at":"2019-12-03T22:06:05Z","title":"PyTorch: An Imperative Style, High-Performance Deep Learning Library","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.01703","snapshot_observed_at":"2026-08-10T14:10:55.234656Z","title":"PyTorch: An Imperative Style, High-Performance Deep Learning Library","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-14T12:46:39.320894Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.234656Z"},"links":{"cited_paper":"/paper/1912.01703","citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:c6c757ad356ab86775b79c63cc91cf4501d4ca35c1e154f4aa13b6a768d42d00","observation_id":"18600bc8-8a6f-42d7-acfd-8744b14e2c17","resolution":{"observed_at":"2026-08-10T14:10:55.234656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:10:55.987933Z","title":"Conservative parametric optimality and the ridge method for tame min-max problems","venue":null,"work_id":"a62ee6d0-0ac2-48a1-8d9d-b2862dcfe9b6","year":2023},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-14T12:46:39.320894Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.238390Z"},"links":{"citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:4bb595ab65990e415a9c2bb0c8da52acf24cd6c1aeeac3dce81d9a3c1462def0","observation_id":"a3d61f3a-0a6d-45ac-8add-0c11fabcb32f","resolution":{"observed_at":"2026-08-10T14:10:55.991827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:10:55.975905Z","title":"Topological properties of the set of functions generated by neural networks of ﬁxed size","venue":null,"work_id":"19a58f4b-02e0-46cd-a4f3-511c7126ab3a","year":2021},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-14T12:46:39.320894Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.242309Z"},"links":{"citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:5240a40a3dd5a4b0e5b474e1db95600eb7f81b67f2477529d2fe9a6642cefc44","observation_id":"c5e849ba-d9cf-4a7e-81b3-1e073f726c5d","resolution":{"observed_at":"2026-08-10T14:10:55.980143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:10:55.246396Z","title":"Mathematical theory of deep learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-14T12:46:39.320894Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.246396Z"},"links":{"citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:7741040b044ea18f34174ef6c75625a18b60884ab0edf14f340c9193e577bb1d","observation_id":"d8bd2e87-a613-4e51-8aa5-9ae1eee4fbcc","resolution":{"observed_at":"2026-08-10T14:10:55.246396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09237","last_updated":"2019-04-19T16:21:38Z","snapshot_observed_at":"2026-08-14T16:43:55.734754Z","submitted_at":"2019-04-19T16:21:38Z","title":"On the Convergence of Adam and Beyond","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09237","snapshot_observed_at":"2026-08-10T14:10:55.250440Z","title":"J., Kale, S., and Kumar, S","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-14T12:46:39.320894Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.250440Z"},"links":{"cited_paper":"/paper/1904.09237","citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:a3545c787df4771c38256f33afbd410598e3b2b756c4e1c00625073037e1645f","observation_id":"04fab9aa-cc6d-4de7-928d-caf7c839d88a","resolution":{"observed_at":"2026-08-10T14:10:55.250440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:10:55.963606Z","title":"T., and Wets, R","venue":null,"work_id":"681f77fa-b4cd-4f1e-a62f-10b1f1d3a08b","year":1998},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-14T12:46:39.320894Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.254360Z"},"links":{"citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:74a1ff3bf2255e479737559fa01881cddb00acdf5bcdf73bd8d2bbd47f1d0b1f","observation_id":"6596ba1a-4111-4321-a318-7bb990f3c059","resolution":{"observed_at":"2026-08-10T14:10:55.967280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-10T14:10:55.258087Z","title":"An overview of gradient descent optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-14T12:46:39.320894Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.258087Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:e33fd6e8e51bf03439f5dcba4f85f217daa0990a31b86497c5dc1eaf377335b7","observation_id":"587b5c32-04c1-459a-b2e3-85e6a28f2179","resolution":{"observed_at":"2026-08-10T14:10:55.258087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.08968","last_updated":"2018-08-09T14:17:45Z","snapshot_observed_at":"2026-08-14T20:00:21.767341Z","submitted_at":"2017-12-24T21:00:10Z","title":"Spurious Local Minima are Common in Two-Layer ReLU Neural Networks","version":3},"cited_work":{"arxiv_id":"1712.08968","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.08968","snapshot_observed_at":"2026-08-10T14:10:55.555541Z","title":"Spurious Local Minima are Common in Two-Layer ReLU Neural Networks","venue":"cs.LG","work_id":"80626904-c29e-464b-8c6f-d4150665abd6","year":2017},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-14T12:46:39.320894Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.261614Z"},"links":{"cited_paper":"/paper/1712.08968","citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:96b58512c652a36798fde57b83f403348cfedceee8420d75ad9a35cf737630c0","observation_id":"3e73331b-66c2-4d4e-a9b9-b4224f0c7db5","resolution":{"observed_at":"2026-08-10T14:10:55.559559Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:10:55.265908Z","title":"The gradient’s limit of a deﬁnable family of functions is a co nservative set-valued ﬁeld","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-14T12:46:39.320894Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.265908Z"},"links":{"citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:d53a05f686591cba781bf0a24b4ea3cec6dfd80bfeb17561964b891229d5211e","observation_id":"aa99968d-afbc-48fa-8857-030d520112f9","resolution":{"observed_at":"2026-08-10T14:10:55.265908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:10:55.952444Z","title":null,"venue":null,"work_id":"34a31869-d9b1-4ae7-97c9-ae1211b910ab","year":2020},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-14T12:46:39.320894Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.269590Z"},"links":{"citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:adaf4a81cba57e2949bd38f9becf05e4eb64e626906c03ef5e6cb8dd30307b85","observation_id":"72b69994-0986-4f7c-8459-8d7434480bc8","resolution":{"observed_at":"2026-08-10T14:10:55.956109Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.08957","last_updated":"2019-12-19T00:23:18Z","snapshot_observed_at":"2026-08-21T02:47:57.572374Z","submitted_at":"2019-12-19T00:23:18Z","title":"Optimization for deep learning: theory and algorithms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.08957","snapshot_observed_at":"2026-08-10T14:10:55.368199Z","title":"Optimization for deep learning: theory and algorithms","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-14T12:46:39.320894Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.368199Z"},"links":{"cited_paper":"/paper/1912.08957","citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:2af40fd2487e0fbb4f432ef40b1d7706cdfab8d9251b7e1be94bbb3e2a293343","observation_id":"26fff830-1fc2-4193-a377-d46ca9e8f0c2","resolution":{"observed_at":"2026-08-10T14:10:55.368199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1611.06310","last_updated":"2017-02-17T14:51:54Z","snapshot_observed_at":"2026-08-14T21:29:39.831336Z","submitted_at":"2016-11-19T05:49:22Z","title":"Local minima in training of neural networks","version":2},"cited_work":{"arxiv_id":"1611.06310","doi":null,"metadata_source":"pith","pith_arxiv_id":"1611.06310","snapshot_observed_at":"2026-08-10T14:10:55.466134Z","title":"Local minima in training of neural networks","venue":"stat.ML","work_id":"67c7545e-71b6-4453-961c-75892f193ffd","year":2016},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-14T12:46:39.320894Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.372632Z"},"links":{"cited_paper":"/paper/1611.06310","citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:c9266cf6f239a77b7841f24cc8d61c0835a12272991d2bd339c52a333fa65697","observation_id":"f61b343a-98b8-488c-98a2-f0f5034bd062","resolution":{"observed_at":"2026-08-10T14:10:55.470243Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:10:55.940917Z","title":"S., and Bruna, J","venue":null,"work_id":"7f14da55-b4bb-4fca-b0be-e0e5a41c8956","year":2019},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-14T12:46:39.320894Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.376505Z"},"links":{"citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:9133d07aa54c5386a22f0bb813088a11477dd599a33e31b8072339e5851344c2","observation_id":"2e04d224-a0a5-4b26-8625-9e01e5213426","resolution":{"observed_at":"2026-08-10T14:10:55.944838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11696","last_updated":"2024-05-19T23:04:09Z","snapshot_observed_at":"2026-08-17T17:27:18.024643Z","submitted_at":"2024-05-19T23:04:09Z","title":"Approximation and Gradient Descent Training with Neural Networks","version":1},"cited_work":{"arxiv_id":"2405.11696","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.11696","snapshot_observed_at":"2026-08-10T14:10:55.447648Z","title":"Approximation and Gradient Descent Training with Neural Networks","venue":"cs.LG","work_id":"c29a296b-261d-4b30-9c9a-7ee689bc2c26","year":2024},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-14T12:46:39.320894Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.379861Z"},"links":{"cited_paper":"/paper/2405.11696","citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:ac97c9b3acc4f3781d42b19d4dd35e120c5e68b97f132b6d3f1298f874c37f3f","observation_id":"c50e8cdc-96f1-4cd6-b8f4-348c3b7ac367","resolution":{"observed_at":"2026-08-10T14:10:55.453704Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:10:55.929738Z","title":"Approximation results for gradient ﬂow trained neural netw orks","venue":null,"work_id":"ba51c07e-1292-4802-929d-2267795f8eb0","year":2024},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-14T12:46:39.320894Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.383559Z"},"links":{"citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:1854c7344760376e9df15a86efb5b04d286ecba5ac4fe2eb10eba77f800b88fc","observation_id":"b09235ce-e803-4d66-828b-d312a10535e8","resolution":{"observed_at":"2026-08-10T14:10:55.933568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.03938","last_updated":"2024-02-19T07:59:56Z","snapshot_observed_at":"2026-08-23T10:21:32.602845Z","submitted_at":"2023-05-06T05:35:56Z","title":"Adam-family Methods for Nonsmooth Optimization with Convergence Guarantees","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.03938","snapshot_observed_at":"2026-08-10T14:10:55.387153Z","title":"Adam-family Methods for Nonsmooth Optimization with Convergence Guarantees","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-14T12:46:39.320894Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.387153Z"},"links":{"cited_paper":"/paper/2305.03938","citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:de36d960fa30f49bf6cc8087ca891439383959f278c1f6a14262c9ed054c2e79","observation_id":"18d67b15-0b65-4b23-84f4-71b7548b57a3","resolution":{"observed_at":"2026-08-10T14:10:55.387153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.10053","last_updated":"2026-08-08T16:05:24Z","snapshot_observed_at":"2026-08-13T23:09:33.034829Z","submitted_at":"2023-07-19T15:26:18Z","title":"Stochastic Subgradient Methods with Guaranteed Global Stability in Nonsmooth Nonconvex Optimization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.10053","snapshot_observed_at":"2026-08-10T14:10:55.390854Z","title":"Convergence Guarantees for Stochastic Subgradient Methods in Nonsmooth Nonconvex Optimization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-14T12:46:39.320894Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.390854Z"},"links":{"cited_paper":"/paper/2307.10053","citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:b6706c57bff47ed2a9e8df04c5e7aaea3c48ee005781bb8f6df0e73941124974","observation_id":"409d5b73-5735-41b6-b555-24d8cf6ce3d2","resolution":{"observed_at":"2026-08-10T14:10:55.390854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:10:55.918445Z","title":null,"venue":null,"work_id":"0802d421-4ba3-4c1b-9211-00c244681d93","year":2022},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-14T12:46:39.320894Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.394691Z"},"links":{"citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:c0d7f6a0ffb44811802f4a3a627f3b516763b63154243d75d350e23105212574","observation_id":"02b81597-8b7b-4ff3-98c1-b4846b707d05","resolution":{"observed_at":"2026-08-10T14:10:55.922227Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-14T12:46:39.320894Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":24,"verified_exact":11,"verified_fuzzy":22},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 0 inbound Pith citation observations for arXiv:2501.15646."}