{"as_of":"2026-08-16T17:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e3dbdf5f26791510fc4a2465d07e9111b1a63e3a2caf415e18529867bc720465","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T14:21:15.062219Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.11479/citation-record","integrity":"/paper/2608.11479/integrity","json":"/paper/2608.11479/citation-record.json","paper":"/paper/2608.11479"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2510.03164","last_updated":"2026-06-28T16:14:54Z","snapshot_observed_at":"2026-08-14T12:29:49.923863Z","submitted_at":"2025-10-03T16:35:56Z","title":"Why Do We Need Warm-up? A Theoretical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.03164","snapshot_observed_at":"2026-08-15T14:21:14.935906Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.11479","last_updated":"2026-08-11T22:43:50Z","snapshot_observed_at":"2026-08-15T23:10:14.549685Z","submitted_at":"2026-08-11T22:43:50Z","title":"Convergence Guarantees of Gradient Descent for Neural Networks via Generalized Lipschitz Smoothness","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T14:21:14.935906Z"},"links":{"cited_paper":"/paper/2510.03164","citing_paper":"/paper/2608.11479"},"observation_digest":"sha256:15948ee514df4223c01a8237954013239be2c3c484aff1200f1aad7d8a003e6e","observation_id":"fe114f94-053f-4736-aab6-09c0fb164bb2","resolution":{"observed_at":"2026-08-15T14:21:14.935906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:21:15.649225Z","title":"A Convergence Theory for Deep Learning via Over-Parameterization","venue":null,"work_id":"2d989746-c464-4729-9dff-4aa07f99638a","year":2019},"citing_paper":{"arxiv_id":"2608.11479","last_updated":"2026-08-11T22:43:50Z","snapshot_observed_at":"2026-08-15T23:10:14.549685Z","submitted_at":"2026-08-11T22:43:50Z","title":"Convergence Guarantees of Gradient Descent for Neural Networks via Generalized Lipschitz Smoothness","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T14:21:14.940351Z"},"links":{"citing_paper":"/paper/2608.11479"},"observation_digest":"sha256:7ecf4f62567f2f0a410ea7556776c43674bdfae6c5cf48e5a381eece9df880d7","observation_id":"e26f6a9a-8061-47f5-9a49-660e9f6ab491","resolution":{"observed_at":"2026-08-15T14:21:15.652611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:21:15.639020Z","title":"A Convergence Analysis of Gradient Descent for Deep Linear Neural Networks","venue":null,"work_id":"15bb6f0c-1d59-4a1b-8aed-695236621146","year":2019},"citing_paper":{"arxiv_id":"2608.11479","last_updated":"2026-08-11T22:43:50Z","snapshot_observed_at":"2026-08-15T23:10:14.549685Z","submitted_at":"2026-08-11T22:43:50Z","title":"Convergence Guarantees of Gradient Descent for Neural Networks via Generalized Lipschitz Smoothness","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T14:21:14.944100Z"},"links":{"citing_paper":"/paper/2608.11479"},"observation_digest":"sha256:fb53b7485b03d5eb6582937cb294bf72d7e45813425fbae27fba333d09fb2b89","observation_id":"18f4ee98-374d-4c7c-be73-09381c4d4847","resolution":{"observed_at":"2026-08-15T14:21:15.642509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:21:15.629159Z","title":"On exact computation with an infinitely wide neural net","venue":null,"work_id":"7b51e507-8a89-4929-84f8-19dc14b03671","year":2019},"citing_paper":{"arxiv_id":"2608.11479","last_updated":"2026-08-11T22:43:50Z","snapshot_observed_at":"2026-08-15T23:10:14.549685Z","submitted_at":"2026-08-11T22:43:50Z","title":"Convergence Guarantees of Gradient Descent for Neural Networks via Generalized Lipschitz Smoothness","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T14:21:14.947986Z"},"links":{"citing_paper":"/paper/2608.11479"},"observation_digest":"sha256:987c8b21c7bd04027e7f7839a1a90f4ded96728668d3eb81cf43ac0b4a9dc735","observation_id":"5f7ad4c1-5cc4-4403-83fa-f0ae86e797c8","resolution":{"observed_at":"2026-08-15T14:21:15.632514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.17660","last_updated":"2026-05-17T21:30:13Z","snapshot_observed_at":"2026-08-15T08:51:36.148437Z","submitted_at":"2026-05-17T21:30:13Z","title":"Training Infinitely Deep and Wide Transformers","version":1},"cited_work":{"arxiv_id":"2605.17660","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.17660","snapshot_observed_at":"2026-08-15T14:21:15.410529Z","title":"Training Infinitely Deep and Wide Transformers","venue":"math.OC","work_id":"794b0620-2d1a-4b16-a483-38192ed63a77","year":2026},"citing_paper":{"arxiv_id":"2608.11479","last_updated":"2026-08-11T22:43:50Z","snapshot_observed_at":"2026-08-15T23:10:14.549685Z","submitted_at":"2026-08-11T22:43:50Z","title":"Convergence Guarantees of Gradient Descent for Neural Networks via Generalized Lipschitz Smoothness","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T14:21:14.951446Z"},"links":{"cited_paper":"/paper/2605.17660","citing_paper":"/paper/2608.11479"},"observation_digest":"sha256:cc9061ddea72fb3f12f11f9dc7e2f93dca0766d354241b7f1b6d73f3381674f6","observation_id":"bbb43331-5668-4a44-9f21-4ce1d13eb5c6","resolution":{"observed_at":"2026-08-15T14:21:15.414348Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:21:14.955351Z","title":"A Descent Lemma Beyond Lipschitz Gradient Continuity: First-Order Methods Revisited and Applications","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.11479","last_updated":"2026-08-11T22:43:50Z","snapshot_observed_at":"2026-08-15T23:10:14.549685Z","submitted_at":"2026-08-11T22:43:50Z","title":"Convergence Guarantees of Gradient Descent for Neural Networks via Generalized Lipschitz Smoothness","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T14:21:14.955351Z"},"links":{"citing_paper":"/paper/2608.11479"},"observation_digest":"sha256:be0fb67828ee1a3cddd3677fa1d147fd7babda9093bb5afbc69c942ada84bdac","observation_id":"c57fdb88-ea85-4aec-9f8e-75bb0bf8b9fe","resolution":{"observed_at":"2026-08-15T14:21:14.955351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:21:15.619996Z","title":"Non-Uniform Smoothness for Gradient Descent","venue":null,"work_id":"287248aa-0e72-41b5-a0da-87efb36dcb84","year":2024},"citing_paper":{"arxiv_id":"2608.11479","last_updated":"2026-08-11T22:43:50Z","snapshot_observed_at":"2026-08-15T23:10:14.549685Z","submitted_at":"2026-08-11T22:43:50Z","title":"Convergence Guarantees of Gradient Descent for Neural Networks via Generalized Lipschitz Smoothness","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T14:21:14.959287Z"},"links":{"citing_paper":"/paper/2608.11479"},"observation_digest":"sha256:794d6401e3702e11f8251dc897d14933eff29050fb9771f2401b96bc60d5985d","observation_id":"9441b31f-20dc-4881-823f-e408ba4dd5cc","resolution":{"observed_at":"2026-08-15T14:21:15.623145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:21:14.962282Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.11479","last_updated":"2026-08-11T22:43:50Z","snapshot_observed_at":"2026-08-15T23:10:14.549685Z","submitted_at":"2026-08-11T22:43:50Z","title":"Convergence Guarantees of Gradient Descent for Neural Networks via Generalized Lipschitz Smoothness","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T14:21:14.962282Z"},"links":{"citing_paper":"/paper/2608.11479"},"observation_digest":"sha256:48337ca133601a6a4c132bd3ef9642d2f2296378532eb13cc3f758fe0b470853","observation_id":"995d8129-df9f-4882-bdb2-941da3d24195","resolution":{"observed_at":"2026-08-15T14:21:14.962282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2026.37044","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:21:15.278067Z","title":"A Non-local Convergence Analysis of Gradient Flow for Deep Linear Networks","venue":null,"work_id":"91a8e8c2-c288-49a1-a395-1cab9607481c","year":2026},"citing_paper":{"arxiv_id":"2608.11479","last_updated":"2026-08-11T22:43:50Z","snapshot_observed_at":"2026-08-15T23:10:14.549685Z","submitted_at":"2026-08-11T22:43:50Z","title":"Convergence Guarantees of Gradient Descent for Neural Networks via Generalized Lipschitz Smoothness","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T14:21:14.965344Z"},"links":{"citing_paper":"/paper/2608.11479"},"observation_digest":"sha256:5f561cfce6dda15d1c1130be37fcd238672a2afae0b5be412767979c28cde381","observation_id":"18269672-f597-4b1f-bb47-b544eb43c92a","resolution":{"observed_at":"2026-08-15T14:21:15.286561Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:21:15.609817Z","title":"On lazy training in differentiable program- ming","venue":null,"work_id":"6317f849-c240-434b-83bc-420d45acd6c4","year":2019},"citing_paper":{"arxiv_id":"2608.11479","last_updated":"2026-08-11T22:43:50Z","snapshot_observed_at":"2026-08-15T23:10:14.549685Z","submitted_at":"2026-08-11T22:43:50Z","title":"Convergence Guarantees of Gradient Descent for Neural Networks via Generalized Lipschitz Smoothness","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T14:21:14.968508Z"},"links":{"citing_paper":"/paper/2608.11479"},"observation_digest":"sha256:2519f6e3a9d08b730f247aa6cddeb6f794fa724c49da28278da9ea38bd79b103","observation_id":"9789eb47-7d0b-443e-9179-894606f7748b","resolution":{"observed_at":"2026-08-15T14:21:15.613359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1002/cpa.22200","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:08:47.750906Z","title":"Infinite-width limit of deep linear neural networks","venue":"Communications on Pure and Applied Mathematics","work_id":"ef436e4e-ecc3-4832-b852-d01088e6877b","year":2024},"citing_paper":{"arxiv_id":"2608.11479","last_updated":"2026-08-11T22:43:50Z","snapshot_observed_at":"2026-08-15T23:10:14.549685Z","submitted_at":"2026-08-11T22:43:50Z","title":"Convergence Guarantees of Gradient Descent for Neural Networks via Generalized Lipschitz Smoothness","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T14:21:14.971868Z"},"links":{"citing_paper":"/paper/2608.11479"},"observation_digest":"sha256:c16c5f4391b13156f8b04df53fed03543617051954b0632f51e672820b9ceedd","observation_id":"f41def0e-ee71-4d16-bb0b-9a0f557b1d91","resolution":{"observed_at":"2026-08-15T14:21:15.119337Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:21:15.599468Z","title":"Convergence of the Gradient Flow for Shallow ReLU Networks on Weakly Interacting Data","venue":null,"work_id":"c875fd1b-e3de-4241-ac91-4cbc2e7d129a","year":2025},"citing_paper":{"arxiv_id":"2608.11479","last_updated":"2026-08-11T22:43:50Z","snapshot_observed_at":"2026-08-15T23:10:14.549685Z","submitted_at":"2026-08-11T22:43:50Z","title":"Convergence Guarantees of Gradient Descent for Neural Networks via Generalized Lipschitz Smoothness","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T14:21:14.975125Z"},"links":{"citing_paper":"/paper/2608.11479"},"observation_digest":"sha256:7f3551d381162df3d1142467efd50b0264514d9d5d205fe8d67b58ea7f99d543","observation_id":"8be0ee41-71cd-4e8e-bfc8-97959b2da425","resolution":{"observed_at":"2026-08-15T14:21:15.602842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:21:15.589698Z","title":"Gradient Descent Provably Optimizes Over-parameterized Neural Networks","venue":null,"work_id":"e7e6784d-85ef-4b22-ae69-e0d59c2aea4b","year":2019},"citing_paper":{"arxiv_id":"2608.11479","last_updated":"2026-08-11T22:43:50Z","snapshot_observed_at":"2026-08-15T23:10:14.549685Z","submitted_at":"2026-08-11T22:43:50Z","title":"Convergence Guarantees of Gradient Descent for Neural Networks via Generalized Lipschitz Smoothness","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T14:21:14.978088Z"},"links":{"citing_paper":"/paper/2608.11479"},"observation_digest":"sha256:90785b1322e48913c49409599c0170c0ba1505e0d3577deb7e7f286866e2a5d7","observation_id":"69b4958e-7bdf-49b7-9c0c-36eb28aa3f1f","resolution":{"observed_at":"2026-08-15T14:21:15.593222Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:21:15.578855Z","title":"Taming Nonconvex Stochastic Mirror Descent with General Breg- man Divergence","venue":null,"work_id":"ba2034d9-7854-4103-85fd-ac12b5f43ffe","year":2024},"citing_paper":{"arxiv_id":"2608.11479","last_updated":"2026-08-11T22:43:50Z","snapshot_observed_at":"2026-08-15T23:10:14.549685Z","submitted_at":"2026-08-11T22:43:50Z","title":"Convergence Guarantees of Gradient Descent for Neural Networks via Generalized Lipschitz Smoothness","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T14:21:14.981324Z"},"links":{"citing_paper":"/paper/2608.11479"},"observation_digest":"sha256:34a90bf8d967f088c7f0188c045da000ca6c01cf367e432c81d5f10ea44dc410","observation_id":"96703a10-e91c-4348-894f-96be9e9e9d9e","resolution":{"observed_at":"2026-08-15T14:21:15.582638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:21:15.568008Z","title":"Glocal Smoothness: Line search and adaptive sizes can help in theory too!","venue":null,"work_id":"0a515daf-f0cc-40b6-865f-0000664ae7b7","year":2026},"citing_paper":{"arxiv_id":"2608.11479","last_updated":"2026-08-11T22:43:50Z","snapshot_observed_at":"2026-08-15T23:10:14.549685Z","submitted_at":"2026-08-11T22:43:50Z","title":"Convergence Guarantees of Gradient Descent for Neural Networks via Generalized Lipschitz Smoothness","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T14:21:14.984687Z"},"links":{"citing_paper":"/paper/2608.11479"},"observation_digest":"sha256:bca1b83e445aa02f53d36337c00bfbe0b993c2494aec889aefe1b9cadcebc5c3","observation_id":"6cedc380-b8e6-47df-b0f7-12276fd291eb","resolution":{"observed_at":"2026-08-15T14:21:15.571717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.11235","last_updated":"2024-03-09T13:28:29Z","snapshot_observed_at":"2026-08-16T15:59:56.095916Z","submitted_at":"2023-01-26T17:18:36Z","title":"Handbook of Convergence Theorems for (Stochastic) Gradient Methods","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.11235","snapshot_observed_at":"2026-08-15T14:21:14.987730Z","title":"Gower.Handbook of Convergence Theorems for (Stochastic) Gradient Methods","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11479","last_updated":"2026-08-11T22:43:50Z","snapshot_observed_at":"2026-08-15T23:10:14.549685Z","submitted_at":"2026-08-11T22:43:50Z","title":"Convergence Guarantees of Gradient Descent for Neural Networks via Generalized Lipschitz Smoothness","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T14:21:14.987730Z"},"links":{"cited_paper":"/paper/2301.11235","citing_paper":"/paper/2608.11479"},"observation_digest":"sha256:ca513eda971bc81445904ef7a65d333bf9d043abaf1bd9ebe4b5eebccc4749b0","observation_id":"549c8ffc-c9b4-4b76-bac2-fbfa7ad3b166","resolution":{"observed_at":"2026-08-15T14:21:14.987730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:21:15.557170Z","title":"Neural tangent kernel: convergence and generalization in neural networks","venue":null,"work_id":"7f65ca90-8886-402e-8779-eb94f224bc4a","year":2018},"citing_paper":{"arxiv_id":"2608.11479","last_updated":"2026-08-11T22:43:50Z","snapshot_observed_at":"2026-08-15T23:10:14.549685Z","submitted_at":"2026-08-11T22:43:50Z","title":"Convergence Guarantees of Gradient Descent for Neural Networks via Generalized Lipschitz Smoothness","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T14:21:14.991113Z"},"links":{"citing_paper":"/paper/2608.11479"},"observation_digest":"sha256:272c2c00402048f296d5632ae5cf84fddafe3bde362589a972b9fd580a13b39c","observation_id":"eb974be1-1875-4682-a936-b17e07888552","resolution":{"observed_at":"2026-08-15T14:21:15.560954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:21:15.545290Z","title":"Convex and Non-convex Optimization Under Generalized Smoothness","venue":null,"work_id":"a2859cc8-65c9-4a0b-a6a7-d99ae79589a2","year":2023},"citing_paper":{"arxiv_id":"2608.11479","last_updated":"2026-08-11T22:43:50Z","snapshot_observed_at":"2026-08-15T23:10:14.549685Z","submitted_at":"2026-08-11T22:43:50Z","title":"Convergence Guarantees of Gradient Descent for Neural Networks via Generalized Lipschitz Smoothness","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T14:21:14.994450Z"},"links":{"citing_paper":"/paper/2608.11479"},"observation_digest":"sha256:85d23cce66da1288ab7fa31fe2adcc0ac1cc46a7260f196d2f463b6f15e2dc61","observation_id":"eabb7d96-5134-4427-8990-940fd639dabf","resolution":{"observed_at":"2026-08-15T14:21:15.549120Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:21:15.533381Z","title":"Learning overparameterized neural networks via stochastic gra- dient descent on structured data","venue":null,"work_id":"a85a09d6-3dcd-4490-a558-580bfbbc65ac","year":2018},"citing_paper":{"arxiv_id":"2608.11479","last_updated":"2026-08-11T22:43:50Z","snapshot_observed_at":"2026-08-15T23:10:14.549685Z","submitted_at":"2026-08-11T22:43:50Z","title":"Convergence Guarantees of Gradient Descent for Neural Networks via Generalized Lipschitz Smoothness","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T14:21:14.997570Z"},"links":{"citing_paper":"/paper/2608.11479"},"observation_digest":"sha256:4911520d746766791f1bd137f2a5fecc85d21de858fbcd6b044eb0368508b5a1","observation_id":"ae41c33d-157f-4007-9c96-e6dd7f813e6d","resolution":{"observed_at":"2026-08-15T14:21:15.537301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:21:15.001085Z","title":"Relatively Smooth Convex Optimization by First-Order Methods, and Applications","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.11479","last_updated":"2026-08-11T22:43:50Z","snapshot_observed_at":"2026-08-15T23:10:14.549685Z","submitted_at":"2026-08-11T22:43:50Z","title":"Convergence Guarantees of Gradient Descent for Neural Networks via Generalized Lipschitz Smoothness","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T14:21:15.001085Z"},"links":{"citing_paper":"/paper/2608.11479"},"observation_digest":"sha256:46dd9851c2a29e62494c1dd8959043b2118648a5b532ed99a50191d7cfc0cc10","observation_id":"e00e23e8-93a6-4866-8e3c-d31cb529a1d2","resolution":{"observed_at":"2026-08-15T14:21:15.001085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:21:15.521731Z","title":"Leveraging Non-uniformity in First-order Non-convex Optimization","venue":null,"work_id":"c8f05065-e972-47ca-9261-3f04636670e9","year":2021},"citing_paper":{"arxiv_id":"2608.11479","last_updated":"2026-08-11T22:43:50Z","snapshot_observed_at":"2026-08-15T23:10:14.549685Z","submitted_at":"2026-08-11T22:43:50Z","title":"Convergence Guarantees of Gradient Descent for Neural Networks via Generalized Lipschitz Smoothness","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T14:21:15.005388Z"},"links":{"citing_paper":"/paper/2608.11479"},"observation_digest":"sha256:b9457f557e6a53dcab2c8f10ad40bc5c1f809bf3d5a346040536b10a30087ad6","observation_id":"3c7d5104-320e-4f17-811b-6ca1abf734b2","resolution":{"observed_at":"2026-08-15T14:21:15.525450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.52202/079017-0473.url:https://","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:21:15.091950Z","title":"Directional Smoothness and Gradient Methods: Convergence and Adaptiv- ity","venue":null,"work_id":"7a920d81-9c56-4263-bc3c-fac05627610f","year":2024},"citing_paper":{"arxiv_id":"2608.11479","last_updated":"2026-08-11T22:43:50Z","snapshot_observed_at":"2026-08-15T23:10:14.549685Z","submitted_at":"2026-08-11T22:43:50Z","title":"Convergence Guarantees of Gradient Descent for Neural Networks via Generalized Lipschitz Smoothness","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T14:21:15.009223Z"},"links":{"citing_paper":"/paper/2608.11479"},"observation_digest":"sha256:5a1f96b6aff0c7465ef098685020a924d0dfe51e4756c96d1d201e3f63673150","observation_id":"541608ab-6407-4780-b848-35cfd4309719","resolution":{"observed_at":"2026-08-15T14:21:15.098174Z","resolver_source":"doi_truncated","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.18248","last_updated":"2026-05-11T05:28:48Z","snapshot_observed_at":"2026-08-15T02:52:01.037707Z","submitted_at":"2025-12-20T07:20:54Z","title":"On the Convergence Rate of LoRA Gradient Descent","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.18248","snapshot_observed_at":"2026-08-15T14:21:15.013527Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.11479","last_updated":"2026-08-11T22:43:50Z","snapshot_observed_at":"2026-08-15T23:10:14.549685Z","submitted_at":"2026-08-11T22:43:50Z","title":"Convergence Guarantees of Gradient Descent for Neural Networks via Generalized Lipschitz Smoothness","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T14:21:15.013527Z"},"links":{"cited_paper":"/paper/2512.18248","citing_paper":"/paper/2608.11479"},"observation_digest":"sha256:316c38f6877b77af89d48a8c31a5f9e20a8e97a617669807dbe6c131dc077145","observation_id":"227381fa-a489-476e-b6e0-e6ef42bd20ee","resolution":{"observed_at":"2026-08-15T14:21:15.013527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.08754","last_updated":"2023-06-25T14:59:15Z","snapshot_observed_at":"2026-08-16T15:32:59.223779Z","submitted_at":"2023-05-15T16:08:31Z","title":"On the Stability of Approximate Message Passing with Independent Measurement Ensembles","version":4},"cited_work":{"arxiv_id":"2305.08754","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.08754","snapshot_observed_at":"2026-08-15T14:21:15.184780Z","title":"On the Stability of Approximate Message Passing with Independent Measurement Ensembles","venue":"cs.IT","work_id":"609c7a93-818c-480d-accc-a00e0b673faa","year":2023},"citing_paper":{"arxiv_id":"2608.11479","last_updated":"2026-08-11T22:43:50Z","snapshot_observed_at":"2026-08-15T23:10:14.549685Z","submitted_at":"2026-08-11T22:43:50Z","title":"Convergence Guarantees of Gradient Descent for Neural Networks via Generalized Lipschitz Smoothness","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T14:21:15.017856Z"},"links":{"cited_paper":"/paper/2305.08754","citing_paper":"/paper/2608.11479"},"observation_digest":"sha256:f18a098e274078ecae32aad8db8bb6b942b8a2cf6529effbffe6fa68a0cdfb37","observation_id":"9c3fb1da-5182-44fc-8265-3bacd58946b1","resolution":{"observed_at":"2026-08-15T14:21:15.188643Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.08957","last_updated":"2019-12-19T00:23:18Z","snapshot_observed_at":"2026-08-05T19:03:39.733993Z","submitted_at":"2019-12-19T00:23:18Z","title":"Optimization for deep learning: theory and algorithms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.08957","snapshot_observed_at":"2026-08-15T14:21:15.022280Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.11479","last_updated":"2026-08-11T22:43:50Z","snapshot_observed_at":"2026-08-15T23:10:14.549685Z","submitted_at":"2026-08-11T22:43:50Z","title":"Convergence Guarantees of Gradient Descent for Neural Networks via Generalized Lipschitz Smoothness","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T14:21:15.022280Z"},"links":{"cited_paper":"/paper/1912.08957","citing_paper":"/paper/2608.11479"},"observation_digest":"sha256:44f91293b8f1d055ef92991c132ac707c74da9dc2b5e4b5a9718da3a503e2920","observation_id":"6755e76f-2d0b-404a-8fe5-51aa1dc66a6b","resolution":{"observed_at":"2026-08-15T14:21:15.022280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13471","last_updated":"2023-06-26T19:19:31Z","snapshot_observed_at":"2026-08-16T15:30:54.749667Z","submitted_at":"2023-05-22T20:30:10Z","title":"Fast Convergence in Learning Two-Layer Neural Networks with Separable Data","version":2},"cited_work":{"arxiv_id":"2305.13471","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.13471","snapshot_observed_at":"2026-08-15T14:21:15.158323Z","title":"Fast Convergence in Learning Two-Layer Neural Networks with Separable Data","venue":"cs.LG","work_id":"50bdedd6-8a04-4b71-9d82-1e3992ab4422","year":2023},"citing_paper":{"arxiv_id":"2608.11479","last_updated":"2026-08-11T22:43:50Z","snapshot_observed_at":"2026-08-15T23:10:14.549685Z","submitted_at":"2026-08-11T22:43:50Z","title":"Convergence Guarantees of Gradient Descent for Neural Networks via Generalized Lipschitz Smoothness","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T14:21:15.026964Z"},"links":{"cited_paper":"/paper/2305.13471","citing_paper":"/paper/2608.11479"},"observation_digest":"sha256:b9ff4619ddb7c0842348f6cc464a834960473f04542b6641164ac31739c599c4","observation_id":"8aec346c-9aae-41ab-b477-5613299f2a35","resolution":{"observed_at":"2026-08-15T14:21:15.162189Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.30648","last_updated":"2026-05-28T23:05:45Z","snapshot_observed_at":"2026-07-06T23:39:53.132531Z","submitted_at":"2026-05-28T23:05:45Z","title":"Convergence of Steepest Descent and Adam under Non-Uniform Smoothness","version":1},"cited_work":{"arxiv_id":"2605.30648","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.30648","snapshot_observed_at":"2026-08-15T14:21:15.142758Z","title":"Convergence of Steepest Descent and Adam under Non-Uniform Smoothness","venue":"cs.LG","work_id":"4a334407-a122-4221-8b0d-c95c7cbfcff2","year":2026},"citing_paper":{"arxiv_id":"2608.11479","last_updated":"2026-08-11T22:43:50Z","snapshot_observed_at":"2026-08-15T23:10:14.549685Z","submitted_at":"2026-08-11T22:43:50Z","title":"Convergence Guarantees of Gradient Descent for Neural Networks via Generalized Lipschitz Smoothness","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T14:21:15.031082Z"},"links":{"cited_paper":"/paper/2605.30648","citing_paper":"/paper/2608.11479"},"observation_digest":"sha256:d2206f5b7fe2ab6ea1a8d936a7df9f4c0465f8fb08827a57a8a9e69cd27bbafd","observation_id":"ab03a82f-45f7-4cd2-b9c4-b0712dca37cc","resolution":{"observed_at":"2026-08-15T14:21:15.146914Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:21:15.510187Z","title":"Empirical Limitations of the NTK for Understanding Scaling Laws in Deep Learning","venue":null,"work_id":"e855a112-46ab-4ba2-af6d-48eec9a9f3a8","year":2023},"citing_paper":{"arxiv_id":"2608.11479","last_updated":"2026-08-11T22:43:50Z","snapshot_observed_at":"2026-08-15T23:10:14.549685Z","submitted_at":"2026-08-11T22:43:50Z","title":"Convergence Guarantees of Gradient Descent for Neural Networks via Generalized Lipschitz Smoothness","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T14:21:15.035004Z"},"links":{"citing_paper":"/paper/2608.11479"},"observation_digest":"sha256:03f6127d10c6a7be6407228fb50a79dbb3f7f9c794038e7e4a823e2eb823ee87","observation_id":"e0e93428-a93e-450c-afb4-71f06a29f56c","resolution":{"observed_at":"2026-08-15T14:21:15.513909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:21:15.500078Z","title":"Accelerating Rescaled Gradient Descent: Fast Optimization of Smooth Functions","venue":null,"work_id":"77ca3c47-4d20-4b4e-9303-6c704269c482","year":2019},"citing_paper":{"arxiv_id":"2608.11479","last_updated":"2026-08-11T22:43:50Z","snapshot_observed_at":"2026-08-15T23:10:14.549685Z","submitted_at":"2026-08-11T22:43:50Z","title":"Convergence Guarantees of Gradient Descent for Neural Networks via Generalized Lipschitz Smoothness","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T14:21:15.038584Z"},"links":{"citing_paper":"/paper/2608.11479"},"observation_digest":"sha256:0cc76c9e3e1e6bd83fef56d879274724dfe86c3c865445d0ee008be5d735b61a","observation_id":"5821e6c2-938d-4d3b-b76a-ff0663d7da99","resolution":{"observed_at":"2026-08-15T14:21:15.503367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:21:15.488849Z","title":"Kernel and Rich Regimes in Overparametrized Models","venue":null,"work_id":"02c34870-a636-4468-a7b2-850d1b95522b","year":2020},"citing_paper":{"arxiv_id":"2608.11479","last_updated":"2026-08-11T22:43:50Z","snapshot_observed_at":"2026-08-15T23:10:14.549685Z","submitted_at":"2026-08-11T22:43:50Z","title":"Convergence Guarantees of Gradient Descent for Neural Networks via Generalized Lipschitz Smoothness","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T14:21:15.041780Z"},"links":{"citing_paper":"/paper/2608.11479"},"observation_digest":"sha256:1723a54f037d8f0694fcd4c28611eb450cfcae9a6f4510518438458c287771d1","observation_id":"89f1a5ec-f06d-42c0-ab0b-2c49c1c520a0","resolution":{"observed_at":"2026-08-15T14:21:15.492918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:21:15.477462Z","title":"How Over-Parameterization Slows Down Gradient Descent in Matrix Sensing: The Curses of Symmetry and Initialization","venue":null,"work_id":"9160b121-c108-49d7-81bf-937d4109611f","year":2024},"citing_paper":{"arxiv_id":"2608.11479","last_updated":"2026-08-11T22:43:50Z","snapshot_observed_at":"2026-08-15T23:10:14.549685Z","submitted_at":"2026-08-11T22:43:50Z","title":"Convergence Guarantees of Gradient Descent for Neural Networks via Generalized Lipschitz Smoothness","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T14:21:15.045186Z"},"links":{"citing_paper":"/paper/2608.11479"},"observation_digest":"sha256:0d392b2298d04008422989eec3ec6fc601c0e4545c35409350aca977b6835bfa","observation_id":"4fe9efac-c325-4212-b0a1-689deb6440ba","resolution":{"observed_at":"2026-08-15T14:21:15.481008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:21:15.466608Z","title":"Linear Convergence of Gradient Descent For Finite Width Over-parametrized Linear Networks With General Initialization","venue":null,"work_id":"f230a2b1-fcc4-465f-99e7-6eaf4eb56b19","year":2023},"citing_paper":{"arxiv_id":"2608.11479","last_updated":"2026-08-11T22:43:50Z","snapshot_observed_at":"2026-08-15T23:10:14.549685Z","submitted_at":"2026-08-11T22:43:50Z","title":"Convergence Guarantees of Gradient Descent for Neural Networks via Generalized Lipschitz Smoothness","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T14:21:15.048642Z"},"links":{"citing_paper":"/paper/2608.11479"},"observation_digest":"sha256:0df9e1c6fdd988cc5f5376efb6bcc59e5b20a065f2448d1b1e49dee8eb890195","observation_id":"a25e1638-a39c-4fd3-920a-38e1e5fe263b","resolution":{"observed_at":"2026-08-15T14:21:15.470358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.14522","last_updated":"2022-07-15T17:04:24Z","snapshot_observed_at":"2026-08-10T23:48:51.698481Z","submitted_at":"2020-11-30T03:21:05Z","title":"Feature Learning in Infinite-Width Neural Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.14522","snapshot_observed_at":"2026-08-15T14:21:15.051860Z","title":"Hu.Feature Learning in Infinite-Width Neural Networks","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.11479","last_updated":"2026-08-11T22:43:50Z","snapshot_observed_at":"2026-08-15T23:10:14.549685Z","submitted_at":"2026-08-11T22:43:50Z","title":"Convergence Guarantees of Gradient Descent for Neural Networks via Generalized Lipschitz Smoothness","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T14:21:15.051860Z"},"links":{"cited_paper":"/paper/2011.14522","citing_paper":"/paper/2608.11479"},"observation_digest":"sha256:5141ac56e1e6314880c219c724013bb707ac26ade24e73ea8191108b10653e70","observation_id":"33ec3a62-484d-42ea-a4e2-13147bd778c4","resolution":{"observed_at":"2026-08-15T14:21:15.051860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:21:15.455427Z","title":"Adaptive Gradient Normalization and Independent Sampling for (Stochas- tic) Generalized-Smooth Optimization","venue":null,"work_id":"a9a55b6e-8ee1-4379-898c-8161fa299762","year":2025},"citing_paper":{"arxiv_id":"2608.11479","last_updated":"2026-08-11T22:43:50Z","snapshot_observed_at":"2026-08-15T23:10:14.549685Z","submitted_at":"2026-08-11T22:43:50Z","title":"Convergence Guarantees of Gradient Descent for Neural Networks via Generalized Lipschitz Smoothness","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T14:21:15.055468Z"},"links":{"citing_paper":"/paper/2608.11479"},"observation_digest":"sha256:288f65c781087aa15c715ced55cf68f1713211b6744d90f140a2587c00653f1f","observation_id":"9adb5e76-ac83-4441-b2d8-87a6a7698834","resolution":{"observed_at":"2026-08-15T14:21:15.458947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:21:15.444477Z","title":"On the Power and Limitations of Random Features for Un- derstanding Neural Networks","venue":null,"work_id":"3b8d7900-97ae-4b8c-9ad3-6ef81e40ea26","year":2019},"citing_paper":{"arxiv_id":"2608.11479","last_updated":"2026-08-11T22:43:50Z","snapshot_observed_at":"2026-08-15T23:10:14.549685Z","submitted_at":"2026-08-11T22:43:50Z","title":"Convergence Guarantees of Gradient Descent for Neural Networks via Generalized Lipschitz Smoothness","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T14:21:15.058581Z"},"links":{"citing_paper":"/paper/2608.11479"},"observation_digest":"sha256:0dcd9cf3027cbc55481449f0c650cd11d944c113234221d0cddb127c5a40399f","observation_id":"15842e5a-c3f4-4b41-a283-9f86ee021cce","resolution":{"observed_at":"2026-08-15T14:21:15.448119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:21:15.433541Z","title":"Why Gradient Clipping Accelerates Training: A Theoretical Justification for Adaptivity","venue":null,"work_id":"78f179b9-0d02-4227-be65-cc84cbbebba0","year":2020},"citing_paper":{"arxiv_id":"2608.11479","last_updated":"2026-08-11T22:43:50Z","snapshot_observed_at":"2026-08-15T23:10:14.549685Z","submitted_at":"2026-08-11T22:43:50Z","title":"Convergence Guarantees of Gradient Descent for Neural Networks via Generalized Lipschitz Smoothness","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T14:21:15.062219Z"},"links":{"citing_paper":"/paper/2608.11479"},"observation_digest":"sha256:0d9d6e1d1197e0a254dda9d56940f9ee476391bc224e975134b3d9b8176506c0","observation_id":"598d1c27-64c0-4ef8-b3aa-4fccdefa9e46","resolution":{"observed_at":"2026-08-15T14:21:15.437132Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.11479","last_updated":"2026-08-11T22:43:50Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-15T23:10:14.549685Z","submitted_at":"2026-08-11T22:43:50Z","title":"Convergence Guarantees of Gradient Descent for Neural Networks via Generalized Lipschitz Smoothness"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":2,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":8,"verified_exact":5,"verified_fuzzy":20},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 0 inbound Pith citation observations for arXiv:2608.11479."}