{"as_of":"2026-08-17T09:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:054113f08359b263fd4caa320891b7a403bfd142acb4bd3f52bb8a9a5304517f","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:58:55.348402Z","state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T00:25:16.465309Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.11664","last_updated":"2025-05-16T19:57:22Z","snapshot_observed_at":"2026-08-16T16:27:04.521093Z","submitted_at":"2025-05-16T19:57:22Z","title":"A Local Polyak-Lojasiewicz and Descent Lemma of Gradient Descent For Overparametrized Linear Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.11664","snapshot_observed_at":"2026-08-04T00:25:16.465309Z","title":"A local Polyak-Łojasiewicz and descent lemma of gradient descent for overparametrized linear models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.01605","last_updated":"2026-06-21T04:15:05Z","snapshot_observed_at":"2026-08-15T20:52:39.564512Z","submitted_at":"2025-11-03T14:07:53Z","title":"The Optimization Landscape of Carath\\'eodory Decomposition of Toeplitz Covariances","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T00:25:16.465309Z"},"links":{"cited_paper":"/paper/2505.11664","citing_paper":"/paper/2511.01605"},"observation_digest":"sha256:c45ceb9c224168f7fa6833d508909d7ce4bf664358486376e1f739689f83a99e","observation_id":"39c2e58c-ee65-4b5d-82ab-0899222b0a13","resolution":{"observed_at":"2026-08-04T00:25:16.465309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.11664/citation-record","integrity":"/paper/2505.11664/integrity","json":"/paper/2505.11664/citation-record.json","paper":"/paper/2505.11664"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1810.02281","last_updated":"2019-10-26T06:58:22Z","snapshot_observed_at":"2026-08-15T13:24:42.177517Z","submitted_at":"2018-10-04T15:53:32Z","title":"A Convergence Analysis of Gradient Descent for Deep Linear Neural Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.02281","snapshot_observed_at":"2026-08-15T20:58:55.093409Z","title":"A convergence analysis of gradient descent for deep linear neural networks","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.11664","last_updated":"2025-05-16T19:57:22Z","snapshot_observed_at":"2026-08-16T16:27:04.521093Z","submitted_at":"2025-05-16T19:57:22Z","title":"A Local Polyak-Lojasiewicz and Descent Lemma of Gradient Descent For Overparametrized Linear Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T20:58:55.093409Z"},"links":{"cited_paper":"/paper/1810.02281","citing_paper":"/paper/2505.11664"},"observation_digest":"sha256:ab16e30acfff0bf1a98f70fae7abd4a6655563c11f16fcb9d64bcdbeded8a818","observation_id":"dc8accb0-e87d-4691-96f4-c95112fefc7c","resolution":{"observed_at":"2026-08-15T20:58:55.093409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:58:55.102963Z","title":"Convex optimization","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2505.11664","last_updated":"2025-05-16T19:57:22Z","snapshot_observed_at":"2026-08-16T16:27:04.521093Z","submitted_at":"2025-05-16T19:57:22Z","title":"A Local Polyak-Lojasiewicz and Descent Lemma of Gradient Descent For Overparametrized Linear Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T20:58:55.102963Z"},"links":{"citing_paper":"/paper/2505.11664"},"observation_digest":"sha256:427a61f00c337ba49f26af642fc633e31502fe1978ed8c32fca687def8c15bae","observation_id":"0a052f10-b2fe-423d-9bb3-41b0312bf1b8","resolution":{"observed_at":"2026-08-15T20:58:55.102963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:58:56.193520Z","title":"Spectral compressed sensing via structured matrix completion","venue":null,"work_id":"41d88453-9a77-428c-86fa-86ab2aff7ff0","year":2013},"citing_paper":{"arxiv_id":"2505.11664","last_updated":"2025-05-16T19:57:22Z","snapshot_observed_at":"2026-08-16T16:27:04.521093Z","submitted_at":"2025-05-16T19:57:22Z","title":"A Local Polyak-Lojasiewicz and Descent Lemma of Gradient Descent For Overparametrized Linear Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T20:58:55.115125Z"},"links":{"citing_paper":"/paper/2505.11664"},"observation_digest":"sha256:f9d9c1de58fc45d9223e32ca03cedd2f1e6c57e84813c6b6f77d408c669aca26","observation_id":"36bed00a-a8aa-4b1d-9e5b-037404e57dfd","resolution":{"observed_at":"2026-08-15T20:58:56.199723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.10782","last_updated":"2022-04-22T15:56:43Z","snapshot_observed_at":"2026-08-16T17:05:13.286715Z","submitted_at":"2022-04-22T15:56:43Z","title":"On Feature Learning in Neural Networks with Global Convergence Guarantees","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.10782","snapshot_observed_at":"2026-08-15T20:58:55.123804Z","title":"On feature learning in neural networks with global convergence guarantees","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.11664","last_updated":"2025-05-16T19:57:22Z","snapshot_observed_at":"2026-08-16T16:27:04.521093Z","submitted_at":"2025-05-16T19:57:22Z","title":"A Local Polyak-Lojasiewicz and Descent Lemma of Gradient Descent For Overparametrized Linear Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T20:58:55.123804Z"},"links":{"cited_paper":"/paper/2204.10782","citing_paper":"/paper/2505.11664"},"observation_digest":"sha256:caa7f6b57bea882c661b3d8afc174f75150883c9f4e43bddf01a3c919a8f9350","observation_id":"06c6b081-df56-4ae3-87e3-37786a5ea7b0","resolution":{"observed_at":"2026-08-15T20:58:55.123804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:58:55.129982Z","title":"On the global convergence of gradient descent for over-parameterized models using optimal transport","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.11664","last_updated":"2025-05-16T19:57:22Z","snapshot_observed_at":"2026-08-16T16:27:04.521093Z","submitted_at":"2025-05-16T19:57:22Z","title":"A Local Polyak-Lojasiewicz and Descent Lemma of Gradient Descent For Overparametrized Linear Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T20:58:55.129982Z"},"links":{"citing_paper":"/paper/2505.11664"},"observation_digest":"sha256:26bbf3d829d84363433e465153dd4b831554b2ed20bacef2c764607dcc6450a3","observation_id":"956a141d-acd8-4d1b-b971-1cd7efc48c42","resolution":{"observed_at":"2026-08-15T20:58:55.129982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:58:55.136766Z","title":"On lazy training in differentiable programming","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.11664","last_updated":"2025-05-16T19:57:22Z","snapshot_observed_at":"2026-08-16T16:27:04.521093Z","submitted_at":"2025-05-16T19:57:22Z","title":"A Local Polyak-Lojasiewicz and Descent Lemma of Gradient Descent For Overparametrized Linear Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T20:58:55.136766Z"},"links":{"citing_paper":"/paper/2505.11664"},"observation_digest":"sha256:cd1bf76a2b3dcdefc34dea96897cf705c80361c3e55a7e65bae5ff53c5df17be","observation_id":"b8a7cc03-19f1-439c-8c33-091b0f0fca1d","resolution":{"observed_at":"2026-08-15T20:58:55.136766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:58:55.143175Z","title":"Gradient descent with adaptive stepsize converges (nearly) linearly under fourth-order growth","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11664","last_updated":"2025-05-16T19:57:22Z","snapshot_observed_at":"2026-08-16T16:27:04.521093Z","submitted_at":"2025-05-16T19:57:22Z","title":"A Local Polyak-Lojasiewicz and Descent Lemma of Gradient Descent For Overparametrized Linear Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T20:58:55.143175Z"},"links":{"citing_paper":"/paper/2505.11664"},"observation_digest":"sha256:58ba19b3397602a5484f4855029c55f3df64da52bea51210ba73376b9aea3bd2","observation_id":"223dda5f-58cc-4e4d-b1f4-c49627cddc91","resolution":{"observed_at":"2026-08-15T20:58:55.143175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:58:56.145569Z","title":"Overparameterization of deep resnet: Zero loss and mean-field analysis","venue":null,"work_id":"2360f629-00af-4192-9373-783bef66c6cc","year":2022},"citing_paper":{"arxiv_id":"2505.11664","last_updated":"2025-05-16T19:57:22Z","snapshot_observed_at":"2026-08-16T16:27:04.521093Z","submitted_at":"2025-05-16T19:57:22Z","title":"A Local Polyak-Lojasiewicz and Descent Lemma of Gradient Descent For Overparametrized Linear Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T20:58:55.148543Z"},"links":{"citing_paper":"/paper/2505.11664"},"observation_digest":"sha256:2b22d02b47b29291f3ddba78bac72792f86d8d6616ee9d9b763185b86b3cbb30","observation_id":"8581951c-69e5-468e-83bf-7a4dda99af51","resolution":{"observed_at":"2026-08-15T20:58:56.153758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:58:56.126708Z","title":"Width provably matters in optimization for deep linear neural networks","venue":null,"work_id":"e192ccc4-b99b-4b04-8351-980bae8d43e3","year":2019},"citing_paper":{"arxiv_id":"2505.11664","last_updated":"2025-05-16T19:57:22Z","snapshot_observed_at":"2026-08-16T16:27:04.521093Z","submitted_at":"2025-05-16T19:57:22Z","title":"A Local Polyak-Lojasiewicz and Descent Lemma of Gradient Descent For Overparametrized Linear Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T20:58:55.153053Z"},"links":{"citing_paper":"/paper/2505.11664"},"observation_digest":"sha256:ea8a795330e95d677af906dddcfc379fdabe9d0e29f65a185810e0a662d6aaeb","observation_id":"0f93e3d4-6101-423d-99cd-7ff5b6dd4564","resolution":{"observed_at":"2026-08-15T20:58:56.132635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:58:56.104365Z","title":"Algorithmic regularization in learning deep homogeneous models: Layers are automatically balanced","venue":null,"work_id":"5fe0e231-1240-4dcd-a487-d9724254c603","year":2018},"citing_paper":{"arxiv_id":"2505.11664","last_updated":"2025-05-16T19:57:22Z","snapshot_observed_at":"2026-08-16T16:27:04.521093Z","submitted_at":"2025-05-16T19:57:22Z","title":"A Local Polyak-Lojasiewicz and Descent Lemma of Gradient Descent For Overparametrized Linear Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T20:58:55.161893Z"},"links":{"citing_paper":"/paper/2505.11664"},"observation_digest":"sha256:01fe2b984aa5797cdf582442cf1080dc2fdee888b0ad8e09f055c1a85c0f4a56","observation_id":"f53f6145-ad48-4472-a56c-40f79a9d1e4e","resolution":{"observed_at":"2026-08-15T20:58:56.110813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.02054","last_updated":"2019-02-05T01:59:59Z","snapshot_observed_at":"2026-08-14T18:19:41.565109Z","submitted_at":"2018-10-04T04:47:47Z","title":"Gradient Descent Provably Optimizes Over-parameterized Neural Networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.02054","snapshot_observed_at":"2026-08-15T20:58:55.168298Z","title":"Gradient descent provably optimizes over-parameterized neural networks","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.11664","last_updated":"2025-05-16T19:57:22Z","snapshot_observed_at":"2026-08-16T16:27:04.521093Z","submitted_at":"2025-05-16T19:57:22Z","title":"A Local Polyak-Lojasiewicz and Descent Lemma of Gradient Descent For Overparametrized Linear Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T20:58:55.168298Z"},"links":{"cited_paper":"/paper/1810.02054","citing_paper":"/paper/2505.11664"},"observation_digest":"sha256:96b20cc3eefd0fae7336299732b7732d4f8547e02d0eba5366b691fdd5d23ce8","observation_id":"e171d16b-a7bf-4937-be0d-001ef3ed2cbc","resolution":{"observed_at":"2026-08-15T20:58:55.168298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:58:56.083018Z","title":"Gradient descent provably solves nonlinear tomographic reconstruction","venue":null,"work_id":"20f3fd32-a835-4f13-a4be-9eff7b201d63","year":2023},"citing_paper":{"arxiv_id":"2505.11664","last_updated":"2025-05-16T19:57:22Z","snapshot_observed_at":"2026-08-16T16:27:04.521093Z","submitted_at":"2025-05-16T19:57:22Z","title":"A Local Polyak-Lojasiewicz and Descent Lemma of Gradient Descent For Overparametrized Linear Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T20:58:55.178244Z"},"links":{"citing_paper":"/paper/2505.11664"},"observation_digest":"sha256:b184ac953fb5f3351722aec1e81e3f5253805e8031af1a8b9bc17279058e50cc","observation_id":"253b037f-7e30-4e78-9490-141aaa301a13","resolution":{"observed_at":"2026-08-15T20:58:56.091473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:58:56.063893Z","title":"Learning dynamics of deep matrix factorization beyond the edge of stability","venue":null,"work_id":"f36c1b8d-96f2-4ae9-97b1-77acabcfaefd","year":2025},"citing_paper":{"arxiv_id":"2505.11664","last_updated":"2025-05-16T19:57:22Z","snapshot_observed_at":"2026-08-16T16:27:04.521093Z","submitted_at":"2025-05-16T19:57:22Z","title":"A Local Polyak-Lojasiewicz and Descent Lemma of Gradient Descent For Overparametrized Linear Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T20:58:55.184501Z"},"links":{"citing_paper":"/paper/2505.11664"},"observation_digest":"sha256:f4a37445f39b8e19082c599f20af5072403f89fa25434b6c66e62357e993d745","observation_id":"ccd09bf8-8bda-43c5-b310-ca9c14dba196","resolution":{"observed_at":"2026-08-15T20:58:56.069418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:58:56.035688Z","title":"Implicit regularization of discrete gradient dynamics in linear neural networks","venue":null,"work_id":"25f3ce23-d434-4663-b296-3c443cdfb705","year":2019},"citing_paper":{"arxiv_id":"2505.11664","last_updated":"2025-05-16T19:57:22Z","snapshot_observed_at":"2026-08-16T16:27:04.521093Z","submitted_at":"2025-05-16T19:57:22Z","title":"A Local Polyak-Lojasiewicz and Descent Lemma of Gradient Descent For Overparametrized Linear Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T20:58:55.190026Z"},"links":{"citing_paper":"/paper/2505.11664"},"observation_digest":"sha256:4176dc567f1a5b9b1007191cd219dd5c71a748d9f75d93e05b56f42561f8696d","observation_id":"b1aeff95-a250-4330-9a53-81764012fdcb","resolution":{"observed_at":"2026-08-15T20:58:56.047226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:58:55.196187Z","title":"Understanding the difficulty of training deep feedforward neural networks","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.11664","last_updated":"2025-05-16T19:57:22Z","snapshot_observed_at":"2026-08-16T16:27:04.521093Z","submitted_at":"2025-05-16T19:57:22Z","title":"A Local Polyak-Lojasiewicz and Descent Lemma of Gradient Descent For Overparametrized Linear Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T20:58:55.196187Z"},"links":{"citing_paper":"/paper/2505.11664"},"observation_digest":"sha256:c628f1094b2752e80eb2752d9e2d0f9eb9b0d9a91dfc3fcdc6eb58ca4c46c334","observation_id":"94e450f1-8599-4ce9-acb1-f96c702e815f","resolution":{"observed_at":"2026-08-15T20:58:55.196187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:58:55.202294Z","title":"Delving deep into rectifiers: Surpassing human-level performance on imagenet classification, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.11664","last_updated":"2025-05-16T19:57:22Z","snapshot_observed_at":"2026-08-16T16:27:04.521093Z","submitted_at":"2025-05-16T19:57:22Z","title":"A Local Polyak-Lojasiewicz and Descent Lemma of Gradient Descent For Overparametrized Linear Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T20:58:55.202294Z"},"links":{"citing_paper":"/paper/2505.11664"},"observation_digest":"sha256:09b656bf508131a8bc3a0268cc2000056f6735638bdf390642196b28c4fc608e","observation_id":"73e3b003-7fab-4b74-a865-2c71c1b156c1","resolution":{"observed_at":"2026-08-15T20:58:55.202294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:58:55.213813Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.11664","last_updated":"2025-05-16T19:57:22Z","snapshot_observed_at":"2026-08-16T16:27:04.521093Z","submitted_at":"2025-05-16T19:57:22Z","title":"A Local Polyak-Lojasiewicz and Descent Lemma of Gradient Descent For Overparametrized Linear Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T20:58:55.213813Z"},"links":{"citing_paper":"/paper/2505.11664"},"observation_digest":"sha256:bf8064d2592b4c375f126fddd743e9352094b4614bd7aba870df509c6d49f0b1","observation_id":"851289cd-95fb-47e9-9fdd-45c715637d1c","resolution":{"observed_at":"2026-08-15T20:58:55.213813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:58:55.220096Z","title":"Neural tangent kernel: Convergence and generalization in neural networks","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.11664","last_updated":"2025-05-16T19:57:22Z","snapshot_observed_at":"2026-08-16T16:27:04.521093Z","submitted_at":"2025-05-16T19:57:22Z","title":"A Local Polyak-Lojasiewicz and Descent Lemma of Gradient Descent For Overparametrized Linear Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T20:58:55.220096Z"},"links":{"citing_paper":"/paper/2505.11664"},"observation_digest":"sha256:4c18f8db80001c2bf0b8087edd34fa39b71269047cdc226505de3e094da9a4f6","observation_id":"31bf8418-ad56-40b0-aef7-a2a5c29af3c8","resolution":{"observed_at":"2026-08-15T20:58:55.220096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:58:55.941474Z","title":"Linear convergence of gradient and proximal-gradient methods under the polyak- ojasiewicz condition, 2020","venue":null,"work_id":"fbb7d1cb-34f7-4e3b-919c-88a85b89b178","year":2020},"citing_paper":{"arxiv_id":"2505.11664","last_updated":"2025-05-16T19:57:22Z","snapshot_observed_at":"2026-08-16T16:27:04.521093Z","submitted_at":"2025-05-16T19:57:22Z","title":"A Local Polyak-Lojasiewicz and Descent Lemma of Gradient Descent For Overparametrized Linear Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T20:58:55.226857Z"},"links":{"citing_paper":"/paper/2505.11664"},"observation_digest":"sha256:ba75591458da15762a5e4908148f2b9c2dfac32388fb9e8e3699c84c86d0bd05","observation_id":"afdd8ae9-129c-45e0-9e31-cf4af9932455","resolution":{"observed_at":"2026-08-15T20:58:55.959418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:58:55.232271Z","title":"Matrix factorization techniques for recommender systems","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.11664","last_updated":"2025-05-16T19:57:22Z","snapshot_observed_at":"2026-08-16T16:27:04.521093Z","submitted_at":"2025-05-16T19:57:22Z","title":"A Local Polyak-Lojasiewicz and Descent Lemma of Gradient Descent For Overparametrized Linear Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T20:58:55.232271Z"},"links":{"citing_paper":"/paper/2505.11664"},"observation_digest":"sha256:231b6f9b06d4772d2eea2f3c2e5b063e7278ee7d2ffa64c6ad89ea9248f44721","observation_id":"7cecdcd8-b1bf-41b0-8714-98e32730dd97","resolution":{"observed_at":"2026-08-15T20:58:55.232271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:58:55.238555Z","title":"Wide neural networks of any depth evolve as linear models under gradient descent","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.11664","last_updated":"2025-05-16T19:57:22Z","snapshot_observed_at":"2026-08-16T16:27:04.521093Z","submitted_at":"2025-05-16T19:57:22Z","title":"A Local Polyak-Lojasiewicz and Descent Lemma of Gradient Descent For Overparametrized Linear Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T20:58:55.238555Z"},"links":{"citing_paper":"/paper/2505.11664"},"observation_digest":"sha256:a70b9f293d098f77e0c7688f8db8bb4587f4e03a29758983ccd7dd13bef2a401","observation_id":"05b16bb5-6a8a-4415-8cb1-73527d25df3d","resolution":{"observed_at":"2026-08-15T20:58:55.238555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:58:55.244939Z","title":"Loss landscapes and optimization in over-parameterized non-linear systems and neural networks","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.11664","last_updated":"2025-05-16T19:57:22Z","snapshot_observed_at":"2026-08-16T16:27:04.521093Z","submitted_at":"2025-05-16T19:57:22Z","title":"A Local Polyak-Lojasiewicz and Descent Lemma of Gradient Descent For Overparametrized Linear Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T20:58:55.244939Z"},"links":{"citing_paper":"/paper/2505.11664"},"observation_digest":"sha256:8936fc98258102fd9eb46b2207acfbd9fdf026a7fc13a9a79fa44c10a316b61c","observation_id":"6afe3676-1505-48c4-b114-f37a88b45ba6","resolution":{"observed_at":"2026-08-15T20:58:55.244939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:58:55.250687Z","title":"A mean field view of the landscape of two-layer neural networks","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.11664","last_updated":"2025-05-16T19:57:22Z","snapshot_observed_at":"2026-08-16T16:27:04.521093Z","submitted_at":"2025-05-16T19:57:22Z","title":"A Local Polyak-Lojasiewicz and Descent Lemma of Gradient Descent For Overparametrized Linear Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T20:58:55.250687Z"},"links":{"citing_paper":"/paper/2505.11664"},"observation_digest":"sha256:858e5ab387582c6f500f9a65fbfff58a7249d7c05b128c0260e9ecbf0d347b56","observation_id":"4fd9b5e7-53a9-4da3-81d3-44fe71515d5a","resolution":{"observed_at":"2026-08-15T20:58:55.250687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:58:55.847647Z","title":"On the explicit role of initialization on the convergence and implicit bias of overparametrized linear networks","venue":null,"work_id":"e1cb5bde-154f-47cb-b5d9-b5683e2ade6d","year":2021},"citing_paper":{"arxiv_id":"2505.11664","last_updated":"2025-05-16T19:57:22Z","snapshot_observed_at":"2026-08-16T16:27:04.521093Z","submitted_at":"2025-05-16T19:57:22Z","title":"A Local Polyak-Lojasiewicz and Descent Lemma of Gradient Descent For Overparametrized Linear Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T20:58:55.256652Z"},"links":{"citing_paper":"/paper/2505.11664"},"observation_digest":"sha256:600f7a979be371563ec8554be4e93243898220e8a72cb7bd3e3b4ee691b8678a","observation_id":"96e5b7d0-d01a-4d3b-86e6-a15d89b81656","resolution":{"observed_at":"2026-08-15T20:58:55.860324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.06351","last_updated":"2022-05-16T17:48:25Z","snapshot_observed_at":"2026-08-16T18:24:56.453635Z","submitted_at":"2021-05-13T15:13:51Z","title":"Convergence and Implicit Bias of Gradient Flow on Overparametrized Linear Networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.06351","snapshot_observed_at":"2026-08-15T20:58:55.263712Z","title":"Convergence and implicit bias of gradient flow on overparametrized linear networks","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.11664","last_updated":"2025-05-16T19:57:22Z","snapshot_observed_at":"2026-08-16T16:27:04.521093Z","submitted_at":"2025-05-16T19:57:22Z","title":"A Local Polyak-Lojasiewicz and Descent Lemma of Gradient Descent For Overparametrized Linear Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T20:58:55.263712Z"},"links":{"cited_paper":"/paper/2105.06351","citing_paper":"/paper/2505.11664"},"observation_digest":"sha256:f3f73b0124147359bc3d6692e3f97529728ae2002d1bbf50606588db7c4e9328","observation_id":"51fa7623-a15c-4844-8934-5a57f8968c01","resolution":{"observed_at":"2026-08-15T20:58:55.263712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:58:55.827137Z","title":"On the convergence of gradient flow on multi-layer linear models","venue":null,"work_id":"4de802f3-1c45-428d-88d6-9ce808251e7a","year":2023},"citing_paper":{"arxiv_id":"2505.11664","last_updated":"2025-05-16T19:57:22Z","snapshot_observed_at":"2026-08-16T16:27:04.521093Z","submitted_at":"2025-05-16T19:57:22Z","title":"A Local Polyak-Lojasiewicz and Descent Lemma of Gradient Descent For Overparametrized Linear Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T20:58:55.273975Z"},"links":{"citing_paper":"/paper/2505.11664"},"observation_digest":"sha256:7db6d2ad17ff8f91ad1e1a9647717d25f66b938efe1a03249c9755e2d16fde47","observation_id":"2d9b9093-eb98-4809-8956-b865bfffe1e5","resolution":{"observed_at":"2026-08-15T20:58:55.834479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.02040","last_updated":"2021-11-24T15:22:42Z","snapshot_observed_at":"2026-08-16T18:05:19.627137Z","submitted_at":"2021-08-04T13:10:30Z","title":"Convergence of gradient descent for learning linear neural networks","version":2},"cited_work":{"arxiv_id":"2108.02040","doi":null,"metadata_source":"pith","pith_arxiv_id":"2108.02040","snapshot_observed_at":"2026-08-15T20:58:55.457386Z","title":"Convergence of gradient descent for learning linear neural networks","venue":"cs.LG","work_id":"6ed2b6b1-843a-4239-91e7-44dd484e1765","year":2021},"citing_paper":{"arxiv_id":"2505.11664","last_updated":"2025-05-16T19:57:22Z","snapshot_observed_at":"2026-08-16T16:27:04.521093Z","submitted_at":"2025-05-16T19:57:22Z","title":"A Local Polyak-Lojasiewicz and Descent Lemma of Gradient Descent For Overparametrized Linear Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T20:58:55.283001Z"},"links":{"cited_paper":"/paper/2108.02040","citing_paper":"/paper/2505.11664"},"observation_digest":"sha256:418d22376bc82473417f7dedc89a2354052a46e3810715d9cab8896561c05ab8","observation_id":"7eb8f73b-f146-4f4d-ba45-d318a1e9dd93","resolution":{"observed_at":"2026-08-15T20:58:55.466939Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:58:55.291716Z","title":"Global convergence of deep networks with one wide layer followed by pyramidal topology","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.11664","last_updated":"2025-05-16T19:57:22Z","snapshot_observed_at":"2026-08-16T16:27:04.521093Z","submitted_at":"2025-05-16T19:57:22Z","title":"A Local Polyak-Lojasiewicz and Descent Lemma of Gradient Descent For Overparametrized Linear Models","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T20:58:55.291716Z"},"links":{"citing_paper":"/paper/2505.11664"},"observation_digest":"sha256:573ac53c7a3a2698149629fec060ea08a6c3d2015fbf3664f5744803bdc300a9","observation_id":"64cfcfa8-d746-4b01-bb33-cdd9bb5453b7","resolution":{"observed_at":"2026-08-15T20:58:55.291716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:58:55.794969Z","title":"Gradient methods for the minimisation of functionals","venue":null,"work_id":"1f30d69d-1400-4378-8afa-c865594c8554","year":1963},"citing_paper":{"arxiv_id":"2505.11664","last_updated":"2025-05-16T19:57:22Z","snapshot_observed_at":"2026-08-16T16:27:04.521093Z","submitted_at":"2025-05-16T19:57:22Z","title":"A Local Polyak-Lojasiewicz and Descent Lemma of Gradient Descent For Overparametrized Linear Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T20:58:55.298554Z"},"links":{"citing_paper":"/paper/2505.11664"},"observation_digest":"sha256:927f5e66010ae2d2fae456869531cdadc29d57d566d879db67a1375fad7795d5","observation_id":"f371bb70-e562-4eb4-90e9-01d78a83ad6a","resolution":{"observed_at":"2026-08-15T20:58:55.800333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6120","last_updated":"2014-02-19T17:26:57Z","snapshot_observed_at":"2026-08-14T23:50:45.351114Z","submitted_at":"2013-12-20T20:24:00Z","title":"Exact solutions to the nonlinear dynamics of learning in deep linear neural networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6120","snapshot_observed_at":"2026-08-15T20:58:55.308511Z","title":"Exact solutions to the nonlinear dynamics of learning in deep linear neural networks","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2505.11664","last_updated":"2025-05-16T19:57:22Z","snapshot_observed_at":"2026-08-16T16:27:04.521093Z","submitted_at":"2025-05-16T19:57:22Z","title":"A Local Polyak-Lojasiewicz and Descent Lemma of Gradient Descent For Overparametrized Linear Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T20:58:55.308511Z"},"links":{"cited_paper":"/paper/1312.6120","citing_paper":"/paper/2505.11664"},"observation_digest":"sha256:a35cb19c9a38a5fad2a892abe0c13763774e00dab28e117af7f588c1dd4ea339","observation_id":"e3e707bc-7fb9-4ac5-9ee3-67cc2ef0ac8f","resolution":{"observed_at":"2026-08-15T20:58:55.308511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:58:55.316795Z","title":"Mean field analysis of neural networks: A law of large numbers","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.11664","last_updated":"2025-05-16T19:57:22Z","snapshot_observed_at":"2026-08-16T16:27:04.521093Z","submitted_at":"2025-05-16T19:57:22Z","title":"A Local Polyak-Lojasiewicz and Descent Lemma of Gradient Descent For Overparametrized Linear Models","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T20:58:55.316795Z"},"links":{"citing_paper":"/paper/2505.11664"},"observation_digest":"sha256:d42331842e4b3a37e53e150d733d28eb0121f0f61ff391fa2f8b4239d819cb99","observation_id":"9f1181db-b87f-4d8e-ae98-a872b4e1399a","resolution":{"observed_at":"2026-08-15T20:58:55.316795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:58:55.747115Z","title":"Understanding the dynamics of gradient flow in overparameterized linear models","venue":null,"work_id":"c9498d52-46c9-4e91-b394-3162f4e4fdbd","year":2021},"citing_paper":{"arxiv_id":"2505.11664","last_updated":"2025-05-16T19:57:22Z","snapshot_observed_at":"2026-08-16T16:27:04.521093Z","submitted_at":"2025-05-16T19:57:22Z","title":"A Local Polyak-Lojasiewicz and Descent Lemma of Gradient Descent For Overparametrized Linear Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-15T20:58:55.323611Z"},"links":{"citing_paper":"/paper/2505.11664"},"observation_digest":"sha256:b0d6bbf3e514e5fd694fbc7c28f3b50c06a9048d5dd1dd49198dda98199b8369","observation_id":"4eaf94c2-daf8-4862-a101-556370616dfe","resolution":{"observed_at":"2026-08-15T20:58:55.762828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.07416","last_updated":"2018-03-16T18:49:22Z","snapshot_observed_at":"2026-08-14T19:35:20.214745Z","submitted_at":"2018-03-16T18:49:22Z","title":"Tensor2Tensor for Neural Machine Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.07416","snapshot_observed_at":"2026-08-15T20:58:55.329507Z","title":"Tensor2tensor for neural machine translation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.11664","last_updated":"2025-05-16T19:57:22Z","snapshot_observed_at":"2026-08-16T16:27:04.521093Z","submitted_at":"2025-05-16T19:57:22Z","title":"A Local Polyak-Lojasiewicz and Descent Lemma of Gradient Descent For Overparametrized Linear Models","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T20:58:55.329507Z"},"links":{"cited_paper":"/paper/1803.07416","citing_paper":"/paper/2505.11664"},"observation_digest":"sha256:59622e09485de140b16c1574407134abea8e37ffefba3507c731367a820aeced","observation_id":"266fb370-78cb-4933-9bd5-e3640bc0ad32","resolution":{"observed_at":"2026-08-15T20:58:55.329507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:58:55.335484Z","title":"High-dimensional probability: An introduction with applications in data science, volume 47","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.11664","last_updated":"2025-05-16T19:57:22Z","snapshot_observed_at":"2026-08-16T16:27:04.521093Z","submitted_at":"2025-05-16T19:57:22Z","title":"A Local Polyak-Lojasiewicz and Descent Lemma of Gradient Descent For Overparametrized Linear Models","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T20:58:55.335484Z"},"links":{"citing_paper":"/paper/2505.11664"},"observation_digest":"sha256:b505ba5fec51caad32430ae86138f93d1878fae1cb969d4683bc516ca5ee0f6b","observation_id":"cd01c3ab-011f-4929-9be5-71cd6f4bbf3e","resolution":{"observed_at":"2026-08-15T20:58:55.335484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:58:55.706638Z","title":"Linear convergence of gradient descent for finite width over-parametrized linear networks with general initialization","venue":null,"work_id":"688d4f2c-a303-41f6-9f8e-25e9408d8d0e","year":2023},"citing_paper":{"arxiv_id":"2505.11664","last_updated":"2025-05-16T19:57:22Z","snapshot_observed_at":"2026-08-16T16:27:04.521093Z","submitted_at":"2025-05-16T19:57:22Z","title":"A Local Polyak-Lojasiewicz and Descent Lemma of Gradient Descent For Overparametrized Linear Models","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-15T20:58:55.342664Z"},"links":{"citing_paper":"/paper/2505.11664"},"observation_digest":"sha256:2a88da0c7d7ff8f7f91a87d7e772635b2806d5b71d2a9ce1e17b22a7472913d6","observation_id":"b94095eb-8f34-4ba9-8876-c67e6935574c","resolution":{"observed_at":"2026-08-15T20:58:55.711875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:58:55.348402Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.11664","last_updated":"2025-05-16T19:57:22Z","snapshot_observed_at":"2026-08-16T16:27:04.521093Z","submitted_at":"2025-05-16T19:57:22Z","title":"A Local Polyak-Lojasiewicz and Descent Lemma of Gradient Descent For Overparametrized Linear Models","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-15T20:58:55.348402Z"},"links":{"citing_paper":"/paper/2505.11664"},"observation_digest":"sha256:f4d0342ed7467ef60c85341126c86473f62d4965ae83b4e588a02c7038ecb558","observation_id":"c18ad132-23f9-45f1-b785-4a94da9df476","resolution":{"observed_at":"2026-08-15T20:58:55.348402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.11664","last_updated":"2025-05-16T19:57:22Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T16:27:04.521093Z","submitted_at":"2025-05-16T19:57:22Z","title":"A Local Polyak-Lojasiewicz and Descent Lemma of Gradient Descent For Overparametrized Linear Models"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":1,"verified_fuzzy":13},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 1 inbound Pith citation observation for arXiv:2505.11664."}