{"as_of":"2026-08-13T23:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:45e2cb7ee1e9b481a70d86e02262c46bce3c4649ea1ab4f7145db46717b2a11d","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:13:00.259466Z","state":"measured"},{"denominator":60,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":60,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.22578/citation-record","integrity":"/paper/2505.22578/integrity","json":"/paper/2505.22578/citation-record.json","paper":"/paper/2505.22578"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:09.075498Z","title":"Du, Wei Hu, Zhiyuan Li, and Ruosong Wang","venue":null,"work_id":"ff5e317a-9afb-4126-a3f1-cafa329c553e","year":2019},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-13T13:10:43.896449Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:54.332413Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:3b2ab83c606ab3642bb3b2cf5f080474007943718123f7af98984b290b1cd0b7","observation_id":"cf65120c-5e39-42e5-b796-7692035685d2","resolution":{"observed_at":"2026-08-07T13:13:09.203822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:08.810220Z","title":null,"venue":null,"work_id":"b8e45a86-0b82-4cf7-85a1-9f23b41921e3","year":2017},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-13T13:10:43.896449Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:54.377545Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:0aef68597a502faffa4537e07cb9424667fad3bf3af4ba83ab3488435df8ca27","observation_id":"83dd3c12-b08d-4f3a-81a2-57cb4c270077","resolution":{"observed_at":"2026-08-07T13:13:08.939482Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:08.563366Z","title":"Penalising the biases in norm regularisation enforces sparsity https://papers.neurips.cc/paper_files/paper/2023/hash/b444ad72520a5f5c467343be88e352ed-Abstract-Conference.html","venue":null,"work_id":"5e5da127-2563-45bb-8774-a648ef7b4d34","year":2023},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-13T13:10:43.896449Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:54.451054Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:1837a4a330d22c582d923f2fb3a7e7db3f124b9e5286b48666cdf13f3a92d95d","observation_id":"74c7d6ca-ef8d-41ef-a13f-d5ba1e3ad86e","resolution":{"observed_at":"2026-08-07T13:13:08.668772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2401.10791","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Early alignment in two-layer networks training is a two-edged sword 10.48550/arxiv.2401.10791","venue":"arXiv (Cornell University)","work_id":"5fe93717-9fd3-4ad9-82ac-bb9d02f03e72","year":2024},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-13T13:10:43.896449Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:54.531975Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:1f7ae2b4ecce8ae7119df6e9e62884f5299cefe11e968b31f18d107bd54d0d2d","observation_id":"9c1ef4dc-9322-4aff-a239-1c5c4fb6f1ca","resolution":{"observed_at":"2026-08-07T13:13:01.118361Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:08.428492Z","title":"Simplicity bias and optimization threshold in two-layer ReLU networks https://openreview.net/forum?id=qAarsvflTa","venue":null,"work_id":"d14498d0-ee07-46de-b8cf-f8ce5e090cc3","year":2025},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-13T13:10:43.896449Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:54.590775Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:a2615194daf832321f8ca35b29d84ff5ad982044468b9ef71503fe1a325a451f","observation_id":"f6a9376d-c56c-4135-ae90-47898d9cfd9c","resolution":{"observed_at":"2026-08-07T13:13:08.496137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:08.286234Z","title":null,"venue":null,"work_id":"16fee694-f7b5-4b00-97a4-87ad8ca80571","year":2022},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-13T13:10:43.896449Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:54.664933Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:68bb26ef9a4fe52b7be2f81dae401dee73ad32605e14307f56d67b45ccac92e8","observation_id":"792d70e4-35af-48d8-be78-090179834cc0","resolution":{"observed_at":"2026-08-07T13:13:08.357491Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:08.078258Z","title":"How Uniform Random Weights Induce Non-uniform Bias: Typical Interpolating Neural Networks Generalize with Narrow Teachers https://openreview.net/forum?id=3eHNvPHL9Z","venue":null,"work_id":"cb40c80e-71be-4341-94d0-dd3299deb2d4","year":2024},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-13T13:10:43.896449Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:54.756758Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:5ca7c423194cadc93a9ce6cb33d763b29af0e945b35fd7504ff1cf17c2040cfd","observation_id":"8f0db553-e388-4387-8853-a948e9210d09","resolution":{"observed_at":"2026-08-07T13:13:08.217059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2203.16462","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Convergence of gradient descent for deep neural networks 10.48550/arxiv.2203.16462","venue":"arXiv (Cornell University)","work_id":"50795789-d680-4bd1-93f3-568f57f5c61c","year":2022},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-13T13:10:43.896449Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:54.914089Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:09acbe838d641bd3c789cdf4600bc4756e1dfe4d3ec511eb83904f4b856caa64","observation_id":"9b1854d3-34d3-4136-9f96-688a9f2403c1","resolution":{"observed_at":"2026-08-07T13:13:00.843877Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:07.954344Z","title":"Loss Landscapes are All You Need: Neural Network Generalization Can Be Explained Without the Implicit Bias of Gradient Descent https://openreview.net/forum?id=QC10RmRbZy9","venue":null,"work_id":"572e15cd-db48-47b7-963f-75cb96c233e0","year":2023},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-13T13:10:43.896449Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:55.032252Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:31b9ef827f6532f64735bcc44cc3fe2999ff3273e06af9c81958ac132ce12c6d","observation_id":"03f525e9-9160-44a3-a045-08d516f2efe6","resolution":{"observed_at":"2026-08-07T13:13:08.001695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:07.946270Z","title":null,"venue":null,"work_id":"6cd72bed-0e7d-4f35-82c2-80b2d7066993","year":2023},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-13T13:10:43.896449Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:55.152527Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:cffc8607f28034ab0f5e3042bbe96791e02ab6869e5e98a7fa19f646c7f592d3","observation_id":"071cdf86-ea16-4c38-a119-33a3a0a780ff","resolution":{"observed_at":"2026-08-07T13:13:07.949186Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:07.811444Z","title":null,"venue":null,"work_id":"c518bde8-26c9-4c67-9b0e-24f42b9107b8","year":2018},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-13T13:10:43.896449Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:55.306196Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:15e4af08d9e8975a33167ce1a96469e865d8473810ef8ac7a9fae7df54fb4a98","observation_id":"38f3a440-21cb-4a86-8869-33e040ebb0ae","resolution":{"observed_at":"2026-08-07T13:13:07.918542Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:07.594311Z","title":null,"venue":null,"work_id":"be0b2e9c-13b3-44f5-b2aa-146ef9727257","year":2019},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-13T13:10:43.896449Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:55.474552Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:7e657a0cafc6d1ba4e52b1d9cd258d90a3ba1277ea9f5054016b9483589bd394","observation_id":"64cdbab3-38e7-43c0-a369-5bd2ede0cb6c","resolution":{"observed_at":"2026-08-07T13:13:07.701863Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:55.590174Z","title":null,"venue":null,"work_id":null,"year":1965},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-13T13:10:43.896449Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:55.590174Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:1d967eeb745fcbde4705433422340fa493cde78dfe87de5f629ddee4837a0bd1","observation_id":"e30d8cd1-5d7c-4bdb-91ac-65168652e6dd","resolution":{"observed_at":"2026-08-07T13:12:55.590174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2502.16977","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Bach, and Loucas Pillaud - Vivien","venue":"ArXiv.org","work_id":"f78a3958-9b64-418d-8900-31b0988d1bca","year":2025},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-13T13:10:43.896449Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:55.704138Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:79936e9ced161ed049a1f089403b2d774edcf78cc54988052b19c75e55dbb2df","observation_id":"b4bd2716-0494-4d02-bfb8-c1da6de70724","resolution":{"observed_at":"2026-08-07T13:13:00.630343Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:07.384425Z","title":null,"venue":null,"work_id":"985b6c41-3085-4efe-b94a-35b0cf714c86","year":2024},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-13T13:10:43.896449Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:55.846688Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:8e4ef0a6d91392edab12f37682a3b63e4837855aee3e3dca191c2e60b60a14fe","observation_id":"e8e52731-abf1-486f-b05d-36faeb95cf96","resolution":{"observed_at":"2026-08-07T13:13:07.503025Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:55.969941Z","title":"Kakade, and Jason D","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-13T13:10:43.896449Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:55.969941Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:9c731eb6f5740edd320734e1a6b67713c8123f48a42b37d1beacaecfd4007f52","observation_id":"79819969-13bd-4fc5-b1f9-a5e6b3778476","resolution":{"observed_at":"2026-08-07T13:12:55.969941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:07.091116Z","title":"https://www.jmlr.org/papers/v17/15-408.html CVXPY : A P ython-embedded modeling language for convex optimization","venue":null,"work_id":"0d5c30fa-b79b-4c91-9312-b9f1ae23870e","year":2016},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-13T13:10:43.896449Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:56.058268Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:6a9fc4541d2a3b747726719fd52fd54d76c19fb78def156993f720970a5fd14f","observation_id":"174a3a10-6587-46e7-8fa9-61538a6fc583","resolution":{"observed_at":"2026-08-07T13:13:07.256033Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:06.811017Z","title":"Hamprecht","venue":null,"work_id":"6ef436b7-15e8-4d81-8f38-7fba02678459","year":2018},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-13T13:10:43.896449Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:56.230864Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:0ecf371a388b2af9cbf4f8683817ec8aad7e91db4f26ba758968132274966f5d","observation_id":"28dc0c1e-59b1-41da-9bd7-e02db3e4f05f","resolution":{"observed_at":"2026-08-07T13:13:06.951243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:06.611056Z","title":"Du, Xiyu Zhai, Barnab \\' a s P \\' o czos, and Aarti Singh","venue":null,"work_id":"3e14bf5c-72b0-4642-9a4b-8740e824c6c0","year":2019},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-13T13:10:43.896449Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:56.343084Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:900872bbd0a86c6a20550f41a1fd5f0e131510b73704bcd2ab8c56c875d83174","observation_id":"2e16810a-a1fd-4a45-a54e-25e522cbd06a","resolution":{"observed_at":"2026-08-07T13:13:06.708498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:06.430466Z","title":"Convex Geometry and Duality of Over-parameterized Neural Networks http://jmlr.org/papers/v22/20-1447.html","venue":null,"work_id":"f0e77f9c-8574-4470-871a-d78f3149cbf6","year":2021},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-13T13:10:43.896449Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:56.443251Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:72e3c9b33fb96782dd828c7925e45bd4eea69e9ab5f44dc58c95c81d364d55fa","observation_id":"0b01b0f9-19ea-4923-afb6-ec89ca45688d","resolution":{"observed_at":"2026-08-07T13:13:06.540935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:06.235216Z","title":"An introduction to probability theory and its applications, volume 2","venue":null,"work_id":"703e6a4e-43b1-4f2a-a3ce-9ccb115adac5","year":1991},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-13T13:10:43.896449Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:56.535095Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:a81ffa9f1b6b1743a0fd3c1bdb7d1a5f8c3936f6f5488b791a351638d96a9953","observation_id":"b7873b5f-3ba9-4ee0-8a70-c6cd7daa7e7c","resolution":{"observed_at":"2026-08-07T13:13:06.364081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:05.993139Z","title":"Vetrov, and Andrew Gordon Wilson","venue":null,"work_id":"47b6cf5b-55f2-475b-a1d5-97b0a7177ad1","year":2018},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-13T13:10:43.896449Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:56.639192Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:02913728c4a571fa6d40a0c9b6ee98d856fa27b666d6b1bf27d92a373080accf","observation_id":"51ada76a-9c7e-49b9-b168-d8626d6c5b38","resolution":{"observed_at":"2026-08-07T13:13:06.086766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:05.851045Z","title":"https://openreview.net/forum?id=HgOJlxzB16 SGD Finds then Tunes Features in Two-Layer Neural Networks with near-Optimal Sample Complexity: A Case Study in the XOR problem","venue":null,"work_id":"db89ed97-facf-4566-87d7-a9dbbcc47e9b","year":2024},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-13T13:10:43.896449Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:56.757397Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:8663c5b1c55f215c8a10f1b832fe436d69d5a110dba5e83c5ecea4fa3e469859","observation_id":"f8d588e8-3ef4-433d-ae93-2cedfb5b5b9a","resolution":{"observed_at":"2026-08-07T13:13:05.911555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:05.728008Z","title":"Truth or backpropaganda? An empirical investigation of deep learning theory https://openreview.net/forum?id=HyxyIgHFvr","venue":null,"work_id":"f2c4e578-f650-4205-a272-bb19d9c63524","year":2020},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-13T13:10:43.896449Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:56.826153Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:a069da06a40f517c58114b65dc7e99249e066eaa623c4b85f7304ddfa8ca2982","observation_id":"28a6c832-38c5-4355-9f20-5bb655161c75","resolution":{"observed_at":"2026-08-07T13:13:05.787591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12762","last_updated":"2024-05-21T13:15:19Z","snapshot_observed_at":"2026-08-13T00:02:59.948350Z","submitted_at":"2024-05-21T13:15:19Z","title":"Clarabel: An interior-point solver for conic programs with quadratic objectives","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12762","snapshot_observed_at":"2026-08-07T13:12:56.938493Z","title":"Goulart and Yuwen Chen","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-13T13:10:43.896449Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:56.938493Z"},"links":{"cited_paper":"/paper/2405.12762","citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:f9bd51e3d4ab8b3cbc1a44c8ab677a3e54643aaecaa52420bfc9b37e592b696d","observation_id":"febe0f18-62a5-4f05-a621-8c1522f71328","resolution":{"observed_at":"2026-08-07T13:12:56.938493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:57.023287Z","title":"Haeffele and Ren \\' e Vidal","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-13T13:10:43.896449Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:57.023287Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:b751cdece35fea14660ea20a99bb1f1074660bf5a73a5228a1b878456b0a18bc","observation_id":"a96253ce-1c46-4c1f-b9cc-8169e7197c6b","resolution":{"observed_at":"2026-08-07T13:12:57.023287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:05.570695Z","title":"Piecewise linear activations substantially shape the loss surfaces of neural networks https://openreview.net/forum?id=B1x6BTEKwr","venue":null,"work_id":"de3c9e40-322c-4513-b98a-d220d330c320","year":2020},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-13T13:10:43.896449Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:57.197644Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:45fbebff96fce9b423f49d7f2d19bcbe172b2c0981c511170b19ebf3b39d00d3","observation_id":"12dd8075-579f-4650-b68b-bc03a8f58350","resolution":{"observed_at":"2026-08-07T13:13:05.676439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:57.324053Z","title":"Deep Residual Learning for Image Recognition 10.1109/cvpr.2016.90","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-13T13:10:43.896449Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:57.324053Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:0e6ec782b3b18e7d8eda6666821aaf1cd0b85ad3f9b5c6d15c71e1a72cd36c3d","observation_id":"c6928d55-1f75-46db-bb7c-805e90b5bf41","resolution":{"observed_at":"2026-08-07T13:12:57.324053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:05.382727Z","title":"Neural Tangent Kernel: Convergence and Generalization in Neural Networks https://proceedings.neurips.cc/paper/2018/hash/5a4be1fa34e62bb8a6ec6b91d2462f5a-Abstract.html","venue":null,"work_id":"e8a599c6-296c-4ea8-b7c7-64ffdbead779","year":2018},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-13T13:10:43.896449Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:57.442933Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:1fabe9ee4ff2321c2b4aeb45b1800fc4583ef8c75be3f452dc20e93d6035646e","observation_id":"752329bc-34da-4c9c-97ac-02aaa5a0259e","resolution":{"observed_at":"2026-08-07T13:13:05.456856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:57.560687Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-13T13:10:43.896449Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:57.560687Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:fc4e782aea2b19cd56c31de9fc632dd311e61103e9563702e467695414101891","observation_id":"16283734-4f5a-42f1-bc36-49195400c4fa","resolution":{"observed_at":"2026-08-07T13:12:57.560687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:05.186573Z","title":"Mildly Overparameterized ReLU Networks Have a Favorable Loss Landscape https://openreview.net/forum?id=10WARaIwFn","venue":null,"work_id":"04d0ec8d-ff20-4514-93c8-bfe446b1ca0b","year":2024},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-13T13:10:43.896449Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:57.708312Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:857d2f0e87c93d73fd42a1debefb3a9d26a219de5fbe9930cacd38485caa3e89","observation_id":"f4c597be-e459-448e-9c63-6d5b0870e528","resolution":{"observed_at":"2026-08-07T13:13:05.283568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:04.932037Z","title":"Deep Learning without Poor Local Minima https://proceedings.neurips.cc/paper/2016/hash/f2fc990265c712c49d51a18a32b39f0c-Abstract.html","venue":null,"work_id":"2a6db262-f141-4e5d-a60e-5fb7e6141948","year":2016},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-13T13:10:43.896449Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:57.835214Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:4359d63514177b4ef9b5fc2ff5369574de3bdeb2e68f8739b8a3483dfe41e2e3","observation_id":"46685940-4451-4b0e-8239-74ac682d9155","resolution":{"observed_at":"2026-08-07T13:13:05.082243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:04.760606Z","title":"Exploring The Loss Landscape Of Regularized Neural Networks Via Convex Duality https://openreview.net/forum?id=4xWQS2z77v","venue":null,"work_id":"6a62ab2d-90f4-41bf-bcda-2a4eb499e44d","year":2025},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-13T13:10:43.896449Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:57.920365Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:69b79de684e6ddafd5064e8261fc98777a34f616ff00e6f8038f0f573edf0e98","observation_id":"eee97ce2-6b4e-4dad-983b-60b3b5db89fb","resolution":{"observed_at":"2026-08-07T13:13:04.832441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:04.531973Z","title":"Deep Linear Networks with Arbitrary Loss: All Local Minima Are Global http://proceedings.mlr.press/v80/laurent18a.html","venue":null,"work_id":"0e1ec4f0-fbdd-49f2-a020-2067e383d14f","year":2018},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-13T13:10:43.896449Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:57.982098Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:dd0e806240b4c07025da67c9034ee682135e93a41a9ae24e37429727a3a59ba3","observation_id":"2dc68690-56d3-48db-8bf9-d4c0fb558842","resolution":{"observed_at":"2026-08-07T13:13:04.610229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:04.387932Z","title":"Michaud, and Max Tegmark","venue":null,"work_id":"4870c99b-cf07-4074-a724-14eabe22a688","year":2023},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-13T13:10:43.896449Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:58.075285Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:7d2beca5b0ca1f18dc2ede17f9a5efea22ab9cacf172e16a5e78bfe66db33255","observation_id":"e05247a5-00b8-498d-a4fc-57a01db631b3","resolution":{"observed_at":"2026-08-07T13:13:04.456563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:04.225646Z","title":"Gradient Descent on Two-layer Nets: Margin Maximization and Simplicity Bias https://proceedings.neurips.cc/paper/2021/hash/6c351da15b5e8a743a21ee96a86e25df-Abstract.html","venue":null,"work_id":"a2af208a-121c-4072-aa8b-692b92446ba4","year":2021},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-13T13:10:43.896449Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:58.144580Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:c786cea2ae2617816fe75ac23dec226c4ff9bde836d95b9aaf8311eb925a6717","observation_id":"79238af5-cf16-4216-898e-969faaaa50b1","resolution":{"observed_at":"2026-08-07T13:13:04.326855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:04.081028Z","title":"Lee, and Wei Hu","venue":null,"work_id":"275836de-b692-4d81-8bf9-c99f6088eef9","year":2024},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-13T13:10:43.896449Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:58.265403Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:943eca6dc85a167815db5bc6b8a03efd2d737c6b515401b59dc9e0dd2add2061","observation_id":"7dcba60d-5130-4eb8-a06f-75bed81ef595","resolution":{"observed_at":"2026-08-07T13:13:04.151036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.08367","last_updated":"2018-03-22T14:08:58Z","snapshot_observed_at":"2026-07-06T06:29:40.070023Z","submitted_at":"2018-03-22T14:08:58Z","title":"Gradient Descent Quantizes ReLU Network Features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.08367","snapshot_observed_at":"2026-08-07T13:12:58.348208Z","title":"Gradient Descent Quantizes ReLU Network Features http://arxiv.org/abs/1803.08367","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-13T13:10:43.896449Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:58.348208Z"},"links":{"cited_paper":"/paper/1803.08367","citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:74253fc282efc7a501d2dcb80d024146612c99a4b02a058dcac5b3be35dd08c8","observation_id":"7f4f4e97-1a83-4c3e-95aa-f8f1cb223d96","resolution":{"observed_at":"2026-08-07T13:12:58.348208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:58.426905Z","title":"A mean field view of the landscape of two-layer neural networks 10.1073/pnas.1806579115","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-13T13:10:43.896449Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:58.426905Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:f30e293952126d251b7a0fc6109bffa6afca64402ccc5e05a8d2488511cdec78","observation_id":"bb55700f-f0c9-4f44-a56d-d5e518060c56","resolution":{"observed_at":"2026-08-07T13:12:58.426905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:03.876494Z","title":"Early Neuron Alignment in Two-layer ReLU Networks with Small Initialization https://openreview.net/forum?id=QibPzdVrRu","venue":null,"work_id":"a37ef39d-b299-474c-9c24-0b18bc0db4e7","year":2024},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-13T13:10:43.896449Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:58.544465Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:579946053ff28362137261c050ef458d28d3a4fe941253a359e17be5b3d10ed4","observation_id":"349c5a1b-fa92-42ed-b34e-603a66389385","resolution":{"observed_at":"2026-08-07T13:13:03.976474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:03.692654Z","title":"Optimal Sets and Solution Paths of ReLU Networks https://proceedings.mlr.press/v202/mishkin23a.html","venue":null,"work_id":"d8f07f35-68d6-46ae-ab99-7406450974a1","year":2023},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-13T13:10:43.896449Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:58.664378Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:113826f9b48d25174a083c808e8bf53db90a871485cfd368e2e98dc65ab7006b","observation_id":"279e937b-4b17-45e4-bad8-8d78436d72b9","resolution":{"observed_at":"2026-08-07T13:13:03.780828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6614","last_updated":"2015-04-16T18:48:31Z","snapshot_observed_at":"2026-08-04T18:00:43.680629Z","submitted_at":"2014-12-20T06:52:25Z","title":"In Search of the Real Inductive Bias: On the Role of Implicit Regularization in Deep Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6614","snapshot_observed_at":"2026-08-07T13:12:58.738470Z","title":"In search of the real inductive bias: On the role of implicit regularization in deep learning 10.48550/arxiv.1412.6614","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-13T13:10:43.896449Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:58.738470Z"},"links":{"cited_paper":"/paper/1412.6614","citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:269ed58a57e82e227704868bb9354db5597e8af9d8b21926bc08ce4629b6468c","observation_id":"14ad19bc-d854-492b-9efd-5753fc7dc9e5","resolution":{"observed_at":"2026-08-07T13:12:58.738470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:03.529962Z","title":"On Connected Sublevel Sets in Deep Learning http://proceedings.mlr.press/v97/nguyen19a.html","venue":null,"work_id":"a1a6a08f-5b2d-46ce-9789-58dfdd4a6f61","year":2019},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-13T13:10:43.896449Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:58.852854Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:04604ec7fc113cd89eb87d2a58e0dd44dc112796a2c1b40ab15ce847cf27a5fa","observation_id":"7b1bb096-e0cc-491c-b36e-c123b365e76b","resolution":{"observed_at":"2026-08-07T13:13:03.632268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.08576","last_updated":"2021-01-21T12:43:26Z","snapshot_observed_at":"2026-08-10T11:25:53.784933Z","submitted_at":"2021-01-21T12:43:26Z","title":"A Note on Connectivity of Sublevel Sets in Deep Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.08576","snapshot_observed_at":"2026-08-07T13:12:58.964229Z","title":"A Note on Connectivity of Sublevel Sets in Deep Learning https://arxiv.org/abs/2101.08576","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-13T13:10:43.896449Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:58.964229Z"},"links":{"cited_paper":"/paper/2101.08576","citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:ec89839f0ce2f3a388e8d630ed89be46bbbcc667f5b5eeea502120823abf1349","observation_id":"9331022f-4f6d-48ce-b281-a344eee577ab","resolution":{"observed_at":"2026-08-07T13:12:58.964229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:03.374982Z","title":"When Are Solutions Connected in Deep Networks? https://proceedings.neurips.cc/paper/2021/hash/af5baf594e9197b43c9f26f17b205e5b-Abstract.html In NeurIPS, pages 20956--20969, 2021","venue":null,"work_id":"e90741e0-bb37-4301-b203-246c5464ff83","year":2021},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-13T13:10:43.896449Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:59.027410Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:e28f7ba5c14182330ae9c67fef306135439b9c88e0c79df1d172e80682484b1a","observation_id":"0d225fce-7953-4a55-ae08-b58b9f4cdc38","resolution":{"observed_at":"2026-08-07T13:13:03.463658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"6258.35463","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:01.358737Z","title":"Banach space representer theorems for neural networks and ridge splines https://dl.acm.org/doi/10.5555/3546258.3546301","venue":null,"work_id":"23aefc9a-4cce-4ff4-b91b-2a820b42f7b0","year":2021},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-13T13:10:43.896449Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:59.146372Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:216231af01f9b9e3f18dcd83e205861f676dc653962112387be9245698384519","observation_id":"ded24de2-dbb3-4229-b5a3-351500f6c86a","resolution":{"observed_at":"2026-08-07T13:13:01.452769Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:03.189086Z","title":"Neural Networks are Convex Regularizers: Exact Polynomial-time Convex Optimization Formulations for Two-layer Networks http://proceedings.mlr.press/v119/pilanci20a.html","venue":null,"work_id":"080c145d-b60f-43e9-bc64-ac6e2a2211df","year":2020},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-13T13:10:43.896449Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:59.231078Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:3d4772709dc7314bab99b64595db7801fd33a7ce05c4bb4a5ae9d7445beaa200","observation_id":"027e40ea-cedb-4cb4-bbe5-9e2f036d8106","resolution":{"observed_at":"2026-08-07T13:13:03.250869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.02177","last_updated":"2022-01-06T18:43:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-01-06T18:43:37Z","title":"Grokking: Generalization Beyond Overfitting on Small Algorithmic Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.02177","snapshot_observed_at":"2026-08-07T13:12:59.316611Z","title":"Grokking: Generalization Beyond Overfitting on Small Algorithmic Datasets https://arxiv.org/abs/2201.02177","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-13T13:10:43.896449Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:59.316611Z"},"links":{"cited_paper":"/paper/2201.02177","citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:b9bc658f619b898b1ca09b44c1c9864579b816abe752d5c9d14c09e623b33476","observation_id":"af995fc2-0e66-43c6-827f-2fdf0ae520e5","resolution":{"observed_at":"2026-08-07T13:12:59.316611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:59.419770Z","title":"Trainability and accuracy of artificial neural networks: An interacting particle system approach 10.1002/cpa.22074","venue":null,"work_id":null,"year":1935},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-13T13:10:43.896449Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:59.419770Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:da13e22ed5c5d8f18c3d762e6b45ff73626fc1e67a6f2f11570d37e55d867db6","observation_id":"147fe6d0-4954-400d-b601-98d8cdd4522c","resolution":{"observed_at":"2026-08-07T13:12:59.419770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:03.009540Z","title":"Spurious Local Minima are Common in Two-Layer ReLU Neural Networks http://proceedings.mlr.press/v80/safran18a.html","venue":null,"work_id":"26e971bb-c199-4805-8848-a79a76cb9131","year":2018},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-13T13:10:43.896449Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:59.498281Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:20dad76b91ead0df0abd6802ac108e0f8e2563084eea30815e19bc88e6e1c2c5","observation_id":"a7b54f09-d21b-4f87-9ddd-80e61a9a7a81","resolution":{"observed_at":"2026-08-07T13:13:03.111915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:02.839677Z","title":"How do infinite width bounded norm networks look in function space? http://proceedings.mlr.press/v99/savarese19a.html In COLT, pages 2667--2690, 2019","venue":null,"work_id":"3e17b5df-595e-4cbe-aa66-906452927ff4","year":2019},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-13T13:10:43.896449Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:59.586553Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:0ea66fb55374e6985bd6658b306d7cbdcf68603755ec93a3ad6373d6bc5d7cd3","observation_id":"f60e7662-4104-42ba-b431-718fd99987c1","resolution":{"observed_at":"2026-08-07T13:13:02.939431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:59.653892Z","title":"Understanding machine learning: From theory to algorithms 10.1017/CBO9781107298019","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-13T13:10:43.896449Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:59.653892Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:fe85d9c4118a50f0548d99a5d77f52d7459a466a7ff96185da869377abefc2cb","observation_id":"52ee293f-9430-491e-915b-45413cc09286","resolution":{"observed_at":"2026-08-07T13:12:59.653892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:02.577198Z","title":"Jamaloddin Golestani","venue":null,"work_id":"4ff86b76-946c-4857-aab1-07ad480e817f","year":2020},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-13T13:10:43.896449Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:59.707457Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:65de7921328a2e39f9541685a3785ef8d591d85bf486699bb0d0839865daa29f","observation_id":"3a176d66-6b8b-45b8-83d3-617a6339a7b5","resolution":{"observed_at":"2026-08-07T13:13:02.705425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:02.357842Z","title":"Geometry of the Loss Landscape in Overparameterized Neural Networks: Symmetries and Invariances http://proceedings.mlr.press/v139/simsek21a.html","venue":null,"work_id":"abfe1f58-037d-49b9-a2fd-ab29cecfabe9","year":2021},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-13T13:10:43.896449Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:59.787288Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:377ce6358d1a88a67facb67a48e158d74ba0d3f1ac60cb9bd84ea192193e6625","observation_id":"0855d4a2-ac27-4f9b-bfdc-55c07735c983","resolution":{"observed_at":"2026-08-07T13:13:02.467783Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:59.866232Z","title":"The Global Landscape of Neural Networks: An Overview 10.1109/msp.2020.3004124","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-13T13:10:43.896449Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:59.866232Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:9fdc3d567a4ff757ff94670ce2e11a42e390dae08bcaf8af7d76160033a22817","observation_id":"8fc4d611-2594-4d34-ab6c-1d366d687115","resolution":{"observed_at":"2026-08-07T13:12:59.866232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:02.180876Z","title":"Bandeira, and Joan Bruna","venue":null,"work_id":"c8de3167-cbf9-45e2-8433-decd24518210","year":2019},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-13T13:10:43.896449Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:59.972636Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:9bca29411f46abd9e25609397722c7d77539be3b5e8a3af75608e775debb25ea","observation_id":"42386525-5e0c-41b5-b985-efdf1ddaf1e1","resolution":{"observed_at":"2026-08-07T13:13:02.276608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:02.001090Z","title":"The Hidden Convex Optimization Landscape of Regularized Two-Layer ReLU Networks: an Exact Characterization of Optimal Solutions https://openreview.net/forum?id=Z7Lk2cQEG8a","venue":null,"work_id":"26b8d0b4-c7e5-4d7e-a4fa-d1045ca2be89","year":2022},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-13T13:10:43.896449Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T13:13:00.068517Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:160d304bc25f4e19dc79097f041cf0d28caaf0a39dde97c1363a67553d3cd17a","observation_id":"c461e396-90eb-48de-954c-3a24e8ad053d","resolution":{"observed_at":"2026-08-07T13:13:02.091759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.13530","last_updated":"2020-05-27T17:54:17Z","snapshot_observed_at":"2026-08-09T05:15:23.533151Z","submitted_at":"2020-05-27T17:54:17Z","title":"On the Convergence of Gradient Descent Training for Two-layer ReLU-networks in the Mean Field Regime","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.13530","snapshot_observed_at":"2026-08-07T13:13:00.129590Z","title":"On the Convergence of Gradient Descent Training for Two-layer ReLU-networks in the Mean Field Regime https://arxiv.org/abs/2005.13530","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-13T13:10:43.896449Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T13:13:00.129590Z"},"links":{"cited_paper":"/paper/2005.13530","citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:b9f0df290ff3eabc9acf8ee1600c79cc6651c10ef3f6dd7a990c3aa0adf48a44","observation_id":"064d0a4b-9a0b-4ce9-a5ac-6bb0e04fee23","resolution":{"observed_at":"2026-08-07T13:13:00.129590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:01.787562Z","title":"Woodworth, Suriya Gunasekar, Jason D","venue":null,"work_id":"4f0b02a7-408e-4175-9aad-206dc5b2cd39","year":2020},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-13T13:10:43.896449Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T13:13:00.191389Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:7da164174a6f69a29148fb88a1107aa729d6276921b0a36780b790d5aa36171f","observation_id":"047842c8-cae0-4b6f-88e8-63aebf6436ef","resolution":{"observed_at":"2026-08-07T13:13:01.882611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:01.635999Z","title":"Small nonlinearities in activation functions create bad local minima in neural networks https://openreview.net/forum?id=rke\\_YiRct7","venue":null,"work_id":"623d02dc-55f1-4eb9-ac7d-485b59a2bf13","year":2019},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-13T13:10:43.896449Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T13:13:00.259466Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:7916b3047fbdefabf44430442e93680f096cce6a2f1daa6a2f09bc06ae833919","observation_id":"a1e10686-1355-4d63-8293-7c13b534aa61","resolution":{"observed_at":"2026-08-07T13:13:01.699375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-13T13:10:43.896449Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":21,"verified_exact":3,"verified_fuzzy":35},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 0 inbound Pith citation observations for arXiv:2505.22578."}