{"as_of":"2026-08-18T17:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5bea14646d569dccebeede92adcbfd8ee0de59010e4d704a3b764e4ac93a5ead","coverage":[{"denominator":117,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T13:20:54.303605Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.29152/citation-record","integrity":"/paper/2605.29152/integrity","json":"/paper/2605.29152/citation-record.json","paper":"/paper/2605.29152"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":"Under- standing deep learning (still) requires rethinking generalization.Communications of the ACM, 64(3):107–115, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:88cb8b7036a92f8759b738bbf6ffc75754329f3f2687306e5ab0228c10d1cae9","observation_id":"2c596934-f23a-40f8-9017-b6ef815f24b2","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":"Strogatz.Nonlinear Dynamics and Chaos: With Applications to Physics, Biology, Chemistry, and Engineering","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:aef2e2d63c35066634fc158da3b9beaf2ccdeb0095bd92ea614dfb41fdbd0f7e","observation_id":"a1a0c1f8-4739-4246-aef6-ea1ff90c7140","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":"Hirsch, Stephen Smale, and Robert L","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:86b085278d8c900391e5ef15c61e3376463915bd3e5672e808a0e0d5b99d43f6","observation_id":"365f77c3-23c8-4e91-b5c1-12d02b0c9ab9","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":"On the explicit role of initialization on the convergence and implicit bias of overparametrized linear networks","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:b9fbfbc81059306e0ca57b2b43abb624d3233a6b1dde8ddb3d9d12c27fd8a28f","observation_id":"a8dc0dd6-2ad0-4919-8139-114961bb7023","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":"On the role of initialization on the implicit bias in deep linear networks, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:5eb334ac4a60ad840aede2eab57484040806bbb2b5eaabec1b484e43030a3356","observation_id":"9bbd45a2-25a2-4cac-9aba-619c2991b4b8","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":"Camargo, and Ard A","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:23a00692d92c088bdc4c6b51c653d2c08cb723242db738c900604b23bf6287df","observation_id":"311b77d0-a8c9-40bf-9851-b9eff4705123","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:6acc95f5029857e5a4975d1067fa152f0abd345c889475d66db976ff809e08c6","observation_id":"55828dee-4045-40d1-b9c5-687c5e5ed24f","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.01217","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T13:28:19.561748Z","title":"Deep-layered machines have a built-in occam’s razor.arXiv preprint arXiv:2603.01217, 2026","venue":null,"work_id":"ef0e795f-c9c6-4bed-a645-d29234ed518a","year":2026},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:7f0209ab6a5e097bee2e4ce1102de112dcc4442d2a8ae23f2da07f6bab4b9a8b","observation_id":"a3eae809-5fbf-48e1-ad15-e3f0cec5ed3c","resolution":{"observed_at":"2026-06-29T13:23:28.016757Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":"Understanding the difficulty of training deep feedforward neural networks","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:0c2997a9d974d96cc9c49861972a6037d5f052ea5ffaed558a9a4c3a24bfcb4e","observation_id":"dea8f9d5-5d6e-49f7-a8c9-85716021f7f8","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":"Delving deep into rectifiers: Surpassing human-level performance on imagenet classification","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:08798d27571453704a2af99756c43f5481d37d7c1382eb36c81f64ca53792cac","observation_id":"1eb131bb-0efb-4b6f-97a1-dec28122bf92","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":"Exponential expressivity in deep neural networks through transient chaos","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:832aeb2aac55eb8748d300db066afe757481dba1f628dca9dbd85c296bbfc016","observation_id":"4dcdbf97-575d-424a-a620-f8d408f6edfc","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":"Schoenholz, Justin Gilmer, Surya Ganguli, and Jascha Sohl-Dickstein","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:26b3dcee4745198cab3cf8e794323985ef55c9340fd19472c85cfd96538cb920","observation_id":"6052ce46-ae6c-4d81-9b06-e86ae353e396","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":"Schoenholz, and Surya Ganguli","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:b98ae6c122172b6f9687751b75b6cc8d6b5f75e982968c1aa321da275fa7c39a","observation_id":"1e3f62e5-b038-43ab-a15e-e8af80274ee3","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":"How to start training: The effect of initialization and architecture","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:d5f08572ea0826cfe1201c0884d0771935a4a303195f7346889583cd3cb05b6c","observation_id":"835c2b17-2a4e-4936-8062-399c6210206d","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":"Which neural net architectures give rise to exploding and vanishing gradients? InAdvances in Neural Information Processing Systems, volume 31, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:d449e11bf9a6d53221390cc6a97e23bea16cc769ac891bb958ffc8b899d47aa8","observation_id":"1fab6d43-6efe-4589-8dd9-05457b30f321","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":"Schoenholz, and Jeffrey Pennington","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:0636fc8d8861b23c2b88f93a506ae9eda9bc664b95248a9ad6d44bfd13ec1c7f","observation_id":"7031d63b-4391-429f-a54f-611d2b1f7280","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":"Schoenholz","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:99067c6c40aa500661202278cdcf0739073ea3a42b892bf8eac131bcb1b28729","observation_id":"1ab31dda-82de-44fe-961f-bc675b43c1fd","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:8529c2b1fddf071f641ae01bf5c6fbfb55adab38ac81f0f7dd276658b8a20fa6","observation_id":"b53f382f-42ae-4071-8ead-7ed8ac60d03f","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":"Hu, Igor Babuschkin, Szymon Sidor, Xiaodong Liu, David Farhi, Nick Ryder, Jakub Pachocki, Weizhu Chen, and Jianfeng Gao","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:50511d30fffb07eaebad810d6f146704127fecf9e08505e8be712ce43b1a413f","observation_id":"87ffc089-f4cb-48e6-9e4e-ea0bc163f5d5","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":"Self-consistent dynamical field theory of kernel evo- lution in wide neural networks.Journal of Statistical Mechanics: Theory and Experiment, 2023(11):114009, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:bff690a0b2164e2ac44b016c3ceda22855209d51a0d8d90a0ed1ec4a68c6a337","observation_id":"0aeb3923-10f6-4382-8109-f46aef020baf","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":"Dynamics of finite width kernel and prediction fluctua- tions in mean field neural networks.Journal of Statistical Mechanics: Theory and Experiment, 2024(10):104021, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:e3aad09cd0ad6a56cdb0a6d546ae2117a39ba3ae50c79dd3529218765901382f","observation_id":"959669ad-4ff1-42fb-8b8d-85aaaeeedace","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":"Deep linear network training dynamics from random initialization: Data, width, depth, and hyperparameter transfer","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:781dd9029cb7655dd1ed01e6a5e849b13ddfdf12c572906baa29544faf555f92","observation_id":"e8ad1fe9-e70a-4e8e-8cc3-229c9b3a6e22","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":"Adaptive kernel predictors from feature-learning infinite limits of neural networks","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:66a9784916511c9d1d9fba575768e1bf37c0bfb64554ee4943141b69888d24f2","observation_id":"39653b32-d607-4d54-85b1-7e8f50de6c15","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.06305","last_updated":"2020-02-15T02:40:10Z","snapshot_observed_at":"2026-08-12T00:45:25.809655Z","submitted_at":"2020-02-15T02:40:10Z","title":"Fine-Tuning Pretrained Language Models: Weight Initializations, Data Orders, and Early Stopping","version":1},"cited_work":{"arxiv_id":"2002.06305","doi":"10.48550/arxiv.2002.06305","metadata_source":"arxiv_reference","pith_arxiv_id":"2002.06305","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Smith , title =","venue":"arXiv (Cornell University)","work_id":"fe5f2849-b8fd-4a10-a1f8-77f98f17cc0b","year":2002},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"cited_paper":"/paper/2002.06305","citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:77e51a8037f4f0846a3bb49d384fdc7ca16d8c2f1f38ec6c276fec8ce139f31c","observation_id":"9dce5377-20ef-4699-b079-4fc60b94cadd","resolution":{"observed_at":"2026-06-29T13:23:28.023366Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":"Zuidema, and Stella R","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:d3d8ed402662532d1a87c97f56f64eb3cedb0b90d16e6f8473248ba3f93b99f1","observation_id":"0e87974f-1ddc-4a3c-b3c4-6de0164b5687","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":"Convergence and divergence of language models under different random seeds","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:1b1a8713d0a365ecf599d2a19063a7babe45e19ef01ed37d46cb49eb2b408319","observation_id":"f5a575c3-3cd2-4a2f-9c56-6de3f6c0d3f6","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:9f273ca23a94292cb767f0d73554424e7d9524c92976675b44ce962f76584b2f","observation_id":"52a8d6e3-6a7d-4bc2-9fa7-48bcabe0c4d3","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":"SeedPrints: Fingerprints can even tell which seed your large language model was trained from","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:bb604614ed03c6e3f20685e4e724d30830dc07c9ea66d11fabb6906b0a545198","observation_id":"ed066a98-d01a-4a14-b485-c3cb3f699d19","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":"Transformers are born biased: Structural inductive biases at random initialization and their practical consequences, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:33258c22549eeeec892c5f564b5964be2ff46589e1c9aa99cb16faec73e06985","observation_id":"67844414-9190-4a3a-a8ba-07ad7d680aa5","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":"Physics of language models: Part 3.1, knowledge storage and extraction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:2b269cbd6e92d53ce0688cc63a83c4ce1f658b680be698893dfcb09a3f7d1283","observation_id":"2c0d35fc-4e7e-4645-8698-4d51dcc1099c","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":"Physics of language models: Part 4.1, architecture design and the magic of canon layers","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:2e9c26fea1db22486905e14a37df09f5a0748cf93e18d7690c87193ff672d374","observation_id":"ddf2782b-5f77-4546-88b9-0c8d117654e8","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:737881700fadea5bebb8af0a7b2e57d49663070b035f23fe50728f4f7fd3712e","observation_id":"6b544f33-ca89-4e22-9208-7ec3b063a18b","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":"Smith, Benoit Dherin, David G","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:88abc03ab397cd1b8c0401daa1bc52fc1c69c70aca832a38badba83931cffe85","observation_id":"102e3f34-ffcc-47e2-b4b8-98cc50633790","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16143","last_updated":"2024-04-20T13:38:32Z","snapshot_observed_at":"2026-08-16T14:31:32.666242Z","submitted_at":"2023-12-26T18:06:48Z","title":"On the Trajectories of SGD Without Replacement","version":2},"cited_work":{"arxiv_id":"2312.16143","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.16143","snapshot_observed_at":"2026-06-29T13:23:28.024863Z","title":"On the Trajectories of SGD Without Replacement","venue":null,"work_id":"4e857e59-61cf-4b45-a47d-344984f6c808","year":2023},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"cited_paper":"/paper/2312.16143","citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:549aa8870c2a61b80b27a5ff2e9dc4d41af7cd38fcb135d90fb29078c76d2341","observation_id":"340eccbf-0333-4f24-99c4-2f019491ee60","resolution":{"observed_at":"2026-06-29T13:23:28.026923Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":"How neural networks learn the support is an implicit regularization effect of SGD","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:496010b5d1a5e954bc1bb44239f6eb2d392b82992fa2aed0dab794fa61a3a863","observation_id":"792a5032-7557-4754-b29d-16ae3d49bc63","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":"Griffiths and J","venue":null,"work_id":null,"year":1986},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:bcd67879cdf2c59b871a4d3d62bd411e7d0cba1c04f06b2f4a1cec8b7782308f","observation_id":"bb8430ce-a874-4494-8be8-19900da026c6","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":"Springer, Berlin, Heidelberg, 2 edition, 2006","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:dab70420c120313c03f221bf7e5e9fed6541b6a77a74986e02c33d20fb4bd17c","observation_id":"c2a54f97-0e20-477c-b88a-c01974b367c0","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00849","last_updated":"2023-02-02T03:25:38Z","snapshot_observed_at":"2026-08-16T15:58:20.325783Z","submitted_at":"2023-02-02T03:25:38Z","title":"Implicit regularization in Heavy-ball momentum accelerated stochastic gradient descent","version":1},"cited_work":{"arxiv_id":"2302.00849","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2302.00849","snapshot_observed_at":"2026-06-29T13:23:28.011879Z","title":"arXiv preprint arXiv:2302.00849 , year=","venue":null,"work_id":"21558782-5d71-4135-8a68-ae61422d7ee1","year":2023},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"cited_paper":"/paper/2302.00849","citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:a13b5a7093ba0cada3973c0096b20143393417d2fb45fbad8263d894a8ed2ee6","observation_id":"e2f7284f-5f07-47f3-abe4-f65a2c084bee","resolution":{"observed_at":"2026-06-29T13:23:28.013996Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":"Cattaneo, Jason Matthew Klusowski, and Boris Shigida","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:19cb45b67f345559d3da419e24aa17a67db4f06cb335f7bedc6bd13d664888a7","observation_id":"404b6453-3754-445c-a9ed-85da2b1f27b5","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":"Implicit regularization in deep matrix factorization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:866e7aac6c038e1e377042ddf1e6c5161ae6332773c50f8cd1bd321b509a2b7e","observation_id":"4f6bdb28-49e3-4286-9b1c-4c68367e99ac","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09137","last_updated":"2025-01-21T03:05:17Z","snapshot_observed_at":"2026-08-17T21:28:04.482890Z","submitted_at":"2025-01-15T20:43:36Z","title":"Gradient Descent Converges Linearly to Flatter Minima than Gradient Flow in Shallow Linear Networks","version":2},"cited_work":{"arxiv_id":"2501.09137","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.09137","snapshot_observed_at":"2026-06-29T13:23:28.017867Z","title":"Gradient descent converges linearly to flatter minima than gradient flow in shallow linear networks.arXiv preprint arXiv:2501.09137, 2025","venue":null,"work_id":"064b4b99-f5ac-4a76-947b-3ec69d8aa572","year":2025},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"cited_paper":"/paper/2501.09137","citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:337a171372205d68ec65ad38c0e7edc63ad44b77e83e4a63a17ade432ff45a87","observation_id":"f1271a0b-d08e-4163-8536-08678091a4bd","resolution":{"observed_at":"2026-06-29T13:23:28.020113Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:ca694d6dd6940ed6f502af57d7a382c9cb2bcd94cf44e2fd6304ab4cf2d3769a","observation_id":"4ffcb543-f52f-4a7b-9281-f7295b86d721","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":"Vapnik and Alexey Ya","venue":null,"work_id":null,"year":1971},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:fad9ea58f71ad2a750f0440d74b7ec00bcd142c664ce4f8d2ee7ee483fda26c2","observation_id":"d2a3fd56-1ccb-437a-8a2c-365a15638a5f","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":"Vapnik.Statistical Learning Theory","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:784c881dbc84cd7ac846b8044f844c02f828e8243c6c7cf4a01df49f40802268","observation_id":"69668f97-5ebe-4014-99c9-6f4348a28622","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":"Bartlett","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:45da234706210735874b078834a26c08cf9c2c38c4bdc241a8f091822f6cecd8","observation_id":"f68f8485-8f33-4102-9bbd-db884b6210e8","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":"Bartlett and Shahar Mendelson","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:eafdacff886a0904741d409d6e0f4d6ee6db83ed591e029f276ebc19a7897c9c","observation_id":"3fe5b723-7ba7-430c-9839-d8fdf7461f17","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":"Norm-based capacity control in neural networks","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:49fec9e7bfa01cf2f721b4be41fbc7ada256721dfd2eb05008ea7fb086e270b9","observation_id":"c0731583-5306-4f76-944f-dcf59370b8cf","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":"Bartlett, Dylan J","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:33c4a9b37e07a04c2477f603f6c8fdd2cc5fbdf644023593c525a073d742b380","observation_id":"492ff402-a245-4242-b750-52f2f9a9a8b8","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":"Understand- ing deep learning requires rethinking generalization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:32168a72df79d442bb29262fa9b6d6266523c87e6c83e8dc3e11c20337818c8b","observation_id":"d872f2b2-7850-41cf-9783-6feb582a0b1f","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":"Kanwal, Tegan Maharaj, Asja Fischer, Aaron Courville, Yoshua Bengio, and Simon Lacoste-Julien","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:eb6ef6d16761979f5576963cb08b84cff3693f15f90425ff01c6619334da89fd","observation_id":"33cc7ff5-7afd-47d2-9d96-1f7646fdc808","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":"Edelman, Fred Zhang, and Boaz Barak","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:8bb7a2283ecacb18482e403f4d39fd5b7a810218aee10cfebdc2b3f2725e92bd","observation_id":"3dee2d76-6c4b-4dce-90ac-24117bc9507f","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":"Train faster, generalize better: Stability of stochastic gradient descent","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:8efc57b5ec0fbba9aa64c40e83b9cee44aad0098ab335917760c805a7b80f9a7","observation_id":"44cf63a5-6c60-41ed-9f6a-5770a84b1bb1","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":"Exploring generalization in deep learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:d87bea2556d5801b09afca9faf3c0a79fa507c643cbf79829ec1ff1fc48c0df2","observation_id":"a3c3d132-634b-42fa-a6e7-99952d24d1e7","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":"A PAC- bayesian approach to spectrally-normalized margin bounds for neural networks","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:2b014b01ad875495861a90be1853878a839c915d0ff285d49e5a618d7e8c513b","observation_id":"9572b56d-df5c-4b21-a23d-02476a1b3538","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":"Predicting the generalization gap in deep networks with margin distributions","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:3ede4689c1c2e011efe15f49ca4727246f29aa7c91da14db5697cf80a2ed1466","observation_id":"54a4c63a-a5a7-401a-b00a-beea8ab6817b","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":"Fantas- tic generalization measures and where to find them","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:4fb43b58c9b15d782c669006dd9c9ab37f94f7872c8857150e0ab718f9e4657b","observation_id":"37ba5b68-355a-4ae4-bd9f-b70bdee85f91","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":"Flat minima.Neural Computation, 9(1):1–42, 1997","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:d8970d6e34ef0c1635c9a81339e7db2c8c4366333c7e48aaccd73dce180091f1","observation_id":"951c8d20-e516-40a7-9b88-769575bbef0a","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":"On large-batch training for deep learning: Generalization gap and sharp minima","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:0468ec80ec4bd6d156cbdd3063d36771dd0aecd5b7b41961d678ea760160761c","observation_id":"6d44bc74-491a-48d0-9c32-a8be15a015dc","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":"Sharp minima can generalize for deep nets","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:dc0bb4256aed3f7e032f945d03cf61c0e1e3f5a4add995e66741685b9c909ad1","observation_id":"0022f79c-12d4-43af-a273-d056702d8447","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":"Sharpness-aware minimization for efficiently improving generalization","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:5dabf9c00ba74d1e5613f77975eceb04265e92f1239a2093d708a954c2478b09","observation_id":"85073a1d-1f9c-491b-b6df-b31d1c7d7a5e","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":"McAllester","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:240298dac0dee94bb044f890b355261e3be8bf8490d5a3ee4421f14364be342e","observation_id":"d73c9a05-c160-4b95-9a58-40fa95072139","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:7e10e02d563f3f661ba69d2145a8a301c44e380a59c580f8d327960dd8ed066c","observation_id":"9ad66981-77e5-4c2e-b3ba-fb0a2b4d20a9","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":"Adams, and Peter Orbanz","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:815e6ad187bf9e9bea3d7961ca4d714a3469602748582caa1f9d0cbc02f05f61","observation_id":"4f0f935f-3259-4953-acfd-36887d7c2c9b","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":"Stronger generalization bounds for deep nets via a compression approach","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:d14517c5d24e210db07c3111cbaf9a658a7fc6fb64352c94c1905258d310cc8d","observation_id":"89235dd1-db05-42c0-b5b7-45fb22c95da2","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":"Reconciling modern machine- learning practice and the classical bias–variance trade-off.Proceedings of the National Academy of Sciences, 116(32):15849–15854, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:9619cd55803b793f1902be0547fb96f937b0b84813a63a671551623a52f56690","observation_id":"cee32d27-e80c-4e02-8bea-71c2460319cf","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":"Deep double descent: Where bigger models and more data hurt","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:46aed1b2097da35ae373b81ebe64a8bb7c3332050620f1a9392d6544f255a7e1","observation_id":"184ac8ca-3a86-4d9f-b382-48fb077785d0","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":"Bartlett, Philip M","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:ef0d658a3415b0aac283b922e88b915499a38dc3a7d6c8ba82ee2e0a2384c24a","observation_id":"5e5d2dc2-eb77-4bd1-8911-6f62172753d2","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":"Neal.Bayesian Learning for Neural Networks, volume 118 ofLecture Notes in Statistics","venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:eae0e6a2f47d1d7a670066df24ad35215a1cb2be39b4a57d7f347aad8dccc41a","observation_id":"293c8f82-3faa-4dc7-944b-de1130079d8a","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":null,"venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:d9cbd30de4a3bf37c87e619d0858b54aaf3bbfdf6d806c1b86ffe8cefeab5332","observation_id":"054e625e-72b2-4a31-a638-0b3f96ba4835","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":"Schoenholz, Jeffrey Pennington, and Jascha Sohl-Dickstein","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:7cf28f669a6e933a94f8121150ea1c0c45f8ecdf192a5514c25eff1df5356c0b","observation_id":"6e757fda-d37d-441c-919d-c95247c49b7a","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":"Neural tangent kernel: Convergence and generalization in neural networks","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:7528f67b964136d7696dc5b0ea9bc9d56af8ecdca833d718c1af440463232023","observation_id":"ad1182f6-1d00-4f13-9cbf-0c87261f3761","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":"Camargo, and Ard A","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:6fb94bfd919e880bddfb2dfa95a5531685411b49c3e6dc737f1a770383b6ecc5","observation_id":"f2dc4f86-eab7-4663-84f1-cd33461828dd","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":"Random deep neural networks are biased towards simple functions","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:fa31319b16d81be3c557c236683f1fe4a833009cac8758836599a35acae86bdf","observation_id":"06d59cbf-2e4f-49ed-9b2f-d050bc648ff5","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":"On the complexity of finite sequences.IEEE Transactions on Information Theory, 22(1):75–81, 1976","venue":null,"work_id":null,"year":1976},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:ae69d6b8df55fa2dc497e0f1c4b31f01548bd4a5f148d285e6bc7cd4011f0811","observation_id":"1a58516d-7671-4d56-8fbc-b688353a4082","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":"A universal algorithm for sequential data compression.IEEE Transactions on Information Theory, 23(3):337–343, 1977","venue":null,"work_id":null,"year":1977},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:a973df5cac245c448f4f3ba4f7646bd5f928d18aca171bdd8eb9242571c3b521","observation_id":"efe22477-0dfb-41fe-9b3f-0db4bd858bc7","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":null,"venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:53e35526a9958c830a190547a31b424888b5412f46b184d820dc513b5968eda7","observation_id":"1c860759-7c1c-4809-8dc0-617d4b1cd3b9","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":"Simplicity bias in transformers and their ability to learn sparse Boolean functions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:e7e74b78827e96dbec8c505edb0eed4b787b2b93e7a866a606deb76ac631fcf2","observation_id":"f38010fe-54d6-4936-a9bd-79b9c8ad3a9d","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:0fbed4080018c227646ed75b6f0c3a7077b15f1e2c7a9612654108f568c08143","observation_id":"f55f61ac-1387-48b1-af04-c458ecbbf9e3","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":"Transformers learn low sensitivity functions: Investigations and implications","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:7359839d040666e9ad71c0e32436cf388f7fa9e6f20ac9a19805d494d3f1cbca","observation_id":"eece98fa-5ad6-465e-b43b-f6304f52742f","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":"Hamprecht, Yoshua Bengio, and Aaron Courville","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:428b7db5f08f77cad2d86581a85c2aaf0453dcc1e474a6b358c24d38fb6637af","observation_id":"e0c8118a-a4b4-42af-9220-8f39358d5e53","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":"Abolafia, Jeffrey Pennington, and Jascha Sohl- Dickstein","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:36c6dabddae302319f7f6e4dbc9edf1a6f28641e45920461e9bd2004f3f5f478","observation_id":"c0a909c4-4503-4be6-a050-86c3adab670c","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":"Complexity of linear regions in deep networks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:939200cc0e4970edea6cc32ba50c6b64fb8f5e828ecf32d51d87ba89445007c8","observation_id":"0816a332-0fc8-4d21-846a-11e50ef39154","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":"Deep ReLU networks have surprisingly few activation patterns","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:387e0a6c6386cac6955ebd98cb2a3cd0411ad0ae3bd9588aff270d7be82afaeb","observation_id":"35bb9b61-ad0c-4826-a601-cb840326e886","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:5f22119b727041a4d1da43dd46a64cee8f832d2bc8c53ec940ed80ace50bf3ed","observation_id":"e9526b96-f38d-4fa7-b464-81ee9d34baad","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":"Neural networks trained with SGD learn distributions of increasing complexity","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:4eddf1270a9e96154bc4bb68629b5280088cef5ba4cddebcf0d4c2ca42d0dd65","observation_id":"02b421a0-65e6-42f6-ba40-48f47de19d0d","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":"Simplicity bias and optimization threshold in two-layer ReLU networks, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:dfb168031be42bab1a7febcad21538eb3aa350c14f3cfe42f41de5be4317b20d","observation_id":"4a592918-713a-4b0d-a9d9-8c2306f1e8a4","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":"Saxe, and Peter E","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:c8cbf712493d8e29cecc7217b1b4dfa553cb6915589cfd64bc5f0a5a17f56765","observation_id":"85b5d626-2219-480c-9838-2fd867ae5a9f","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":"Saxe, James L","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:50de87c20d2b288b6bfc07ba9d682f3a0698fd6bf20f3c57f5c69cfc9cd08a3d","observation_id":"eebaa548-d109-42e1-b268-fc3f84ae757d","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:e125fea675ae4375e9a02e265690cb58b0c1847d42f7c320d07f80b95aa37be4","observation_id":"178408fe-3078-4103-838d-85626207a99b","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":"Tensor programs I: Wide feedforward or recurrent neural networks of any architecture are gaussian processes, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:40216121bde79d5b5c9500a1172ae5890f44fcf90d658da99a9f49749ce2d387","observation_id":"1a5e7935-6b8e-4660-a503-11a6b3f44acf","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":"Batch normalization: Accelerating deep network training by reducing internal covariate shift","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:e7229957333d0caab117d2bbdd61c795670a03a0f349134ffb0b4c3b21e334a7","observation_id":"62bf712d-4e7c-4620-83e0-837fa3fe77e2","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":"Theoretical analysis of auto rate-tuning by batch normalization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:a08b88b60cd17c11460f260872bc3fe34263a054d224ea1e66506b23d4a9f1b6","observation_id":"f3568005-b996-4119-b0f9-e6f2f4ff0287","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":"Reconciling modern deep learning with tradi- tional optimization analyses: The intrinsic learning rate","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:9f2b9fff23b1f90ca39788bf385bc64fa6cd97d6872f74042268708d933a4506","observation_id":"bba10d06-188e-404c-9db6-f7313fd141e2","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":"Number 32 in Notes on Applied Science","venue":null,"work_id":null,"year":1963},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:db3acb18f19107c7d198ab1d8ece83398ff48c485af75ec39742b3fa275a6625","observation_id":"0c9bd7f4-a27b-404c-91ef-1190ab2d06c6","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":"Monographs on Numerical Analysis","venue":null,"work_id":null,"year":1965},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:5ea96e75762ca3d157fa1ef7d1b651475e085d6ca576f0443c3262dd314978df","observation_id":"d1d9de8f-c6c8-426d-809c-4cda99690ba8","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":"Higham.Accuracy and Stability of Numerical Algorithms","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:e681fc4e22c6f8d7db6b4914e87df2c85eecb8b1d3b6efa8614f2888fbd57412","observation_id":"2590ce15-2872-4ec1-a064-b1e0d5b5363e","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":null,"venue":null,"work_id":null,"year":1994},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:9ac700ea615068dbb4176cfc4d9b058c30c1884ddd3a6ce153e539430ae4a5a5","observation_id":"14ea6b90-f0b4-40f6-b3b8-5819474a3967","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":"Modified equations for stochastic differential equations.BIT Numerical Mathematics, 46(1):111–125, 2006","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:000cb96f3be66599f83b32233838c4711fafc926b32a80bd7e77c93d0c19a46c","observation_id":"b1cae5ec-226a-412b-9b15-affc360657b4","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":"Zygalakis","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:b71631a0e00f6355fba1f3a2d356ece22278a30106ee360b19531f3c5af1077e","observation_id":"79a410a8-776d-4d9e-92aa-f9ab6415fbdc","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:20:54.303605Z","title":"Weak backward error analysis for SDEs.SIAM Journal on Numerical Analysis, 50(3):1735–1752, 2012","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias","version":1},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-06-29T13:20:54.303605Z"},"links":{"citing_paper":"/paper/2605.29152"},"observation_digest":"sha256:69f5eecc37796721b7f535f47c2352705c63681b5925f50140a397efaaa8de27","observation_id":"cac2f792-718c-4331-8a92-62d674eaa89c","resolution":{"observed_at":"2026-06-29T13:20:54.303605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2605.29152","last_updated":"2026-05-27T22:30:39Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-15T13:50:56.497474Z","submitted_at":"2026-05-27T22:30:39Z","title":"Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":95,"verified_exact":5,"verified_fuzzy":0},"total_outbound_references":117},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 100 of 117 outbound references and 0 inbound Pith citation observations for arXiv:2605.29152."}