{"as_of":"2026-08-10T03:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:985c9c2f0d6d8f7a03caf7017521615d4919874b2c8f7ec244ba782251b1d0ba","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T11:54:36.999715Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-22T10:25:54.649302Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-22T10:26:24.100616Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.02531","last_updated":"2025-06-16T12:52:01Z","snapshot_observed_at":"2026-08-09T19:03:39.376210Z","submitted_at":"2025-02-04T17:50:55Z","title":"Deep Linear Network Training Dynamics from Random Initialization: Data, Width, Depth, and Hyperparameter Transfer","version":3},"cited_work":{"arxiv_id":"2502.02531","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.02531","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deep linear network training dynamics from random initialization: Data, width, depth, and hyperparameter transfer","venue":null,"work_id":"652ba1af-2b7b-4104-af22-23e95d7cdd3f","year":2025},"citing_paper":{"arxiv_id":"2604.21691","last_updated":"2026-04-23T13:58:12Z","snapshot_observed_at":"2026-08-02T12:48:50.592713Z","submitted_at":"2026-04-23T13:58:12Z","title":"There Will Be a Scientific Theory of Deep Learning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-09T20:11:17.616190Z"},"links":{"cited_paper":"/paper/2502.02531","citing_paper":"/paper/2604.21691"},"observation_digest":"sha256:1fc727b309c848734e69fdc5d37de855167623dfa01c7d685ae25ca3f6659804","observation_id":"3f788870-ad61-4919-b3a2-181940488d87","resolution":{"observed_at":"2026-05-11T15:21:08.980824Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02531","last_updated":"2025-06-16T12:52:01Z","snapshot_observed_at":"2026-08-09T19:03:39.376210Z","submitted_at":"2025-02-04T17:50:55Z","title":"Deep Linear Network Training Dynamics from Random Initialization: Data, Width, Depth, and Hyperparameter Transfer","version":3},"cited_work":{"arxiv_id":"2502.02531","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.02531","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deep linear network training dynamics from random initialization: Data, width, depth, and hyperparameter transfer","venue":null,"work_id":"652ba1af-2b7b-4104-af22-23e95d7cdd3f","year":2025},"citing_paper":{"arxiv_id":"2605.07870","last_updated":"2026-05-21T16:56:03Z","snapshot_observed_at":"2026-07-06T23:20:11.042952Z","submitted_at":"2026-05-08T15:28:01Z","title":"Spectral Dynamics in Deep Networks: Feature Learning, Outlier Escape, and Learning Rate Transfer","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-11T03:02:52.833353Z"},"links":{"cited_paper":"/paper/2502.02531","citing_paper":"/paper/2605.07870"},"observation_digest":"sha256:0d912f03f33c57c7af00c4e942fe21df132c6410d350112675cb32192241aa1e","observation_id":"64686c53-6c31-48df-85d3-0635d4454f8d","resolution":{"observed_at":"2026-05-11T03:05:53.487859Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02531","last_updated":"2025-06-16T12:52:01Z","snapshot_observed_at":"2026-08-09T19:03:39.376210Z","submitted_at":"2025-02-04T17:50:55Z","title":"Deep Linear Network Training Dynamics from Random Initialization: Data, Width, Depth, and Hyperparameter Transfer","version":3},"cited_work":{"arxiv_id":"2502.02531","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.02531","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deep linear network training dynamics from random initialization: Data, width, depth, and hyperparameter transfer","venue":null,"work_id":"652ba1af-2b7b-4104-af22-23e95d7cdd3f","year":2025},"citing_paper":{"arxiv_id":"2605.07870","last_updated":"2026-05-21T16:56:03Z","snapshot_observed_at":"2026-07-06T23:20:11.042952Z","submitted_at":"2026-05-08T15:28:01Z","title":"Spectral Dynamics in Deep Networks: Feature Learning, Outlier Escape, and Learning Rate Transfer","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-22T10:25:54.649302Z"},"links":{"cited_paper":"/paper/2502.02531","citing_paper":"/paper/2605.07870"},"observation_digest":"sha256:b10a5556be733c2100b982217271e97699aaa9c0821913ad0e34333c1f901a58","observation_id":"cc0eec55-8df5-4051-a7eb-4bd5f1761e89","resolution":{"observed_at":"2026-05-22T10:26:24.104396Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02531","last_updated":"2025-06-16T12:52:01Z","snapshot_observed_at":"2026-08-09T19:03:39.376210Z","submitted_at":"2025-02-04T17:50:55Z","title":"Deep Linear Network Training Dynamics from Random Initialization: Data, Width, Depth, and Hyperparameter Transfer","version":3},"cited_work":{"arxiv_id":"2502.02531","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.02531","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deep linear network training dynamics from random initialization: Data, width, depth, and hyperparameter transfer","venue":null,"work_id":"652ba1af-2b7b-4104-af22-23e95d7cdd3f","year":2025},"citing_paper":{"arxiv_id":"2605.14200","last_updated":"2026-05-13T23:32:00Z","snapshot_observed_at":"2026-07-06T23:25:39.415637Z","submitted_at":"2026-05-13T23:32:00Z","title":"How to Scale Mixture-of-Experts: From muP to the Maximally Scale-Stable Parameterization","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-05-15T04:45:20.091598Z"},"links":{"cited_paper":"/paper/2502.02531","citing_paper":"/paper/2605.14200"},"observation_digest":"sha256:d71046987bd52eb7aead0b2deefc8f2b5867d104f0a694b81ea590450815a042","observation_id":"ac9810ea-8128-4c8c-b11f-5b109f14e692","resolution":{"observed_at":"2026-05-15T04:49:44.858804Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.02531/citation-record","integrity":"/paper/2502.02531/integrity","json":"/paper/2502.02531/citation-record.json","paper":"/paper/2502.02531"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:54:36.757492Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02531","last_updated":"2025-06-16T12:52:01Z","snapshot_observed_at":"2026-08-09T19:03:39.376210Z","submitted_at":"2025-02-04T17:50:55Z","title":"Deep Linear Network Training Dynamics from Random Initialization: Data, Width, Depth, and Hyperparameter Transfer","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-09T11:54:36.757492Z"},"links":{"citing_paper":"/paper/2502.02531"},"observation_digest":"sha256:c73d9e42256852afc1927e825a4804c45e5b134c2fcf231807a5f77390e95d6f","observation_id":"5eb35ad6-997a-48be-a296-59725bf22aec","resolution":{"observed_at":"2026-08-09T11:54:36.757492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-09T11:54:36.763726Z","title":"L., Almeida, D., Altenschmidt, J., Altman, S., Anadkat, S., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02531","last_updated":"2025-06-16T12:52:01Z","snapshot_observed_at":"2026-08-09T19:03:39.376210Z","submitted_at":"2025-02-04T17:50:55Z","title":"Deep Linear Network Training Dynamics from Random Initialization: Data, Width, Depth, and Hyperparameter Transfer","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-09T11:54:36.763726Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2502.02531"},"observation_digest":"sha256:16632a41cc5e7ec41c4e43d3f74bf801d5f8487ea816686723306275dabfd195","observation_id":"bf6a0a3e-984e-4ad9-bb98-5825e86a2882","resolution":{"observed_at":"2026-08-09T11:54:36.763726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:54:37.907479Z","title":"and Pennington, J","venue":null,"work_id":"f440c761-0f34-48a7-9076-72220eef17c2","year":2020},"citing_paper":{"arxiv_id":"2502.02531","last_updated":"2025-06-16T12:52:01Z","snapshot_observed_at":"2026-08-09T19:03:39.376210Z","submitted_at":"2025-02-04T17:50:55Z","title":"Deep Linear Network Training Dynamics from Random Initialization: Data, Width, Depth, and Hyperparameter Transfer","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-09T11:54:36.768869Z"},"links":{"citing_paper":"/paper/2502.02531"},"observation_digest":"sha256:29622e554ad6c30dbbebd955a5b8cf6a539327e36b69e3c47a35a37df08d3989","observation_id":"18fab8f8-e431-488d-8ab6-661036f0506d","resolution":{"observed_at":"2026-08-09T11:54:37.912140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:54:37.893561Z","title":"and Pennington, J","venue":null,"work_id":"10ae7290-f7ae-4ccd-96df-a1188c146b4d","year":2020},"citing_paper":{"arxiv_id":"2502.02531","last_updated":"2025-06-16T12:52:01Z","snapshot_observed_at":"2026-08-09T19:03:39.376210Z","submitted_at":"2025-02-04T17:50:55Z","title":"Deep Linear Network Training Dynamics from Random Initialization: Data, Width, Depth, and Hyperparameter Transfer","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-09T11:54:36.773528Z"},"links":{"citing_paper":"/paper/2502.02531"},"observation_digest":"sha256:331dfbd69f2be28e4007b0b5b7824213149b1c124c46411c9d51b171ff7f5beb","observation_id":"3974edb7-3f78-4252-871e-453a708d4599","resolution":{"observed_at":"2026-08-09T11:54:37.898058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:54:36.778304Z","title":"S., Saxe, A","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.02531","last_updated":"2025-06-16T12:52:01Z","snapshot_observed_at":"2026-08-09T19:03:39.376210Z","submitted_at":"2025-02-04T17:50:55Z","title":"Deep Linear Network Training Dynamics from Random Initialization: Data, Width, Depth, and Hyperparameter Transfer","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-09T11:54:36.778304Z"},"links":{"citing_paper":"/paper/2502.02531"},"observation_digest":"sha256:826ba9acd206fef9785fcd1a57e2757f357d9781b32998e252e44c1e6688a4ba","observation_id":"4491be3e-df65-413b-b1cb-83b4a084524b","resolution":{"observed_at":"2026-08-09T11:54:36.778304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:54:37.870271Z","title":"Out-of-equilibrium dynamical mean-field equations for the perceptron model","venue":null,"work_id":"69e9f76a-34ca-4f5d-b70c-c610c5344e4f","year":2018},"citing_paper":{"arxiv_id":"2502.02531","last_updated":"2025-06-16T12:52:01Z","snapshot_observed_at":"2026-08-09T19:03:39.376210Z","submitted_at":"2025-02-04T17:50:55Z","title":"Deep Linear Network Training Dynamics from Random Initialization: Data, Width, Depth, and Hyperparameter Transfer","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-09T11:54:36.782921Z"},"links":{"citing_paper":"/paper/2502.02531"},"observation_digest":"sha256:693dd93a6cd2d5e33db4ea7e091f4bb6b519dd43d63fe80cee0321c365340c8d","observation_id":"888c9cdf-5189-4f96-88ea-3fe798a179af","resolution":{"observed_at":"2026-08-09T11:54:37.874794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:54:37.856346Z","title":"Local kernel renormalization as a mechanism for feature learning in overparametrized convolutional neural networks","venue":null,"work_id":"19556886-b86a-4a6b-a2c4-b7ed5f3c3c3f","year":2025},"citing_paper":{"arxiv_id":"2502.02531","last_updated":"2025-06-16T12:52:01Z","snapshot_observed_at":"2026-08-09T19:03:39.376210Z","submitted_at":"2025-02-04T17:50:55Z","title":"Deep Linear Network Training Dynamics from Random Initialization: Data, Width, Depth, and Hyperparameter Transfer","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-09T11:54:36.787567Z"},"links":{"citing_paper":"/paper/2502.02531"},"observation_digest":"sha256:c793c46abc30c2381522a5753996a77f966ac6edfacdfbf04a58b2e0ef77fa42","observation_id":"fb4eb0b4-15c8-457a-98f3-eb03bae36086","resolution":{"observed_at":"2026-08-09T11:54:37.860923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:54:37.841794Z","title":"Neural networks as kernel learners: The silent alignment effect","venue":null,"work_id":"5ed7dd08-c406-40c6-b162-47a203a64de6","year":2022},"citing_paper":{"arxiv_id":"2502.02531","last_updated":"2025-06-16T12:52:01Z","snapshot_observed_at":"2026-08-09T19:03:39.376210Z","submitted_at":"2025-02-04T17:50:55Z","title":"Deep Linear Network Training Dynamics from Random Initialization: Data, Width, Depth, and Hyperparameter Transfer","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-09T11:54:36.792699Z"},"links":{"citing_paper":"/paper/2502.02531"},"observation_digest":"sha256:12d775635001a6f65af5faa4827c4c4e1965ade462317b002958191a582f969f","observation_id":"f6d688ed-e99c-49e9-aa59-e53305ba142e","resolution":{"observed_at":"2026-08-09T11:54:37.846327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:54:37.827525Z","title":"Predictive power of a bayesian effective action for fully connected one hidden layer neural networks in the proportional limit","venue":null,"work_id":"98e64309-d3c9-45a1-9ca7-aaa87147c9e4","year":2024},"citing_paper":{"arxiv_id":"2502.02531","last_updated":"2025-06-16T12:52:01Z","snapshot_observed_at":"2026-08-09T19:03:39.376210Z","submitted_at":"2025-02-04T17:50:55Z","title":"Deep Linear Network Training Dynamics from Random Initialization: Data, Width, Depth, and Hyperparameter Transfer","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-09T11:54:36.797358Z"},"links":{"citing_paper":"/paper/2502.02531"},"observation_digest":"sha256:1f7363a2aaf7fdea0bea3206951b7041a07a435e52712c26a1cdd0f5b2cc9a21","observation_id":"e355e0f3-a00b-4864-8445-674f9d001585","resolution":{"observed_at":"2026-08-09T11:54:37.832142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03260","last_updated":"2025-06-16T11:42:27Z","snapshot_observed_at":"2026-08-08T19:05:14.410481Z","submitted_at":"2024-06-05T13:37:42Z","title":"Feature learning in finite-width Bayesian deep linear networks with multiple outputs and convolutional layers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03260","snapshot_observed_at":"2026-08-09T11:54:36.802045Z","title":"Feature learning in finite-width bayesian deep linear networks with multiple outputs and convolutional layers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02531","last_updated":"2025-06-16T12:52:01Z","snapshot_observed_at":"2026-08-09T19:03:39.376210Z","submitted_at":"2025-02-04T17:50:55Z","title":"Deep Linear Network Training Dynamics from Random Initialization: Data, Width, Depth, and Hyperparameter Transfer","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-09T11:54:36.802045Z"},"links":{"cited_paper":"/paper/2406.03260","citing_paper":"/paper/2502.02531"},"observation_digest":"sha256:2bbd8217e180aa534ea51bb4396cf3473a8e76ac81743a48beeac9edde86fd20","observation_id":"cf1dc6c6-0932-4ef7-9b4d-a0dbd131e1bf","resolution":{"observed_at":"2026-08-09T11:54:36.802045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.09653","last_updated":"2022-10-04T15:55:59Z","snapshot_observed_at":"2026-08-09T17:45:20.603478Z","submitted_at":"2022-05-19T16:10:10Z","title":"Self-Consistent Dynamical Field Theory of Kernel Evolution in Wide Neural Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.09653","snapshot_observed_at":"2026-08-09T11:54:36.807310Z","title":"and Pehlevan, C","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.02531","last_updated":"2025-06-16T12:52:01Z","snapshot_observed_at":"2026-08-09T19:03:39.376210Z","submitted_at":"2025-02-04T17:50:55Z","title":"Deep Linear Network Training Dynamics from Random Initialization: Data, Width, Depth, and Hyperparameter Transfer","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-09T11:54:36.807310Z"},"links":{"cited_paper":"/paper/2205.09653","citing_paper":"/paper/2502.02531"},"observation_digest":"sha256:0aa2670b8d775c25872ebadb6239a602256906b8662e1ae20574225d03603fa8","observation_id":"c09b42b8-6058-441a-a813-1c79c1436f24","resolution":{"observed_at":"2026-08-09T11:54:36.807310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.03408","last_updated":"2023-11-07T12:15:57Z","snapshot_observed_at":"2026-07-06T15:13:13.695535Z","submitted_at":"2023-04-06T23:11:49Z","title":"Dynamics of Finite Width Kernel and Prediction Fluctuations in Mean Field Neural Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.03408","snapshot_observed_at":"2026-08-09T11:54:36.812224Z","title":"and Pehlevan, C","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02531","last_updated":"2025-06-16T12:52:01Z","snapshot_observed_at":"2026-08-09T19:03:39.376210Z","submitted_at":"2025-02-04T17:50:55Z","title":"Deep Linear Network Training Dynamics from Random Initialization: Data, Width, Depth, and Hyperparameter Transfer","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-09T11:54:36.812224Z"},"links":{"cited_paper":"/paper/2304.03408","citing_paper":"/paper/2502.02531"},"observation_digest":"sha256:8e65858801a963eecc6c5700cb97e9e4e6463cf47132c3d377d655be153e9225","observation_id":"91f53ded-6e7d-4d80-bab1-cb29eff73b45","resolution":{"observed_at":"2026-08-09T11:54:36.812224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01092","last_updated":"2024-06-23T10:46:17Z","snapshot_observed_at":"2026-08-09T19:02:14.307469Z","submitted_at":"2024-02-02T01:41:38Z","title":"A Dynamical Model of Neural Scaling Laws","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01092","snapshot_observed_at":"2026-08-09T11:54:36.817140Z","title":"A dynamical model of neural scaling laws","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02531","last_updated":"2025-06-16T12:52:01Z","snapshot_observed_at":"2026-08-09T19:03:39.376210Z","submitted_at":"2025-02-04T17:50:55Z","title":"Deep Linear Network Training Dynamics from Random Initialization: Data, Width, Depth, and Hyperparameter Transfer","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-09T11:54:36.817140Z"},"links":{"cited_paper":"/paper/2402.01092","citing_paper":"/paper/2502.02531"},"observation_digest":"sha256:f7d85fcda8e15a918bdc78c5bd43d243616c23434c49ce787c90cea851914141","observation_id":"f1aa050a-3461-4a3a-a485-ffb0c08bc2e9","resolution":{"observed_at":"2026-08-09T11:54:36.817140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17858","last_updated":"2025-04-04T13:47:57Z","snapshot_observed_at":"2026-07-06T19:22:45.746115Z","submitted_at":"2024-09-26T14:05:32Z","title":"How Feature Learning Can Improve Neural Scaling Laws","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17858","snapshot_observed_at":"2026-08-09T11:54:36.822209Z","title":"How feature learning can improve neural scaling laws, 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02531","last_updated":"2025-06-16T12:52:01Z","snapshot_observed_at":"2026-08-09T19:03:39.376210Z","submitted_at":"2025-02-04T17:50:55Z","title":"Deep Linear Network Training Dynamics from Random Initialization: Data, Width, Depth, and Hyperparameter Transfer","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-09T11:54:36.822209Z"},"links":{"cited_paper":"/paper/2409.17858","citing_paper":"/paper/2502.02531"},"observation_digest":"sha256:14794d76f24a04d7476b1860010e11e7e16dbc505ffa8a975afbbb78440bdd89","observation_id":"e0677a36-301e-4be4-a930-f0e5157640d7","resolution":{"observed_at":"2026-08-09T11:54:36.822209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:54:37.813244Z","title":"B., Hanin, B., and Pehlevan, C","venue":null,"work_id":"2f656fdb-99ec-457d-96f4-fc5b7004796b","year":2024},"citing_paper":{"arxiv_id":"2502.02531","last_updated":"2025-06-16T12:52:01Z","snapshot_observed_at":"2026-08-09T19:03:39.376210Z","submitted_at":"2025-02-04T17:50:55Z","title":"Deep Linear Network Training Dynamics from Random Initialization: Data, Width, Depth, and Hyperparameter Transfer","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-09T11:54:36.827297Z"},"links":{"citing_paper":"/paper/2502.02531"},"observation_digest":"sha256:c32831aa818e4c0313fd34df82271898e992576e08ee997a1b4943b5506bfe5b","observation_id":"8dd11ef5-724c-4372-ac3a-392f2a3b2628","resolution":{"observed_at":"2026-08-09T11:54:37.817724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.08571","last_updated":"2025-06-19T21:42:08Z","snapshot_observed_at":"2026-07-06T14:06:16.951816Z","submitted_at":"2022-10-16T16:01:05Z","title":"Dimension free ridge regression","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.08571","snapshot_observed_at":"2026-08-09T11:54:36.831994Z","title":"and Montanari, A","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.02531","last_updated":"2025-06-16T12:52:01Z","snapshot_observed_at":"2026-08-09T19:03:39.376210Z","submitted_at":"2025-02-04T17:50:55Z","title":"Deep Linear Network Training Dynamics from Random Initialization: Data, Width, Depth, and Hyperparameter Transfer","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-09T11:54:36.831994Z"},"links":{"cited_paper":"/paper/2210.08571","citing_paper":"/paper/2502.02531"},"observation_digest":"sha256:299182731f78b07dac7d525f76806a70c5d9650941b9a917c08caf961e33cac1","observation_id":"30be389f-6e5d-497e-a1f4-e8621dcec3b2","resolution":{"observed_at":"2026-08-09T11:54:36.831994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00065","last_updated":"2022-11-23T18:09:57Z","snapshot_observed_at":"2026-08-06T02:48:08.712124Z","submitted_at":"2021-02-26T22:08:19Z","title":"Gradient Descent on Neural Networks Typically Occurs at the Edge of Stability","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00065","snapshot_observed_at":"2026-08-09T11:54:36.836741Z","title":"M., Kaur, S., Li, Y., Kolter, J","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.02531","last_updated":"2025-06-16T12:52:01Z","snapshot_observed_at":"2026-08-09T19:03:39.376210Z","submitted_at":"2025-02-04T17:50:55Z","title":"Deep Linear Network Training Dynamics from Random Initialization: Data, Width, Depth, and Hyperparameter Transfer","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-09T11:54:36.836741Z"},"links":{"cited_paper":"/paper/2103.00065","citing_paper":"/paper/2502.02531"},"observation_digest":"sha256:ae66adf5e1582b48d0b6aef9e41ef48d0031c1b084fb0c18a90483d5d09ab8d5","observation_id":"39b2a6c4-6922-4c15-af54-acdc5d92246c","resolution":{"observed_at":"2026-08-09T11:54:36.836741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:54:37.798163Z","title":"and Sompolinsky, H","venue":null,"work_id":"92a4cdaa-fa23-4f16-a1e6-373055eff29f","year":2018},"citing_paper":{"arxiv_id":"2502.02531","last_updated":"2025-06-16T12:52:01Z","snapshot_observed_at":"2026-08-09T19:03:39.376210Z","submitted_at":"2025-02-04T17:50:55Z","title":"Deep Linear Network Training Dynamics from Random Initialization: Data, Width, Depth, and Hyperparameter Transfer","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-09T11:54:36.841551Z"},"links":{"citing_paper":"/paper/2502.02531"},"observation_digest":"sha256:e84d2eee9697cd00606a22f8258b9f4c83c4fc757811bd81539f149547d80dcf","observation_id":"6cb14acb-408e-4921-b419-20817423b660","resolution":{"observed_at":"2026-08-09T11:54:37.803272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:54:37.782692Z","title":"Bayes-optimal learning of deep random networks of extensive-width","venue":null,"work_id":"0fe567b3-ba2b-421a-8e43-6fa6d9088f4f","year":2023},"citing_paper":{"arxiv_id":"2502.02531","last_updated":"2025-06-16T12:52:01Z","snapshot_observed_at":"2026-08-09T19:03:39.376210Z","submitted_at":"2025-02-04T17:50:55Z","title":"Deep Linear Network Training Dynamics from Random Initialization: Data, Width, Depth, and Hyperparameter Transfer","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-09T11:54:36.846792Z"},"links":{"citing_paper":"/paper/2502.02531"},"observation_digest":"sha256:25fa98bdb2f22258b7601abe56c2f1d9e8d26bd88e43c5f152f84d3c18ea2a50","observation_id":"cb4c6b9c-4353-4c3d-839f-4a67beb73df9","resolution":{"observed_at":"2026-08-09T11:54:37.788026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:54:37.768090Z","title":"Error scaling laws for kernel classification under source and capacity conditions","venue":null,"work_id":"1eb94387-6210-41ea-8636-920bd423002d","year":2023},"citing_paper":{"arxiv_id":"2502.02531","last_updated":"2025-06-16T12:52:01Z","snapshot_observed_at":"2026-08-09T19:03:39.376210Z","submitted_at":"2025-02-04T17:50:55Z","title":"Deep Linear Network Training Dynamics from Random Initialization: Data, Width, Depth, and Hyperparameter Transfer","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-09T11:54:36.851509Z"},"links":{"citing_paper":"/paper/2502.02531"},"observation_digest":"sha256:1f5efbc46f37a71d40739ab32cc2cd7ace4cc9f471293b4cff363da3e21dd038","observation_id":"bb4af645-3e8a-4f5f-9739-ba494ca1c375","resolution":{"observed_at":"2026-08-09T11:54:37.773047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:54:37.753693Z","title":"How two-layer neural networks learn, one (giant) step at a time","venue":null,"work_id":"14ec6c22-a791-4d4c-94ed-2422f78f201c","year":2023},"citing_paper":{"arxiv_id":"2502.02531","last_updated":"2025-06-16T12:52:01Z","snapshot_observed_at":"2026-08-09T19:03:39.376210Z","submitted_at":"2025-02-04T17:50:55Z","title":"Deep Linear Network Training Dynamics from Random Initialization: Data, Width, Depth, and Hyperparameter Transfer","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-09T11:54:36.856004Z"},"links":{"citing_paper":"/paper/2502.02531"},"observation_digest":"sha256:1dd4d10723bf957dbf0caaead5c4861fcdba2d3a2442b2b309b7d2cf62523ac2","observation_id":"e05c33be-1290-497a-924c-41480ba3a4fd","resolution":{"observed_at":"2026-08-09T11:54:37.758227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14623","last_updated":"2025-03-04T11:18:33Z","snapshot_observed_at":"2026-07-06T19:19:33.231002Z","submitted_at":"2024-09-22T23:19:04Z","title":"From Lazy to Rich: Exact Learning Dynamics in Deep Linear Networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14623","snapshot_observed_at":"2026-08-09T11:54:36.860380Z","title":"C., Anguita, N., Proca, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02531","last_updated":"2025-06-16T12:52:01Z","snapshot_observed_at":"2026-08-09T19:03:39.376210Z","submitted_at":"2025-02-04T17:50:55Z","title":"Deep Linear Network Training Dynamics from Random Initialization: Data, Width, Depth, and Hyperparameter Transfer","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-09T11:54:36.860380Z"},"links":{"cited_paper":"/paper/2409.14623","citing_paper":"/paper/2502.02531"},"observation_digest":"sha256:209a9c2c81db3d89d8bde093cab5bce3e8b3f012e26ae9697e0bdff3ca7a8864","observation_id":"487aad8a-f5b0-4bc3-aceb-248014afba66","resolution":{"observed_at":"2026-08-09T11:54:36.860380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:54:37.739886Z","title":"and Gur-Ari, G","venue":null,"work_id":"c559cc66-0ffd-41d2-9de1-d6e20668a07e","year":2020},"citing_paper":{"arxiv_id":"2502.02531","last_updated":"2025-06-16T12:52:01Z","snapshot_observed_at":"2026-08-09T19:03:39.376210Z","submitted_at":"2025-02-04T17:50:55Z","title":"Deep Linear Network Training Dynamics from Random Initialization: Data, Width, Depth, and Hyperparameter Transfer","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-09T11:54:36.865056Z"},"links":{"citing_paper":"/paper/2502.02531"},"observation_digest":"sha256:2c97a22c2f6b3cbabb8b615aa934a0d69ab001501372eae2fa2f5003a6249010","observation_id":"b1a0c616-1509-45ba-b17c-5370de4eaec0","resolution":{"observed_at":"2026-08-09T11:54:37.744328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:54:37.725484Z","title":"Double trouble in double descent: Bias and variance (s) in the lazy regime","venue":null,"work_id":"43250026-da8b-428b-b920-afb0101cc80c","year":2020},"citing_paper":{"arxiv_id":"2502.02531","last_updated":"2025-06-16T12:52:01Z","snapshot_observed_at":"2026-08-09T19:03:39.376210Z","submitted_at":"2025-02-04T17:50:55Z","title":"Deep Linear Network Training Dynamics from Random Initialization: Data, Width, Depth, and Hyperparameter Transfer","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-09T11:54:36.869482Z"},"links":{"citing_paper":"/paper/2502.02531"},"observation_digest":"sha256:9dd7fc42749cea513d24a6eebbb29f2fdcf18539d342f1a9d1ce498d750867fb","observation_id":"4b4a5173-09bc-4304-a3f9-615fcbe86358","resolution":{"observed_at":"2026-08-09T11:54:37.730109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05872","last_updated":"2024-07-16T17:40:09Z","snapshot_observed_at":"2026-07-06T18:42:56.281402Z","submitted_at":"2024-07-08T12:32:51Z","title":"Scaling Exponents Across Parameterizations and Optimizers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05872","snapshot_observed_at":"2026-08-09T11:54:36.874008Z","title":"A., Novak, R., Liu, P","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02531","last_updated":"2025-06-16T12:52:01Z","snapshot_observed_at":"2026-08-09T19:03:39.376210Z","submitted_at":"2025-02-04T17:50:55Z","title":"Deep Linear Network Training Dynamics from Random Initialization: Data, Width, Depth, and Hyperparameter Transfer","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-09T11:54:36.874008Z"},"links":{"cited_paper":"/paper/2407.05872","citing_paper":"/paper/2502.02531"},"observation_digest":"sha256:d2d029ee59f8e6712ff68cd940f8774e29f4f5cab52f0b68f653b6c64e772daa","observation_id":"a7e52749-50eb-49f8-8199-6388b3bf013b","resolution":{"observed_at":"2026-08-09T11:54:36.874008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:54:36.878775Z","title":"Rigorous dynamical mean field theory for stochastic gradient descent methods","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.02531","last_updated":"2025-06-16T12:52:01Z","snapshot_observed_at":"2026-08-09T19:03:39.376210Z","submitted_at":"2025-02-04T17:50:55Z","title":"Deep Linear Network Training Dynamics from Random Initialization: Data, Width, Depth, and Hyperparameter Transfer","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-09T11:54:36.878775Z"},"links":{"citing_paper":"/paper/2502.02531"},"observation_digest":"sha256:b39ee447bfdf56dae7e79911a536e81f1454e25d1d35642c964eaf0347457fcc","observation_id":"51d65a98-8151-425a-9436-df7dddd7fb5e","resolution":{"observed_at":"2026-08-09T11:54:36.878775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.05989","last_updated":"2019-09-13T00:21:53Z","snapshot_observed_at":"2026-08-09T04:32:29.065400Z","submitted_at":"2019-09-13T00:21:53Z","title":"Finite Depth and Width Corrections to the Neural Tangent Kernel","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.05989","snapshot_observed_at":"2026-08-09T11:54:36.883247Z","title":"and Nica, M","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2502.02531","last_updated":"2025-06-16T12:52:01Z","snapshot_observed_at":"2026-08-09T19:03:39.376210Z","submitted_at":"2025-02-04T17:50:55Z","title":"Deep Linear Network Training Dynamics from Random Initialization: Data, Width, Depth, and Hyperparameter Transfer","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-09T11:54:36.883247Z"},"links":{"cited_paper":"/paper/1909.05989","citing_paper":"/paper/2502.02531"},"observation_digest":"sha256:7c9d17594d36e2c23bbca243bc3640601cca2a469f09b4b6911431621654fa5f","observation_id":"fa877548-18b0-4e8a-9a07-1b3a8ba427f6","resolution":{"observed_at":"2026-08-09T11:54:36.883247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16630","last_updated":"2024-05-26T17:08:04Z","snapshot_observed_at":"2026-08-10T01:43:01.080927Z","submitted_at":"2024-05-26T17:08:04Z","title":"Bayesian Inference with Deep Weakly Nonlinear Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16630","snapshot_observed_at":"2026-08-09T11:54:36.887888Z","title":"and Zlokapa, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02531","last_updated":"2025-06-16T12:52:01Z","snapshot_observed_at":"2026-08-09T19:03:39.376210Z","submitted_at":"2025-02-04T17:50:55Z","title":"Deep Linear Network Training Dynamics from Random Initialization: Data, Width, Depth, and Hyperparameter Transfer","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-09T11:54:36.887888Z"},"links":{"cited_paper":"/paper/2405.16630","citing_paper":"/paper/2502.02531"},"observation_digest":"sha256:9eb55ae3c717d38f3a129ef5bcc35c80fbcb05cf2dd8641bbc30a7d28f1790da","observation_id":"69b556e7-2555-4f97-a301-e677cd4c1b19","resolution":{"observed_at":"2026-08-09T11:54:36.887888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-08-09T19:52:33.533277Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-09T11:54:36.892600Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.02531","last_updated":"2025-06-16T12:52:01Z","snapshot_observed_at":"2026-08-09T19:03:39.376210Z","submitted_at":"2025-02-04T17:50:55Z","title":"Deep Linear Network Training Dynamics from Random Initialization: Data, Width, Depth, and Hyperparameter Transfer","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-09T11:54:36.892600Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2502.02531"},"observation_digest":"sha256:008a50003fdd99bb787eac22f1825dfc681cbf0d9d2774743369c7b1d805d458","observation_id":"b4495b4e-ae97-43c0-9450-55b568f14903","resolution":{"observed_at":"2026-08-09T11:54:36.892600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:54:36.897035Z","title":"and Lu, Y","venue":null,"work_id":null,"year":1932},"citing_paper":{"arxiv_id":"2502.02531","last_updated":"2025-06-16T12:52:01Z","snapshot_observed_at":"2026-08-09T19:03:39.376210Z","submitted_at":"2025-02-04T17:50:55Z","title":"Deep Linear Network Training Dynamics from Random Initialization: Data, Width, Depth, and Hyperparameter Transfer","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-09T11:54:36.897035Z"},"links":{"citing_paper":"/paper/2502.02531"},"observation_digest":"sha256:f3f9d4e8e06c14a72842ba7b059c59acbfdcc9f7fb8af01da9bd85a59a5cffa5","observation_id":"9be7a1d6-12c7-4620-9ff0-b1498b2a381a","resolution":{"observed_at":"2026-08-09T11:54:36.897035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:54:36.901447Z","title":"Neural tangent kernel: Convergence and generalization in neural networks","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.02531","last_updated":"2025-06-16T12:52:01Z","snapshot_observed_at":"2026-08-09T19:03:39.376210Z","submitted_at":"2025-02-04T17:50:55Z","title":"Deep Linear Network Training Dynamics from Random Initialization: Data, Width, Depth, and Hyperparameter Transfer","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-09T11:54:36.901447Z"},"links":{"citing_paper":"/paper/2502.02531"},"observation_digest":"sha256:c8f3864b5b8e74ecd7c0da210f19a94f9990bcb5bad45b0af3eb70f5f36bf430","observation_id":"cb006b81-e733-46e9-a44b-8c727f47f8ea","resolution":{"observed_at":"2026-08-09T11:54:36.901447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06158","last_updated":"2024-10-12T21:38:28Z","snapshot_observed_at":"2026-08-06T16:04:26.423565Z","submitted_at":"2024-06-10T10:42:37Z","title":"Get rich quick: exact solutions reveal how unbalanced initializations promote rapid feature learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06158","snapshot_observed_at":"2026-08-09T11:54:36.905939Z","title":"Get rich quick: exact solutions reveal how unbalanced initializations promote rapid feature learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02531","last_updated":"2025-06-16T12:52:01Z","snapshot_observed_at":"2026-08-09T19:03:39.376210Z","submitted_at":"2025-02-04T17:50:55Z","title":"Deep Linear Network Training Dynamics from Random Initialization: Data, Width, Depth, and Hyperparameter Transfer","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-09T11:54:36.905939Z"},"links":{"cited_paper":"/paper/2406.06158","citing_paper":"/paper/2502.02531"},"observation_digest":"sha256:cc194ac7bea16dda6695f22a95892c9079d8d9d57e08933ac9dd2867cba23b39","observation_id":"ff950a05-9e44-4e4d-b021-616f3aefd125","resolution":{"observed_at":"2026-08-09T11:54:36.905939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:54:37.692062Z","title":"Wide neural networks of any depth evolve as linear models under gradient descent","venue":null,"work_id":"cd292413-68cf-4e1a-a42b-575bc0f00cb3","year":2019},"citing_paper":{"arxiv_id":"2502.02531","last_updated":"2025-06-16T12:52:01Z","snapshot_observed_at":"2026-08-09T19:03:39.376210Z","submitted_at":"2025-02-04T17:50:55Z","title":"Deep Linear Network Training Dynamics from Random Initialization: Data, Width, Depth, and Hyperparameter Transfer","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-09T11:54:36.910661Z"},"links":{"citing_paper":"/paper/2502.02531"},"observation_digest":"sha256:cd60f861cfd4ab3e59568a914c7c82d9f39289e93e6ac16c1af3407cdf4a31ae","observation_id":"cb9b95c5-7286-4f86-b37f-a1be6128f2ca","resolution":{"observed_at":"2026-08-09T11:54:37.697018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:54:37.677665Z","title":"and Sompolinsky, H","venue":null,"work_id":"901652d3-b123-49e3-9c90-cc6113aa77b0","year":2021},"citing_paper":{"arxiv_id":"2502.02531","last_updated":"2025-06-16T12:52:01Z","snapshot_observed_at":"2026-08-09T19:03:39.376210Z","submitted_at":"2025-02-04T17:50:55Z","title":"Deep Linear Network Training Dynamics from Random Initialization: Data, Width, Depth, and Hyperparameter Transfer","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-09T11:54:36.914950Z"},"links":{"citing_paper":"/paper/2502.02531"},"observation_digest":"sha256:43ce5ad5ffb24508f3a071f0300946d7b0313e60569ab4f9ee8801b2e45cc2b0","observation_id":"fef3fdc1-d76b-49cd-b92e-d5cd1c7143cf","resolution":{"observed_at":"2026-08-09T11:54:37.682084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:54:37.663980Z","title":"S., Krzakala, F., Urbani, P., and Zdeborova, L","venue":null,"work_id":"9bead628-3768-4258-91cd-0430ea7cc088","year":2019},"citing_paper":{"arxiv_id":"2502.02531","last_updated":"2025-06-16T12:52:01Z","snapshot_observed_at":"2026-08-09T19:03:39.376210Z","submitted_at":"2025-02-04T17:50:55Z","title":"Deep Linear Network Training Dynamics from Random Initialization: Data, Width, Depth, and Hyperparameter Transfer","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-09T11:54:36.919161Z"},"links":{"citing_paper":"/paper/2502.02531"},"observation_digest":"sha256:65752aec0979bf2a180c94f67b3f22f5611df8aca55bb41fbe596d87608ab002","observation_id":"e533b552-3d57-4592-8a3a-c2b56294f779","resolution":{"observed_at":"2026-08-09T11:54:37.668275Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:54:37.649984Z","title":"C., Siggia, E., and Rose, H","venue":null,"work_id":"0925d6d4-e4c3-4f9a-a262-15a3ee2295ab","year":1973},"citing_paper":{"arxiv_id":"2502.02531","last_updated":"2025-06-16T12:52:01Z","snapshot_observed_at":"2026-08-09T19:03:39.376210Z","submitted_at":"2025-02-04T17:50:55Z","title":"Deep Linear Network Training Dynamics from Random Initialization: Data, Width, Depth, and Hyperparameter Transfer","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-09T11:54:36.923517Z"},"links":{"citing_paper":"/paper/2502.02531"},"observation_digest":"sha256:709528a7177998c2032be816fb82bafc8740cafb4ffb13cca88d2582d07fe53d","observation_id":"c410c5fe-855b-48e4-bb62-93685066eb7d","resolution":{"observed_at":"2026-08-09T11:54:37.654605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:54:37.634976Z","title":"and Montanari, A","venue":null,"work_id":"2f37c3cc-ffcc-4c5e-8a93-886ba6bf377b","year":2022},"citing_paper":{"arxiv_id":"2502.02531","last_updated":"2025-06-16T12:52:01Z","snapshot_observed_at":"2026-08-09T19:03:39.376210Z","submitted_at":"2025-02-04T17:50:55Z","title":"Deep Linear Network Training Dynamics from Random Initialization: Data, Width, Depth, and Hyperparameter Transfer","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-09T11:54:36.927780Z"},"links":{"citing_paper":"/paper/2502.02531"},"observation_digest":"sha256:f427e7581bfeaecf3eef149f4c9a502914eed19b57bca6c345fc97b3b6b6265d","observation_id":"4074d9ba-0652-4f7f-8a0c-f8163ccd94a5","resolution":{"observed_at":"2026-08-09T11:54:37.640026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:54:37.618950Z","title":"Mean-field theory of two-layers neural networks: dimension-free bounds and kernel limit","venue":null,"work_id":"eac7bc08-7a2d-483d-8c6f-7fddc07c947d","year":2019},"citing_paper":{"arxiv_id":"2502.02531","last_updated":"2025-06-16T12:52:01Z","snapshot_observed_at":"2026-08-09T19:03:39.376210Z","submitted_at":"2025-02-04T17:50:55Z","title":"Deep Linear Network Training Dynamics from Random Initialization: Data, Width, Depth, and Hyperparameter Transfer","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-09T11:54:36.932213Z"},"links":{"citing_paper":"/paper/2502.02531"},"observation_digest":"sha256:250c456b40c0a8429175059ca7139e2087e64fc0b3af16f06d57ed2c05e89b12","observation_id":"0ad92422-bac8-4d8b-9cbb-5d8e2e0527ca","resolution":{"observed_at":"2026-08-09T11:54:37.623786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:54:37.604414Z","title":"and Urbani, P","venue":null,"work_id":"29073ffd-3b2f-462b-a05b-f5b698b0fd43","year":2022},"citing_paper":{"arxiv_id":"2502.02531","last_updated":"2025-06-16T12:52:01Z","snapshot_observed_at":"2026-08-09T19:03:39.376210Z","submitted_at":"2025-02-04T17:50:55Z","title":"Deep Linear Network Training Dynamics from Random Initialization: Data, Width, Depth, and Hyperparameter Transfer","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-09T11:54:36.936621Z"},"links":{"citing_paper":"/paper/2502.02531"},"observation_digest":"sha256:62e664b77b055fa464438ea4ae98cf1d59f6a18b419705e0e2a376063ef6dab4","observation_id":"c8e199a5-0987-45b1-beaa-7d09c68b14ed","resolution":{"observed_at":"2026-08-09T11:54:37.608874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:54:37.589025Z","title":"Dynamical mean-field theory for stochastic gradient descent in gaussian mixture classification","venue":null,"work_id":"03759f15-5617-4d68-9d7b-7f6e6d6b558d","year":2020},"citing_paper":{"arxiv_id":"2502.02531","last_updated":"2025-06-16T12:52:01Z","snapshot_observed_at":"2026-08-09T19:03:39.376210Z","submitted_at":"2025-02-04T17:50:55Z","title":"Deep Linear Network Training Dynamics from Random Initialization: Data, Width, Depth, and Hyperparameter Transfer","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-09T11:54:36.940998Z"},"links":{"citing_paper":"/paper/2502.02531"},"observation_digest":"sha256:a21c56d4daed4f5f0b5d5154de090c2d7f7a44946b6e6c0292ebe2978ca3728a","observation_id":"0d56aadf-0172-48a3-bf55-453600e41fc9","resolution":{"observed_at":"2026-08-09T11:54:37.594154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17457","last_updated":"2024-11-13T00:38:48Z","snapshot_observed_at":"2026-08-04T19:06:04.443035Z","submitted_at":"2024-02-27T12:28:01Z","title":"Super Consistency of Neural Network Landscapes and Learning Rate Transfer","version":2},"cited_work":{"arxiv_id":"2402.17457","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.17457","snapshot_observed_at":"2026-08-09T11:54:37.212573Z","title":"Super Consistency of Neural Network Landscapes and Learning Rate Transfer","venue":"cs.LG","work_id":"bd59d6ff-3d02-4a05-8024-ab71cd734d19","year":2024},"citing_paper":{"arxiv_id":"2502.02531","last_updated":"2025-06-16T12:52:01Z","snapshot_observed_at":"2026-08-09T19:03:39.376210Z","submitted_at":"2025-02-04T17:50:55Z","title":"Deep Linear Network Training Dynamics from Random Initialization: Data, Width, Depth, and Hyperparameter Transfer","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-09T11:54:36.945315Z"},"links":{"cited_paper":"/paper/2402.17457","citing_paper":"/paper/2502.02531"},"observation_digest":"sha256:7f41361e81c43827f3b96b1b3e71403dd39ed29c455a372415e9b48a1e2c3e40","observation_id":"289b2551-a682-4c73-9c82-303688f13aa2","resolution":{"observed_at":"2026-08-09T11:54:37.219680Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:54:37.573314Z","title":"A statistical mechanics framework for bayesian deep neural networks beyond the infinite-width limit","venue":null,"work_id":"550be5a7-a442-4f3f-83b1-b557f7d36d72","year":2023},"citing_paper":{"arxiv_id":"2502.02531","last_updated":"2025-06-16T12:52:01Z","snapshot_observed_at":"2026-08-09T19:03:39.376210Z","submitted_at":"2025-02-04T17:50:55Z","title":"Deep Linear Network Training Dynamics from Random Initialization: Data, Width, Depth, and Hyperparameter Transfer","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-09T11:54:36.949713Z"},"links":{"citing_paper":"/paper/2502.02531"},"observation_digest":"sha256:6dfe416f610da808ebf0b155fdf30bb16114a2b9648131a18fb6cd0bf58fbc0a","observation_id":"909e0d77-9f8e-4372-ab69-3498556f84ce","resolution":{"observed_at":"2026-08-09T11:54:37.578804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15074","last_updated":"2025-04-18T21:56:39Z","snapshot_observed_at":"2026-08-01T23:00:36.303010Z","submitted_at":"2024-05-23T21:50:54Z","title":"4+3 Phases of Compute-Optimal Neural Scaling Laws","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15074","snapshot_observed_at":"2026-08-09T11:54:36.954538Z","title":"4+ 3 phases of compute-optimal neural scaling laws","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02531","last_updated":"2025-06-16T12:52:01Z","snapshot_observed_at":"2026-08-09T19:03:39.376210Z","submitted_at":"2025-02-04T17:50:55Z","title":"Deep Linear Network Training Dynamics from Random Initialization: Data, Width, Depth, and Hyperparameter Transfer","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-09T11:54:36.954538Z"},"links":{"cited_paper":"/paper/2405.15074","citing_paper":"/paper/2502.02531"},"observation_digest":"sha256:289a9272110429d74b6512323645edd4f9fec2fea629db207b671fe8f18827b5","observation_id":"0b9f5d02-a367-447e-8c95-4e115429eca3","resolution":{"observed_at":"2026-08-09T11:54:36.954538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:54:36.958962Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.02531","last_updated":"2025-06-16T12:52:01Z","snapshot_observed_at":"2026-08-09T19:03:39.376210Z","submitted_at":"2025-02-04T17:50:55Z","title":"Deep Linear Network Training Dynamics from Random Initialization: Data, Width, Depth, and Hyperparameter Transfer","version":3},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-09T11:54:36.958962Z"},"links":{"citing_paper":"/paper/2502.02531"},"observation_digest":"sha256:6d3547347f6d03ab04a5108610eb26883c0b46353d91523e33f8fd575e0272e3","observation_id":"fa9a8356-769a-492d-b60f-d58cd312f38b","resolution":{"observed_at":"2026-08-09T11:54:36.958962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:54:37.559476Z","title":"A., Yaida, S., and Hanin, B","venue":null,"work_id":"0d40ce67-2121-49d2-8a03-c82f8ca73ac3","year":2022},"citing_paper":{"arxiv_id":"2502.02531","last_updated":"2025-06-16T12:52:01Z","snapshot_observed_at":"2026-08-09T19:03:39.376210Z","submitted_at":"2025-02-04T17:50:55Z","title":"Deep Linear Network Training Dynamics from Random Initialization: Data, Width, Depth, and Hyperparameter Transfer","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-09T11:54:36.963727Z"},"links":{"citing_paper":"/paper/2502.02531"},"observation_digest":"sha256:a0f3928ac9e81b5c4c1949b8a62326600847486ba3b7579618fc3e648fed2413","observation_id":"dd3a2e97-1875-44d4-8a2b-56b426e8e51d","resolution":{"observed_at":"2026-08-09T11:54:37.563851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:54:36.968052Z","title":"and Vanden-Eijnden, E","venue":null,"work_id":null,"year":1935},"citing_paper":{"arxiv_id":"2502.02531","last_updated":"2025-06-16T12:52:01Z","snapshot_observed_at":"2026-08-09T19:03:39.376210Z","submitted_at":"2025-02-04T17:50:55Z","title":"Deep Linear Network Training Dynamics from Random Initialization: Data, Width, Depth, and Hyperparameter Transfer","version":3},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-09T11:54:36.968052Z"},"links":{"citing_paper":"/paper/2502.02531"},"observation_digest":"sha256:20b9d85ce84332dc9c4e8cf8978de8bd1d33acbfa6723a493c0b73016bfd480e","observation_id":"5bc77b0f-2c30-4669-8522-aa2f2e219d45","resolution":{"observed_at":"2026-08-09T11:54:36.968052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6120","last_updated":"2014-02-19T17:26:57Z","snapshot_observed_at":"2026-08-08T04:46:43.735461Z","submitted_at":"2013-12-20T20:24:00Z","title":"Exact solutions to the nonlinear dynamics of learning in deep linear neural networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6120","snapshot_observed_at":"2026-08-09T11:54:36.972330Z","title":"M., McClelland, J","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2502.02531","last_updated":"2025-06-16T12:52:01Z","snapshot_observed_at":"2026-08-09T19:03:39.376210Z","submitted_at":"2025-02-04T17:50:55Z","title":"Deep Linear Network Training Dynamics from Random Initialization: Data, Width, Depth, and Hyperparameter Transfer","version":3},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-09T11:54:36.972330Z"},"links":{"cited_paper":"/paper/1312.6120","citing_paper":"/paper/2502.02531"},"observation_digest":"sha256:178aa6a1d49dd0aaa0db5fbd794d11888a0d07c480f92f3b617505bacffb2d4c","observation_id":"4fce7627-0883-44ff-95e8-ef9cc212008f","resolution":{"observed_at":"2026-08-09T11:54:36.972330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:54:37.536473Z","title":"C., Xu, J., Haas, M., and Cevher, V","venue":null,"work_id":"e5ed8611-d495-44a8-bdbc-42ac2a4a7844","year":2024},"citing_paper":{"arxiv_id":"2502.02531","last_updated":"2025-06-16T12:52:01Z","snapshot_observed_at":"2026-08-09T19:03:39.376210Z","submitted_at":"2025-02-04T17:50:55Z","title":"Deep Linear Network Training Dynamics from Random Initialization: Data, Width, Depth, and Hyperparameter Transfer","version":3},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-09T11:54:36.976896Z"},"links":{"citing_paper":"/paper/2502.02531"},"observation_digest":"sha256:6553ae347584067a847eb7441ecf957b2ea34d689de2b236c43e10710fe674f5","observation_id":"53bc0647-54a0-4ec2-86e9-2f2472422dc4","resolution":{"observed_at":"2026-08-09T11:54:37.540836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:54:36.981463Z","title":"and Hu, E","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.02531","last_updated":"2025-06-16T12:52:01Z","snapshot_observed_at":"2026-08-09T19:03:39.376210Z","submitted_at":"2025-02-04T17:50:55Z","title":"Deep Linear Network Training Dynamics from Random Initialization: Data, Width, Depth, and Hyperparameter Transfer","version":3},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-09T11:54:36.981463Z"},"links":{"citing_paper":"/paper/2502.02531"},"observation_digest":"sha256:57af982b173a63c5300574aa0d8687d2c1f6412d7a07910dff20f991916d7f05","observation_id":"2cfc7ce2-5863-46df-a64d-8d1d718484a9","resolution":{"observed_at":"2026-08-09T11:54:36.981463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:54:36.985871Z","title":"J., Babuschkin, I., Sidor, S., Liu, X., Farhi, D., Ryder, N., Pachocki, J., Chen, W., and Gao, J","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.02531","last_updated":"2025-06-16T12:52:01Z","snapshot_observed_at":"2026-08-09T19:03:39.376210Z","submitted_at":"2025-02-04T17:50:55Z","title":"Deep Linear Network Training Dynamics from Random Initialization: Data, Width, Depth, and Hyperparameter Transfer","version":3},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-09T11:54:36.985871Z"},"links":{"citing_paper":"/paper/2502.02531"},"observation_digest":"sha256:0692cc4ac23d95d8ab2b430351d06947f99e3a954b94101635204fc8a2abebb5","observation_id":"a8bf1cc5-f80f-4f56-bf33-f97752193d7b","resolution":{"observed_at":"2026-08-09T11:54:36.985871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02244","last_updated":"2023-10-12T17:50:31Z","snapshot_observed_at":"2026-08-06T03:52:25.161270Z","submitted_at":"2023-10-03T17:50:40Z","title":"Tensor Programs VI: Feature Learning in Infinite-Depth Neural Networks","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02244","snapshot_observed_at":"2026-08-09T11:54:36.990546Z","title":"Tensor programs vi: Feature learning in infinite-depth neural networks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02531","last_updated":"2025-06-16T12:52:01Z","snapshot_observed_at":"2026-08-09T19:03:39.376210Z","submitted_at":"2025-02-04T17:50:55Z","title":"Deep Linear Network Training Dynamics from Random Initialization: Data, Width, Depth, and Hyperparameter Transfer","version":3},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-09T11:54:36.990546Z"},"links":{"cited_paper":"/paper/2310.02244","citing_paper":"/paper/2502.02531"},"observation_digest":"sha256:85e0d6fdd99be442033eefc11bd2e58060e67c83b41eefe7d42780ff37eb0261","observation_id":"b7c6b5ed-b662-47d4-aeac-825a38105945","resolution":{"observed_at":"2026-08-09T11:54:36.990546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:54:37.504297Z","title":null,"venue":null,"work_id":"ca2075db-38bc-49f5-9651-681b8a84e1a4","year":2023},"citing_paper":{"arxiv_id":"2502.02531","last_updated":"2025-06-16T12:52:01Z","snapshot_observed_at":"2026-08-09T19:03:39.376210Z","submitted_at":"2025-02-04T17:50:55Z","title":"Deep Linear Network Training Dynamics from Random Initialization: Data, Width, Depth, and Hyperparameter Transfer","version":3},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-09T11:54:36.995272Z"},"links":{"citing_paper":"/paper/2502.02531"},"observation_digest":"sha256:bd3259146cb559fb08c2c4b519b29b6cb0ac9aa01d7834a7473cc67731a7a703","observation_id":"53fe2196-153e-4f4f-9a62-ad0481871143","resolution":{"observed_at":"2026-08-09T11:54:37.508761Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:54:37.490129Z","title":"A., Tong, W","venue":null,"work_id":"30d84adb-b4fe-40b2-a1b3-1d4c36ecd509","year":2022},"citing_paper":{"arxiv_id":"2502.02531","last_updated":"2025-06-16T12:52:01Z","snapshot_observed_at":"2026-08-09T19:03:39.376210Z","submitted_at":"2025-02-04T17:50:55Z","title":"Deep Linear Network Training Dynamics from Random Initialization: Data, Width, Depth, and Hyperparameter Transfer","version":3},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-09T11:54:36.999715Z"},"links":{"citing_paper":"/paper/2502.02531"},"observation_digest":"sha256:d351b944c6bbf6a5284f239b8ed167f8b816923913d076af66b6011d8c6e5e44","observation_id":"d741f9d7-7f6f-4a17-aa21-e2aafadbe8bd","resolution":{"observed_at":"2026-08-09T11:54:37.494758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.02531","last_updated":"2025-06-16T12:52:01Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T19:03:39.376210Z","submitted_at":"2025-02-04T17:50:55Z","title":"Deep Linear Network Training Dynamics from Random Initialization: Data, Width, Depth, and Hyperparameter Transfer"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":27,"verified_exact":0,"verified_fuzzy":25},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 4 inbound Pith citation observations for arXiv:2502.02531."}