{"as_of":"2026-08-09T21:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0e190d68d47cb9bb4cd3936ebde4d9eadf8ad7e0ea3487471f841588afcd636b","coverage":[{"denominator":65,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":65,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T11:19:07.049822Z","state":"measured"},{"denominator":71,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":71,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T07:44:14.864819Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":1,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.07998","last_updated":"2025-09-10T18:21:17Z","snapshot_observed_at":"2026-08-08T11:09:21.022136Z","submitted_at":"2025-02-11T22:34:49Z","title":"Adaptive kernel predictors from feature-learning infinite limits of neural networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07998","snapshot_observed_at":"2026-08-04T07:44:14.864819Z","title":"Lauditi , author B","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.24616","last_updated":"2026-07-24T13:24:32Z","snapshot_observed_at":"2026-08-08T04:03:00.363067Z","submitted_at":"2025-10-28T16:44:34Z","title":"Statistical physics of deep learning: Optimal learning of a multi-layer perceptron near interpolation","version":5},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-04T07:44:14.864819Z"},"links":{"cited_paper":"/paper/2502.07998","citing_paper":"/paper/2510.24616"},"observation_digest":"sha256:d1ae3cec7e182aef2f378656f21cff0ffabb77c8e8bae81146cb3e0b4e0885a2","observation_id":"377dc5a1-bda8-438c-baa8-7845ddd15a42","resolution":{"observed_at":"2026-08-04T07:44:14.864819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07998","last_updated":"2025-09-10T18:21:17Z","snapshot_observed_at":"2026-08-08T11:09:21.022136Z","submitted_at":"2025-02-11T22:34:49Z","title":"Adaptive kernel predictors from feature-learning infinite limits of neural networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07998","snapshot_observed_at":"2026-08-02T20:37:01.243971Z","title":"Adaptive kernel predictors from feature-learning infinite limits of neural networks","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.23039","last_updated":"2026-06-01T09:29:09Z","snapshot_observed_at":"2026-08-04T13:27:32.737495Z","submitted_at":"2026-02-26T14:24:11Z","title":"Dynamics of neural scaling laws in random feature regression with powerlaw-distributed kernel eigenvalues","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-02T20:37:01.243971Z"},"links":{"cited_paper":"/paper/2502.07998","citing_paper":"/paper/2602.23039"},"observation_digest":"sha256:ce0feab27094421cf848eae19bfd5a19d1fa7875e562c823a520fd1d1e732de4","observation_id":"a73e6885-3911-4ce0-92bd-2548f58b676c","resolution":{"observed_at":"2026-08-02T20:37:01.243971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07998","last_updated":"2025-09-10T18:21:17Z","snapshot_observed_at":"2026-08-08T11:09:21.022136Z","submitted_at":"2025-02-11T22:34:49Z","title":"Adaptive kernel predictors from feature-learning infinite limits of neural networks","version":2},"cited_work":{"arxiv_id":"2502.07998","doi":"10.48550/arxiv.2502.07998","metadata_source":"pith","pith_arxiv_id":"2502.07998","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Adaptive kernel predictors from feature-learning infinite limits of neural networks","venue":"cs.LG","work_id":"38e737c0-85b2-438e-bc55-6cbfff28f59a","year":2025},"citing_paper":{"arxiv_id":"2606.04426","last_updated":"2026-06-03T04:17:06Z","snapshot_observed_at":"2026-08-06T15:15:34.132980Z","submitted_at":"2026-06-03T04:17:06Z","title":"Discrete signaling mediates chaotic regularization in recurrent neural networks","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-06-28T03:34:30.037433Z"},"links":{"cited_paper":"/paper/2502.07998","citing_paper":"/paper/2606.04426"},"observation_digest":"sha256:bf56b83bdf4a7a23e1ef835a588fff88d51d0ff69ea80589e91b0f18c409372b","observation_id":"e02057ba-af11-4e84-8a97-ca13153679b9","resolution":{"observed_at":"2026-07-02T11:26:54.928860Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07998","last_updated":"2025-09-10T18:21:17Z","snapshot_observed_at":"2026-08-08T11:09:21.022136Z","submitted_at":"2025-02-11T22:34:49Z","title":"Adaptive kernel predictors from feature-learning infinite limits of neural networks","version":2},"cited_work":{"arxiv_id":"2502.07998","doi":"10.48550/arxiv.2502.07998","metadata_source":"pith","pith_arxiv_id":"2502.07998","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Adaptive kernel predictors from feature-learning infinite limits of neural networks","venue":"cs.LG","work_id":"38e737c0-85b2-438e-bc55-6cbfff28f59a","year":2025},"citing_paper":{"arxiv_id":"2606.20299","last_updated":"2026-07-01T14:03:37Z","snapshot_observed_at":"2026-08-09T16:51:41.612467Z","submitted_at":"2026-06-18T14:35:53Z","title":"Statistical Properties of Training & Generalization","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-06-26T15:35:51.654392Z"},"links":{"cited_paper":"/paper/2502.07998","citing_paper":"/paper/2606.20299"},"observation_digest":"sha256:a218fd8b96870569eedce17eea42421933f83babd2103a62972431809f97ad53","observation_id":"afe6d8af-682c-4d61-a89e-c13e1beed33f","resolution":{"observed_at":"2026-06-26T15:39:33.210724Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07998","last_updated":"2025-09-10T18:21:17Z","snapshot_observed_at":"2026-08-08T11:09:21.022136Z","submitted_at":"2025-02-11T22:34:49Z","title":"Adaptive kernel predictors from feature-learning infinite limits of neural networks","version":2},"cited_work":{"arxiv_id":"2502.07998","doi":"10.48550/arxiv.2502.07998","metadata_source":"pith","pith_arxiv_id":"2502.07998","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Adaptive kernel predictors from feature-learning infinite limits of neural networks","venue":"cs.LG","work_id":"38e737c0-85b2-438e-bc55-6cbfff28f59a","year":2025},"citing_paper":{"arxiv_id":"2606.20299","last_updated":"2026-07-01T14:03:37Z","snapshot_observed_at":"2026-08-09T16:51:41.612467Z","submitted_at":"2026-06-18T14:35:53Z","title":"Statistical Properties of Training & Generalization","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-07-02T21:51:13.457071Z"},"links":{"cited_paper":"/paper/2502.07998","citing_paper":"/paper/2606.20299"},"observation_digest":"sha256:f4973d0e09d9318a5ecdf9088b4718f2c03300a9739fd332b6215933afe54ed4","observation_id":"1e08dc13-4114-4336-a807-af3c274e68fa","resolution":{"observed_at":"2026-07-02T21:57:25.361396Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07998","last_updated":"2025-09-10T18:21:17Z","snapshot_observed_at":"2026-08-08T11:09:21.022136Z","submitted_at":"2025-02-11T22:34:49Z","title":"Adaptive kernel predictors from feature-learning infinite limits of neural networks","version":2},"cited_work":{"arxiv_id":"2502.07998","doi":"10.48550/arxiv.2502.07998","metadata_source":"pith","pith_arxiv_id":"2502.07998","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Adaptive kernel predictors from feature-learning infinite limits of neural networks","venue":"cs.LG","work_id":"38e737c0-85b2-438e-bc55-6cbfff28f59a","year":2025},"citing_paper":{"arxiv_id":"2607.05735","last_updated":"2026-07-07T01:41:42Z","snapshot_observed_at":"2026-08-07T03:43:40.481601Z","submitted_at":"2026-07-07T01:41:42Z","title":"Width-Robust Learnability in Mean-Field Bayesian Neural Networks","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-11T02:50:06.746659Z"},"links":{"cited_paper":"/paper/2502.07998","citing_paper":"/paper/2607.05735"},"observation_digest":"sha256:50b80536e2dc43f736c801689a5d2f30fde59e104067c82199139ab7a034640e","observation_id":"5a8e3961-d350-466d-b79a-a55f4d0c37ce","resolution":{"observed_at":"2026-07-11T02:57:47.204069Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.07998/citation-record","integrity":"/paper/2502.07998/integrity","json":"/paper/2502.07998/citation-record.json","paper":"/paper/2502.07998"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1710.03667","last_updated":"2017-10-10T15:48:12Z","snapshot_observed_at":"2026-08-05T16:01:52.576963Z","submitted_at":"2017-10-10T15:48:12Z","title":"High-dimensional dynamics of generalization error in neural networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.03667","snapshot_observed_at":"2026-08-08T11:19:06.808903Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.07998","last_updated":"2025-09-10T18:21:17Z","snapshot_observed_at":"2026-08-08T11:09:21.022136Z","submitted_at":"2025-02-11T22:34:49Z","title":"Adaptive kernel predictors from feature-learning infinite limits of neural networks","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-08T11:19:06.808903Z"},"links":{"cited_paper":"/paper/1710.03667","citing_paper":"/paper/2502.07998"},"observation_digest":"sha256:ad5b392faec99c3732ae992c68f9bb49d6b91777f96849770f06f40dfa32521f","observation_id":"f11a5f33-ba69-4b94-835a-2fc200601510","resolution":{"observed_at":"2026-08-08T11:19:06.808903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.08013","last_updated":"2020-06-24T08:53:07Z","snapshot_observed_at":"2026-08-09T10:57:40.324120Z","submitted_at":"2019-10-17T16:33:34Z","title":"Why bigger is not always better: on finite and infinite neural networks","version":3},"cited_work":{"arxiv_id":"1910.08013","doi":null,"metadata_source":"pith","pith_arxiv_id":"1910.08013","snapshot_observed_at":"2026-08-08T11:19:07.496736Z","title":"Why bigger is not always better: on finite and infinite neural networks","venue":"stat.ML","work_id":"ace9d0eb-6f7c-45e6-ab55-b2184677c0cd","year":2019},"citing_paper":{"arxiv_id":"2502.07998","last_updated":"2025-09-10T18:21:17Z","snapshot_observed_at":"2026-08-08T11:09:21.022136Z","submitted_at":"2025-02-11T22:34:49Z","title":"Adaptive kernel predictors from feature-learning infinite limits of neural networks","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-08T11:19:06.813916Z"},"links":{"cited_paper":"/paper/1910.08013","citing_paper":"/paper/2502.07998"},"observation_digest":"sha256:e173796d2af90ddf1efc58b62b4f0f526ea928eb8639856dcbd129ac092ecf0c","observation_id":"f4cb9d6a-3ff9-4617-a5cc-247ba2cb966f","resolution":{"observed_at":"2026-08-08T11:19:07.501107Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:19:07.749182Z","title":"Local kernel renormalization as a mechanism for feature learning in overparametrized convolutional neural networks","venue":null,"work_id":"c6b388c8-51ae-4a14-95eb-1c5df2603ad0","year":2023},"citing_paper":{"arxiv_id":"2502.07998","last_updated":"2025-09-10T18:21:17Z","snapshot_observed_at":"2026-08-08T11:09:21.022136Z","submitted_at":"2025-02-11T22:34:49Z","title":"Adaptive kernel predictors from feature-learning infinite limits of neural networks","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-08T11:19:06.817903Z"},"links":{"citing_paper":"/paper/2502.07998"},"observation_digest":"sha256:652c7b9133d47ade2267f208d99785b9ed46dbd9592a7878c6c3ff82e6a4f8a2","observation_id":"35945893-4b60-4f79-9cb2-14c30c390b53","resolution":{"observed_at":"2026-08-08T11:19:07.753180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.02281","last_updated":"2019-10-26T06:58:22Z","snapshot_observed_at":"2026-08-06T22:39:11.101764Z","submitted_at":"2018-10-04T15:53:32Z","title":"A Convergence Analysis of Gradient Descent for Deep Linear Neural Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.02281","snapshot_observed_at":"2026-08-08T11:19:06.821739Z","title":"A convergence analysis of gradient descent for deep linear neural networks, 2019 a","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.07998","last_updated":"2025-09-10T18:21:17Z","snapshot_observed_at":"2026-08-08T11:09:21.022136Z","submitted_at":"2025-02-11T22:34:49Z","title":"Adaptive kernel predictors from feature-learning infinite limits of neural networks","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-08T11:19:06.821739Z"},"links":{"cited_paper":"/paper/1810.02281","citing_paper":"/paper/2502.07998"},"observation_digest":"sha256:e76340f1ec679788324e8bc0230ece4f0c18358b5d70a38ae9b42362ae9d7cde","observation_id":"821a7bad-9ca0-4a91-be5d-768160597ff3","resolution":{"observed_at":"2026-08-08T11:19:06.821739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.11955","last_updated":"2019-11-04T15:10:47Z","snapshot_observed_at":"2026-08-04T12:19:28.413522Z","submitted_at":"2019-04-26T17:29:37Z","title":"On Exact Computation with an Infinitely Wide Neural Net","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.11955","snapshot_observed_at":"2026-08-08T11:19:06.825359Z","title":"S., Hu, W., Li, Z., Salakhutdinov, R., and Wang, R","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.07998","last_updated":"2025-09-10T18:21:17Z","snapshot_observed_at":"2026-08-08T11:09:21.022136Z","submitted_at":"2025-02-11T22:34:49Z","title":"Adaptive kernel predictors from feature-learning infinite limits of neural networks","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-08T11:19:06.825359Z"},"links":{"cited_paper":"/paper/1904.11955","citing_paper":"/paper/2502.07998"},"observation_digest":"sha256:bd36c9105f6204a23f51c073e0263765809485440a3893587a5fb98e3f48d9e8","observation_id":"6f8e108e-a3b1-4ba4-a092-7bfc8242e44d","resolution":{"observed_at":"2026-08-08T11:19:06.825359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"math/0409273","last_updated":"2004-09-16T08:48:31Z","snapshot_observed_at":"2026-08-09T09:04:42.844462Z","submitted_at":"2004-09-16T08:48:31Z","title":"Cugliandolo-Kurchan equations for dynamics of Spin-Glasses","version":1},"cited_work":{"arxiv_id":"math/0409273","doi":null,"metadata_source":"pith","pith_arxiv_id":"math/0409273","snapshot_observed_at":"2026-08-08T11:19:07.459041Z","title":"Cugliandolo-Kurchan equations for dynamics of Spin-Glasses","venue":"math.PR","work_id":"0510aa94-8730-495a-b2ad-29775e91fd7c","year":2004},"citing_paper":{"arxiv_id":"2502.07998","last_updated":"2025-09-10T18:21:17Z","snapshot_observed_at":"2026-08-08T11:09:21.022136Z","submitted_at":"2025-02-11T22:34:49Z","title":"Adaptive kernel predictors from feature-learning infinite limits of neural networks","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-08T11:19:06.829072Z"},"links":{"cited_paper":"/paper/math/0409273","citing_paper":"/paper/2502.07998"},"observation_digest":"sha256:7b1f7f9df94b83bb3ae1bfcd514d53149bc3b0cbf1996d3857813cf1abe6e90b","observation_id":"ef6f8416-55c0-42d9-8fe4-4849a3b08b31","resolution":{"observed_at":"2026-08-08T11:19:07.463977Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.00034","last_updated":"2021-12-02T21:06:20Z","snapshot_observed_at":"2026-08-02T07:28:20.038757Z","submitted_at":"2021-10-29T18:22:46Z","title":"Neural Networks as Kernel Learners: The Silent Alignment Effect","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.00034","snapshot_observed_at":"2026-08-08T11:19:06.832965Z","title":"Neural networks as kernel learners: The silent alignment effect, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.07998","last_updated":"2025-09-10T18:21:17Z","snapshot_observed_at":"2026-08-08T11:09:21.022136Z","submitted_at":"2025-02-11T22:34:49Z","title":"Adaptive kernel predictors from feature-learning infinite limits of neural networks","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-08T11:19:06.832965Z"},"links":{"cited_paper":"/paper/2111.00034","citing_paper":"/paper/2502.07998"},"observation_digest":"sha256:8926377c93d59829406397052f60f5188dea85f04459b26df56dde0b639a047d","observation_id":"216b74cb-9053-4a67-8641-b8abc2a81482","resolution":{"observed_at":"2026-08-08T11:19:06.832965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:19:06.836577Z","title":"Predictive power of a bayesian effective action for fully connected one hidden layer neural networks in the proportional limit","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07998","last_updated":"2025-09-10T18:21:17Z","snapshot_observed_at":"2026-08-08T11:09:21.022136Z","submitted_at":"2025-02-11T22:34:49Z","title":"Adaptive kernel predictors from feature-learning infinite limits of neural networks","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-08T11:19:06.836577Z"},"links":{"citing_paper":"/paper/2502.07998"},"observation_digest":"sha256:ab69109498705976d03190737d37816c676da155591389f9e9f0e5bcb5fc2864","observation_id":"637656cc-0c93-472e-b556-7b3b91a5115c","resolution":{"observed_at":"2026-08-08T11:19:06.836577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03260","last_updated":"2025-06-16T11:42:27Z","snapshot_observed_at":"2026-08-08T19:05:14.410481Z","submitted_at":"2024-06-05T13:37:42Z","title":"Feature learning in finite-width Bayesian deep linear networks with multiple outputs and convolutional layers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03260","snapshot_observed_at":"2026-08-08T11:19:06.839815Z","title":"Feature learning in finite-width bayesian deep linear networks with multiple outputs and convolutional layers, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07998","last_updated":"2025-09-10T18:21:17Z","snapshot_observed_at":"2026-08-08T11:09:21.022136Z","submitted_at":"2025-02-11T22:34:49Z","title":"Adaptive kernel predictors from feature-learning infinite limits of neural networks","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-08T11:19:06.839815Z"},"links":{"cited_paper":"/paper/2406.03260","citing_paper":"/paper/2502.07998"},"observation_digest":"sha256:e307b4ddd4288cf40a273a143dc513233f7c5934fd524a35f777368b8443c27a","observation_id":"b6869787-4dd8-4d19-9a28-96a123fc6bd4","resolution":{"observed_at":"2026-08-08T11:19:06.839815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.09653","last_updated":"2022-10-04T15:55:59Z","snapshot_observed_at":"2026-08-09T17:45:20.603478Z","submitted_at":"2022-05-19T16:10:10Z","title":"Self-Consistent Dynamical Field Theory of Kernel Evolution in Wide Neural Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.09653","snapshot_observed_at":"2026-08-08T11:19:06.844013Z","title":"and Pehlevan, C","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.07998","last_updated":"2025-09-10T18:21:17Z","snapshot_observed_at":"2026-08-08T11:09:21.022136Z","submitted_at":"2025-02-11T22:34:49Z","title":"Adaptive kernel predictors from feature-learning infinite limits of neural networks","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-08T11:19:06.844013Z"},"links":{"cited_paper":"/paper/2205.09653","citing_paper":"/paper/2502.07998"},"observation_digest":"sha256:dcd9c2f3759058abedcf0efb30008e62e69499583ed086b5b7ba3bbbb9999f59","observation_id":"202dfba4-7359-4e73-bd69-54180ad414ba","resolution":{"observed_at":"2026-08-08T11:19:06.844013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:19:07.737619Z","title":"and Pehlevan, C","venue":null,"work_id":"47efed6b-453e-4866-a37f-b3af0bb9e865","year":2024},"citing_paper":{"arxiv_id":"2502.07998","last_updated":"2025-09-10T18:21:17Z","snapshot_observed_at":"2026-08-08T11:09:21.022136Z","submitted_at":"2025-02-11T22:34:49Z","title":"Adaptive kernel predictors from feature-learning infinite limits of neural networks","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-08T11:19:06.848896Z"},"links":{"citing_paper":"/paper/2502.07998"},"observation_digest":"sha256:2cd2943dc7d3114d9968567801424491943e835e6101c3de170b17292c288be7","observation_id":"47d0dcee-7ae7-4be4-a065-67f94f03d744","resolution":{"observed_at":"2026-08-08T11:19:07.741576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17858","last_updated":"2025-04-04T13:47:57Z","snapshot_observed_at":"2026-07-06T19:22:45.746115Z","submitted_at":"2024-09-26T14:05:32Z","title":"How Feature Learning Can Improve Neural Scaling Laws","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17858","snapshot_observed_at":"2026-08-08T11:19:06.852656Z","title":"How feature learning can improve neural scaling laws, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07998","last_updated":"2025-09-10T18:21:17Z","snapshot_observed_at":"2026-08-08T11:09:21.022136Z","submitted_at":"2025-02-11T22:34:49Z","title":"Adaptive kernel predictors from feature-learning infinite limits of neural networks","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-08T11:19:06.852656Z"},"links":{"cited_paper":"/paper/2409.17858","citing_paper":"/paper/2502.07998"},"observation_digest":"sha256:67794bfd84da57b90905c4395d0824e6b22cefee5d19f9d84105c3942170e17d","observation_id":"4c9bdd53-9dd8-435e-8a1a-1b8c506a928c","resolution":{"observed_at":"2026-08-08T11:19:06.852656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:19:06.856547Z","title":"J., Leary, C., Maclaurin, D., Necula, G., Paszke, A., Vander P las, J., Wanderman- M ilne, S., and Zhang, Q","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.07998","last_updated":"2025-09-10T18:21:17Z","snapshot_observed_at":"2026-08-08T11:09:21.022136Z","submitted_at":"2025-02-11T22:34:49Z","title":"Adaptive kernel predictors from feature-learning infinite limits of neural networks","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-08T11:19:06.856547Z"},"links":{"citing_paper":"/paper/2502.07998"},"observation_digest":"sha256:33699828f0a92f17d48202b7f6e6619696ca05b0b8cf1f480d89cb6d07c5425c","observation_id":"f268f5f8-6d70-446c-9d59-9d2563b51547","resolution":{"observed_at":"2026-08-08T11:19:06.856547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.07956","last_updated":"2020-01-07T16:11:56Z","snapshot_observed_at":"2026-07-06T07:22:15.380277Z","submitted_at":"2018-12-19T14:11:20Z","title":"On Lazy Training in Differentiable Programming","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.07956","snapshot_observed_at":"2026-08-08T11:19:06.859986Z","title":"On lazy training in differentiable programming, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.07998","last_updated":"2025-09-10T18:21:17Z","snapshot_observed_at":"2026-08-08T11:09:21.022136Z","submitted_at":"2025-02-11T22:34:49Z","title":"Adaptive kernel predictors from feature-learning infinite limits of neural networks","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-08T11:19:06.859986Z"},"links":{"cited_paper":"/paper/1812.07956","citing_paper":"/paper/2502.07998"},"observation_digest":"sha256:5bec6e4e5f9ec8cbdac554d309b81ea656b037b87caa38484d816deea741df26","observation_id":"9f65ee60-4932-4c50-b9bc-acb42c536454","resolution":{"observed_at":"2026-08-08T11:19:06.859986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:19:07.719324Z","title":"and Saul, L","venue":null,"work_id":"cc4d8d9b-a61b-4986-9774-950072d9f506","year":2009},"citing_paper":{"arxiv_id":"2502.07998","last_updated":"2025-09-10T18:21:17Z","snapshot_observed_at":"2026-08-08T11:09:21.022136Z","submitted_at":"2025-02-11T22:34:49Z","title":"Adaptive kernel predictors from feature-learning infinite limits of neural networks","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-08T11:19:06.863894Z"},"links":{"citing_paper":"/paper/2502.07998"},"observation_digest":"sha256:778c788cc6f992d2accee107ead7e37253cc6971a7812d7a5b34fccfb2b550f7","observation_id":"1e9f7474-2619-4741-8109-aee74a5d2b25","resolution":{"observed_at":"2026-08-08T11:19:07.722946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:19:07.707425Z","title":"and Saul, L","venue":null,"work_id":"574811b1-81ae-40c1-ad62-092daa551f78","year":2009},"citing_paper":{"arxiv_id":"2502.07998","last_updated":"2025-09-10T18:21:17Z","snapshot_observed_at":"2026-08-08T11:09:21.022136Z","submitted_at":"2025-02-11T22:34:49Z","title":"Adaptive kernel predictors from feature-learning infinite limits of neural networks","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-08T11:19:06.867543Z"},"links":{"citing_paper":"/paper/2502.07998"},"observation_digest":"sha256:6a69030ca91cf97cd68272a4cd861680a9d511be7a3192fdbb95a99ad6c837b8","observation_id":"8be4b685-5a59-4e7d-8ab1-97f88b5548ca","resolution":{"observed_at":"2026-08-08T11:19:07.710963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:19:07.696138Z","title":"Bayes-optimal learning of deep random networks of extensive-width","venue":null,"work_id":"eca6197b-f84a-4b32-9f58-4ca195c62790","year":2023},"citing_paper":{"arxiv_id":"2502.07998","last_updated":"2025-09-10T18:21:17Z","snapshot_observed_at":"2026-08-08T11:09:21.022136Z","submitted_at":"2025-02-11T22:34:49Z","title":"Adaptive kernel predictors from feature-learning infinite limits of neural networks","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-08T11:19:06.871163Z"},"links":{"citing_paper":"/paper/2502.07998"},"observation_digest":"sha256:e44c9205492368bc2d667a57af64a0a46b0a53448243d5644df3bbeb0cf0e637","observation_id":"7985e8e9-24eb-4a4e-9e35-4c681148acdc","resolution":{"observed_at":"2026-08-08T11:19:07.699764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1103/physrevb.18.4913","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:19:07.156384Z","title":"Dynamics as a substitute for replicas in systems with quenched random impurities","venue":null,"work_id":"78d554f9-0163-412a-a825-9a82e944e80c","year":1978},"citing_paper":{"arxiv_id":"2502.07998","last_updated":"2025-09-10T18:21:17Z","snapshot_observed_at":"2026-08-08T11:09:21.022136Z","submitted_at":"2025-02-11T22:34:49Z","title":"Adaptive kernel predictors from feature-learning infinite limits of neural networks","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-08T11:19:06.875034Z"},"links":{"citing_paper":"/paper/2502.07998"},"observation_digest":"sha256:a63172df296fdd820ad35c222442a6d2c88c4c0c12265d40446937b5b165b07f","observation_id":"11b517b3-b2d4-455a-ae02-67ab74cf4157","resolution":{"observed_at":"2026-08-08T11:19:07.161368Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1804.11271","last_updated":"2018-08-16T14:51:32Z","snapshot_observed_at":"2026-07-06T06:36:28.916734Z","submitted_at":"2018-04-30T15:21:23Z","title":"Gaussian Process Behaviour in Wide Deep Neural Networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.11271","snapshot_observed_at":"2026-08-08T11:19:06.878727Z","title":"Matthews, A","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.07998","last_updated":"2025-09-10T18:21:17Z","snapshot_observed_at":"2026-08-08T11:09:21.022136Z","submitted_at":"2025-02-11T22:34:49Z","title":"Adaptive kernel predictors from feature-learning infinite limits of neural networks","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-08T11:19:06.878727Z"},"links":{"cited_paper":"/paper/1804.11271","citing_paper":"/paper/2502.07998"},"observation_digest":"sha256:d86b9a536d8f9eb499932d136cc129a1cfe05951ff005937fac2836d5d89f145","observation_id":"0fedcee7-c9b8-4b1b-8355-3d24ab9e5c20","resolution":{"observed_at":"2026-08-08T11:19:06.878727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.00152","last_updated":"2020-11-30T23:02:47Z","snapshot_observed_at":"2026-08-07T22:37:10.588379Z","submitted_at":"2020-11-30T23:02:47Z","title":"Every Model Learned by Gradient Descent Is Approximately a Kernel Machine","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.00152","snapshot_observed_at":"2026-08-08T11:19:06.882525Z","title":"Every model learned by gradient descent is approximately a kernel machine","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2502.07998","last_updated":"2025-09-10T18:21:17Z","snapshot_observed_at":"2026-08-08T11:09:21.022136Z","submitted_at":"2025-02-11T22:34:49Z","title":"Adaptive kernel predictors from feature-learning infinite limits of neural networks","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-08T11:19:06.882525Z"},"links":{"cited_paper":"/paper/2012.00152","citing_paper":"/paper/2502.07998"},"observation_digest":"sha256:f91132ee794ce134d3debffd26071c4eda5c3b160860099d023c0ccef8739816","observation_id":"030de9a1-7961-41b9-8eaa-ee99351fa5a5","resolution":{"observed_at":"2026-08-08T11:19:06.882525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10761","last_updated":"2024-05-17T13:17:48Z","snapshot_observed_at":"2026-07-06T18:15:46.130919Z","submitted_at":"2024-05-17T13:17:48Z","title":"Critical feature learning in deep neural networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10761","snapshot_observed_at":"2026-08-08T11:19:06.886269Z","title":"Critical feature learning in deep neural networks, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07998","last_updated":"2025-09-10T18:21:17Z","snapshot_observed_at":"2026-08-08T11:09:21.022136Z","submitted_at":"2025-02-11T22:34:49Z","title":"Adaptive kernel predictors from feature-learning infinite limits of neural networks","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-08T11:19:06.886269Z"},"links":{"cited_paper":"/paper/2405.10761","citing_paper":"/paper/2502.07998"},"observation_digest":"sha256:aafba3b2601273636193cd16b658e910669891b38960d0260ffe6f0d031c7f61","observation_id":"b61eb48b-c304-40e6-86ed-7106a292235d","resolution":{"observed_at":"2026-08-08T11:19:06.886269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:19:06.889958Z","title":"Disentangling feature and lazy training in deep neural networks","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.07998","last_updated":"2025-09-10T18:21:17Z","snapshot_observed_at":"2026-08-08T11:09:21.022136Z","submitted_at":"2025-02-11T22:34:49Z","title":"Adaptive kernel predictors from feature-learning infinite limits of neural networks","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-08T11:19:06.889958Z"},"links":{"citing_paper":"/paper/2502.07998"},"observation_digest":"sha256:ae28d8605c94a1a6d5cf25c19c960a7e36f2fd66098df5434d9bd235074906b2","observation_id":"a26cbc6e-a872-4150-b56c-b031b6af91c6","resolution":{"observed_at":"2026-08-08T11:19:06.889958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:19:06.893729Z","title":"and Zlokapa, A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07998","last_updated":"2025-09-10T18:21:17Z","snapshot_observed_at":"2026-08-08T11:09:21.022136Z","submitted_at":"2025-02-11T22:34:49Z","title":"Adaptive kernel predictors from feature-learning infinite limits of neural networks","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-08T11:19:06.893729Z"},"links":{"citing_paper":"/paper/2502.07998"},"observation_digest":"sha256:15522a3d7f8755dd80862c4fdc7edf472804e1082f15b69d7f5af84b60538762","observation_id":"f4152f35-b898-4c36-9244-6313525ba377","resolution":{"observed_at":"2026-08-08T11:19:06.893729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-08-08T11:19:06.897338Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.07998","last_updated":"2025-09-10T18:21:17Z","snapshot_observed_at":"2026-08-08T11:09:21.022136Z","submitted_at":"2025-02-11T22:34:49Z","title":"Adaptive kernel predictors from feature-learning infinite limits of neural networks","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-08T11:19:06.897338Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2502.07998"},"observation_digest":"sha256:0e52f37ab17101c17b2d6ecf136dd4381074aab70779f09f77ff04cb54ffd35e","observation_id":"1ecaf56d-d98d-462b-aec1-5843d4bf1a03","resolution":{"observed_at":"2026-08-08T11:19:06.897338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-08-09T19:52:33.533277Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-08T11:19:06.901243Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.07998","last_updated":"2025-09-10T18:21:17Z","snapshot_observed_at":"2026-08-08T11:09:21.022136Z","submitted_at":"2025-02-11T22:34:49Z","title":"Adaptive kernel predictors from feature-learning infinite limits of neural networks","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-08T11:19:06.901243Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2502.07998"},"observation_digest":"sha256:ed5022017c69332ad28a22ce178cb4aca90f9b4185130f67836fbcbeeee90ef3","observation_id":"97325572-1d20-46ed-a26f-f8e31ae1efa3","resolution":{"observed_at":"2026-08-08T11:19:06.901243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:19:07.680058Z","title":"Statistical mechanics of transfer learning in fully connected networks in the proportional limit","venue":null,"work_id":"20545827-1ac4-48bb-8c2c-8dd49e7e5e0a","year":2025},"citing_paper":{"arxiv_id":"2502.07998","last_updated":"2025-09-10T18:21:17Z","snapshot_observed_at":"2026-08-08T11:09:21.022136Z","submitted_at":"2025-02-11T22:34:49Z","title":"Adaptive kernel predictors from feature-learning infinite limits of neural networks","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-08T11:19:06.905808Z"},"links":{"citing_paper":"/paper/2502.07998"},"observation_digest":"sha256:176a2300ee146969e6582978591e793459efd6e9f2c4f85cc8a4bed6973904e6","observation_id":"e8fc6134-d396-45e7-b62b-452e28fcb024","resolution":{"observed_at":"2026-08-08T11:19:07.683280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1806.07572","last_updated":"2020-02-10T08:39:09Z","snapshot_observed_at":"2026-08-09T19:02:12.754548Z","submitted_at":"2018-06-20T06:35:46Z","title":"Neural Tangent Kernel: Convergence and Generalization in Neural Networks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.07572","snapshot_observed_at":"2026-08-08T11:19:06.909343Z","title":"Neural tangent kernel: Convergence and generalization in neural networks, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.07998","last_updated":"2025-09-10T18:21:17Z","snapshot_observed_at":"2026-08-08T11:09:21.022136Z","submitted_at":"2025-02-11T22:34:49Z","title":"Adaptive kernel predictors from feature-learning infinite limits of neural networks","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-08T11:19:06.909343Z"},"links":{"cited_paper":"/paper/1806.07572","citing_paper":"/paper/2502.07998"},"observation_digest":"sha256:1a04cfbecc3afbf8d7705455704722d6ba3cfe2f4bebf04ae851a0986109b2cd","observation_id":"46e1a3e4-15cd-4ab6-9f8f-7ea9f208eb4d","resolution":{"observed_at":"2026-08-08T11:19:06.909343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.15933","last_updated":"2022-01-31T12:58:39Z","snapshot_observed_at":"2026-08-08T08:13:53.762544Z","submitted_at":"2021-06-30T09:34:05Z","title":"Saddle-to-Saddle Dynamics in Deep Linear Networks: Small Initialization Training, Symmetry, and Sparsity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.15933","snapshot_observed_at":"2026-08-08T11:19:06.913318Z","title":"Saddle-to-saddle dynamics in deep linear networks: Small initialization training, symmetry, and sparsity, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.07998","last_updated":"2025-09-10T18:21:17Z","snapshot_observed_at":"2026-08-08T11:09:21.022136Z","submitted_at":"2025-02-11T22:34:49Z","title":"Adaptive kernel predictors from feature-learning infinite limits of neural networks","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-08T11:19:06.913318Z"},"links":{"cited_paper":"/paper/2106.15933","citing_paper":"/paper/2502.07998"},"observation_digest":"sha256:3ddd4b73acc577f02ca921ad3b36d18666025063f35618db9312c9060dcebc4b","observation_id":"769afe19-6e56-443e-aa3b-48ef611a577f","resolution":{"observed_at":"2026-08-08T11:19:06.913318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-08T11:19:06.917216Z","title":"B., Chess, B., Child, R., Gray, S., Radford, A., Wu, J., and Amodei, D","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2502.07998","last_updated":"2025-09-10T18:21:17Z","snapshot_observed_at":"2026-08-08T11:09:21.022136Z","submitted_at":"2025-02-11T22:34:49Z","title":"Adaptive kernel predictors from feature-learning infinite limits of neural networks","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-08T11:19:06.917216Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2502.07998"},"observation_digest":"sha256:eaec14b95854a402ce9c6f4c3fa8d8639eab70aa22d5bf38d6abf33c6f5a21b7","observation_id":"3239907b-896e-4611-8df7-56fa7b38070e","resolution":{"observed_at":"2026-08-08T11:19:06.917216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:19:07.670979Z","title":"Statistical physics of particles","venue":null,"work_id":"7405d8e6-47f1-49ae-8d1e-1d4163794f2b","year":2007},"citing_paper":{"arxiv_id":"2502.07998","last_updated":"2025-09-10T18:21:17Z","snapshot_observed_at":"2026-08-08T11:09:21.022136Z","submitted_at":"2025-02-11T22:34:49Z","title":"Adaptive kernel predictors from feature-learning infinite limits of neural networks","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-08T11:19:06.920826Z"},"links":{"citing_paper":"/paper/2502.07998"},"observation_digest":"sha256:0d7dd84893c2c23d13cba52493eaa1d537d52069828d8517497efa5c5373863f","observation_id":"940271fc-43af-4276-b9a8-4141443481a2","resolution":{"observed_at":"2026-08-08T11:19:07.674233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.00165","last_updated":"2018-03-03T00:45:00Z","snapshot_observed_at":"2026-08-04T10:06:19.819372Z","submitted_at":"2017-11-01T02:13:25Z","title":"Deep Neural Networks as Gaussian Processes","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.00165","snapshot_observed_at":"2026-08-08T11:19:06.923904Z","title":"S., Pennington, J., and Sohl-Dickstein, J","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.07998","last_updated":"2025-09-10T18:21:17Z","snapshot_observed_at":"2026-08-08T11:09:21.022136Z","submitted_at":"2025-02-11T22:34:49Z","title":"Adaptive kernel predictors from feature-learning infinite limits of neural networks","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-08T11:19:06.923904Z"},"links":{"cited_paper":"/paper/1711.00165","citing_paper":"/paper/2502.07998"},"observation_digest":"sha256:771724bd4ea778a6ecc4de5bb20b0a6e30d9dd9d163e0f1dca03d1bae4f1d55f","observation_id":"dca8517e-2a35-4f7c-b1d1-c74aabc788bb","resolution":{"observed_at":"2026-08-08T11:19:06.923904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:19:06.927454Z","title":"S., Bahri, Y., Novak, R., Sohl-Dickstein, J., and Pennington, J","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.07998","last_updated":"2025-09-10T18:21:17Z","snapshot_observed_at":"2026-08-08T11:09:21.022136Z","submitted_at":"2025-02-11T22:34:49Z","title":"Adaptive kernel predictors from feature-learning infinite limits of neural networks","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-08T11:19:06.927454Z"},"links":{"citing_paper":"/paper/2502.07998"},"observation_digest":"sha256:70a5ab9e7e7c2a22f97b982bd60367e4402f428a71f0ce8a0352cc7a3dbf8ff8","observation_id":"447c233a-9b78-4c30-941e-345f3957807d","resolution":{"observed_at":"2026-08-08T11:19:06.927454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:19:07.660668Z","title":"and Gur-Ari, G","venue":null,"work_id":"23759206-f3d8-4bec-afed-b926530e7d80","year":2020},"citing_paper":{"arxiv_id":"2502.07998","last_updated":"2025-09-10T18:21:17Z","snapshot_observed_at":"2026-08-08T11:09:21.022136Z","submitted_at":"2025-02-11T22:34:49Z","title":"Adaptive kernel predictors from feature-learning infinite limits of neural networks","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-08T11:19:06.930484Z"},"links":{"citing_paper":"/paper/2502.07998"},"observation_digest":"sha256:38dacf5eaef05be1655a16182f4a80d5c3d223e01d3f9b6e2b4d9de96e267c56","observation_id":"8d64a1a2-c8b4-4738-8f80-9190dbdac3f7","resolution":{"observed_at":"2026-08-08T11:19:07.664570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:19:06.933771Z","title":"and Sompolinsky, H","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.07998","last_updated":"2025-09-10T18:21:17Z","snapshot_observed_at":"2026-08-08T11:09:21.022136Z","submitted_at":"2025-02-11T22:34:49Z","title":"Adaptive kernel predictors from feature-learning infinite limits of neural networks","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-08T11:19:06.933771Z"},"links":{"citing_paper":"/paper/2502.07998"},"observation_digest":"sha256:1994c771b6689c1686a60b7baf42b933e2261a6ec7740179f88660ed67137f34","observation_id":"25023ee7-4bd7-4413-96b1-df8c5621a2fa","resolution":{"observed_at":"2026-08-08T11:19:06.933771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:19:07.650261Z","title":"and Sompolinsky, H","venue":null,"work_id":"eeaa524e-c156-4654-b52b-5a58b74e84bc","year":2022},"citing_paper":{"arxiv_id":"2502.07998","last_updated":"2025-09-10T18:21:17Z","snapshot_observed_at":"2026-08-08T11:09:21.022136Z","submitted_at":"2025-02-11T22:34:49Z","title":"Adaptive kernel predictors from feature-learning infinite limits of neural networks","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-08T11:19:06.936889Z"},"links":{"citing_paper":"/paper/2502.07998"},"observation_digest":"sha256:8950f823546fbe40ecde3dcc01ce0dbcd39ded8f63073768e5d92e6988348479","observation_id":"6e64359e-a00a-4bea-aaef-8cbe67ad028a","resolution":{"observed_at":"2026-08-08T11:19:07.653825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.20199","last_updated":"2025-07-09T04:06:02Z","snapshot_observed_at":"2026-08-09T15:22:12.820309Z","submitted_at":"2024-07-29T17:28:58Z","title":"Emergence in non-neural models: grokking modular arithmetic via average gradient outer product","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.20199","snapshot_observed_at":"2026-08-08T11:19:06.940034Z","title":"Emergence in non-neural models: grokking modular arithmetic via average gradient outer product","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07998","last_updated":"2025-09-10T18:21:17Z","snapshot_observed_at":"2026-08-08T11:09:21.022136Z","submitted_at":"2025-02-11T22:34:49Z","title":"Adaptive kernel predictors from feature-learning infinite limits of neural networks","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-08T11:19:06.940034Z"},"links":{"cited_paper":"/paper/2407.20199","citing_paper":"/paper/2502.07998"},"observation_digest":"sha256:f185a6e622d6444750b57eaa7571e9fe94e682bf7df02c07f4d1fed46bebb754","observation_id":"1d92bf66-9cac-4000-80d8-58e5e572e237","resolution":{"observed_at":"2026-08-08T11:19:06.940034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:19:06.943360Z","title":"C., Siggia, E","venue":null,"work_id":null,"year":1973},"citing_paper":{"arxiv_id":"2502.07998","last_updated":"2025-09-10T18:21:17Z","snapshot_observed_at":"2026-08-08T11:09:21.022136Z","submitted_at":"2025-02-11T22:34:49Z","title":"Adaptive kernel predictors from feature-learning infinite limits of neural networks","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-08T11:19:06.943360Z"},"links":{"citing_paper":"/paper/2502.07998"},"observation_digest":"sha256:89f3ec2097cbe1a887f8fd37b1b4775fc6a7b2a230f399b50b3da89e9a977890","observation_id":"12f9193c-c4d0-48a7-84bd-429726d0bda6","resolution":{"observed_at":"2026-08-08T11:19:06.943360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:19:06.947373Z","title":"A mean field view of the landscape of two-layer neural networks","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.07998","last_updated":"2025-09-10T18:21:17Z","snapshot_observed_at":"2026-08-08T11:09:21.022136Z","submitted_at":"2025-02-11T22:34:49Z","title":"Adaptive kernel predictors from feature-learning infinite limits of neural networks","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-08T11:19:06.947373Z"},"links":{"citing_paper":"/paper/2502.07998"},"observation_digest":"sha256:af1fba87dc5311bafa7732dda770d86f9813084e607fb6c576c9e8370208f75c","observation_id":"da79474d-9e0f-4238-adb9-490e510cc596","resolution":{"observed_at":"2026-08-08T11:19:06.947373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.15191","last_updated":"2020-10-24T13:28:11Z","snapshot_observed_at":"2026-07-06T09:33:10.947499Z","submitted_at":"2020-06-26T19:45:36Z","title":"Is SGD a Bayesian sampler? Well, almost","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.15191","snapshot_observed_at":"2026-08-08T11:19:06.951145Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.07998","last_updated":"2025-09-10T18:21:17Z","snapshot_observed_at":"2026-08-08T11:09:21.022136Z","submitted_at":"2025-02-11T22:34:49Z","title":"Adaptive kernel predictors from feature-learning infinite limits of neural networks","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-08T11:19:06.951145Z"},"links":{"cited_paper":"/paper/2006.15191","citing_paper":"/paper/2502.07998"},"observation_digest":"sha256:e2c5af003861300c1a489f1cd97cf906472a41042aaf5cbaa342cf82acb32f2c","observation_id":"7b64faef-61a0-4c46-8f65-0c18ef84c6f1","resolution":{"observed_at":"2026-08-08T11:19:06.951145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:19:07.639493Z","title":"and Ringel, Z","venue":null,"work_id":"812f9948-2464-42e8-a844-6d7b9941503b","year":2021},"citing_paper":{"arxiv_id":"2502.07998","last_updated":"2025-09-10T18:21:17Z","snapshot_observed_at":"2026-08-08T11:09:21.022136Z","submitted_at":"2025-02-11T22:34:49Z","title":"Adaptive kernel predictors from feature-learning infinite limits of neural networks","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-08T11:19:06.955103Z"},"links":{"citing_paper":"/paper/2502.07998"},"observation_digest":"sha256:dc6f3169257257f19b6c8ab6614da7502e3b4193328f0a8f801b281502b5b69d","observation_id":"3e16fe45-6b8c-4c4d-8830-57a6b6885dde","resolution":{"observed_at":"2026-08-08T11:19:07.643327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1103/physreve.104.064301","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:19:07.108179Z","title":"Predicting the outputs of finite deep neural networks trained with noisy gradients","venue":null,"work_id":"e8d1ba0b-daf3-4c8b-b807-e043ee096819","year":2021},"citing_paper":{"arxiv_id":"2502.07998","last_updated":"2025-09-10T18:21:17Z","snapshot_observed_at":"2026-08-08T11:09:21.022136Z","submitted_at":"2025-02-11T22:34:49Z","title":"Adaptive kernel predictors from feature-learning infinite limits of neural networks","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-08T11:19:06.958807Z"},"links":{"citing_paper":"/paper/2502.07998"},"observation_digest":"sha256:ace19900f2130113d737ffed6ec7a634def63b404654493c2ed754d3ccbfb0f8","observation_id":"e2231842-c6c5-4c52-b7e6-befbc46ba41f","resolution":{"observed_at":"2026-08-08T11:19:07.113606Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:19:07.628679Z","title":null,"venue":null,"work_id":"0c3a77a1-8d4d-494a-ba15-d980d5f80d28","year":1995},"citing_paper":{"arxiv_id":"2502.07998","last_updated":"2025-09-10T18:21:17Z","snapshot_observed_at":"2026-08-08T11:09:21.022136Z","submitted_at":"2025-02-11T22:34:49Z","title":"Adaptive kernel predictors from feature-learning infinite limits of neural networks","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-08T11:19:06.963021Z"},"links":{"citing_paper":"/paper/2502.07998"},"observation_digest":"sha256:5a79a07732ef5ae45d079f3862b44bb44d9bd098340da502a4e391884b525c6c","observation_id":"53cb4eba-9aab-44ae-b716-75b4af523f17","resolution":{"observed_at":"2026-08-08T11:19:07.632462Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1802.08760","last_updated":"2018-06-18T18:01:43Z","snapshot_observed_at":"2026-07-06T06:25:07.039294Z","submitted_at":"2018-02-23T23:11:07Z","title":"Sensitivity and Generalization in Neural Networks: an Empirical Study","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.08760","snapshot_observed_at":"2026-08-08T11:19:06.966729Z","title":"A., Pennington, J., and Sohl-Dickstein, J","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.07998","last_updated":"2025-09-10T18:21:17Z","snapshot_observed_at":"2026-08-08T11:09:21.022136Z","submitted_at":"2025-02-11T22:34:49Z","title":"Adaptive kernel predictors from feature-learning infinite limits of neural networks","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-08T11:19:06.966729Z"},"links":{"cited_paper":"/paper/1802.08760","citing_paper":"/paper/2502.07998"},"observation_digest":"sha256:f65dfe0bc04c3ee1d44e9b5676046cddb23e9132652b627c408f30f20cbc585c","observation_id":"64e31a00-76f6-4753-bf56-de879aaffc62","resolution":{"observed_at":"2026-08-08T11:19:06.966729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:19:06.970827Z","title":"A statistical mechanics framework for bayesian deep neural networks beyond the infinite-width limit","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07998","last_updated":"2025-09-10T18:21:17Z","snapshot_observed_at":"2026-08-08T11:09:21.022136Z","submitted_at":"2025-02-11T22:34:49Z","title":"Adaptive kernel predictors from feature-learning infinite limits of neural networks","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-08T11:19:06.970827Z"},"links":{"citing_paper":"/paper/2502.07998"},"observation_digest":"sha256:7f581636058efa90f30c73e15fbf49de6f1321633aedcf27565f78ddc8c1d582","observation_id":"f79b6eb6-da9b-450f-92a6-a64db65f8290","resolution":{"observed_at":"2026-08-08T11:19:06.970827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.13881","last_updated":"2023-05-09T14:29:35Z","snapshot_observed_at":"2026-07-06T14:35:33.623257Z","submitted_at":"2022-12-28T15:50:58Z","title":"Mechanism of feature learning in deep fully connected networks and kernel machines that recursively learn features","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.13881","snapshot_observed_at":"2026-08-08T11:19:06.974626Z","title":"Mechanism of feature learning in deep fully connected networks and kernel machines that recursively learn features","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.07998","last_updated":"2025-09-10T18:21:17Z","snapshot_observed_at":"2026-08-08T11:09:21.022136Z","submitted_at":"2025-02-11T22:34:49Z","title":"Adaptive kernel predictors from feature-learning infinite limits of neural networks","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-08T11:19:06.974626Z"},"links":{"cited_paper":"/paper/2212.13881","citing_paper":"/paper/2502.07998"},"observation_digest":"sha256:41130b37d112b12b0befba1ec090852bef71f3a9b94a0de1ee7f372aaa45b911","observation_id":"271e0afb-0925-436c-b665-82c946573226","resolution":{"observed_at":"2026-08-08T11:19:06.974626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:19:07.618403Z","title":null,"venue":null,"work_id":"db4869bb-acda-45b9-b03f-b5b47f730c76","year":2006},"citing_paper":{"arxiv_id":"2502.07998","last_updated":"2025-09-10T18:21:17Z","snapshot_observed_at":"2026-08-08T11:09:21.022136Z","submitted_at":"2025-02-11T22:34:49Z","title":"Adaptive kernel predictors from feature-learning infinite limits of neural networks","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-08T11:19:06.978594Z"},"links":{"citing_paper":"/paper/2502.07998"},"observation_digest":"sha256:014e50a489bee0217b69aa6c28e393fd469e7cb96fad84945f6b840849307392","observation_id":"44f85839-89ae-49a1-afe3-58687255615d","resolution":{"observed_at":"2026-08-08T11:19:07.621900Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:19:07.607835Z","title":"A., Yaida, S., and Hanin, B","venue":null,"work_id":"396788fd-c4d2-4b0d-87fa-f0bfea196c52","year":2022},"citing_paper":{"arxiv_id":"2502.07998","last_updated":"2025-09-10T18:21:17Z","snapshot_observed_at":"2026-08-08T11:09:21.022136Z","submitted_at":"2025-02-11T22:34:49Z","title":"Adaptive kernel predictors from feature-learning infinite limits of neural networks","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-08T11:19:06.982181Z"},"links":{"citing_paper":"/paper/2502.07998"},"observation_digest":"sha256:e80998b0150f3a2c7223dae4821ad92cd8ed1009d12e02c25305b2816de747e7","observation_id":"a400b59a-ae1c-4bf1-a498-9f76bdcee383","resolution":{"observed_at":"2026-08-08T11:19:07.611471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:19:07.596694Z","title":"and Vanden-Eijnden, E","venue":null,"work_id":"0cc96cd0-ba4d-4fbe-ad7d-e6470c4efc23","year":1935},"citing_paper":{"arxiv_id":"2502.07998","last_updated":"2025-09-10T18:21:17Z","snapshot_observed_at":"2026-08-08T11:09:21.022136Z","submitted_at":"2025-02-11T22:34:49Z","title":"Adaptive kernel predictors from feature-learning infinite limits of neural networks","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-08T11:19:06.985649Z"},"links":{"citing_paper":"/paper/2502.07998"},"observation_digest":"sha256:71a2e00dd4f9bdc3e4a1ccac522562d05348acf5ff28c35d5505d0361dc326e7","observation_id":"f9e59aad-3499-4177-b6d4-e0b318109772","resolution":{"observed_at":"2026-08-08T11:19:07.600372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:19:07.585250Z","title":"A unified approach to feature learning in bayesian neural networks","venue":null,"work_id":"a5ce9a8e-f431-4c0c-b7d8-857d99dbdee0","year":2024},"citing_paper":{"arxiv_id":"2502.07998","last_updated":"2025-09-10T18:21:17Z","snapshot_observed_at":"2026-08-08T11:09:21.022136Z","submitted_at":"2025-02-11T22:34:49Z","title":"Adaptive kernel predictors from feature-learning infinite limits of neural networks","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-08T11:19:06.989308Z"},"links":{"citing_paper":"/paper/2502.07998"},"observation_digest":"sha256:64515e7e1b99fd0e5bc7d7b32c6218aed1dc0166b8935735414c8a7f4dd19d72","observation_id":"15992051-5d48-4167-bf31-af731bf79ad6","resolution":{"observed_at":"2026-08-08T11:19:07.589224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:19:07.573597Z","title":"Grokking as a first order phase transition in two layer networks","venue":null,"work_id":"5239498c-f438-42aa-8c0f-2b21b8db907b","year":2024},"citing_paper":{"arxiv_id":"2502.07998","last_updated":"2025-09-10T18:21:17Z","snapshot_observed_at":"2026-08-08T11:09:21.022136Z","submitted_at":"2025-02-11T22:34:49Z","title":"Adaptive kernel predictors from feature-learning infinite limits of neural networks","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-08T11:19:06.993330Z"},"links":{"citing_paper":"/paper/2502.07998"},"observation_digest":"sha256:d40db06f84345d7218a4751b8191e87cf0f4f0ed4ed57050a4980de8fb1feb5f","observation_id":"49f52b8c-42b7-441a-b450-4f90b08959fc","resolution":{"observed_at":"2026-08-08T11:19:07.578056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6120","last_updated":"2014-02-19T17:26:57Z","snapshot_observed_at":"2026-08-08T04:46:43.735461Z","submitted_at":"2013-12-20T20:24:00Z","title":"Exact solutions to the nonlinear dynamics of learning in deep linear neural networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6120","snapshot_observed_at":"2026-08-08T11:19:06.997200Z","title":"M., McClelland, J","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2502.07998","last_updated":"2025-09-10T18:21:17Z","snapshot_observed_at":"2026-08-08T11:09:21.022136Z","submitted_at":"2025-02-11T22:34:49Z","title":"Adaptive kernel predictors from feature-learning infinite limits of neural networks","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-08T11:19:06.997200Z"},"links":{"cited_paper":"/paper/1312.6120","citing_paper":"/paper/2502.07998"},"observation_digest":"sha256:b14a30d47c2a08a9d7d8fa5bda1a09e2c74d9983d07c5a5699b253fb852c4fa5","observation_id":"5ada8535-a99a-477b-b044-67ab0ea8e0e3","resolution":{"observed_at":"2026-08-08T11:19:06.997200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:19:07.562393Z","title":"and Smola, A","venue":null,"work_id":"8b6a4232-c56d-4ced-886b-c1c21e8d9274","year":2001},"citing_paper":{"arxiv_id":"2502.07998","last_updated":"2025-09-10T18:21:17Z","snapshot_observed_at":"2026-08-08T11:09:21.022136Z","submitted_at":"2025-02-11T22:34:49Z","title":"Adaptive kernel predictors from feature-learning infinite limits of neural networks","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-08T11:19:07.001297Z"},"links":{"citing_paper":"/paper/2502.07998"},"observation_digest":"sha256:4e3afcac79e749f86f8524c8da985a28dbc7250a3b97f380ce18db49b5375f94","observation_id":"fdbaaeb2-5632-42e7-bb93-0d1730c6fe11","resolution":{"observed_at":"2026-08-08T11:19:07.565958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:19:07.551128Z","title":"Separation of scales and a thermodynamic description of feature learning in some cnns","venue":null,"work_id":"7f71b76d-5186-42b3-8082-adc99d73b349","year":2023},"citing_paper":{"arxiv_id":"2502.07998","last_updated":"2025-09-10T18:21:17Z","snapshot_observed_at":"2026-08-08T11:09:21.022136Z","submitted_at":"2025-02-11T22:34:49Z","title":"Adaptive kernel predictors from feature-learning infinite limits of neural networks","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-08T11:19:07.005714Z"},"links":{"citing_paper":"/paper/2502.07998"},"observation_digest":"sha256:5567c3f29afdd4d3d899f229f7bdc3f1ee603175208fef10fdf3f5f591704ab7","observation_id":"fe37039f-94a6-4b6d-bd8e-a8ba1bfbdd84","resolution":{"observed_at":"2026-08-08T11:19:07.555220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10315","last_updated":"2025-01-26T04:27:17Z","snapshot_observed_at":"2026-07-06T18:46:09.997234Z","submitted_at":"2024-07-14T20:22:36Z","title":"Order parameters and phase transitions of continual learning in deep neural networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10315","snapshot_observed_at":"2026-08-08T11:19:07.009634Z","title":"Order parameters and phase transitions of continual learning in deep neural networks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07998","last_updated":"2025-09-10T18:21:17Z","snapshot_observed_at":"2026-08-08T11:09:21.022136Z","submitted_at":"2025-02-11T22:34:49Z","title":"Adaptive kernel predictors from feature-learning infinite limits of neural networks","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-08T11:19:07.009634Z"},"links":{"cited_paper":"/paper/2407.10315","citing_paper":"/paper/2502.07998"},"observation_digest":"sha256:cd0795f6b2d68c351f749f690dac066520d79a42e7d30dbb16ec4c82286303c9","observation_id":"1999f3c4-7eef-4eee-8d95-79d2ad4bc88e","resolution":{"observed_at":"2026-08-08T11:19:07.009634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:19:07.013525Z","title":"and Zippelius, A","venue":null,"work_id":null,"year":1981},"citing_paper":{"arxiv_id":"2502.07998","last_updated":"2025-09-10T18:21:17Z","snapshot_observed_at":"2026-08-08T11:09:21.022136Z","submitted_at":"2025-02-11T22:34:49Z","title":"Adaptive kernel predictors from feature-learning infinite limits of neural networks","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-08T11:19:07.013525Z"},"links":{"citing_paper":"/paper/2502.07998"},"observation_digest":"sha256:d5027eeb5cf60333932ec90b13b19b33bd7394f79e393615bf2e9451d5a24f9e","observation_id":"beee171c-b9fe-48fe-b153-492958a3bec2","resolution":{"observed_at":"2026-08-08T11:19:07.013525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16689","last_updated":"2024-06-24T14:50:05Z","snapshot_observed_at":"2026-07-06T18:36:03.601696Z","submitted_at":"2024-06-24T14:50:05Z","title":"Coding schemes in neural networks learning classification tasks","version":1},"cited_work":{"arxiv_id":"2406.16689","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.16689","snapshot_observed_at":"2026-08-08T11:19:07.241392Z","title":"Coding schemes in neural networks learning classification tasks","venue":"cs.LG","work_id":"1679ac0a-0492-4c95-9dc0-1053c063df7e","year":2024},"citing_paper":{"arxiv_id":"2502.07998","last_updated":"2025-09-10T18:21:17Z","snapshot_observed_at":"2026-08-08T11:09:21.022136Z","submitted_at":"2025-02-11T22:34:49Z","title":"Adaptive kernel predictors from feature-learning infinite limits of neural networks","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-08T11:19:07.018072Z"},"links":{"cited_paper":"/paper/2406.16689","citing_paper":"/paper/2502.07998"},"observation_digest":"sha256:f44ad30763f47c1f2830bdfb5ca876c40a129840bd6dc5b0df2f2cf1a517f1e8","observation_id":"a7e5d306-4a5b-4d61-ac6a-89532adfd56a","resolution":{"observed_at":"2026-08-08T11:19:07.245475Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10012","last_updated":"2022-06-20T21:23:28Z","snapshot_observed_at":"2026-07-06T13:22:50.125014Z","submitted_at":"2022-06-20T21:23:28Z","title":"Limitations of the NTK for Understanding Generalization in Deep Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10012","snapshot_observed_at":"2026-08-08T11:19:07.021901Z","title":"Limitations of the ntk for understanding generalization in deep learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.07998","last_updated":"2025-09-10T18:21:17Z","snapshot_observed_at":"2026-08-08T11:09:21.022136Z","submitted_at":"2025-02-11T22:34:49Z","title":"Adaptive kernel predictors from feature-learning infinite limits of neural networks","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-08T11:19:07.021901Z"},"links":{"cited_paper":"/paper/2206.10012","citing_paper":"/paper/2502.07998"},"observation_digest":"sha256:d675e5981d7acecd51adbe67baafd05952d3e6a5b531857cc18a898307d81ce9","observation_id":"8da687c9-9cfd-4ea6-a967-0d71f2b75040","resolution":{"observed_at":"2026-08-08T11:19:07.021901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18411","last_updated":"2023-12-06T01:45:02Z","snapshot_observed_at":"2026-08-07T04:38:30.799325Z","submitted_at":"2023-05-28T17:09:32Z","title":"Feature-Learning Networks Are Consistent Across Widths At Realistic Scales","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18411","snapshot_observed_at":"2026-08-08T11:19:07.025953Z","title":"Feature-learning networks are consistent across widths at realistic scales, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07998","last_updated":"2025-09-10T18:21:17Z","snapshot_observed_at":"2026-08-08T11:09:21.022136Z","submitted_at":"2025-02-11T22:34:49Z","title":"Adaptive kernel predictors from feature-learning infinite limits of neural networks","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-08T11:19:07.025953Z"},"links":{"cited_paper":"/paper/2305.18411","citing_paper":"/paper/2502.07998"},"observation_digest":"sha256:3328b8bcac10e64704c2d32be42ef53797e12d02ce188938bca0ff707e0964cf","observation_id":"4f4726ba-6eac-46d5-b1c4-3c716a872113","resolution":{"observed_at":"2026-08-08T11:19:07.025953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.06176","last_updated":"2022-03-11T18:59:01Z","snapshot_observed_at":"2026-08-07T02:57:29.303009Z","submitted_at":"2022-03-11T18:59:01Z","title":"More Than a Toy: Random Matrix Models Predict How Real-World Neural Representations Generalize","version":1},"cited_work":{"arxiv_id":"2203.06176","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.06176","snapshot_observed_at":"2026-08-08T11:19:07.201370Z","title":"More Than a Toy: Random Matrix Models Predict How Real-World Neural Representations Generalize","venue":"cs.LG","work_id":"d9968e6c-6cf0-4de4-928a-f7eefccde07d","year":2022},"citing_paper":{"arxiv_id":"2502.07998","last_updated":"2025-09-10T18:21:17Z","snapshot_observed_at":"2026-08-08T11:09:21.022136Z","submitted_at":"2025-02-11T22:34:49Z","title":"Adaptive kernel predictors from feature-learning infinite limits of neural networks","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-08T11:19:07.029681Z"},"links":{"cited_paper":"/paper/2203.06176","citing_paper":"/paper/2502.07998"},"observation_digest":"sha256:4e043b7a602bc7fa4cbf2be345b67ed1b6b0b2d5f12c53d08a27d904447e1a1a","observation_id":"61ba1729-c35b-4a9c-9a77-1926a53d1574","resolution":{"observed_at":"2026-08-08T11:19:07.206339Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:19:07.540813Z","title":"and Teh, Y","venue":null,"work_id":"24a6d6e9-3fb7-4de5-b9f4-6fcb102860c5","year":2011},"citing_paper":{"arxiv_id":"2502.07998","last_updated":"2025-09-10T18:21:17Z","snapshot_observed_at":"2026-08-08T11:09:21.022136Z","submitted_at":"2025-02-11T22:34:49Z","title":"Adaptive kernel predictors from feature-learning infinite limits of neural networks","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-08T11:19:07.033663Z"},"links":{"citing_paper":"/paper/2502.07998"},"observation_digest":"sha256:77501509ff8aac774a4def9208b7b58772ff2fbfd720b7b31d1da90a87410c26","observation_id":"3f0426e9-5a73-44a1-951d-5e4cfe740c20","resolution":{"observed_at":"2026-08-08T11:19:07.544336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:19:07.529899Z","title":"X., Robeyns, M., Milsom, E., Anson, B., Schoots, N., and Aitchison, L","venue":null,"work_id":"4e669437-2bdb-4986-854d-7377d15d27eb","year":2023},"citing_paper":{"arxiv_id":"2502.07998","last_updated":"2025-09-10T18:21:17Z","snapshot_observed_at":"2026-08-08T11:09:21.022136Z","submitted_at":"2025-02-11T22:34:49Z","title":"Adaptive kernel predictors from feature-learning infinite limits of neural networks","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-08T11:19:07.036935Z"},"links":{"citing_paper":"/paper/2502.07998"},"observation_digest":"sha256:4d1d43957c522f700fb9cfd0ea802509f932d5ac3c21ed120047cd10cef05411","observation_id":"8596b6dd-b1a9-42e9-a6ab-1b60374c520a","resolution":{"observed_at":"2026-08-08T11:19:07.533673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.14522","last_updated":"2022-07-15T17:04:24Z","snapshot_observed_at":"2026-08-09T04:48:30.109419Z","submitted_at":"2020-11-30T03:21:05Z","title":"Feature Learning in Infinite-Width Neural Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.14522","snapshot_observed_at":"2026-08-08T11:19:07.040114Z","title":"and Hu, E","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.07998","last_updated":"2025-09-10T18:21:17Z","snapshot_observed_at":"2026-08-08T11:09:21.022136Z","submitted_at":"2025-02-11T22:34:49Z","title":"Adaptive kernel predictors from feature-learning infinite limits of neural networks","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-08T11:19:07.040114Z"},"links":{"cited_paper":"/paper/2011.14522","citing_paper":"/paper/2502.07998"},"observation_digest":"sha256:141a97727d496eeeca443a8d608a2d93535937a932d630264a14c298be72f4ca","observation_id":"ee08f366-21d2-4bfd-8f63-176e95ca622a","resolution":{"observed_at":"2026-08-08T11:19:07.040114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03466","last_updated":"2022-03-28T08:12:14Z","snapshot_observed_at":"2026-08-07T09:04:57.100575Z","submitted_at":"2022-03-07T15:37:35Z","title":"Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.03466","snapshot_observed_at":"2026-08-08T11:19:07.043513Z","title":"J., Babuschkin, I., Sidor, S., Liu, X., Farhi, D., Ryder, N., Pachocki, J., Chen, W., and Gao, J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.07998","last_updated":"2025-09-10T18:21:17Z","snapshot_observed_at":"2026-08-08T11:09:21.022136Z","submitted_at":"2025-02-11T22:34:49Z","title":"Adaptive kernel predictors from feature-learning infinite limits of neural networks","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-08T11:19:07.043513Z"},"links":{"cited_paper":"/paper/2203.03466","citing_paper":"/paper/2502.07998"},"observation_digest":"sha256:6f26ea8c739d4f5b5172d7495f1ab10278093e1730d1d2b1d13e8134c12ca09f","observation_id":"f0f72734-4604-44e2-8874-80dae20de07e","resolution":{"observed_at":"2026-08-08T11:19:07.043513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1088/1742-5468/ac98a6","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:19:07.078226Z","title":"A., Canatar, A., Ruben, B","venue":null,"work_id":"3d4a93c7-425c-4a9f-8b3b-7bd3720b39e0","year":2022},"citing_paper":{"arxiv_id":"2502.07998","last_updated":"2025-09-10T18:21:17Z","snapshot_observed_at":"2026-08-08T11:09:21.022136Z","submitted_at":"2025-02-11T22:34:49Z","title":"Adaptive kernel predictors from feature-learning infinite limits of neural networks","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-08T11:19:07.046753Z"},"links":{"citing_paper":"/paper/2502.07998"},"observation_digest":"sha256:1eb111164db87bcc0a085a850727ad5fb53a90290317b686b6a3c46e1a076de1","observation_id":"eb90f376-629c-4cf3-a8c3-a9768446da5c","resolution":{"observed_at":"2026-08-08T11:19:07.082812Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:19:07.519259Z","title":"A., Tong, W","venue":null,"work_id":"93167990-918b-4474-9270-7c213d0cbaeb","year":2022},"citing_paper":{"arxiv_id":"2502.07998","last_updated":"2025-09-10T18:21:17Z","snapshot_observed_at":"2026-08-08T11:09:21.022136Z","submitted_at":"2025-02-11T22:34:49Z","title":"Adaptive kernel predictors from feature-learning infinite limits of neural networks","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-08T11:19:07.049822Z"},"links":{"citing_paper":"/paper/2502.07998"},"observation_digest":"sha256:45129fa801117e53ec5376073ca5ca2afca2d7ad8a2699c1c71d385c06bee01e","observation_id":"cb786d73-1c23-419f-ba36-0b335a306d82","resolution":{"observed_at":"2026-08-08T11:19:07.522724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.07998","last_updated":"2025-09-10T18:21:17Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T11:09:21.022136Z","submitted_at":"2025-02-11T22:34:49Z","title":"Adaptive kernel predictors from feature-learning infinite limits of neural networks"},"reference_resolution":{"displayed":65,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":39,"verified_exact":6,"verified_fuzzy":19},"total_outbound_references":65},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 65 of 65 outbound references and 6 inbound Pith citation observations for arXiv:2502.07998."}