{"as_of":"2026-08-10T11:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:af5a308f17511483bc3dcbdb626b050da763f865bf77a8e40cdec1fd6f433cdc","coverage":[{"denominator":124,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T14:47:40.728250Z","state":"measured"},{"denominator":102,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":102,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T04:23:02.017903Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01763","snapshot_observed_at":"2026-08-02T05:49:26.668562Z","title":"arXiv preprint arXiv:2502.01763 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13246","last_updated":"2026-08-01T19:18:42Z","snapshot_observed_at":"2026-08-07T16:33:22.195520Z","submitted_at":"2026-07-14T20:21:38Z","title":"Reassessing Muon for Matrix Factorization","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-02T05:49:26.668562Z"},"links":{"cited_paper":"/paper/2502.01763","citing_paper":"/paper/2607.13246"},"observation_digest":"sha256:74eee6bb9f26ea48f602992ef3175c08f002b3230e0689e25975baec5beee7ed","observation_id":"c594bbe2-d8d7-4cec-bd63-908906f78eb9","resolution":{"observed_at":"2026-08-02T05:49:26.668562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01763","snapshot_observed_at":"2026-08-04T04:23:02.017903Z","title":"arXiv preprint arXiv:2502.01763 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13246","last_updated":"2026-08-01T19:18:42Z","snapshot_observed_at":"2026-08-07T16:33:22.195520Z","submitted_at":"2026-07-14T20:21:38Z","title":"Reassessing Muon for Matrix Factorization","version":2},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-04T04:23:02.017903Z"},"links":{"cited_paper":"/paper/2502.01763","citing_paper":"/paper/2607.13246"},"observation_digest":"sha256:b466d84f4488f324248674059121cb2a8b7ffee4bc1a5a94ca40cb3f21ea1b67","observation_id":"5512bc06-639e-46bb-ac2b-6717516fa8eb","resolution":{"observed_at":"2026-08-04T04:23:02.017903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2502.01763/citation-record","integrity":"/paper/2502.01763/integrity","json":"/paper/2502.01763/citation-record.json","paper":"/paper/2502.01763"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.304467Z","title":"and Szepesv \\'a ri, C","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.304467Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:cebec6a5a279026634e96880aec3acfba512ec6594547d1336423d1b46628bdf","observation_id":"bce02749-8550-4b65-9051-fb87ac1530e8","resolution":{"observed_at":"2026-08-09T14:47:40.304467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.309277Z","title":"B., and Misiakiewicz, T","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.309277Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:63ab70bb7736e7c738262b5430a85fb96dbbd982313fef82da8c41ae9e63bae2","observation_id":"7193376e-7dd6-48c3-b2a8-b33e0f8e89e2","resolution":{"observed_at":"2026-08-09T14:47:40.309277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.313480Z","title":"B., and Misiakiewicz, T","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.313480Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:f6c802cacd22b196cc9716e267109e69b6ed3657f8ceec5a574ec4f73cd6a081","observation_id":"2f320a98-16b5-4740-b412-3c65974b592d","resolution":{"observed_at":"2026-08-09T14:47:40.313480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.317319Z","title":"Optimization algorithms on matrix manifolds","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.317319Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:be81492caaaf6b2a91c06c432722bfdaf66eb4ada300737932f38aeda5efc4dd","observation_id":"1f82431a-f5ef-45a0-919a-6a9adada6074","resolution":{"observed_at":"2026-08-09T14:47:40.317319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.321442Z","title":"and Pennington, J","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.321442Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:e95985e4daf2302e28f7c7f025fc18f1edaf5d77f16eadc0ccde37cf464b27e1","observation_id":"de925ca4-f8c1-4d47-bbbd-fa25391ce57f","resolution":{"observed_at":"2026-08-09T14:47:40.321442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.325138Z","title":"and Parrilo, P","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.325138Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:b29cbb793acb3983414ca26f64ce30b9d3164f7556a009b12227f9bb7a8be6b2","observation_id":"fbb44cb4-3cd9-4723-9b84-6abc71b8a4a4","resolution":{"observed_at":"2026-08-09T14:47:40.325138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.10732","last_updated":"2020-12-08T19:12:44Z","snapshot_observed_at":"2026-07-06T09:30:32.320227Z","submitted_at":"2020-06-18T17:57:26Z","title":"When Does Preconditioning Help or Hurt Generalization?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.10732","snapshot_observed_at":"2026-08-09T14:47:40.329559Z","title":"When does preconditioning help or hurt generalization? arXiv preprint arXiv:2006.10732, 2020","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.329559Z"},"links":{"cited_paper":"/paper/2006.10732","citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:cf282d098b2241c5c2394c19e4c1d78f5c03b011fab2eb2a5fdd5d63607998a2","observation_id":"bc46bb90-4b9e-4c1f-8db1-4c69c55aa12b","resolution":{"observed_at":"2026-08-09T14:47:40.329559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.334202Z","title":"Locoprop: Enhancing backprop via local loss optimization","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.334202Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:950a4d0e27ed9c8d1d8e7426bbc0fa7d540d8526a57833fec8daf9c2b36d8895","observation_id":"4d693f72-8cd8-44b1-b08b-cd2ea91164e3","resolution":{"observed_at":"2026-08-09T14:47:40.334202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.09018","last_updated":"2021-03-05T06:29:48Z","snapshot_observed_at":"2026-08-03T21:55:15.856477Z","submitted_at":"2020-02-20T20:51:33Z","title":"Scalable Second Order Optimization for Deep Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.09018","snapshot_observed_at":"2026-08-09T14:47:40.338674Z","title":"Scalable second order optimization for deep learning","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.338674Z"},"links":{"cited_paper":"/paper/2002.09018","citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:7ee8f95f62a7661a4ec9754c9624a3b9a0a299857910a4a9c0864ff133b40765","observation_id":"f6ee63cb-87d5-46c8-b7e5-4bfbe809579d","resolution":{"observed_at":"2026-08-09T14:47:40.338674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15459","last_updated":"2025-02-10T09:33:48Z","snapshot_observed_at":"2026-08-05T15:27:10.774229Z","submitted_at":"2024-05-24T11:34:31Z","title":"Repetita Iuvant: Data Repetition Allows SGD to Learn High-Dimensional Multi-Index Functions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15459","snapshot_observed_at":"2026-08-09T14:47:40.343242Z","title":"Repetita iuvant: Data repetition allows SGD to learn high-dimensional multi-index functions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.343242Z"},"links":{"cited_paper":"/paper/2405.15459","citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:e7bccfa78e3c41034c2576679a6f0f1bb5c2a7750ffebc3642441e4327ef79a4","observation_id":"10a1e903-c85c-402b-b5c9-ed75f1db0ffd","resolution":{"observed_at":"2026-08-09T14:47:40.343242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.348170Z","title":"Implicit regularization in deep matrix factorization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.348170Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:613ca514165f28935fa820fc6debf933cdfd137b145829e9961e5c8bcebfb942","observation_id":"ffc32a11-37db-4fb2-84a0-6b7db5fd17ad","resolution":{"observed_at":"2026-08-09T14:47:40.348170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.354122Z","title":"B., and Martens, J","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.354122Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:1c25efbf861d4f4b802068ff694da16d4bc92c89302f10440dd6ad365447c53a","observation_id":"9e0fea14-736a-46a7-85e0-4113327f6a78","resolution":{"observed_at":"2026-08-09T14:47:40.354122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.361665Z","title":"A., Suzuki, T., Wang, Z., Wu, D., and Yang, G","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.361665Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:03ccf7fc4b82080cfaa0a2b47eeecf450bf2821a19815427870123d9bfc38d04","observation_id":"b3f1fec8-b5c5-4e6a-bedc-373c61660763","resolution":{"observed_at":"2026-08-09T14:47:40.361665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.367830Z","title":"A., Suzuki, T., Wang, Z., and Wu, D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.367830Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:325978ef9b9c0f7491ddeec2336d542912cc16e74ab5ef1d6ef55465443ba783","observation_id":"b5fb6e65-fc38-4903-9e15-552dc4f0c857","resolution":{"observed_at":"2026-08-09T14:47:40.367830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.372639Z","title":"Scaling laws of optimization, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.372639Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:2a74bacadfcbc03069523fdc6ae77fd2bc0580c74b15471efd4e7fb9b53a389d","observation_id":"07808b72-662a-4e0d-aa38-38a34939e8f9","resolution":{"observed_at":"2026-08-09T14:47:40.372639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.377075Z","title":"and Lee, J","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.377075Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:ef13c94346366e295d4b5cc17987b541dead32acd8930afdd5543e12325b037e","observation_id":"872b33da-ce0b-410a-b93f-b550286e9611","resolution":{"observed_at":"2026-08-09T14:47:40.377075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.381857Z","title":"Hidden progress in deep learning: SGD learns parities near the computational limit","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.381857Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:d37865965721e3ccf9e8edd314a486a6717e2419878722796b826a9c96d27355","observation_id":"67f30173-e43f-4a91-89fa-d175b3d5ef5c","resolution":{"observed_at":"2026-08-09T14:47:40.381857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.386686Z","title":"Online stochastic gradient descent on non-convex losses from high-dimensional inference","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.386686Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:a11b017daf716109bbbd3d4cdac86342d996587cd1ae17d160fb9072718c6309","observation_id":"298c1374-61c3-40f4-a042-331e08af5ff4","resolution":{"observed_at":"2026-08-09T14:47:40.386686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.391577Z","title":"Gradient descent on neurons and its link to approximate second-order optimization","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.391577Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:21dde6458142cd8ed155488b57368aab27f035c0a12bfe16f011e1bb642c7e6f","observation_id":"cfa5e545-948c-440d-b037-85207d68765e","resolution":{"observed_at":"2026-08-09T14:47:40.391577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21265","last_updated":"2024-12-06T17:02:28Z","snapshot_observed_at":"2026-08-08T03:37:14.378232Z","submitted_at":"2024-10-28T17:57:31Z","title":"Modular Duality in Deep Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21265","snapshot_observed_at":"2026-08-09T14:47:40.399031Z","title":"and Newhouse, L","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.399031Z"},"links":{"cited_paper":"/paper/2410.21265","citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:a06244c8cadde63a11969eb7ca4caf64ba11ae0f2c323ff7bb0de65b40fbc46f","observation_id":"e104b005-4fdb-4942-9cd6-7ff6a9ed5fc9","resolution":{"observed_at":"2026-08-09T14:47:40.399031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.20325","last_updated":"2024-12-06T14:09:22Z","snapshot_observed_at":"2026-08-03T03:18:47.425243Z","submitted_at":"2024-09-30T14:26:12Z","title":"Old Optimizer, New Norm: An Anthology","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.20325","snapshot_observed_at":"2026-08-09T14:47:40.403483Z","title":"and Newhouse, L","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.403483Z"},"links":{"cited_paper":"/paper/2409.20325","citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:f8b90e43081d143a2b7333c6a99080fa8ad1c14018f2dd569c50429defb0eb5c","observation_id":"b146c1de-38bf-40c4-a319-a6fd06b40fd3","resolution":{"observed_at":"2026-08-09T14:47:40.403483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.408891Z","title":"Learning time-scales in two-layers neural networks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.408891Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:e87038bbf447bdfb0513a511486f843b445a90df43dba568a7020815f34d9e33","observation_id":"a64b08e4-4b17-473d-8c9e-329c965a33c7","resolution":{"observed_at":"2026-08-09T14:47:40.408891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.412814Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.412814Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:2cd5d30c757456fea30ac2e48e8d6fe5bf4f81a00668fde07a96372e9ad5d1c9","observation_id":"1fbfaf72-6a26-49b0-88a2-c72effb17601","resolution":{"observed_at":"2026-08-09T14:47:40.412814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.418425Z","title":"and Mondelli, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.418425Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:78934b41f82c69433f6ddca83b1b54f73e7226465d07d363b55b9e19ae73b233","observation_id":"30f40d95-194f-4b0e-a58f-bead24c7b0b2","resolution":{"observed_at":"2026-08-09T14:47:40.418425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14787","last_updated":"2025-05-27T20:36:47Z","snapshot_observed_at":"2026-08-08T15:45:00.702935Z","submitted_at":"2024-10-18T18:01:11Z","title":"Privacy for Free in the Overparameterized Regime","version":2},"cited_work":{"arxiv_id":"2410.14787","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.14787","snapshot_observed_at":"2026-08-09T14:47:42.495361Z","title":"Privacy for Free in the Overparameterized Regime","venue":"stat.ML","work_id":"6f96ef27-a68a-4964-b61a-ed9556bca306","year":2024},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.422681Z"},"links":{"cited_paper":"/paper/2410.14787","citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:42096eabd55edfc591b2e487cfe3088ac3691bae2dc9ce0fda51d73bae28d3c8","observation_id":"bf328dcd-c6a2-4e14-8f98-9b2938b8b042","resolution":{"observed_at":"2026-08-09T14:47:42.500114Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.428124Z","title":"Beyond the universal law of robustness: Sharper laws for random features and neural tangent kernels","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.428124Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:35dc950b2e4bd96d01c7f0371a2b1512826b54627a76d029e1fee2f4d89d8b39","observation_id":"517db258-d052-4692-875b-96881237575e","resolution":{"observed_at":"2026-08-09T14:47:40.428124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.432156Z","title":"Practical Gauss- Netwon optimisation for deep learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.432156Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:a5eef9cc20b8394c8acd0b1153fba882dc832e0e2dd20f8c3163375dad87c56d","observation_id":"8a41c11c-128f-4786-90a2-a04690a6f33b","resolution":{"observed_at":"2026-08-09T14:47:40.432156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.435829Z","title":"H., Hansen, S","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.435829Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:784cf8323271b76834e027ba76282e942ec373d99237756e199692743a409ae2","observation_id":"d8ade78a-5882-4f91-9a98-047061157a6e","resolution":{"observed_at":"2026-08-09T14:47:40.435829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.11675","last_updated":"2019-09-25T15:28:33Z","snapshot_observed_at":"2026-07-06T07:56:03.252728Z","submitted_at":"2019-05-28T08:30:24Z","title":"Gram-Gauss-Newton Method: Learning Overparameterized Neural Networks for Regression Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.11675","snapshot_observed_at":"2026-08-09T14:47:40.439889Z","title":"Gram-Gauss- Netwon method: Learning overparameterized neural networks for regression problems","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.439889Z"},"links":{"cited_paper":"/paper/1905.11675","citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:ed0c3a8464bc90b521949b54e8bcc03dccca5bb256fa6d6d0da80f0084598e73","observation_id":"e9f04798-4a48-4bab-a702-aa64104d58f7","resolution":{"observed_at":"2026-08-09T14:47:40.439889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.443948Z","title":"Exploiting shared representations for personalized federated learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.443948Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:52399d9a75ccaa1eb3d7e80095248b377cb62cc9b3714be6a5c37ee97f825253","observation_id":"dcdce652-6755-4296-acbc-cf9716c7fb7f","resolution":{"observed_at":"2026-08-09T14:47:40.443948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.449327Z","title":"Provable multi-task representation learning by two-layer ReLU neural networks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.449327Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:d5d60af7637e1017670fd33bcc3a6159e025e5b16da4cea3ef9691c879ddb77c","observation_id":"5d5657af-e725-4a2b-a3a8-09f1b66ba8d6","resolution":{"observed_at":"2026-08-09T14:47:40.449327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.453841Z","title":"Asymptotics of feature learning in two-layer networks after one gradient-step","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.453841Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:137fc7567c5db2e350b561b1a3faa2285427f8604e1adb432d123f9a45cfd274","observation_id":"256b669c-b153-4ee5-b57c-08d152b1bdbc","resolution":{"observed_at":"2026-08-09T14:47:40.453841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07179","last_updated":"2025-06-18T11:00:36Z","snapshot_observed_at":"2026-07-06T15:41:35.923624Z","submitted_at":"2023-06-12T15:21:02Z","title":"Benchmarking Neural Network Training Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07179","snapshot_observed_at":"2026-08-09T14:47:40.457590Z","title":"E., Schneider, F., Nado, Z., Agarwal, N., Sastry, C","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.457590Z"},"links":{"cited_paper":"/paper/2306.07179","citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:bae5f9aca50bbaf070b0cae356fa38f73cec0c3b67ee372b06d31537bb5523fd","observation_id":"fa88d2c3-f48e-4033-8299-440b908b08ec","resolution":{"observed_at":"2026-08-09T14:47:40.457590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.462358Z","title":"Neural networks can learn representations with gradient descent","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.462358Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:892e889c685a0f5b1f3729101ff35db622222a62bdc98821c6a4ddaf0f7adcdf","observation_id":"b1bbd743-58fa-4b98-93d6-9628fe76a564","resolution":{"observed_at":"2026-08-09T14:47:40.462358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.466603Z","title":"How two-layer neural networks learn, one (giant) step at a time","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.466603Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:3ac5a9c8eb9041171813eaeb045e23b3659eac80633e61a43a7fcb8f4c471d9d","observation_id":"22cf088e-f81b-41dd-8090-046e598c859a","resolution":{"observed_at":"2026-08-09T14:47:40.466603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18938","last_updated":"2024-10-24T17:24:34Z","snapshot_observed_at":"2026-08-10T00:03:27.002170Z","submitted_at":"2024-10-24T17:24:34Z","title":"A Random Matrix Theory Perspective on the Spectrum of Learned Features and Asymptotic Generalization Capabilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18938","snapshot_observed_at":"2026-08-09T14:47:40.471320Z","title":"M., and Loureiro, B","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.471320Z"},"links":{"cited_paper":"/paper/2410.18938","citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:f36e535440835f47c7a3d4e1f7bfbee4cd7648da894903c64e0ae6e14d1c8979","observation_id":"84927feb-beac-4eb3-a64a-d1fe23e2c2bf","resolution":{"observed_at":"2026-08-09T14:47:40.471320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.475810Z","title":"The benefits of reusing batches for gradient descent in two-layer networks: Breaking the curse of information and leap exponents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.475810Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:e52eaff8d441c3d385ba540e82940621795b879986ab35d83d60254ca5dd0b31","observation_id":"7e01e8de-9c7e-4716-afc4-6d14356ae73b","resolution":{"observed_at":"2026-08-09T14:47:40.475810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.480451Z","title":"Modular block-diagonal curvature approximations for feedforward architectures","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.480451Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:11c3dc78ebd9331772bc3502522b1bf136517fcdb455b1b748bbcd40402932a6","observation_id":"73454c87-a7f4-4455-9fd0-ed35153d6aec","resolution":{"observed_at":"2026-08-09T14:47:40.480451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08100","last_updated":"2024-07-11T00:10:35Z","snapshot_observed_at":"2026-08-09T22:04:18.191604Z","submitted_at":"2024-07-11T00:10:35Z","title":"Non-convergence of Adam and other adaptive stochastic gradient descent optimization methods for non-vanishing learning rates","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08100","snapshot_observed_at":"2026-08-09T14:47:40.486358Z","title":"Non-convergence of Adam and other adaptive stochastic gradient descent optimization methods for non-vanishing learning rates","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.486358Z"},"links":{"cited_paper":"/paper/2407.08100","citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:9657149d42976674e7402563d19f7966fa666ebfdc102c4bf2b73c95513908b5","observation_id":"6866259e-82f7-440b-84eb-964097cfc13f","resolution":{"observed_at":"2026-08-09T14:47:40.486358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.490862Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.490862Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:86b485ed79b6b900b02dfb0156c630401272fe6cdf99c16e013274c18c3bacb1","observation_id":"c762e9fa-410a-40ba-8934-edbd513acfc9","resolution":{"observed_at":"2026-08-09T14:47:40.490862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.495605Z","title":"and Wager, S","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.495605Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:5d134147660fcdfe4d36769800a178dd3ff52d312180010fbc7bd092de19b156","observation_id":"25d7dbda-a607-4810-85b7-8cb65679855e","resolution":{"observed_at":"2026-08-09T14:47:40.495605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.500141Z","title":"S., Hu, W., Kakade, S","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.500141Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:424ee24c2813273e3126cf6b5ced0ce5f87266fbdc297944e2440d3a3c13547a","observation_id":"15c500be-be2a-4cc5-a5e2-fa8686a15c2a","resolution":{"observed_at":"2026-08-09T14:47:40.500141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.505091Z","title":"Adaptive subgradient methods for online learning and stochastic optimization","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.505091Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:d8e210b2fa448818fca3b8d286475075b743c873287710fb87bef5044f678129","observation_id":"bc16ca31-d1cc-4744-85a8-393eb048238e","resolution":{"observed_at":"2026-08-09T14:47:40.505091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.509479Z","title":"Proximal backpropagation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.509479Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:cd449011d321691031c4d67a1f5bb617b808ad6409c510fc2e9f7f05504679ec","observation_id":"ff4ce0d6-8580-4bcf-8fab-76c3c9ef8204","resolution":{"observed_at":"2026-08-09T14:47:40.509479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17201","last_updated":"2024-11-26T08:14:48Z","snapshot_observed_at":"2026-08-02T22:36:11.159874Z","submitted_at":"2024-11-26T08:14:48Z","title":"Learning Hierarchical Polynomials of Multiple Nonlinear Features with Three-Layer Networks","version":1},"cited_work":{"arxiv_id":"2411.17201","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.17201","snapshot_observed_at":"2026-08-09T14:47:42.438358Z","title":"Learning Hierarchical Polynomials of Multiple Nonlinear Features with Three-Layer Networks","venue":"cs.LG","work_id":"e114caf1-18ae-49ec-99ab-24bd737bdf2a","year":2024},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.513091Z"},"links":{"cited_paper":"/paper/2411.17201","citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:06d581f7f9d86d9f209dd8d5b01b028589c59ecef7825d0c45ad2032edbde2b3","observation_id":"c99f2b0f-2772-4e15-9be3-6dcaa37c2bb9","resolution":{"observed_at":"2026-08-09T14:47:42.442595Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.516867Z","title":"Linearized two-layers neural networks in high dimension","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.516867Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:c11a0023130bba544be14307f2010cb9693cf72cc82cf1daf8abe95a0c010314","observation_id":"252bdf19-c590-4bbc-9cd7-29e0d50eb381","resolution":{"observed_at":"2026-08-09T14:47:40.516867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.520374Z","title":"When do neural networks outperform kernel methods? Journal of Statistical Mechanics: Theory and Experiment, 2021 0 (12), 2021 b","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.520374Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:e10035cf4d5259e27a0c0a8015e11c275103cb4a6fadd47418de9520b02d20a3","observation_id":"f7931c78-ba89-4082-85ee-c5923442b1b1","resolution":{"observed_at":"2026-08-09T14:47:40.520374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.524058Z","title":"A family of variable-metric methods derived by variational means","venue":null,"work_id":null,"year":1970},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.524058Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:928ceb0f5f873adea0325abf6ce7f76c6cc64e7ae3ca320a8a43684839afaf4f","observation_id":"85e99ff8-1046-4e3e-a3f8-18dd3eafd38e","resolution":{"observed_at":"2026-08-09T14:47:40.524058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.528448Z","title":"Practical quasi- Netwon methods for training deep neural networks","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.528448Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:528282a6443a73ae4a6819d9fd69fd6133aa43bebdb931777eae402279085e3d","observation_id":"82c83bb6-3165-4b28-9f16-a163af501fd2","resolution":{"observed_at":"2026-08-09T14:47:40.528448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.533185Z","title":"The G aussian equivalence of generative models for learning with shallow neural networks","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.533185Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:029c5e0aa76376fef964b192704a38748e5f41fc28cf6a8d32d58b08692e2fa5","observation_id":"abe35d8f-a5d0-4268-8cc0-5d98c753aa40","resolution":{"observed_at":"2026-08-09T14:47:40.533185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.14055","last_updated":"2023-10-21T16:23:59Z","snapshot_observed_at":"2026-07-06T16:36:35.423639Z","submitted_at":"2023-10-21T16:23:59Z","title":"Spectral Phase Transitions in Non-Linear Wigner Spiked Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.14055","snapshot_observed_at":"2026-08-09T14:47:40.537284Z","title":"Spectral phase transitions in non-linear wigner spiked models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.537284Z"},"links":{"cited_paper":"/paper/2310.14055","citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:068b9d5b62d979dd888c9699b332cf584a112142c9d1400cbeeb7c5a55a2f1b0","observation_id":"e457abdd-3640-4945-8bb9-6fc4db3ca515","resolution":{"observed_at":"2026-08-09T14:47:40.537284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.541398Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.541398Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:7100defdd4730aeca1854bde0255421a6a5c9af3a18a67fdbb157a2be126e929","observation_id":"421b455b-ee73-471f-a4a2-ca042e11dd29","resolution":{"observed_at":"2026-08-09T14:47:40.541398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.545269Z","title":"Shampoo: Preconditioned stochastic tensor optimization","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.545269Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:e343c2d33916f53314b3df71308530072982460c085338bf8df849ffef58c082","observation_id":"8126d448-d040-4a49-b6ac-1eff22992fcd","resolution":{"observed_at":"2026-08-09T14:47:40.545269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.548962Z","title":"and Nica, M","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.548962Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:65f8d657811efab54d1afdd4359c9b4127467734f3be8856d12d5a448bb0bc18","observation_id":"bcebb231-9ae7-4250-bd93-c2e08d1f1d6d","resolution":{"observed_at":"2026-08-09T14:47:40.548962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.552782Z","title":null,"venue":null,"work_id":null,"year":1971},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.552782Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:7c3507d98f3b0da1044b2c7365e59203d2762b66873ef0c6250c15a84a486f75","observation_id":"5a6fb108-5b8d-4047-90f3-6f33e8decf73","resolution":{"observed_at":"2026-08-09T14:47:40.552782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.556647Z","title":"and Javanmard, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.556647Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:70e0f45bddc230ca359582d05ed0dc441ad6694e7c7e062cdaa47a8ca8202816","observation_id":"f2471c44-e407-4422-923a-84655537715f","resolution":{"observed_at":"2026-08-09T14:47:40.556647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.560608Z","title":null,"venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.560608Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:b048b138d071d53c697e8cb70738053210643c04def66eee5d768426f7064aed","observation_id":"29217597-fb3d-4d51-ae01-90ea07e95239","resolution":{"observed_at":"2026-08-09T14:47:40.560608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:43.211484Z","title":"M., and Zhang, T","venue":null,"work_id":"50946303-e0f9-4edd-ad69-618953ca3478","year":2012},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.564868Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:b0dd506d06a87e1822d0e5c9b2ea54e3b29ccea355dd9967ae75e6d26365df35","observation_id":"9c12a425-d4ce-4403-aaf6-f07e0d3354ab","resolution":{"observed_at":"2026-08-09T14:47:43.215635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:43.197169Z","title":"and Lu, Y","venue":null,"work_id":"36ad3309-c894-462f-b8b6-1fe7c865b25f","year":2023},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.568825Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:1cf46f142cd146df1f50455bcad79d58e112934f0975bc3bed3fc14693eeb7fd","observation_id":"bc7af867-b87f-45f9-adec-00bdf6d797ae","resolution":{"observed_at":"2026-08-09T14:47:43.201443Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:43.184878Z","title":"and Szegedy, C","venue":null,"work_id":"c4ae6710-4c3b-4183-bcb8-b6d83659b0ce","year":2015},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.572424Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:e99bbb557e0c6c3a1f535e9cbafa1f232276b7d7bb67399d90b17fbd2c30f7c4","observation_id":"f54e91de-1899-4096-adac-1fae999788d5","resolution":{"observed_at":"2026-08-09T14:47:43.188677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.12226","last_updated":"2024-06-08T08:45:12Z","snapshot_observed_at":"2026-08-06T03:17:03.846308Z","submitted_at":"2023-12-19T15:12:39Z","title":"On the Parameterization of Second-Order Optimization Effective Towards the Infinite Width","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.12226","snapshot_observed_at":"2026-08-09T14:47:40.576362Z","title":"and Karakida, R","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.576362Z"},"links":{"cited_paper":"/paper/2312.12226","citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:34adee5ce8232a30de61a7b179e601f732330f0b154ae094a4beb801534aea59","observation_id":"f9d9e5e1-2cef-4e89-836f-81fc90171b64","resolution":{"observed_at":"2026-08-09T14:47:40.576362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:43.172230Z","title":"Neural tangent kernel: Convergence and generalization in neural networks","venue":null,"work_id":"cd28a444-2183-448a-8917-7dc222db1cfd","year":2018},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.580605Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:839ca67b0c9906b1686782dcd19ed1af154e7deb1c7d6d2ddb37478c420d92fa","observation_id":"690ad69d-fb90-4bbb-b54e-8173f53389ed","resolution":{"observed_at":"2026-08-09T14:47:43.176504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:43.158330Z","title":"Low-rank matrix completion using alternating minimization","venue":null,"work_id":"dc121db3-947f-4ed4-b4ed-c2bdb6ca0308","year":2013},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.584397Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:9e6168eb8d79301b35c3279e9b598532f1d254eec7bd72d10a62b881c509c894","observation_id":"1279429c-1794-4140-be6d-178de71424b7","resolution":{"observed_at":"2026-08-09T14:47:43.163081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:43.143599Z","title":"Muon: An optimizer for hidden layers in neural networks, 2024","venue":null,"work_id":"4fa6197d-b14a-401f-88e4-ec9a556057e2","year":2024},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.589217Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:8ac4229f3d7e3a770a8d8b3514024b97ba6de4221c9c6bfe2bec154ed3bebfa0","observation_id":"026a4f86-c81a-4f80-9bd7-24b01f956401","resolution":{"observed_at":"2026-08-09T14:47:43.147831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.07628","last_updated":"2017-12-20T18:34:08Z","snapshot_observed_at":"2026-08-07T18:27:25.346124Z","submitted_at":"2017-12-20T18:34:08Z","title":"Improving Generalization Performance by Switching from Adam to SGD","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.07628","snapshot_observed_at":"2026-08-09T14:47:40.593164Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.593164Z"},"links":{"cited_paper":"/paper/1712.07628","citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:53a56335db0cd1daaaa7e5984c5f730cd9df5282fd5b081f811aeef8d33650b4","observation_id":"e77cab59-85e7-4356-b651-1126434c3d34","resolution":{"observed_at":"2026-08-09T14:47:40.593164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.597248Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.597248Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:84f3cf2d48d88b690d32458a4edbec3118a1ddca8eae826eb532e72672899bce","observation_id":"652e5d86-f409-41c7-ae50-3cc85dabc55a","resolution":{"observed_at":"2026-08-09T14:47:40.597248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:43.118786Z","title":"M., Ma, T., and Liang, P","venue":null,"work_id":"2e20b296-c57b-4429-80fc-8194ab9125c2","year":2022},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.601177Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:50054e904e3d1a168ecd92ae8d41f9c058cc35defd40c83067aafa0a05826760","observation_id":"869a9e7f-5c29-4588-8006-ceb7733b6b02","resolution":{"observed_at":"2026-08-09T14:47:43.123219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14813","last_updated":"2024-05-23T17:23:30Z","snapshot_observed_at":"2026-08-10T06:23:17.427470Z","submitted_at":"2024-05-23T17:23:30Z","title":"Scalable Optimization in the Modular Norm","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14813","snapshot_observed_at":"2026-08-09T14:47:40.604767Z","title":"Scalable optimization in the modular norm","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.604767Z"},"links":{"cited_paper":"/paper/2405.14813","citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:aad40d5c59964b22566a8657abe97bd4c9aa4bd6a3b9c5f1dc723d96f5e29271","observation_id":"72e137fb-aec8-4d12-af33-abbead0af4b2","resolution":{"observed_at":"2026-08-09T14:47:40.604767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:43.105410Z","title":"and Massart, P","venue":null,"work_id":"c015076a-86dc-4def-8cc6-2f159b67f232","year":2000},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.609198Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:95b53ce3570a415f37b1da54854448b1bdeeb9917e783202f9bc6af9f157381c","observation_id":"836c0b76-eeb2-4ac8-8076-2ae655001634","resolution":{"observed_at":"2026-08-09T14:47:43.109668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:43.092456Z","title":"Demystifying disagreement-on-the-line in high dimensions","venue":null,"work_id":"25ce2bd8-d81b-477d-9839-de91c623bfc3","year":2023},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.613267Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:5234c14267b84e9d32394c01a41be3ff048be5553e3cb9693037956074be27d4","observation_id":"f975a99a-dee8-4548-9e66-394fcce7a653","resolution":{"observed_at":"2026-08-09T14:47:43.096942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01581","last_updated":"2024-12-22T09:59:09Z","snapshot_observed_at":"2026-08-04T02:53:19.400873Z","submitted_at":"2024-06-03T17:56:58Z","title":"Neural network learns low-dimensional polynomials with SGD near the information-theoretic limit","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01581","snapshot_observed_at":"2026-08-09T14:47:40.617364Z","title":"D., Oko, K., Suzuki, T., and Wu, D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.617364Z"},"links":{"cited_paper":"/paper/2406.01581","citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:d7cb6cf51669833fb4ab8c0752e3a078e9ee943cfecd65b169dfa71f1fd229bd","observation_id":"4a46ccb1-c848-4c3b-ae50-394da2df9736","resolution":{"observed_at":"2026-08-09T14:47:40.617364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:43.080167Z","title":"S., Tajwar, F., Kumar, A., Yao, H., Liang, P., and Finn, C","venue":null,"work_id":"b9304870-416e-40e4-8fc4-16327e6e8977","year":2023},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.621410Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:7eb5b8d36b3a9a3087a6613767260afafbb0f00f844c2de7a57b22aa8fdf96cf","observation_id":"c7f7b1aa-9db5-41af-b91c-70601291b98c","resolution":{"observed_at":"2026-08-09T14:47:43.084316Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:43.066165Z","title":"and Dobriban, E","venue":null,"work_id":"e59c5b99-b20a-441c-97fd-3bcc467aaa19","year":2021},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.624853Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:84ed19c115400dea39b18990cca432661a59ade44d9abbe33ef131c1229f0f02","observation_id":"367733f4-e4ea-4cee-bbcc-fb3d3563caa0","resolution":{"observed_at":"2026-08-09T14:47:43.070732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:43.053183Z","title":"E., and Makhzani, A","venue":null,"work_id":"8d37231a-2e34-4059-83ea-bb92280c8f33","year":2024},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.628536Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:807c3178990b4b152df744c7733cf4d59457180dcbfaf4ff143fe49ee5580e6b","observation_id":"b12ff897-c3ca-4236-9049-ae560dbd4a27","resolution":{"observed_at":"2026-08-09T14:47:43.057485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.632426Z","title":null,"venue":null,"work_id":null,"year":1989},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.632426Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:572d2d5581e7a4594702a42d64fea73fe7033dcebc6320ced9be8b3204c57f2a","observation_id":"388f6a38-5390-42c8-9c6d-1631db713a18","resolution":{"observed_at":"2026-08-09T14:47:40.632426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:43.032879Z","title":"Deep learning via Hessian -free optimization","venue":null,"work_id":"4a8ced4d-3897-48fd-b362-e3dbd444d0b9","year":2010},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.636203Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:ee430e2995ed8e2d7dddf7a99cf29669eb26dcae73e0dbc4bbbe9cacad6c2dd4","observation_id":"d154584e-0edb-45c6-8104-9eb67556d371","resolution":{"observed_at":"2026-08-09T14:47:43.037180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.640176Z","title":"New insights and perspectives on the natural gradient method","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.640176Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:90fc0014cf683eb230d5dc3f594d8d994de7fe11597ddd43c0657c9b34432e95","observation_id":"a8a14744-97ca-4df6-982b-504df2350ef7","resolution":{"observed_at":"2026-08-09T14:47:40.640176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:43.013085Z","title":"and Grosse, R","venue":null,"work_id":"f64288bd-6c3c-4bea-bc50-654b06e5c05c","year":2015},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.643973Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:4f2e2de39a79039eb8d70b55137fdce144d7298895291f9d8322f15c29a11520","observation_id":"d26dd43c-c00c-44eb-99e2-7541db46b928","resolution":{"observed_at":"2026-08-09T14:47:43.016984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:42.999475Z","title":"The benefit of multitask representation learning","venue":null,"work_id":"87a70c02-0a59-406d-9425-98a9d1e22ce6","year":2016},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.647750Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:c0b1e2a84fd6c032fd8adc9e80efbf2ef33b568964cbfc32c09212f4e989e37a","observation_id":"ea6facc4-7413-47de-9477-bb75f5272864","resolution":{"observed_at":"2026-08-09T14:47:43.004539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.651377Z","title":"and Montanari, A","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.651377Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:5ff876bc9312a1f4b1012cc61ddcddefe0788f1b877068b402ba0a5a3a98e94b","observation_id":"ca064cd8-24a5-4eff-a8e5-82afb1ec2bed","resolution":{"observed_at":"2026-08-09T14:47:40.651377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:42.979839Z","title":"Announcing the results of the inaugural AlgoPerf : Training algorithms benchmark competition, 2024","venue":null,"work_id":"4216a635-3add-4e65-a98e-2efcc489222d","year":2024},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.655175Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:30e298f13312a540eec2697d521daeec10d2435360f40e2487f077a9066eb0d8","observation_id":"72c85b7c-06ff-4720-8cb5-7bc8c702ff7c","resolution":{"observed_at":"2026-08-09T14:47:42.984276Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03702","last_updated":"2024-12-07T21:32:39Z","snapshot_observed_at":"2026-07-06T20:01:50.356653Z","submitted_at":"2024-12-04T20:31:47Z","title":"Asymptotics of Linear Regression with Linearly Dependent Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03702","snapshot_observed_at":"2026-08-09T14:47:40.658970Z","title":"and Hassani, H","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.658970Z"},"links":{"cited_paper":"/paper/2412.03702","citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:89045ae00d045b81e29eb879ce92ccf6e73601ad2ec90bfe22efbc606568d2e4","observation_id":"dfc3bb58-f64e-4136-8191-d2ceed24bcf8","resolution":{"observed_at":"2026-08-09T14:47:40.658970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18274","last_updated":"2024-05-28T15:24:35Z","snapshot_observed_at":"2026-08-08T06:07:30.021034Z","submitted_at":"2024-05-28T15:24:35Z","title":"Signal-Plus-Noise Decomposition of Nonlinear Spiked Random Matrix Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18274","snapshot_observed_at":"2026-08-09T14:47:40.662641Z","title":"and Hassani, H","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.662641Z"},"links":{"cited_paper":"/paper/2405.18274","citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:d4e5ba1be7ee340fe72af566c3f8d49302297ce3a7a3f85ffb6d2f1d265e7e34","observation_id":"49b4fddf-ba51-4679-b613-98ca54407e0b","resolution":{"observed_at":"2026-08-09T14:47:40.662641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:42.967756Z","title":"A theory of non-linear feature learning with one gradient step in two-layer neural networks","venue":null,"work_id":"d137561c-ac50-40ea-b5eb-8ee619d46749","year":2024},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.666465Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:d8f3e33b9a7b09972309df154b16843c0c6c43034548acc0e08036229e58126a","observation_id":"dc3c028a-32bc-490d-b3cb-245003e03137","resolution":{"observed_at":"2026-08-09T14:47:42.971707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.01544","last_updated":"2023-03-22T16:53:25Z","snapshot_observed_at":"2026-07-06T08:34:41.399203Z","submitted_at":"2019-11-05T00:15:27Z","title":"The generalization error of max-margin linear classifiers: Benign overfitting and high dimensional asymptotics in the overparametrized regime","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.01544","snapshot_observed_at":"2026-08-09T14:47:40.669988Z","title":"The generalization error of max-margin linear classifiers: High-dimensional asymptotics in the overparametrized regime","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.669988Z"},"links":{"cited_paper":"/paper/1911.01544","citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:e4a3d8a4daa9d5ad9f368e21037dfc0ea2d70533d6fac35773c1504a618aa9f6","observation_id":"cd2205b1-aa50-48c0-b8f3-5eb254c2b041","resolution":{"observed_at":"2026-08-09T14:47:40.669988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17748","last_updated":"2024-06-25T17:34:51Z","snapshot_observed_at":"2026-08-04T06:25:41.174652Z","submitted_at":"2024-06-25T17:34:51Z","title":"A New Perspective on Shampoo's Preconditioner","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17748","snapshot_observed_at":"2026-08-09T14:47:40.673899Z","title":"A new perspective on shampoo's preconditioner","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.673899Z"},"links":{"cited_paper":"/paper/2406.17748","citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:f0e2b2b0102be6e61ba40882d3f61cd01fafefba0bfbbf80989e92f804bedc8f","observation_id":"c3a67bcd-ac56-446b-b883-d372f0cb6099","resolution":{"observed_at":"2026-08-09T14:47:40.673899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:42.955715Z","title":null,"venue":null,"work_id":"43245962-d98f-4c49-add7-d1b1713c0e09","year":2023},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.678103Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:0072098e240b198fc43d18b99e8f512d1e4d91c31847e9f75160dc094b6bdb42","observation_id":"5c6387ee-d047-4a34-8b20-226e3634757a","resolution":{"observed_at":"2026-08-09T14:47:42.959520Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21696","last_updated":"2025-02-27T06:07:09Z","snapshot_observed_at":"2026-08-09T03:58:39.438292Z","submitted_at":"2024-10-29T03:27:08Z","title":"The Effects of Multi-Task Learning on ReLU Neural Network Functions","version":4},"cited_work":{"arxiv_id":"2410.21696","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.21696","snapshot_observed_at":"2026-08-09T14:47:42.205894Z","title":"The Effects of Multi-Task Learning on ReLU Neural Network Functions","venue":"stat.ML","work_id":"8167b706-a440-481a-94de-1d1d03db15c8","year":2024},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.681743Z"},"links":{"cited_paper":"/paper/2410.21696","citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:a3de977dd708fd0a556514d82dd5077c3077125bb75f08f74c65bb2bc4b86173","observation_id":"cd8868c1-1a99-41ee-9b96-5036ab4b028c","resolution":{"observed_at":"2026-08-09T14:47:42.212659Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:42.943525Z","title":"and Vaswani, N","venue":null,"work_id":"b7dce5fb-2bbe-401f-87c9-8378008978d7","year":2022},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.685732Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:28ea6af27ab15fc2f896ea9a59cd6a00931c82e238cd07f3ad18c12482470d1e","observation_id":"e8b91276-6fb6-4dcf-b223-3a0ebf4c5970","resolution":{"observed_at":"2026-08-09T14:47:42.947872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:42.931613Z","title":null,"venue":null,"work_id":"d59a3762-951d-4c12-b96d-b2b6714c9249","year":2024},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.689591Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:dfa18116c612009afd02e32e9745e8292de72c6f96a0aa059df608ec747a6209","observation_id":"231319a4-4634-44bb-b4b2-d86129a81411","resolution":{"observed_at":"2026-08-09T14:47:42.935618Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:42.918168Z","title":null,"venue":null,"work_id":"2dba342a-81fa-46f4-85d5-ee2b0c2df700","year":2024},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.693289Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:34add4f1c5d207955f8acba9e4201d2bf361221ffc5fb00b42f5a061dead289f","observation_id":"842238ef-a75e-4a88-8da8-3d2c4826019e","resolution":{"observed_at":"2026-08-09T14:47:42.922094Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.696612Z","title":"and Wright, S","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.696612Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:bf3d9688eddbb573387b3a2ca93c787320bcd42213cc6fd52ce12c4745de05b7","observation_id":"59412849-2ae1-4f39-9488-9994150bfc71","resolution":{"observed_at":"2026-08-09T14:47:40.696612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.700012Z","title":null,"venue":null,"work_id":null,"year":1994},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.700012Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:315f888da2328473d4277a2e5c83018ab67d85b76e9ce7a2b8aab51e81915723","observation_id":"c8c6eed3-3c23-4b61-98ce-4e57ab071899","resolution":{"observed_at":"2026-08-09T14:47:40.700012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:42.892758Z","title":"and Recht, B","venue":null,"work_id":"92039b22-eecd-4589-a6ea-06db119133d7","year":2007},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.704030Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:0d82e3b2e10bafdf24a326ca5247b9bdf9baf915f0fced42c45689168c98a734","observation_id":"cb2ddf47-a413-4315-88d7-fc3902713327","resolution":{"observed_at":"2026-08-09T14:47:42.896569Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:42.880775Z","title":"J., Kale, S., and Kumar, S","venue":null,"work_id":"a012d1b9-d50f-44f1-b70a-0a65f602af5a","year":2018},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.708947Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:467a78baa6fef6481ddb9c70cf57a041ffe5867a5b896677e4e5064274b95945","observation_id":"d88406f9-136f-404b-a8b6-3ccc80639d69","resolution":{"observed_at":"2026-08-09T14:47:42.884738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:42.868527Z","title":"and Vershynin, R","venue":null,"work_id":"2de420b5-3e27-42ad-b005-d899eff88234","year":2013},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.712662Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:aaae380b869bb08e2bd22fcaef281745e9a51b01340cfd609564ab76ab0985a8","observation_id":"af7d01e1-2641-4f1c-a187-18c9bc667570","resolution":{"observed_at":"2026-08-09T14:47:42.872327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:42.857652Z","title":"M., Schneider, F., and Hennig, P","venue":null,"work_id":"c0d11325-d466-4910-8294-de0ce00dbceb","year":2021},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.716403Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:dd7a6a9e4d6e61e71da3a06345219d6a58dacde23f193beb8f042c8031bb4d30","observation_id":"fd2c4366-ab72-4c83-92f8-fe022a0627a5","resolution":{"observed_at":"2026-08-09T14:47:42.861461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:42.846988Z","title":null,"venue":null,"work_id":"4803a07a-e623-45b5-a5cb-910fa3f1faca","year":2002},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.720427Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:17ade8a12da25f0121392002dbe862d0bab753b59fe0e6b320c5569ac90ee533","observation_id":"6e58c8ab-04e5-466d-9273-3cf1e012a7ed","resolution":{"observed_at":"2026-08-09T14:47:42.850858Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06497","last_updated":"2023-09-12T18:11:10Z","snapshot_observed_at":"2026-08-05T09:31:11.684666Z","submitted_at":"2023-09-12T18:11:10Z","title":"A Distributed Data-Parallel PyTorch Implementation of the Distributed Shampoo Optimizer for Training Neural Networks At-Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.06497","snapshot_observed_at":"2026-08-09T14:47:40.724257Z","title":"M., Lee, T.-H., Iwasaki, S., Gallego-Posada, J., Li, Z., Rangadurai, K., Mudigere, D., and Rabbat, M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.724257Z"},"links":{"cited_paper":"/paper/2309.06497","citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:1ccdfb911257d4a0dadac7a21f7b1c928cd98c808fb09a281cb3386f709be10c","observation_id":"5ce83e7f-3c9c-4240-9c0a-ed5c29df1bf1","resolution":{"observed_at":"2026-08-09T14:47:40.724257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:42.834121Z","title":"A theoretical analysis on feature learning in neural networks: Emergence from inputs and advantage over fixed features","venue":null,"work_id":"afa35e0f-8185-424b-bd0c-b12662b4de17","year":2022},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.728250Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:c9976666c8429e323dfa4a1969a74a047481601f876fb59cccbfb547d2bfa9ae","observation_id":"c59315d4-4c51-4e1b-a509-6f4a23834c4f","resolution":{"observed_at":"2026-08-09T14:47:42.838365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T22:04:26.139102Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":74,"verified_exact":3,"verified_fuzzy":23},"total_outbound_references":124},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 100 of 124 outbound references and 2 inbound Pith citation observations for arXiv:2502.01763."}