{"as_of":"2026-08-09T10:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2d534bc363f20141a7ab56788065f9b5ec435475bb9062cfbf8bc091ae7676c7","coverage":[{"denominator":56,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:48:55.792391Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-16T06:58:38.927268Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-16T07:00:43.255075Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-09T03:48:37.458741Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"cited_work":{"arxiv_id":"2507.02119","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02119","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"G., Pennington, J., and Agar- wala, A","venue":null,"work_id":"8d07adf0-3365-4326-a700-454de9ee464b","year":null},"citing_paper":{"arxiv_id":"2602.04774","last_updated":"2026-05-08T16:24:57Z","snapshot_observed_at":"2026-08-03T01:34:12.578849Z","submitted_at":"2026-02-04T17:11:36Z","title":"Theory of Optimal Learning Rate Schedules and Scaling Laws for a Random Feature Model","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-16T06:58:38.927268Z"},"links":{"cited_paper":"/paper/2507.02119","citing_paper":"/paper/2602.04774"},"observation_digest":"sha256:b591b30b8275325502323b337c8e93a1476b032730c3ae57bd22f0f14608855b","observation_id":"41fd3f8c-d9fe-418e-b9d8-5b79dd298a3f","resolution":{"observed_at":"2026-05-16T07:00:43.256809Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.02119/citation-record","integrity":"/paper/2507.02119/integrity","json":"/paper/2507.02119/citation-record.json","paper":"/paper/2507.02119"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T20:48:48.890013Z","title":"L., Almeida, D., Altenschmidt, J., Altman, S., Anadkat, S., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-09T03:48:37.458741Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:48.890013Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:85f56761ae898117a4d4faabb77698dc9cf3b8da788b6eafe7e1033bc5473062","observation_id":"1f8507b7-d662-4d9a-a6f9-a37c495b3814","resolution":{"observed_at":"2026-08-06T20:48:48.890013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:49:03.187780Z","title":"and Fisher, D","venue":null,"work_id":"78c03c41-a1dc-4d7a-a6f0-6cfbafbdf88e","year":2019},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-09T03:48:37.458741Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:48.984871Z"},"links":{"citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:1da5c25e24f3d796babf690e94bf2f1bf51e827dc12ab9cff98d5cc52c608f5c","observation_id":"ff16d3b2-6874-4029-bc2a-03c5d1a16f45","resolution":{"observed_at":"2026-08-06T20:49:03.332256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19261","last_updated":"2025-02-01T01:30:40Z","snapshot_observed_at":"2026-07-06T18:07:27.432252Z","submitted_at":"2024-04-30T04:54:15Z","title":"High dimensional analysis reveals conservative sharpening and a stochastic edge of stability","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.19261","snapshot_observed_at":"2026-08-06T20:48:49.116497Z","title":"and Pennington, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-09T03:48:37.458741Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:49.116497Z"},"links":{"cited_paper":"/paper/2404.19261","citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:c337fef4b14dceeca227c815b0e9af656f01d8b6c02cfe7ac28b1d332274d40e","observation_id":"d210d09d-bd03-4756-84ab-8877e7587d6b","resolution":{"observed_at":"2026-08-06T20:48:49.116497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:48:49.230831Z","title":"Power lines: Scaling laws for weight decay and batch size in llm pre-training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-09T03:48:37.458741Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:49.230831Z"},"links":{"citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:876472dbd5d5c36ac80e84f10d9e2ae12aeefeeb3c5c541398cea42f20b24059","observation_id":"803ba54a-c036-4b78-a89f-9aacfaba5bff","resolution":{"observed_at":"2026-08-06T20:48:49.230831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:49:02.997796Z","title":"Finite size scaling analysis of ising model block distribution functions","venue":null,"work_id":"26f7dfc4-cdad-42f9-8998-5da169846d97","year":1981},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-09T03:48:37.458741Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:49.341620Z"},"links":{"citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:6cfbdd8e98df210206639707f7a0b58f1d2b2d198b5564595d25fb2bd17466ff","observation_id":"19d23896-26c3-4357-a7ee-da726da3d950","resolution":{"observed_at":"2026-08-06T20:49:03.061062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:49:02.704232Z","title":"and Pehlevan, C","venue":null,"work_id":"798ad1a4-3f67-4dfb-96b4-89f3561d4f84","year":2022},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-09T03:48:37.458741Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:49.465906Z"},"links":{"citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:442efbd6418744651a7630f57331a12fa8862f488126888a5512738b7861337c","observation_id":"00ddcf25-616c-4d98-97c1-562523c70530","resolution":{"observed_at":"2026-08-06T20:49:02.877934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16620","last_updated":"2023-12-08T18:19:44Z","snapshot_observed_at":"2026-07-06T16:25:01.609308Z","submitted_at":"2023-09-28T17:20:50Z","title":"Depthwise Hyperparameter Transfer in Residual Networks: Dynamics and Scaling Limit","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16620","snapshot_observed_at":"2026-08-06T20:48:49.634542Z","title":"B., Hanin, B., and Pehlevan, C","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-09T03:48:37.458741Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:49.634542Z"},"links":{"cited_paper":"/paper/2309.16620","citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:9ad446e1e944f70032eede973032fb3cfe02ff430bb2667f6e127f4ba4540cd9","observation_id":"7c5eee10-f120-4418-be25-ed004d944912","resolution":{"observed_at":"2026-08-06T20:48:49.634542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01092","last_updated":"2024-06-23T10:46:17Z","snapshot_observed_at":"2026-08-06T19:33:29.368862Z","submitted_at":"2024-02-02T01:41:38Z","title":"A Dynamical Model of Neural Scaling Laws","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01092","snapshot_observed_at":"2026-08-06T20:48:49.730886Z","title":"A dynamical model of neural scaling laws","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-09T03:48:37.458741Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:49.730886Z"},"links":{"cited_paper":"/paper/2402.01092","citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:21d60a4fcb650542bbf7b809db2f75206cc5cd4f8477252eaa41961fffd8de52","observation_id":"34cf55a9-2ec1-4ee3-979d-31fb7e50ae16","resolution":{"observed_at":"2026-08-06T20:48:49.730886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17858","last_updated":"2025-04-04T13:47:57Z","snapshot_observed_at":"2026-07-06T19:22:45.746115Z","submitted_at":"2024-09-26T14:05:32Z","title":"How Feature Learning Can Improve Neural Scaling Laws","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17858","snapshot_observed_at":"2026-08-06T20:48:49.856090Z","title":"How feature learning can improve neural scaling laws","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-09T03:48:37.458741Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:49.856090Z"},"links":{"cited_paper":"/paper/2409.17858","citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:b660ea5745baf47873a6437da8e4f03fe5f8c8973943f691175c009968370c08","observation_id":"14832c06-88b9-461a-8b12-2d859f17a77f","resolution":{"observed_at":"2026-08-06T20:48:49.856090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:49:02.332172Z","title":"Infinite limits of multi-head transformer dynamics","venue":null,"work_id":"7baeaf16-4934-464a-b607-f6e5c2788147","year":2024},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-09T03:48:37.458741Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:49.979212Z"},"links":{"citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:bbb49618bf5a800028449023f42d139ec45254f3a780738a588e951cb000a196","observation_id":"03d58112-1883-4f77-943c-d1f8987069cd","resolution":{"observed_at":"2026-08-06T20:49:02.507256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00065","last_updated":"2022-11-23T18:09:57Z","snapshot_observed_at":"2026-08-06T02:48:08.712124Z","submitted_at":"2021-02-26T22:08:19Z","title":"Gradient Descent on Neural Networks Typically Occurs at the Edge of Stability","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00065","snapshot_observed_at":"2026-08-06T20:48:50.108888Z","title":"M., Kaur, S., Li, Y., Kolter, J","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-09T03:48:37.458741Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:50.108888Z"},"links":{"cited_paper":"/paper/2103.00065","citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:5cf432e91670bb0c3550cc267efa9849b7f01809019b5af348e51c98738b5b09","observation_id":"b2a49a53-e9c1-4dc0-bdee-154cb355f9c6","resolution":{"observed_at":"2026-08-06T20:48:50.108888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.14484","last_updated":"2024-04-15T22:52:51Z","snapshot_observed_at":"2026-07-06T13:36:37.251739Z","submitted_at":"2022-07-29T05:23:47Z","title":"Adaptive Gradient Methods at the Edge of Stability","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.14484","snapshot_observed_at":"2026-08-06T20:48:50.237889Z","title":"M., Ghorbani, B., Krishnan, S., Agarwal, N., Medapati, S., Badura, M., Suo, D., Cardoze, D., Nado, Z., Dahl, G","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-09T03:48:37.458741Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:50.237889Z"},"links":{"cited_paper":"/paper/2207.14484","citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:80c688a7dda49fa4fb06076bf90d44f97e93cd23a9ca3c4fae71354729c4dbab","observation_id":"4d05b138-7864-4521-a851-7c0cf4d60ba8","resolution":{"observed_at":"2026-08-06T20:48:50.237889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:48:50.344017Z","title":"M., Damian, A., Talwalkar, A., Kolter, Z., and Lee, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-09T03:48:37.458741Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:50.344017Z"},"links":{"citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:4cbcdecdbcaa38bd32dfc6f69f25fbd215bfb298ddcb5af6329583fff7bd8717","observation_id":"6e76a5f3-8709-4694-8311-a01ccecbc2c8","resolution":{"observed_at":"2026-08-06T20:48:50.344017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.04509","last_updated":"2022-02-09T15:15:39Z","snapshot_observed_at":"2026-07-06T12:36:04.284368Z","submitted_at":"2022-02-09T15:15:39Z","title":"Optimal learning rate schedules in high-dimensional non-convex optimization problems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.04509","snapshot_observed_at":"2026-08-06T20:48:50.480589Z","title":"Optimal learning rate schedules in high-dimensional non-convex optimization problems","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-09T03:48:37.458741Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:50.480589Z"},"links":{"cited_paper":"/paper/2202.04509","citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:d4fbdbe565fa55633390ee3c2f09d6c3fe698563cb98a9610a23663660a293be","observation_id":"80156d54-db79-46f4-8069-df4302dbccae","resolution":{"observed_at":"2026-08-06T20:48:50.480589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:48:50.592169Z","title":"C., Noci, L., Li, M., Bordelon, B., Bergsma, S., Pehlevan, C., Hanin, B., and Hestness, J","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-09T03:48:37.458741Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:50.592169Z"},"links":{"citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:efe9bdd68ac4fbfc7d515cba2424d01f2a1fb8e19eac2ce6bb8db672017f0cfe","observation_id":"9502e4e6-1a62-40ee-8cb0-5ed9eaf6c731","resolution":{"observed_at":"2026-08-06T20:48:50.592169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:49:02.083371Z","title":"Kingma, J","venue":null,"work_id":"cb513680-d7d7-4bfc-9e84-597c255ede27","year":2015},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-09T03:48:37.458741Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:50.697194Z"},"links":{"citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:467c1b87e801973359d037630130acdea35fddce1c981f1c83a1ed7f47829a96","observation_id":"ad86be4a-4417-4076-9c0f-e4185cd2952a","resolution":{"observed_at":"2026-08-06T20:49:02.206565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05872","last_updated":"2024-07-16T17:40:09Z","snapshot_observed_at":"2026-07-06T18:42:56.281402Z","submitted_at":"2024-07-08T12:32:51Z","title":"Scaling Exponents Across Parameterizations and Optimizers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05872","snapshot_observed_at":"2026-08-06T20:48:50.834417Z","title":"A., Novak, R., Liu, P","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-09T03:48:37.458741Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:50.834417Z"},"links":{"cited_paper":"/paper/2407.05872","citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:25070917fc19fa832a5ba1ea3527f462d0de384d05ebf656354c9c875b5b2bf3","observation_id":"0231a66f-5898-4deb-a78f-3976de64ab0d","resolution":{"observed_at":"2026-08-06T20:48:50.834417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:49:01.789913Z","title":null,"venue":null,"work_id":"8add9626-2d20-4fcc-bebd-db7207463149","year":2013},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-09T03:48:37.458741Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:50.982931Z"},"links":{"citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:e3885df1fe1eb3edc532a3951ca71148fe7292c39a48f2c37ca3853e0d7f1887","observation_id":"a27cd3c4-c959-4c6c-ade8-6651aebda303","resolution":{"observed_at":"2026-08-06T20:49:01.969127Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:49:01.428144Z","title":"Monte Carlo methods in financial engineering, volume 53","venue":null,"work_id":"ba9a1046-044c-4b81-8ec3-d299826c7d8e","year":2004},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-09T03:48:37.458741Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:51.135576Z"},"links":{"citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:bf777b3ec8b88075abcd87fcc7cc9340faa1589087470a4615081fc99343e1d1","observation_id":"9b472174-aad9-4b29-a6f6-280c995a9936","resolution":{"observed_at":"2026-08-06T20:49:01.602856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:49:01.138438Z","title":"and Fisher, D","venue":null,"work_id":"0897cec5-bec4-4362-9ef7-d174e4fa87f1","year":2014},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-09T03:48:37.458741Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:51.288401Z"},"links":{"citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:f5813a45837fe0da7eff04ba53007d8c9cbc74bf7d2eb103c640658db536a0b0","observation_id":"894f4596-0b96-4b61-a659-2679eddf39c2","resolution":{"observed_at":"2026-08-06T20:49:01.275473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.08415","last_updated":"2023-06-06T01:53:32Z","snapshot_observed_at":"2026-07-06T05:01:27.910364Z","submitted_at":"2016-06-27T19:20:40Z","title":"Gaussian Error Linear Units (GELUs)","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.08415","snapshot_observed_at":"2026-08-06T20:48:51.439168Z","title":"and Gimpel, K","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-09T03:48:37.458741Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:51.439168Z"},"links":{"cited_paper":"/paper/1606.08415","citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:6c872d1f2bc9fb1abb9352edfaacc4409958da7490bb36855705b13264f6b217","observation_id":"01e15fe3-4ed2-492b-8957-bad8c1daf31e","resolution":{"observed_at":"2026-08-06T20:48:51.439168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-08-06T20:48:51.541070Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-09T03:48:37.458741Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:51.541070Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:5986260e12a51acb7c215e27dbeaf85a92fc95ebc7a2fdbbe18c35ac741350e5","observation_id":"4e936d7a-dbe8-4e16-ba21-53b8d78e44a6","resolution":{"observed_at":"2026-08-06T20:48:51.541070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-07-06T12:54:11.616335Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-06T20:48:51.686276Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-09T03:48:37.458741Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:51.686276Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:8ba457f9638a15922120bbb9d9a604418e440407621867cc2ff7db557b99bde8","observation_id":"a53d9abd-f9f5-46f0-9a61-462a98c5354a","resolution":{"observed_at":"2026-08-06T20:48:51.686276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-06T20:48:51.813397Z","title":"B., Chess, B., Child, R., Gray, S., Radford, A., Wu, J., and Amodei, D","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-09T03:48:37.458741Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:51.813397Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:5dc9b0fa2ab8551aee29e0dea1b726fb135c321d7b6174d3d12b0a8294b26fb4","observation_id":"6c3c0699-c49f-492c-a582-7a53930cd057","resolution":{"observed_at":"2026-08-06T20:48:51.813397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:49:00.808738Z","title":"F., Blundell, J","venue":null,"work_id":"b21cd242-e8f1-4d45-b764-cdeac3cb2c83","year":2015},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-09T03:48:37.458741Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:51.957254Z"},"links":{"citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:cb5db8c1d7bb50886648400a3297f91706f5a355ec584774cef409b77e4e152e","observation_id":"ff42298c-b9e7-4d0e-9192-5040dfe2c84d","resolution":{"observed_at":"2026-08-06T20:49:00.969218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:49:00.583115Z","title":"Stochastic modified equations and adaptive stochastic gradient algorithms","venue":null,"work_id":"fe7594f6-9995-4b9a-8268-49f98cb996b7","year":2017},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-09T03:48:37.458741Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:52.040916Z"},"links":{"citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:ea9af8d6863f9a6b7934ca61161198b4ae26cb0b2c54f63f37770c8a06b6f6ad","observation_id":"285b1657-f9f6-4e76-9a21-83e8c78a68f3","resolution":{"observed_at":"2026-08-06T20:49:00.702563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12811","last_updated":"2025-03-17T04:36:45Z","snapshot_observed_at":"2026-08-07T16:59:04.794204Z","submitted_at":"2025-03-17T04:36:45Z","title":"A Multi-Power Law for Loss Curve Prediction Across Learning Rate Schedules","version":1},"cited_work":{"arxiv_id":"2503.12811","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.12811","snapshot_observed_at":"2026-08-06T20:48:56.360959Z","title":"A Multi-Power Law for Loss Curve Prediction Across Learning Rate Schedules","venue":"cs.LG","work_id":"0ab39c2c-1c5e-4217-a3ec-4b32e0e8aafb","year":2025},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-09T03:48:37.458741Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:52.152237Z"},"links":{"cited_paper":"/paper/2503.12811","citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:d4646d5e573391b279325aac7c17d84c58cd7e120a6a25fde322dda0bbf25477","observation_id":"1541ff55-00bc-4e67-beb4-0ec9ee48de10","resolution":{"observed_at":"2026-08-06T20:48:56.444458Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:49:00.344518Z","title":"On the sdes and scaling rules for adaptive gradient algorithms","venue":null,"work_id":"5598fa69-fcff-46b9-a5e9-8090b16c04d5","year":2022},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-09T03:48:37.458741Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:52.302674Z"},"links":{"citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:97ac8544ace47b24c2ded195de8a0741017fd286a26b1ed337bf1377c3989f8a","observation_id":"aaa4604b-ec14-4b6c-be1a-efdd3c1a479d","resolution":{"observed_at":"2026-08-06T20:49:00.420054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:49:00.111704Z","title":"and Pastur, L","venue":null,"work_id":"0c0365b8-fb9d-4ca1-b9db-d66b3023f438","year":1967},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-09T03:48:37.458741Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:52.402249Z"},"links":{"citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:18397aac2ad0f8fa2721d54c6d4ad320b5b9781bb47adff45c7389b0d580db58","observation_id":"f77b1822-0677-4628-920b-ba8297a7df0a","resolution":{"observed_at":"2026-08-06T20:49:00.239937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.06162","last_updated":"2018-12-14T20:49:09Z","snapshot_observed_at":"2026-07-06T07:21:19.842962Z","submitted_at":"2018-12-14T20:49:09Z","title":"An Empirical Model of Large-Batch Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.06162","snapshot_observed_at":"2026-08-06T20:48:52.527254Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-09T03:48:37.458741Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:52.527254Z"},"links":{"cited_paper":"/paper/1812.06162","citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:fbf180ada17cdd8eb7c2b6219dd0c1ce747dacbeb7bb6bd066347639fe64e97a","observation_id":"3593f90c-ab38-4294-a77a-dbf7cb00324e","resolution":{"observed_at":"2026-08-06T20:48:52.527254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:48:52.668462Z","title":"Y., Singh, S., Bhatele, A., Goldblum, M., Panda, A., and Goldstein, T","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-09T03:48:37.458741Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:52.668462Z"},"links":{"citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:928278fbbf826621cc4bf8264ab15fedaa13f48f1764e4349087ea0c52bc424a","observation_id":"9d7c7f74-d112-40fa-87e1-a8fce35df8b4","resolution":{"observed_at":"2026-08-06T20:48:52.668462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.08127","last_updated":"2021-02-19T03:24:24Z","snapshot_observed_at":"2026-08-03T04:24:28.195669Z","submitted_at":"2020-10-16T03:07:49Z","title":"The Deep Bootstrap Framework: Good Online Learners are Good Offline Generalizers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.08127","snapshot_observed_at":"2026-08-06T20:48:52.826035Z","title":"The deep bootstrap framework: Good online learners are good offline generalizers","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-09T03:48:37.458741Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:52.826035Z"},"links":{"cited_paper":"/paper/2010.08127","citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:e2079cb9b782a97d710593daf54bfb370c81231edff6ab2f1ab55564bfbd34b1","observation_id":"04774ee9-505a-45a6-9571-c86f9dea0c0d","resolution":{"observed_at":"2026-08-06T20:48:52.826035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:48:59.921587Z","title":"Super consistency of neural network landscapes and learning rate transfer","venue":null,"work_id":"562f92fe-f62d-4127-8b7c-9bd453bcbedd","year":2024},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-09T03:48:37.458741Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:52.964417Z"},"links":{"citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:195af58ec4391b086dbad8e76c786423ff9b7c5ff5388da498a97f3c77684b6a","observation_id":"32a46c09-50ef-497d-b2dd-898847fea43b","resolution":{"observed_at":"2026-08-06T20:48:59.986705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:48:59.696081Z","title":"Sgd in the large: Average-case analysis, asymptotics, and stepsize criticality","venue":null,"work_id":"75627fa1-14fc-46a0-a099-2796192212f7","year":2021},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-09T03:48:37.458741Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:53.062783Z"},"links":{"citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:ef0a57a3fd00ce187e65eed85db1e2b2fb19b60ae7ae1781d09f8f98e5b774f4","observation_id":"f53c09ca-dfd3-44cb-a19f-41b65fc5e507","resolution":{"observed_at":"2026-08-06T20:48:59.812856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:48:59.464840Z","title":"Homogenization of sgd in high-dimensions: Exact dynamics and generalization properties","venue":null,"work_id":"a57b9cfc-8256-4ee6-be49-552527050b78","year":2024},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-09T03:48:37.458741Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:53.171825Z"},"links":{"citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:ff9bcd3a48a8ab268e96fa7326df39f203f44c75739b8bc82124214c4becea83","observation_id":"6a579c77-06eb-48d0-a7fb-542382b48a89","resolution":{"observed_at":"2026-08-06T20:48:59.564827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15074","last_updated":"2025-04-18T21:56:39Z","snapshot_observed_at":"2026-08-01T23:00:36.303010Z","submitted_at":"2024-05-23T21:50:54Z","title":"4+3 Phases of Compute-Optimal Neural Scaling Laws","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15074","snapshot_observed_at":"2026-08-06T20:48:53.293116Z","title":"4+ 3 phases of compute-optimal neural scaling laws","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-09T03:48:37.458741Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:53.293116Z"},"links":{"cited_paper":"/paper/2405.15074","citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:89bdfc17237c5e63e6512f6143afaa515a4b74af5b53ef6963d0061bbb56f0ec","observation_id":"17e6d158-514a-450d-ad6c-12a4ecc631b6","resolution":{"observed_at":"2026-08-06T20:48:53.293116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:48:59.170771Z","title":"T., Agarwala, A., and Fisher, D","venue":null,"work_id":"c0543f5a-3d97-4a78-9d53-56b065e7fd02","year":2020},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-09T03:48:37.458741Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:53.414115Z"},"links":{"citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:7e724b69f634928a0c52e23a5629664cc3cdcdca5ffc27c801c29d1e7389d84c","observation_id":"ae4e746d-a68b-4e00-a98f-f1a8a904de60","resolution":{"observed_at":"2026-08-06T20:48:59.330413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12907","last_updated":"2024-11-21T12:17:22Z","snapshot_observed_at":"2026-07-06T18:33:11.370375Z","submitted_at":"2024-06-12T13:30:48Z","title":"Reconciling Kaplan and Chinchilla Scaling Laws","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12907","snapshot_observed_at":"2026-08-06T20:48:53.523148Z","title":"and Song, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-09T03:48:37.458741Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:53.523148Z"},"links":{"cited_paper":"/paper/2406.12907","citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:0321900b45c14c22f0b2b29ea81a79985f0be616d2ea60f8051c10300a599ef8","observation_id":"5be144fc-b5ef-41b9-bb18-d0db1e2f5d94","resolution":{"observed_at":"2026-08-06T20:48:53.523148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:48:58.907121Z","title":"J., Davison, M., Bhaya, D., and Fisher, D","venue":null,"work_id":"be8297a6-e523-47cd-a376-71b7a54edcee","year":2015},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-09T03:48:37.458741Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:53.640808Z"},"links":{"citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:bc8f2f214d88c50e0d3bec7768c88435eee815b369ddf48598a43ec167d2c677","observation_id":"81426342-a206-4235-9622-0e17160b76f0","resolution":{"observed_at":"2026-08-06T20:48:59.064308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18965","last_updated":"2025-07-23T13:03:41Z","snapshot_observed_at":"2026-07-06T20:28:52.880548Z","submitted_at":"2025-01-31T08:55:56Z","title":"The Surprising Agreement Between Convex Optimization Theory and Learning-Rate Scheduling for Large Model Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18965","snapshot_observed_at":"2026-08-06T20:48:53.764373Z","title":"The surprising agreement between convex optimization theory and learning-rate scheduling for large model training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-09T03:48:37.458741Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:53.764373Z"},"links":{"cited_paper":"/paper/2501.18965","citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:a8b5d148c994d4a1c9468c91d63c494e033f35927773dbff9f2756a94fa019d3","observation_id":"524ba4f5-5eea-4805-bd48-9394a5ddabe6","resolution":{"observed_at":"2026-08-06T20:48:53.764373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:48:58.616331Z","title":"Ubiquitous abundance distribution of non-dominant plankton across the global ocean","venue":null,"work_id":"5c8b3698-02c2-4f44-9c3c-2bf8388ef02f","year":2018},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-09T03:48:37.458741Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:53.834070Z"},"links":{"citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:bd2cdba2344ccfb57d5aad43e8e9cfff3aa57b07b7f61d19d8f144b88c574e18","observation_id":"671b23b1-1324-45fa-af71-19fe0c84092b","resolution":{"observed_at":"2026-08-06T20:48:58.772167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:48:58.317527Z","title":"and Kaplan, J","venue":null,"work_id":"9e1d3430-0c38-4ba6-8049-b2d7561ff4dc","year":2022},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-09T03:48:37.458741Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:53.926114Z"},"links":{"citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:0ee70f84c4d3f48781a887e1ad705417b91efffdb47c02a07d3d4e8bb41ffb78","observation_id":"fa376d3b-72b2-4d46-8bf4-f6869b571edc","resolution":{"observed_at":"2026-08-06T20:48:58.494464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02284","last_updated":"2025-04-10T05:38:41Z","snapshot_observed_at":"2026-08-01T20:35:17.105153Z","submitted_at":"2023-07-05T13:39:02Z","title":"Universal Scaling Laws of Absorbing Phase Transitions in Artificial Deep Neural Networks","version":3},"cited_work":{"arxiv_id":"2307.02284","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.02284","snapshot_observed_at":"2026-08-06T20:48:55.963447Z","title":"Universal Scaling Laws of Absorbing Phase Transitions in Artificial Deep Neural Networks","venue":"stat.ML","work_id":"5ac49b4f-6b38-43c5-a133-202928e84503","year":2023},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-09T03:48:37.458741Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:54.043892Z"},"links":{"cited_paper":"/paper/2307.02284","citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:a5ffc3eb52d1d47f505dd2b03cab0b56fb102c6a47adb1e90d2aad64cb01d71b","observation_id":"4091f172-60bd-41e7-a799-b1009cb2f517","resolution":{"observed_at":"2026-08-06T20:48:56.060606Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11029","last_updated":"2024-10-24T17:56:14Z","snapshot_observed_at":"2026-08-06T07:25:53.036005Z","submitted_at":"2024-08-20T17:30:48Z","title":"Scaling Law with Learning Rate Annealing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11029","snapshot_observed_at":"2026-08-06T20:48:54.159538Z","title":"Scaling law with learning rate annealing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-09T03:48:37.458741Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:54.159538Z"},"links":{"cited_paper":"/paper/2408.11029","citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:41c6256964bce811617cb5278bd842291f8e71af8e765cfd021f9000875e074d","observation_id":"0d53d82b-059b-4a33-be5a-6c88d9f6f97d","resolution":{"observed_at":"2026-08-06T20:48:54.159538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:48:57.997099Z","title":"R., Geiler-Samerotte, K., H \\'e rissant, L., Blundell, J","venue":null,"work_id":"516ff17a-a618-413b-bd0f-bc722c0e72bd","year":2016},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-09T03:48:37.458741Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:54.271428Z"},"links":{"citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:7bc4e5ba2f9ae5e1afaade2801b4b1ca98b5634b8b9410b973b1f2996d3fb586","observation_id":"8b73fa26-db25-4502-92c4-30c46691e5dc","resolution":{"observed_at":"2026-08-06T20:48:58.140034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:48:57.665167Z","title":"Feature-learning networks are consistent across widths at realistic scales","venue":null,"work_id":"782df296-b554-45bc-9526-9d56a30cfbd0","year":2023},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-09T03:48:37.458741Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:54.396692Z"},"links":{"citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:0fbf7c9cff91c0939214e494c8c31e0666d34a55872eb55e29eec42c941abb42","observation_id":"dbb367e9-4461-4699-9c01-b99aa9f5d739","resolution":{"observed_at":"2026-08-06T20:48:57.822552Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.13698","last_updated":"2025-06-01T16:35:40Z","snapshot_observed_at":"2026-08-09T06:13:16.272849Z","submitted_at":"2024-05-22T14:43:02Z","title":"How to set AdamW's weight decay as you scale model and dataset size","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.13698","snapshot_observed_at":"2026-08-06T20:48:54.538611Z","title":"and Aitchison, L","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-09T03:48:37.458741Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:54.538611Z"},"links":{"cited_paper":"/paper/2405.13698","citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:5ea25857b4b61fda276541abfdcce9110b593932ad6e9aeb8f88b88fbf78c317","observation_id":"16c13459-0ce0-4da9-8d2f-dab0399daa4c","resolution":{"observed_at":"2026-08-06T20:48:54.538611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05192","last_updated":"2024-12-02T21:54:54Z","snapshot_observed_at":"2026-07-06T19:29:09.714725Z","submitted_at":"2024-10-07T16:49:39Z","title":"Understanding Warmup-Stable-Decay Learning Rates: A River Valley Loss Landscape Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05192","snapshot_observed_at":"2026-08-06T20:48:54.682273Z","title":"Understanding warmup-stable-decay learning rates: A river valley loss landscape perspective","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-09T03:48:37.458741Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:54.682273Z"},"links":{"cited_paper":"/paper/2410.05192","citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:9c2055d52fd8f7323c94ba701934995ad93e00987615e0902f932cc5a6518b70","observation_id":"8e56a2c6-68f4-468a-b2d3-e557308434b4","resolution":{"observed_at":"2026-08-06T20:48:54.682273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:48:57.435356Z","title":null,"venue":null,"work_id":"ba53343e-cb90-4a57-9362-36118f67fac4","year":1971},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-09T03:48:37.458741Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:54.825321Z"},"links":{"citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:6ca41212a8074e4f19e5b1ba246d6a0b8c1dcb09334be9b19d1781287afe6ecf","observation_id":"675f7208-5acd-4a1d-bed0-13fa8463fd56","resolution":{"observed_at":"2026-08-06T20:48:57.542119Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14322","last_updated":"2023-10-16T18:43:25Z","snapshot_observed_at":"2026-07-06T16:23:26.584450Z","submitted_at":"2023-09-25T17:48:51Z","title":"Small-scale proxies for large-scale Transformer training instabilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14322","snapshot_observed_at":"2026-08-06T20:48:54.971531Z","title":"J., Xiao, L., Everett, K., Alemi, A., Adlam, B., Co-Reyes, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-09T03:48:37.458741Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:54.971531Z"},"links":{"cited_paper":"/paper/2309.14322","citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:290a8c73ad9a88896da2342bb0b52ec65ab93f67a9281fce22d424d062887260","observation_id":"e268f4b4-f837-49ba-a19f-7c5fdae47cf3","resolution":{"observed_at":"2026-08-06T20:48:54.971531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15156","last_updated":"2025-02-14T04:54:23Z","snapshot_observed_at":"2026-07-06T19:20:32.349889Z","submitted_at":"2024-09-23T16:04:03Z","title":"Rethinking Conventional Wisdom in Machine Learning: From Generalization to Scaling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.15156","snapshot_observed_at":"2026-08-06T20:48:55.089882Z","title":"Rethinking conventional wisdom in machine learning: From generalization to scaling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-09T03:48:37.458741Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:55.089882Z"},"links":{"cited_paper":"/paper/2409.15156","citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:f8659ba71fb1a553a7c9718bfdab530c17af16af59216e5c3257db263f797e91","observation_id":"daf49d49-f471-46bf-8352-787c0b0f9991","resolution":{"observed_at":"2026-08-06T20:48:55.089882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:48:57.077929Z","title":"and Hu, E","venue":null,"work_id":"f82ad670-d905-4f2f-8ed5-743c650bb769","year":2021},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-09T03:48:37.458741Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:55.214821Z"},"links":{"citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:7c38aa37cd7fa301939447f7f2315228c7a286331db8e311e21ec26e3c351c69","observation_id":"cf60c245-08c2-470e-b2e2-307e619503a5","resolution":{"observed_at":"2026-08-06T20:48:57.192764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:48:56.929980Z","title":"and Littwin, E","venue":null,"work_id":"5858b770-6d9e-47bb-a008-0599346fe424","year":2023},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-09T03:48:37.458741Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:55.349785Z"},"links":{"citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:b169f477fe5d8a7308ccf556417a6ab339f1b90ff284bb56c72d2a60ad98708e","observation_id":"6907316e-e6d2-48a5-97e1-881565c4a1ec","resolution":{"observed_at":"2026-08-06T20:48:57.010570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:48:56.793233Z","title":"J., Babuschkin, I., Sidor, S., Liu, X., Farhi, D., Ryder, N., Pachocki, J., Chen, W., and Gao, J","venue":null,"work_id":"b6b85137-4d94-454d-b2f6-4ce66b36a62b","year":2021},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-09T03:48:37.458741Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:55.507002Z"},"links":{"citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:de8d74e8132a9be261f500fa21335c4303fa39057c23a444fbcad32c5d118c81","observation_id":"b05f31e8-fb3c-44e1-b053-f8a9f689ea30","resolution":{"observed_at":"2026-08-06T20:48:56.863551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:48:55.635949Z","title":"and Sennrich, R","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-09T03:48:37.458741Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:55.635949Z"},"links":{"citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:5d6ed5f677b022421477e05090d4b4e8834358b523c0368acf57ef7ea1ac70d1","observation_id":"d6b96640-4afb-48c5-a528-1ee0a2da6836","resolution":{"observed_at":"2026-08-06T20:48:55.635949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:48:55.792391Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-09T03:48:37.458741Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:55.792391Z"},"links":{"citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:4a34a84e780ad9302c33827c42098b367f7bb8d38b909bfa24136bdfaead9edf","observation_id":"ae15619c-a965-4477-a706-d53476ec9131","resolution":{"observed_at":"2026-08-06T20:48:55.792391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T03:48:37.458741Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks"},"reference_resolution":{"displayed":56,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":2,"verified_fuzzy":23},"total_outbound_references":56},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 1 inbound Pith citation observation for arXiv:2507.02119."}