{"as_of":"2026-08-11T18:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:54b0261cf603ce2f349f3ddb51a845bcc1a8eadf8f1929d95890e4aa76baea86","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T17:20:51.167524Z","state":"measured"},{"denominator":66,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":66,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T04:07:46.155112Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T17:20:00.854998Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.12391","last_updated":"2025-01-21T18:59:49Z","snapshot_observed_at":"2026-08-10T20:26:48.268439Z","submitted_at":"2025-01-21T18:59:49Z","title":"Physics of Skill Learning","version":1},"cited_work":{"arxiv_id":"2501.12391","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.12391","snapshot_observed_at":"2026-07-04T17:20:00.854998Z","title":"J., Gore, J., and Tegmark, M","venue":null,"work_id":"2e59ab41-33f1-4033-89c6-5df043539ea6","year":2025},"citing_paper":{"arxiv_id":"2505.10465","last_updated":"2025-11-29T21:39:27Z","snapshot_observed_at":"2026-08-11T17:14:46.258670Z","submitted_at":"2025-05-15T16:18:13Z","title":"Superposition Yields Robust Neural Scaling","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-22T14:38:44.789822Z"},"links":{"cited_paper":"/paper/2501.12391","citing_paper":"/paper/2505.10465"},"observation_digest":"sha256:1a2472a6572d18972b43a9a559aa28bc1a26202d6afd80fd7fe871f8ee579874","observation_id":"45154810-94fb-432a-942c-1f4fafdcb089","resolution":{"observed_at":"2026-05-09T06:36:25.569357Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12391","last_updated":"2025-01-21T18:59:49Z","snapshot_observed_at":"2026-08-10T20:26:48.268439Z","submitted_at":"2025-01-21T18:59:49Z","title":"Physics of Skill Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12391","snapshot_observed_at":"2026-08-03T04:07:46.155112Z","title":"J., Gore, J., and Tegmark, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.05970","last_updated":"2026-05-31T19:48:07Z","snapshot_observed_at":"2026-08-10T17:47:41.861848Z","submitted_at":"2026-02-05T18:22:41Z","title":"Inverse Depth Scaling From Most Layers Being Similar","version":2},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-03T04:07:46.155112Z"},"links":{"cited_paper":"/paper/2501.12391","citing_paper":"/paper/2602.05970"},"observation_digest":"sha256:b646f51cfbc01fa68c3869337e296d6fa6ecdf1578cf8de613473d3899736f2b","observation_id":"5aef93e9-9074-45d5-a52a-30ecd854082c","resolution":{"observed_at":"2026-08-03T04:07:46.155112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12391","last_updated":"2025-01-21T18:59:49Z","snapshot_observed_at":"2026-08-10T20:26:48.268439Z","submitted_at":"2025-01-21T18:59:49Z","title":"Physics of Skill Learning","version":1},"cited_work":{"arxiv_id":"2501.12391","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.12391","snapshot_observed_at":"2026-07-04T17:20:00.854998Z","title":"J., Gore, J., and Tegmark, M","venue":null,"work_id":"2e59ab41-33f1-4033-89c6-5df043539ea6","year":2025},"citing_paper":{"arxiv_id":"2604.22951","last_updated":"2026-07-08T19:29:03Z","snapshot_observed_at":"2026-08-11T11:16:51.301799Z","submitted_at":"2026-04-24T18:49:08Z","title":"The Power of Power Law: Asymmetry Enables Compositional Reasoning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-08T11:49:49.787123Z"},"links":{"cited_paper":"/paper/2501.12391","citing_paper":"/paper/2604.22951"},"observation_digest":"sha256:d1381262da77e94c72c55209cdb0243e09ccbd85e29ac3ded5eafefd60ec3c86","observation_id":"2aeedff4-5ef4-4b1c-a253-43af41146d95","resolution":{"observed_at":"2026-05-11T19:31:08.306295Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12391","last_updated":"2025-01-21T18:59:49Z","snapshot_observed_at":"2026-08-10T20:26:48.268439Z","submitted_at":"2025-01-21T18:59:49Z","title":"Physics of Skill Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12391","snapshot_observed_at":"2026-07-12T18:26:05.728364Z","title":"J., Gore, J., and Tegmark, M","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.22951","last_updated":"2026-07-08T19:29:03Z","snapshot_observed_at":"2026-08-11T11:16:51.301799Z","submitted_at":"2026-04-24T18:49:08Z","title":"The Power of Power Law: Asymmetry Enables Compositional Reasoning","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-07-12T18:26:05.728364Z"},"links":{"cited_paper":"/paper/2501.12391","citing_paper":"/paper/2604.22951"},"observation_digest":"sha256:48849854c7ed80c2e71e68137cf9389fa4a40cc0d3b6193e3d70732a21a11813","observation_id":"220c6655-5707-4570-82bb-fc8d65ba711f","resolution":{"observed_at":"2026-07-12T18:26:05.728364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12391","last_updated":"2025-01-21T18:59:49Z","snapshot_observed_at":"2026-08-10T20:26:48.268439Z","submitted_at":"2025-01-21T18:59:49Z","title":"Physics of Skill Learning","version":1},"cited_work":{"arxiv_id":"2501.12391","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.12391","snapshot_observed_at":"2026-07-04T17:20:00.854998Z","title":"J., Gore, J., and Tegmark, M","venue":null,"work_id":"2e59ab41-33f1-4033-89c6-5df043539ea6","year":2025},"citing_paper":{"arxiv_id":"2606.25008","last_updated":"2026-06-23T17:46:30Z","snapshot_observed_at":"2026-07-31T03:01:22.674756Z","submitted_at":"2026-06-23T17:46:30Z","title":"Neural Scaling Universality: If Exponents Are Fixed, Time to Understand Coefficients","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-25T23:45:54.283436Z"},"links":{"cited_paper":"/paper/2501.12391","citing_paper":"/paper/2606.25008"},"observation_digest":"sha256:ebeecb2f4d8f532a34ad83d2c9afef0e3817d95987a9e2baccab66d2f9660a35","observation_id":"41b06145-f42a-4d28-8a41-f4f53c2c89a4","resolution":{"observed_at":"2026-07-04T17:20:00.856712Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12391","last_updated":"2025-01-21T18:59:49Z","snapshot_observed_at":"2026-08-10T20:26:48.268439Z","submitted_at":"2025-01-21T18:59:49Z","title":"Physics of Skill Learning","version":1},"cited_work":{"arxiv_id":"2501.12391","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.12391","snapshot_observed_at":"2026-07-04T17:20:00.854998Z","title":"J., Gore, J., and Tegmark, M","venue":null,"work_id":"2e59ab41-33f1-4033-89c6-5df043539ea6","year":2025},"citing_paper":{"arxiv_id":"2607.01647","last_updated":"2026-07-02T03:18:59Z","snapshot_observed_at":"2026-08-02T10:39:21.439291Z","submitted_at":"2026-07-02T03:18:59Z","title":"AgenticDataBench: A Comprehensive Benchmark for Data Agents","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-03T03:36:00.516063Z"},"links":{"cited_paper":"/paper/2501.12391","citing_paper":"/paper/2607.01647"},"observation_digest":"sha256:2738daedcfaaa495d9015ff12061714f516d4a3c54c61c49f1b2fee1277c645e","observation_id":"7e085967-9cbc-4dc1-ae07-63cd091bbb72","resolution":{"observed_at":"2026-07-03T03:37:35.105081Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.12391/citation-record","integrity":"/paper/2501.12391/integrity","json":"/paper/2501.12391/citation-record.json","paper":"/paper/2501.12391"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2307.15936","last_updated":"2023-11-06T00:36:24Z","snapshot_observed_at":"2026-08-10T11:49:46.237187Z","submitted_at":"2023-07-29T09:22:54Z","title":"A Theory for Emergence of Complex Skills in Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15936","snapshot_observed_at":"2026-08-10T17:20:50.949186Z","title":"A theory for emergence of complex skills in language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12391","last_updated":"2025-01-21T18:59:49Z","snapshot_observed_at":"2026-08-10T20:26:48.268439Z","submitted_at":"2025-01-21T18:59:49Z","title":"Physics of Skill Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T17:20:50.949186Z"},"links":{"cited_paper":"/paper/2307.15936","citing_paper":"/paper/2501.12391"},"observation_digest":"sha256:d1205c8fe72416adeb503f205f9fabc3a906a7ca016a041254c5f574c307ff82","observation_id":"8449aa35-5af4-4d33-ba82-26a25eff1f54","resolution":{"observed_at":"2026-08-10T17:20:50.949186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:20:51.771048Z","title":"Skill-it! a data-driven skills framework for understanding and training language models","venue":null,"work_id":"e40637b0-db0f-4741-9a10-e5cba9b1f8ed","year":2024},"citing_paper":{"arxiv_id":"2501.12391","last_updated":"2025-01-21T18:59:49Z","snapshot_observed_at":"2026-08-10T20:26:48.268439Z","submitted_at":"2025-01-21T18:59:49Z","title":"Physics of Skill Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T17:20:50.953923Z"},"links":{"citing_paper":"/paper/2501.12391"},"observation_digest":"sha256:bcaafbe1a9ecbf4fd17ace9c1ad3317524a3af46cb9ea014a972915aedd853f4","observation_id":"5162b022-4043-41f4-9a94-9b83a8958c2b","resolution":{"observed_at":"2026-08-10T17:20:51.774937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:20:51.760363Z","title":"The quantization model of neural scaling","venue":null,"work_id":"2a51def8-4dbd-4fec-ad1d-13d9e81337dd","year":2024},"citing_paper":{"arxiv_id":"2501.12391","last_updated":"2025-01-21T18:59:49Z","snapshot_observed_at":"2026-08-10T20:26:48.268439Z","submitted_at":"2025-01-21T18:59:49Z","title":"Physics of Skill Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T17:20:50.957990Z"},"links":{"citing_paper":"/paper/2501.12391"},"observation_digest":"sha256:3593e4d5cda1574e0911be6574979db9abf1a584e30ae8df39c91688f3d8224f","observation_id":"a686877a-3218-4acf-af43-ebabde2e17ae","resolution":{"observed_at":"2026-08-10T17:20:51.764256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.07682","last_updated":"2022-10-26T05:06:24Z","snapshot_observed_at":"2026-08-02T15:56:35.249569Z","submitted_at":"2022-06-15T17:32:01Z","title":"Emergent Abilities of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.07682","snapshot_observed_at":"2026-08-10T17:20:50.961452Z","title":"Emergent abilities of large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.12391","last_updated":"2025-01-21T18:59:49Z","snapshot_observed_at":"2026-08-10T20:26:48.268439Z","submitted_at":"2025-01-21T18:59:49Z","title":"Physics of Skill Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T17:20:50.961452Z"},"links":{"cited_paper":"/paper/2206.07682","citing_paper":"/paper/2501.12391"},"observation_digest":"sha256:e1a7f401e6a428e469821dc22ccc5602512ba2adde7ef0e4e2db3cb77a448fec","observation_id":"7781202b-4836-4024-adc5-19238ee00855","resolution":{"observed_at":"2026-08-10T17:20:50.961452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:20:51.749385Z","title":"Task arithmetic in the tangent space: Improved editing of pre-trained models","venue":null,"work_id":"adbd4130-5bdc-4d5c-86b9-bcff50bcce3e","year":2024},"citing_paper":{"arxiv_id":"2501.12391","last_updated":"2025-01-21T18:59:49Z","snapshot_observed_at":"2026-08-10T20:26:48.268439Z","submitted_at":"2025-01-21T18:59:49Z","title":"Physics of Skill Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T17:20:50.965997Z"},"links":{"citing_paper":"/paper/2501.12391"},"observation_digest":"sha256:ea60edb06c5c0eefba5c6237d4383b44cdfcee227807b2466b8eb9c79f2af34f","observation_id":"8f1974e6-c2db-4d7b-9bdf-c01f222c4c8d","resolution":{"observed_at":"2026-08-10T17:20:51.752874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04089","last_updated":"2023-03-31T15:27:01Z","snapshot_observed_at":"2026-08-03T22:12:27.993418Z","submitted_at":"2022-12-08T05:50:53Z","title":"Editing Models with Task Arithmetic","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04089","snapshot_observed_at":"2026-08-10T17:20:50.969620Z","title":"Editing models with task arithmetic","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.12391","last_updated":"2025-01-21T18:59:49Z","snapshot_observed_at":"2026-08-10T20:26:48.268439Z","submitted_at":"2025-01-21T18:59:49Z","title":"Physics of Skill Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T17:20:50.969620Z"},"links":{"cited_paper":"/paper/2212.04089","citing_paper":"/paper/2501.12391"},"observation_digest":"sha256:018d879e0693812498b3a7cdf9c41e373251e38c05e9d63e399af2c20e1a545b","observation_id":"24c54788-96c9-4d25-b950-3b7a9f468323","resolution":{"observed_at":"2026-08-10T17:20:50.969620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.15213","last_updated":"2024-02-25T18:32:18Z","snapshot_observed_at":"2026-08-08T01:23:24.701475Z","submitted_at":"2023-10-23T17:55:24Z","title":"Function Vectors in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.15213","snapshot_observed_at":"2026-08-10T17:20:50.981160Z","title":"Function vectors in large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12391","last_updated":"2025-01-21T18:59:49Z","snapshot_observed_at":"2026-08-10T20:26:48.268439Z","submitted_at":"2025-01-21T18:59:49Z","title":"Physics of Skill Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T17:20:50.981160Z"},"links":{"cited_paper":"/paper/2310.15213","citing_paper":"/paper/2501.12391"},"observation_digest":"sha256:4ea9b29e91c6293f56cf534443ff6b889a02e13c3bf74e0eb4aeef9f4b73bd09","observation_id":"52e6582f-d0e6-4ca2-a7f0-cdcc6a4a631d","resolution":{"observed_at":"2026-08-10T17:20:50.981160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-10T17:20:50.985635Z","title":"Scaling laws for neural language models","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2501.12391","last_updated":"2025-01-21T18:59:49Z","snapshot_observed_at":"2026-08-10T20:26:48.268439Z","submitted_at":"2025-01-21T18:59:49Z","title":"Physics of Skill Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T17:20:50.985635Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2501.12391"},"observation_digest":"sha256:ef8cf8db71cc586ea75a402d617da061a4a781d67b9280b96d47d9abfbe88a39","observation_id":"534124d3-9d59-47f3-8939-c542d5ed1df4","resolution":{"observed_at":"2026-08-10T17:20:50.985635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-08-09T19:52:33.533277Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-10T17:20:50.989206Z","title":"Training compute-optimal large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.12391","last_updated":"2025-01-21T18:59:49Z","snapshot_observed_at":"2026-08-10T20:26:48.268439Z","submitted_at":"2025-01-21T18:59:49Z","title":"Physics of Skill Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T17:20:50.989206Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2501.12391"},"observation_digest":"sha256:64f0d52f58755a9918f28ba48846c1d4a8daf0fd93bff1903f4ce365efceb9d1","observation_id":"079087bd-ddf6-49b7-ad75-d2cc3927c3e0","resolution":{"observed_at":"2026-08-10T17:20:50.989206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10102","last_updated":"2024-05-15T00:57:23Z","snapshot_observed_at":"2026-08-11T07:45:22.403344Z","submitted_at":"2024-04-15T19:19:56Z","title":"Chinchilla Scaling: A replication attempt","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.10102","snapshot_observed_at":"2026-08-10T17:20:50.993062Z","title":"Chinchilla scaling: A replication attempt","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12391","last_updated":"2025-01-21T18:59:49Z","snapshot_observed_at":"2026-08-10T20:26:48.268439Z","submitted_at":"2025-01-21T18:59:49Z","title":"Physics of Skill Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T17:20:50.993062Z"},"links":{"cited_paper":"/paper/2404.10102","citing_paper":"/paper/2501.12391"},"observation_digest":"sha256:f2659129cdf1de1633f384d9245ac0df6ee859c703229e0232f0309866f196d0","observation_id":"c63a44d2-e7a8-4a39-a917-635caeaf1f3a","resolution":{"observed_at":"2026-08-10T17:20:50.993062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.02177","last_updated":"2022-01-06T18:43:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-01-06T18:43:37Z","title":"Grokking: Generalization Beyond Overfitting on Small Algorithmic Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.02177","snapshot_observed_at":"2026-08-10T17:20:50.996951Z","title":"Grokking: Gen- eralization beyond overfitting on small algorithmic datasets","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.12391","last_updated":"2025-01-21T18:59:49Z","snapshot_observed_at":"2026-08-10T20:26:48.268439Z","submitted_at":"2025-01-21T18:59:49Z","title":"Physics of Skill Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T17:20:50.996951Z"},"links":{"cited_paper":"/paper/2201.02177","citing_paper":"/paper/2501.12391"},"observation_digest":"sha256:d407b1964cd82dc782885802a9dc21da21aca195261896903b6a89f6be96cf03","observation_id":"fb634936-7d0b-40c8-baf5-73b6d11fc557","resolution":{"observed_at":"2026-08-10T17:20:50.996951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1708.02002","last_updated":"2018-02-07T18:44:44Z","snapshot_observed_at":"2026-07-06T05:54:18.908943Z","submitted_at":"2017-08-07T06:32:42Z","title":"Focal Loss for Dense Object Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1708.02002","snapshot_observed_at":"2026-08-10T17:20:51.000629Z","title":"Focal loss for dense object detection","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.12391","last_updated":"2025-01-21T18:59:49Z","snapshot_observed_at":"2026-08-10T20:26:48.268439Z","submitted_at":"2025-01-21T18:59:49Z","title":"Physics of Skill Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T17:20:51.000629Z"},"links":{"cited_paper":"/paper/1708.02002","citing_paper":"/paper/2501.12391"},"observation_digest":"sha256:b232613712ad8d9143b3f24fd8fc40ca1d5d9078558508469d07169c8c6ad4cd","observation_id":"c9a1796a-0bea-499e-8e78-c7ad860a5102","resolution":{"observed_at":"2026-08-10T17:20:51.000629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07965","last_updated":"2025-01-08T09:07:54Z","snapshot_observed_at":"2026-08-10T07:06:40.041118Z","submitted_at":"2024-04-11T17:52:01Z","title":"Rho-1: Not All Tokens Are What You Need","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07965","snapshot_observed_at":"2026-08-10T17:20:51.004432Z","title":"Rho-1: Not all tokens are what you need","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12391","last_updated":"2025-01-21T18:59:49Z","snapshot_observed_at":"2026-08-10T20:26:48.268439Z","submitted_at":"2025-01-21T18:59:49Z","title":"Physics of Skill Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T17:20:51.004432Z"},"links":{"cited_paper":"/paper/2404.07965","citing_paper":"/paper/2501.12391"},"observation_digest":"sha256:3b9bddfd384df8d25d634a54cae056c2907179b13bfbf3e21abf53754c242cc1","observation_id":"188116ab-547b-4111-881a-7480b490b8b2","resolution":{"observed_at":"2026-08-10T17:20:51.004432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:20:51.008017Z","title":"Symbolic discovery of optimization algorithms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12391","last_updated":"2025-01-21T18:59:49Z","snapshot_observed_at":"2026-08-10T20:26:48.268439Z","submitted_at":"2025-01-21T18:59:49Z","title":"Physics of Skill Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T17:20:51.008017Z"},"links":{"citing_paper":"/paper/2501.12391"},"observation_digest":"sha256:64a5efc8a86df4fcefc762c0cac42d48c005c89f2744ca57df8fcd3f29eb1653","observation_id":"526333a0-66ed-4c01-aee9-60e0aede2318","resolution":{"observed_at":"2026-08-10T17:20:51.008017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03137","last_updated":"2024-09-27T18:31:02Z","snapshot_observed_at":"2026-08-09T09:49:46.964576Z","submitted_at":"2024-09-05T00:13:16Z","title":"The AdEMAMix Optimizer: Better, Faster, Older","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03137","snapshot_observed_at":"2026-08-10T17:20:51.011462Z","title":"The ademamix optimizer: Better, faster, older","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12391","last_updated":"2025-01-21T18:59:49Z","snapshot_observed_at":"2026-08-10T20:26:48.268439Z","submitted_at":"2025-01-21T18:59:49Z","title":"Physics of Skill Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T17:20:51.011462Z"},"links":{"cited_paper":"/paper/2409.03137","citing_paper":"/paper/2501.12391"},"observation_digest":"sha256:e9cfbee9c50f94fbb911960acc4b716d56a62f170bcf077d15364f78a0f416dd","observation_id":"715b2e31-a319-421f-a2ef-0b6d17ceee2d","resolution":{"observed_at":"2026-08-10T17:20:51.011462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14342","last_updated":"2024-03-05T17:07:16Z","snapshot_observed_at":"2026-08-08T09:25:28.224090Z","submitted_at":"2023-05-23T17:59:21Z","title":"Sophia: A Scalable Stochastic Second-order Optimizer for Language Model Pre-training","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14342","snapshot_observed_at":"2026-08-10T17:20:51.014910Z","title":"Sophia: A scalable stochastic second-order optimizer for language model pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12391","last_updated":"2025-01-21T18:59:49Z","snapshot_observed_at":"2026-08-10T20:26:48.268439Z","submitted_at":"2025-01-21T18:59:49Z","title":"Physics of Skill Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T17:20:51.014910Z"},"links":{"cited_paper":"/paper/2305.14342","citing_paper":"/paper/2501.12391"},"observation_digest":"sha256:50d33ac08f2b8a769177fd411c5d5acfeb8e75daf8a0f445ab3306b941b5df01","observation_id":"f13b28c7-d635-4820-bafe-ead489f3cdae","resolution":{"observed_at":"2026-08-10T17:20:51.014910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11321","last_updated":"2025-01-31T18:52:42Z","snapshot_observed_at":"2026-07-06T19:16:51.512681Z","submitted_at":"2024-09-17T16:18:05Z","title":"SOAP: Improving and Stabilizing Shampoo using Adam","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11321","snapshot_observed_at":"2026-08-10T17:20:51.018533Z","title":"Soap: Improving and stabilizing shampoo using adam","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12391","last_updated":"2025-01-21T18:59:49Z","snapshot_observed_at":"2026-08-10T20:26:48.268439Z","submitted_at":"2025-01-21T18:59:49Z","title":"Physics of Skill Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T17:20:51.018533Z"},"links":{"cited_paper":"/paper/2409.11321","citing_paper":"/paper/2501.12391"},"observation_digest":"sha256:83c54b4cd4035ca2e2ce50e5233bc7a590edce14cda1226aba25945df8bc8f45","observation_id":"123251a3-0e1b-4b3a-bfe8-dab2951e645b","resolution":{"observed_at":"2026-08-10T17:20:51.018533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-07-06T19:51:05.604758Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10438","snapshot_observed_at":"2026-08-10T17:20:51.021889Z","title":"Mars: Unleashing the power of variance reduction for training large models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12391","last_updated":"2025-01-21T18:59:49Z","snapshot_observed_at":"2026-08-10T20:26:48.268439Z","submitted_at":"2025-01-21T18:59:49Z","title":"Physics of Skill Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T17:20:51.021889Z"},"links":{"cited_paper":"/paper/2411.10438","citing_paper":"/paper/2501.12391"},"observation_digest":"sha256:b2c69a43587938bf91116cc5097abc2c071847917740afdc573b0e60c32f6bb7","observation_id":"82111d87-d0d8-4a25-a1e8-c4c8250ce563","resolution":{"observed_at":"2026-08-10T17:20:51.021889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:20:51.732826Z","title":"Muon: An optimizer for hidden layers in neural networks, 2024","venue":null,"work_id":"83ddd2d6-47fc-47be-9c4a-1ffbd9b08dd6","year":2024},"citing_paper":{"arxiv_id":"2501.12391","last_updated":"2025-01-21T18:59:49Z","snapshot_observed_at":"2026-08-10T20:26:48.268439Z","submitted_at":"2025-01-21T18:59:49Z","title":"Physics of Skill Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T17:20:51.025354Z"},"links":{"citing_paper":"/paper/2501.12391"},"observation_digest":"sha256:a404f367f97ad8c824cb9bce66704b9ea95b349c6be704b2937e847ccd529aa1","observation_id":"eeef1cfb-ad28-4f20-9eb0-92c448ec49a4","resolution":{"observed_at":"2026-08-10T17:20:51.736874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-10T17:20:51.028481Z","title":"Adam: A method for stochastic optimization","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2501.12391","last_updated":"2025-01-21T18:59:49Z","snapshot_observed_at":"2026-08-10T20:26:48.268439Z","submitted_at":"2025-01-21T18:59:49Z","title":"Physics of Skill Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T17:20:51.028481Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2501.12391"},"observation_digest":"sha256:4ce5177fec1479736b25e8941bbb4821a754032278059a5f3e906faad9170456","observation_id":"b8761673-4955-4fcf-9b30-a7e11f994727","resolution":{"observed_at":"2026-08-10T17:20:51.028481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:20:51.721989Z","title":"Failures of gradient-based deep learning","venue":null,"work_id":"c9e6e1fd-82be-4795-8449-38e8950c62af","year":2017},"citing_paper":{"arxiv_id":"2501.12391","last_updated":"2025-01-21T18:59:49Z","snapshot_observed_at":"2026-08-10T20:26:48.268439Z","submitted_at":"2025-01-21T18:59:49Z","title":"Physics of Skill Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T17:20:51.031909Z"},"links":{"citing_paper":"/paper/2501.12391"},"observation_digest":"sha256:7105f1656bb38b5ec5a26dabbff958f1fde355fff9ebba412ecb2782d62f3a8b","observation_id":"74e70fe4-7ace-4f46-b866-0c082a90292d","resolution":{"observed_at":"2026-08-10T17:20:51.725789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.11529","last_updated":"2024-01-27T12:01:57Z","snapshot_observed_at":"2026-08-10T12:22:40.853182Z","submitted_at":"2023-02-22T18:11:25Z","title":"Modular Deep Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.11529","snapshot_observed_at":"2026-08-10T17:20:51.035436Z","title":"Modular deep learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12391","last_updated":"2025-01-21T18:59:49Z","snapshot_observed_at":"2026-08-10T20:26:48.268439Z","submitted_at":"2025-01-21T18:59:49Z","title":"Physics of Skill Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T17:20:51.035436Z"},"links":{"cited_paper":"/paper/2302.11529","citing_paper":"/paper/2501.12391"},"observation_digest":"sha256:31db742021565ac708997a17327a0afda0ea7f0583eba83b7aa8e52d26f8777c","observation_id":"afe143f9-d251-451e-bd7e-be3c4ff5e0cc","resolution":{"observed_at":"2026-08-10T17:20:51.035436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:20:51.039070Z","title":"Neural module networks","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.12391","last_updated":"2025-01-21T18:59:49Z","snapshot_observed_at":"2026-08-10T20:26:48.268439Z","submitted_at":"2025-01-21T18:59:49Z","title":"Physics of Skill Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T17:20:51.039070Z"},"links":{"citing_paper":"/paper/2501.12391"},"observation_digest":"sha256:d6f4eec7f950ca535ce0f9d6be9e35912ec1990c9adb737400ad4bbee40a12a9","observation_id":"9103c227-8bc0-45aa-8df1-e4783ce8da3b","resolution":{"observed_at":"2026-08-10T17:20:51.039070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:20:51.704911Z","title":"Modular meta-learning","venue":null,"work_id":"6ccc1157-928c-4fd0-856e-9ba15763a226","year":2018},"citing_paper":{"arxiv_id":"2501.12391","last_updated":"2025-01-21T18:59:49Z","snapshot_observed_at":"2026-08-10T20:26:48.268439Z","submitted_at":"2025-01-21T18:59:49Z","title":"Physics of Skill Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T17:20:51.042470Z"},"links":{"citing_paper":"/paper/2501.12391"},"observation_digest":"sha256:6fd42d25e38bc7cde0138fb190f3c8b8a841f929454bd3fefb2f1c73e9c15197","observation_id":"04ca40ae-4a2a-4a0e-825f-53dedc43e3b2","resolution":{"observed_at":"2026-08-10T17:20:51.709308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:20:51.046039Z","title":"Mixture of experts: a literature survey","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2501.12391","last_updated":"2025-01-21T18:59:49Z","snapshot_observed_at":"2026-08-10T20:26:48.268439Z","submitted_at":"2025-01-21T18:59:49Z","title":"Physics of Skill Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T17:20:51.046039Z"},"links":{"citing_paper":"/paper/2501.12391"},"observation_digest":"sha256:cdb6d4c620443ad73d3107381ce0efdaa03a1d5480412f75ab1f8fbbd538070c","observation_id":"30be3189-2677-422a-94cc-969e2e05dde8","resolution":{"observed_at":"2026-08-10T17:20:51.046039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:20:51.688901Z","title":"A survey on mixture of experts","venue":null,"work_id":"45b9b6e1-07bc-44f3-a316-7153f9f994ed","year":2024},"citing_paper":{"arxiv_id":"2501.12391","last_updated":"2025-01-21T18:59:49Z","snapshot_observed_at":"2026-08-10T20:26:48.268439Z","submitted_at":"2025-01-21T18:59:49Z","title":"Physics of Skill Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T17:20:51.049512Z"},"links":{"citing_paper":"/paper/2501.12391"},"observation_digest":"sha256:3336d74c2356f36e0f4f97e980ed439d3d129304feffd29dae255df5edf3ac6f","observation_id":"d28de113-88e6-4064-8f15-6127ae26de57","resolution":{"observed_at":"2026-08-10T17:20:51.692316Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04332","last_updated":"2024-11-29T18:52:41Z","snapshot_observed_at":"2026-07-06T19:28:30.731752Z","submitted_at":"2024-10-06T02:43:49Z","title":"Gradient Routing: Masking Gradients to Localize Computation in Neural Networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04332","snapshot_observed_at":"2026-08-10T17:20:51.053725Z","title":"Gradient routing: Masking gradients to localize computation in neural networks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12391","last_updated":"2025-01-21T18:59:49Z","snapshot_observed_at":"2026-08-10T20:26:48.268439Z","submitted_at":"2025-01-21T18:59:49Z","title":"Physics of Skill Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T17:20:51.053725Z"},"links":{"cited_paper":"/paper/2410.04332","citing_paper":"/paper/2501.12391"},"observation_digest":"sha256:3e3277a8e31b55d4dab20e1ecb214dd1a1e388dc5bafd77eaaf95a47d9213a8a","observation_id":"827738cc-4638-4101-941d-79701dcd89aa","resolution":{"observed_at":"2026-08-10T17:20:51.053725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:20:51.057486Z","title":"Foundations of machine learning, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.12391","last_updated":"2025-01-21T18:59:49Z","snapshot_observed_at":"2026-08-10T20:26:48.268439Z","submitted_at":"2025-01-21T18:59:49Z","title":"Physics of Skill Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T17:20:51.057486Z"},"links":{"citing_paper":"/paper/2501.12391"},"observation_digest":"sha256:972bfea705beaf555ba291ea0992293abfd9f2bb299009e940ed0dce091d3df3","observation_id":"3f4446d7-2df6-4dad-81f9-a613196d7950","resolution":{"observed_at":"2026-08-10T17:20:51.057486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:20:51.673339Z","title":"Statistical mechanics of learning","venue":null,"work_id":"9c6121ed-b7ab-4402-8581-271fe912ab7e","year":2001},"citing_paper":{"arxiv_id":"2501.12391","last_updated":"2025-01-21T18:59:49Z","snapshot_observed_at":"2026-08-10T20:26:48.268439Z","submitted_at":"2025-01-21T18:59:49Z","title":"Physics of Skill Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T17:20:51.060723Z"},"links":{"citing_paper":"/paper/2501.12391"},"observation_digest":"sha256:110e3f2886a68cd4d06ff47be7d35b4605fd4b96b2e6fe3f7f936498422c6bd0","observation_id":"e0206aea-58b7-48bb-8cf3-68987e7dc930","resolution":{"observed_at":"2026-08-10T17:20:51.676731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:20:51.663477Z","title":"Statistical mechanics of deep learning","venue":null,"work_id":"914650fa-e39d-490b-b8d1-81eba8be93be","year":2020},"citing_paper":{"arxiv_id":"2501.12391","last_updated":"2025-01-21T18:59:49Z","snapshot_observed_at":"2026-08-10T20:26:48.268439Z","submitted_at":"2025-01-21T18:59:49Z","title":"Physics of Skill Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T17:20:51.064001Z"},"links":{"citing_paper":"/paper/2501.12391"},"observation_digest":"sha256:f28a61d3e9db2e76a32b0601fd99cc384c0c3b7a6ea01f1b545280589f78bd7f","observation_id":"9f2a8f23-971a-44ee-b9e9-c9707d44ce10","resolution":{"observed_at":"2026-08-10T17:20:51.667315Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:20:51.067454Z","title":"Neural tangent kernel: Convergence and generalization in neural networks","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.12391","last_updated":"2025-01-21T18:59:49Z","snapshot_observed_at":"2026-08-10T20:26:48.268439Z","submitted_at":"2025-01-21T18:59:49Z","title":"Physics of Skill Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T17:20:51.067454Z"},"links":{"citing_paper":"/paper/2501.12391"},"observation_digest":"sha256:6f4095e1abf342c69cfae59e1501fb3183df0bf9b81f998d4c30c3ae2e1b1cbb","observation_id":"7a211324-44d8-413a-885f-50d607376a38","resolution":{"observed_at":"2026-08-10T17:20:51.067454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:20:51.649017Z","title":"Almost all learning machines are singular","venue":null,"work_id":"85f6b352-58c3-4a0c-8403-e68008dbff1b","year":2007},"citing_paper":{"arxiv_id":"2501.12391","last_updated":"2025-01-21T18:59:49Z","snapshot_observed_at":"2026-08-10T20:26:48.268439Z","submitted_at":"2025-01-21T18:59:49Z","title":"Physics of Skill Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T17:20:51.070856Z"},"links":{"citing_paper":"/paper/2501.12391"},"observation_digest":"sha256:fc8fb3bd6bed2412f0139728b38496cd64389b8966060fc7320d3f8f821f6f3f","observation_id":"5b632fc0-f2f7-4b60-85d1-a4835902af9f","resolution":{"observed_at":"2026-08-10T17:20:51.652340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:20:51.638928Z","title":"Deep learning is singular, and that’s good.IEEE Transactions on Neural Networks and Learning Systems, 34(12):10473–10486, 2022","venue":null,"work_id":"f0934caa-4810-42da-9806-03c881ea7d8a","year":2022},"citing_paper":{"arxiv_id":"2501.12391","last_updated":"2025-01-21T18:59:49Z","snapshot_observed_at":"2026-08-10T20:26:48.268439Z","submitted_at":"2025-01-21T18:59:49Z","title":"Physics of Skill Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T17:20:51.074019Z"},"links":{"citing_paper":"/paper/2501.12391"},"observation_digest":"sha256:ec7811673e77c62c1ccbc18ff28cf6af5754819e2927a5001cf0842e62cd6960","observation_id":"5569ee65-5f7e-4025-9282-302b257d3f79","resolution":{"observed_at":"2026-08-10T17:20:51.642529Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.19198","last_updated":"2024-11-25T08:57:20Z","snapshot_observed_at":"2026-08-02T15:17:02.015045Z","submitted_at":"2024-07-27T07:34:49Z","title":"Towards the Dynamics of a DNN Learning Symbolic Interactions","version":2},"cited_work":{"arxiv_id":"2407.19198","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.19198","snapshot_observed_at":"2026-08-10T17:20:51.399309Z","title":"Towards the Dynamics of a DNN Learning Symbolic Interactions","venue":"cs.LG","work_id":"b11395ed-fee2-43ae-a717-dbdbddf8b3e2","year":2024},"citing_paper":{"arxiv_id":"2501.12391","last_updated":"2025-01-21T18:59:49Z","snapshot_observed_at":"2026-08-10T20:26:48.268439Z","submitted_at":"2025-01-21T18:59:49Z","title":"Physics of Skill Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T17:20:51.077373Z"},"links":{"cited_paper":"/paper/2407.19198","citing_paper":"/paper/2501.12391"},"observation_digest":"sha256:02cf46c19c1874e5415c6c214e32bde30956df291b6953ffe9d8d6e5e92011b9","observation_id":"5b206b7b-abc6-41e0-a610-8b0640c8be0e","resolution":{"observed_at":"2026-08-10T17:20:51.402838Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.15916","last_updated":"2023-10-24T15:17:14Z","snapshot_observed_at":"2026-08-11T02:56:42.859887Z","submitted_at":"2023-10-24T15:17:14Z","title":"In-Context Learning Creates Task Vectors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.15916","snapshot_observed_at":"2026-08-10T17:20:51.081428Z","title":"In-context learning creates task vectors","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12391","last_updated":"2025-01-21T18:59:49Z","snapshot_observed_at":"2026-08-10T20:26:48.268439Z","submitted_at":"2025-01-21T18:59:49Z","title":"Physics of Skill Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T17:20:51.081428Z"},"links":{"cited_paper":"/paper/2310.15916","citing_paper":"/paper/2501.12391"},"observation_digest":"sha256:35fb284435b92a18f2b90d96d50e1d668c3180e1b8218461fae4a4696024acd4","observation_id":"8770370f-bdfc-4519-9c1a-679071edbf46","resolution":{"observed_at":"2026-08-10T17:20:51.081428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:20:51.629377Z","title":"Task vectors in in-context learning: Emergence, formation, and benefit, 2025","venue":null,"work_id":"8f565160-66f5-4da7-bee7-782fa0891ed5","year":2025},"citing_paper":{"arxiv_id":"2501.12391","last_updated":"2025-01-21T18:59:49Z","snapshot_observed_at":"2026-08-10T20:26:48.268439Z","submitted_at":"2025-01-21T18:59:49Z","title":"Physics of Skill Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T17:20:51.085148Z"},"links":{"citing_paper":"/paper/2501.12391"},"observation_digest":"sha256:cfbc71c10ba1a6660494e24ceb6b823351479825d0a996ceae2ecf1cfa3f697f","observation_id":"a22aa8fe-9eff-41d4-a5cb-92f91efd989e","resolution":{"observed_at":"2026-08-10T17:20:51.632857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.11895","last_updated":"2022-09-24T00:43:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-09-24T00:43:19Z","title":"In-context Learning and Induction Heads","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.11895","snapshot_observed_at":"2026-08-10T17:20:51.088819Z","title":"In-context learning and induction heads","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.12391","last_updated":"2025-01-21T18:59:49Z","snapshot_observed_at":"2026-08-10T20:26:48.268439Z","submitted_at":"2025-01-21T18:59:49Z","title":"Physics of Skill Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T17:20:51.088819Z"},"links":{"cited_paper":"/paper/2209.11895","citing_paper":"/paper/2501.12391"},"observation_digest":"sha256:74c4898a8f5b8d4faa36d7f820795fa4e2376db505d8171e124307b56f9d21c3","observation_id":"08381879-a905-4798-8f22-6f1132b13b2e","resolution":{"observed_at":"2026-08-10T17:20:51.088819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:20:51.092546Z","title":"Towards understanding grokking: An effective theory of representation learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.12391","last_updated":"2025-01-21T18:59:49Z","snapshot_observed_at":"2026-08-10T20:26:48.268439Z","submitted_at":"2025-01-21T18:59:49Z","title":"Physics of Skill Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T17:20:51.092546Z"},"links":{"citing_paper":"/paper/2501.12391"},"observation_digest":"sha256:524d1b9dcb16f092983d659b341f9f2d5c8994678e6da77850c9186ff95ffc2c","observation_id":"d9c955d9-7745-4475-a51d-d9f4e9604090","resolution":{"observed_at":"2026-08-10T17:20:51.092546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:20:51.613658Z","title":"Omnigrok: Grokking beyond algorithmic data","venue":null,"work_id":"19c4ed39-ef0a-4778-944c-3c0685f33d52","year":2022},"citing_paper":{"arxiv_id":"2501.12391","last_updated":"2025-01-21T18:59:49Z","snapshot_observed_at":"2026-08-10T20:26:48.268439Z","submitted_at":"2025-01-21T18:59:49Z","title":"Physics of Skill Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T17:20:51.095940Z"},"links":{"citing_paper":"/paper/2501.12391"},"observation_digest":"sha256:bb1baaba6d78fc9593fdea0a3b3e78cb789e17a16863a0e2823032bf05fa07f2","observation_id":"4ab2533b-6740-4f86-a689-6839cf30b98a","resolution":{"observed_at":"2026-08-10T17:20:51.617395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.05217","last_updated":"2023-10-19T21:25:32Z","snapshot_observed_at":"2026-08-02T10:20:00.635719Z","submitted_at":"2023-01-12T18:56:49Z","title":"Progress measures for grokking via mechanistic interpretability","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.05217","snapshot_observed_at":"2026-08-10T17:20:51.099359Z","title":"Progress measures for grokking via mechanistic interpretability","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12391","last_updated":"2025-01-21T18:59:49Z","snapshot_observed_at":"2026-08-10T20:26:48.268439Z","submitted_at":"2025-01-21T18:59:49Z","title":"Physics of Skill Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T17:20:51.099359Z"},"links":{"cited_paper":"/paper/2301.05217","citing_paper":"/paper/2501.12391"},"observation_digest":"sha256:d1c02f8f527800c257b903d1144515a0a8304681af4d2907af698f3649af9571","observation_id":"70e392f4-ce55-4ef8-bd3a-2cc8784756a0","resolution":{"observed_at":"2026-08-10T17:20:51.099359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:20:51.603363Z","title":"Sgd learning on neural net- works: leap complexity and saddle-to-saddle dynamics","venue":null,"work_id":"b65da213-7dd2-413d-ace2-295009ec855c","year":2023},"citing_paper":{"arxiv_id":"2501.12391","last_updated":"2025-01-21T18:59:49Z","snapshot_observed_at":"2026-08-10T20:26:48.268439Z","submitted_at":"2025-01-21T18:59:49Z","title":"Physics of Skill Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T17:20:51.102988Z"},"links":{"citing_paper":"/paper/2501.12391"},"observation_digest":"sha256:f9734f2a915fd90df802dc41d71bae871fa7e3b01ba7049ba71f18c788655c9a","observation_id":"2c011231-c9c8-4906-b04d-4fbf44d53da0","resolution":{"observed_at":"2026-08-10T17:20:51.607181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:20:51.592478Z","title":"The clock and the pizza: Two stories in mechanistic explanation of neural networks","venue":null,"work_id":"1bee863c-98fa-466a-8390-04c5bdc46f85","year":2024},"citing_paper":{"arxiv_id":"2501.12391","last_updated":"2025-01-21T18:59:49Z","snapshot_observed_at":"2026-08-10T20:26:48.268439Z","submitted_at":"2025-01-21T18:59:49Z","title":"Physics of Skill Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T17:20:51.106269Z"},"links":{"citing_paper":"/paper/2501.12391"},"observation_digest":"sha256:0c5aeb6fafc22c17f5dd463a0f99eebdfad4c76644efd0915a4bdb32cb4305a1","observation_id":"84b82829-5f7d-4789-b9d2-76ebc08ea939","resolution":{"observed_at":"2026-08-10T17:20:51.596780Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03902","last_updated":"2024-10-15T19:54:06Z","snapshot_observed_at":"2026-08-11T17:11:26.928187Z","submitted_at":"2024-02-06T11:13:54Z","title":"A phase transition between positional and semantic learning in a solvable model of dot-product attention","version":2},"cited_work":{"arxiv_id":"2402.03902","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.03902","snapshot_observed_at":"2026-08-10T17:20:51.361535Z","title":"A phase transition between positional and semantic learning in a solvable model of dot-product attention","venue":"cs.LG","work_id":"c0fbae47-9fa5-40a3-9789-474a865617dc","year":2024},"citing_paper":{"arxiv_id":"2501.12391","last_updated":"2025-01-21T18:59:49Z","snapshot_observed_at":"2026-08-10T20:26:48.268439Z","submitted_at":"2025-01-21T18:59:49Z","title":"Physics of Skill Learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T17:20:51.109713Z"},"links":{"cited_paper":"/paper/2402.03902","citing_paper":"/paper/2501.12391"},"observation_digest":"sha256:a12d0df5a1b2147b897d1d226be5734086d48e19c68cbc1db5557294537b3e2f","observation_id":"a2763031-f196-471e-9fe6-5dfbe87fa238","resolution":{"observed_at":"2026-08-10T17:20:51.365522Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05916","last_updated":"2025-03-20T16:31:41Z","snapshot_observed_at":"2026-07-06T17:27:37.212340Z","submitted_at":"2024-02-08T18:51:55Z","title":"GenEFT: Understanding Statics and Dynamics of Model Generalization via Effective Theory","version":2},"cited_work":{"arxiv_id":"2402.05916","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.05916","snapshot_observed_at":"2026-08-10T17:20:51.346168Z","title":"GenEFT: Understanding Statics and Dynamics of Model Generalization via Effective Theory","venue":"cs.LG","work_id":"517e8f2b-8036-49e6-b1dc-e6b597380c28","year":2024},"citing_paper":{"arxiv_id":"2501.12391","last_updated":"2025-01-21T18:59:49Z","snapshot_observed_at":"2026-08-10T20:26:48.268439Z","submitted_at":"2025-01-21T18:59:49Z","title":"Physics of Skill Learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T17:20:51.113148Z"},"links":{"cited_paper":"/paper/2402.05916","citing_paper":"/paper/2501.12391"},"observation_digest":"sha256:61297b32d7e36365fb48363a293d4092a6a534ba2392c78d29a0188cc7d1c90d","observation_id":"6eef25a9-ada5-49ea-9896-f2bef3066bf8","resolution":{"observed_at":"2026-08-10T17:20:51.351936Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:20:51.116376Z","title":"On the impact of the activation function on deep neural networks training","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.12391","last_updated":"2025-01-21T18:59:49Z","snapshot_observed_at":"2026-08-10T20:26:48.268439Z","submitted_at":"2025-01-21T18:59:49Z","title":"Physics of Skill Learning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T17:20:51.116376Z"},"links":{"citing_paper":"/paper/2501.12391"},"observation_digest":"sha256:7e4188bd82fecde31290350c762141163f1a15b7d5a49c193866fa6f4f24a1cf","observation_id":"d3074974-1f4b-4763-9182-4afb3fbe25b2","resolution":{"observed_at":"2026-08-10T17:20:51.116376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.14522","last_updated":"2022-07-15T17:04:24Z","snapshot_observed_at":"2026-08-10T23:48:51.698481Z","submitted_at":"2020-11-30T03:21:05Z","title":"Feature Learning in Infinite-Width Neural Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.14522","snapshot_observed_at":"2026-08-10T17:20:51.119602Z","title":"Feature learning in infinite-width neural networks","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2501.12391","last_updated":"2025-01-21T18:59:49Z","snapshot_observed_at":"2026-08-10T20:26:48.268439Z","submitted_at":"2025-01-21T18:59:49Z","title":"Physics of Skill Learning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T17:20:51.119602Z"},"links":{"cited_paper":"/paper/2011.14522","citing_paper":"/paper/2501.12391"},"observation_digest":"sha256:2960cc88f6731108b5f1bb1b1e16d7533ce6d261a3b070eee53dc0cfbe963f05","observation_id":"c39b7c73-b8f1-450f-82f0-8170a3ab1007","resolution":{"observed_at":"2026-08-10T17:20:51.119602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:20:51.577208Z","title":"Are emergent abilities of large language models a mirage? Advances in Neural Information Processing Systems, 36, 2024","venue":null,"work_id":"d3321f9d-3219-473b-ac7a-e6c1e44a43f3","year":2024},"citing_paper":{"arxiv_id":"2501.12391","last_updated":"2025-01-21T18:59:49Z","snapshot_observed_at":"2026-08-10T20:26:48.268439Z","submitted_at":"2025-01-21T18:59:49Z","title":"Physics of Skill Learning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T17:20:51.122789Z"},"links":{"citing_paper":"/paper/2501.12391"},"observation_digest":"sha256:eb6fffdd6cecbfce31823bd5bb3977f3a9623ec5231bd7bf75fad6c86073de9a","observation_id":"e7476996-f2e1-4adc-aadb-e8d316bfbbfe","resolution":{"observed_at":"2026-08-10T17:20:51.580799Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.10802","last_updated":"2020-04-22T19:16:06Z","snapshot_observed_at":"2026-08-11T08:19:07.869521Z","submitted_at":"2020-04-22T19:16:06Z","title":"A Neural Scaling Law from the Dimension of the Data Manifold","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.10802","snapshot_observed_at":"2026-08-10T17:20:51.125775Z","title":"A neural scaling law from the dimension of the data manifold","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2501.12391","last_updated":"2025-01-21T18:59:49Z","snapshot_observed_at":"2026-08-10T20:26:48.268439Z","submitted_at":"2025-01-21T18:59:49Z","title":"Physics of Skill Learning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T17:20:51.125775Z"},"links":{"cited_paper":"/paper/2004.10802","citing_paper":"/paper/2501.12391"},"observation_digest":"sha256:34773e78c7a7899324be383970f8e8355f837b0ba1bb8ea69b660f929977af5e","observation_id":"f16b1678-4431-4148-b383-ec80fc2d9635","resolution":{"observed_at":"2026-08-10T17:20:51.125775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05164","last_updated":"2024-05-15T15:39:38Z","snapshot_observed_at":"2026-08-09T23:43:33.708808Z","submitted_at":"2024-02-07T18:58:18Z","title":"A Resource Model For Neural Scaling Law","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05164","snapshot_observed_at":"2026-08-10T17:20:51.129278Z","title":"A resource model for neural scaling law","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12391","last_updated":"2025-01-21T18:59:49Z","snapshot_observed_at":"2026-08-10T20:26:48.268439Z","submitted_at":"2025-01-21T18:59:49Z","title":"Physics of Skill Learning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T17:20:51.129278Z"},"links":{"cited_paper":"/paper/2402.05164","citing_paper":"/paper/2501.12391"},"observation_digest":"sha256:6773335634d5adb6ea10365a065f4b387bc6c64538950d653111b90fdb610b48","observation_id":"aff2047b-01e8-4568-9f57-b953e61e9bfa","resolution":{"observed_at":"2026-08-10T17:20:51.129278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:20:51.132457Z","title":"Explaining neural scaling laws","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12391","last_updated":"2025-01-21T18:59:49Z","snapshot_observed_at":"2026-08-10T20:26:48.268439Z","submitted_at":"2025-01-21T18:59:49Z","title":"Physics of Skill Learning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T17:20:51.132457Z"},"links":{"citing_paper":"/paper/2501.12391"},"observation_digest":"sha256:85092d74036e2f78b68241998ef28ac70a7b2f742d48cbae81975c9e2369140a","observation_id":"80923d14-65d0-4917-9c1f-cf8f6e5e512f","resolution":{"observed_at":"2026-08-10T17:20:51.132457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.16859","last_updated":"2022-10-30T15:13:18Z","snapshot_observed_at":"2026-08-10T19:38:03.042475Z","submitted_at":"2022-10-30T15:13:18Z","title":"A Solvable Model of Neural Scaling Laws","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.16859","snapshot_observed_at":"2026-08-10T17:20:51.135804Z","title":"A solvable model of neural scaling laws","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.12391","last_updated":"2025-01-21T18:59:49Z","snapshot_observed_at":"2026-08-10T20:26:48.268439Z","submitted_at":"2025-01-21T18:59:49Z","title":"Physics of Skill Learning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T17:20:51.135804Z"},"links":{"cited_paper":"/paper/2210.16859","citing_paper":"/paper/2501.12391"},"observation_digest":"sha256:84e25db2d16bb4a9b3321f35a06a3de9d4b48b8ce77f11c44c9e879787566c86","observation_id":"7949c896-d677-4046-9656-48ce083b9489","resolution":{"observed_at":"2026-08-10T17:20:51.135804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01092","last_updated":"2024-06-23T10:46:17Z","snapshot_observed_at":"2026-08-10T17:46:18.227894Z","submitted_at":"2024-02-02T01:41:38Z","title":"A Dynamical Model of Neural Scaling Laws","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01092","snapshot_observed_at":"2026-08-10T17:20:51.139060Z","title":"A dynamical model of neural scaling laws","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12391","last_updated":"2025-01-21T18:59:49Z","snapshot_observed_at":"2026-08-10T20:26:48.268439Z","submitted_at":"2025-01-21T18:59:49Z","title":"Physics of Skill Learning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T17:20:51.139060Z"},"links":{"cited_paper":"/paper/2402.01092","citing_paper":"/paper/2501.12391"},"observation_digest":"sha256:468efea8b42c0bed45e872861fc38e78c11f0aaaf2f5f435f103b3e6f99e2e13","observation_id":"74349365-87b6-4e3c-8f2b-4968db025671","resolution":{"observed_at":"2026-08-10T17:20:51.139060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:20:51.142366Z","title":"Beyond neural scaling laws: beating power law scaling via data pruning.Advances in Neural Information Processing Systems, 35:19523–19536, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.12391","last_updated":"2025-01-21T18:59:49Z","snapshot_observed_at":"2026-08-10T20:26:48.268439Z","submitted_at":"2025-01-21T18:59:49Z","title":"Physics of Skill Learning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T17:20:51.142366Z"},"links":{"citing_paper":"/paper/2501.12391"},"observation_digest":"sha256:7a38eceb9b1e6bdf011c54e7593933169e6661bbc5aa46b7e40e125bbd23ab27","observation_id":"b858fa06-f2e7-4957-b774-d9b4a2b85ba2","resolution":{"observed_at":"2026-08-10T17:20:51.142366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19756","last_updated":"2025-02-09T21:09:09Z","snapshot_observed_at":"2026-07-06T18:07:47.744531Z","submitted_at":"2024-04-30T17:58:29Z","title":"KAN: Kolmogorov-Arnold Networks","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.19756","snapshot_observed_at":"2026-08-10T17:20:51.145735Z","title":"Kan: Kolmogorov-arnold networks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12391","last_updated":"2025-01-21T18:59:49Z","snapshot_observed_at":"2026-08-10T20:26:48.268439Z","submitted_at":"2025-01-21T18:59:49Z","title":"Physics of Skill Learning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T17:20:51.145735Z"},"links":{"cited_paper":"/paper/2404.19756","citing_paper":"/paper/2501.12391"},"observation_digest":"sha256:7b532fc2cd7fd19a2d0a0a21aad152cd7df66c28060ee2f8a9f9a014706a99d1","observation_id":"ecc4b37d-9e6e-46b9-a423-219037f69ad8","resolution":{"observed_at":"2026-08-10T17:20:51.145735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:20:51.149105Z","title":"Glam: Efficient scaling of language models with mixture-of-experts","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.12391","last_updated":"2025-01-21T18:59:49Z","snapshot_observed_at":"2026-08-10T20:26:48.268439Z","submitted_at":"2025-01-21T18:59:49Z","title":"Physics of Skill Learning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T17:20:51.149105Z"},"links":{"citing_paper":"/paper/2501.12391"},"observation_digest":"sha256:0c299f8da9d5995a9a5946033dea7d70bf01f8134b3775b5709f3020bf923e5d","observation_id":"cd3532dc-a1fb-47bf-aecd-b8d0061ee2de","resolution":{"observed_at":"2026-08-10T17:20:51.149105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04330","last_updated":"2024-11-30T02:42:31Z","snapshot_observed_at":"2026-08-04T07:47:22.112536Z","submitted_at":"2024-11-07T00:10:10Z","title":"Scaling Laws for Precision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04330","snapshot_observed_at":"2026-08-10T17:20:51.152418Z","title":"Scaling laws for precision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12391","last_updated":"2025-01-21T18:59:49Z","snapshot_observed_at":"2026-08-10T20:26:48.268439Z","submitted_at":"2025-01-21T18:59:49Z","title":"Physics of Skill Learning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T17:20:51.152418Z"},"links":{"cited_paper":"/paper/2411.04330","citing_paper":"/paper/2501.12391"},"observation_digest":"sha256:2a03bed093c19583b99c6b33c45d1b729e3c572626f2866a346f2de0260e9b9e","observation_id":"f6542a55-fcf3-4cce-bdf9-05369c1ece25","resolution":{"observed_at":"2026-08-10T17:20:51.152418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.08520","last_updated":"2023-09-15T16:29:27Z","snapshot_observed_at":"2026-08-10T14:43:47.936653Z","submitted_at":"2023-09-15T16:29:27Z","title":"Scaling Laws for Sparsely-Connected Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.08520","snapshot_observed_at":"2026-08-10T17:20:51.156794Z","title":"Scaling laws for sparsely-connected foundation models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12391","last_updated":"2025-01-21T18:59:49Z","snapshot_observed_at":"2026-08-10T20:26:48.268439Z","submitted_at":"2025-01-21T18:59:49Z","title":"Physics of Skill Learning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T17:20:51.156794Z"},"links":{"cited_paper":"/paper/2309.08520","citing_paper":"/paper/2501.12391"},"observation_digest":"sha256:54cd99e29daa31a2a591d774df01cb0695ff4ff47d621f225fdddfad0b28b43a","observation_id":"60c7d7be-2e56-4d08-a2b4-38c32e4a9efb","resolution":{"observed_at":"2026-08-10T17:20:51.156794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:20:51.160378Z","title":"Cautious optimizers: Improving training with one line of code","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12391","last_updated":"2025-01-21T18:59:49Z","snapshot_observed_at":"2026-08-10T20:26:48.268439Z","submitted_at":"2025-01-21T18:59:49Z","title":"Physics of Skill Learning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-10T17:20:51.160378Z"},"links":{"citing_paper":"/paper/2501.12391"},"observation_digest":"sha256:9ccb5775444786f8a291965f78f0a417b34b415c0204a4c555d2c1fe17d978de","observation_id":"62914c19-bc4c-4a7b-a99f-b778b971c6c1","resolution":{"observed_at":"2026-08-10T17:20:51.160378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14813","last_updated":"2024-05-23T17:23:30Z","snapshot_observed_at":"2026-08-10T13:12:13.812077Z","submitted_at":"2024-05-23T17:23:30Z","title":"Scalable Optimization in the Modular Norm","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14813","snapshot_observed_at":"2026-08-10T17:20:51.163954Z","title":"Scalable optimization in the modular norm","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12391","last_updated":"2025-01-21T18:59:49Z","snapshot_observed_at":"2026-08-10T20:26:48.268439Z","submitted_at":"2025-01-21T18:59:49Z","title":"Physics of Skill Learning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-10T17:20:51.163954Z"},"links":{"cited_paper":"/paper/2405.14813","citing_paper":"/paper/2501.12391"},"observation_digest":"sha256:3b777f128f2c9aecc6701336a27a17a852eb244245527647f2781e51f90e0269","observation_id":"d529e7d6-f487-42fc-9492-137edad10981","resolution":{"observed_at":"2026-08-10T17:20:51.163954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:20:51.550121Z","title":"Shampoo: Preconditioned stochastic tensor optimization","venue":null,"work_id":"1f36f95c-8291-4f4b-af18-1c1c1d2c956f","year":2018},"citing_paper":{"arxiv_id":"2501.12391","last_updated":"2025-01-21T18:59:49Z","snapshot_observed_at":"2026-08-10T20:26:48.268439Z","submitted_at":"2025-01-21T18:59:49Z","title":"Physics of Skill Learning","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-10T17:20:51.167524Z"},"links":{"citing_paper":"/paper/2501.12391"},"observation_digest":"sha256:29dc8405779c807289c8183515d83b4d4bd4889c140c96ae3bffc03546f013d0","observation_id":"82bfe036-232e-4ace-958f-b53cb978950a","resolution":{"observed_at":"2026-08-10T17:20:51.553972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.12391","last_updated":"2025-01-21T18:59:49Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-10T20:26:48.268439Z","submitted_at":"2025-01-21T18:59:49Z","title":"Physics of Skill Learning"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":40,"verified_exact":3,"verified_fuzzy":17},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 6 inbound Pith citation observations for arXiv:2501.12391."}