{"as_of":"2026-08-22T12:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8505d3998119599a4fe81ebf2b56ae521ead5994ff98a5498a38813badd40cee","coverage":[{"denominator":23,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T12:27:49.499597Z","state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2504.12700/citation-record","integrity":"/paper/2504.12700/integrity","json":"/paper/2504.12700/citation-record.json","paper":"/paper/2504.12700"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2201.02177","last_updated":"2022-01-06T18:43:37Z","snapshot_observed_at":"2026-08-18T12:23:06.967499Z","submitted_at":"2022-01-06T18:43:37Z","title":"Grokking: Generalization Beyond Overfitting on Small Algorithmic Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.02177","snapshot_observed_at":"2026-08-16T12:27:49.389192Z","title":"Grokking: Generalization beyond overfitting on small algorithmic datasets,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.12700","last_updated":"2025-04-17T06:57:37Z","snapshot_observed_at":"2026-08-20T16:54:50.259836Z","submitted_at":"2025-04-17T06:57:37Z","title":"A Two-Phase Perspective on Deep Learning Dynamics","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T12:27:49.389192Z"},"links":{"cited_paper":"/paper/2201.02177","citing_paper":"/paper/2504.12700"},"observation_digest":"sha256:0769dc29a8d34aeb27b779434df182c67331e75b4f0a454ed0dd84877688b4d7","observation_id":"9e80c18b-605e-46bb-a8a2-a19a44eb19c1","resolution":{"observed_at":"2026-08-16T12:27:49.389192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.01117","last_updated":"2023-03-23T13:42:27Z","snapshot_observed_at":"2026-08-19T22:36:28.346094Z","submitted_at":"2022-10-03T17:58:04Z","title":"Omnigrok: Grokking Beyond Algorithmic Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.01117","snapshot_observed_at":"2026-08-16T12:27:49.394756Z","title":"Omnigrok: Grokking beyond algorithmic data,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.12700","last_updated":"2025-04-17T06:57:37Z","snapshot_observed_at":"2026-08-20T16:54:50.259836Z","submitted_at":"2025-04-17T06:57:37Z","title":"A Two-Phase Perspective on Deep Learning Dynamics","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T12:27:49.394756Z"},"links":{"cited_paper":"/paper/2210.01117","citing_paper":"/paper/2504.12700"},"observation_digest":"sha256:baf461a504ca004ed295bc3bac087408d333761b7e7181947278f1937ad449d5","observation_id":"243b8f4d-f8e5-49df-93c4-6a44c9ce3193","resolution":{"observed_at":"2026-08-16T12:27:49.394756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02541","last_updated":"2023-10-04T02:50:34Z","snapshot_observed_at":"2026-08-20T16:55:21.474536Z","submitted_at":"2023-10-04T02:50:34Z","title":"Benign Overfitting and Grokking in ReLU Networks for XOR Cluster Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02541","snapshot_observed_at":"2026-08-16T12:27:49.400092Z","title":"Benign overfitting and grokking in relu networks for xor cluster data,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.12700","last_updated":"2025-04-17T06:57:37Z","snapshot_observed_at":"2026-08-20T16:54:50.259836Z","submitted_at":"2025-04-17T06:57:37Z","title":"A Two-Phase Perspective on Deep Learning Dynamics","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T12:27:49.400092Z"},"links":{"cited_paper":"/paper/2310.02541","citing_paper":"/paper/2504.12700"},"observation_digest":"sha256:b871262de15c78f1a13796c0d62521564ad76e955c271b84f72b8bec51be17b8","observation_id":"4f79a466-9aac-49cd-8814-524576b7e37f","resolution":{"observed_at":"2026-08-16T12:27:49.400092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15555","last_updated":"2024-06-06T18:33:15Z","snapshot_observed_at":"2026-08-16T14:15:48.967034Z","submitted_at":"2024-02-23T18:59:31Z","title":"Deep Networks Always Grok and Here is Why","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15555","snapshot_observed_at":"2026-08-16T12:27:49.405956Z","title":"Deep networks always grok and here is why,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12700","last_updated":"2025-04-17T06:57:37Z","snapshot_observed_at":"2026-08-20T16:54:50.259836Z","submitted_at":"2025-04-17T06:57:37Z","title":"A Two-Phase Perspective on Deep Learning Dynamics","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T12:27:49.405956Z"},"links":{"cited_paper":"/paper/2402.15555","citing_paper":"/paper/2504.12700"},"observation_digest":"sha256:9fc0d692ca06271573ee5c1b5f0dc5f86ba4858f8f54377014b7e637a6e24e73","observation_id":"62bcf852-774c-4319-b882-f04b73193402","resolution":{"observed_at":"2026-08-16T12:27:49.405956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02390","last_updated":"2023-09-05T17:00:24Z","snapshot_observed_at":"2026-08-16T15:03:06.920972Z","submitted_at":"2023-09-05T17:00:24Z","title":"Explaining grokking through circuit efficiency","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.02390","snapshot_observed_at":"2026-08-16T12:27:49.411603Z","title":"Explaining grokking through circuit efficiency,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.12700","last_updated":"2025-04-17T06:57:37Z","snapshot_observed_at":"2026-08-20T16:54:50.259836Z","submitted_at":"2025-04-17T06:57:37Z","title":"A Two-Phase Perspective on Deep Learning Dynamics","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T12:27:49.411603Z"},"links":{"cited_paper":"/paper/2309.02390","citing_paper":"/paper/2504.12700"},"observation_digest":"sha256:b8b3d111cb61a50842a8f57bd51f26d06c6b6bb5b386012e1f0bee1cfc97c2c6","observation_id":"68fddc4c-0d10-44b5-a1b5-afc480e7716f","resolution":{"observed_at":"2026-08-16T12:27:49.411603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:27:49.905748Z","title":"Grokking and the Geometry of Circuit Formation,","venue":null,"work_id":"7c5b442e-d29d-4cab-9a36-ebe9b54f36e3","year":2024},"citing_paper":{"arxiv_id":"2504.12700","last_updated":"2025-04-17T06:57:37Z","snapshot_observed_at":"2026-08-20T16:54:50.259836Z","submitted_at":"2025-04-17T06:57:37Z","title":"A Two-Phase Perspective on Deep Learning Dynamics","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T12:27:49.417003Z"},"links":{"citing_paper":"/paper/2504.12700"},"observation_digest":"sha256:01064dbeea8c52906c9749e1e9f63647c9cd2a9cba8b8d95a0ac81c80d4a4b18","observation_id":"ff1d6786-dcdb-44aa-98b1-b7d56ed3a6fc","resolution":{"observed_at":"2026-08-16T12:27:49.910840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12332","last_updated":"2024-07-17T06:15:30Z","snapshot_observed_at":"2026-08-21T17:13:24.036935Z","submitted_at":"2024-07-17T06:15:30Z","title":"Why Do You Grok? A Theoretical Analysis of Grokking Modular Addition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12332","snapshot_observed_at":"2026-08-16T12:27:49.422435Z","title":"Why do you grok? a theoretical analysis of grokking modular addition,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12700","last_updated":"2025-04-17T06:57:37Z","snapshot_observed_at":"2026-08-20T16:54:50.259836Z","submitted_at":"2025-04-17T06:57:37Z","title":"A Two-Phase Perspective on Deep Learning Dynamics","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T12:27:49.422435Z"},"links":{"cited_paper":"/paper/2407.12332","citing_paper":"/paper/2504.12700"},"observation_digest":"sha256:0f3dcad7f999ea4fe32b11e2725f24d7659daaffd47785c18628ab318af3de40","observation_id":"f47d8d08-c895-4cee-b8d4-a1623797ef93","resolution":{"observed_at":"2026-08-16T12:27:49.422435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.05217","last_updated":"2023-10-19T21:25:32Z","snapshot_observed_at":"2026-08-02T10:20:00.635719Z","submitted_at":"2023-01-12T18:56:49Z","title":"Progress measures for grokking via mechanistic interpretability","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.05217","snapshot_observed_at":"2026-08-16T12:27:49.427633Z","title":"Progress measures for grokking via mechanistic interpretability,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.12700","last_updated":"2025-04-17T06:57:37Z","snapshot_observed_at":"2026-08-20T16:54:50.259836Z","submitted_at":"2025-04-17T06:57:37Z","title":"A Two-Phase Perspective on Deep Learning Dynamics","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T12:27:49.427633Z"},"links":{"cited_paper":"/paper/2301.05217","citing_paper":"/paper/2504.12700"},"observation_digest":"sha256:08f70874b577e6dc5e5a4b95b307221dceefeca6b73e320f33c334c848d7bb90","observation_id":"859e1c7d-fa47-424d-a059-cc31a15aaf0a","resolution":{"observed_at":"2026-08-16T12:27:49.427633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:27:49.890472Z","title":"Zoom in: An introduction to circuits,","venue":null,"work_id":"1ebfc360-9ecd-4c23-9977-4fa1a492890f","year":2020},"citing_paper":{"arxiv_id":"2504.12700","last_updated":"2025-04-17T06:57:37Z","snapshot_observed_at":"2026-08-20T16:54:50.259836Z","submitted_at":"2025-04-17T06:57:37Z","title":"A Two-Phase Perspective on Deep Learning Dynamics","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T12:27:49.432674Z"},"links":{"citing_paper":"/paper/2504.12700"},"observation_digest":"sha256:2fad60fae9810e91e300d1e56521f7721dfa90ca24b0431e004b189bf80b6018","observation_id":"a3cafea8-ef25-4089-b5a6-4e7867eab224","resolution":{"observed_at":"2026-08-16T12:27:49.895185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:27:49.874450Z","title":"Hidden progress in deep learning: Sgd learns parities near the computational limit,","venue":null,"work_id":"bd4b1361-2c3f-4857-994d-4540a5a11a70","year":2022},"citing_paper":{"arxiv_id":"2504.12700","last_updated":"2025-04-17T06:57:37Z","snapshot_observed_at":"2026-08-20T16:54:50.259836Z","submitted_at":"2025-04-17T06:57:37Z","title":"A Two-Phase Perspective on Deep Learning Dynamics","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T12:27:49.437489Z"},"links":{"citing_paper":"/paper/2504.12700"},"observation_digest":"sha256:2ec336780afd731994350c8007054b873a99b5897eecdeb45d1da20becba95d1","observation_id":"3a94b629-7d64-4dbb-954e-b6d82ab4d27f","resolution":{"observed_at":"2026-08-16T12:27:49.880189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05918","last_updated":"2023-10-09T17:59:18Z","snapshot_observed_at":"2026-08-21T17:13:25.754282Z","submitted_at":"2023-10-09T17:59:18Z","title":"Grokking as Compression: A Nonlinear Complexity Perspective","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05918","snapshot_observed_at":"2026-08-16T12:27:49.442057Z","title":"Grokking as compression: A nonlinear complexity perspective,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.12700","last_updated":"2025-04-17T06:57:37Z","snapshot_observed_at":"2026-08-20T16:54:50.259836Z","submitted_at":"2025-04-17T06:57:37Z","title":"A Two-Phase Perspective on Deep Learning Dynamics","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T12:27:49.442057Z"},"links":{"cited_paper":"/paper/2310.05918","citing_paper":"/paper/2504.12700"},"observation_digest":"sha256:bcec93885d987a8b70a81abce41728cfab1f7627e1734fe0ce5868c81b2a1b32","observation_id":"f3511184-a246-4665-b36c-10942137da35","resolution":{"observed_at":"2026-08-16T12:27:49.442057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:27:49.859214Z","title":"Deep double descent: Where bigger models and more data hurt,","venue":null,"work_id":"3f27bd11-ddcb-4154-a353-dbe4773dbb80","year":2021},"citing_paper":{"arxiv_id":"2504.12700","last_updated":"2025-04-17T06:57:37Z","snapshot_observed_at":"2026-08-20T16:54:50.259836Z","submitted_at":"2025-04-17T06:57:37Z","title":"A Two-Phase Perspective on Deep Learning Dynamics","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T12:27:49.446982Z"},"links":{"citing_paper":"/paper/2504.12700"},"observation_digest":"sha256:177fac051b26003493ca8a8d72e421591ff839824b1f261c9e27c7f7a15e82c9","observation_id":"3f24a3bf-13c8-4f65-9153-2ef851fb1066","resolution":{"observed_at":"2026-08-16T12:27:49.863846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:27:49.844136Z","title":"Double trouble in double descent: Bias and variance (s) in the lazy regime,","venue":null,"work_id":"ee6c9730-cc11-4ec1-86fb-ff1fd612d0cf","year":2020},"citing_paper":{"arxiv_id":"2504.12700","last_updated":"2025-04-17T06:57:37Z","snapshot_observed_at":"2026-08-20T16:54:50.259836Z","submitted_at":"2025-04-17T06:57:37Z","title":"A Two-Phase Perspective on Deep Learning Dynamics","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T12:27:49.451690Z"},"links":{"citing_paper":"/paper/2504.12700"},"observation_digest":"sha256:3b943acdb7202cc5a51ed4a449c0b156d6419ec6d6195f64e94f3ec377577445","observation_id":"3707e4d1-75d8-41f8-9c6d-b24e9b488170","resolution":{"observed_at":"2026-08-16T12:27:49.848765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:27:49.826541Z","title":"A brief prehistory of double descent,","venue":null,"work_id":"2ef6c446-3b98-421f-b1ca-bb9df17d1b52","year":2020},"citing_paper":{"arxiv_id":"2504.12700","last_updated":"2025-04-17T06:57:37Z","snapshot_observed_at":"2026-08-20T16:54:50.259836Z","submitted_at":"2025-04-17T06:57:37Z","title":"A Two-Phase Perspective on Deep Learning Dynamics","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T12:27:49.456102Z"},"links":{"citing_paper":"/paper/2504.12700"},"observation_digest":"sha256:356f217e0c851a4baab7c7f27212dcec851ca44807a204820d8bdf5cd8c7aa69","observation_id":"57492f93-52d6-4699-a974-b4ee53ff9ef1","resolution":{"observed_at":"2026-08-16T12:27:49.832904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"physics/0004057","last_updated":"2000-04-24T15:22:30Z","snapshot_observed_at":"2026-08-16T09:10:10.815975Z","submitted_at":"2000-04-24T15:22:30Z","title":"The information bottleneck method","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"physics/0004057","snapshot_observed_at":"2026-08-16T12:27:49.460886Z","title":"The information bottleneck method,","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2504.12700","last_updated":"2025-04-17T06:57:37Z","snapshot_observed_at":"2026-08-20T16:54:50.259836Z","submitted_at":"2025-04-17T06:57:37Z","title":"A Two-Phase Perspective on Deep Learning Dynamics","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T12:27:49.460886Z"},"links":{"cited_paper":"/paper/physics/0004057","citing_paper":"/paper/2504.12700"},"observation_digest":"sha256:a651e2ce52624fa01a2e1ec08392e15bc6428a9ded5f1a23dd2b437bb8b2eb41","observation_id":"cd50dd40-e71e-40bd-bfac-f60eaa7b190d","resolution":{"observed_at":"2026-08-16T12:27:49.460886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:27:49.807870Z","title":"Deep learning and the information bottleneck principle,","venue":null,"work_id":"49cb8106-b0a3-4e9d-90ad-4981b5013513","year":2015},"citing_paper":{"arxiv_id":"2504.12700","last_updated":"2025-04-17T06:57:37Z","snapshot_observed_at":"2026-08-20T16:54:50.259836Z","submitted_at":"2025-04-17T06:57:37Z","title":"A Two-Phase Perspective on Deep Learning Dynamics","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T12:27:49.465744Z"},"links":{"citing_paper":"/paper/2504.12700"},"observation_digest":"sha256:c31facc966418b7c131eb4e55a720505a8b51c178709e46df89e0d68fbe953bd","observation_id":"1a8d423f-b906-4940-8e01-9f806a124a11","resolution":{"observed_at":"2026-08-16T12:27:49.813452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1703.00810","last_updated":"2017-04-29T17:32:47Z","snapshot_observed_at":"2026-08-14T21:13:52.487817Z","submitted_at":"2017-03-02T14:53:14Z","title":"Opening the Black Box of Deep Neural Networks via Information","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1703.00810","snapshot_observed_at":"2026-08-16T12:27:49.470319Z","title":"Opening the black box of deep neural networks via information,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.12700","last_updated":"2025-04-17T06:57:37Z","snapshot_observed_at":"2026-08-20T16:54:50.259836Z","submitted_at":"2025-04-17T06:57:37Z","title":"A Two-Phase Perspective on Deep Learning Dynamics","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T12:27:49.470319Z"},"links":{"cited_paper":"/paper/1703.00810","citing_paper":"/paper/2504.12700"},"observation_digest":"sha256:1dbead1fcaa9f90f330d477f95423f54011269999be2a2ad09ac4257fb6b9885","observation_id":"1f69bb5e-120a-4ff1-b985-db1853642e70","resolution":{"observed_at":"2026-08-16T12:27:49.470319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:27:49.788260Z","title":"The renormalization group: Critical phenomena and the Kondo problem,","venue":null,"work_id":"689e77ea-3069-49b9-a41f-e643dfc79c1c","year":1975},"citing_paper":{"arxiv_id":"2504.12700","last_updated":"2025-04-17T06:57:37Z","snapshot_observed_at":"2026-08-20T16:54:50.259836Z","submitted_at":"2025-04-17T06:57:37Z","title":"A Two-Phase Perspective on Deep Learning Dynamics","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T12:27:49.475257Z"},"links":{"citing_paper":"/paper/2504.12700"},"observation_digest":"sha256:b8c77555b71c483f9ef12fa8fcbc42cc65ddfedac56cc0fe61e2f5b0b4bf994d","observation_id":"d8765667-8208-4731-9164-325e0e318003","resolution":{"observed_at":"2026-08-16T12:27:49.793992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1410.3831","last_updated":"2014-10-14T20:00:09Z","snapshot_observed_at":"2026-08-14T23:15:43.495106Z","submitted_at":"2014-10-14T20:00:09Z","title":"An exact mapping between the Variational Renormalization Group and Deep Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1410.3831","snapshot_observed_at":"2026-08-16T12:27:49.479944Z","title":"Mehta, and D.J","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2504.12700","last_updated":"2025-04-17T06:57:37Z","snapshot_observed_at":"2026-08-20T16:54:50.259836Z","submitted_at":"2025-04-17T06:57:37Z","title":"A Two-Phase Perspective on Deep Learning Dynamics","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T12:27:49.479944Z"},"links":{"cited_paper":"/paper/1410.3831","citing_paper":"/paper/2504.12700"},"observation_digest":"sha256:7541eea0ec0b295cd2b9e26f4a3d800849a624d8b332544f07ce093172dec057","observation_id":"9a0482e4-4954-49b6-8b9b-537c2defec9e","resolution":{"observed_at":"2026-08-16T12:27:49.479944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:27:49.770771Z","title":"Mutual information, neural networks and the renormalization group","venue":null,"work_id":"6073db67-582a-40e8-b7e6-ca8112a1db3a","year":2018},"citing_paper":{"arxiv_id":"2504.12700","last_updated":"2025-04-17T06:57:37Z","snapshot_observed_at":"2026-08-20T16:54:50.259836Z","submitted_at":"2025-04-17T06:57:37Z","title":"A Two-Phase Perspective on Deep Learning Dynamics","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T12:27:49.485258Z"},"links":{"citing_paper":"/paper/2504.12700"},"observation_digest":"sha256:b107945806b40b75c6a70629bba13c9604a7e1b4197d3c3ad33a691af3e5a9ba","observation_id":"69eecf8b-f28e-4a04-b1e2-7a9e2b475b96","resolution":{"observed_at":"2026-08-16T12:27:49.775990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:27:49.754448Z","title":"Is deep learning a renormalization group flow?","venue":null,"work_id":"de796efb-4185-465f-81ff-67aa73a00964","year":2020},"citing_paper":{"arxiv_id":"2504.12700","last_updated":"2025-04-17T06:57:37Z","snapshot_observed_at":"2026-08-20T16:54:50.259836Z","submitted_at":"2025-04-17T06:57:37Z","title":"A Two-Phase Perspective on Deep Learning Dynamics","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T12:27:49.490062Z"},"links":{"citing_paper":"/paper/2504.12700"},"observation_digest":"sha256:bb0ecd3c014a7f84ab37a6ebce60bf67594d12737998f4a9c8cc3caf202cee86","observation_id":"0e3b1a5c-609f-4f3f-9e49-6372eb04a3e7","resolution":{"observed_at":"2026-08-16T12:27:49.759287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:27:49.738248Z","title":"Short-sighted deep learning,","venue":null,"work_id":"05c54742-50f9-4384-972b-407069f7798e","year":2020},"citing_paper":{"arxiv_id":"2504.12700","last_updated":"2025-04-17T06:57:37Z","snapshot_observed_at":"2026-08-20T16:54:50.259836Z","submitted_at":"2025-04-17T06:57:37Z","title":"A Two-Phase Perspective on Deep Learning Dynamics","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T12:27:49.494720Z"},"links":{"citing_paper":"/paper/2504.12700"},"observation_digest":"sha256:957cdb70ca47d7524960594ae59cd3f9d6531779625646da7bd208c6b810cf89","observation_id":"e1d11958-4f8d-4f76-bada-4e9997dc0431","resolution":{"observed_at":"2026-08-16T12:27:49.743619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.03531","last_updated":"2020-12-07T08:45:20Z","snapshot_observed_at":"2026-08-21T17:13:26.808305Z","submitted_at":"2020-12-07T08:45:20Z","title":"Why Unsupervised Deep Networks Generalize","version":1},"cited_work":{"arxiv_id":"2012.03531","doi":null,"metadata_source":"pith","pith_arxiv_id":"2012.03531","snapshot_observed_at":"2026-08-16T12:27:49.536150Z","title":"Why Unsupervised Deep Networks Generalize","venue":"cs.LG","work_id":"0fc58e5d-189f-4c32-a724-6e2ed864e6f5","year":2020},"citing_paper":{"arxiv_id":"2504.12700","last_updated":"2025-04-17T06:57:37Z","snapshot_observed_at":"2026-08-20T16:54:50.259836Z","submitted_at":"2025-04-17T06:57:37Z","title":"A Two-Phase Perspective on Deep Learning Dynamics","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T12:27:49.499597Z"},"links":{"cited_paper":"/paper/2012.03531","citing_paper":"/paper/2504.12700"},"observation_digest":"sha256:0a44f097486b5ef79fc447777000b9777f04dcf73bf4ed7fb647d91919351adf","observation_id":"cf13d3e2-1d1c-4338-b338-5bbfcb6ae4b8","resolution":{"observed_at":"2026-08-16T12:27:49.543685Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2504.12700","last_updated":"2025-04-17T06:57:37Z","latest_version":1,"primary_category":"hep-th","snapshot_observed_at":"2026-08-20T16:54:50.259836Z","submitted_at":"2025-04-17T06:57:37Z","title":"A Two-Phase Perspective on Deep Learning Dynamics"},"reference_resolution":{"displayed":23,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":1,"verified_fuzzy":11},"total_outbound_references":23},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 23 of 23 outbound references and 0 inbound Pith citation observations for arXiv:2504.12700."}