{"as_of":"2026-08-10T15:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1c81993d53aa72b8056dad70589cf70ee9b1237ec89681965c33415e2b1aa24c","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T14:44:27.141734Z","state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2502.01739/citation-record","integrity":"/paper/2502.01739/integrity","json":"/paper/2502.01739/citation-record.json","paper":"/paper/2502.01739"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:44:26.970609Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.01739","last_updated":"2025-02-03T19:00:02Z","snapshot_observed_at":"2026-08-09T23:01:29.939584Z","submitted_at":"2025-02-03T19:00:02Z","title":"Grokking vs. Learning: Same Features, Different Encodings","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-09T14:44:26.970609Z"},"links":{"citing_paper":"/paper/2502.01739"},"observation_digest":"sha256:68d3ebe125560fbd18316b1fda30b87078eb2765486c491f4688d850dafa3bdc","observation_id":"58276907-54ac-4d82-8922-725f392e5fea","resolution":{"observed_at":"2026-08-09T14:44:26.970609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1610.01644","last_updated":"2018-11-22T23:40:00Z","snapshot_observed_at":"2026-08-09T22:50:03.459615Z","submitted_at":"2016-10-05T20:59:01Z","title":"Understanding intermediate layers using linear classifier probes","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1610.01644","snapshot_observed_at":"2026-08-09T14:44:26.975066Z","title":"Understanding intermediate layers using linear classifier probes, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.01739","last_updated":"2025-02-03T19:00:02Z","snapshot_observed_at":"2026-08-09T23:01:29.939584Z","submitted_at":"2025-02-03T19:00:02Z","title":"Grokking vs. Learning: Same Features, Different Encodings","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-09T14:44:26.975066Z"},"links":{"cited_paper":"/paper/1610.01644","citing_paper":"/paper/2502.01739"},"observation_digest":"sha256:59c7f95df156510ba30739f2be0d35d0a06559241fdd51148ec2b5cc80c13de3","observation_id":"7a43bb7e-da09-47de-8160-e23d72ea698d","resolution":{"observed_at":"2026-08-09T14:44:26.975066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:44:26.979171Z","title":"Information geometry and its applications, volume 194","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.01739","last_updated":"2025-02-03T19:00:02Z","snapshot_observed_at":"2026-08-09T23:01:29.939584Z","submitted_at":"2025-02-03T19:00:02Z","title":"Grokking vs. Learning: Same Features, Different Encodings","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-09T14:44:26.979171Z"},"links":{"citing_paper":"/paper/2502.01739"},"observation_digest":"sha256:28a8298982a3df30f7c610fd654bd3fa692595de1c0b32d9f4129931cbca4302","observation_id":"48a228ea-f02c-41d4-88f7-410703f98032","resolution":{"observed_at":"2026-08-09T14:44:26.979171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:44:38.272638Z","title":"Fisher information and natural gradient learning in random deep networks","venue":null,"work_id":"d18abe02-18fe-4e82-8f01-3cf04dab136b","year":2019},"citing_paper":{"arxiv_id":"2502.01739","last_updated":"2025-02-03T19:00:02Z","snapshot_observed_at":"2026-08-09T23:01:29.939584Z","submitted_at":"2025-02-03T19:00:02Z","title":"Grokking vs. Learning: Same Features, Different Encodings","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-09T14:44:26.982667Z"},"links":{"citing_paper":"/paper/2502.01739"},"observation_digest":"sha256:ed7af93bd909e4d709ad7b3dab98a68286ba1f8ab6c8708ca13375c315db2ce8","observation_id":"e3e45b44-d810-414a-8aea-720797bd79c2","resolution":{"observed_at":"2026-08-09T14:44:38.275886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:44:38.263788Z","title":null,"venue":null,"work_id":"4658954e-a53a-49f3-8f45-969e89840128","year":2007},"citing_paper":{"arxiv_id":"2502.01739","last_updated":"2025-02-03T19:00:02Z","snapshot_observed_at":"2026-08-09T23:01:29.939584Z","submitted_at":"2025-02-03T19:00:02Z","title":"Grokking vs. Learning: Same Features, Different Encodings","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-09T14:44:26.986138Z"},"links":{"citing_paper":"/paper/2502.01739"},"observation_digest":"sha256:8aacec3ec067e77bb8c2caea5b9557acb520b01f9e96df261ca35cefb8a39967","observation_id":"19eded2b-141c-4da1-9f71-afa464d8866a","resolution":{"observed_at":"2026-08-09T14:44:38.266966Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:44:26.989543Z","title":"Berman and Marc S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01739","last_updated":"2025-02-03T19:00:02Z","snapshot_observed_at":"2026-08-09T23:01:29.939584Z","submitted_at":"2025-02-03T19:00:02Z","title":"Grokking vs. Learning: Same Features, Different Encodings","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-09T14:44:26.989543Z"},"links":{"citing_paper":"/paper/2502.01739"},"observation_digest":"sha256:36fbc5aec22a3c59551d919c543e1ff7eaf6429c3905b3d638fbcec523df5f4b","observation_id":"08002a17-7247-43e2-8a57-80cb7d5c69f9","resolution":{"observed_at":"2026-08-09T14:44:26.989543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:44:38.254748Z","title":"Berman, Jonathan J","venue":null,"work_id":"5a74e217-eddc-4b6e-97f1-f35486e8ac32","year":2022},"citing_paper":{"arxiv_id":"2502.01739","last_updated":"2025-02-03T19:00:02Z","snapshot_observed_at":"2026-08-09T23:01:29.939584Z","submitted_at":"2025-02-03T19:00:02Z","title":"Grokking vs. Learning: Same Features, Different Encodings","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-09T14:44:26.993090Z"},"links":{"citing_paper":"/paper/2502.01739"},"observation_digest":"sha256:2b9ac5241954d9115534fa29b71bd873e27928ca2e4810b33eb1a449a50f917f","observation_id":"c0020a1c-b885-4920-8781-29c367367949","resolution":{"observed_at":"2026-08-09T14:44:38.257923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1088/2632-2153/ad0102","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Berman, Marc S","venue":"Machine Learning Science and Technology","work_id":"04611e09-dabb-4b8d-9501-97bfedc8475f","year":2023},"citing_paper":{"arxiv_id":"2502.01739","last_updated":"2025-02-03T19:00:02Z","snapshot_observed_at":"2026-08-09T23:01:29.939584Z","submitted_at":"2025-02-03T19:00:02Z","title":"Grokking vs. Learning: Same Features, Different Encodings","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-09T14:44:26.996583Z"},"links":{"citing_paper":"/paper/2502.01739"},"observation_digest":"sha256:8c5f23f45f101ef8df4facef32d1eddcb9750334450233023b94b727fb393bd8","observation_id":"ad9024f6-308d-4aaa-8354-bef223040e1b","resolution":{"observed_at":"2026-08-09T14:44:37.960635Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:44:38.245973Z","title":"Berman, Marc S","venue":null,"work_id":"5702c5ac-637e-487f-b2d5-885be3f1c530","year":2024},"citing_paper":{"arxiv_id":"2502.01739","last_updated":"2025-02-03T19:00:02Z","snapshot_observed_at":"2026-08-09T23:01:29.939584Z","submitted_at":"2025-02-03T19:00:02Z","title":"Grokking vs. Learning: Same Features, Different Encodings","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-09T14:44:26.999927Z"},"links":{"citing_paper":"/paper/2502.01739"},"observation_digest":"sha256:82af5f196db76bdf6d96cc63790333209f9475f276e67867698101ce0d832a0c","observation_id":"743f3968-be90-4dba-b9e2-0db2c2f8b851","resolution":{"observed_at":"2026-08-09T14:44:38.249141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09080","last_updated":"2020-07-22T17:59:18Z","snapshot_observed_at":"2026-08-10T07:25:38.965164Z","submitted_at":"2019-04-19T04:58:36Z","title":"Implicit regularization for deep neural networks driven by an Ornstein-Uhlenbeck like process","version":2},"cited_work":{"arxiv_id":"1904.09080","doi":null,"metadata_source":"pith","pith_arxiv_id":"1904.09080","snapshot_observed_at":"2026-08-09T14:44:38.156091Z","title":"Implicit regularization for deep neural networks driven by an Ornstein-Uhlenbeck like process","venue":"cs.LG","work_id":"e441627b-373d-43b9-9f2f-6774ed128ced","year":2019},"citing_paper":{"arxiv_id":"2502.01739","last_updated":"2025-02-03T19:00:02Z","snapshot_observed_at":"2026-08-09T23:01:29.939584Z","submitted_at":"2025-02-03T19:00:02Z","title":"Grokking vs. Learning: Same Features, Different Encodings","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-09T14:44:27.003027Z"},"links":{"cited_paper":"/paper/1904.09080","citing_paper":"/paper/2502.01739"},"observation_digest":"sha256:ab6c2a96f922ba88308774ec08a9090260a8ee050e70bb959a631d76b0470fb7","observation_id":"607f8c3c-7574-4d58-8ce2-2b8a5fc89245","resolution":{"observed_at":"2026-08-09T14:44:38.159790Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06301","last_updated":"2023-10-10T04:26:04Z","snapshot_observed_at":"2026-08-09T06:15:57.100129Z","submitted_at":"2023-10-10T04:26:04Z","title":"Dynamical versus Bayesian Phase Transitions in a Toy Model of Superposition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06301","snapshot_observed_at":"2026-08-09T14:44:27.006690Z","title":"Dynamical versus bayesian phase transitions in a toy model of superposition, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01739","last_updated":"2025-02-03T19:00:02Z","snapshot_observed_at":"2026-08-09T23:01:29.939584Z","submitted_at":"2025-02-03T19:00:02Z","title":"Grokking vs. Learning: Same Features, Different Encodings","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-09T14:44:27.006690Z"},"links":{"cited_paper":"/paper/2310.06301","citing_paper":"/paper/2502.01739"},"observation_digest":"sha256:27e05d661f6dfa7dda8313d4c8ab6d1e2a001325d59b34e1f60c4b45ae84c99a","observation_id":"a8c31a6f-90d8-48f6-a381-02565baab2f7","resolution":{"observed_at":"2026-08-09T14:44:27.006690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06767","last_updated":"2024-08-09T03:44:50Z","snapshot_observed_at":"2026-08-09T23:06:54.209559Z","submitted_at":"2023-08-13T13:34:04Z","title":"A Survey on Deep Neural Network Pruning-Taxonomy, Comparison, Analysis, and Recommendations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06767","snapshot_observed_at":"2026-08-09T14:44:27.010340Z","title":"A survey on deep neural network pruning-taxonomy, comparison, analysis, and recommendations, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01739","last_updated":"2025-02-03T19:00:02Z","snapshot_observed_at":"2026-08-09T23:01:29.939584Z","submitted_at":"2025-02-03T19:00:02Z","title":"Grokking vs. Learning: Same Features, Different Encodings","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-09T14:44:27.010340Z"},"links":{"cited_paper":"/paper/2308.06767","citing_paper":"/paper/2502.01739"},"observation_digest":"sha256:4df67b09a839f155980d8e20b9ff7e93d028039ff87f83ff079b391980212901","observation_id":"f4d4d3ee-e2bf-4e73-a5c8-43de26b3d9a0","resolution":{"observed_at":"2026-08-09T14:44:27.010340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09810","last_updated":"2025-08-21T12:59:05Z","snapshot_observed_at":"2026-08-09T02:48:06.379156Z","submitted_at":"2024-12-13T02:57:59Z","title":"The Complexity Dynamics of Grokking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09810","snapshot_observed_at":"2026-08-09T14:44:27.013833Z","title":"The Complexity Dynamics of Grokking","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01739","last_updated":"2025-02-03T19:00:02Z","snapshot_observed_at":"2026-08-09T23:01:29.939584Z","submitted_at":"2025-02-03T19:00:02Z","title":"Grokking vs. Learning: Same Features, Different Encodings","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-09T14:44:27.013833Z"},"links":{"cited_paper":"/paper/2412.09810","citing_paper":"/paper/2502.01739"},"observation_digest":"sha256:d436ed091d99c5890615c578300b46d68a4a5bab667fdf011aef0f9413091706","observation_id":"8bfb5cfe-7e14-4285-b099-106506d729dd","resolution":{"observed_at":"2026-08-09T14:44:27.013833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.13061","last_updated":"2024-03-04T21:59:58Z","snapshot_observed_at":"2026-07-06T16:35:52.483600Z","submitted_at":"2023-10-19T18:01:10Z","title":"To grok or not to grok: Disentangling generalization and memorization on corrupted algorithmic datasets","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.13061","snapshot_observed_at":"2026-08-09T14:44:27.017503Z","title":"To grok or not to grok: Disentangling generalization and memorization on corrupted algorithmic datasets, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01739","last_updated":"2025-02-03T19:00:02Z","snapshot_observed_at":"2026-08-09T23:01:29.939584Z","submitted_at":"2025-02-03T19:00:02Z","title":"Grokking vs. Learning: Same Features, Different Encodings","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-09T14:44:27.017503Z"},"links":{"cited_paper":"/paper/2310.13061","citing_paper":"/paper/2502.01739"},"observation_digest":"sha256:640a7b510a097e556bf5e98230a8073ccd30b98b42217c54b3a09941736099db","observation_id":"d33e0f3b-5499-4ec3-bd8a-4fa7d8b67996","resolution":{"observed_at":"2026-08-09T14:44:27.017503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:44:27.020918Z","title":"Toy models of superposition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01739","last_updated":"2025-02-03T19:00:02Z","snapshot_observed_at":"2026-08-09T23:01:29.939584Z","submitted_at":"2025-02-03T19:00:02Z","title":"Grokking vs. Learning: Same Features, Different Encodings","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-09T14:44:27.020918Z"},"links":{"citing_paper":"/paper/2502.01739"},"observation_digest":"sha256:967e44cf11182a5337fe438ea707f14b528657b2d012a820b1ef6cd9430bf8e6","observation_id":"8b05ae53-d8ab-47b8-afb0-dfc9675c25bc","resolution":{"observed_at":"2026-08-09T14:44:27.020918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19454","last_updated":"2024-05-29T19:05:11Z","snapshot_observed_at":"2026-07-06T18:22:14.521977Z","submitted_at":"2024-05-29T19:05:11Z","title":"Deep Grokking: Would Deep Neural Networks Generalize Better?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19454","snapshot_observed_at":"2026-08-09T14:44:27.023924Z","title":"Deep grokking: Would deep neural networks generalize better?, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01739","last_updated":"2025-02-03T19:00:02Z","snapshot_observed_at":"2026-08-09T23:01:29.939584Z","submitted_at":"2025-02-03T19:00:02Z","title":"Grokking vs. Learning: Same Features, Different Encodings","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-09T14:44:27.023924Z"},"links":{"cited_paper":"/paper/2405.19454","citing_paper":"/paper/2502.01739"},"observation_digest":"sha256:c0b1ce8ab806923e187507b0a7f4726ca58061f986fb870d6e7191cd1de36e17","observation_id":"3c8c77e5-fe0f-4266-8e02-25ba5d3f3d22","resolution":{"observed_at":"2026-08-09T14:44:27.023924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:44:27.027239Z","title":"NNGeometry: Easy and Fast Fisher Information Matrices and Neural Tangent Kernels in PyTorch , February 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.01739","last_updated":"2025-02-03T19:00:02Z","snapshot_observed_at":"2026-08-09T23:01:29.939584Z","submitted_at":"2025-02-03T19:00:02Z","title":"Grokking vs. Learning: Same Features, Different Encodings","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-09T14:44:27.027239Z"},"links":{"citing_paper":"/paper/2502.01739"},"observation_digest":"sha256:9e32dad5835e5ec82d458262d8648a25b97d96515f6a75048f32279c317c086c","observation_id":"369ad4a6-f5b9-47aa-93e0-e46caaa9dcf8","resolution":{"observed_at":"2026-08-09T14:44:27.027239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:44:27.030299Z","title":null,"venue":null,"work_id":null,"year":1963},"citing_paper":{"arxiv_id":"2502.01739","last_updated":"2025-02-03T19:00:02Z","snapshot_observed_at":"2026-08-09T23:01:29.939584Z","submitted_at":"2025-02-03T19:00:02Z","title":"Grokking vs. Learning: Same Features, Different Encodings","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-09T14:44:27.030299Z"},"links":{"citing_paper":"/paper/2502.01739"},"observation_digest":"sha256:eb0cda5e55e1b32aeafed0c8c36ae8c4c2c8306713fdaad003d0141bfea800c7","observation_id":"b5d0d404-3bfe-46db-9256-fea828bc8a85","resolution":{"observed_at":"2026-08-09T14:44:27.030299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:44:38.232324Z","title":"A simple and interpretable model of grokking modular arithmetic tasks, 2024","venue":null,"work_id":"eae52bac-f82d-4dfa-844e-03ace42dcb65","year":2024},"citing_paper":{"arxiv_id":"2502.01739","last_updated":"2025-02-03T19:00:02Z","snapshot_observed_at":"2026-08-09T23:01:29.939584Z","submitted_at":"2025-02-03T19:00:02Z","title":"Grokking vs. Learning: Same Features, Different Encodings","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-09T14:44:27.033629Z"},"links":{"citing_paper":"/paper/2502.01739"},"observation_digest":"sha256:d193d83cfd549851b279fefda14072c196796a94b52ff4a67c59a85e92baa490","observation_id":"09a00390-5367-4204-9444-7c8ea7fa402c","resolution":{"observed_at":"2026-08-09T14:44:38.235519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02364","last_updated":"2025-08-01T09:20:40Z","snapshot_observed_at":"2026-08-10T06:47:42.759048Z","submitted_at":"2024-02-04T06:23:05Z","title":"Loss Landscape Degeneracy and Stagewise Development in Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02364","snapshot_observed_at":"2026-08-09T14:44:27.036736Z","title":"The developmental landscape of in-context learning, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01739","last_updated":"2025-02-03T19:00:02Z","snapshot_observed_at":"2026-08-09T23:01:29.939584Z","submitted_at":"2025-02-03T19:00:02Z","title":"Grokking vs. Learning: Same Features, Different Encodings","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-09T14:44:27.036736Z"},"links":{"cited_paper":"/paper/2402.02364","citing_paper":"/paper/2502.01739"},"observation_digest":"sha256:46fe35e884a156db1d68581352f550565dd5bcf9a43c3bfab209d3edf9a5c4d4","observation_id":"1843eddf-e8a3-4f10-b0b8-618978f5547e","resolution":{"observed_at":"2026-08-09T14:44:27.036736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17538","last_updated":"2025-02-05T20:07:55Z","snapshot_observed_at":"2026-08-03T19:10:06.084416Z","submitted_at":"2024-05-27T18:00:00Z","title":"Bayesian RG Flow in Neural Network Field Theories","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17538","snapshot_observed_at":"2026-08-09T14:44:27.040034Z","title":"Howard, Marc S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01739","last_updated":"2025-02-03T19:00:02Z","snapshot_observed_at":"2026-08-09T23:01:29.939584Z","submitted_at":"2025-02-03T19:00:02Z","title":"Grokking vs. Learning: Same Features, Different Encodings","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-09T14:44:27.040034Z"},"links":{"cited_paper":"/paper/2405.17538","citing_paper":"/paper/2502.01739"},"observation_digest":"sha256:7ee9fd305d01ffd2d2a9906d1db7baaf66222a9bffea27fffd807fa56dec4e4b","observation_id":"14e19a7c-f3a2-4736-9de4-7fd8834b44bd","resolution":{"observed_at":"2026-08-09T14:44:27.040034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:44:27.043095Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.01739","last_updated":"2025-02-03T19:00:02Z","snapshot_observed_at":"2026-08-09T23:01:29.939584Z","submitted_at":"2025-02-03T19:00:02Z","title":"Grokking vs. Learning: Same Features, Different Encodings","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-09T14:44:27.043095Z"},"links":{"citing_paper":"/paper/2502.01739"},"observation_digest":"sha256:c3cf06d763bbef70b1896c88165cc9639b7d82d5a73790668964e997fc9c48b0","observation_id":"873877f2-38bc-4544-a6a2-1c6e930c3aad","resolution":{"observed_at":"2026-08-09T14:44:27.043095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12807","last_updated":"2024-09-03T21:00:39Z","snapshot_observed_at":"2026-07-06T18:17:21.217971Z","submitted_at":"2024-05-21T13:58:17Z","title":"FAdam: Adam is a natural gradient optimizer using diagonal empirical Fisher information","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12807","snapshot_observed_at":"2026-08-09T14:44:27.046167Z","title":"Fadam: Adam is a natural gradient optimizer using diagonal empirical fisher information, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01739","last_updated":"2025-02-03T19:00:02Z","snapshot_observed_at":"2026-08-09T23:01:29.939584Z","submitted_at":"2025-02-03T19:00:02Z","title":"Grokking vs. Learning: Same Features, Different Encodings","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-09T14:44:27.046167Z"},"links":{"cited_paper":"/paper/2405.12807","citing_paper":"/paper/2502.01739"},"observation_digest":"sha256:2ff958e78348a04ae53817b738d01a7e6c6f9c049029b522089fa3cf7e80ff1c","observation_id":"05c1eb62-aff8-4045-afd3-fc7f1021728d","resolution":{"observed_at":"2026-08-09T14:44:27.046167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15555","last_updated":"2024-06-06T18:33:15Z","snapshot_observed_at":"2026-07-06T17:34:45.072246Z","submitted_at":"2024-02-23T18:59:31Z","title":"Deep Networks Always Grok and Here is Why","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15555","snapshot_observed_at":"2026-08-09T14:44:27.049435Z","title":"Deep Networks Always Grok and Here is Why","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01739","last_updated":"2025-02-03T19:00:02Z","snapshot_observed_at":"2026-08-09T23:01:29.939584Z","submitted_at":"2025-02-03T19:00:02Z","title":"Grokking vs. Learning: Same Features, Different Encodings","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-09T14:44:27.049435Z"},"links":{"cited_paper":"/paper/2402.15555","citing_paper":"/paper/2502.01739"},"observation_digest":"sha256:991efa60e3c74151b17562d9a0163e0417a339384cfac1a605a6ae7c247f806a","observation_id":"c93a662c-a4ad-4b88-b089-80340c6a35b0","resolution":{"observed_at":"2026-08-09T14:44:27.049435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:44:27.052688Z","title":"Beitrag zur theorie des ferromagnetismus","venue":null,"work_id":null,"year":1925},"citing_paper":{"arxiv_id":"2502.01739","last_updated":"2025-02-03T19:00:02Z","snapshot_observed_at":"2026-08-09T23:01:29.939584Z","submitted_at":"2025-02-03T19:00:02Z","title":"Grokking vs. Learning: Same Features, Different Encodings","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-09T14:44:27.052688Z"},"links":{"citing_paper":"/paper/2502.01739"},"observation_digest":"sha256:79a3c0033eed23b10a4d9285c56fa905c188c729293b348e7d7b2e9e1278eaf1","observation_id":"2290a975-112a-4272-a7b3-ca401e1f60a0","resolution":{"observed_at":"2026-08-09T14:44:27.052688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00247","last_updated":"2024-10-31T22:54:34Z","snapshot_observed_at":"2026-07-06T19:43:19.201456Z","submitted_at":"2024-10-31T22:54:34Z","title":"Deep Learning Through A Telescoping Lens: A Simple Model Provides Empirical Insights On Grokking, Gradient Boosting & Beyond","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00247","snapshot_observed_at":"2026-08-09T14:44:27.055649Z","title":"Deep learning through a telescoping lens: A simple model provides empirical insights on grokking, gradient boosting & beyond, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01739","last_updated":"2025-02-03T19:00:02Z","snapshot_observed_at":"2026-08-09T23:01:29.939584Z","submitted_at":"2025-02-03T19:00:02Z","title":"Grokking vs. Learning: Same Features, Different Encodings","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-09T14:44:27.055649Z"},"links":{"cited_paper":"/paper/2411.00247","citing_paper":"/paper/2502.01739"},"observation_digest":"sha256:89a9bcf571b6d1143909ab943ea305b13ca8e8159955b875c5423836c5a41dc9","observation_id":"b6766937-96a8-4ba6-a0ee-437db336199e","resolution":{"observed_at":"2026-08-09T14:44:27.055649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:44:27.058883Z","title":"Apocrita - High Performance Computing Cluster for Queen Mary University of London , March 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.01739","last_updated":"2025-02-03T19:00:02Z","snapshot_observed_at":"2026-08-09T23:01:29.939584Z","submitted_at":"2025-02-03T19:00:02Z","title":"Grokking vs. Learning: Same Features, Different Encodings","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-09T14:44:27.058883Z"},"links":{"citing_paper":"/paper/2502.01739"},"observation_digest":"sha256:0b07362705f8f5e518733a696680ea048c65ae456df28cc79e5d63575b6d8b34","observation_id":"469a567e-7f64-4951-953d-eaf277dc4d8f","resolution":{"observed_at":"2026-08-09T14:44:27.058883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-09T14:44:27.062041Z","title":"Kingma and Jimmy Ba","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.01739","last_updated":"2025-02-03T19:00:02Z","snapshot_observed_at":"2026-08-09T23:01:29.939584Z","submitted_at":"2025-02-03T19:00:02Z","title":"Grokking vs. Learning: Same Features, Different Encodings","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-09T14:44:27.062041Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2502.01739"},"observation_digest":"sha256:7aa76e37bda81b31bd704968e3403a7b1f9c72757aa4041a663cad447504e261","observation_id":"e1950e5e-8b70-4d03-9e15-4c57ea847f9a","resolution":{"observed_at":"2026-08-09T14:44:27.062041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2412.18624","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:44:37.906594Z","title":null,"venue":null,"work_id":"082aba36-bbbf-42c3-9181-7e1c97ec08e5","year":2024},"citing_paper":{"arxiv_id":"2502.01739","last_updated":"2025-02-03T19:00:02Z","snapshot_observed_at":"2026-08-09T23:01:29.939584Z","submitted_at":"2025-02-03T19:00:02Z","title":"Grokking vs. Learning: Same Features, Different Encodings","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-09T14:44:27.065467Z"},"links":{"citing_paper":"/paper/2502.01739"},"observation_digest":"sha256:027ae850bb78c3c09df85885f1ac79197cd5f136ae59f72e9aef6d663c7184e6","observation_id":"9511697f-c95d-4768-a216-4fd6280c0793","resolution":{"observed_at":"2026-08-09T14:44:37.909886Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:44:38.223614Z","title":"Gershman, and Cengiz Pehlevan","venue":null,"work_id":"772265fd-4091-45f3-a82a-897a63663f2b","year":2024},"citing_paper":{"arxiv_id":"2502.01739","last_updated":"2025-02-03T19:00:02Z","snapshot_observed_at":"2026-08-09T23:01:29.939584Z","submitted_at":"2025-02-03T19:00:02Z","title":"Grokking vs. Learning: Same Features, Different Encodings","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-09T14:44:27.068536Z"},"links":{"citing_paper":"/paper/2502.01739"},"observation_digest":"sha256:7a524084279bf1ca907acaa307165beab124e7ea4618af77f69be68b876bff6b","observation_id":"43526eb7-0913-4293-8062-0344fda061a5","resolution":{"observed_at":"2026-08-09T14:44:38.226695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12108","last_updated":"2024-09-30T23:30:37Z","snapshot_observed_at":"2026-08-10T01:24:03.443212Z","submitted_at":"2023-08-23T12:55:41Z","title":"The Local Learning Coefficient: A Singularity-Aware Complexity Measure","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12108","snapshot_observed_at":"2026-08-09T14:44:27.071552Z","title":"The local learning coefficient: A singularity-aware complexity measure, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01739","last_updated":"2025-02-03T19:00:02Z","snapshot_observed_at":"2026-08-09T23:01:29.939584Z","submitted_at":"2025-02-03T19:00:02Z","title":"Grokking vs. Learning: Same Features, Different Encodings","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-09T14:44:27.071552Z"},"links":{"cited_paper":"/paper/2308.12108","citing_paper":"/paper/2502.01739"},"observation_digest":"sha256:b8eca9be500be5f205f2733656f67e060fe3dff37fabc4f42769f431662a2e51","observation_id":"243ebaf4-4c02-40ba-bba9-9946db9c1f80","resolution":{"observed_at":"2026-08-09T14:44:27.071552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:44:27.074759Z","title":"Optimal brain damage","venue":null,"work_id":null,"year":1989},"citing_paper":{"arxiv_id":"2502.01739","last_updated":"2025-02-03T19:00:02Z","snapshot_observed_at":"2026-08-09T23:01:29.939584Z","submitted_at":"2025-02-03T19:00:02Z","title":"Grokking vs. Learning: Same Features, Different Encodings","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-09T14:44:27.074759Z"},"links":{"citing_paper":"/paper/2502.01739"},"observation_digest":"sha256:82656edff947c6652d4d7cc488844461c19d0a0fe493e6b00b858c934d645253","observation_id":"dbbe5450-7889-44d0-8e34-6a2a7cba7940","resolution":{"observed_at":"2026-08-09T14:44:27.074759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.08643","last_updated":"2021-01-04T17:15:12Z","snapshot_observed_at":"2026-07-06T09:29:21.603604Z","submitted_at":"2020-06-15T18:00:09Z","title":"On the training dynamics of deep networks with $L_2$ regularization","version":2},"cited_work":{"arxiv_id":"2006.08643","doi":null,"metadata_source":"pith","pith_arxiv_id":"2006.08643","snapshot_observed_at":"2026-08-09T14:44:38.068604Z","title":"On the training dynamics of deep networks with $L_2$ regularization","venue":"stat.ML","work_id":"cab14b7c-24cd-4d04-a4d8-e515e86daae2","year":2020},"citing_paper":{"arxiv_id":"2502.01739","last_updated":"2025-02-03T19:00:02Z","snapshot_observed_at":"2026-08-09T23:01:29.939584Z","submitted_at":"2025-02-03T19:00:02Z","title":"Grokking vs. Learning: Same Features, Different Encodings","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-09T14:44:27.077807Z"},"links":{"cited_paper":"/paper/2006.08643","citing_paper":"/paper/2502.01739"},"observation_digest":"sha256:e51e6e0dd2b1f95d6d3a18aba2c919264b595f28cba19684c9e796fc72901f53","observation_id":"3443fd2e-64da-407d-b400-0fb9ed04c6cf","resolution":{"observed_at":"2026-08-09T14:44:38.072110Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:44:38.209464Z","title":"Michaud, Max Tegmark, and Mike Williams","venue":null,"work_id":"b4e87305-2730-4b7a-83b4-e6113ccd6e0d","year":2022},"citing_paper":{"arxiv_id":"2502.01739","last_updated":"2025-02-03T19:00:02Z","snapshot_observed_at":"2026-08-09T23:01:29.939584Z","submitted_at":"2025-02-03T19:00:02Z","title":"Grokking vs. Learning: Same Features, Different Encodings","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-09T14:44:27.080915Z"},"links":{"citing_paper":"/paper/2502.01739"},"observation_digest":"sha256:7a01d26a7deb070d345600a8b0cfdeec708df316247339f93a374fccae33ca90","observation_id":"5322ec0c-4efa-43f8-ac0e-25b3ffbb9966","resolution":{"observed_at":"2026-08-09T14:44:38.212602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:44:38.200676Z","title":"Towards understanding grokking: An effective theory of representation learning, 2022 b","venue":null,"work_id":"d96ea3cb-7917-4435-90a0-b7bc0803c6f1","year":2022},"citing_paper":{"arxiv_id":"2502.01739","last_updated":"2025-02-03T19:00:02Z","snapshot_observed_at":"2026-08-09T23:01:29.939584Z","submitted_at":"2025-02-03T19:00:02Z","title":"Grokking vs. Learning: Same Features, Different Encodings","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-09T14:44:27.084544Z"},"links":{"citing_paper":"/paper/2502.01739"},"observation_digest":"sha256:6102ce7db659031f0ab4f056f2e31414cf9de72d1b9e1cd026764ddabd50024c","observation_id":"a39a6110-66e6-47ed-9cf8-2596c59c720f","resolution":{"observed_at":"2026-08-09T14:44:38.203887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:44:38.192069Z","title":"Michaud, and Max Tegmark","venue":null,"work_id":"b7355d91-676d-4796-83e4-98551699f1b4","year":2023},"citing_paper":{"arxiv_id":"2502.01739","last_updated":"2025-02-03T19:00:02Z","snapshot_observed_at":"2026-08-09T23:01:29.939584Z","submitted_at":"2025-02-03T19:00:02Z","title":"Grokking vs. Learning: Same Features, Different Encodings","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-09T14:44:27.087594Z"},"links":{"citing_paper":"/paper/2502.01739"},"observation_digest":"sha256:5895018c86f111cea9c0bad5c327a0b66c1dd6d9df744f865c8c33184d6435e0","observation_id":"db956a8d-84dc-4274-88ff-b574128ec9e4","resolution":{"observed_at":"2026-08-09T14:44:38.195081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05918","last_updated":"2023-10-09T17:59:18Z","snapshot_observed_at":"2026-08-02T03:11:30.434124Z","submitted_at":"2023-10-09T17:59:18Z","title":"Grokking as Compression: A Nonlinear Complexity Perspective","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05918","snapshot_observed_at":"2026-08-09T14:44:27.090670Z","title":"Grokking as compression: A nonlinear complexity perspective, 2023 b","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01739","last_updated":"2025-02-03T19:00:02Z","snapshot_observed_at":"2026-08-09T23:01:29.939584Z","submitted_at":"2025-02-03T19:00:02Z","title":"Grokking vs. Learning: Same Features, Different Encodings","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-09T14:44:27.090670Z"},"links":{"cited_paper":"/paper/2310.05918","citing_paper":"/paper/2502.01739"},"observation_digest":"sha256:e4bb5325791fc0129a7e008d24b52cd7a892506d1c3070034bce6d40bd8a7abf","observation_id":"c20f2aa5-09a8-446d-b681-08a86fce7c8d","resolution":{"observed_at":"2026-08-09T14:44:27.090670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/j.neucom.2022.11.072","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Deep neural networks compression: A comparative survey and choice recommendations","venue":"Neurocomputing","work_id":"9e098477-7656-4569-aa86-4b2437ab862c","year":2023},"citing_paper":{"arxiv_id":"2502.01739","last_updated":"2025-02-03T19:00:02Z","snapshot_observed_at":"2026-08-09T23:01:29.939584Z","submitted_at":"2025-02-03T19:00:02Z","title":"Grokking vs. Learning: Same Features, Different Encodings","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-09T14:44:27.093969Z"},"links":{"citing_paper":"/paper/2502.01739"},"observation_digest":"sha256:2c030dc8a0d681f2b572d2be696c5477f55d6c47019a89ef52f245ca82894ec2","observation_id":"80e0d3e3-c860-493b-ad00-52b0259d172d","resolution":{"observed_at":"2026-08-09T14:44:27.185150Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19470","last_updated":"2025-05-09T15:21:11Z","snapshot_observed_at":"2026-08-09T11:06:03.688884Z","submitted_at":"2023-10-30T11:58:44Z","title":"Bridging Lottery Ticket and Grokking: Understanding Grokking from Inner Structure of Networks","version":3},"cited_work":{"arxiv_id":"2310.19470","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.19470","snapshot_observed_at":"2026-08-09T14:44:38.048484Z","title":"Bridging Lottery Ticket and Grokking: Understanding Grokking from Inner Structure of Networks","venue":"cs.LG","work_id":"ba927c51-b5df-4a6d-a135-e16706d05d90","year":2023},"citing_paper":{"arxiv_id":"2502.01739","last_updated":"2025-02-03T19:00:02Z","snapshot_observed_at":"2026-08-09T23:01:29.939584Z","submitted_at":"2025-02-03T19:00:02Z","title":"Grokking vs. Learning: Same Features, Different Encodings","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-09T14:44:27.097537Z"},"links":{"cited_paper":"/paper/2310.19470","citing_paper":"/paper/2502.01739"},"observation_digest":"sha256:340f6c9010a7dedae36c3b4ca3aaaeec515926f2347ef6a248ba939177a89db3","observation_id":"98cc9c60-e459-4496-a36b-24e68557aacb","resolution":{"observed_at":"2026-08-09T14:44:38.052275Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12332","last_updated":"2024-07-17T06:15:30Z","snapshot_observed_at":"2026-07-06T18:47:37.971415Z","submitted_at":"2024-07-17T06:15:30Z","title":"Why Do You Grok? A Theoretical Analysis of Grokking Modular Addition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12332","snapshot_observed_at":"2026-08-09T14:44:27.100863Z","title":"Sutherland","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01739","last_updated":"2025-02-03T19:00:02Z","snapshot_observed_at":"2026-08-09T23:01:29.939584Z","submitted_at":"2025-02-03T19:00:02Z","title":"Grokking vs. Learning: Same Features, Different Encodings","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-09T14:44:27.100863Z"},"links":{"cited_paper":"/paper/2407.12332","citing_paper":"/paper/2502.01739"},"observation_digest":"sha256:2e6d6ab099175358a7690d4b510f1ec5388c759cefaac98809e5f252b12b3059","observation_id":"8ed5b963-d3ac-4c86-ba36-fcafb1582e84","resolution":{"observed_at":"2026-08-09T14:44:27.100863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:44:38.183123Z","title":"Progress measures for grokking via mechanistic interpretability, 2023","venue":null,"work_id":"2923b731-9f45-4169-b1a1-a6d884067851","year":2023},"citing_paper":{"arxiv_id":"2502.01739","last_updated":"2025-02-03T19:00:02Z","snapshot_observed_at":"2026-08-09T23:01:29.939584Z","submitted_at":"2025-02-03T19:00:02Z","title":"Grokking vs. Learning: Same Features, Different Encodings","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-09T14:44:27.104026Z"},"links":{"citing_paper":"/paper/2502.01739"},"observation_digest":"sha256:40b574343a88345f0eb64e445557c04c2cbe61d9cabc65e1c201471191d4c3a2","observation_id":"f81046a7-76f7-4619-9f22-e53312cff507","resolution":{"observed_at":"2026-08-09T14:44:38.186498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:44:38.174047Z","title":"devinterp, 2024","venue":null,"work_id":"19f5889f-51fa-4266-814f-fbc6d55cc4ff","year":2024},"citing_paper":{"arxiv_id":"2502.01739","last_updated":"2025-02-03T19:00:02Z","snapshot_observed_at":"2026-08-09T23:01:29.939584Z","submitted_at":"2025-02-03T19:00:02Z","title":"Grokking vs. Learning: Same Features, Different Encodings","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-09T14:44:27.107059Z"},"links":{"citing_paper":"/paper/2502.01739"},"observation_digest":"sha256:5be4704bb19309095a1ed8afd621fec7b7be7eef041035423696cbae61afaae1","observation_id":"6ad329a5-473d-4d5c-9d31-f05d5f9f0d41","resolution":{"observed_at":"2026-08-09T14:44:38.177367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.02177","last_updated":"2022-01-06T18:43:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-01-06T18:43:37Z","title":"Grokking: Generalization Beyond Overfitting on Small Algorithmic Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.02177","snapshot_observed_at":"2026-08-09T14:44:27.110186Z","title":"Grokking: Generalization beyond overfitting on small algorithmic datasets, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01739","last_updated":"2025-02-03T19:00:02Z","snapshot_observed_at":"2026-08-09T23:01:29.939584Z","submitted_at":"2025-02-03T19:00:02Z","title":"Grokking vs. Learning: Same Features, Different Encodings","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-09T14:44:27.110186Z"},"links":{"cited_paper":"/paper/2201.02177","citing_paper":"/paper/2502.01739"},"observation_digest":"sha256:dea2af82965ee7d6e893a9fd98f912834f4834eaec6737af4a1b3183abe6dc07","observation_id":"707cbd67-9815-4b90-bb3c-c4af0e781971","resolution":{"observed_at":"2026-08-09T14:44:27.110186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04697","last_updated":"2025-05-19T11:02:53Z","snapshot_observed_at":"2026-08-05T11:14:36.679405Z","submitted_at":"2025-01-08T18:58:48Z","title":"Grokking at the Edge of Numerical Stability","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04697","snapshot_observed_at":"2026-08-09T14:44:27.113342Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.01739","last_updated":"2025-02-03T19:00:02Z","snapshot_observed_at":"2026-08-09T23:01:29.939584Z","submitted_at":"2025-02-03T19:00:02Z","title":"Grokking vs. Learning: Same Features, Different Encodings","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-09T14:44:27.113342Z"},"links":{"cited_paper":"/paper/2501.04697","citing_paper":"/paper/2502.01739"},"observation_digest":"sha256:2106860eed82ee77897e2ade453c29404da967345a6c9a0479e01c5c4e12cb49","observation_id":"3aefc6f6-17cf-4bfa-8780-c4642a1e5f15","resolution":{"observed_at":"2026-08-09T14:44:27.113342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03789","last_updated":"2024-05-05T12:21:36Z","snapshot_observed_at":"2026-07-06T16:28:26.234851Z","submitted_at":"2023-10-05T18:00:01Z","title":"Grokking as a First Order Phase Transition in Two Layer Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03789","snapshot_observed_at":"2026-08-09T14:44:27.116581Z","title":"Grokking as a first order phase transition in two layer networks, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01739","last_updated":"2025-02-03T19:00:02Z","snapshot_observed_at":"2026-08-09T23:01:29.939584Z","submitted_at":"2025-02-03T19:00:02Z","title":"Grokking vs. Learning: Same Features, Different Encodings","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-09T14:44:27.116581Z"},"links":{"cited_paper":"/paper/2310.03789","citing_paper":"/paper/2502.01739"},"observation_digest":"sha256:26783958bef2fca7c93e5b0a5d41a7cdb6ab06741b1916130c470a9f14f4a6ab","observation_id":"2ad621b7-7223-469f-bd7f-6586de3793a4","resolution":{"observed_at":"2026-08-09T14:44:27.116581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.15383","last_updated":"2022-09-22T21:42:18Z","snapshot_observed_at":"2026-07-06T12:23:45.886707Z","submitted_at":"2021-12-31T10:49:55Z","title":"Separation of Scales and a Thermodynamic Description of Feature Learning in Some CNNs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.15383","snapshot_observed_at":"2026-08-09T14:44:27.119703Z","title":"Separation of scales and a thermodynamic description of feature learning in some cnns, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01739","last_updated":"2025-02-03T19:00:02Z","snapshot_observed_at":"2026-08-09T23:01:29.939584Z","submitted_at":"2025-02-03T19:00:02Z","title":"Grokking vs. Learning: Same Features, Different Encodings","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-09T14:44:27.119703Z"},"links":{"cited_paper":"/paper/2112.15383","citing_paper":"/paper/2502.01739"},"observation_digest":"sha256:4317928a65a11ca3b9ed0ea81404911948bb9f56dedec91267780a291e8353b4","observation_id":"5aa8093d-855e-4c05-9440-9ef54380b552","resolution":{"observed_at":"2026-08-09T14:44:27.119703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1103/physrevb.97.174435","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Parameter diagnostics of phases and phase transition learning by neural networks","venue":"Physical review. B./Physical review. B","work_id":"b5bf756a-eac0-415b-b45f-0617a6f778b4","year":2018},"citing_paper":{"arxiv_id":"2502.01739","last_updated":"2025-02-03T19:00:02Z","snapshot_observed_at":"2026-08-09T23:01:29.939584Z","submitted_at":"2025-02-03T19:00:02Z","title":"Grokking vs. Learning: Same Features, Different Encodings","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-09T14:44:27.126058Z"},"links":{"citing_paper":"/paper/2502.01739"},"observation_digest":"sha256:1b36d35677edd34ef128e683f798f2a181f3d382a6420a2d8cbc18e89f140042","observation_id":"384292c4-68fe-472b-b3b0-0b37da5419d1","resolution":{"observed_at":"2026-08-09T14:44:27.175424Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.06597","last_updated":"2024-02-02T14:03:32Z","snapshot_observed_at":"2026-08-02T19:33:20.317724Z","submitted_at":"2023-11-11T15:45:44Z","title":"Understanding Grokking Through A Robustness Viewpoint","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.06597","snapshot_observed_at":"2026-08-09T14:44:27.129043Z","title":"Understanding grokking through a robustness viewpoint, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01739","last_updated":"2025-02-03T19:00:02Z","snapshot_observed_at":"2026-08-09T23:01:29.939584Z","submitted_at":"2025-02-03T19:00:02Z","title":"Grokking vs. Learning: Same Features, Different Encodings","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-09T14:44:27.129043Z"},"links":{"cited_paper":"/paper/2311.06597","citing_paper":"/paper/2502.01739"},"observation_digest":"sha256:8c47f0d6fb28382fed781f08ec75121c8cedfff84c8fbec1dbeb23e8992d6caa","observation_id":"ee86bfc9-d528-42ac-8681-a754c1b7d4c3","resolution":{"observed_at":"2026-08-09T14:44:27.129043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:44:27.132195Z","title":"Rethinking weight decay for efficient neural network pruning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01739","last_updated":"2025-02-03T19:00:02Z","snapshot_observed_at":"2026-08-09T23:01:29.939584Z","submitted_at":"2025-02-03T19:00:02Z","title":"Grokking vs. Learning: Same Features, Different Encodings","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-09T14:44:27.132195Z"},"links":{"citing_paper":"/paper/2502.01739"},"observation_digest":"sha256:a0bb816092bfce21cb7b26528e29d4b8eeac970a2408e006e1e3cd03b0d9aac5","observation_id":"3313acc1-aee0-40b2-afe4-f0009fa5529a","resolution":{"observed_at":"2026-08-09T14:44:27.132195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04817","last_updated":"2022-06-13T04:18:16Z","snapshot_observed_at":"2026-08-09T23:00:58.211659Z","submitted_at":"2022-06-10T00:04:21Z","title":"The Slingshot Mechanism: An Empirical Study of Adaptive Optimizers and the Grokking Phenomenon","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.04817","snapshot_observed_at":"2026-08-09T14:44:27.135407Z","title":"The slingshot mechanism: An empirical study of adaptive optimizers and the grokking phenomenon, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01739","last_updated":"2025-02-03T19:00:02Z","snapshot_observed_at":"2026-08-09T23:01:29.939584Z","submitted_at":"2025-02-03T19:00:02Z","title":"Grokking vs. Learning: Same Features, Different Encodings","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-09T14:44:27.135407Z"},"links":{"cited_paper":"/paper/2206.04817","citing_paper":"/paper/2502.01739"},"observation_digest":"sha256:6045a63f33c673cd015f1ef31789a004ae530aa55bf91934930968d6a0a2112c","observation_id":"dd48eb36-bbad-44a5-91da-b6bf244dc858","resolution":{"observed_at":"2026-08-09T14:44:27.135407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02390","last_updated":"2023-09-05T17:00:24Z","snapshot_observed_at":"2026-08-02T05:47:38.281400Z","submitted_at":"2023-09-05T17:00:24Z","title":"Explaining grokking through circuit efficiency","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.02390","snapshot_observed_at":"2026-08-09T14:44:27.138533Z","title":"Explaining grokking through circuit efficiency, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01739","last_updated":"2025-02-03T19:00:02Z","snapshot_observed_at":"2026-08-09T23:01:29.939584Z","submitted_at":"2025-02-03T19:00:02Z","title":"Grokking vs. Learning: Same Features, Different Encodings","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-09T14:44:27.138533Z"},"links":{"cited_paper":"/paper/2309.02390","citing_paper":"/paper/2502.01739"},"observation_digest":"sha256:86ecc2171e6985c59aa3f6e96f7bb2ed12756992c4485c8a38a38aa09cb60fbf","observation_id":"627d8cf2-7e78-4a44-a8eb-7d81dff4e459","resolution":{"observed_at":"2026-08-09T14:44:27.138533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01345","last_updated":"2024-12-20T16:18:13Z","snapshot_observed_at":"2026-08-05T22:23:54.517276Z","submitted_at":"2024-06-03T14:08:04Z","title":"BMRS: Bayesian Model Reduction for Structured Pruning","version":2},"cited_work":{"arxiv_id":"2406.01345","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.01345","snapshot_observed_at":"2026-08-09T14:44:37.974742Z","title":"BMRS: Bayesian Model Reduction for Structured Pruning","venue":"cs.LG","work_id":"8864ca68-3eb1-4ec2-8987-cffbeaf0c69c","year":2024},"citing_paper":{"arxiv_id":"2502.01739","last_updated":"2025-02-03T19:00:02Z","snapshot_observed_at":"2026-08-09T23:01:29.939584Z","submitted_at":"2025-02-03T19:00:02Z","title":"Grokking vs. Learning: Same Features, Different Encodings","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-09T14:44:27.141734Z"},"links":{"cited_paper":"/paper/2406.01345","citing_paper":"/paper/2502.01739"},"observation_digest":"sha256:6ab8e8e2076e9ec39270320bebcf2fe1349cff5358b96d1e4b8e8c6bd1560379","observation_id":"30f3e340-f2b9-467b-b6d6-6542c7deccb4","resolution":{"observed_at":"2026-08-09T14:44:37.978524Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.01739","last_updated":"2025-02-03T19:00:02Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T23:01:29.939584Z","submitted_at":"2025-02-03T19:00:02Z","title":"Grokking vs. Learning: Same Features, Different Encodings"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":34,"verified_exact":8,"verified_fuzzy":10},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 0 inbound Pith citation observations for arXiv:2502.01739."}