{"as_of":"2026-08-19T15:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4cfdc6b8cf83645ceaf41715bcf8aaae7dbde0880da17a4eaa4e24b24ee9e31f","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":23,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T01:03:53.041974Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":1,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2407.05872","last_updated":"2024-07-16T17:40:09Z","snapshot_observed_at":"2026-08-16T13:36:11.410804Z","submitted_at":"2024-07-08T12:32:51Z","title":"Scaling Exponents Across Parameterizations and Optimizers","version":2},"cited_work":{"arxiv_id":"2407.05872","doi":"10.48550/arxiv.2407.05872","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.05872","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Everett, L","venue":"arXiv (Cornell University)","work_id":"9a97efa5-3eee-41c8-9936-aa1cf0da2450","year":2024},"citing_paper":{"arxiv_id":"2501.07237","last_updated":"2026-04-27T13:03:55Z","snapshot_observed_at":"2026-08-17T10:50:12.904968Z","submitted_at":"2025-01-13T11:35:09Z","title":"GWT: Scalable Optimizer State Compression for Large Language Model Training","version":5},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-23T05:57:09.276224Z"},"links":{"cited_paper":"/paper/2407.05872","citing_paper":"/paper/2501.07237"},"observation_digest":"sha256:f758a1b0650a1b65084e23e02dc7274e536ba89ddc827bb2979961f010898769","observation_id":"28c08736-595d-4735-9602-dae2f7e9964a","resolution":{"observed_at":"2026-05-23T05:57:36.655891Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05872","last_updated":"2024-07-16T17:40:09Z","snapshot_observed_at":"2026-08-16T13:36:11.410804Z","submitted_at":"2024-07-08T12:32:51Z","title":"Scaling Exponents Across Parameterizations and Optimizers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05872","snapshot_observed_at":"2026-08-09T12:21:20.377243Z","title":"Everett, L","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02407","last_updated":"2025-02-04T15:25:47Z","snapshot_observed_at":"2026-08-09T16:18:00.285516Z","submitted_at":"2025-02-04T15:25:47Z","title":"Avoiding spurious sharpness minimization broadens applicability of SAM","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-09T12:21:20.377243Z"},"links":{"cited_paper":"/paper/2407.05872","citing_paper":"/paper/2502.02407"},"observation_digest":"sha256:fbf22e53da27a715e938fde6600301e4d1629ce26b70aa894e4b9e950acc5a69","observation_id":"b70c9695-3fb7-44af-abc1-b35ac67cf3bb","resolution":{"observed_at":"2026-08-09T12:21:20.377243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05872","last_updated":"2024-07-16T17:40:09Z","snapshot_observed_at":"2026-08-16T13:36:11.410804Z","submitted_at":"2024-07-08T12:32:51Z","title":"Scaling Exponents Across Parameterizations and Optimizers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05872","snapshot_observed_at":"2026-08-09T11:54:36.874008Z","title":"A., Novak, R., Liu, P","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02531","last_updated":"2025-06-16T12:52:01Z","snapshot_observed_at":"2026-08-14T08:02:32.970133Z","submitted_at":"2025-02-04T17:50:55Z","title":"Deep Linear Network Training Dynamics from Random Initialization: Data, Width, Depth, and Hyperparameter Transfer","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-09T11:54:36.874008Z"},"links":{"cited_paper":"/paper/2407.05872","citing_paper":"/paper/2502.02531"},"observation_digest":"sha256:57d047d4908bf83583a157da7d01e4855c783f2ea10c00ed7c717df56c0af46c","observation_id":"a7e52749-50eb-49f8-8199-6388b3bf013b","resolution":{"observed_at":"2026-08-09T11:54:36.874008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05872","last_updated":"2024-07-16T17:40:09Z","snapshot_observed_at":"2026-08-16T13:36:11.410804Z","submitted_at":"2024-07-08T12:32:51Z","title":"Scaling Exponents Across Parameterizations and Optimizers","version":2},"cited_work":{"arxiv_id":"2407.05872","doi":"10.48550/arxiv.2407.05872","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.05872","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Everett, L","venue":"arXiv (Cornell University)","work_id":"9a97efa5-3eee-41c8-9936-aa1cf0da2450","year":2024},"citing_paper":{"arxiv_id":"2502.05074","last_updated":"2025-11-10T21:45:46Z","snapshot_observed_at":"2026-08-13T12:47:06.661412Z","submitted_at":"2025-02-07T16:45:40Z","title":"Two-Point Deterministic Equivalence for Stochastic Gradient Dynamics in Linear Models","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-23T04:16:04.110552Z"},"links":{"cited_paper":"/paper/2407.05872","citing_paper":"/paper/2502.05074"},"observation_digest":"sha256:976605c659e1d39c0c4e34c793d68d6f5356615906cdde4049ecc707ff3f4f6a","observation_id":"54ecae26-47be-45b3-96f0-58a71145a502","resolution":{"observed_at":"2026-05-23T04:17:30.972203Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05872","last_updated":"2024-07-16T17:40:09Z","snapshot_observed_at":"2026-08-16T13:36:11.410804Z","submitted_at":"2024-07-08T12:32:51Z","title":"Scaling Exponents Across Parameterizations and Optimizers","version":2},"cited_work":{"arxiv_id":"2407.05872","doi":"10.48550/arxiv.2407.05872","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.05872","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Everett, L","venue":"arXiv (Cornell University)","work_id":"9a97efa5-3eee-41c8-9936-aa1cf0da2450","year":2024},"citing_paper":{"arxiv_id":"2502.05171","last_updated":"2025-02-17T17:14:04Z","snapshot_observed_at":"2026-08-15T00:53:48.099058Z","submitted_at":"2025-02-07T18:55:02Z","title":"Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-05-12T15:39:40.845703Z"},"links":{"cited_paper":"/paper/2407.05872","citing_paper":"/paper/2502.05171"},"observation_digest":"sha256:4519fbeae106fbd228c8a1b49ab974ac03045beccbb1b26e4ff9462a212e8f73","observation_id":"2d965bc0-1928-4efa-a0e7-9ba8e7c6afd4","resolution":{"observed_at":"2026-05-12T15:39:41.136195Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05872","last_updated":"2024-07-16T17:40:09Z","snapshot_observed_at":"2026-08-16T13:36:11.410804Z","submitted_at":"2024-07-08T12:32:51Z","title":"Scaling Exponents Across Parameterizations and Optimizers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05872","snapshot_observed_at":"2026-08-16T01:03:53.041974Z","title":"A., Novak, R., Liu, P","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02222","last_updated":"2025-05-20T01:04:35Z","snapshot_observed_at":"2026-08-17T11:38:13.930266Z","submitted_at":"2025-05-04T19:14:43Z","title":"Practical Efficiency of Muon for Pretraining","version":4},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-16T01:03:53.041974Z"},"links":{"cited_paper":"/paper/2407.05872","citing_paper":"/paper/2505.02222"},"observation_digest":"sha256:13a1fd9f0452371bb1b2a6513ae7936d359a0832f97b82f1e7cd531ffc1d820e","observation_id":"1936ef49-33e9-404f-ae58-372b5fffb8ac","resolution":{"observed_at":"2026-08-16T01:03:53.041974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05872","last_updated":"2024-07-16T17:40:09Z","snapshot_observed_at":"2026-08-16T13:36:11.410804Z","submitted_at":"2024-07-08T12:32:51Z","title":"Scaling Exponents Across Parameterizations and Optimizers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05872","snapshot_observed_at":"2026-08-07T10:31:20.364789Z","title":"Alemi, Roman Novak, Peter J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05447","last_updated":"2025-07-14T23:29:38Z","snapshot_observed_at":"2026-08-18T01:42:19.840722Z","submitted_at":"2025-06-05T15:18:35Z","title":"Training Dynamics Underlying Language Model Scaling Laws: Loss Deceleration and Zero-Sum Learning","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T10:31:20.364789Z"},"links":{"cited_paper":"/paper/2407.05872","citing_paper":"/paper/2506.05447"},"observation_digest":"sha256:fd8440c2eae0d36e08534eaf4b2985f774fe2a63a685cb50ce0a805fee3c707c","observation_id":"f225e47c-d49a-40d2-8c6e-9d2916046295","resolution":{"observed_at":"2026-08-07T10:31:20.364789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05872","last_updated":"2024-07-16T17:40:09Z","snapshot_observed_at":"2026-08-16T13:36:11.410804Z","submitted_at":"2024-07-08T12:32:51Z","title":"Scaling Exponents Across Parameterizations and Optimizers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05872","snapshot_observed_at":"2026-08-15T19:54:42.469149Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.15025","last_updated":"2025-06-17T23:57:30Z","snapshot_observed_at":"2026-08-18T09:46:27.882306Z","submitted_at":"2025-06-17T23:57:30Z","title":"Optimal Embedding Learning Rate in LLMs: The Effect of Vocabulary Size","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-15T19:54:42.469149Z"},"links":{"cited_paper":"/paper/2407.05872","citing_paper":"/paper/2506.15025"},"observation_digest":"sha256:8ba73b0d704b0df5c84cdc83950fe5b40a267d9e16a1c2df63233f16e86766b1","observation_id":"3c8dd48f-a720-4c59-839c-43c18097175c","resolution":{"observed_at":"2026-08-15T19:54:42.469149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05872","last_updated":"2024-07-16T17:40:09Z","snapshot_observed_at":"2026-08-16T13:36:11.410804Z","submitted_at":"2024-07-08T12:32:51Z","title":"Scaling Exponents Across Parameterizations and Optimizers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05872","snapshot_observed_at":"2026-08-06T20:48:50.834417Z","title":"A., Novak, R., Liu, P","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-12T09:35:03.190861Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:50.834417Z"},"links":{"cited_paper":"/paper/2407.05872","citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:a56604014bcc38169bf83fcad2265d24877b9587510d99218096e5f6421b10a4","observation_id":"0231a66f-5898-4deb-a78f-3976de64ab0d","resolution":{"observed_at":"2026-08-06T20:48:50.834417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05872","last_updated":"2024-07-16T17:40:09Z","snapshot_observed_at":"2026-08-16T13:36:11.410804Z","submitted_at":"2024-07-08T12:32:51Z","title":"Scaling Exponents Across Parameterizations and Optimizers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05872","snapshot_observed_at":"2026-08-06T20:14:11.824040Z","title":"Alemi, Roman Novak, Peter J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03526","last_updated":"2025-07-04T12:23:45Z","snapshot_observed_at":"2026-08-17T13:58:09.232306Z","submitted_at":"2025-07-04T12:23:45Z","title":"Decoupled Relative Learning Rate Schedules","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T20:14:11.824040Z"},"links":{"cited_paper":"/paper/2407.05872","citing_paper":"/paper/2507.03526"},"observation_digest":"sha256:fdddba1fbdc6f1341a2ec7a9e6ee13d3f3e3a9fc6fffcb23927a0837554db406","observation_id":"e0385b0d-7ebe-4c00-8d84-3431dec3bbdc","resolution":{"observed_at":"2026-08-06T20:14:11.824040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05872","last_updated":"2024-07-16T17:40:09Z","snapshot_observed_at":"2026-08-16T13:36:11.410804Z","submitted_at":"2024-07-08T12:32:51Z","title":"Scaling Exponents Across Parameterizations and Optimizers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05872","snapshot_observed_at":"2026-08-06T14:17:37.081920Z","title":"Alemi, Roman Novak, Peter J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19680","last_updated":"2025-07-25T21:19:37Z","snapshot_observed_at":"2026-08-16T06:57:12.804004Z","submitted_at":"2025-07-25T21:19:37Z","title":"Feature learning is decoupled from generalization in high capacity neural networks","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T14:17:37.081920Z"},"links":{"cited_paper":"/paper/2407.05872","citing_paper":"/paper/2507.19680"},"observation_digest":"sha256:8f6e60d2b5620b0cc158e40159bbbd7b559125e91744ed2b6d28d3560e4a480f","observation_id":"1af5ec08-b7dd-43b3-acae-d35d9369cca7","resolution":{"observed_at":"2026-08-06T14:17:37.081920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05872","last_updated":"2024-07-16T17:40:09Z","snapshot_observed_at":"2026-08-16T13:36:11.410804Z","submitted_at":"2024-07-08T12:32:51Z","title":"Scaling Exponents Across Parameterizations and Optimizers","version":2},"cited_work":{"arxiv_id":"2407.05872","doi":"10.48550/arxiv.2407.05872","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.05872","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Everett, L","venue":"arXiv (Cornell University)","work_id":"9a97efa5-3eee-41c8-9936-aa1cf0da2450","year":2024},"citing_paper":{"arxiv_id":"2602.04774","last_updated":"2026-05-08T16:24:57Z","snapshot_observed_at":"2026-08-15T04:58:48.280086Z","submitted_at":"2026-02-04T17:11:36Z","title":"Theory of Optimal Learning Rate Schedules and Scaling Laws for a Random Feature Model","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-16T06:58:38.927268Z"},"links":{"cited_paper":"/paper/2407.05872","citing_paper":"/paper/2602.04774"},"observation_digest":"sha256:cc9e3e0c4bc025ef45fcaa2116991bd504fda431037f429d92a43443a9328e6b","observation_id":"f93461aa-05fe-4da9-adf6-69f66ffbcde1","resolution":{"observed_at":"2026-05-16T07:00:43.299777Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05872","last_updated":"2024-07-16T17:40:09Z","snapshot_observed_at":"2026-08-16T13:36:11.410804Z","submitted_at":"2024-07-08T12:32:51Z","title":"Scaling Exponents Across Parameterizations and Optimizers","version":2},"cited_work":{"arxiv_id":"2407.05872","doi":"10.48550/arxiv.2407.05872","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.05872","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Everett, L","venue":"arXiv (Cornell University)","work_id":"9a97efa5-3eee-41c8-9936-aa1cf0da2450","year":2024},"citing_paper":{"arxiv_id":"2604.12946","last_updated":"2026-04-14T16:43:37Z","snapshot_observed_at":"2026-08-13T05:55:36.135070Z","submitted_at":"2026-04-14T16:43:37Z","title":"Parcae: Scaling Laws For Stable Looped Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T15:33:04.442462Z"},"links":{"cited_paper":"/paper/2407.05872","citing_paper":"/paper/2604.12946"},"observation_digest":"sha256:fb232fc331571edbf1a664cd57ce4b4ff0069932443d16472e44df6910e8601f","observation_id":"9102af60-12fc-4a52-b523-61953e1188a0","resolution":{"observed_at":"2026-05-11T10:21:01.021466Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05872","last_updated":"2024-07-16T17:40:09Z","snapshot_observed_at":"2026-08-16T13:36:11.410804Z","submitted_at":"2024-07-08T12:32:51Z","title":"Scaling Exponents Across Parameterizations and Optimizers","version":2},"cited_work":{"arxiv_id":"2407.05872","doi":"10.48550/arxiv.2407.05872","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.05872","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Everett, L","venue":"arXiv (Cornell University)","work_id":"9a97efa5-3eee-41c8-9936-aa1cf0da2450","year":2024},"citing_paper":{"arxiv_id":"2604.13521","last_updated":"2026-04-15T06:10:12Z","snapshot_observed_at":"2026-08-17T05:34:17.532036Z","submitted_at":"2026-04-15T06:10:12Z","title":"C-voting: Confidence-Based Test-Time Voting without Explicit Energy Functions","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T13:02:52.920735Z"},"links":{"cited_paper":"/paper/2407.05872","citing_paper":"/paper/2604.13521"},"observation_digest":"sha256:838edcaf507b60276bfb95dff4e80ccf2a927aad66c777551d89d9dcce76273d","observation_id":"a223976d-c983-44ac-85da-6472e97be7d7","resolution":{"observed_at":"2026-05-10T13:05:24.996003Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05872","last_updated":"2024-07-16T17:40:09Z","snapshot_observed_at":"2026-08-16T13:36:11.410804Z","submitted_at":"2024-07-08T12:32:51Z","title":"Scaling Exponents Across Parameterizations and Optimizers","version":2},"cited_work":{"arxiv_id":"2407.05872","doi":"10.48550/arxiv.2407.05872","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.05872","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Everett, L","venue":"arXiv (Cornell University)","work_id":"9a97efa5-3eee-41c8-9936-aa1cf0da2450","year":2024},"citing_paper":{"arxiv_id":"2604.27077","last_updated":"2026-05-01T03:33:05Z","snapshot_observed_at":"2026-08-16T15:21:56.439164Z","submitted_at":"2026-04-29T18:11:42Z","title":"Learning Rate Transfer in Normalized Transformers","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-07T09:01:45.365126Z"},"links":{"cited_paper":"/paper/2407.05872","citing_paper":"/paper/2604.27077"},"observation_digest":"sha256:e622cb27cae613715553b73cf8afc8951c4b7322f94484cd88d8a8967e4a9558","observation_id":"805efe36-d7e0-4353-96ba-7b0aba39edc1","resolution":{"observed_at":"2026-05-12T09:51:28.083967Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05872","last_updated":"2024-07-16T17:40:09Z","snapshot_observed_at":"2026-08-16T13:36:11.410804Z","submitted_at":"2024-07-08T12:32:51Z","title":"Scaling Exponents Across Parameterizations and Optimizers","version":2},"cited_work":{"arxiv_id":"2407.05872","doi":"10.48550/arxiv.2407.05872","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.05872","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Everett, L","venue":"arXiv (Cornell University)","work_id":"9a97efa5-3eee-41c8-9936-aa1cf0da2450","year":2024},"citing_paper":{"arxiv_id":"2605.11170","last_updated":"2026-06-02T13:57:02Z","snapshot_observed_at":"2026-08-02T02:13:17.912919Z","submitted_at":"2026-05-11T19:28:33Z","title":"Unlearning with Asymmetric Sources: Improved Unlearning-Utility Trade-off with Public Data","version":1},"reference_index":141,"source":"arxiv_source","source_observed_at":"2026-05-13T05:56:38.042978Z"},"links":{"cited_paper":"/paper/2407.05872","citing_paper":"/paper/2605.11170"},"observation_digest":"sha256:dfd88b80af76b5f9e3cd52ff70cb2f4a784272ba2a85a863555bfc5c064719a8","observation_id":"2e55164d-4c29-441a-a4e6-ec14cbc6e6b6","resolution":{"observed_at":"2026-05-13T05:57:21.512477Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05872","last_updated":"2024-07-16T17:40:09Z","snapshot_observed_at":"2026-08-16T13:36:11.410804Z","submitted_at":"2024-07-08T12:32:51Z","title":"Scaling Exponents Across Parameterizations and Optimizers","version":2},"cited_work":{"arxiv_id":"2407.05872","doi":"10.48550/arxiv.2407.05872","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.05872","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Everett, L","venue":"arXiv (Cornell University)","work_id":"9a97efa5-3eee-41c8-9936-aa1cf0da2450","year":2024},"citing_paper":{"arxiv_id":"2605.14200","last_updated":"2026-05-13T23:32:00Z","snapshot_observed_at":"2026-07-06T23:25:39.415637Z","submitted_at":"2026-05-13T23:32:00Z","title":"How to Scale Mixture-of-Experts: From muP to the Maximally Scale-Stable Parameterization","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-05-15T04:45:20.091598Z"},"links":{"cited_paper":"/paper/2407.05872","citing_paper":"/paper/2605.14200"},"observation_digest":"sha256:3b488e6d087c6e840b04778bad754b1544df66b28f299c86d4b78cb49bfb37ee","observation_id":"d85931f2-99b1-4294-9198-7a845be45fa1","resolution":{"observed_at":"2026-05-15T04:49:44.837389Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05872","last_updated":"2024-07-16T17:40:09Z","snapshot_observed_at":"2026-08-16T13:36:11.410804Z","submitted_at":"2024-07-08T12:32:51Z","title":"Scaling Exponents Across Parameterizations and Optimizers","version":2},"cited_work":{"arxiv_id":"2407.05872","doi":"10.48550/arxiv.2407.05872","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.05872","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Everett, L","venue":"arXiv (Cornell University)","work_id":"9a97efa5-3eee-41c8-9936-aa1cf0da2450","year":2024},"citing_paper":{"arxiv_id":"2605.15290","last_updated":"2026-05-14T18:03:16Z","snapshot_observed_at":"2026-08-17T06:45:36.789466Z","submitted_at":"2026-05-14T18:03:16Z","title":"GQA-{\\mu}P: The maximal parameterization update for grouped query attention","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-19T16:35:40.231293Z"},"links":{"cited_paper":"/paper/2407.05872","citing_paper":"/paper/2605.15290"},"observation_digest":"sha256:d0964c4621af5b3f6836cdff39fc4d19b93089060d5dbb4f7f386a9314b38a8d","observation_id":"fa8b0839-ae38-430c-8d99-827db6b9e8fc","resolution":{"observed_at":"2026-05-19T16:37:39.842088Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05872","last_updated":"2024-07-16T17:40:09Z","snapshot_observed_at":"2026-08-16T13:36:11.410804Z","submitted_at":"2024-07-08T12:32:51Z","title":"Scaling Exponents Across Parameterizations and Optimizers","version":2},"cited_work":{"arxiv_id":"2407.05872","doi":"10.48550/arxiv.2407.05872","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.05872","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Everett, L","venue":"arXiv (Cornell University)","work_id":"9a97efa5-3eee-41c8-9936-aa1cf0da2450","year":2024},"citing_paper":{"arxiv_id":"2606.20299","last_updated":"2026-07-01T14:03:37Z","snapshot_observed_at":"2026-08-15T21:10:11.569207Z","submitted_at":"2026-06-18T14:35:53Z","title":"Statistical Properties of Training & Generalization","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-06-26T15:35:51.654392Z"},"links":{"cited_paper":"/paper/2407.05872","citing_paper":"/paper/2606.20299"},"observation_digest":"sha256:899c9eed163aeb5aab918d462b673dc52a008c920f9a7cf07b6fa0af2d535c21","observation_id":"08b3d673-2af3-4b48-a3b2-09dd84cd135e","resolution":{"observed_at":"2026-06-26T15:39:33.195350Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05872","last_updated":"2024-07-16T17:40:09Z","snapshot_observed_at":"2026-08-16T13:36:11.410804Z","submitted_at":"2024-07-08T12:32:51Z","title":"Scaling Exponents Across Parameterizations and Optimizers","version":2},"cited_work":{"arxiv_id":"2407.05872","doi":"10.48550/arxiv.2407.05872","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.05872","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Everett, L","venue":"arXiv (Cornell University)","work_id":"9a97efa5-3eee-41c8-9936-aa1cf0da2450","year":2024},"citing_paper":{"arxiv_id":"2606.20299","last_updated":"2026-07-01T14:03:37Z","snapshot_observed_at":"2026-08-15T21:10:11.569207Z","submitted_at":"2026-06-18T14:35:53Z","title":"Statistical Properties of Training & Generalization","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-07-02T21:51:13.457071Z"},"links":{"cited_paper":"/paper/2407.05872","citing_paper":"/paper/2606.20299"},"observation_digest":"sha256:171d3de1ba6370246d474e0c32fe7559431a642b4a32802969db1d32412386bd","observation_id":"d0848018-1c61-4497-a063-900a48ac9109","resolution":{"observed_at":"2026-07-02T21:57:25.317838Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05872","last_updated":"2024-07-16T17:40:09Z","snapshot_observed_at":"2026-08-16T13:36:11.410804Z","submitted_at":"2024-07-08T12:32:51Z","title":"Scaling Exponents Across Parameterizations and Optimizers","version":2},"cited_work":{"arxiv_id":"2407.05872","doi":"10.48550/arxiv.2407.05872","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.05872","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Everett, L","venue":"arXiv (Cornell University)","work_id":"9a97efa5-3eee-41c8-9936-aa1cf0da2450","year":2024},"citing_paper":{"arxiv_id":"2606.25971","last_updated":"2026-07-17T13:42:08Z","snapshot_observed_at":"2026-08-02T10:13:56.529128Z","submitted_at":"2026-06-24T15:40:26Z","title":"Improving Neural Network Training by Decoupling the Magnitude and Direction of Weight Vectors","version":1},"reference_index":168,"source":"arxiv_source","source_observed_at":"2026-06-25T20:05:09.179627Z"},"links":{"cited_paper":"/paper/2407.05872","citing_paper":"/paper/2606.25971"},"observation_digest":"sha256:f46e0c6a4cd5ae1d6bd121488ace39a4c7f84eb63d1e1dfd0ef74866505e0f08","observation_id":"38c7f7b7-d4c8-4b42-8683-bb38aed6a0d7","resolution":{"observed_at":"2026-07-04T20:30:07.676652Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05872","last_updated":"2024-07-16T17:40:09Z","snapshot_observed_at":"2026-08-16T13:36:11.410804Z","submitted_at":"2024-07-08T12:32:51Z","title":"Scaling Exponents Across Parameterizations and Optimizers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05872","snapshot_observed_at":"2026-08-02T10:14:06.198299Z","title":"Alemi, Roman Novak, Peter J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.25971","last_updated":"2026-07-17T13:42:08Z","snapshot_observed_at":"2026-08-02T10:13:56.529128Z","submitted_at":"2026-06-24T15:40:26Z","title":"Improving Neural Network Training by Decoupling the Magnitude and Direction of Weight Vectors","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-02T10:14:06.198299Z"},"links":{"cited_paper":"/paper/2407.05872","citing_paper":"/paper/2606.25971"},"observation_digest":"sha256:422f34f09ee5a1fb81e5320cad6c4d4433062e381c68cc381a0dfbe0b8341b86","observation_id":"44235205-ee6f-4780-be28-54aab9ef7635","resolution":{"observed_at":"2026-08-02T10:14:06.198299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05872","last_updated":"2024-07-16T17:40:09Z","snapshot_observed_at":"2026-08-16T13:36:11.410804Z","submitted_at":"2024-07-08T12:32:51Z","title":"Scaling Exponents Across Parameterizations and Optimizers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05872","snapshot_observed_at":"2026-08-02T06:45:17.238514Z","title":"Scaling exponents across parameterizations and optimizers.arXiv preprint arXiv:2407.05872, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20548","last_updated":"2026-07-13T21:47:08Z","snapshot_observed_at":"2026-08-13T09:57:37.734844Z","submitted_at":"2026-07-13T21:47:08Z","title":"SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-02T06:45:17.238514Z"},"links":{"cited_paper":"/paper/2407.05872","citing_paper":"/paper/2607.20548"},"observation_digest":"sha256:caf6212f8cb392132cf1227b6e8b4a2b957a83215bc5b456fe974dfdaec18408","observation_id":"0ca474ff-08db-4668-8d38-4b65e51d4f23","resolution":{"observed_at":"2026-08-02T06:45:17.238514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2407.05872/citation-record","integrity":"/paper/2407.05872/integrity","json":"/paper/2407.05872/citation-record.json","paper":"/paper/2407.05872"},"outbound":[],"paper":{"arxiv_id":"2407.05872","last_updated":"2024-07-16T17:40:09Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T13:36:11.410804Z","submitted_at":"2024-07-08T12:32:51Z","title":"Scaling Exponents Across Parameterizations and Optimizers"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 23 inbound Pith citation observations for arXiv:2407.05872."}