{"as_of":"2026-08-13T10:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9c1047e64227bd14bbe06b0cc41a6b2be383e0a35aacf3dbe5c8065f75d5911a","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:31:20.550988Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T03:02:05.516512Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.05447","last_updated":"2025-07-14T23:29:38Z","snapshot_observed_at":"2026-08-10T08:55:55.383716Z","submitted_at":"2025-06-05T15:18:35Z","title":"Training Dynamics Underlying Language Model Scaling Laws: Loss Deceleration and Zero-Sum Learning","version":2},"cited_work":{"arxiv_id":"2506.05447","doi":"10.48550/arxiv.2506.05447","metadata_source":"pith","pith_arxiv_id":"2506.05447","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Training Dynamics Underlying Language Model Scaling Laws: Loss Deceleration and Zero-Sum Learning","venue":"cs.LG","work_id":"0e374ff8-1661-4e48-98e4-f4187d058fcb","year":2025},"citing_paper":{"arxiv_id":"2607.25271","last_updated":"2026-07-28T04:18:49Z","snapshot_observed_at":"2026-08-13T02:12:02.677620Z","submitted_at":"2026-07-28T04:18:49Z","title":"Bridging Compute- and Data-Optimal Pretraining","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-01T03:02:05.516512Z"},"links":{"cited_paper":"/paper/2506.05447","citing_paper":"/paper/2607.25271"},"observation_digest":"sha256:f0f493bdc1153d6a1515ae22c0d57e59fab3c80ec07bd387ab5cbfa1d44bdf18","observation_id":"21d0767b-bbd7-44ae-b12e-a8508b3d6055","resolution":{"observed_at":"2026-08-01T03:08:36.328547Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.05447/citation-record","integrity":"/paper/2506.05447/integrity","json":"/paper/2506.05447/citation-record.json","paper":"/paper/2506.05447"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:20.306883Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05447","last_updated":"2025-07-14T23:29:38Z","snapshot_observed_at":"2026-08-10T08:55:55.383716Z","submitted_at":"2025-06-05T15:18:35Z","title":"Training Dynamics Underlying Language Model Scaling Laws: Loss Deceleration and Zero-Sum Learning","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T10:31:20.306883Z"},"links":{"citing_paper":"/paper/2506.05447"},"observation_digest":"sha256:35d3453de6b517dae6b8facf7adaca09299058a3fd8aa4ffc97a8fa8b56fa7ad","observation_id":"a381240c-4449-458e-9476-d0579b6f0a85","resolution":{"observed_at":"2026-08-07T10:31:20.306883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:20.314438Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05447","last_updated":"2025-07-14T23:29:38Z","snapshot_observed_at":"2026-08-10T08:55:55.383716Z","submitted_at":"2025-06-05T15:18:35Z","title":"Training Dynamics Underlying Language Model Scaling Laws: Loss Deceleration and Zero-Sum Learning","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T10:31:20.314438Z"},"links":{"citing_paper":"/paper/2506.05447"},"observation_digest":"sha256:4f0340a79cf88c7f88736162f14731a32b79efb234e37207a06c67eaab4c4a59","observation_id":"673f7902-411a-4e2f-bc9f-3480e903d649","resolution":{"observed_at":"2026-08-07T10:31:20.314438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.09816","last_updated":"2023-02-15T10:01:31Z","snapshot_observed_at":"2026-08-12T21:51:33.390100Z","submitted_at":"2020-12-17T18:34:45Z","title":"Towards Understanding Ensemble, Knowledge Distillation and Self-Distillation in Deep Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.09816","snapshot_observed_at":"2026-08-07T10:31:20.328935Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05447","last_updated":"2025-07-14T23:29:38Z","snapshot_observed_at":"2026-08-10T08:55:55.383716Z","submitted_at":"2025-06-05T15:18:35Z","title":"Training Dynamics Underlying Language Model Scaling Laws: Loss Deceleration and Zero-Sum Learning","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T10:31:20.328935Z"},"links":{"cited_paper":"/paper/2012.09816","citing_paper":"/paper/2506.05447"},"observation_digest":"sha256:d8354aa54281b410e926fd0365828611174ca4d76d39344f1a69e7c605b01c23","observation_id":"187ee80c-5b8b-4d2e-bde7-363c5159e6eb","resolution":{"observed_at":"2026-08-07T10:31:20.328935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:21.348142Z","title":"Atanasov, Jacob A","venue":null,"work_id":"173e6a32-4cad-4d11-b034-7923d86a178d","year":2024},"citing_paper":{"arxiv_id":"2506.05447","last_updated":"2025-07-14T23:29:38Z","snapshot_observed_at":"2026-08-10T08:55:55.383716Z","submitted_at":"2025-06-05T15:18:35Z","title":"Training Dynamics Underlying Language Model Scaling Laws: Loss Deceleration and Zero-Sum Learning","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T10:31:20.335963Z"},"links":{"citing_paper":"/paper/2506.05447"},"observation_digest":"sha256:e92a58a758a18a5306e95896d2c101ca9ba8ac6e8723eb2c829ed596d0fb3519","observation_id":"94b2fce2-c6d0-47c3-86a8-d3e2020a40b2","resolution":{"observed_at":"2026-08-07T10:31:21.353615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:20.341972Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05447","last_updated":"2025-07-14T23:29:38Z","snapshot_observed_at":"2026-08-10T08:55:55.383716Z","submitted_at":"2025-06-05T15:18:35Z","title":"Training Dynamics Underlying Language Model Scaling Laws: Loss Deceleration and Zero-Sum Learning","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T10:31:20.341972Z"},"links":{"citing_paper":"/paper/2506.05447"},"observation_digest":"sha256:f94749f18afd24bd2a68b80ab2a4a5af6c989b1dff32ff4ba9525f1cdea95308","observation_id":"28757c54-f468-4906-b66d-be7fa4b406f8","resolution":{"observed_at":"2026-08-07T10:31:20.341972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:21.328257Z","title":null,"venue":null,"work_id":"38a41fa1-cc28-4aa7-aff6-64da560d021e","year":2024},"citing_paper":{"arxiv_id":"2506.05447","last_updated":"2025-07-14T23:29:38Z","snapshot_observed_at":"2026-08-10T08:55:55.383716Z","submitted_at":"2025-06-05T15:18:35Z","title":"Training Dynamics Underlying Language Model Scaling Laws: Loss Deceleration and Zero-Sum Learning","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T10:31:20.347469Z"},"links":{"citing_paper":"/paper/2506.05447"},"observation_digest":"sha256:145ba042a20288cf39eb2871ead4f9e20b19917f8c45f3bc2f03543828d05869","observation_id":"03619f5c-1633-405e-a256-803fcd2d4e81","resolution":{"observed_at":"2026-08-07T10:31:21.334057Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.14891","last_updated":"2023-07-24T00:05:04Z","snapshot_observed_at":"2026-08-11T15:21:59.648451Z","submitted_at":"2022-10-26T17:45:01Z","title":"Broken Neural Scaling Laws","version":17},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.14891","snapshot_observed_at":"2026-08-07T10:31:20.353468Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05447","last_updated":"2025-07-14T23:29:38Z","snapshot_observed_at":"2026-08-10T08:55:55.383716Z","submitted_at":"2025-06-05T15:18:35Z","title":"Training Dynamics Underlying Language Model Scaling Laws: Loss Deceleration and Zero-Sum Learning","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T10:31:20.353468Z"},"links":{"cited_paper":"/paper/2210.14891","citing_paper":"/paper/2506.05447"},"observation_digest":"sha256:9a74b50d8f95d6f9f2fc16bc2f02cc3d755af2044647e4d0b7a039e3e07cc01f","observation_id":"bfa26d7c-1cd2-4395-9cd4-0e91a68d634d","resolution":{"observed_at":"2026-08-07T10:31:20.353468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00065","last_updated":"2022-11-23T18:09:57Z","snapshot_observed_at":"2026-08-13T04:20:08.395688Z","submitted_at":"2021-02-26T22:08:19Z","title":"Gradient Descent on Neural Networks Typically Occurs at the Edge of Stability","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00065","snapshot_observed_at":"2026-08-07T10:31:20.359142Z","title":"Cohen, Simran Kaur, Yuanzhi Li, J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05447","last_updated":"2025-07-14T23:29:38Z","snapshot_observed_at":"2026-08-10T08:55:55.383716Z","submitted_at":"2025-06-05T15:18:35Z","title":"Training Dynamics Underlying Language Model Scaling Laws: Loss Deceleration and Zero-Sum Learning","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T10:31:20.359142Z"},"links":{"cited_paper":"/paper/2103.00065","citing_paper":"/paper/2506.05447"},"observation_digest":"sha256:dc5f7207b102b5eb27866a9f3db012e078792b2127dd59aaf79dfa903753d88e","observation_id":"6c24d1c1-a387-45a4-ab02-9f5023e092bc","resolution":{"observed_at":"2026-08-07T10:31:20.359142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05872","last_updated":"2024-07-16T17:40:09Z","snapshot_observed_at":"2026-08-12T23:26:49.280247Z","submitted_at":"2024-07-08T12:32:51Z","title":"Scaling Exponents Across Parameterizations and Optimizers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05872","snapshot_observed_at":"2026-08-07T10:31:20.364789Z","title":"Alemi, Roman Novak, Peter J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05447","last_updated":"2025-07-14T23:29:38Z","snapshot_observed_at":"2026-08-10T08:55:55.383716Z","submitted_at":"2025-06-05T15:18:35Z","title":"Training Dynamics Underlying Language Model Scaling Laws: Loss Deceleration and Zero-Sum Learning","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T10:31:20.364789Z"},"links":{"cited_paper":"/paper/2407.05872","citing_paper":"/paper/2506.05447"},"observation_digest":"sha256:801846cbd1b761f8134293c76eb23e161c4b1aa6ca8057879e5971e2a13b3473","observation_id":"f225e47c-d49a-40d2-8c6e-9d2916046295","resolution":{"observed_at":"2026-08-07T10:31:20.364789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00027","last_updated":"2020-12-31T19:00:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-12-31T19:00:10Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00027","snapshot_observed_at":"2026-08-07T10:31:20.370181Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.05447","last_updated":"2025-07-14T23:29:38Z","snapshot_observed_at":"2026-08-10T08:55:55.383716Z","submitted_at":"2025-06-05T15:18:35Z","title":"Training Dynamics Underlying Language Model Scaling Laws: Loss Deceleration and Zero-Sum Learning","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T10:31:20.370181Z"},"links":{"cited_paper":"/paper/2101.00027","citing_paper":"/paper/2506.05447"},"observation_digest":"sha256:58b975d6ca546bb42697e1c82a63e34876988c57b6f5bd53babdab5a4b183eef","observation_id":"ab140c9e-642f-4dae-939a-209b848441b4","resolution":{"observed_at":"2026-08-07T10:31:20.370181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.4324/9781315731544","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":null,"venue":null,"work_id":"c03bddda-e166-40d7-8884-805814d1db8f","year":2017},"citing_paper":{"arxiv_id":"2506.05447","last_updated":"2025-07-14T23:29:38Z","snapshot_observed_at":"2026-08-10T08:55:55.383716Z","submitted_at":"2025-06-05T15:18:35Z","title":"Training Dynamics Underlying Language Model Scaling Laws: Loss Deceleration and Zero-Sum Learning","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T10:31:20.375809Z"},"links":{"citing_paper":"/paper/2506.05447"},"observation_digest":"sha256:7ba9ddc5a3f71a65920c6c20ca9083a7840fd4f4d835f442dc5e04edb9c4aff2","observation_id":"3bb8d72f-b197-4dc5-883b-01621b12d273","resolution":{"observed_at":"2026-08-07T10:31:20.907800Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07647","last_updated":"2024-04-11T11:10:36Z","snapshot_observed_at":"2026-08-13T00:32:47.787332Z","submitted_at":"2024-04-11T11:10:36Z","title":"Why do small language models underperform? Studying Language Model Saturation via the Softmax Bottleneck","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07647","snapshot_observed_at":"2026-08-07T10:31:20.382188Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05447","last_updated":"2025-07-14T23:29:38Z","snapshot_observed_at":"2026-08-10T08:55:55.383716Z","submitted_at":"2025-06-05T15:18:35Z","title":"Training Dynamics Underlying Language Model Scaling Laws: Loss Deceleration and Zero-Sum Learning","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T10:31:20.382188Z"},"links":{"cited_paper":"/paper/2404.07647","citing_paper":"/paper/2506.05447"},"observation_digest":"sha256:7ff0de8d2c11c95ad5c7d5b9638fa6fce45bb8e7c992233b154b1ec926856a23","observation_id":"2988fb8e-629f-48d4-ace9-b76f3659ff9c","resolution":{"observed_at":"2026-08-07T10:31:20.382188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00838","last_updated":"2024-06-07T21:59:52Z","snapshot_observed_at":"2026-07-06T17:23:51.547578Z","submitted_at":"2024-02-01T18:28:55Z","title":"OLMo: Accelerating the Science of Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00838","snapshot_observed_at":"2026-08-07T10:31:20.387856Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05447","last_updated":"2025-07-14T23:29:38Z","snapshot_observed_at":"2026-08-10T08:55:55.383716Z","submitted_at":"2025-06-05T15:18:35Z","title":"Training Dynamics Underlying Language Model Scaling Laws: Loss Deceleration and Zero-Sum Learning","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T10:31:20.387856Z"},"links":{"cited_paper":"/paper/2402.00838","citing_paper":"/paper/2506.05447"},"observation_digest":"sha256:22b740b2b255f95a2a965cd735b930bd022f079b95bd9543e2d3b44556725741","observation_id":"1027a3ea-4290-441e-9d5e-0e74972add43","resolution":{"observed_at":"2026-08-07T10:31:20.387856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:21.303066Z","title":"Rae, and Laurent Sifre","venue":null,"work_id":"bccd7cf5-0be6-405a-bac5-71e093d065a0","year":2022},"citing_paper":{"arxiv_id":"2506.05447","last_updated":"2025-07-14T23:29:38Z","snapshot_observed_at":"2026-08-10T08:55:55.383716Z","submitted_at":"2025-06-05T15:18:35Z","title":"Training Dynamics Underlying Language Model Scaling Laws: Loss Deceleration and Zero-Sum Learning","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T10:31:20.394487Z"},"links":{"citing_paper":"/paper/2506.05447"},"observation_digest":"sha256:0c62e43835a40577f1da93bbf96ceb1244a8f0bd1022d064059e3e0ba7e8ab18","observation_id":"c9652438-c0eb-450e-aaa4-e0fe3a553bd3","resolution":{"observed_at":"2026-08-07T10:31:21.308776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.04074","last_updated":"2021-02-08T09:25:31Z","snapshot_observed_at":"2026-08-09T18:26:21.057081Z","submitted_at":"2021-02-08T09:25:31Z","title":"Learning Curve Theory","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.04074","snapshot_observed_at":"2026-08-07T10:31:20.400174Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.05447","last_updated":"2025-07-14T23:29:38Z","snapshot_observed_at":"2026-08-10T08:55:55.383716Z","submitted_at":"2025-06-05T15:18:35Z","title":"Training Dynamics Underlying Language Model Scaling Laws: Loss Deceleration and Zero-Sum Learning","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T10:31:20.400174Z"},"links":{"cited_paper":"/paper/2102.04074","citing_paper":"/paper/2506.05447"},"observation_digest":"sha256:057feb5f355d95e89b1177b94e42c320da5792467eef592beb3088551e343c7c","observation_id":"7fbdc2cd-c03f-4aed-8ad7-76703561d66d","resolution":{"observed_at":"2026-08-07T10:31:20.400174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:21.282860Z","title":null,"venue":null,"work_id":"4bd6b592-2467-4399-9ea5-87dcb4e27aa2","year":2024},"citing_paper":{"arxiv_id":"2506.05447","last_updated":"2025-07-14T23:29:38Z","snapshot_observed_at":"2026-08-10T08:55:55.383716Z","submitted_at":"2025-06-05T15:18:35Z","title":"Training Dynamics Underlying Language Model Scaling Laws: Loss Deceleration and Zero-Sum Learning","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T10:31:20.406165Z"},"links":{"citing_paper":"/paper/2506.05447"},"observation_digest":"sha256:ec81a5748b837c2d274fd92f52cb6ea915eca854ec529b277c9a1477af351f0a","observation_id":"0e645430-c0ac-4d66-8e53-a2ae77ccffed","resolution":{"observed_at":"2026-08-07T10:31:21.288053Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:21.263616Z","title":null,"venue":null,"work_id":"18d956b9-c8cb-4e02-9d02-07d7e6418830","year":2024},"citing_paper":{"arxiv_id":"2506.05447","last_updated":"2025-07-14T23:29:38Z","snapshot_observed_at":"2026-08-10T08:55:55.383716Z","submitted_at":"2025-06-05T15:18:35Z","title":"Training Dynamics Underlying Language Model Scaling Laws: Loss Deceleration and Zero-Sum Learning","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T10:31:20.411836Z"},"links":{"citing_paper":"/paper/2506.05447"},"observation_digest":"sha256:d38cacd33aa0fcf20b5448a90db2902cccb75f8997f0abf89af7b183aaf2b27c","observation_id":"4de56d0a-b8f0-4b67-ba50-8e5e6a1e5294","resolution":{"observed_at":"2026-08-07T10:31:21.271940Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:20.417724Z","title":null,"venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2506.05447","last_updated":"2025-07-14T23:29:38Z","snapshot_observed_at":"2026-08-10T08:55:55.383716Z","submitted_at":"2025-06-05T15:18:35Z","title":"Training Dynamics Underlying Language Model Scaling Laws: Loss Deceleration and Zero-Sum Learning","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T10:31:20.417724Z"},"links":{"citing_paper":"/paper/2506.05447"},"observation_digest":"sha256:e84cc6824da03b231b8f04609456e51f1c7cdab9e8d310dd17e3ccd6cde26ed1","observation_id":"190826fb-ace0-4549-bb0a-34db1785d24c","resolution":{"observed_at":"2026-08-07T10:31:20.417724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-07T10:31:20.423534Z","title":"Brown, Benjamin Chess, Rewon Child, Scott Gray, Alec Radford, Jeffrey Wu, and Dario Amodei","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.05447","last_updated":"2025-07-14T23:29:38Z","snapshot_observed_at":"2026-08-10T08:55:55.383716Z","submitted_at":"2025-06-05T15:18:35Z","title":"Training Dynamics Underlying Language Model Scaling Laws: Loss Deceleration and Zero-Sum Learning","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T10:31:20.423534Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2506.05447"},"observation_digest":"sha256:7c860d4f71148e62b122add5cca4d98ccc1948c586ed4469cdf5ae8d186e1099","observation_id":"ffb6496d-3839-474e-ad3d-49ff68b8cb74","resolution":{"observed_at":"2026-08-07T10:31:20.423534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:21.246885Z","title":null,"venue":null,"work_id":"02256354-66ee-4773-8271-0d73911c04b1","year":2022},"citing_paper":{"arxiv_id":"2506.05447","last_updated":"2025-07-14T23:29:38Z","snapshot_observed_at":"2026-08-10T08:55:55.383716Z","submitted_at":"2025-06-05T15:18:35Z","title":"Training Dynamics Underlying Language Model Scaling Laws: Loss Deceleration and Zero-Sum Learning","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T10:31:20.428496Z"},"links":{"citing_paper":"/paper/2506.05447"},"observation_digest":"sha256:43be32b96190f557f52da1db34b2fbf06afbd945e58205e5ef836350fd4686ae","observation_id":"811dc1f4-9f45-4c92-b30e-d18d83c128aa","resolution":{"observed_at":"2026-08-07T10:31:21.252089Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:20.433609Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05447","last_updated":"2025-07-14T23:29:38Z","snapshot_observed_at":"2026-08-10T08:55:55.383716Z","submitted_at":"2025-06-05T15:18:35Z","title":"Training Dynamics Underlying Language Model Scaling Laws: Loss Deceleration and Zero-Sum Learning","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T10:31:20.433609Z"},"links":{"citing_paper":"/paper/2506.05447"},"observation_digest":"sha256:d29cc2377d246895b5cf4a64ca2bc2b6e195b5d6b8bc0d5711f39576f8ac042c","observation_id":"cb665d93-206a-4ac8-b17e-ec2bffb28845","resolution":{"observed_at":"2026-08-07T10:31:20.433609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:21.228702Z","title":null,"venue":null,"work_id":"e80be6c0-2935-4075-b805-b4cb16375c2c","year":2021},"citing_paper":{"arxiv_id":"2506.05447","last_updated":"2025-07-14T23:29:38Z","snapshot_observed_at":"2026-08-10T08:55:55.383716Z","submitted_at":"2025-06-05T15:18:35Z","title":"Training Dynamics Underlying Language Model Scaling Laws: Loss Deceleration and Zero-Sum Learning","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T10:31:20.441055Z"},"links":{"citing_paper":"/paper/2506.05447"},"observation_digest":"sha256:7fdc43ab240a8a6ba5ff8de56a7169a15aff9f710250b591650ba481a79faf25","observation_id":"2e8a43a8-a092-47cd-8fa6-5eecde1d9bf7","resolution":{"observed_at":"2026-08-07T10:31:21.235256Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:20.446261Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.05447","last_updated":"2025-07-14T23:29:38Z","snapshot_observed_at":"2026-08-10T08:55:55.383716Z","submitted_at":"2025-06-05T15:18:35Z","title":"Training Dynamics Underlying Language Model Scaling Laws: Loss Deceleration and Zero-Sum Learning","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T10:31:20.446261Z"},"links":{"citing_paper":"/paper/2506.05447"},"observation_digest":"sha256:ebd9cd7beed8b80727b36937542189252c36afba09a3bb1592b96452a6fce90b","observation_id":"8e99f216-4cb2-4585-a3ea-18661cbc1fa2","resolution":{"observed_at":"2026-08-07T10:31:20.446261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10523","last_updated":"2024-12-07T20:22:22Z","snapshot_observed_at":"2026-08-13T05:00:17.735885Z","submitted_at":"2023-12-16T19:12:45Z","title":"Paloma: A Benchmark for Evaluating Language Model Fit","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10523","snapshot_observed_at":"2026-08-07T10:31:20.450742Z","title":"Smith, Kyle Richardson, and Jesse Dodge","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05447","last_updated":"2025-07-14T23:29:38Z","snapshot_observed_at":"2026-08-10T08:55:55.383716Z","submitted_at":"2025-06-05T15:18:35Z","title":"Training Dynamics Underlying Language Model Scaling Laws: Loss Deceleration and Zero-Sum Learning","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T10:31:20.450742Z"},"links":{"cited_paper":"/paper/2312.10523","citing_paper":"/paper/2506.05447"},"observation_digest":"sha256:1c9ba6041501733291b11aba4705cb93e0dc98decb07438ab35595cb0f6c04a0","observation_id":"b5d9cf26-1b55-47ec-b814-6e278a268e92","resolution":{"observed_at":"2026-08-07T10:31:20.450742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.04564","last_updated":"2023-09-08T19:34:05Z","snapshot_observed_at":"2026-08-13T10:17:41.024765Z","submitted_at":"2023-09-08T19:34:05Z","title":"When Less is More: Investigating Data Pruning for Pretraining LLMs at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.04564","snapshot_observed_at":"2026-08-07T10:31:20.455874Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05447","last_updated":"2025-07-14T23:29:38Z","snapshot_observed_at":"2026-08-10T08:55:55.383716Z","submitted_at":"2025-06-05T15:18:35Z","title":"Training Dynamics Underlying Language Model Scaling Laws: Loss Deceleration and Zero-Sum Learning","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T10:31:20.455874Z"},"links":{"cited_paper":"/paper/2309.04564","citing_paper":"/paper/2506.05447"},"observation_digest":"sha256:6f7baed136ab18ab4de33ff934bb050e2ccd145944d0c126820b41834e78002a","observation_id":"64bb2aec-abbc-4d16-aafe-645de5f60d18","resolution":{"observed_at":"2026-08-07T10:31:20.455874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:21.196479Z","title":null,"venue":null,"work_id":"d4d5b378-3978-4296-a83b-11dff4cccab0","year":2023},"citing_paper":{"arxiv_id":"2506.05447","last_updated":"2025-07-14T23:29:38Z","snapshot_observed_at":"2026-08-10T08:55:55.383716Z","submitted_at":"2025-06-05T15:18:35Z","title":"Training Dynamics Underlying Language Model Scaling Laws: Loss Deceleration and Zero-Sum Learning","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T10:31:20.460735Z"},"links":{"citing_paper":"/paper/2506.05447"},"observation_digest":"sha256:1c96664b886c81bc8b44e946d5ceabbb3d5860d34415183bbf7b47563e8a4936","observation_id":"0afb2e2b-3515-4df5-8662-a91f2621106d","resolution":{"observed_at":"2026-08-07T10:31:21.202276Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:21.177085Z","title":null,"venue":null,"work_id":"ce3380ec-a780-45c5-a2e0-ed518d95a2a7","year":2024},"citing_paper":{"arxiv_id":"2506.05447","last_updated":"2025-07-14T23:29:38Z","snapshot_observed_at":"2026-08-10T08:55:55.383716Z","submitted_at":"2025-06-05T15:18:35Z","title":"Training Dynamics Underlying Language Model Scaling Laws: Loss Deceleration and Zero-Sum Learning","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T10:31:20.465412Z"},"links":{"citing_paper":"/paper/2506.05447"},"observation_digest":"sha256:731490d45d7db1b61bef2472a9e1ebb3d3c34897ae0a751d14948e5b1c2699c1","observation_id":"736de624-1040-4b06-a353-90424ceda43e","resolution":{"observed_at":"2026-08-07T10:31:21.182023Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.11895","last_updated":"2022-09-24T00:43:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-09-24T00:43:19Z","title":"In-context Learning and Induction Heads","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.11895","snapshot_observed_at":"2026-08-07T10:31:20.470207Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05447","last_updated":"2025-07-14T23:29:38Z","snapshot_observed_at":"2026-08-10T08:55:55.383716Z","submitted_at":"2025-06-05T15:18:35Z","title":"Training Dynamics Underlying Language Model Scaling Laws: Loss Deceleration and Zero-Sum Learning","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T10:31:20.470207Z"},"links":{"cited_paper":"/paper/2209.11895","citing_paper":"/paper/2506.05447"},"observation_digest":"sha256:32a00449124fe95535ba7d69d90d7005e30178039483f7173ec38a3141c7a096","observation_id":"f894a601-7ebb-4e98-9e4d-ad84dd5733de","resolution":{"observed_at":"2026-08-07T10:31:20.470207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03137","last_updated":"2024-09-27T18:31:02Z","snapshot_observed_at":"2026-08-12T22:51:08.835615Z","submitted_at":"2024-09-05T00:13:16Z","title":"The AdEMAMix Optimizer: Better, Faster, Older","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03137","snapshot_observed_at":"2026-08-07T10:31:20.474636Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05447","last_updated":"2025-07-14T23:29:38Z","snapshot_observed_at":"2026-08-10T08:55:55.383716Z","submitted_at":"2025-06-05T15:18:35Z","title":"Training Dynamics Underlying Language Model Scaling Laws: Loss Deceleration and Zero-Sum Learning","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T10:31:20.474636Z"},"links":{"cited_paper":"/paper/2409.03137","citing_paper":"/paper/2506.05447"},"observation_digest":"sha256:fa3fe2c16557e57a0ebef5672e1b69ebae6ff31530f84470847531daaa8f2987","observation_id":"fb5891ae-b06e-403b-9648-dfb55cf572dd","resolution":{"observed_at":"2026-08-07T10:31:20.474636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:21.161538Z","title":null,"venue":null,"work_id":"6d8b8cd7-0f9b-45ec-967f-4c4dcb00be97","year":2020},"citing_paper":{"arxiv_id":"2506.05447","last_updated":"2025-07-14T23:29:38Z","snapshot_observed_at":"2026-08-10T08:55:55.383716Z","submitted_at":"2025-06-05T15:18:35Z","title":"Training Dynamics Underlying Language Model Scaling Laws: Loss Deceleration and Zero-Sum Learning","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T10:31:20.479519Z"},"links":{"citing_paper":"/paper/2506.05447"},"observation_digest":"sha256:47f105f700e819926b3ef703242e7ab94ef8edec8276aea9dd62f72c16ced6f2","observation_id":"9da32be0-03f4-4c1a-b0d1-cb583aa553db","resolution":{"observed_at":"2026-08-07T10:31:21.166392Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:21.143845Z","title":null,"venue":null,"work_id":"6d86d1a0-3c06-4f0e-9142-06779fda81ae","year":2019},"citing_paper":{"arxiv_id":"2506.05447","last_updated":"2025-07-14T23:29:38Z","snapshot_observed_at":"2026-08-10T08:55:55.383716Z","submitted_at":"2025-06-05T15:18:35Z","title":"Training Dynamics Underlying Language Model Scaling Laws: Loss Deceleration and Zero-Sum Learning","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T10:31:20.484527Z"},"links":{"citing_paper":"/paper/2506.05447"},"observation_digest":"sha256:830d52a3792a22e13580e38def6aa1f1e4ef0c037f820611e4ce11b3159d6b0f","observation_id":"77df1296-b4a4-4f56-962b-3c7e4e1842d9","resolution":{"observed_at":"2026-08-07T10:31:21.149829Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02258","last_updated":"2024-04-02T19:28:11Z","snapshot_observed_at":"2026-07-06T17:54:47.689340Z","submitted_at":"2024-04-02T19:28:11Z","title":"Mixture-of-Depths: Dynamically allocating compute in transformer-based language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02258","snapshot_observed_at":"2026-08-07T10:31:20.490228Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05447","last_updated":"2025-07-14T23:29:38Z","snapshot_observed_at":"2026-08-10T08:55:55.383716Z","submitted_at":"2025-06-05T15:18:35Z","title":"Training Dynamics Underlying Language Model Scaling Laws: Loss Deceleration and Zero-Sum Learning","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T10:31:20.490228Z"},"links":{"cited_paper":"/paper/2404.02258","citing_paper":"/paper/2506.05447"},"observation_digest":"sha256:33a0c524a4a03974ab1278df1131a76d7e36d3df6752a69fff649207d010cd60","observation_id":"07729239-587b-4a1a-ae67-0d987caa8ced","resolution":{"observed_at":"2026-08-07T10:31:20.490228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04163","last_updated":"2023-11-07T17:43:50Z","snapshot_observed_at":"2026-08-13T05:30:25.290720Z","submitted_at":"2023-11-07T17:43:50Z","title":"Outliers with Opposing Signals Have an Outsized Effect on Neural Network Optimization","version":1},"cited_work":{"arxiv_id":"2311.04163","doi":"10.48550/arxiv.2311.04163","metadata_source":"pith","pith_arxiv_id":"2311.04163","snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Outliers with Opposing Signals Have an Outsized Effect on Neural Network Optimization","venue":"cs.LG","work_id":"394c77fb-0488-4322-b478-f1df21a4590a","year":2023},"citing_paper":{"arxiv_id":"2506.05447","last_updated":"2025-07-14T23:29:38Z","snapshot_observed_at":"2026-08-10T08:55:55.383716Z","submitted_at":"2025-06-05T15:18:35Z","title":"Training Dynamics Underlying Language Model Scaling Laws: Loss Deceleration and Zero-Sum Learning","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T10:31:20.496089Z"},"links":{"cited_paper":"/paper/2311.04163","citing_paper":"/paper/2506.05447"},"observation_digest":"sha256:477437a641f9e3fa4182da472fbbfa0ca776671d45f997c7fecad7696edc5e81","observation_id":"3d2cf27f-cac3-4065-9290-b35030a91c69","resolution":{"observed_at":"2026-08-07T10:31:20.681375Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:21.127761Z","title":null,"venue":null,"work_id":"779688ef-9f2d-4ba3-803e-31288414b495","year":2022},"citing_paper":{"arxiv_id":"2506.05447","last_updated":"2025-07-14T23:29:38Z","snapshot_observed_at":"2026-08-10T08:55:55.383716Z","submitted_at":"2025-06-05T15:18:35Z","title":"Training Dynamics Underlying Language Model Scaling Laws: Loss Deceleration and Zero-Sum Learning","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T10:31:20.501651Z"},"links":{"citing_paper":"/paper/2506.05447"},"observation_digest":"sha256:1e1d46a941b90856de257206d281eab3ad3b0597bee4f524de5f2eaf9e25bf40","observation_id":"6162da8a-0c80-4923-bf02-e979cd7c508b","resolution":{"observed_at":"2026-08-07T10:31:21.133494Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:21.111378Z","title":null,"venue":null,"work_id":"d0f134eb-21dd-47f2-9873-297ee4f71dd3","year":2022},"citing_paper":{"arxiv_id":"2506.05447","last_updated":"2025-07-14T23:29:38Z","snapshot_observed_at":"2026-08-10T08:55:55.383716Z","submitted_at":"2025-06-05T15:18:35Z","title":"Training Dynamics Underlying Language Model Scaling Laws: Loss Deceleration and Zero-Sum Learning","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T10:31:20.506125Z"},"links":{"citing_paper":"/paper/2506.05447"},"observation_digest":"sha256:6fb2d15b43c6fcb5f5f455e3a08f6eb7b61cd2cbfda752f8bb4249217d61864e","observation_id":"0acf9fcd-435d-40de-8a1c-bb12889ed4e6","resolution":{"observed_at":"2026-08-07T10:31:21.117029Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:20.511694Z","title":null,"venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.05447","last_updated":"2025-07-14T23:29:38Z","snapshot_observed_at":"2026-08-10T08:55:55.383716Z","submitted_at":"2025-06-05T15:18:35Z","title":"Training Dynamics Underlying Language Model Scaling Laws: Loss Deceleration and Zero-Sum Learning","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T10:31:20.511694Z"},"links":{"citing_paper":"/paper/2506.05447"},"observation_digest":"sha256:1a0577acd8487257fa428ed71aad524223314bbc1f15623a98bed7412b8aaaa3","observation_id":"e74392e0-56ae-4ef1-9ee2-b5fde6cddedc","resolution":{"observed_at":"2026-08-07T10:31:20.511694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-02T16:20:09.773989Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-08-07T10:31:20.516813Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05447","last_updated":"2025-07-14T23:29:38Z","snapshot_observed_at":"2026-08-10T08:55:55.383716Z","submitted_at":"2025-06-05T15:18:35Z","title":"Training Dynamics Underlying Language Model Scaling Laws: Loss Deceleration and Zero-Sum Learning","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T10:31:20.516813Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2506.05447"},"observation_digest":"sha256:6ee534f268759d12d4aa44c1ba008142a4df434c5176604822cd002a5c706ec7","observation_id":"2b8ec33d-d619-4193-a0c7-3afc4d71caad","resolution":{"observed_at":"2026-08-07T10:31:20.516813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11029","last_updated":"2024-10-24T17:56:14Z","snapshot_observed_at":"2026-08-12T23:00:31.580114Z","submitted_at":"2024-08-20T17:30:48Z","title":"Scaling Law with Learning Rate Annealing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11029","snapshot_observed_at":"2026-08-07T10:31:20.522740Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05447","last_updated":"2025-07-14T23:29:38Z","snapshot_observed_at":"2026-08-10T08:55:55.383716Z","submitted_at":"2025-06-05T15:18:35Z","title":"Training Dynamics Underlying Language Model Scaling Laws: Loss Deceleration and Zero-Sum Learning","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T10:31:20.522740Z"},"links":{"cited_paper":"/paper/2408.11029","citing_paper":"/paper/2506.05447"},"observation_digest":"sha256:81a8207d8d8954bb511329d85af7eb0ef2d09c1902ae8ff33319a2f20dacf6d0","observation_id":"8b1f55d0-2325-4943-aadd-c42eb35e4330","resolution":{"observed_at":"2026-08-07T10:31:20.522740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.10948","last_updated":"2022-11-05T13:38:27Z","snapshot_observed_at":"2026-08-08T16:27:25.061433Z","submitted_at":"2021-03-19T17:56:33Z","title":"The Shape of Learning Curves: a Review","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.10948","snapshot_observed_at":"2026-08-07T10:31:20.528055Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05447","last_updated":"2025-07-14T23:29:38Z","snapshot_observed_at":"2026-08-10T08:55:55.383716Z","submitted_at":"2025-06-05T15:18:35Z","title":"Training Dynamics Underlying Language Model Scaling Laws: Loss Deceleration and Zero-Sum Learning","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T10:31:20.528055Z"},"links":{"cited_paper":"/paper/2103.10948","citing_paper":"/paper/2506.05447"},"observation_digest":"sha256:7b20699533a587572bb1cc14ad8f3c05912953a4325d06a731ac0b1c163d579a","observation_id":"0ef2f770-b496-4cd6-ae99-715b7f8e8c68","resolution":{"observed_at":"2026-08-07T10:31:20.528055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05192","last_updated":"2024-12-02T21:54:54Z","snapshot_observed_at":"2026-08-12T22:28:58.573178Z","submitted_at":"2024-10-07T16:49:39Z","title":"Understanding Warmup-Stable-Decay Learning Rates: A River Valley Loss Landscape Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05192","snapshot_observed_at":"2026-08-07T10:31:20.534009Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05447","last_updated":"2025-07-14T23:29:38Z","snapshot_observed_at":"2026-08-10T08:55:55.383716Z","submitted_at":"2025-06-05T15:18:35Z","title":"Training Dynamics Underlying Language Model Scaling Laws: Loss Deceleration and Zero-Sum Learning","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T10:31:20.534009Z"},"links":{"cited_paper":"/paper/2410.05192","citing_paper":"/paper/2506.05447"},"observation_digest":"sha256:5e2406d4142ba2e11ac7a0d0d30054d47317d3800f25fadbe6f9ab30e9921a45","observation_id":"22a06aaa-38ec-4f17-98a5-881b1a0aa397","resolution":{"observed_at":"2026-08-07T10:31:20.534009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.03371","last_updated":"2020-01-10T10:17:08Z","snapshot_observed_at":"2026-08-12T09:37:34.902345Z","submitted_at":"2020-01-10T10:17:08Z","title":"Data-Dependence of Plateau Phenomenon in Learning with Neural Network --- Statistical Mechanical Analysis","version":1},"cited_work":{"arxiv_id":"2001.03371","doi":null,"metadata_source":"pith","pith_arxiv_id":"2001.03371","snapshot_observed_at":"2026-08-07T10:31:21.020961Z","title":"Data-Dependence of Plateau Phenomenon in Learning with Neural Network --- Statistical Mechanical Analysis","venue":"stat.ML","work_id":"1cf7be37-7a61-4671-8e6a-fb1e2fa18949","year":2020},"citing_paper":{"arxiv_id":"2506.05447","last_updated":"2025-07-14T23:29:38Z","snapshot_observed_at":"2026-08-10T08:55:55.383716Z","submitted_at":"2025-06-05T15:18:35Z","title":"Training Dynamics Underlying Language Model Scaling Laws: Loss Deceleration and Zero-Sum Learning","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T10:31:20.539480Z"},"links":{"cited_paper":"/paper/2001.03371","citing_paper":"/paper/2506.05447"},"observation_digest":"sha256:d783f1bf0b07bc50c8cf9a760b23c6c92f86676f0aa1f0a42bbd899a38686e1c","observation_id":"a13dbdef-d570-432a-b52a-5c9b2282293a","resolution":{"observed_at":"2026-08-07T10:31:21.027574Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.12298","last_updated":"2022-08-22T20:24:50Z","snapshot_observed_at":"2026-08-06T15:46:33.397187Z","submitted_at":"2021-09-25T07:10:54Z","title":"Opacus: User-Friendly Differential Privacy Library in PyTorch","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.12298","snapshot_observed_at":"2026-08-07T10:31:20.544798Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.05447","last_updated":"2025-07-14T23:29:38Z","snapshot_observed_at":"2026-08-10T08:55:55.383716Z","submitted_at":"2025-06-05T15:18:35Z","title":"Training Dynamics Underlying Language Model Scaling Laws: Loss Deceleration and Zero-Sum Learning","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T10:31:20.544798Z"},"links":{"cited_paper":"/paper/2109.12298","citing_paper":"/paper/2506.05447"},"observation_digest":"sha256:8802cfb0c8b91854e972ab278de6b51a1ad8e755536fd1359337081ff509b280","observation_id":"380618aa-20e5-4ba1-9f0c-1ad070b497d9","resolution":{"observed_at":"2026-08-07T10:31:20.544798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.06782","last_updated":"2020-12-22T00:35:46Z","snapshot_observed_at":"2026-08-10T13:07:02.974893Z","submitted_at":"2020-01-19T06:33:47Z","title":"Gradient Surgery for Multi-Task Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.06782","snapshot_observed_at":"2026-08-07T10:31:20.550988Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.05447","last_updated":"2025-07-14T23:29:38Z","snapshot_observed_at":"2026-08-10T08:55:55.383716Z","submitted_at":"2025-06-05T15:18:35Z","title":"Training Dynamics Underlying Language Model Scaling Laws: Loss Deceleration and Zero-Sum Learning","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T10:31:20.550988Z"},"links":{"cited_paper":"/paper/2001.06782","citing_paper":"/paper/2506.05447"},"observation_digest":"sha256:0f5d1e9fa657d5e6ed09e170ff402726f5992bfab4258aeabaf14300362ea103","observation_id":"62f9b0f3-c2ac-4530-842f-51ca8ffb82cf","resolution":{"observed_at":"2026-08-07T10:31:20.550988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.05447","last_updated":"2025-07-14T23:29:38Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-10T08:55:55.383716Z","submitted_at":"2025-06-05T15:18:35Z","title":"Training Dynamics Underlying Language Model Scaling Laws: Loss Deceleration and Zero-Sum Learning"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":38,"verified_exact":3,"verified_fuzzy":2},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 1 inbound Pith citation observation for arXiv:2506.05447."}