{"as_of":"2026-08-14T03:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bca2281090f1b745b3321a1fded947aa9682e767df5e50c10ed258f6ac680b72","coverage":[{"denominator":48,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T17:01:36.218426Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T22:30:58.664303Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-12T20:13:07.221870Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"cited_work":{"arxiv_id":"2502.06042","doi":"10.48550/arxiv.2502.06042","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.06042","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2502.06042 , year=","venue":"ArXiv.org","work_id":"9617c4ed-1474-439a-9d08-e0612fa954ae","year":2025},"citing_paper":{"arxiv_id":"2605.00195","last_updated":"2026-05-11T12:48:16Z","snapshot_observed_at":"2026-07-31T18:51:54.041588Z","submitted_at":"2026-04-30T20:20:59Z","title":"Diversity in Large Language Models under Supervised Fine-Tuning","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-05-09T20:32:37.788283Z"},"links":{"cited_paper":"/paper/2502.06042","citing_paper":"/paper/2605.00195"},"observation_digest":"sha256:d96bd750a1b4bc4fd45a6a6bcad2f9b3896c3a79e5cd4fd902adcc562b64d5dc","observation_id":"6a545c2e-3c8f-4a92-9ebf-6f75cc838343","resolution":{"observed_at":"2026-05-09T20:37:32.124103Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-12T20:13:07.221870Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"cited_work":{"arxiv_id":"2502.06042","doi":"10.48550/arxiv.2502.06042","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.06042","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2502.06042 , year=","venue":"ArXiv.org","work_id":"9617c4ed-1474-439a-9d08-e0612fa954ae","year":2025},"citing_paper":{"arxiv_id":"2605.00195","last_updated":"2026-05-11T12:48:16Z","snapshot_observed_at":"2026-07-31T18:51:54.041588Z","submitted_at":"2026-04-30T20:20:59Z","title":"Diversity in Large Language Models under Supervised Fine-Tuning","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-05-12T03:10:22.314719Z"},"links":{"cited_paper":"/paper/2502.06042","citing_paper":"/paper/2605.00195"},"observation_digest":"sha256:f2496091fa653109740c13e1b6a73f962ad8e7751bb0b8de076a956d6ca469d2","observation_id":"978121c7-1d7d-4fd1-beeb-272e51c1da1b","resolution":{"observed_at":"2026-05-12T03:11:18.148664Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-12T20:13:07.221870Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"cited_work":{"arxiv_id":"2502.06042","doi":"10.48550/arxiv.2502.06042","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.06042","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2502.06042 , year=","venue":"ArXiv.org","work_id":"9617c4ed-1474-439a-9d08-e0612fa954ae","year":2025},"citing_paper":{"arxiv_id":"2605.12705","last_updated":"2026-08-09T17:20:04Z","snapshot_observed_at":"2026-08-13T23:28:04.404751Z","submitted_at":"2026-05-12T20:08:00Z","title":"Early Data Exposure Improves Robustness to Subsequent Fine-Tuning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-14T20:45:27.673290Z"},"links":{"cited_paper":"/paper/2502.06042","citing_paper":"/paper/2605.12705"},"observation_digest":"sha256:ad8ef56ab271d9fee06a939cbaeb08eb77260c22ca9405e098e983a5dbc06804","observation_id":"85bd389e-4357-4b8c-aa69-868cf41f28f9","resolution":{"observed_at":"2026-05-14T20:47:58.617673Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-12T20:13:07.221870Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"cited_work":{"arxiv_id":"2502.06042","doi":"10.48550/arxiv.2502.06042","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.06042","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2502.06042 , year=","venue":"ArXiv.org","work_id":"9617c4ed-1474-439a-9d08-e0612fa954ae","year":2025},"citing_paper":{"arxiv_id":"2605.12715","last_updated":"2026-05-15T17:01:07Z","snapshot_observed_at":"2026-07-06T23:24:23.402304Z","submitted_at":"2026-05-12T20:22:45Z","title":"Scaling Laws for Mixture Pretraining Under Data Constraints","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-14T21:44:31.429223Z"},"links":{"cited_paper":"/paper/2502.06042","citing_paper":"/paper/2605.12715"},"observation_digest":"sha256:5db5351744dfd1711f18d8b3d2c02ff184e38e8a535ed2d01444175b5eec697f","observation_id":"960bddf1-eedd-4e95-98d1-0465059c9ed9","resolution":{"observed_at":"2026-05-14T21:48:00.978072Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-12T20:13:07.221870Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"cited_work":{"arxiv_id":"2502.06042","doi":"10.48550/arxiv.2502.06042","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.06042","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2502.06042 , year=","venue":"ArXiv.org","work_id":"9617c4ed-1474-439a-9d08-e0612fa954ae","year":2025},"citing_paper":{"arxiv_id":"2605.26097","last_updated":"2026-05-25T17:54:34Z","snapshot_observed_at":"2026-07-06T23:36:01.564747Z","submitted_at":"2026-05-25T17:54:34Z","title":"Forgetting in Language Models: Capacity, Optimization, and Self-Generated Replay","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-29T23:15:45.174086Z"},"links":{"cited_paper":"/paper/2502.06042","citing_paper":"/paper/2605.26097"},"observation_digest":"sha256:197b766424ae1378dedfea8cc4bea899188cd0a0b166633817b645ebb0d506a7","observation_id":"0701f0ff-3b37-47eb-9a35-895ffbbcad32","resolution":{"observed_at":"2026-06-29T23:24:01.970658Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-12T20:13:07.221870Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"cited_work":{"arxiv_id":"2502.06042","doi":"10.48550/arxiv.2502.06042","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.06042","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2502.06042 , year=","venue":"ArXiv.org","work_id":"9617c4ed-1474-439a-9d08-e0612fa954ae","year":2025},"citing_paper":{"arxiv_id":"2606.03924","last_updated":"2026-06-02T17:14:37Z","snapshot_observed_at":"2026-08-12T21:43:13.974825Z","submitted_at":"2026-06-02T17:14:37Z","title":"Knowledge Editing in Masked Diffusion Language Models","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-06-28T09:51:42.811856Z"},"links":{"cited_paper":"/paper/2502.06042","citing_paper":"/paper/2606.03924"},"observation_digest":"sha256:d19c08148cfff287674b6272964eb8dbe608b21650ca76731793deda9d54084e","observation_id":"0e5085ee-2d3f-4315-a358-1eabbe3127eb","resolution":{"observed_at":"2026-07-02T03:36:29.935755Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-12T20:13:07.221870Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06042","snapshot_observed_at":"2026-08-01T22:30:58.664303Z","title":"arXiv Preprint arXiv:2502.06042 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16354","last_updated":"2026-07-17T08:21:15Z","snapshot_observed_at":"2026-08-13T04:41:58.441212Z","submitted_at":"2026-07-17T08:21:15Z","title":"A Predict-then-Correct Loop Based on Few-Shot Continuous Contextual Bandit for Demand Forecasting","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-01T22:30:58.664303Z"},"links":{"cited_paper":"/paper/2502.06042","citing_paper":"/paper/2607.16354"},"observation_digest":"sha256:f234691bba756907343fa4a42691d6b6166df476417e88952828fe12e21dad8e","observation_id":"85a28b91-5f85-4d9c-af51-c4cff710587a","resolution":{"observed_at":"2026-08-01T22:30:58.664303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2502.06042/citation-record","integrity":"/paper/2502.06042/integrity","json":"/paper/2502.06042/citation-record.json","paper":"/paper/2502.06042"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:01:36.870592Z","title":"Scaling laws for generative mixed-modal language models","venue":null,"work_id":"c2563649-ab2b-45ec-8752-1edbb408634b","year":2023},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-12T20:13:07.221870Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.045067Z"},"links":{"citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:4e05a6e724f779c829b538946ecbab31e2bd85d6d661bbe71396a4bcc19fb30e","observation_id":"0e539dbd-18d5-4e79-8178-391069d27b79","resolution":{"observed_at":"2026-08-08T17:01:36.874266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00660","last_updated":"2024-11-16T06:17:37Z","snapshot_observed_at":"2026-08-12T22:09:40.445895Z","submitted_at":"2024-11-01T15:26:15Z","title":"Physics in Next-token Prediction","version":2},"cited_work":{"arxiv_id":"2411.00660","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.00660","snapshot_observed_at":"2026-08-08T17:01:36.671244Z","title":"Physics in Next-token Prediction","venue":"cs.LG","work_id":"b5a2392b-104b-4a71-a9ff-246245e88186","year":2024},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-12T20:13:07.221870Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.049342Z"},"links":{"cited_paper":"/paper/2411.00660","citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:16018d432307d3de79d14e72e5a2a92594e818cffdf94264c3a449cb7ebca80c","observation_id":"54015f12-73e8-4298-bc75-689f38c3d2a1","resolution":{"observed_at":"2026-08-08T17:01:36.675840Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16947","last_updated":"2024-08-30T00:06:29Z","snapshot_observed_at":"2026-08-12T22:54:49.604752Z","submitted_at":"2024-08-30T00:06:29Z","title":"An Empirical Study of Scaling Laws for Transfer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16947","snapshot_observed_at":"2026-08-08T17:01:36.054331Z","title":"An empirical study of scaling laws for transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-12T20:13:07.221870Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.054331Z"},"links":{"cited_paper":"/paper/2408.16947","citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:caf1cbe432fc232aa7afb9e99f204882c870bd91e2336dd4a788f28c3bd7fb79","observation_id":"348d53aa-d60c-4d10-bf07-05829460d3d8","resolution":{"observed_at":"2026-08-08T17:01:36.054331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10102","last_updated":"2024-05-15T00:57:23Z","snapshot_observed_at":"2026-08-13T00:29:35.081404Z","submitted_at":"2024-04-15T19:19:56Z","title":"Chinchilla Scaling: A replication attempt","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.10102","snapshot_observed_at":"2026-08-08T17:01:36.058241Z","title":"Chinchilla scaling: A replication attempt","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-12T20:13:07.221870Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.058241Z"},"links":{"cited_paper":"/paper/2404.10102","citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:210b166af41caf8fb9f6695eee1005b359a93c8ee5aa8cbe328c70d036408fdf","observation_id":"5ad549d4-7fac-4b5a-90c7-53a13cc61fbb","resolution":{"observed_at":"2026-08-08T17:01:36.058241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-08T17:01:36.062327Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-12T20:13:07.221870Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.062327Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:af30a1d1109da89e876a8e743e0e46a582513a23088525e4d462ab61e03e8193","observation_id":"d3d0fa82-5ef3-490b-8ea0-13d01b547b18","resolution":{"observed_at":"2026-08-08T17:01:36.062327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02954","last_updated":"2024-01-05T18:59:13Z","snapshot_observed_at":"2026-08-10T17:03:38.042994Z","submitted_at":"2024-01-05T18:59:13Z","title":"DeepSeek LLM: Scaling Open-Source Language Models with Longtermism","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02954","snapshot_observed_at":"2026-08-08T17:01:36.066170Z","title":"Deepseek llm: Scaling open-source language models with longtermism","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-12T20:13:07.221870Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.066170Z"},"links":{"cited_paper":"/paper/2401.02954","citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:d9961b2658a088f54aafd409c2448a6f2555e2bf49ef9e85dedbbdc33a27b23c","observation_id":"f5824e7e-4bcb-4e98-be0e-ebfb8295506d","resolution":{"observed_at":"2026-08-08T17:01:36.066170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00027","last_updated":"2020-12-31T19:00:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-12-31T19:00:10Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00027","snapshot_observed_at":"2026-08-08T17:01:36.070822Z","title":"The pile: An 800gb dataset of diverse text for language modeling","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-12T20:13:07.221870Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.070822Z"},"links":{"cited_paper":"/paper/2101.00027","citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:a3144b269f1ba11f130c39ec9b3efd44e64823dd0f29533d8bfc6a6c9ebd1e2e","observation_id":"6f0003f1-0c81-4ad5-8ba1-00c8381cdae5","resolution":{"observed_at":"2026-08-08T17:01:36.070822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:01:36.860983Z","title":"B., Werra, L","venue":null,"work_id":"9f3bf1e5-be9d-4be4-9f07-ebb7dcc88624","year":2024},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-12T20:13:07.221870Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.074685Z"},"links":{"citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:749f0b03c60d78e895eca4824a2caa83a1beb6aec2e34fb641a88644ae1b43ba","observation_id":"12aa82ea-4964-4565-8705-4c5e29328f9b","resolution":{"observed_at":"2026-08-08T17:01:36.864014Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:01:36.850761Z","title":"The elements of statistical learning: data mining, inference, and prediction, 2017","venue":null,"work_id":"03203ebe-5429-4e08-aec2-4353598f0283","year":2017},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-12T20:13:07.221870Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.078314Z"},"links":{"citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:8991cb33ba2c6e3983183385311a9269ea774bbafcfde251e8014991e83a797b","observation_id":"dd78c85f-f506-471a-ab91-a72768059e65","resolution":{"observed_at":"2026-08-08T17:01:36.854328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04366","last_updated":"2022-02-02T16:39:23Z","snapshot_observed_at":"2026-08-13T17:56:57.877812Z","submitted_at":"2021-10-08T20:22:26Z","title":"Towards a Unified View of Parameter-Efficient Transfer Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.04366","snapshot_observed_at":"2026-08-08T17:01:36.082196Z","title":"Towards a unified view of parameter-efficient transfer learning, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-12T20:13:07.221870Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.082196Z"},"links":{"cited_paper":"/paper/2110.04366","citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:171d1103dfd72b9fc0edae3d75a151493cd7e28667facee1c7bca2c27656af5b","observation_id":"2bf46535-cc36-49d7-abf5-1af770924f88","resolution":{"observed_at":"2026-08-08T17:01:36.082196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:01:36.086743Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-12T20:13:07.221870Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.086743Z"},"links":{"citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:38894b19cc378452a3aa34a6d0cc9d4f4b1a0ca551e5b10841f1f2572a04d3c7","observation_id":"df1de12e-323e-4169-a5d7-b9b9546a62ed","resolution":{"observed_at":"2026-08-08T17:01:36.086743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.01293","last_updated":"2021-02-02T04:07:38Z","snapshot_observed_at":"2026-08-01T22:46:19.170916Z","submitted_at":"2021-02-02T04:07:38Z","title":"Scaling Laws for Transfer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.01293","snapshot_observed_at":"2026-08-08T17:01:36.090967Z","title":"Scaling laws for transfer, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-12T20:13:07.221870Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.090967Z"},"links":{"cited_paper":"/paper/2102.01293","citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:cef6b1619d23d2cb416282f15e745fc92da64180bbfad4c002a73180ce1fd0e3","observation_id":"722dd3be-544e-49c2-891c-b678f9a43b81","resolution":{"observed_at":"2026-08-08T17:01:36.090967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-08-14T02:46:56.838057Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-08-08T17:01:36.095414Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-12T20:13:07.221870Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.095414Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:b579fe69e6bc0609ea4d53d0859eb138319b1cb7ce25e2fb166dbfd5c7732887","observation_id":"19d8cfee-df61-4bc6-8e13-6b387f11ea40","resolution":{"observed_at":"2026-08-08T17:01:36.095414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20236","last_updated":"2024-05-30T16:40:07Z","snapshot_observed_at":"2026-08-12T23:53:59.633144Z","submitted_at":"2024-05-30T16:40:07Z","title":"Disentangling and Mitigating the Impact of Task Similarity for Continual Learning","version":1},"cited_work":{"arxiv_id":"2405.20236","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.20236","snapshot_observed_at":"2026-08-08T17:01:36.573204Z","title":"Disentangling and Mitigating the Impact of Task Similarity for Continual Learning","venue":"stat.ML","work_id":"d7d4bd2e-73bc-4c88-a2e8-d558748ae47e","year":2024},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-12T20:13:07.221870Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.099665Z"},"links":{"cited_paper":"/paper/2405.20236","citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:85caacd16c2191a6839fa851179076b203dfff720168bf7ab6af1fb27333d534","observation_id":"670b62d3-df1b-43f4-ac17-63c093676837","resolution":{"observed_at":"2026-08-08T17:01:36.579501Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-08-09T19:52:33.533277Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-08T17:01:36.103707Z","title":"A., Welbl, J., Clark, A., Hennigan, T., Noland, E., Millican, K., van den Driessche, G., Damoc, B., Guy, A., Osindero, S., Simonyan, K., Elsen, E., Rae, J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-12T20:13:07.221870Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.103707Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:baba003a663d1ae6d235903f5b7a1a9f946a020aa7e67c8647e774a5883eaf07","observation_id":"d3629529-3168-4d20-bb8d-ce8902bde973","resolution":{"observed_at":"2026-08-08T17:01:36.103707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:01:36.832748Z","title":null,"venue":null,"work_id":"b43aaa4f-271d-4da0-82b7-8c37552e9a4f","year":2022},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-12T20:13:07.221870Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.107743Z"},"links":{"citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:4a66878b5ca196e27a3e1913129ee66cfd8896a9ca8f9c5999660267698b4344","observation_id":"7ffca25e-5a4d-4446-8e11-50e9128774da","resolution":{"observed_at":"2026-08-08T17:01:36.836051Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1902.00751","last_updated":"2019-06-13T17:48:30Z","snapshot_observed_at":"2026-07-06T07:30:44.870185Z","submitted_at":"2019-02-02T16:29:47Z","title":"Parameter-Efficient Transfer Learning for NLP","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1902.00751","snapshot_observed_at":"2026-08-08T17:01:36.110759Z","title":"Parameter-efficient transfer learning for nlp, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-12T20:13:07.221870Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.110759Z"},"links":{"cited_paper":"/paper/1902.00751","citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:982f5fe61590c797162daf9b4c45fce0ddd7478cb5f51795af6128f8b04960c8","observation_id":"13153a14-8642-4f09-a584-d0d7da39aedc","resolution":{"observed_at":"2026-08-08T17:01:36.110759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-08T17:01:36.113930Z","title":"J., Shen, Y., Wallis, P., Allen-Zhu, Z., Li, Y., Wang, S., Wang, L., and Chen, W","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-12T20:13:07.221870Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.113930Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:beda59c740000493f79b5bb741a7291b62b1239190a6c07696133d3ed657b4d7","observation_id":"2f570756-ec8c-491d-9c7f-683279943162","resolution":{"observed_at":"2026-08-08T17:01:36.113930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:01:36.822258Z","title":"L., Wang, C., Yao, Y., Zhao, C., Zhou, J., Cai, J., Zhai, Z., Ding, N., Jia, C., Zeng, G., dahai li, Liu, Z., and Sun, M","venue":null,"work_id":"63afa9a4-9d9a-40c1-b99a-6c7ecbd4ab0f","year":2024},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-12T20:13:07.221870Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.117451Z"},"links":{"citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:9c887a03387466877ccfcec5e635843685440540d6612b6849cdbe8e839135db","observation_id":"5e9eebac-00a9-4b75-9358-e17ecb98a7fd","resolution":{"observed_at":"2026-08-08T17:01:36.825506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08763","last_updated":"2024-09-04T16:13:18Z","snapshot_observed_at":"2026-08-13T00:54:55.069129Z","submitted_at":"2024-03-13T17:58:57Z","title":"Simple and Scalable Strategies to Continually Pre-train Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08763","snapshot_observed_at":"2026-08-08T17:01:36.120434Z","title":"L., Anthony, Q., Lesort, T., Belilovsky, E., and Rish, I","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-12T20:13:07.221870Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.120434Z"},"links":{"cited_paper":"/paper/2403.08763","citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:c9db5a20a17db2dc03185af948afc66753443b9253bc563a6c702241a2950b33","observation_id":"32c3eda3-14ab-4ce6-820c-2666f8d054b3","resolution":{"observed_at":"2026-08-08T17:01:36.120434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:01:36.123633Z","title":"Scaling laws for downstream task performance of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-12T20:13:07.221870Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.123633Z"},"links":{"citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:73ff5090bfe95bf253f9a98e5a4ab3c2aaf4a317cdb3d47e98c52bc59cddf520","observation_id":"c1c71820-692a-4f1a-a23e-6be4f017bc7c","resolution":{"observed_at":"2026-08-08T17:01:36.123633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.05605","last_updated":"2024-01-11T00:44:25Z","snapshot_observed_at":"2026-08-13T04:44:56.379629Z","submitted_at":"2024-01-11T00:44:25Z","title":"Scaling Laws for Forgetting When Fine-Tuning Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.05605","snapshot_observed_at":"2026-08-08T17:01:36.126796Z","title":"Scaling laws for forgetting when fine-tuning large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-12T20:13:07.221870Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.126796Z"},"links":{"cited_paper":"/paper/2401.05605","citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:f649793d96a67b41a23f1e510458f817b23e8daa0071e05916db1d78d21a9fcb","observation_id":"46cd8a44-6f4f-4b39-bed4-e6aae40e8a25","resolution":{"observed_at":"2026-08-08T17:01:36.126796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02774","last_updated":"2024-05-05T00:08:00Z","snapshot_observed_at":"2026-08-13T00:14:45.625191Z","submitted_at":"2024-05-05T00:08:00Z","title":"Get more for less: Principled Data Selection for Warming Up Fine-Tuning in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.02774","snapshot_observed_at":"2026-08-08T17:01:36.130140Z","title":"A., Sun, Y., Jahagirdar, H., Zhang, Y., Du, R., Sahu, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-12T20:13:07.221870Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.130140Z"},"links":{"cited_paper":"/paper/2405.02774","citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:cf7dbe53c0c60f247e0b52a509584bd71cd12692a8ae85e2dcf0e0828f8a852b","observation_id":"eb9e3c6f-cab7-4d45-be90-58871f1ca401","resolution":{"observed_at":"2026-08-08T17:01:36.130140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-08T17:01:36.133857Z","title":"B., Chess, B., Child, R., Gray, S., Radford, A., Wu, J., and Amodei, D","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-12T20:13:07.221870Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.133857Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:3288b7ced3ede1a213641269147dbf2c7195b4d79d1e27db09cb3c9acd8aab4c","observation_id":"f69888e6-bb5c-4108-8578-105fac66082d","resolution":{"observed_at":"2026-08-08T17:01:36.133857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1808.06226","last_updated":"2018-08-19T16:49:06Z","snapshot_observed_at":"2026-07-06T06:56:20.935388Z","submitted_at":"2018-08-19T16:49:06Z","title":"SentencePiece: A simple and language independent subword tokenizer and detokenizer for Neural Text Processing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.06226","snapshot_observed_at":"2026-08-08T17:01:36.137146Z","title":"Sentencepiece: A simple and language independent subword tokenizer and detokenizer for neural text processing","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-12T20:13:07.221870Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.137146Z"},"links":{"cited_paper":"/paper/1808.06226","citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:ea97733712fd7f63b32a06456c10f537c5c53dabd4af812972b4a1e5c8b55522","observation_id":"d4b50a27-f704-4b8b-b279-6409a8d22899","resolution":{"observed_at":"2026-08-08T17:01:36.137146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:01:36.810516Z","title":"Improved fine-tuning by better leveraging pre-training data","venue":null,"work_id":"a553b18c-e2b2-4bbb-a720-8e893851e636","year":2022},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-12T20:13:07.221870Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.140667Z"},"links":{"citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:93af5ef0bce7b38a22e97ad5282990ad7b3451db24306c1bdf913efaaa25daf0","observation_id":"9e551a4f-ba48-4fff-85fc-cd1a357abb79","resolution":{"observed_at":"2026-08-08T17:01:36.814908Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:01:36.799302Z","title":"and Hutter, F","venue":null,"work_id":"7b27ff8a-ffa8-4faf-94f1-d06efd6ae03a","year":2017},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-12T20:13:07.221870Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.144198Z"},"links":{"citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:5bbfc6d130a0e17c36ba1b255f62dcc5e7c4a58485ceb2f3398791a9e8d47ed6","observation_id":"5bdfefc6-a351-409c-ac89-22579ccc7eac","resolution":{"observed_at":"2026-08-08T17:01:36.803295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:01:36.147470Z","title":"and Hutter, F","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-12T20:13:07.221870Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.147470Z"},"links":{"citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:a6ddebd6bf41b35f7baaa44d410868c3cc5a5c32c909f9f0926faf04cac98ed2","observation_id":"9fa8498c-dad9-43e8-a60c-a0e333f548b3","resolution":{"observed_at":"2026-08-08T17:01:36.147470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08747","last_updated":"2025-01-05T04:09:00Z","snapshot_observed_at":"2026-08-10T01:52:30.559515Z","submitted_at":"2023-08-17T02:53:23Z","title":"An Empirical Study of Catastrophic Forgetting in Large Language Models During Continual Fine-tuning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.08747","snapshot_observed_at":"2026-08-08T17:01:36.150551Z","title":"An empirical study of catastrophic forgetting in large language models during continual fine-tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-12T20:13:07.221870Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.150551Z"},"links":{"cited_paper":"/paper/2308.08747","citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:394a9c9e4e4da9436503ec099ee882c77722ba82d58c86ae327b437acbe7dbec","observation_id":"b0701b48-8b4b-4e01-86cc-847043c43dbd","resolution":{"observed_at":"2026-08-08T17:01:36.150551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12120","last_updated":"2026-05-20T13:58:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-17T18:45:25Z","title":"LLMs on the Line: Data Determines Loss-to-Loss Scaling Laws","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12120","snapshot_observed_at":"2026-08-08T17:01:36.154116Z","title":"Llms on the line: Data determines loss-to-loss scaling laws","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-12T20:13:07.221870Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.154116Z"},"links":{"cited_paper":"/paper/2502.12120","citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:437b8681c29ee66790f3b299d515a291560fc756b5acd3bc323de0ba9d1d928a","observation_id":"89f4ec0a-15e4-410c-9400-07e39d7e2ef8","resolution":{"observed_at":"2026-08-08T17:01:36.154116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:01:36.782288Z","title":"Metaicl: Learning to learn in context","venue":null,"work_id":"b457b4a6-933e-47ee-a9f2-ff7818dddc66","year":2022},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-12T20:13:07.221870Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.157349Z"},"links":{"citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:640b35c38e3922676bde7bec1792c0b21f57491b1246fe92dcbef270a7c7ced7","observation_id":"22ad3363-1613-43d8-a6f3-8698700c4d9a","resolution":{"observed_at":"2026-08-08T17:01:36.786124Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:01:36.160335Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-12T20:13:07.221870Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.160335Z"},"links":{"citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:3639f980c23aa135288734005f37a91b3ffcf162a8c771d0bf6be76f425e259f","observation_id":"b42c65b6-0a14-4b5f-a976-f198e5fb034a","resolution":{"observed_at":"2026-08-08T17:01:36.160335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:01:36.163627Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-12T20:13:07.221870Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.163627Z"},"links":{"citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:3af0296d28f9b21fa53032c941262d48b47c08e3aa8bb31ef02dfde907b82144","observation_id":"275cdcbb-c633-49dd-8b0e-b6b879a9b018","resolution":{"observed_at":"2026-08-08T17:01:36.163627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19146","last_updated":"2025-01-19T10:34:08Z","snapshot_observed_at":"2026-08-13T16:33:02.071205Z","submitted_at":"2024-06-27T13:02:43Z","title":"Resolving Discrepancies in Compute-Optimal Scaling of Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19146","snapshot_observed_at":"2026-08-08T17:01:36.166405Z","title":"Resolving discrepancies in compute-optimal scaling of language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-12T20:13:07.221870Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.166405Z"},"links":{"cited_paper":"/paper/2406.19146","citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:54aadfac2d0fb184fc488bfe1732f0544dfa8be19e660d9b6455059b999b428b","observation_id":"774c7d91-55e4-49be-8a31-36fbb86bdd82","resolution":{"observed_at":"2026-08-08T17:01:36.166405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.05682","last_updated":"2022-10-10T16:36:47Z","snapshot_observed_at":"2026-08-13T17:18:00.736039Z","submitted_at":"2021-12-10T17:25:07Z","title":"Self-attention Does Not Need $O(n^2)$ Memory","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.05682","snapshot_observed_at":"2026-08-08T17:01:36.169940Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-12T20:13:07.221870Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.169940Z"},"links":{"cited_paper":"/paper/2112.05682","citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:2479885f1f17c34b563fc5a4241ae36e7375965cb95243693262386b7e74d924","observation_id":"d1acaf38-48d1-4533-b92d-d1ccf2ea4737","resolution":{"observed_at":"2026-08-08T17:01:36.169940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:01:36.756738Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":"c4dbba5d-f756-4a89-8ca6-518a180ba6f0","year":2019},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-12T20:13:07.221870Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.174011Z"},"links":{"citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:2f31ed47e4082a3aa971a14980bb3346a8915a4e3975bd5fabcb29f25f0a38ff","observation_id":"d3f9934a-f0b0-4695-ad68-967cbd97e01a","resolution":{"observed_at":"2026-08-08T17:01:36.760912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:01:36.745635Z","title":"Multitask prompted training enables zero-shot task generalization","venue":null,"work_id":"4ad603f9-e1a4-45a4-9e11-598fe3916592","year":2022},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-12T20:13:07.221870Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.177949Z"},"links":{"citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:b6fba17a9e683b93f63ce13e31911fbe5e9ae24c785212e3677f602b771e88a0","observation_id":"9e25533c-d209-44cc-a08c-28141256f423","resolution":{"observed_at":"2026-08-08T17:01:36.749186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.00448","last_updated":"2025-04-14T10:11:13Z","snapshot_observed_at":"2026-08-13T04:50:51.273891Z","submitted_at":"2023-12-31T10:53:58Z","title":"Beyond Chinchilla-Optimal: Accounting for Inference in Language Model Scaling Laws","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.00448","snapshot_observed_at":"2026-08-08T17:01:36.181915Z","title":"Beyond chinchilla-optimal: Accounting for inference in language model scaling laws, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-12T20:13:07.221870Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.181915Z"},"links":{"cited_paper":"/paper/2401.00448","citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:219c97d0d5fcf7c49784663cf67232a2e7f922077686f76b484f28d8b034ca68","observation_id":"642d8bb8-aa55-41cd-a887-240b8c4f5928","resolution":{"observed_at":"2026-08-08T17:01:36.181915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1409.3215","last_updated":"2014-12-14T20:59:51Z","snapshot_observed_at":"2026-08-02T03:58:50.109606Z","submitted_at":"2014-09-10T19:55:35Z","title":"Sequence to Sequence Learning with Neural Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1409.3215","snapshot_observed_at":"2026-08-08T17:01:36.186433Z","title":"Sequence to sequence learning with neural networks","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-12T20:13:07.221870Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.186433Z"},"links":{"cited_paper":"/paper/1409.3215","citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:69c8c0202a03256af4fc7e5948d9a48fc6881aabb5a5456946f919307be9a45a","observation_id":"115c1904-e99d-429f-903e-b3d1bc5afdfe","resolution":{"observed_at":"2026-08-08T17:01:36.186433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:01:36.734692Z","title":"Openhermes 2.5: An open dataset of synthetic data for generalist llm assistants, 2023","venue":null,"work_id":"a761c99e-f7b2-4b56-9fff-0fdcb3f48d21","year":2023},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-12T20:13:07.221870Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.190495Z"},"links":{"citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:d31fbe3db35149dab26872f1102ee2393269c2e65cd9d17015713f7011aa738d","observation_id":"3b9816fa-688c-4341-b4a2-73273cece9e3","resolution":{"observed_at":"2026-08-08T17:01:36.738109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11029","last_updated":"2024-10-24T17:56:14Z","snapshot_observed_at":"2026-08-13T17:49:29.590173Z","submitted_at":"2024-08-20T17:30:48Z","title":"Scaling Law with Learning Rate Annealing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11029","snapshot_observed_at":"2026-08-08T17:01:36.194110Z","title":"Scaling law with learning rate annealing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-12T20:13:07.221870Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.194110Z"},"links":{"cited_paper":"/paper/2408.11029","citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:1038536ffddccf1e34ec06c8efd7d8277e056404c2c02337c293300cd87c9ef5","observation_id":"db0581da-92ba-4af8-90c0-2553e2f59445","resolution":{"observed_at":"2026-08-08T17:01:36.194110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13476","last_updated":"2024-11-26T09:46:25Z","snapshot_observed_at":"2026-08-13T05:56:58.341433Z","submitted_at":"2024-11-20T17:22:31Z","title":"When Precision Meets Position: BFloat16 Breaks Down RoPE in Long-Context Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13476","snapshot_observed_at":"2026-08-08T17:01:36.198148Z","title":"When precision meets position: Bfloat16 breaks down rope in long-context training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-12T20:13:07.221870Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.198148Z"},"links":{"cited_paper":"/paper/2411.13476","citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:9c7ec47b02e16edea949f4648ed2f0aca1807e2dee2bf77772242000359b3d90","observation_id":"702def6f-d4b2-4b6f-9f4f-80b9658d61cf","resolution":{"observed_at":"2026-08-08T17:01:36.198148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:01:36.723873Z","title":null,"venue":null,"work_id":"5b38b600-5832-4f80-b447-11cb54ebccf1","year":2024},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-12T20:13:07.221870Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.202404Z"},"links":{"citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:946695078f599127c07d813450fceab9a70eadb4db8e06b8d6f4d1454d73de15","observation_id":"e4c8af24-347c-4f88-8d86-0e579484ba57","resolution":{"observed_at":"2026-08-08T17:01:36.727455Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:01:36.713435Z","title":"W., Lester, B., Du, N., Dai, A","venue":null,"work_id":"6e92979f-8af3-463c-80fd-186b6d9ba7c3","year":2022},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-12T20:13:07.221870Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.205762Z"},"links":{"citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:6e6ffec55bf01bea7ce018c816dcc8f8cb3cb9109ba2830147c610b76c77c5bf","observation_id":"9c8321d0-e366-4e90-b046-338df60caa46","resolution":{"observed_at":"2026-08-08T17:01:36.717023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:01:36.701639Z","title":"What makes a high-quality training dataset for large language models: A practitioners' perspective","venue":null,"work_id":"ba143f1b-c81f-49bf-8487-914b90b8da17","year":2024},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-12T20:13:07.221870Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.208846Z"},"links":{"citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:7cbd7c81db45176607b77af5c59c739117e1e8cfda4e49555a4256e07e7c2bdf","observation_id":"ec7e55ca-b143-495b-bae8-4fbbdeee3771","resolution":{"observed_at":"2026-08-08T17:01:36.705655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:01:36.689960Z","title":"When scaling meets LLM finetuning: The effect of data, model and finetuning method","venue":null,"work_id":"30add9c9-01db-4207-8b7f-271d5363e206","year":2024},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-12T20:13:07.221870Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.211919Z"},"links":{"citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:15406f752f3696b0a8fd9ac98c3405c8639d18feecd12cd1ab1fd74fb19e5d2c","observation_id":"8e58dd0b-5e36-44bd-a36e-76d72e08d32c","resolution":{"observed_at":"2026-08-08T17:01:36.693831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16842","last_updated":"2024-02-27T18:06:29Z","snapshot_observed_at":"2026-08-13T04:09:46.874007Z","submitted_at":"2024-02-26T18:59:12Z","title":"Asymmetry in Low-Rank Adapters of Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16842","snapshot_observed_at":"2026-08-08T17:01:36.214939Z","title":"S., Gabrielsson, R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-12T20:13:07.221870Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.214939Z"},"links":{"cited_paper":"/paper/2402.16842","citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:82e1e4adb36f8b27c994b76a6971ea256af9e00c8d1e899273fa7a1d7f3678c0","observation_id":"da611d14-44c9-419b-bc38-a58e6281c029","resolution":{"observed_at":"2026-08-08T17:01:36.214939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:01:36.218426Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-12T20:13:07.221870Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.218426Z"},"links":{"citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:5566d5568d99b011aef1d04c1d321216c932076f74b1ab050688f01987ec56fa","observation_id":"170695dc-26c0-4cb5-af04-f682e50a23ea","resolution":{"observed_at":"2026-08-08T17:01:36.218426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-12T20:13:07.221870Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection"},"reference_resolution":{"displayed":48,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":33,"verified_exact":2,"verified_fuzzy":13},"total_outbound_references":48},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 48 of 48 outbound references and 7 inbound Pith citation observations for arXiv:2502.06042."}