{"as_of":"2026-08-23T22:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9c25f2cba976c9d8f1422b37f38e474c44599045bcbc6f68fea8b64b7fe57cff","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-14T20:00:47.126736Z","state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.13405/citation-record","integrity":"/paper/2605.13405/integrity","json":"/paper/2605.13405/citation-record.json","paper":"/paper/2605.13405"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.25087","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T20:30:07.540307Z","title":"Bergsma, B","venue":null,"work_id":"a7caf177-64bd-4bbb-9f0d-cf67cf518292","year":2025},"citing_paper":{"arxiv_id":"2605.13405","last_updated":"2026-05-13T12:00:11Z","snapshot_observed_at":"2026-08-13T03:09:22.814107Z","submitted_at":"2026-05-13T12:00:11Z","title":"When is Warmstarting Effective for Scaling Language Models?","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-14T20:00:47.126736Z"},"links":{"citing_paper":"/paper/2605.13405"},"observation_digest":"sha256:e66aed49985dbfc33d1f62780a1f88597fef7f20df6731f0b4a0e589ddb39377","observation_id":"166c4dd5-d84a-4117-a34d-b56503e7dd2b","resolution":{"observed_at":"2026-05-14T20:02:52.971842Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Brown, B","venue":null,"work_id":"f34fe3d3-0ff9-4661-bc74-3a8d1b5e66bf","year":1901},"citing_paper":{"arxiv_id":"2605.13405","last_updated":"2026-05-13T12:00:11Z","snapshot_observed_at":"2026-08-13T03:09:22.814107Z","submitted_at":"2026-05-13T12:00:11Z","title":"When is Warmstarting Effective for Scaling Language Models?","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-14T20:00:47.126736Z"},"links":{"citing_paper":"/paper/2605.13405"},"observation_digest":"sha256:d6e76c54ac7fa0a87cdecc27068e023167841be50d45b2ca670fcd0f95d5f548","observation_id":"857ed5f3-c96a-4d6e-a765-002b2ca79b6a","resolution":{"observed_at":"2026-05-14T20:02:54.620589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-08-14T19:36:07.505691Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":"1803.05457","doi":"10.1162/tacl_a_00448.https://aclanthology.org/2022.tacl-1.5","metadata_source":"pith","pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","venue":"cs.AI","work_id":"28ea1282-d657-4c61-a83c-f1249be6d6b1","year":2018},"citing_paper":{"arxiv_id":"2605.13405","last_updated":"2026-05-13T12:00:11Z","snapshot_observed_at":"2026-08-13T03:09:22.814107Z","submitted_at":"2026-05-13T12:00:11Z","title":"When is Warmstarting Effective for Scaling Language Models?","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-14T20:00:47.126736Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2605.13405"},"observation_digest":"sha256:30218f92bc7347a663ca1e99e3b93759f7076cbbacf4a4c377573ecd76f7fa03","observation_id":"5c79c660-0134-4341-b9b7-864abec704b7","resolution":{"observed_at":"2026-05-14T20:02:52.977944Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2405.15743","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"63fecd0e-9c7d-4315-9fd8-1e277c222876","year":null},"citing_paper":{"arxiv_id":"2605.13405","last_updated":"2026-05-13T12:00:11Z","snapshot_observed_at":"2026-08-13T03:09:22.814107Z","submitted_at":"2026-05-13T12:00:11Z","title":"When is Warmstarting Effective for Scaling Language Models?","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-14T20:00:47.126736Z"},"links":{"citing_paper":"/paper/2605.13405"},"observation_digest":"sha256:0f5e7fb9c5ce05e5e30d0e8df933e35395f1ad81d2ec6788fac1adc39f47a9fa","observation_id":"a519cee7-e1af-46a2-9c49-eb9f0864fed0","resolution":{"observed_at":"2026-05-14T20:02:53.028001Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.01618","doi":"10.48550/arxiv.2505.01618","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Don’t be lazy: Completep enables compute-efficient deep transformers","venue":"ArXiv.org","work_id":"85f11780-ed20-4881-8d31-bb0834b58027","year":2025},"citing_paper":{"arxiv_id":"2605.13405","last_updated":"2026-05-13T12:00:11Z","snapshot_observed_at":"2026-08-13T03:09:22.814107Z","submitted_at":"2026-05-13T12:00:11Z","title":"When is Warmstarting Effective for Scaling Language Models?","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-14T20:00:47.126736Z"},"links":{"citing_paper":"/paper/2605.13405"},"observation_digest":"sha256:4cf75a3ca8de110c105a807091eec5facaea57b200b8c8229e840509f7f305af","observation_id":"4e00b95c-2dd8-471f-a8a2-3921f7e2c625","resolution":{"observed_at":"2026-05-14T20:02:53.004359Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13812","last_updated":"2024-04-09T21:01:56Z","snapshot_observed_at":"2026-08-19T03:56:32.694978Z","submitted_at":"2023-06-23T23:19:21Z","title":"Maintaining Plasticity in Deep Continual Learning","version":3},"cited_work":{"arxiv_id":"2306.13812","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.13812","snapshot_observed_at":"2026-07-02T03:26:29.423429Z","title":"Fernando Hernandez-Garcia, Parash Rahman, Richard S","venue":null,"work_id":"7ff5dd29-d9a7-480e-befd-778fc7f98653","year":2023},"citing_paper":{"arxiv_id":"2605.13405","last_updated":"2026-05-13T12:00:11Z","snapshot_observed_at":"2026-08-13T03:09:22.814107Z","submitted_at":"2026-05-13T12:00:11Z","title":"When is Warmstarting Effective for Scaling Language Models?","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-14T20:00:47.126736Z"},"links":{"cited_paper":"/paper/2306.13812","citing_paper":"/paper/2605.13405"},"observation_digest":"sha256:49f07f9a7df685ce1f0679c8714cb5d31fbe40e8d775482a061429509a41fdc1","observation_id":"8bd0698d-2c4c-4b19-98bd-00c2ebca09a7","resolution":{"observed_at":"2026-05-14T20:02:53.011616Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02222","last_updated":"2025-05-20T01:04:35Z","snapshot_observed_at":"2026-08-17T11:38:13.930266Z","submitted_at":"2025-05-04T19:14:43Z","title":"Practical Efficiency of Muon for Pretraining","version":4},"cited_work":{"arxiv_id":"2505.02222","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.02222","snapshot_observed_at":"2026-07-09T17:36:25.409899Z","title":"arXiv preprint arXiv:2505.02222 , year=","venue":"cs.LG","work_id":"3b5f21a7-2f9f-4001-bba4-8f7b7f0468f4","year":2025},"citing_paper":{"arxiv_id":"2605.13405","last_updated":"2026-05-13T12:00:11Z","snapshot_observed_at":"2026-08-13T03:09:22.814107Z","submitted_at":"2026-05-13T12:00:11Z","title":"When is Warmstarting Effective for Scaling Language Models?","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-14T20:00:47.126736Z"},"links":{"cited_paper":"/paper/2505.02222","citing_paper":"/paper/2605.13405"},"observation_digest":"sha256:1a9abf0d2ff2175615b8fbe2b1dbdbf9ca54937cd8949fbae7733a3cb478e8f9","observation_id":"c018810f-77f1-493e-b2f7-79b864874de0","resolution":{"observed_at":"2026-05-14T20:02:53.040706Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.08055","last_updated":"2023-06-13T18:22:24Z","snapshot_observed_at":"2026-08-18T19:21:59.409838Z","submitted_at":"2023-06-13T18:22:24Z","title":"Tune As You Scale: Hyperparameter Optimization For Compute Efficient Training","version":1},"cited_work":{"arxiv_id":"2306.08055","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.08055","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"938498f9-1c30-4ebe-967d-84fcbf50562f","year":null},"citing_paper":{"arxiv_id":"2605.13405","last_updated":"2026-05-13T12:00:11Z","snapshot_observed_at":"2026-08-13T03:09:22.814107Z","submitted_at":"2026-05-13T12:00:11Z","title":"When is Warmstarting Effective for Scaling Language Models?","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-14T20:00:47.126736Z"},"links":{"cited_paper":"/paper/2306.08055","citing_paper":"/paper/2605.13405"},"observation_digest":"sha256:be90c0527216aecf76f44e0566b95c5b2db1d637e51fbbba25ba441ad207cab0","observation_id":"039146de-b5d7-4940-b374-f3a16c2b65b2","resolution":{"observed_at":"2026-05-14T20:02:53.060870Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.03871","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T18:45:00.368940Z","title":"Filatov, J","venue":null,"work_id":"842e106c-7863-4b7a-89ed-aac75c9cab0e","year":2025},"citing_paper":{"arxiv_id":"2605.13405","last_updated":"2026-05-13T12:00:11Z","snapshot_observed_at":"2026-08-13T03:09:22.814107Z","submitted_at":"2026-05-13T12:00:11Z","title":"When is Warmstarting Effective for Scaling Language Models?","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-14T20:00:47.126736Z"},"links":{"citing_paper":"/paper/2605.13405"},"observation_digest":"sha256:a36b8bda138151d0bab6dc55ca4d69d0ddc3b65ce56681e2205ccdcb92f9ea2e","observation_id":"f92ea071-a9f2-409a-9722-4847d80c5611","resolution":{"observed_at":"2026-05-14T20:02:52.996815Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-08-17T20:47:46.242385Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":"2312.00752","doi":"10.48550/arxiv.2312.00752","metadata_source":"pith","pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","venue":"cs.LG","work_id":"4ee75248-1199-492c-a52f-6661e0f4adff","year":2023},"citing_paper":{"arxiv_id":"2605.13405","last_updated":"2026-05-13T12:00:11Z","snapshot_observed_at":"2026-08-13T03:09:22.814107Z","submitted_at":"2026-05-13T12:00:11Z","title":"When is Warmstarting Effective for Scaling Language Models?","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-14T20:00:47.126736Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2605.13405"},"observation_digest":"sha256:ddd6ddde78a7af09814a7a9364110f1f929b49480ff6e5a48629e8373374566d","observation_id":"9bfea212-151a-414c-bba6-af48498c7aa9","resolution":{"observed_at":"2026-05-14T20:02:53.080173Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-13T20:38:14.544227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-13T20:38:14.544227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":"2001.08361","doi":"10.1145/3616855.3635845","metadata_source":"pith","pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Laws for Neural Language Models","venue":"cs.LG","work_id":"b7dd8749-9c45-4977-ab9b-64478dce1ae8","year":2020},"citing_paper":{"arxiv_id":"2605.13405","last_updated":"2026-05-13T12:00:11Z","snapshot_observed_at":"2026-08-13T03:09:22.814107Z","submitted_at":"2026-05-13T12:00:11Z","title":"When is Warmstarting Effective for Scaling Language Models?","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-14T20:00:47.126736Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2605.13405"},"observation_digest":"sha256:106ed49308fc2a47233ac46862d30f0fa9a5f5d23300411d6a4344eca8f57bd2","observation_id":"5c55f784-bd38-4abc-9629-78247574edcd","resolution":{"observed_at":"2026-05-14T20:02:53.018294Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02469","last_updated":"2024-06-04T16:38:57Z","snapshot_observed_at":"2026-08-16T13:46:12.144157Z","submitted_at":"2024-06-04T16:38:57Z","title":"Landscape-Aware Growing: The Power of a Little LAG","version":1},"cited_work":{"arxiv_id":"2406.02469","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.02469","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c8293f8e-4341-4a1b-9a06-b2b663e6b19e","year":2024},"citing_paper":{"arxiv_id":"2605.13405","last_updated":"2026-05-13T12:00:11Z","snapshot_observed_at":"2026-08-13T03:09:22.814107Z","submitted_at":"2026-05-13T12:00:11Z","title":"When is Warmstarting Effective for Scaling Language Models?","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-14T20:00:47.126736Z"},"links":{"cited_paper":"/paper/2406.02469","citing_paper":"/paper/2605.13405"},"observation_digest":"sha256:c98856fe8909286ffff80bd832286cd5fcd5e68d6ae9cd07815fcc9688f2ade9","observation_id":"ff14f264-26cb-40b5-9440-8c52167e737d","resolution":{"observed_at":"2026-05-14T20:02:53.086528Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.06548","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2510.06548 , year=","venue":null,"work_id":"6e628b1f-a1b1-451e-84ce-3a469b302154","year":2025},"citing_paper":{"arxiv_id":"2605.13405","last_updated":"2026-05-13T12:00:11Z","snapshot_observed_at":"2026-08-13T03:09:22.814107Z","submitted_at":"2026-05-13T12:00:11Z","title":"When is Warmstarting Effective for Scaling Language Models?","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-14T20:00:47.126736Z"},"links":{"citing_paper":"/paper/2605.13405"},"observation_digest":"sha256:02d415a03b08ebd6aad8f17c8164312ffd8eba572200d0469651afd661d9daa7","observation_id":"ae6ef9ec-3d43-4dfc-9e67-911427ac3152","resolution":{"observed_at":"2026-05-14T20:02:53.034301Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.10545","last_updated":"2026-07-02T03:00:57Z","snapshot_observed_at":"2026-08-15T12:15:56.651831Z","submitted_at":"2026-02-11T05:37:22Z","title":"$\\mu$pscaling small models: Principled warm starts and hyperparameter transfer","version":2},"cited_work":{"arxiv_id":"2602.10545","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2602.10545","snapshot_observed_at":"2026-07-03T02:16:49.045063Z","title":null,"venue":null,"work_id":"38589029-87d1-4ec4-8f4b-5620d6f7f9b5","year":null},"citing_paper":{"arxiv_id":"2605.13405","last_updated":"2026-05-13T12:00:11Z","snapshot_observed_at":"2026-08-13T03:09:22.814107Z","submitted_at":"2026-05-13T12:00:11Z","title":"When is Warmstarting Effective for Scaling Language Models?","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-14T20:00:47.126736Z"},"links":{"cited_paper":"/paper/2602.10545","citing_paper":"/paper/2605.13405"},"observation_digest":"sha256:0cc0037da0daf1852f3938441137f1afcb1a937fe38d4cf0253b07d96819f238","observation_id":"d10de383-9733-4bf1-a916-3e68e1d5bdd6","resolution":{"observed_at":"2026-07-03T02:16:49.045063Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mihaylov, P","venue":null,"work_id":"55ed7bb3-672b-4f62-9754-9e00ec986a61","year":2018},"citing_paper":{"arxiv_id":"2605.13405","last_updated":"2026-05-13T12:00:11Z","snapshot_observed_at":"2026-08-13T03:09:22.814107Z","submitted_at":"2026-05-13T12:00:11Z","title":"When is Warmstarting Effective for Scaling Language Models?","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-14T20:00:47.126736Z"},"links":{"citing_paper":"/paper/2605.13405"},"observation_digest":"sha256:bea1d44add38e32070b562f20e0538edd18a69f9bdcef385f2e8d8eaef3ed89d","observation_id":"77694bcf-1c11-4ed6-b205-f317191741e4","resolution":{"observed_at":"2026-05-14T20:02:54.596060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2605.13405","last_updated":"2026-05-13T12:00:11Z","snapshot_observed_at":"2026-08-13T03:09:22.814107Z","submitted_at":"2026-05-13T12:00:11Z","title":"When is Warmstarting Effective for Scaling Language Models?","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-14T20:00:47.126736Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2605.13405"},"observation_digest":"sha256:2379f34c6c24bca3aaa45d775102865354bb660628e4e1d5eaedd57d1fe271b6","observation_id":"2e4b1609-7317-42c5-ac8d-00c81c037857","resolution":{"observed_at":"2026-05-14T20:02:53.098552Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Porian, M","venue":null,"work_id":"b5e02c7f-f1b2-41fc-8069-2095db6282a0","year":2024},"citing_paper":{"arxiv_id":"2605.13405","last_updated":"2026-05-13T12:00:11Z","snapshot_observed_at":"2026-08-13T03:09:22.814107Z","submitted_at":"2026-05-13T12:00:11Z","title":"When is Warmstarting Effective for Scaling Language Models?","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-14T20:00:47.126736Z"},"links":{"citing_paper":"/paper/2605.13405"},"observation_digest":"sha256:08b8d482604e50cca0580198b67b1b85748fd31c1d1c268edd76f358e355ad3b","observation_id":"f372e8cf-2faa-46e5-9a6c-cae219386f7f","resolution":{"observed_at":"2026-05-14T20:02:54.591746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.13880","last_updated":"2022-04-26T10:54:24Z","snapshot_observed_at":"2026-08-21T18:31:19.325852Z","submitted_at":"2021-05-28T14:43:26Z","title":"Knowledge Inheritance for Pre-trained Language Models","version":2},"cited_work":{"arxiv_id":"2105.13880","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2105.13880","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2105.13880 , year=","venue":null,"work_id":"795c64f3-7777-4135-bcd2-95b4d97f1416","year":2022},"citing_paper":{"arxiv_id":"2605.13405","last_updated":"2026-05-13T12:00:11Z","snapshot_observed_at":"2026-08-13T03:09:22.814107Z","submitted_at":"2026-05-13T12:00:11Z","title":"When is Warmstarting Effective for Scaling Language Models?","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-14T20:00:47.126736Z"},"links":{"cited_paper":"/paper/2105.13880","citing_paper":"/paper/2605.13405"},"observation_digest":"sha256:1bdd7c38ee0dd7c62b68bda1cdd63c9b033fd0f760c9f7b0386914594a545968","observation_id":"748e86c1-48ae-40d3-8071-563a27a0fb3a","resolution":{"observed_at":"2026-05-14T20:02:53.073632Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.11446","last_updated":"2022-01-21T18:39:38Z","snapshot_observed_at":"2026-08-09T14:52:01.161814Z","submitted_at":"2021-12-08T19:41:47Z","title":"Scaling Language Models: Methods, Analysis & Insights from Training Gopher","version":2},"cited_work":{"arxiv_id":"2112.11446","doi":"10.48550/arxiv.2112.11446","metadata_source":"pith","pith_arxiv_id":"2112.11446","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Language Models: Methods, Analysis & Insights from Training Gopher","venue":"cs.CL","work_id":"47ce8be9-e500-407d-af41-ac2d132215eb","year":2021},"citing_paper":{"arxiv_id":"2605.13405","last_updated":"2026-05-13T12:00:11Z","snapshot_observed_at":"2026-08-13T03:09:22.814107Z","submitted_at":"2026-05-13T12:00:11Z","title":"When is Warmstarting Effective for Scaling Language Models?","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-14T20:00:47.126736Z"},"links":{"cited_paper":"/paper/2112.11446","citing_paper":"/paper/2605.13405"},"observation_digest":"sha256:cee609fe834b1033fc8236489964c1a59beabb7a3ef80ef8bde3e4423dc918e3","observation_id":"95e7bbe6-0968-421c-86f1-41900fd61071","resolution":{"observed_at":"2026-05-14T20:02:53.054105Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12903","last_updated":"2024-09-20T16:22:37Z","snapshot_observed_at":"2026-08-20T10:26:58.889783Z","submitted_at":"2024-09-19T16:50:26Z","title":"Scaling Smart: Accelerating Large Language Model Pre-training with Small Model Initialization","version":2},"cited_work":{"arxiv_id":"2409.12903","doi":"10.48550/arxiv.2409.12903","metadata_source":"arxiv_reference","pith_arxiv_id":"2409.12903","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling smart: Accelerating large language model pre-training with small model initialization","venue":"arXiv (Cornell University)","work_id":"26390b69-5202-484a-bfa1-1165329220c4","year":2024},"citing_paper":{"arxiv_id":"2605.13405","last_updated":"2026-05-13T12:00:11Z","snapshot_observed_at":"2026-08-13T03:09:22.814107Z","submitted_at":"2026-05-13T12:00:11Z","title":"When is Warmstarting Effective for Scaling Language Models?","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-14T20:00:47.126736Z"},"links":{"cited_paper":"/paper/2409.12903","citing_paper":"/paper/2605.13405"},"observation_digest":"sha256:ab68afbd8c93ed448453ded039acae0ed84fe2dd40201953381e2727797f495b","observation_id":"7e33514b-bed9-43ce-b9dc-93a0ccf1b66e","resolution":{"observed_at":"2026-05-14T20:02:52.958845Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"67bfb98a-bc2a-4aea-97c9-0ceefd16fc4f","year":2024},"citing_paper":{"arxiv_id":"2605.13405","last_updated":"2026-05-13T12:00:11Z","snapshot_observed_at":"2026-08-13T03:09:22.814107Z","submitted_at":"2026-05-13T12:00:11Z","title":"When is Warmstarting Effective for Scaling Language Models?","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-14T20:00:47.126736Z"},"links":{"citing_paper":"/paper/2605.13405"},"observation_digest":"sha256:f1172ccc04f65d7796fa0e2afe00222924a06e120fed2f139aa9a68fa7ff2cee","observation_id":"41e1fed8-4fb3-4ef0-b270-046fc059d2d4","resolution":{"observed_at":"2026-05-14T20:02:54.600050Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09864","last_updated":"2023-11-08T13:36:32Z","snapshot_observed_at":"2026-08-17T06:56:20.644738Z","submitted_at":"2021-04-20T09:54:06Z","title":"RoFormer: Enhanced Transformer with Rotary Position Embedding","version":5},"cited_work":{"arxiv_id":"2104.09864","doi":"10.48550/arxiv.2104.09864","metadata_source":"pith","pith_arxiv_id":"2104.09864","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RoFormer: Enhanced Transformer with Rotary Position Embedding","venue":"cs.CL","work_id":"4e5eee26-cd04-4c7a-988f-3e6d1a1f0eb9","year":2021},"citing_paper":{"arxiv_id":"2605.13405","last_updated":"2026-05-13T12:00:11Z","snapshot_observed_at":"2026-08-13T03:09:22.814107Z","submitted_at":"2026-05-13T12:00:11Z","title":"When is Warmstarting Effective for Scaling Language Models?","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-14T20:00:47.126736Z"},"links":{"cited_paper":"/paper/2104.09864","citing_paper":"/paper/2605.13405"},"observation_digest":"sha256:88169df885edb109ad582426ce767e63134c18ce2380da1fb188e0023acd0fa5","observation_id":"2c524322-9ff8-46e3-8489-a20837f450fa","resolution":{"observed_at":"2026-05-14T20:02:52.964832Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-10T15:38:39.263809+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-10T15:38:39.263809+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2406.00153","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Thérien, C","venue":null,"work_id":"9a1a9e32-28a1-4169-9707-1a3aa37cf770","year":null},"citing_paper":{"arxiv_id":"2605.13405","last_updated":"2026-05-13T12:00:11Z","snapshot_observed_at":"2026-08-13T03:09:22.814107Z","submitted_at":"2026-05-13T12:00:11Z","title":"When is Warmstarting Effective for Scaling Language Models?","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-14T20:00:47.126736Z"},"links":{"citing_paper":"/paper/2605.13405"},"observation_digest":"sha256:594f8beb8cbf76e19a6a4727cdb0e9898751fcaec763015f1ae64d503e9713ab","observation_id":"3b246ad4-492b-48aa-8619-060e739f08a6","resolution":{"observed_at":"2026-05-14T20:02:52.984062Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":"2302.13971","doi":"10.48550/arxiv.2302.13971","metadata_source":"pith","pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaMA: Open and Efficient Foundation Language Models","venue":"cs.CL","work_id":"c018fc23-6f3f-4035-9d02-28a2173b2b9d","year":2023},"citing_paper":{"arxiv_id":"2605.13405","last_updated":"2026-05-13T12:00:11Z","snapshot_observed_at":"2026-08-13T03:09:22.814107Z","submitted_at":"2026-05-13T12:00:11Z","title":"When is Warmstarting Effective for Scaling Language Models?","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-14T20:00:47.126736Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2605.13405"},"observation_digest":"sha256:b85ed1986a1675d77a98f5b052fc6f58d60dffd4b1d3d9cb2d40bfc15d4476b8","observation_id":"7c3faa21-eb96-44fc-916c-1c97034859f2","resolution":{"observed_at":"2026-05-14T20:02:53.092487Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:17.350515+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:17.350515+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.04281","last_updated":"2026-04-05T21:47:41Z","snapshot_observed_at":"2026-07-13T10:12:39.064092Z","submitted_at":"2026-04-05T21:47:41Z","title":"Preservation Is Not Enough for Width Growth: Regime-Sensitive Selection of Dense LM Warm Starts","version":1},"cited_work":{"arxiv_id":"2604.04281","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.04281","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Preservation Is Not Enough for Width Growth: Regime-Sensitive Selection of Dense LM Warm Starts","venue":"cs.AI","work_id":"57743b22-4baa-44cc-b3f1-388a6e520e63","year":2026},"citing_paper":{"arxiv_id":"2605.13405","last_updated":"2026-05-13T12:00:11Z","snapshot_observed_at":"2026-08-13T03:09:22.814107Z","submitted_at":"2026-05-13T12:00:11Z","title":"When is Warmstarting Effective for Scaling Language Models?","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-14T20:00:47.126736Z"},"links":{"cited_paper":"/paper/2604.04281","citing_paper":"/paper/2605.13405"},"observation_digest":"sha256:5955b1395d89ac91df60d030f35b746814de71d5f4507387177ec62062485100","observation_id":"debbe55d-f196-454e-a243-ee78a484e021","resolution":{"observed_at":"2026-05-14T20:02:53.066891Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.03863","last_updated":"2024-05-23T06:08:37Z","snapshot_observed_at":"2026-08-19T14:32:38.763371Z","submitted_at":"2023-12-06T19:18:42Z","title":"Efficient Large Language Models: A Survey","version":4},"cited_work":{"arxiv_id":"2312.03863","doi":"10.48550/arxiv.2312.03863","metadata_source":"pith","pith_arxiv_id":"2312.03863","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Effi- cient large language models: A survey.arXiv preprint arXiv:2312.03863","venue":"cs.CL","work_id":"d859363b-b3a3-42c5-861b-b3b7776e4ff7","year":2023},"citing_paper":{"arxiv_id":"2605.13405","last_updated":"2026-05-13T12:00:11Z","snapshot_observed_at":"2026-08-13T03:09:22.814107Z","submitted_at":"2026-05-13T12:00:11Z","title":"When is Warmstarting Effective for Scaling Language Models?","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-14T20:00:47.126736Z"},"links":{"cited_paper":"/paper/2312.03863","citing_paper":"/paper/2605.13405"},"observation_digest":"sha256:cbdf9c3fd9d3472ca9c0f6770ed607dbef6282ff54ab8206779a8ac04f0aeca6","observation_id":"51e8d4f7-ff39-4b93-a88a-86c1aafbf229","resolution":{"observed_at":"2026-05-14T20:02:53.104922Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-05-20T14:22:10.21899+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T14:22:10.21899+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.02472","last_updated":"2026-06-29T15:41:30Z","snapshot_observed_at":"2026-08-15T11:15:45.302280Z","submitted_at":"2026-02-02T18:52:52Z","title":"SPARKLING: Balancing Signal Preservation and Symmetry Breaking for Width-Progressive Learning","version":2},"cited_work":{"arxiv_id":"2602.02472","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2602.02472","snapshot_observed_at":"2026-06-30T03:18:06.134504Z","title":"SPARKLING: Balancing signal preservation and symmetry breaking for width-progressive learning","venue":null,"work_id":"3bcc0808-6118-4b54-b0b7-15b2be0c101d","year":2026},"citing_paper":{"arxiv_id":"2605.13405","last_updated":"2026-05-13T12:00:11Z","snapshot_observed_at":"2026-08-13T03:09:22.814107Z","submitted_at":"2026-05-13T12:00:11Z","title":"When is Warmstarting Effective for Scaling Language Models?","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-14T20:00:47.126736Z"},"links":{"cited_paper":"/paper/2602.02472","citing_paper":"/paper/2605.13405"},"observation_digest":"sha256:996a58c92bd2f0a63507324cc64104e026503e1e15c3ebf57f68d316160f4da9","observation_id":"9d8fb988-dd5a-4056-b221-c6d9a04fc9e8","resolution":{"observed_at":"2026-06-30T03:18:06.134504Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"This family of parameteriza- tions describes scaling factors for the weights, the learning rate, and the standard deviation of the initialization","venue":null,"work_id":"42d5b322-959a-4e3f-9716-d34db60733c9","year":2024},"citing_paper":{"arxiv_id":"2605.13405","last_updated":"2026-05-13T12:00:11Z","snapshot_observed_at":"2026-08-13T03:09:22.814107Z","submitted_at":"2026-05-13T12:00:11Z","title":"When is Warmstarting Effective for Scaling Language Models?","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-14T20:00:47.126736Z"},"links":{"citing_paper":"/paper/2605.13405"},"observation_digest":"sha256:044c8bbbf66f91f0b53d613cec8402722bb681d445d233139d55afd6192cc1c8","observation_id":"c16acb1a-c7f0-45c2-af20-8b04ffe883ca","resolution":{"observed_at":"2026-05-14T20:02:54.580817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"B Synthetic Regression Benchmark We use the synthetic regression benchmark in which the target function is constructed to have a power-law Fourier spectrum [Qiu et al., 2025]","venue":null,"work_id":"d65c6349-d6a7-46d7-ba4c-b2d3ae676cef","year":2025},"citing_paper":{"arxiv_id":"2605.13405","last_updated":"2026-05-13T12:00:11Z","snapshot_observed_at":"2026-08-13T03:09:22.814107Z","submitted_at":"2026-05-13T12:00:11Z","title":"When is Warmstarting Effective for Scaling Language Models?","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-14T20:00:47.126736Z"},"links":{"citing_paper":"/paper/2605.13405"},"observation_digest":"sha256:46df9e85a11abe07fea50d4ca25ca67055ca269d14b19c91bcc12707eea1fbbd","observation_id":"d32acd80-7f12-41c7-a133-35a9ee3289aa","resolution":{"observed_at":"2026-05-14T20:02:54.575901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Grid Sizes.The base grid contains 8·3·5·3·2 = 720 configurations","venue":null,"work_id":"69f21117-3654-46a0-afe4-169b4ee08077","year":2048},"citing_paper":{"arxiv_id":"2605.13405","last_updated":"2026-05-13T12:00:11Z","snapshot_observed_at":"2026-08-13T03:09:22.814107Z","submitted_at":"2026-05-13T12:00:11Z","title":"When is Warmstarting Effective for Scaling Language Models?","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-14T20:00:47.126736Z"},"links":{"citing_paper":"/paper/2605.13405"},"observation_digest":"sha256:c8e9edea7c15fdd4c295971410df8c14c51914f668911b59c619047523a66728","observation_id":"b90c003f-7ebc-49ca-a25c-8ed92a5cc03f","resolution":{"observed_at":"2026-05-14T20:02:54.587430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"74b61734-5cd8-4140-9913-a5ad8ac2f82b","year":2023},"citing_paper":{"arxiv_id":"2605.13405","last_updated":"2026-05-13T12:00:11Z","snapshot_observed_at":"2026-08-13T03:09:22.814107Z","submitted_at":"2026-05-13T12:00:11Z","title":"When is Warmstarting Effective for Scaling Language Models?","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-14T20:00:47.126736Z"},"links":{"citing_paper":"/paper/2605.13405"},"observation_digest":"sha256:1d520a08681324f45b53b794b9f6a5de0ba6501fabea0cf69dccbd9bbc7054bb","observation_id":"3a46482d-97e8-4afe-838e-9c3fe9523c53","resolution":{"observed_at":"2026-05-14T20:02:54.604152Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"To study its sensitivity, we sweep the perturbation scale σperturb on a 32M→286M transfer, keeping the remaining SZP settings fixed","venue":null,"work_id":"bb2395f0-86b6-4330-8e62-a70eda4ee981","year":2024},"citing_paper":{"arxiv_id":"2605.13405","last_updated":"2026-05-13T12:00:11Z","snapshot_observed_at":"2026-08-13T03:09:22.814107Z","submitted_at":"2026-05-13T12:00:11Z","title":"When is Warmstarting Effective for Scaling Language Models?","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-14T20:00:47.126736Z"},"links":{"citing_paper":"/paper/2605.13405"},"observation_digest":"sha256:5c2b983cc254f8d4bd0e1798e9809ddda7fd93e4ba43bbcf787a742453c63a81","observation_id":"ab4b6cea-df64-4369-a6d9-d6306c6a0549","resolution":{"observed_at":"2026-05-14T20:02:54.608501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"6027a077-9899-43ac-ae08-a11cd926efd2","year":2048},"citing_paper":{"arxiv_id":"2605.13405","last_updated":"2026-05-13T12:00:11Z","snapshot_observed_at":"2026-08-13T03:09:22.814107Z","submitted_at":"2026-05-13T12:00:11Z","title":"When is Warmstarting Effective for Scaling Language Models?","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-14T20:00:47.126736Z"},"links":{"citing_paper":"/paper/2605.13405"},"observation_digest":"sha256:1fb93f6660b2c910643d04e0eb0ce25f2dfee1300c8514f7cf1d250e5cd7a992","observation_id":"6e87f098-361a-4a95-9f03-faf382187222","resolution":{"observed_at":"2026-05-14T20:02:54.612694Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Weight Decay.All experiments usezeroweight decay","venue":null,"work_id":"a072ca44-9261-4855-9300-c334d39f7687","year":2024},"citing_paper":{"arxiv_id":"2605.13405","last_updated":"2026-05-13T12:00:11Z","snapshot_observed_at":"2026-08-13T03:09:22.814107Z","submitted_at":"2026-05-13T12:00:11Z","title":"When is Warmstarting Effective for Scaling Language Models?","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-14T20:00:47.126736Z"},"links":{"citing_paper":"/paper/2605.13405"},"observation_digest":"sha256:e8be86eb9377bcf3d02b450a54e79af44a2ea4313eca4b3a55022366383db1e3","observation_id":"cf4664b6-c31a-47d5-aa2b-e648f41b8a4a","resolution":{"observed_at":"2026-05-14T20:02:54.617051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"e1f152e4-48d3-45c9-bf9e-ff33c53d3558","year":1920},"citing_paper":{"arxiv_id":"2605.13405","last_updated":"2026-05-13T12:00:11Z","snapshot_observed_at":"2026-08-13T03:09:22.814107Z","submitted_at":"2026-05-13T12:00:11Z","title":"When is Warmstarting Effective for Scaling Language Models?","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-14T20:00:47.126736Z"},"links":{"citing_paper":"/paper/2605.13405"},"observation_digest":"sha256:45466ac056e4c02ca9bebbdde32d80d96c9832d46f70a03696052a4374253070","observation_id":"7ac909cf-3983-4ab1-904b-967620676fc5","resolution":{"observed_at":"2026-05-14T20:02:54.562630Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"For the reported language-model experiments, we report GPU-hour ranges based on the number of completed runs, hardware allocation, and typical wall-clock time per target scale","venue":null,"work_id":"4a6a70f7-d238-4061-9fce-4d36cf07e4d7","year":2023},"citing_paper":{"arxiv_id":"2605.13405","last_updated":"2026-05-13T12:00:11Z","snapshot_observed_at":"2026-08-13T03:09:22.814107Z","submitted_at":"2026-05-13T12:00:11Z","title":"When is Warmstarting Effective for Scaling Language Models?","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-14T20:00:47.126736Z"},"links":{"citing_paper":"/paper/2605.13405"},"observation_digest":"sha256:f7560d07bfbe6ef320e196583a9694f33b68ee3bb0424f8e03b348884323f06c","observation_id":"bb041131-db90-4501-884a-c8d60784a859","resolution":{"observed_at":"2026-05-14T20:02:54.567503Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"copy-and-rescale","venue":null,"work_id":"981e9faa-c799-4ee4-addc-06d9e3a61088","year":2016},"citing_paper":{"arxiv_id":"2605.13405","last_updated":"2026-05-13T12:00:11Z","snapshot_observed_at":"2026-08-13T03:09:22.814107Z","submitted_at":"2026-05-13T12:00:11Z","title":"When is Warmstarting Effective for Scaling Language Models?","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-14T20:00:47.126736Z"},"links":{"citing_paper":"/paper/2605.13405"},"observation_digest":"sha256:d245056cd2f48bb6580079f42f960a9ef7e6cf4b3bb2b20da8a427481232cb60","observation_id":"73987363-78ce-4c61-887f-1248229eae0b","resolution":{"observed_at":"2026-05-14T20:02:54.571721Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Following Approach 3 of Hoffmann et al","venue":null,"work_id":"9b00296f-1ad0-4a57-b9d1-fda9022d8878","year":2022},"citing_paper":{"arxiv_id":"2605.13405","last_updated":"2026-05-13T12:00:11Z","snapshot_observed_at":"2026-08-13T03:09:22.814107Z","submitted_at":"2026-05-13T12:00:11Z","title":"When is Warmstarting Effective for Scaling Language Models?","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-14T20:00:47.126736Z"},"links":{"citing_paper":"/paper/2605.13405"},"observation_digest":"sha256:40d4aa5697c9193baa03b7d307b90766f9ab4592b1d28225fe0c4a8a458b939e","observation_id":"a0a6ed75-0ff1-49d8-bca1-ce9ae6f7050c","resolution":{"observed_at":"2026-05-14T20:02:54.559030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.13405","last_updated":"2026-05-13T12:00:11Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-13T03:09:22.814107Z","submitted_at":"2026-05-13T12:00:11Z","title":"When is Warmstarting Effective for Scaling Language Models?"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":4,"verified_exact":23,"verified_fuzzy":9},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 0 inbound Pith citation observations for arXiv:2605.13405."}