{"as_of":"2026-08-20T21:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:749adfae5a2f0a963f9f55e2f602d040372f92a8b451e26f02931f79beb774f1","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-08T12:00:49.127471Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T04:19:38.424519Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-02T11:56:55.992114Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-08-14T17:08:26.107852Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"cited_work":{"arxiv_id":"2605.06654","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.06654","snapshot_observed_at":"2026-07-02T11:56:55.992114Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","venue":"cs.LG","work_id":"cfd2294f-6e60-4281-b49d-edcaaaa55ab8","year":2026},"citing_paper":{"arxiv_id":"2606.06418","last_updated":"2026-06-04T17:22:58Z","snapshot_observed_at":"2026-08-16T10:17:57.703806Z","submitted_at":"2026-06-04T17:22:58Z","title":"Double Preconditioning (DoPr): Optimization for Test-Time Performance, not Validation Loss","version":1},"reference_index":185,"source":"arxiv_source","source_observed_at":"2026-06-28T02:35:39.845487Z"},"links":{"cited_paper":"/paper/2605.06654","citing_paper":"/paper/2606.06418"},"observation_digest":"sha256:31cc0a6b866637fc67f2db5d0056af299545111be75cfbf3c8e0bdb2d0201482","observation_id":"0dcd802d-c6f2-4675-a64f-0c12f2d4c537","resolution":{"observed_at":"2026-07-02T11:56:55.993275Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-08-14T17:08:26.107852Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.06654","snapshot_observed_at":"2026-08-01T21:13:39.201865Z","title":"Liu,Z.;Zhang,R.;Wang,Z.;Zhao,Y.;Su,Y.;Yang,Z.;andZhang, Z","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16169","last_updated":"2026-08-02T14:51:38Z","snapshot_observed_at":"2026-08-18T02:02:01.039134Z","submitted_at":"2026-07-17T17:49:05Z","title":"When Does Muon Help Agentic Reinforcement Learning?","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T21:13:39.201865Z"},"links":{"cited_paper":"/paper/2605.06654","citing_paper":"/paper/2607.16169"},"observation_digest":"sha256:0e4fb3ab34d9405cc90d82f52e75810d9938759499a16641ca0138ccbe324834","observation_id":"259292d8-88cf-4435-a378-1f4e34a0f944","resolution":{"observed_at":"2026-08-01T21:13:39.201865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-08-14T17:08:26.107852Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.06654","snapshot_observed_at":"2026-08-04T04:19:38.424519Z","title":"Liu,Z.;Zhang,R.;Wang,Z.;Zhao,Y.;Su,Y.;Yang,Z.;andZhang, Z","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16169","last_updated":"2026-08-02T14:51:38Z","snapshot_observed_at":"2026-08-18T02:02:01.039134Z","submitted_at":"2026-07-17T17:49:05Z","title":"When Does Muon Help Agentic Reinforcement Learning?","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T04:19:38.424519Z"},"links":{"cited_paper":"/paper/2605.06654","citing_paper":"/paper/2607.16169"},"observation_digest":"sha256:4bc7893cb6c2ef6da7ed1e12cb3dd5d608fdbbb16fce9e0a5515b984fd8d4af7","observation_id":"31f5b1af-31b0-4aac-9ee3-6833d9bf061e","resolution":{"observed_at":"2026-08-04T04:19:38.424519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.06654/citation-record","integrity":"/paper/2605.06654/integrity","json":"/paper/2605.06654/citation-record.json","paper":"/paper/2605.06654"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.16928","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T14:29:54.485236Z","title":"arXiv preprint arXiv:2512.16928 , year=","venue":null,"work_id":"06ab448a-e346-485e-8f8b-37394e6aacd4","year":2002},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-08-14T17:08:26.107852Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:9bcf205fbca239a9b516192815b4bc70e49002f52bc9049ab898beec8dcfc361","observation_id":"c2207734-b6f6-42fc-a872-15b9fd029f84","resolution":{"observed_at":"2026-05-11T19:26:08.621624Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.08056","last_updated":"2020-02-19T08:45:54Z","snapshot_observed_at":"2026-08-18T22:59:20.269870Z","submitted_at":"2020-02-19T08:45:54Z","title":"The Geometry of Sign Gradient Descent","version":1},"cited_work":{"arxiv_id":"2002.08056","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2002.08056","snapshot_observed_at":"2026-07-04T10:09:44.617472Z","title":"The geometry of sign gradient descent.arXiv preprint arXiv:2002.08056","venue":null,"work_id":"f21e3dd4-b8a2-4d68-a027-50f7a8adb90a","year":2002},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-08-14T17:08:26.107852Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"cited_paper":"/paper/2002.08056","citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:b03db7576482ff0f9731f21b2218f8fe622cff12c23be737cc49428b502f9fb0","observation_id":"1a26534a-2a18-4038-9238-482c3f75d6d6","resolution":{"observed_at":"2026-05-11T19:26:08.613799Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.20325","last_updated":"2024-12-06T14:09:22Z","snapshot_observed_at":"2026-08-12T12:26:45.359430Z","submitted_at":"2024-09-30T14:26:12Z","title":"Old Optimizer, New Norm: An Anthology","version":2},"cited_work":{"arxiv_id":"2409.20325","doi":"10.48550/arxiv.2409.20325","metadata_source":"pith","pith_arxiv_id":"2409.20325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Old Optimizer, New Norm: An Anthology","venue":"cs.LG","work_id":"c0089db6-7349-44fd-b103-0d7b36142bab","year":2024},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-08-14T17:08:26.107852Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"cited_paper":"/paper/2409.20325","citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:2fe8af101e658717a3f1e785d13f037250b52b9eaddc047983f3a41a0e0a4150","observation_id":"7f285ec0-7c51-4989-94a2-5e67b5bff8f7","resolution":{"observed_at":"2026-05-16T07:27:53.041705Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09673","last_updated":"2024-09-20T21:21:56Z","snapshot_observed_at":"2026-08-16T13:52:21.979655Z","submitted_at":"2024-05-15T19:27:45Z","title":"LoRA Learns Less and Forgets Less","version":2},"cited_work":{"arxiv_id":"2405.09673","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.09673","snapshot_observed_at":"2026-07-04T19:30:07.259186Z","title":"Biderman, J","venue":null,"work_id":"ca00d37c-5297-4fa7-b692-52260eb614f2","year":2024},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-08-14T17:08:26.107852Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"cited_paper":"/paper/2405.09673","citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:d30fdcdf0f8dcc83e62b04a57dca951c90c1628fb2d3e085ab34deae4f68bb04","observation_id":"ad4e9f03-6c4e-478a-826b-f9b537b6122c","resolution":{"observed_at":"2026-05-11T19:26:08.668232Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02285","last_updated":"2025-06-09T22:08:17Z","snapshot_observed_at":"2026-08-14T08:48:49.903804Z","submitted_at":"2025-06-02T21:51:04Z","title":"Why Gradients Rapidly Increase Near the End of Training","version":2},"cited_work":{"arxiv_id":"2506.02285","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02285","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Why gradients rapidly increase near the end of training.arXiv preprint arXiv: 2506.02285","venue":null,"work_id":"d7d91978-0bbd-407c-b5ea-208029246d0d","year":2025},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-08-14T17:08:26.107852Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"cited_paper":"/paper/2506.02285","citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:ba9cc1481f5de0b93466dce6363cbd605441912141fae84ee271a8f2a6495f11","observation_id":"2c37b115-b48a-4f6b-83e9-cfa5e1166495","resolution":{"observed_at":"2026-05-11T19:26:08.465260Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":"2407.21783","doi":"10.1016/s0749-0720(15","metadata_source":"pith","pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"The Llama 3 Herd of Models","venue":"cs.AI","work_id":"1549a635-88af-4ac1-acfe-51ae7bb53345","year":2024},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-08-14T17:08:26.107852Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:ff2aba715858702f6dcde5424cc1a1e27044c19e41a72f03ae8dac0dc559edcf","observation_id":"9aa17456-7f4c-4915-8828-f9adb80ba8cb","resolution":{"observed_at":"2026-05-11T19:26:08.588850Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.08415","last_updated":"2023-06-06T01:53:32Z","snapshot_observed_at":"2026-08-13T19:48:28.322536Z","submitted_at":"2016-06-27T19:20:40Z","title":"Gaussian Error Linear Units (GELUs)","version":5},"cited_work":{"arxiv_id":"1606.08415","doi":"10.18653/v1/n19-1122","metadata_source":"pith","pith_arxiv_id":"1606.08415","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gaussian Error Linear Units (GELUs)","venue":"cs.LG","work_id":"0466fd22-03a1-4a61-af0a-a900e77bb023","year":2016},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-08-14T17:08:26.107852Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"cited_paper":"/paper/1606.08415","citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:9eb4cdfd4d154eddb5121de7299392e73c724048029bcb890e19fc29dbd3aadf","observation_id":"7d23d21a-41e1-4567-924e-045438fda472","resolution":{"observed_at":"2026-05-11T19:26:08.454674Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.00099","last_updated":"2023-05-09T14:08:17Z","snapshot_observed_at":"2026-08-16T16:49:06.318226Z","submitted_at":"2022-06-30T20:48:26Z","title":"Measuring Forgetting of Memorized Training Examples","version":2},"cited_work":{"arxiv_id":"2207.00099","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2207.00099","snapshot_observed_at":"2026-07-04T21:10:09.130679Z","title":"Measuring forgetting of memorized training examples","venue":null,"work_id":"77c404a2-a502-42d0-aa44-85d03ec09bf9","year":2022},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-08-14T17:08:26.107852Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"cited_paper":"/paper/2207.00099","citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:5559439ea3d77ed9fe486a44ad8f33d31c1a7be41975f8881315a27c62deaa5d","observation_id":"75507299-eb8a-4078-83fb-a22a249ceb3b","resolution":{"observed_at":"2026-05-11T19:26:08.593021Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04592","last_updated":"2025-06-06T04:08:17Z","snapshot_observed_at":"2026-08-16T13:45:18.555901Z","submitted_at":"2024-06-07T02:55:57Z","title":"Provable Complexity Improvement of AdaGrad over SGD: Upper and Lower Bounds in Stochastic Non-Convex Optimization","version":3},"cited_work":{"arxiv_id":"2406.04592","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.04592","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Provable complexity improvement of adagrad over sgd: Upper and lower bounds in stochastic non-convex optimization","venue":null,"work_id":"cdbc19d9-63d7-4304-9fc2-b65420a15f1d","year":2024},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-08-14T17:08:26.107852Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"cited_paper":"/paper/2406.04592","citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:19b84739faae6c24be510fe8139247bfe80e102182c3711ce8359d72313bff4e","observation_id":"7ee54a71-d2e5-47f8-929b-96ac55cfdafa","resolution":{"observed_at":"2026-05-11T19:26:08.606390Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.02276","last_updated":"2026-02-02T16:17:38Z","snapshot_observed_at":"2026-08-12T00:25:39.214406Z","submitted_at":"2026-02-02T16:17:38Z","title":"Kimi K2.5: Visual Agentic Intelligence","version":1},"cited_work":{"arxiv_id":"2602.02276","doi":"10.48550/arxiv.2602.02276","metadata_source":"pith","pith_arxiv_id":"2602.02276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kimi K2.5: Visual Agentic Intelligence","venue":"cs.CL","work_id":"d690be8f-5d53-49b0-b1e7-79668eb8fcdb","year":2026},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-08-14T17:08:26.107852Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"cited_paper":"/paper/2602.02276","citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:629705f1d1145b43e006bc5aa6e48b1419f3e80633515c0fd4abb4a269cc50b5","observation_id":"08cf0d11-a3bd-41b6-be38-ff7898efc49b","resolution":{"observed_at":"2026-05-11T19:26:08.580519Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-07T20:38:24.673777+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-07T20:38:24.673777+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-17T19:26:44.032537Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":"1412.6980","doi":"10.1002/mrm.28086","metadata_source":"pith","pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Adam: A Method for Stochastic Optimization","venue":"cs.LG","work_id":"1910796d-9b52-4683-bf5c-de9632c1028b","year":2014},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-08-14T17:08:26.107852Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:b632a6b7e5f103c8fc02f6b0380cf76eeebb775fa041297fef83d7b93d901af7","observation_id":"36fc57b1-e1fc-445b-9dbc-effb24ae7b67","resolution":{"observed_at":"2026-05-11T19:26:08.584831Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13960","last_updated":"2023-04-27T05:41:13Z","snapshot_observed_at":"2026-08-19T14:21:30.667758Z","submitted_at":"2023-04-27T05:41:13Z","title":"Noise Is Not the Main Factor Behind the Gap Between SGD and Adam on Transformers, but Sign Descent Might Be","version":1},"cited_work":{"arxiv_id":"2304.13960","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.13960","snapshot_observed_at":"2026-07-03T23:59:07.455071Z","title":"Noise is not the main factor behind the gap between sgd and adam on transformers, but sign descent might be","venue":null,"work_id":"8b55b951-9eb5-4661-944d-3ff7735beb98","year":2023},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-08-14T17:08:26.107852Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"cited_paper":"/paper/2304.13960","citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:1e2e6e24a264e94d1dc0f80a730e4e199ffccc234c9dbc62552d0a5908f3891a","observation_id":"f777e85e-7854-414a-a13e-ad3cc895b8ce","resolution":{"observed_at":"2026-05-11T19:26:08.565537Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-16T22:48:15.725816Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-08-14T17:08:26.107852Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:f748a55055b3050ba6a9bfecbc58b42ce48c616c36730545ee34a1f639a549b5","observation_id":"4ac87229-543a-4618-82ed-a76d92920cdc","resolution":{"observed_at":"2026-05-11T23:02:52.981675Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15244","last_updated":"2024-10-14T03:44:54Z","snapshot_observed_at":"2026-08-17T03:28:07.666441Z","submitted_at":"2024-06-21T15:29:31Z","title":"AdaGrad under Anisotropic Smoothness","version":2},"cited_work":{"arxiv_id":"2406.15244","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.15244","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Adagrad under anisotropic smoothness","venue":null,"work_id":"94bb6ea1-28c4-44e3-bea7-dfee267edc79","year":null},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-08-14T17:08:26.107852Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"cited_paper":"/paper/2406.15244","citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:ce70db0ee1da8afd3d0e660406b128e899addf4a52daea2e968f39a80306f58e","observation_id":"20218c8c-a913-4081-90e6-74a40eeb76b6","resolution":{"observed_at":"2026-05-11T19:26:08.577041Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1608.03983","last_updated":"2017-05-03T16:28:09Z","snapshot_observed_at":"2026-07-06T05:06:55.589962Z","submitted_at":"2016-08-13T13:46:05Z","title":"SGDR: Stochastic Gradient Descent with Warm Restarts","version":5},"cited_work":{"arxiv_id":"1608.03983","doi":"10.21203/rs.3.rs-7055642/v1","metadata_source":"pith","pith_arxiv_id":"1608.03983","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"SGDR: Stochastic Gradient Descent with Warm Restarts","venue":"cs.LG","work_id":"ad476478-c5ea-495b-a454-168c504bbfcc","year":2016},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-08-14T17:08:26.107852Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"cited_paper":"/paper/1608.03983","citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:635fb508df5a8b58eb8969001193974fc15b75c62b92fceabfbea262dbcec759","observation_id":"96edba34-090c-4e5c-b12d-8427fd30a166","resolution":{"observed_at":"2026-05-11T19:26:08.573133Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":"1711.05101","doi":"10.1137/1.9781611972825.47","metadata_source":"pith","pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Decoupled Weight Decay Regularization","venue":"cs.LG","work_id":"07ef7360-d385-4033-83f7-8384a6325204","year":2017},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-08-14T17:08:26.107852Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:9602de469edeab1818a326793741a206524f69319a9f9a89b6f635bd65edf4f4","observation_id":"4f098732-d3b8-4da8-b2ed-62c4bafda5c2","resolution":{"observed_at":"2026-05-11T19:26:08.600508Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07097","last_updated":"2025-04-09T17:59:42Z","snapshot_observed_at":"2026-08-16T12:42:36.700164Z","submitted_at":"2025-04-09T17:59:42Z","title":"Sculpting Subspaces: Constrained Full Fine-Tuning in LLMs for Continual Learning","version":1},"cited_work":{"arxiv_id":"2504.07097","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.07097","snapshot_observed_at":"2026-07-02T12:36:56.945120Z","title":"Sculpt- ing subspaces: Constrained full fine-tuning in llms for continual learning","venue":null,"work_id":"ea02711d-672d-40e9-b679-eceb72a528a8","year":2025},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-08-14T17:08:26.107852Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"cited_paper":"/paper/2504.07097","citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:2f5e4c5a20594a75d5e41efa0f1279baad148954b43c24a52408506b98d3ccfb","observation_id":"f4527207-05ea-4dd8-9507-941d1a833de2","resolution":{"observed_at":"2026-05-11T19:26:08.634575Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.17802","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T22:25:39.566248Z","title":"Unbiased gradient low-rank projection.arXiv preprint arXiv:2510.17802","venue":null,"work_id":"1f71ca93-2c40-4170-8857-d1af388500ff","year":null},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-08-14T17:08:26.107852Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:b4f02c7eec032ce7b42c5122ebfb80df26b244357629c972da889ed38d451b52","observation_id":"1e85877e-44bc-4d15-a1a8-5749c9a97cc2","resolution":{"observed_at":"2026-05-11T19:26:08.558293Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07529","last_updated":"2025-06-06T13:42:19Z","snapshot_observed_at":"2026-08-16T22:34:28.103547Z","submitted_at":"2025-02-11T13:10:34Z","title":"Training Deep Learning Models with Norm-Constrained LMOs","version":2},"cited_work":{"arxiv_id":"2502.07529","doi":"10.48550/arxiv.2502.07529","metadata_source":"pith","pith_arxiv_id":"2502.07529","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Training Deep Learning Models with Norm-Constrained LMOs","venue":"cs.LG","work_id":"4f1b774a-8ada-4d79-a90b-520511fce5d0","year":2025},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-08-14T17:08:26.107852Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"cited_paper":"/paper/2502.07529","citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:d9e234f6ca874afea5accf30073cbc2bdbc1b34fce7fbeecb55a045bc3610c72","observation_id":"8de20694-9b62-4668-9ea0-79d4fddf3e94","resolution":{"observed_at":"2026-05-21T21:22:37.653978Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"icarl: Incre- mental classifier and representation learning","venue":null,"work_id":"35219150-3a72-46ca-abfc-06591ab07c2c","year":2001},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-08-14T17:08:26.107852Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:b983b739b18dbc59a313e6860109e11275b422dd100f0d187196a81985869316","observation_id":"f1f02a4f-4515-4026-a6d2-bd867ff84826","resolution":{"observed_at":"2026-05-26T13:47:25.028824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09237","last_updated":"2019-04-19T16:21:38Z","snapshot_observed_at":"2026-08-14T16:43:55.734754Z","submitted_at":"2019-04-19T16:21:38Z","title":"On the Convergence of Adam and Beyond","version":1},"cited_work":{"arxiv_id":"1904.09237","doi":"10.1016/s0893-6080(98","metadata_source":"pith","pith_arxiv_id":"1904.09237","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"On the Convergence of Adam and Beyond","venue":"cs.LG","work_id":"c727f303-212d-4d55-8c2c-19128e3c9c3f","year":2019},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-08-14T17:08:26.107852Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"cited_paper":"/paper/1904.09237","citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:f50ea13639284c9175a793a702d41956030db6df3fbf82ef9bc30a22ee9c3815","observation_id":"7a950eec-14aa-4e47-ab6c-b8982a1f4b85","resolution":{"observed_at":"2026-05-11T19:26:08.480366Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.13627","last_updated":"2026-08-03T12:13:35Z","snapshot_observed_at":"2026-08-16T00:16:20.653666Z","submitted_at":"2026-04-15T08:53:42Z","title":"(How) Learning Rates Regulate Catastrophic Overtraining","version":2},"cited_work":{"arxiv_id":"2604.13627","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.13627","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"(How) Learning Rates Regulate Catastrophic Overtraining","venue":"cs.LG","work_id":"eb43b7c7-13aa-473e-ac68-12112acd59fc","year":2026},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-08-14T17:08:26.107852Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"cited_paper":"/paper/2604.13627","citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:066fed1cbd0bc5ff70a6ee30d1d679227330f5b1e28aac0fcbbf44a34c199659","observation_id":"e69b531a-65e8-493c-9425-606bceeda5fb","resolution":{"observed_at":"2026-05-11T19:26:08.516618Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-14T19:59:46.270724Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"cited_work":{"arxiv_id":"2509.01440","doi":"10.48550/arxiv.2509.01440","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01440","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Benchmarking optimizers for large language model pretraining.arXiv preprint arXiv:2509.01440","venue":"ArXiv.org","work_id":"0365a535-39b7-4c6c-8ef2-d08314864789","year":2025},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-08-14T17:08:26.107852Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"cited_paper":"/paper/2509.01440","citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:220db84680636e73b16acea7c059e6f4ff05ae3345011007773aadd4ca130eab","observation_id":"c241f457-713a-41f8-9d3e-7a495da4d34b","resolution":{"observed_at":"2026-05-11T19:26:08.543311Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.05202","last_updated":"2020-02-12T19:57:13Z","snapshot_observed_at":"2026-08-11T06:21:56.129166Z","submitted_at":"2020-02-12T19:57:13Z","title":"GLU Variants Improve Transformer","version":1},"cited_work":{"arxiv_id":"2002.05202","doi":"10.48550/arxiv.2002.05202","metadata_source":"pith","pith_arxiv_id":"2002.05202","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GLU Variants Improve Transformer","venue":"cs.LG","work_id":"17d0763c-1016-41ab-a478-478e890765eb","year":2020},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-08-14T17:08:26.107852Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"cited_paper":"/paper/2002.05202","citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:19ad7c13be709d61b8655b82f9f8c57daf1f59aad1499fee561c4e4112e6cba6","observation_id":"fd97bb7d-23c4-4df2-b005-67030e28bb84","resolution":{"observed_at":"2026-05-11T19:26:08.625847Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:50:07.002485+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:50:07.002485+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2410.21228","doi":"10.48550/arxiv.2410.21228","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Lora vs full fine-tuning: An illusion of equivalence","venue":"arXiv (Cornell University)","work_id":"64c35e8b-7441-4e1e-81d0-4c8b33204da6","year":2025},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-08-14T17:08:26.107852Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:f5d4736805a0905a638b6f80f6c21c65501ef2b26e45efb8fd7670f478c9646d","observation_id":"ee1c7cdd-d492-4dec-a458-30197356ce85","resolution":{"observed_at":"2026-05-11T19:26:08.547227Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19206","last_updated":"2025-03-28T02:10:05Z","snapshot_observed_at":"2026-08-16T12:47:09.951548Z","submitted_at":"2025-03-24T23:11:56Z","title":"Overtrained Language Models Are Harder to Fine-Tune","version":2},"cited_work":{"arxiv_id":"2503.19206","doi":"10.48550/arxiv.2503.19206","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.19206","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Overtrained language models are harder to fine-tune","venue":"ArXiv.org","work_id":"7809cd57-b457-491d-b50a-dbaaf8aef56b","year":2025},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-08-14T17:08:26.107852Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"cited_paper":"/paper/2503.19206","citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:695d3c0e27cb04686356c6a313faea0e24b9d8446e33e9d01b776ccc2caeb040","observation_id":"b97e7a15-a4d7-4248-9177-2ad6489cbcff","resolution":{"observed_at":"2026-05-11T19:26:08.539517Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1002.4862","last_updated":"2010-02-25T20:31:05Z","snapshot_observed_at":"2026-08-15T05:25:31.056048Z","submitted_at":"2010-02-25T20:31:05Z","title":"Less Regret via Online Conditioning","version":1},"cited_work":{"arxiv_id":"1002.4862","doi":null,"metadata_source":"pith","pith_arxiv_id":"1002.4862","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Less Regret via Online Conditioning","venue":"cs.LG","work_id":"564d428e-9b87-4f71-adfa-dab45e00bb16","year":2010},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-08-14T17:08:26.107852Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"cited_paper":"/paper/1002.4862","citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:f92495f134fa895cd07345a944d662ed1c40135188c286bbb5be1c967e709ce2","observation_id":"ab44dce8-7b8b-44cb-902e-4aa2bd1a0bc3","resolution":{"observed_at":"2026-05-11T19:26:08.508615Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.00674","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T06:29:38.165345Z","title":"ArXiv Preprint: 2511.00674 , Year =","venue":null,"work_id":"5e0fa664-f7a6-4ce3-934b-dd6d242ac7c6","year":2025},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-08-14T17:08:26.107852Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:8b13349bf5a225e265e7d187e3821c753f1e85c29d2ee1e5e2aa9e169adf53e6","observation_id":"1e3575ad-ab31-4b6d-8858-e9664cfd7ddf","resolution":{"observed_at":"2026-05-11T19:26:08.610339Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":"2307.09288","doi":"10.24963/ijcai.2025/706","metadata_source":"pith","pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","venue":"cs.CL","work_id":"68a5177f-d644-44c1-bd4f-4e5278c22f5d","year":2023},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-08-14T17:08:26.107852Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:19057d2c4c70b41d3fc818d58556ce1d64026debb8466ccd7e52f368a4550b6d","observation_id":"d8f36dc5-1a7a-4d95-a955-201b4894fdc2","resolution":{"observed_at":"2026-05-11T19:26:08.512185Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11321","last_updated":"2025-01-31T18:52:42Z","snapshot_observed_at":"2026-08-15T04:58:58.957938Z","submitted_at":"2024-09-17T16:18:05Z","title":"SOAP: Improving and Stabilizing Shampoo using Adam","version":2},"cited_work":{"arxiv_id":"2409.11321","doi":"10.48550/arxiv.2409.11321","metadata_source":"pith","pith_arxiv_id":"2409.11321","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SOAP: Improving and Stabilizing Shampoo using Adam","venue":"cs.LG","work_id":"65c9d9eb-0524-49bd-9aa5-2756ce24dc7f","year":2024},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-08-14T17:08:26.107852Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"cited_paper":"/paper/2409.11321","citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:507b1b92f7cce0b7ec382273555e6816b88006170b3bab2a78008ebbdfd1a9a8","observation_id":"29e05265-12eb-40cc-95fd-de75bd8b3692","resolution":{"observed_at":"2026-05-15T01:02:28.631723Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.26030","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T06:29:38.185587Z","title":"Muon outperforms adam in tail-end associative memory learning","venue":null,"work_id":"557e3d1a-f8b7-4fbe-9dc8-9432aa0bb507","year":2025},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-08-14T17:08:26.107852Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:8c090d51634914ae3b7cc649d31e8b905fb2c754c4ba8a0e1c9324433d3342b3","observation_id":"6a34c718-50c3-41dc-a453-89bed6c500bc","resolution":{"observed_at":"2026-05-11T19:26:08.554861Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02120","last_updated":"2024-06-07T02:50:56Z","snapshot_observed_at":"2026-08-16T22:22:41.448725Z","submitted_at":"2023-12-04T18:50:35Z","title":"Magicoder: Empowering Code Generation with OSS-Instruct","version":2},"cited_work":{"arxiv_id":"2312.02120","doi":"10.48550/arxiv.2312.02120","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.02120","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Magicoder: Empowering code generation with oss-instruct","venue":"arXiv (Cornell University)","work_id":"1ea1e0ea-c781-4443-983d-cd560e111e59","year":2024},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-08-14T17:08:26.107852Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"cited_paper":"/paper/2312.02120","citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:650800bdffd4a13933a303887fa6b21fd4b76e9e8f9aec26fb8c2b692d7f7178","observation_id":"8347914b-4c3a-4e8e-aefe-e7d261dbc576","resolution":{"observed_at":"2026-05-11T19:26:08.655977Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02046","last_updated":"2025-09-04T19:22:04Z","snapshot_observed_at":"2026-08-18T07:20:56.759709Z","submitted_at":"2025-09-02T07:43:22Z","title":"Fantastic Pretraining Optimizers and Where to Find Them","version":2},"cited_work":{"arxiv_id":"2509.02046","doi":"10.48550/arxiv.2509.02046","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.02046","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fantastic pretraining optimizers and where to find them.arXiv preprint arXiv:2509.02046","venue":"ArXiv.org","work_id":"692b6526-174d-4275-b06f-8afe06e28a6c","year":2025},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-08-14T17:08:26.107852Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"cited_paper":"/paper/2509.02046","citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:9b770f715d997ea2cad34f46153e88915c45f1fe4c456a89b5cb7337f95e247d","observation_id":"fbb0ff62-ebc5-4ca2-8e0d-a4c89742f877","resolution":{"observed_at":"2026-05-11T19:26:08.470520Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10537","last_updated":"2025-07-15T06:22:08Z","snapshot_observed_at":"2026-08-16T12:50:18.277375Z","submitted_at":"2025-03-13T16:51:59Z","title":"Structured Preconditioners in Adaptive Optimization: A Unified Analysis","version":2},"cited_work":{"arxiv_id":"2503.10537","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10537","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Structured preconditioners in adaptive optimization: A unified analysis.arXiv preprint arXiv:2503.10537","venue":null,"work_id":"b15e83a3-d996-4fb3-ab6b-f585a222bb3b","year":2025},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-08-14T17:08:26.107852Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"cited_paper":"/paper/2503.10537","citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:8db6d018c1f6c2f8eccb033fc52c013b8f55a85f6631eaec986f491ccfc55c9c","observation_id":"804a2766-31e4-49f3-92f5-fb3a064bf02b","resolution":{"observed_at":"2026-05-11T19:26:08.660083Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.08393","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T20:30:07.779389Z","title":"Controlled llm training on spectral sphere","venue":null,"work_id":"69f692bf-c6bb-45da-9428-f2f0a648156c","year":2026},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-08-14T17:08:26.107852Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:e925e7b7a23875bf688d3fbb6af0a4b0ab4c464c079d822820e26e2b97ce8e85","observation_id":"ccac7eb6-8554-4f1d-ba41-a2562d30ea4f","resolution":{"observed_at":"2026-05-11T19:26:08.531367Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.09952","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T20:30:07.719901Z","title":"On the width scaling of neural optimizers under matrix operator norms i: Row/column normalization and hyperparameter transfer.arXiv preprint arXiv:2603.09952","venue":null,"work_id":"a5de91e4-fa69-4278-ba7c-b1597e427196","year":2026},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-08-14T17:08:26.107852Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:fd1acd16dfa2ca8c8ddbbb4d3a4482c518ff8e5a5c412b09690959f7a0770aa8","observation_id":"c4701b1e-aca3-42f1-8db0-da32010a60c0","resolution":{"observed_at":"2026-05-11T19:26:08.475919Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-08-14T17:08:26.107852Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:9619617e31922eab00a067cc36d10c7764281e38b6a4bfd5fe0828cd7dfb0dff","observation_id":"300a9d68-6a8e-4151-aa35-e275248e36ae","resolution":{"observed_at":"2026-05-11T19:26:08.629870Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.17813","last_updated":"2024-05-14T00:10:33Z","snapshot_observed_at":"2026-08-17T09:16:32.835122Z","submitted_at":"2023-10-26T23:17:39Z","title":"A Spectral Condition for Feature Learning","version":2},"cited_work":{"arxiv_id":"2310.17813","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.17813","snapshot_observed_at":"2026-07-03T00:27:30.167566Z","title":"A spectral condition for feature learning","venue":null,"work_id":"ea5e7b7c-3b11-439d-8d99-51b97d507821","year":2023},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-08-14T17:08:26.107852Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"cited_paper":"/paper/2310.17813","citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:40e5c417ae6b1de0145e133c5fedc204232a53aa44787847eeab1d147f3a8235","observation_id":"982ace06-fbed-4f02-b303-9cc6e2c4cdfa","resolution":{"observed_at":"2026-05-11T19:26:08.596926Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.00962","last_updated":"2020-01-03T06:53:00Z","snapshot_observed_at":"2026-08-19T04:31:12.196632Z","submitted_at":"2019-04-01T16:53:35Z","title":"Large Batch Optimization for Deep Learning: Training BERT in 76 minutes","version":5},"cited_work":{"arxiv_id":"1904.00962","doi":"10.48550/arxiv.1904.00962","metadata_source":"pith","pith_arxiv_id":"1904.00962","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Batch Optimization for Deep Learning: Training BERT in 76 minutes","venue":"cs.LG","work_id":"206d2a89-691e-4467-8958-5630dacf4765","year":2019},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-08-14T17:08:26.107852Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"cited_paper":"/paper/1904.00962","citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:a336cd214387bc544d9f5b4b0233b6a4ae17567086de3312610b0fd1632b2e80","observation_id":"d01d0395-cad3-4f9b-8c96-e98959813614","resolution":{"observed_at":"2026-05-21T21:39:00.104164Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-07-16T20:21:35.755083+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-16T20:21:35.755083+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.15416","last_updated":"2026-04-16T17:55:36Z","snapshot_observed_at":"2026-08-15T05:22:14.623643Z","submitted_at":"2026-04-16T17:55:36Z","title":"StoSignSGD: Unbiased Structural Stochasticity Fixes SignSGD for Training Large Language Models","version":1},"cited_work":{"arxiv_id":"2604.15416","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.15416","snapshot_observed_at":"2026-07-04T10:09:44.609382Z","title":"StoSignSGD: Unbiased Structural Stochasticity Fixes SignSGD for Training Large Language Models","venue":"cs.LG","work_id":"16171c61-28f7-494e-ab39-fdc10e7aeff0","year":2026},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-08-14T17:08:26.107852Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"cited_paper":"/paper/2604.15416","citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:49ee35571e5342f3ab350cb7aa7288153032b7340bd13403606da0369899a718","observation_id":"06f3d469-ea31-425a-b541-7c6f1cd48023","resolution":{"observed_at":"2026-05-11T19:26:08.562081Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.12284","last_updated":"2024-05-03T17:36:07Z","snapshot_observed_at":"2026-08-13T10:57:13.012119Z","submitted_at":"2023-09-21T17:45:42Z","title":"MetaMath: Bootstrap Your Own Mathematical Questions for Large Language Models","version":4},"cited_work":{"arxiv_id":"2309.12284","doi":"10.48550/arxiv.2309.12284","metadata_source":"pith","pith_arxiv_id":"2309.12284","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MetaMath: Bootstrap Your Own Mathematical Questions for Large Language Models","venue":"cs.CL","work_id":"e791a2f0-3b75-4c5b-84e1-d297d96e42f0","year":2023},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-08-14T17:08:26.107852Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"cited_paper":"/paper/2309.12284","citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:e3783288140bcc9695b3147b386de57f2ee09ffa0b8c0c248c684db98d8a3097","observation_id":"f9e4fb2e-0950-4211-b854-5b50d1359a24","resolution":{"observed_at":"2026-05-13T10:07:53.977132Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10438","last_updated":"2025-09-04T09:37:05Z","snapshot_observed_at":"2026-08-17T20:25:32.027243Z","submitted_at":"2024-11-15T18:57:39Z","title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","version":4},"cited_work":{"arxiv_id":"2411.10438","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.10438","snapshot_observed_at":"2026-07-03T20:18:56.218978Z","title":"Mars: Unleashing the power of variance reduction for training large models.arXiv preprint arXiv:2411.10438","venue":null,"work_id":"c3479a39-1a42-40c5-8f10-bafb1da1e032","year":2024},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-08-14T17:08:26.107852Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"cited_paper":"/paper/2411.10438","citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:bb0acb69050c1e626bd566aba0870393cf522cbe9aead69fc87287c3b4f866a8","observation_id":"538e25c1-2441-4600-8506-41ad000ad01b","resolution":{"observed_at":"2026-05-11T19:26:08.551157Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1212.5701","last_updated":"2012-12-22T15:46:49Z","snapshot_observed_at":"2026-08-19T05:19:50.480481Z","submitted_at":"2012-12-22T15:46:49Z","title":"ADADELTA: An Adaptive Learning Rate Method","version":1},"cited_work":{"arxiv_id":"1212.5701","doi":null,"metadata_source":"pith","pith_arxiv_id":"1212.5701","snapshot_observed_at":"2026-07-03T17:08:43.610664Z","title":"ADADELTA: An Adaptive Learning Rate Method","venue":"cs.LG","work_id":"8cf4a28d-2b04-4146-9751-ac0d4ad61310","year":2012},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-08-14T17:08:26.107852Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"cited_paper":"/paper/1212.5701","citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:79a2803889c70ddb6d52491f99683adb7b4574658edd81c9584324fef3c74d1a","observation_id":"7998c599-731f-4125-89ab-d025e16f3398","resolution":{"observed_at":"2026-05-11T19:26:08.535605Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06471","last_updated":"2025-08-08T17:21:06Z","snapshot_observed_at":"2026-08-11T03:34:09.767397Z","submitted_at":"2025-08-08T17:21:06Z","title":"GLM-4.5: Agentic, Reasoning, and Coding (ARC) Foundation Models","version":1},"cited_work":{"arxiv_id":"2508.06471","doi":"10.48550/arxiv.2508.06471","metadata_source":"pith","pith_arxiv_id":"2508.06471","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GLM-4.5: Agentic, Reasoning, and Coding (ARC) Foundation Models","venue":"cs.CL","work_id":"5bb4e5d7-985e-431b-bb0d-75576cdc2950","year":2025},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-08-14T17:08:26.107852Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"cited_paper":"/paper/2508.06471","citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:7966fb06e2be9f4a4778b9657d9db62a0d0b7fd9d97f7bf432de993497f5da44","observation_id":"a21fa863-90da-41e5-9bfa-ccd8459b71d7","resolution":{"observed_at":"2026-05-11T19:26:08.642431Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-05-23T05:23:01.474969+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T05:23:01.474969+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1611.03530","last_updated":"2017-02-26T19:36:40Z","snapshot_observed_at":"2026-08-01T16:56:59.989486Z","submitted_at":"2016-11-10T22:02:36Z","title":"Understanding deep learning requires rethinking generalization","version":2},"cited_work":{"arxiv_id":"1611.03530","doi":"10.48550/arxiv.1611.03530","metadata_source":"pith","pith_arxiv_id":"1611.03530","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Understanding deep learning requires rethinking generalization","venue":"cs.LG","work_id":"b260f96a-16f6-4936-8f3b-440917a19b34","year":2016},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-08-14T17:08:26.107852Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"cited_paper":"/paper/1611.03530","citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:e0e51b87c0d5132cd40a63d18cf3657f39f490107ee2a18d9d768ff8eb405291","observation_id":"2b360052-3f06-406c-91f1-0c3317a26c5a","resolution":{"observed_at":"2026-05-13T11:56:40.372790Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-07-11T05:49:49.910618+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T05:49:49.910618+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16788","last_updated":"2024-10-21T08:27:23Z","snapshot_observed_at":"2026-08-18T11:52:10.492128Z","submitted_at":"2024-02-26T18:01:41Z","title":"Why Transformers Need Adam: A Hessian Perspective","version":4},"cited_work":{"arxiv_id":"2402.16788","doi":"10.48550/arxiv.2402.16788","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.16788","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Yuan, J., Xie, F., Nie, F., and Li, X","venue":"arXiv (Cornell University)","work_id":"1dbea7ce-1a30-4c1b-a952-af4d80f6c7e0","year":2024},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-08-14T17:08:26.107852Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"cited_paper":"/paper/2402.16788","citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:14869d3b249372497c374a9c290d72250145ad76e66a73b70e70ab830aa7dc9f","observation_id":"b7dff74f-a846-48eb-8e76-8b915e9acffc","resolution":{"observed_at":"2026-05-11T19:26:08.489778Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13372","last_updated":"2024-06-27T22:44:48Z","snapshot_observed_at":"2026-08-17T02:51:06.474773Z","submitted_at":"2024-03-20T08:08:54Z","title":"LlamaFactory: Unified Efficient Fine-Tuning of 100+ Language Models","version":4},"cited_work":{"arxiv_id":"2403.13372","doi":"10.48550/arxiv.2403.13372","metadata_source":"pith","pith_arxiv_id":"2403.13372","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LlamaFactory: Unified Efficient Fine-Tuning of 100+ Language Models","venue":"cs.CL","work_id":"462b3287-e058-48e3-b5e3-82a5f2a8dc06","year":2024},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-08-14T17:08:26.107852Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"cited_paper":"/paper/2403.13372","citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:47f446de4bc2c87aac0da37a3bb950cfd509a0df575afecd9ef0e07697cc7ced","observation_id":"9d9eb6cb-2630-4c13-a323-20ebf4406cca","resolution":{"observed_at":"2026-05-11T19:26:08.526331Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"4ee998b2-c4ad-42e9-bf74-40b673e52828","year":2024},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-08-14T17:08:26.107852Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:79a87b7520268e8855a0b2d4d54525d37f4d6e0cc0260ead138b19114aa92a6c","observation_id":"34dcb554-30af-42cc-b424-357df4da4d06","resolution":{"observed_at":"2026-05-26T13:47:25.031255Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Here, LoRA rank 64 shows a greater forgetting compared to rank 256, mainly because rank 256 diverges for lr=5e-4, and a smaller learning rate leads to less forgetting","venue":null,"work_id":"af196173-ab27-4583-a7b7-d4ae6d2d314e","year":2024},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-08-14T17:08:26.107852Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:3b9aa480ba9d26db963b9ed8ab6660a6731b99a8ea36db7981b1fdb7258327da","observation_id":"54569520-ba6a-4626-91be-97757a02b5b6","resolution":{"observed_at":"2026-05-26T13:47:25.025446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"103a8f39-5e40-4404-9b72-54d793d75f51","year":2000},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-08-14T17:08:26.107852Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:bd8db2dfc2d9dc940add9692c5e86bd23ab8c6a0e0928f02cd094763fcc225c5","observation_id":"581d67f9-75c1-41ff-b6eb-d653bb622d9a","resolution":{"observed_at":"2026-05-26T13:47:25.019542Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"B.2 More Detailed Activation Plots In Figures 10 and 11, we present the average activation sparsity of detailed modules and specific ac- tivation splits","venue":null,"work_id":"a3e9440f-e587-4ae5-8df6-9f2b74999367","year":2000},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-08-14T17:08:26.107852Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:5834f740617008c7301b544ed054cdeb91918add958d2b48d78985b7588e1218","observation_id":"2469ed4d-f60e-4a5b-8514-9601ba82e64b","resolution":{"observed_at":"2026-05-26T13:47:25.016966Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"23 •Ifα∈(α 1,∞], based on Lemma 2 and Assumption 4, it holds that ∥∆W∥ α1,β∗ ≤ ∥∆W∥ α,β∗ andE h ∥x∥2 α1 i = Θ E h ∥x∥2 α i","venue":null,"work_id":"53812a69-d2b7-4637-84ce-fd5095254881","year":2023},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-08-14T17:08:26.107852Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:762394158ff15d9ca2738310c469c12920f17448b4dab78a69bd0d1acab20de7","observation_id":"57ef95fa-30bb-4711-b3c2-176177269826","resolution":{"observed_at":"2026-05-26T13:47:25.022703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-14T17:08:26.107852Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":0,"metadata_mismatch":5,"parse_uncertain":0,"unresolved":2,"verified_exact":41,"verified_fuzzy":4},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 3 inbound Pith citation observations for arXiv:2605.06654."}