{"as_of":"2026-08-19T06:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:969809858251754b5c40a1c5357f2cb8b55bf710e211603208380cc5bc322e3c","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:46:28.238597Z","state":"measured"},{"denominator":68,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":68,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":11,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":11,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T17:30:10.163726Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T10:49:46.245243Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.12082","last_updated":"2025-05-22T09:35:43Z","snapshot_observed_at":"2026-08-15T20:39:05.998045Z","submitted_at":"2025-05-17T16:53:14Z","title":"Model Merging in Pre-training of Large Language Models","version":3},"cited_work":{"arxiv_id":"2505.12082","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.12082","snapshot_observed_at":"2026-07-04T10:49:46.245243Z","title":"arXiv preprint arXiv:2505.12082 , year=","venue":null,"work_id":"a6b02b76-6c31-41bf-9706-2c3470dda4ad","year":2025},"citing_paper":{"arxiv_id":"2408.07666","last_updated":"2025-12-31T04:06:49Z","snapshot_observed_at":"2026-08-07T23:28:24.025478Z","submitted_at":"2024-08-14T16:58:48Z","title":"Model Merging in LLMs, MLLMs, and Beyond: Methods, Theories, Applications and Opportunities","version":5},"reference_index":129,"source":"pdf_text","source_observed_at":"2026-05-17T22:16:04.386706Z"},"links":{"cited_paper":"/paper/2505.12082","citing_paper":"/paper/2408.07666"},"observation_digest":"sha256:516e53fef0d737d37b66b017983b55fe0b25b9fcf88d9f1bf8dbf21a67f2b06d","observation_id":"11f46116-417b-46e2-9a8f-da9c9ba887cd","resolution":{"observed_at":"2026-05-17T22:16:04.524049Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12082","last_updated":"2025-05-22T09:35:43Z","snapshot_observed_at":"2026-08-15T20:39:05.998045Z","submitted_at":"2025-05-17T16:53:14Z","title":"Model Merging in Pre-training of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.12082","snapshot_observed_at":"2026-08-06T20:45:08.181516Z","title":"Model merging in pre-training of large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01949","last_updated":"2025-07-02T17:57:28Z","snapshot_observed_at":"2026-08-16T04:50:52.862197Z","submitted_at":"2025-07-02T17:57:28Z","title":"Kwai Keye-VL Technical Report","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T20:45:08.181516Z"},"links":{"cited_paper":"/paper/2505.12082","citing_paper":"/paper/2507.01949"},"observation_digest":"sha256:f6177f266303dbc05dcb5ecce1812712a0a3398bfbc3b4ba9d2ebadf1d6c3e96","observation_id":"04dde608-7a4e-4db6-9a65-e5d8367a23ee","resolution":{"observed_at":"2026-08-06T20:45:08.181516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12082","last_updated":"2025-05-22T09:35:43Z","snapshot_observed_at":"2026-08-15T20:39:05.998045Z","submitted_at":"2025-05-17T16:53:14Z","title":"Model Merging in Pre-training of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.12082","snapshot_observed_at":"2026-08-06T14:49:40.270904Z","title":"Model merging in pre-training of large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17634","last_updated":"2025-08-11T08:36:31Z","snapshot_observed_at":"2026-08-14T20:34:00.378005Z","submitted_at":"2025-07-23T16:02:06Z","title":"WSM: Decay-Free Learning Rate Schedule via Checkpoint Merging for LLM Pre-training","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T14:49:40.270904Z"},"links":{"cited_paper":"/paper/2505.12082","citing_paper":"/paper/2507.17634"},"observation_digest":"sha256:a50cb116dc4e1a92d443c7de4bca9fbf237b6f23fc4976bf4860a028d14e60ad","observation_id":"b01d7e69-effd-4359-869c-aaa6507bee03","resolution":{"observed_at":"2026-08-06T14:49:40.270904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12082","last_updated":"2025-05-22T09:35:43Z","snapshot_observed_at":"2026-08-15T20:39:05.998045Z","submitted_at":"2025-05-17T16:53:14Z","title":"Model Merging in Pre-training of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.12082","snapshot_observed_at":"2026-08-15T17:30:10.163726Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12387","last_updated":"2025-08-17T14:50:23Z","snapshot_observed_at":"2026-08-16T13:53:05.201184Z","submitted_at":"2025-08-17T14:50:23Z","title":"ReaLM: Reflection-Enhanced Autonomous Reasoning with Small Language Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T17:30:10.163726Z"},"links":{"cited_paper":"/paper/2505.12082","citing_paper":"/paper/2508.12387"},"observation_digest":"sha256:37883cb45df128738049d6630f07ad1d6dab2a8afa9a44e523638b2b9b5f2bf5","observation_id":"d532f56f-1d36-4e14-a307-9d752f503eed","resolution":{"observed_at":"2026-08-15T17:30:10.163726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12082","last_updated":"2025-05-22T09:35:43Z","snapshot_observed_at":"2026-08-15T20:39:05.998045Z","submitted_at":"2025-05-17T16:53:14Z","title":"Model Merging in Pre-training of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.12082","snapshot_observed_at":"2026-08-05T17:45:16.870761Z","title":"Kling ai","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.15761","last_updated":"2025-08-26T10:56:04Z","snapshot_observed_at":"2026-08-17T21:40:41.006322Z","submitted_at":"2025-08-21T17:56:10Z","title":"Waver: Wave Your Way to Lifelike Video Generation","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-05T17:45:16.870761Z"},"links":{"cited_paper":"/paper/2505.12082","citing_paper":"/paper/2508.15761"},"observation_digest":"sha256:dc95b0a978d5b5a3de94a14e116da19ee797c0ddf07c24246d477c2220ecc880","observation_id":"a7a559c1-04ee-4264-b5dd-27d1d9222cd3","resolution":{"observed_at":"2026-08-05T17:45:16.870761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12082","last_updated":"2025-05-22T09:35:43Z","snapshot_observed_at":"2026-08-15T20:39:05.998045Z","submitted_at":"2025-05-17T16:53:14Z","title":"Model Merging in Pre-training of Large Language Models","version":3},"cited_work":{"arxiv_id":"2505.12082","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.12082","snapshot_observed_at":"2026-07-04T10:49:46.245243Z","title":"arXiv preprint arXiv:2505.12082 , year=","venue":null,"work_id":"a6b02b76-6c31-41bf-9706-2c3470dda4ad","year":2025},"citing_paper":{"arxiv_id":"2605.19095","last_updated":"2026-05-18T20:31:49Z","snapshot_observed_at":"2026-08-17T16:01:10.130690Z","submitted_at":"2026-05-18T20:31:49Z","title":"ScheduleFree+: Scaling Learning-Rate-Free & Schedule-Free Learning to Large Language Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-20T12:22:30.263086Z"},"links":{"cited_paper":"/paper/2505.12082","citing_paper":"/paper/2605.19095"},"observation_digest":"sha256:31e72c7aa24623069c0eb0b899b135695ba44af3edbdc44f94904528d29f71ff","observation_id":"cdfded52-de3c-4810-8fbc-99db82938247","resolution":{"observed_at":"2026-05-20T12:23:16.787163Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12082","last_updated":"2025-05-22T09:35:43Z","snapshot_observed_at":"2026-08-15T20:39:05.998045Z","submitted_at":"2025-05-17T16:53:14Z","title":"Model Merging in Pre-training of Large Language Models","version":3},"cited_work":{"arxiv_id":"2505.12082","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.12082","snapshot_observed_at":"2026-07-04T10:49:46.245243Z","title":"arXiv preprint arXiv:2505.12082 , year=","venue":null,"work_id":"a6b02b76-6c31-41bf-9706-2c3470dda4ad","year":2025},"citing_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-18T22:31:32.273634Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-25T05:38:16.958574Z"},"links":{"cited_paper":"/paper/2505.12082","citing_paper":"/paper/2605.23061"},"observation_digest":"sha256:80049ca55d1857311ada581cefaac4413d99546ab4107b93f2560102b30198e5","observation_id":"e7bd2b19-81d5-452c-b607-0ede6828ea68","resolution":{"observed_at":"2026-05-25T05:40:24.455637Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12082","last_updated":"2025-05-22T09:35:43Z","snapshot_observed_at":"2026-08-15T20:39:05.998045Z","submitted_at":"2025-05-17T16:53:14Z","title":"Model Merging in Pre-training of Large Language Models","version":3},"cited_work":{"arxiv_id":"2505.12082","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.12082","snapshot_observed_at":"2026-07-04T10:49:46.245243Z","title":"arXiv preprint arXiv:2505.12082 , year=","venue":null,"work_id":"a6b02b76-6c31-41bf-9706-2c3470dda4ad","year":2025},"citing_paper":{"arxiv_id":"2606.10651","last_updated":"2026-06-09T09:58:08Z","snapshot_observed_at":"2026-07-06T23:49:51.672382Z","submitted_at":"2026-06-09T09:58:08Z","title":"Kwai Keye-VL-2.0 Technical Report","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-06-27T13:53:10.352603Z"},"links":{"cited_paper":"/paper/2505.12082","citing_paper":"/paper/2606.10651"},"observation_digest":"sha256:b0b5442be4b86fa0579934c9bb7bef97e40c037d5e61e35f0d4439fee5eafbd4","observation_id":"6cac034e-95b0-4736-a464-d13520d85f90","resolution":{"observed_at":"2026-07-03T04:27:37.028942Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12082","last_updated":"2025-05-22T09:35:43Z","snapshot_observed_at":"2026-08-15T20:39:05.998045Z","submitted_at":"2025-05-17T16:53:14Z","title":"Model Merging in Pre-training of Large Language Models","version":3},"cited_work":{"arxiv_id":"2505.12082","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.12082","snapshot_observed_at":"2026-07-04T10:49:46.245243Z","title":"arXiv preprint arXiv:2505.12082 , year=","venue":null,"work_id":"a6b02b76-6c31-41bf-9706-2c3470dda4ad","year":2025},"citing_paper":{"arxiv_id":"2606.22971","last_updated":"2026-06-22T07:52:25Z","snapshot_observed_at":"2026-08-07T18:55:06.210921Z","submitted_at":"2026-06-22T07:52:25Z","title":"Humanoid-OmniOcc: Stereo-Based Full-View Occupancy Dataset for Embodied AI","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-06-26T08:29:13.389779Z"},"links":{"cited_paper":"/paper/2505.12082","citing_paper":"/paper/2606.22971"},"observation_digest":"sha256:fef8c4681d9aadcea297d8b4bd9eaf8f6be5399ace182c02bd46be50891ee9e7","observation_id":"a161417f-12aa-443a-9431-55420b5ce9fc","resolution":{"observed_at":"2026-07-04T10:49:46.246632Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12082","last_updated":"2025-05-22T09:35:43Z","snapshot_observed_at":"2026-08-15T20:39:05.998045Z","submitted_at":"2025-05-17T16:53:14Z","title":"Model Merging in Pre-training of Large Language Models","version":3},"cited_work":{"arxiv_id":"2505.12082","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.12082","snapshot_observed_at":"2026-07-04T10:49:46.245243Z","title":"arXiv preprint arXiv:2505.12082 , year=","venue":null,"work_id":"a6b02b76-6c31-41bf-9706-2c3470dda4ad","year":2025},"citing_paper":{"arxiv_id":"2606.24901","last_updated":"2026-06-12T13:44:48Z","snapshot_observed_at":"2026-08-03T03:21:51.293576Z","submitted_at":"2026-06-12T13:44:48Z","title":"LLM Evolution as an Industry-Scale Ecosystem: A Lifecycle Perspective on Continual Learning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-06-27T05:02:18.347642Z"},"links":{"cited_paper":"/paper/2505.12082","citing_paper":"/paper/2606.24901"},"observation_digest":"sha256:bc41e8c927c070d601e86073f6545305b0a9d6cfe008e73e58de1979194ab3a4","observation_id":"556c49c3-1768-4df0-bda2-1621d33479bb","resolution":{"observed_at":"2026-07-03T16:48:39.896841Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12082","last_updated":"2025-05-22T09:35:43Z","snapshot_observed_at":"2026-08-15T20:39:05.998045Z","submitted_at":"2025-05-17T16:53:14Z","title":"Model Merging in Pre-training of Large Language Models","version":3},"cited_work":{"arxiv_id":"2505.12082","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.12082","snapshot_observed_at":"2026-07-04T10:49:46.245243Z","title":"arXiv preprint arXiv:2505.12082 , year=","venue":null,"work_id":"a6b02b76-6c31-41bf-9706-2c3470dda4ad","year":2025},"citing_paper":{"arxiv_id":"2607.02291","last_updated":"2026-07-02T15:08:56Z","snapshot_observed_at":"2026-08-07T15:44:37.020127Z","submitted_at":"2026-07-02T15:08:56Z","title":"Optimizing Visual Generative Models via Distribution-wise Rewards","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-03T16:39:12.711424Z"},"links":{"cited_paper":"/paper/2505.12082","citing_paper":"/paper/2607.02291"},"observation_digest":"sha256:bbc4e0e03a1aadfeecfde23380b68a0ee39ed3e582974e63952a8409c04e1774","observation_id":"8a40e590-512f-447e-9ff7-8ec128222178","resolution":{"observed_at":"2026-07-03T16:48:39.787654Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.12082/citation-record","integrity":"/paper/2505.12082/integrity","json":"/paper/2505.12082/citation-record.json","paper":"/paper/2505.12082"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-15T20:46:27.985936Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12082","last_updated":"2025-05-22T09:35:43Z","snapshot_observed_at":"2026-08-15T20:39:05.998045Z","submitted_at":"2025-05-17T16:53:14Z","title":"Model Merging in Pre-training of Large Language Models","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T20:46:27.985936Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.12082"},"observation_digest":"sha256:434eeee59107a23316621d64de97b9a0cf511b894e3f712fff692bb0cca10adb","observation_id":"dc5cf18c-451a-4f70-9c22-712ccb546981","resolution":{"observed_at":"2026-08-15T20:46:27.985936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:46:27.991379Z","title":"Evolutionary optimization of model merging recipes","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.12082","last_updated":"2025-05-22T09:35:43Z","snapshot_observed_at":"2026-08-15T20:39:05.998045Z","submitted_at":"2025-05-17T16:53:14Z","title":"Model Merging in Pre-training of Large Language Models","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T20:46:27.991379Z"},"links":{"citing_paper":"/paper/2505.12082"},"observation_digest":"sha256:e45d4749e60df96a1b6c0c88c1b4dbd596376a79e27cf114465631b51cbbf293","observation_id":"113a2c22-078a-44da-9bb5-3ac6372e80b4","resolution":{"observed_at":"2026-08-15T20:46:27.991379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-15T17:40:38.050939Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-15T20:46:27.996068Z","title":"Program synthesis with large language models.arXiv preprint arXiv:2108.07732, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.12082","last_updated":"2025-05-22T09:35:43Z","snapshot_observed_at":"2026-08-15T20:39:05.998045Z","submitted_at":"2025-05-17T16:53:14Z","title":"Model Merging in Pre-training of Large Language Models","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T20:46:27.996068Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2505.12082"},"observation_digest":"sha256:5cb145773a6c9fc2bf3f56beb368e0355abc37ba008e83ed83c786836c7819f8","observation_id":"a06fe965-8853-4ab4-9c45-54f33b7cc8c9","resolution":{"observed_at":"2026-08-15T20:46:27.996068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02954","last_updated":"2024-01-05T18:59:13Z","snapshot_observed_at":"2026-08-14T19:47:04.330126Z","submitted_at":"2024-01-05T18:59:13Z","title":"DeepSeek LLM: Scaling Open-Source Language Models with Longtermism","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02954","snapshot_observed_at":"2026-08-15T20:46:28.001379Z","title":"Deepseek llm: Scaling open-source language models with longtermism.arXiv preprint arXiv:2401.02954, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12082","last_updated":"2025-05-22T09:35:43Z","snapshot_observed_at":"2026-08-15T20:39:05.998045Z","submitted_at":"2025-05-17T16:53:14Z","title":"Model Merging in Pre-training of Large Language Models","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T20:46:28.001379Z"},"links":{"cited_paper":"/paper/2401.02954","citing_paper":"/paper/2505.12082"},"observation_digest":"sha256:117144479cac4bf947dba085360eb291bdf2b06747871b8a0a29f3ebd3058b39","observation_id":"5bcbde28-ffdc-4097-9834-52c36772cf39","resolution":{"observed_at":"2026-08-15T20:46:28.001379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-15T20:46:28.006262Z","title":"Evaluating large language models trained on code","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.12082","last_updated":"2025-05-22T09:35:43Z","snapshot_observed_at":"2026-08-15T20:39:05.998045Z","submitted_at":"2025-05-17T16:53:14Z","title":"Model Merging in Pre-training of Large Language Models","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T20:46:28.006262Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2505.12082"},"observation_digest":"sha256:cf04f7917c4c5f3b2d76aab23cabf9ac2ef1c329298f834fadd243f967ffa317","observation_id":"abf61e49-c49b-4a58-970b-e6ea3f5c7287","resolution":{"observed_at":"2026-08-15T20:46:28.006262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-08-14T19:36:07.505691Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-15T20:46:28.011465Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge.arXiv preprint arXiv:1803.05457, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.12082","last_updated":"2025-05-22T09:35:43Z","snapshot_observed_at":"2026-08-15T20:39:05.998045Z","submitted_at":"2025-05-17T16:53:14Z","title":"Model Merging in Pre-training of Large Language Models","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T20:46:28.011465Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2505.12082"},"observation_digest":"sha256:ee0dbc6e99827bb1f20140d0ac5793484c6922cb645e6bdc3e0b3c8aea94fe38","observation_id":"c91f5bf3-8d9e-48fc-94aa-93bffa4db82e","resolution":{"observed_at":"2026-08-15T20:46:28.011465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-15T20:46:28.016606Z","title":"Training verifiers to solve math word problems.arXiv preprint arXiv:2110.14168, 2021","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12082","last_updated":"2025-05-22T09:35:43Z","snapshot_observed_at":"2026-08-15T20:39:05.998045Z","submitted_at":"2025-05-17T16:53:14Z","title":"Model Merging in Pre-training of Large Language Models","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T20:46:28.016606Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2505.12082"},"observation_digest":"sha256:386c9eef68c0216f6d2ce2d1f9238a183dbc804354be760c59c99a02aa7217be","observation_id":"e1657b69-436f-4b9a-b7ab-d23823604a78","resolution":{"observed_at":"2026-08-15T20:46:28.016606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:46:28.021188Z","title":"Gradient descent on neural networks typically occurs at the edge of stability","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.12082","last_updated":"2025-05-22T09:35:43Z","snapshot_observed_at":"2026-08-15T20:39:05.998045Z","submitted_at":"2025-05-17T16:53:14Z","title":"Model Merging in Pre-training of Large Language Models","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T20:46:28.021188Z"},"links":{"citing_paper":"/paper/2505.12082"},"observation_digest":"sha256:75b3251ae4240cdc93059b230bf5902079085cd53316ea68cf2a941b149b1851","observation_id":"b8d5fa3a-2383-49ef-ae99-9e16c020f42b","resolution":{"observed_at":"2026-08-15T20:46:28.021188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:46:28.025569Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.12082","last_updated":"2025-05-22T09:35:43Z","snapshot_observed_at":"2026-08-15T20:39:05.998045Z","submitted_at":"2025-05-17T16:53:14Z","title":"Model Merging in Pre-training of Large Language Models","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T20:46:28.025569Z"},"links":{"citing_paper":"/paper/2505.12082"},"observation_digest":"sha256:18b70adea9b2f0b9a80137074f0bbbdc890031c26c33ec9bf32faae77726c298","observation_id":"7f6af6af-c17b-452e-9cb9-7cdb04977025","resolution":{"observed_at":"2026-08-15T20:46:28.025569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:46:29.083984Z","title":"DROP: A reading comprehension benchmark requiring discrete reasoning over paragraphs","venue":null,"work_id":"f3774823-9cb0-4c82-acc0-ac24c8f425f6","year":2019},"citing_paper":{"arxiv_id":"2505.12082","last_updated":"2025-05-22T09:35:43Z","snapshot_observed_at":"2026-08-15T20:39:05.998045Z","submitted_at":"2025-05-17T16:53:14Z","title":"Model Merging in Pre-training of Large Language Models","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T20:46:28.029866Z"},"links":{"citing_paper":"/paper/2505.12082"},"observation_digest":"sha256:c5c58087774e6f936a68c3e5889374f34dd2bfdaa02047bd7777f350f19c6e83","observation_id":"694e03df-c1b9-420e-9715-8601d83ca4e1","resolution":{"observed_at":"2026-08-15T20:46:29.088974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:46:28.034400Z","title":"The llama 3 herd of models.arXiv e-prints, pages arXiv–2407, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12082","last_updated":"2025-05-22T09:35:43Z","snapshot_observed_at":"2026-08-15T20:39:05.998045Z","submitted_at":"2025-05-17T16:53:14Z","title":"Model Merging in Pre-training of Large Language Models","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T20:46:28.034400Z"},"links":{"citing_paper":"/paper/2505.12082"},"observation_digest":"sha256:9d7aa85dbe04031df797b751251cd73bcd4537447ec27704820040b5a7e3fc7f","observation_id":"afdfec0b-13eb-410b-90a2-86a92e6d70e3","resolution":{"observed_at":"2026-08-15T20:46:28.034400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-15T20:46:28.038785Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.12082","last_updated":"2025-05-22T09:35:43Z","snapshot_observed_at":"2026-08-15T20:39:05.998045Z","submitted_at":"2025-05-17T16:53:14Z","title":"Model Merging in Pre-training of Large Language Models","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T20:46:28.038785Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.12082"},"observation_digest":"sha256:711d9e5f3942d2bf61ca5dce1d265065a17c822e2c4ebdacebe2d3cf0fefe16a","observation_id":"d02f92f1-ae8a-4335-b87b-c16443f94f05","resolution":{"observed_at":"2026-08-15T20:46:28.038785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:46:29.060868Z","title":"Scaling laws and compute-optimal training beyond fixed training durations.Advances in Neural Information Processing Systems, 37:76232–76264, 2024","venue":null,"work_id":"ac898cd8-4f75-4291-be50-c9956bb12e01","year":2024},"citing_paper":{"arxiv_id":"2505.12082","last_updated":"2025-05-22T09:35:43Z","snapshot_observed_at":"2026-08-15T20:39:05.998045Z","submitted_at":"2025-05-17T16:53:14Z","title":"Model Merging in Pre-training of Large Language Models","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T20:46:28.043088Z"},"links":{"citing_paper":"/paper/2505.12082"},"observation_digest":"sha256:f2c720ff871373d9a7511552377c374225ad4580a32d24338e4a3f806dbc67a0","observation_id":"0fdbbd56-4a27-4c7a-a7f2-d1535cbc2ff4","resolution":{"observed_at":"2026-08-15T20:46:29.065656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:46:28.047542Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.12082","last_updated":"2025-05-22T09:35:43Z","snapshot_observed_at":"2026-08-15T20:39:05.998045Z","submitted_at":"2025-05-17T16:53:14Z","title":"Model Merging in Pre-training of Large Language Models","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T20:46:28.047542Z"},"links":{"citing_paper":"/paper/2505.12082"},"observation_digest":"sha256:da996b6808c8487637bbfa4693c18ab78ff8bd80beea0920131febf78479aba2","observation_id":"161b767d-48e6-4e61-939a-a37620cbbca0","resolution":{"observed_at":"2026-08-15T20:46:28.047542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:46:29.037508Z","title":"MiniCPM: Unveiling the potential of small language models with scalable training strategies","venue":null,"work_id":"71fdc8a3-d63c-4b01-84ee-9b687e71da93","year":2024},"citing_paper":{"arxiv_id":"2505.12082","last_updated":"2025-05-22T09:35:43Z","snapshot_observed_at":"2026-08-15T20:39:05.998045Z","submitted_at":"2025-05-17T16:53:14Z","title":"Model Merging in Pre-training of Large Language Models","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T20:46:28.051774Z"},"links":{"citing_paper":"/paper/2505.12082"},"observation_digest":"sha256:5f1ecdd8cdbe016a3b0b75c7f73172b6cb64ec1c372bc9667b51461d56fa3067","observation_id":"a7168105-42fe-4f7b-be6e-5506274842cf","resolution":{"observed_at":"2026-08-15T20:46:29.042041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:46:29.023035Z","title":"C-eval: A multi-level multi-discipline chinese evaluation suite for foundation models","venue":null,"work_id":"3f099523-f1e2-4a29-be74-15d1eaa6ed75","year":2023},"citing_paper":{"arxiv_id":"2505.12082","last_updated":"2025-05-22T09:35:43Z","snapshot_observed_at":"2026-08-15T20:39:05.998045Z","submitted_at":"2025-05-17T16:53:14Z","title":"Model Merging in Pre-training of Large Language Models","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T20:46:28.056087Z"},"links":{"citing_paper":"/paper/2505.12082"},"observation_digest":"sha256:06edb0d7f62a82ec70a45ee5cae35a5e23d40008b5e1b360a664fbebcb5958c2","observation_id":"4370adf0-5a6c-4cb9-937f-865e0524054d","resolution":{"observed_at":"2026-08-15T20:46:29.027766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:46:28.060418Z","title":"The exponentially weighted moving average.Journal of quality technology, 18(4):203–210, 1986","venue":null,"work_id":null,"year":1986},"citing_paper":{"arxiv_id":"2505.12082","last_updated":"2025-05-22T09:35:43Z","snapshot_observed_at":"2026-08-15T20:39:05.998045Z","submitted_at":"2025-05-17T16:53:14Z","title":"Model Merging in Pre-training of Large Language Models","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T20:46:28.060418Z"},"links":{"citing_paper":"/paper/2505.12082"},"observation_digest":"sha256:737d1484141681051e27ba4b9e6f6849e8b885d7242d256bd62e4b8263fbe649","observation_id":"d96def94-1097-4ab3-90da-66a2037988e4","resolution":{"observed_at":"2026-08-15T20:46:28.060418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:46:28.998232Z","title":"Editing models with task arithmetic","venue":null,"work_id":"d03c3390-fd4c-436c-a926-738cc92898bc","year":2023},"citing_paper":{"arxiv_id":"2505.12082","last_updated":"2025-05-22T09:35:43Z","snapshot_observed_at":"2026-08-15T20:39:05.998045Z","submitted_at":"2025-05-17T16:53:14Z","title":"Model Merging in Pre-training of Large Language Models","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T20:46:28.064763Z"},"links":{"citing_paper":"/paper/2505.12082"},"observation_digest":"sha256:908e6e4415a005b174b81c3fdbcdd63f971061b8a42434cb115bc00c20c19178","observation_id":"caade15a-3dbd-4e92-934c-7eeadf223440","resolution":{"observed_at":"2026-08-15T20:46:29.003251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:46:28.982899Z","title":"Dataless knowledge fusion by merging weights of language models","venue":null,"work_id":"e6e3d1f2-8264-40fe-9f3f-2645feda9acb","year":2023},"citing_paper":{"arxiv_id":"2505.12082","last_updated":"2025-05-22T09:35:43Z","snapshot_observed_at":"2026-08-15T20:39:05.998045Z","submitted_at":"2025-05-17T16:53:14Z","title":"Model Merging in Pre-training of Large Language Models","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T20:46:28.069243Z"},"links":{"citing_paper":"/paper/2505.12082"},"observation_digest":"sha256:7795f53e1d0b8f79f3c629ea0d6f6025fc8eea8db7d45aa625ffc308cd2032e3","observation_id":"15e89984-c6ad-4484-935f-64099d86899e","resolution":{"observed_at":"2026-08-15T20:46:28.987743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:46:28.968588Z","title":"Some properties of a simple moving average when applied to forecasting a time series.Journal of the Operational Research Society, 50(12):1267–1271, 1999","venue":null,"work_id":"9ac9bdfa-f63b-4428-ac27-4b5c40b07f8f","year":1999},"citing_paper":{"arxiv_id":"2505.12082","last_updated":"2025-05-22T09:35:43Z","snapshot_observed_at":"2026-08-15T20:39:05.998045Z","submitted_at":"2025-05-17T16:53:14Z","title":"Model Merging in Pre-training of Large Language Models","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T20:46:28.073511Z"},"links":{"citing_paper":"/paper/2505.12082"},"observation_digest":"sha256:dfe76332c5fc83352c9e6196e9bbfd5831d7a791525eda12d55fecb3604021e4","observation_id":"2429eb69-8451-44db-801b-b86f1afe2439","resolution":{"observed_at":"2026-08-15T20:46:28.973248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.03094","last_updated":"2024-05-06T14:32:35Z","snapshot_observed_at":"2026-08-16T15:42:16.126506Z","submitted_at":"2023-04-06T14:22:02Z","title":"PopulAtion Parameter Averaging (PAPA)","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.03094","snapshot_observed_at":"2026-08-15T20:46:28.077730Z","title":"Population parameter averaging (papa).arXiv preprint arXiv:2304.03094, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12082","last_updated":"2025-05-22T09:35:43Z","snapshot_observed_at":"2026-08-15T20:39:05.998045Z","submitted_at":"2025-05-17T16:53:14Z","title":"Model Merging in Pre-training of Large Language Models","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T20:46:28.077730Z"},"links":{"cited_paper":"/paper/2304.03094","citing_paper":"/paper/2505.12082"},"observation_digest":"sha256:2f9a82b92f6814d21d1728c47745b7b4fefdffef8803d86b1a09737ed8e8e318","observation_id":"a7fe01eb-919e-48e0-a51d-2a8c413791fa","resolution":{"observed_at":"2026-08-15T20:46:28.077730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:46:28.954332Z","title":"TriviaQA: A large scale distantly supervised challenge dataset for reading comprehension","venue":null,"work_id":"edc2e637-bccc-408e-b821-87cea1bf154b","year":2017},"citing_paper":{"arxiv_id":"2505.12082","last_updated":"2025-05-22T09:35:43Z","snapshot_observed_at":"2026-08-15T20:39:05.998045Z","submitted_at":"2025-05-17T16:53:14Z","title":"Model Merging in Pre-training of Large Language Models","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T20:46:28.082242Z"},"links":{"citing_paper":"/paper/2505.12082"},"observation_digest":"sha256:3320d0d53990d1ce3415d5bf12513f963ecd28db01d95a146fa2482442d29e08","observation_id":"ac51e743-4037-4e1c-b1bf-25e121691780","resolution":{"observed_at":"2026-08-15T20:46:28.959066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:46:28.939621Z","title":"Stop wasting my time! saving days of imagenet and BERT training with latest weight averaging","venue":null,"work_id":"caf5a9e8-5263-4196-94a4-70d65fe918d0","year":2022},"citing_paper":{"arxiv_id":"2505.12082","last_updated":"2025-05-22T09:35:43Z","snapshot_observed_at":"2026-08-15T20:39:05.998045Z","submitted_at":"2025-05-17T16:53:14Z","title":"Model Merging in Pre-training of Large Language Models","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T20:46:28.086596Z"},"links":{"citing_paper":"/paper/2505.12082"},"observation_digest":"sha256:a989c8ff7acabd1678fb1685e266f30da15dc871f68cab9ea9046735bda5ad64","observation_id":"2b0de40c-ddfa-430a-8e69-f771b2f930d0","resolution":{"observed_at":"2026-08-15T20:46:28.944286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-15T20:46:28.091049Z","title":"Scaling laws for neural language models.arXiv preprintarXiv:2001.08361, 2020","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2505.12082","last_updated":"2025-05-22T09:35:43Z","snapshot_observed_at":"2026-08-15T20:39:05.998045Z","submitted_at":"2025-05-17T16:53:14Z","title":"Model Merging in Pre-training of Large Language Models","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T20:46:28.091049Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2505.12082"},"observation_digest":"sha256:6be672ff10f1e6ccb2cb0e437be6b2259d39011df625547f03d93b2e2ad9ef0e","observation_id":"6e4a93c5-356a-4446-9a3a-9e46f31c46e4","resolution":{"observed_at":"2026-08-15T20:46:28.091049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:46:28.925209Z","title":"Trainable weight averaging: Efficient training by optimizing historical solutions","venue":null,"work_id":"5cba2283-ae4a-4645-b38b-f4f35862e541","year":2022},"citing_paper":{"arxiv_id":"2505.12082","last_updated":"2025-05-22T09:35:43Z","snapshot_observed_at":"2026-08-15T20:39:05.998045Z","submitted_at":"2025-05-17T16:53:14Z","title":"Model Merging in Pre-training of Large Language Models","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T20:46:28.095470Z"},"links":{"citing_paper":"/paper/2505.12082"},"observation_digest":"sha256:be9081d17b84e40511e7d07397bbe3de7c58c4063dc515c55a50fd2000f11b70","observation_id":"e54e9882-bdcf-4eaa-9728-ef474e5c1122","resolution":{"observed_at":"2026-08-15T20:46:28.930075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-18T18:18:37.449517Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-15T20:46:28.099762Z","title":"Deepseek-v3 technical report.arXiv preprint arXiv:2412.19437, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12082","last_updated":"2025-05-22T09:35:43Z","snapshot_observed_at":"2026-08-15T20:39:05.998045Z","submitted_at":"2025-05-17T16:53:14Z","title":"Model Merging in Pre-training of Large Language Models","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T20:46:28.099762Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2505.12082"},"observation_digest":"sha256:534184c6cb1010668b24b5af8f464813b5f95bc4d9b1d3bf97f84e6ead1604f8","observation_id":"08235f68-b1ff-48d8-961b-a118c409527e","resolution":{"observed_at":"2026-08-15T20:46:28.099762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19390","last_updated":"2025-06-03T06:01:14Z","snapshot_observed_at":"2026-08-18T14:06:07.369751Z","submitted_at":"2024-03-28T13:01:18Z","title":"Checkpoint Merging via Bayesian Optimization in LLM Pretraining","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19390","snapshot_observed_at":"2026-08-15T20:46:28.104948Z","title":"Checkpoint merging via bayesian optimization in llm pretraining.arXiv preprint arXiv:2403.19390, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12082","last_updated":"2025-05-22T09:35:43Z","snapshot_observed_at":"2026-08-15T20:39:05.998045Z","submitted_at":"2025-05-17T16:53:14Z","title":"Model Merging in Pre-training of Large Language Models","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T20:46:28.104948Z"},"links":{"cited_paper":"/paper/2403.19390","citing_paper":"/paper/2505.12082"},"observation_digest":"sha256:b02b1738120973da77d1796f92abfcbefe8a762e8c067fc44568a2ba2aa258f0","observation_id":"ceb07be9-756a-4a49-a66e-d7565e759fcd","resolution":{"observed_at":"2026-08-15T20:46:28.104948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:46:28.109336Z","title":"SGDR: Stochastic gradient descent with warm restarts","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.12082","last_updated":"2025-05-22T09:35:43Z","snapshot_observed_at":"2026-08-15T20:39:05.998045Z","submitted_at":"2025-05-17T16:53:14Z","title":"Model Merging in Pre-training of Large Language Models","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T20:46:28.109336Z"},"links":{"citing_paper":"/paper/2505.12082"},"observation_digest":"sha256:05934ecd74e0b8b9f0d414c51b35c100beaa4560522d5faaf6dccdb00f5007bc","observation_id":"3309126d-ca29-4e54-a4e6-7c4fee9cfeb0","resolution":{"observed_at":"2026-08-15T20:46:28.109336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:46:28.902172Z","title":"Wizardmath: Empowering mathematical reasoning for large language models via reinforced evol-instruct","venue":null,"work_id":"2d836366-ba08-4c70-8638-b24ae9fead8b","year":2025},"citing_paper":{"arxiv_id":"2505.12082","last_updated":"2025-05-22T09:35:43Z","snapshot_observed_at":"2026-08-15T20:39:05.998045Z","submitted_at":"2025-05-17T16:53:14Z","title":"Model Merging in Pre-training of Large Language Models","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T20:46:28.113454Z"},"links":{"citing_paper":"/paper/2505.12082"},"observation_digest":"sha256:b877e4c6056342dd0be5d253b1d5c9db63f275af79a9583da266e123edcf13d9","observation_id":"fcf1b735-1106-4bb8-a3d5-e7a6358126f7","resolution":{"observed_at":"2026-08-15T20:46:28.906903Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:46:28.117878Z","title":"Merging models with fisher-weighted averaging.Advances in Neural Information Processing Systems, 35:17703–17716, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.12082","last_updated":"2025-05-22T09:35:43Z","snapshot_observed_at":"2026-08-15T20:39:05.998045Z","submitted_at":"2025-05-17T16:53:14Z","title":"Model Merging in Pre-training of Large Language Models","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T20:46:28.117878Z"},"links":{"citing_paper":"/paper/2505.12082"},"observation_digest":"sha256:ef164e213898c01fab2136dfeb802fe3a740241f2dab8a329d9bd79772fc5de3","observation_id":"13cb1706-2de0-43c7-a4af-c32ebba4822d","resolution":{"observed_at":"2026-08-15T20:46:28.117878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.06162","last_updated":"2018-12-14T20:49:09Z","snapshot_observed_at":"2026-08-14T17:43:20.166812Z","submitted_at":"2018-12-14T20:49:09Z","title":"An Empirical Model of Large-Batch Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.06162","snapshot_observed_at":"2026-08-15T20:46:28.122787Z","title":"An empirical model of large-batch training","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.12082","last_updated":"2025-05-22T09:35:43Z","snapshot_observed_at":"2026-08-15T20:39:05.998045Z","submitted_at":"2025-05-17T16:53:14Z","title":"Model Merging in Pre-training of Large Language Models","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T20:46:28.122787Z"},"links":{"cited_paper":"/paper/1812.06162","citing_paper":"/paper/2505.12082"},"observation_digest":"sha256:f6e4d0a8be6ab4ba5933510c10936b271d18475825f5485b01e7ad8e0c6bd2ce","observation_id":"fcb3d693-7a59-41d3-937b-9a222a560c6c","resolution":{"observed_at":"2026-08-15T20:46:28.122787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:46:28.878161Z","title":"The weighted moving average technique.Wiley Encyclopedia of Operations Research and Management Science, 2010","venue":null,"work_id":"57e355ff-6aa4-45d7-88a5-6c2fe88f1418","year":2010},"citing_paper":{"arxiv_id":"2505.12082","last_updated":"2025-05-22T09:35:43Z","snapshot_observed_at":"2026-08-15T20:39:05.998045Z","submitted_at":"2025-05-17T16:53:14Z","title":"Model Merging in Pre-training of Large Language Models","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T20:46:28.127526Z"},"links":{"citing_paper":"/paper/2505.12082"},"observation_digest":"sha256:a4f999a86a47f5f68ff0f7a4ee83f749f4f1d287714a6db059227778f476c118","observation_id":"e0cfc1d1-ea07-4974-a2ab-daedd6058278","resolution":{"observed_at":"2026-08-15T20:46:28.883090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:46:28.131557Z","title":"Gpqa: A graduate-level google-proof q&a benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12082","last_updated":"2025-05-22T09:35:43Z","snapshot_observed_at":"2026-08-15T20:39:05.998045Z","submitted_at":"2025-05-17T16:53:14Z","title":"Model Merging in Pre-training of Large Language Models","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T20:46:28.131557Z"},"links":{"citing_paper":"/paper/2505.12082"},"observation_digest":"sha256:5cfcb08a609bcca2f2a4424fd9d137d93f3fe027e9b30b1c2246caf2f15bf85d","observation_id":"15e7104d-207f-4cdc-af77-ce5ef72d3731","resolution":{"observed_at":"2026-08-15T20:46:28.131557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:46:28.136077Z","title":"Winogrande: An adversarial winograd schema challenge at scale.Communications of the ACM, 64(9):99–106, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.12082","last_updated":"2025-05-22T09:35:43Z","snapshot_observed_at":"2026-08-15T20:39:05.998045Z","submitted_at":"2025-05-17T16:53:14Z","title":"Model Merging in Pre-training of Large Language Models","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T20:46:28.136077Z"},"links":{"citing_paper":"/paper/2505.12082"},"observation_digest":"sha256:4fd0d49fd9450847502e6ef08ff7b4f202633cff3060e85d4e9c739e742bc5c5","observation_id":"6017fe27-3ec2-46c4-acce-6ac0f84d3535","resolution":{"observed_at":"2026-08-15T20:46:28.136077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:46:28.846283Z","title":"Early weight averaging meets high learning rates for LLM pre-training","venue":null,"work_id":"bc1f852b-a8f3-4752-aa9f-2d1a39085a0b","year":2024},"citing_paper":{"arxiv_id":"2505.12082","last_updated":"2025-05-22T09:35:43Z","snapshot_observed_at":"2026-08-15T20:39:05.998045Z","submitted_at":"2025-05-17T16:53:14Z","title":"Model Merging in Pre-training of Large Language Models","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T20:46:28.140589Z"},"links":{"citing_paper":"/paper/2505.12082"},"observation_digest":"sha256:d463f27ff0a3543ac297436088386839e2824af15204ef71d1801c8ad4063f0f","observation_id":"f733f241-f864-4aa3-b47b-e00bc7be65b6","resolution":{"observed_at":"2026-08-15T20:46:28.850780Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:46:28.145028Z","title":"Seed-thinking-v1","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.12082","last_updated":"2025-05-22T09:35:43Z","snapshot_observed_at":"2026-08-15T20:39:05.998045Z","submitted_at":"2025-05-17T16:53:14Z","title":"Model Merging in Pre-training of Large Language Models","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T20:46:28.145028Z"},"links":{"citing_paper":"/paper/2505.12082"},"observation_digest":"sha256:46b2efe61d7b522c8d638bde87642f66c1eb465b8eb1ee089cf7b32965b71188","observation_id":"ab4f75e6-a192-43b5-982f-1f1bf5f31dd0","resolution":{"observed_at":"2026-08-15T20:46:28.145028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-15T20:46:28.149485Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12082","last_updated":"2025-05-22T09:35:43Z","snapshot_observed_at":"2026-08-15T20:39:05.998045Z","submitted_at":"2025-05-17T16:53:14Z","title":"Model Merging in Pre-training of Large Language Models","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T20:46:28.149485Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.12082"},"observation_digest":"sha256:3d619c34f509f2d64bf9813f447dd3d101b6eb927c2afb9a307766ded3fb2499","observation_id":"3e384067-98dc-4227-a9bd-81e473be7b7e","resolution":{"observed_at":"2026-08-15T20:46:28.149485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:46:28.154477Z","title":"Outrageously large neural networks: The sparsely-gated mixture-of-experts layer","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.12082","last_updated":"2025-05-22T09:35:43Z","snapshot_observed_at":"2026-08-15T20:39:05.998045Z","submitted_at":"2025-05-17T16:53:14Z","title":"Model Merging in Pre-training of Large Language Models","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T20:46:28.154477Z"},"links":{"citing_paper":"/paper/2505.12082"},"observation_digest":"sha256:dfc125552a78274f1780b59b4cc23d2f14dc6da3e7dbc53094eaad42e31b7d3c","observation_id":"7a370094-ffcc-4ee8-ae56-bd33208f8ad3","resolution":{"observed_at":"2026-08-15T20:46:28.154477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:46:28.823670Z","title":"Challenging BIG-bench tasks and whether chain-of- thought can solve them","venue":null,"work_id":"3b66ead0-945b-448f-963a-c29286d50e73","year":2023},"citing_paper":{"arxiv_id":"2505.12082","last_updated":"2025-05-22T09:35:43Z","snapshot_observed_at":"2026-08-15T20:39:05.998045Z","submitted_at":"2025-05-17T16:53:14Z","title":"Model Merging in Pre-training of Large Language Models","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T20:46:28.159389Z"},"links":{"citing_paper":"/paper/2505.12082"},"observation_digest":"sha256:b4cf2a05a1d06e94d429b033627946c250078f98cea411cced4d87d1e4871a36","observation_id":"1205ee6d-ee6c-4766-bad1-f09d51b5f3ee","resolution":{"observed_at":"2026-08-15T20:46:28.828274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-08-14T18:15:53.516440Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-15T20:46:28.163645Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context.arXiv preprint arXiv:2403.05530, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12082","last_updated":"2025-05-22T09:35:43Z","snapshot_observed_at":"2026-08-15T20:39:05.998045Z","submitted_at":"2025-05-17T16:53:14Z","title":"Model Merging in Pre-training of Large Language Models","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T20:46:28.163645Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2505.12082"},"observation_digest":"sha256:f4f9677abb3353d23fc2eacae346c3a2a44afac5c7e5a419b87fa06a467f06b6","observation_id":"73f8b1d7-a9a4-479b-a23e-544e4c0951be","resolution":{"observed_at":"2026-08-15T20:46:28.163645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:46:28.809698Z","title":"Mmlu-pro: A more robust and challenging multi-task language understanding benchmark","venue":null,"work_id":"5aa383f6-94f0-42d7-af84-615e5f639459","year":2024},"citing_paper":{"arxiv_id":"2505.12082","last_updated":"2025-05-22T09:35:43Z","snapshot_observed_at":"2026-08-15T20:39:05.998045Z","submitted_at":"2025-05-17T16:53:14Z","title":"Model Merging in Pre-training of Large Language Models","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T20:46:28.168009Z"},"links":{"citing_paper":"/paper/2505.12082"},"observation_digest":"sha256:47a9836c182734d284ba7cd52490b5ed65d4377e47536cd562601f5284908763","observation_id":"6c6fd893-5ccb-4866-8714-d9865e9d7e1a","resolution":{"observed_at":"2026-08-15T20:46:28.814108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:46:28.796123Z","title":"Dai, and Quoc V Le","venue":null,"work_id":"0deeb390-cdd6-41e7-823a-89fc27f11228","year":2022},"citing_paper":{"arxiv_id":"2505.12082","last_updated":"2025-05-22T09:35:43Z","snapshot_observed_at":"2026-08-15T20:39:05.998045Z","submitted_at":"2025-05-17T16:53:14Z","title":"Model Merging in Pre-training of Large Language Models","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T20:46:28.172072Z"},"links":{"citing_paper":"/paper/2505.12082"},"observation_digest":"sha256:a84333ab99edbe5d6c9378a555a6f64dd3c98cdc81046bd697495e472a844cef","observation_id":"3f52f625-1ed8-4e1d-b7c6-b32076afabdb","resolution":{"observed_at":"2026-08-15T20:46:28.800404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:46:28.781777Z","title":"Livebench: A challenging, contamination-limited LLM benchmark","venue":null,"work_id":"4ac0e7b2-6215-4856-9fa0-9ff07c57f7b1","year":2025},"citing_paper":{"arxiv_id":"2505.12082","last_updated":"2025-05-22T09:35:43Z","snapshot_observed_at":"2026-08-15T20:39:05.998045Z","submitted_at":"2025-05-17T16:53:14Z","title":"Model Merging in Pre-training of Large Language Models","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T20:46:28.176555Z"},"links":{"citing_paper":"/paper/2505.12082"},"observation_digest":"sha256:b61939a89fa9a40c6c27b4b56f85b7f3e4fc6118bd3958dfde2902948d21c9c0","observation_id":"8b17a5cd-4a8d-4f45-bece-510fea2ae4d2","resolution":{"observed_at":"2026-08-15T20:46:28.786598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:46:28.766379Z","title":"Small-scale proxies for large-scale transformer training instabilities","venue":null,"work_id":"3cf164f3-edbf-4b4a-9f82-566a309d991b","year":2024},"citing_paper":{"arxiv_id":"2505.12082","last_updated":"2025-05-22T09:35:43Z","snapshot_observed_at":"2026-08-15T20:39:05.998045Z","submitted_at":"2025-05-17T16:53:14Z","title":"Model Merging in Pre-training of Large Language Models","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T20:46:28.181037Z"},"links":{"citing_paper":"/paper/2505.12082"},"observation_digest":"sha256:40c2096e3d5284315ce2d3fbc569ce83f317414d273571e0db5720f23360e59c","observation_id":"5ed6c65a-7216-4061-91ea-c214d88deb82","resolution":{"observed_at":"2026-08-15T20:46:28.771728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:46:28.750864Z","title":"WizardLM: Empowering large pre-trained language models to follow complex instructions","venue":null,"work_id":"2202fa54-6b59-488f-83af-c5e7d4bb7ce5","year":2024},"citing_paper":{"arxiv_id":"2505.12082","last_updated":"2025-05-22T09:35:43Z","snapshot_observed_at":"2026-08-15T20:39:05.998045Z","submitted_at":"2025-05-17T16:53:14Z","title":"Model Merging in Pre-training of Large Language Models","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T20:46:28.185394Z"},"links":{"citing_paper":"/paper/2505.12082"},"observation_digest":"sha256:20a5ea768ed23597d31d51d186b1d35668f92e788ab62694799ebfa5e6622790","observation_id":"07f1acda-f168-41bb-8595-4c7eb99b71b7","resolution":{"observed_at":"2026-08-15T20:46:28.756060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:46:28.735049Z","title":"TIES-merging: Resolving interference when merging models","venue":null,"work_id":"e5e59016-5ae2-4d63-9de0-7920de6258fc","year":2023},"citing_paper":{"arxiv_id":"2505.12082","last_updated":"2025-05-22T09:35:43Z","snapshot_observed_at":"2026-08-15T20:39:05.998045Z","submitted_at":"2025-05-17T16:53:14Z","title":"Model Merging in Pre-training of Large Language Models","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T20:46:28.189876Z"},"links":{"citing_paper":"/paper/2505.12082"},"observation_digest":"sha256:302792cb32ea430ea204d819141955051e6c1d35e0da8809742cbb0c88eb59b7","observation_id":"3f9a73ed-d049-4584-b97b-64c716ee8d7e","resolution":{"observed_at":"2026-08-15T20:46:28.739730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10305","last_updated":"2025-04-17T08:34:42Z","snapshot_observed_at":"2026-08-14T19:59:05.307983Z","submitted_at":"2023-09-19T04:13:22Z","title":"Baichuan 2: Open Large-scale Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10305","snapshot_observed_at":"2026-08-15T20:46:28.194200Z","title":"Baichuan 2: Open large-scale language models.arXiv preprint arXiv:2309.10305, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12082","last_updated":"2025-05-22T09:35:43Z","snapshot_observed_at":"2026-08-15T20:39:05.998045Z","submitted_at":"2025-05-17T16:53:14Z","title":"Model Merging in Pre-training of Large Language Models","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T20:46:28.194200Z"},"links":{"cited_paper":"/paper/2309.10305","citing_paper":"/paper/2505.12082"},"observation_digest":"sha256:14206d8e3a8939d5637418e2caa0a0926f409aa997cc3df09063b31744a73fe3","observation_id":"975fafc3-1f35-4e9e-acd6-997afcb40bc5","resolution":{"observed_at":"2026-08-15T20:46:28.194200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-08-17T18:50:07.059564Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-15T20:46:28.198793Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12082","last_updated":"2025-05-22T09:35:43Z","snapshot_observed_at":"2026-08-15T20:39:05.998045Z","submitted_at":"2025-05-17T16:53:14Z","title":"Model Merging in Pre-training of Large Language Models","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T20:46:28.198793Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.12082"},"observation_digest":"sha256:76ce5b0893356b983c68157e86d0bdac2f79d5ccfa9f0d3dce3dc688a69e0f10","observation_id":"1419f775-e006-4a89-8060-f18f0bf6a6ae","resolution":{"observed_at":"2026-08-15T20:46:28.198793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.07666","last_updated":"2025-12-31T04:06:49Z","snapshot_observed_at":"2026-08-07T23:28:24.025478Z","submitted_at":"2024-08-14T16:58:48Z","title":"Model Merging in LLMs, MLLMs, and Beyond: Methods, Theories, Applications and Opportunities","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.07666","snapshot_observed_at":"2026-08-15T20:46:28.203139Z","title":"Model merging in llms, mllms, and beyond: Methods, theories, applications and opportunities.arXiv preprint arXiv:2408.07666, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12082","last_updated":"2025-05-22T09:35:43Z","snapshot_observed_at":"2026-08-15T20:39:05.998045Z","submitted_at":"2025-05-17T16:53:14Z","title":"Model Merging in Pre-training of Large Language Models","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T20:46:28.203139Z"},"links":{"cited_paper":"/paper/2408.07666","citing_paper":"/paper/2505.12082"},"observation_digest":"sha256:4521f64b6eb675f86f4788e50a1a2574b4ed82408be5f20e9d29515a134b19dc","observation_id":"20d6aab7-72a0-45d2-a645-5d0e0a4bd855","resolution":{"observed_at":"2026-08-15T20:46:28.203139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:46:28.720779Z","title":"Adamerging: Adaptive model merging for multi-task learning","venue":null,"work_id":"792b0782-7f82-4e99-9da4-8e9605698c0f","year":2024},"citing_paper":{"arxiv_id":"2505.12082","last_updated":"2025-05-22T09:35:43Z","snapshot_observed_at":"2026-08-15T20:39:05.998045Z","submitted_at":"2025-05-17T16:53:14Z","title":"Model Merging in Pre-training of Large Language Models","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T20:46:28.207520Z"},"links":{"citing_paper":"/paper/2505.12082"},"observation_digest":"sha256:f2858c01bca96f167377437ce3ff05084600bc0732c4f52086e03eb0ee444ed4","observation_id":"aa8c7e5b-22e5-4888-959e-d68ffeec81a2","resolution":{"observed_at":"2026-08-15T20:46:28.725421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:46:28.706219Z","title":"Language models are super mario: Absorbing abilities from homologous models as a free lunch","venue":null,"work_id":"ae61eb55-246b-4807-8353-a0abdcc0f24d","year":2024},"citing_paper":{"arxiv_id":"2505.12082","last_updated":"2025-05-22T09:35:43Z","snapshot_observed_at":"2026-08-15T20:39:05.998045Z","submitted_at":"2025-05-17T16:53:14Z","title":"Model Merging in Pre-training of Large Language Models","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T20:46:28.211878Z"},"links":{"citing_paper":"/paper/2505.12082"},"observation_digest":"sha256:175b20dfa43a3cfc7bfc2507d6773ee94047687f93b49adf7958e8bed05b964b","observation_id":"bc2a334e-9ee0-4af7-82c9-269437af24c5","resolution":{"observed_at":"2026-08-15T20:46:28.711011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-18T05:01:20.543826Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-15T20:46:28.216068Z","title":"Dapo: An open-source llm reinforcement learning system at scale.arXiv preprint arXiv:2503.14476, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.12082","last_updated":"2025-05-22T09:35:43Z","snapshot_observed_at":"2026-08-15T20:39:05.998045Z","submitted_at":"2025-05-17T16:53:14Z","title":"Model Merging in Pre-training of Large Language Models","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T20:46:28.216068Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.12082"},"observation_digest":"sha256:f9d9fad4d3ba60ddc9e5ea1bdbbcf0c4958de3f6185b172d8a725e97551413ca","observation_id":"3e4cb3b1-6dcc-4ef7-9ac8-a149d50e25fe","resolution":{"observed_at":"2026-08-15T20:46:28.216068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-14T16:01:52.772456Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-15T20:46:28.220562Z","title":"Vapo: Efficient and reliable reinforcement learning for advanced reasoning tasks","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.12082","last_updated":"2025-05-22T09:35:43Z","snapshot_observed_at":"2026-08-15T20:39:05.998045Z","submitted_at":"2025-05-17T16:53:14Z","title":"Model Merging in Pre-training of Large Language Models","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T20:46:28.220562Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2505.12082"},"observation_digest":"sha256:b3dc4455a55eea4ff601fdd5f0705725abb0c9135b99b4393938a2c426aa7759","observation_id":"fa64e4dd-c4bf-4bef-8fa8-94024c6853c2","resolution":{"observed_at":"2026-08-15T20:46:28.220562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.07830","last_updated":"2019-05-19T23:57:23Z","snapshot_observed_at":"2026-08-15T09:37:44.321271Z","submitted_at":"2019-05-19T23:57:23Z","title":"HellaSwag: Can a Machine Really Finish Your Sentence?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.07830","snapshot_observed_at":"2026-08-15T20:46:28.225152Z","title":"Hellaswag: Can a machine really finish your sentence? arXiv preprint arXiv:1905.07830, 2019","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2505.12082","last_updated":"2025-05-22T09:35:43Z","snapshot_observed_at":"2026-08-15T20:39:05.998045Z","submitted_at":"2025-05-17T16:53:14Z","title":"Model Merging in Pre-training of Large Language Models","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T20:46:28.225152Z"},"links":{"cited_paper":"/paper/1905.07830","citing_paper":"/paper/2505.12082"},"observation_digest":"sha256:4aae133f78c866ce285d48e4bcaaaba074ac8b7572fd7eaed04f02287f531778","observation_id":"4d7d8925-ac6d-4eca-9cb6-31086e773e10","resolution":{"observed_at":"2026-08-15T20:46:28.225152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.11506","last_updated":"2020-10-09T01:36:35Z","snapshot_observed_at":"2026-07-06T09:58:22.699198Z","submitted_at":"2020-09-24T06:17:10Z","title":"Ape210K: A Large-Scale and Template-Rich Dataset of Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.11506","snapshot_observed_at":"2026-08-15T20:46:28.229714Z","title":"Ape210k: A large-scale and template-rich dataset of math word problems.arXiv preprint arXiv:2009.11506, 2020","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.12082","last_updated":"2025-05-22T09:35:43Z","snapshot_observed_at":"2026-08-15T20:39:05.998045Z","submitted_at":"2025-05-17T16:53:14Z","title":"Model Merging in Pre-training of Large Language Models","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T20:46:28.229714Z"},"links":{"cited_paper":"/paper/2009.11506","citing_paper":"/paper/2505.12082"},"observation_digest":"sha256:5b735f055873d13112fa8d37841ba060750c2e7de0b6d8212b4bc1b25db5232f","observation_id":"9e386bee-32b1-4cea-863e-91acaf16e72a","resolution":{"observed_at":"2026-08-15T20:46:28.229714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:46:28.691123Z","title":"AGIEval: A human-centric benchmark for evaluating foundation models","venue":null,"work_id":"441039df-3b14-4933-9374-23ab7e88641b","year":2024},"citing_paper":{"arxiv_id":"2505.12082","last_updated":"2025-05-22T09:35:43Z","snapshot_observed_at":"2026-08-15T20:39:05.998045Z","submitted_at":"2025-05-17T16:53:14Z","title":"Model Merging in Pre-training of Large Language Models","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T20:46:28.234367Z"},"links":{"citing_paper":"/paper/2505.12082"},"observation_digest":"sha256:c4bbc3e2a183596938c78840a61e1605b09e23a9eb574ee980c6d925aeef6ab9","observation_id":"6694c25b-3f3b-41a3-bd03-50540bfc15eb","resolution":{"observed_at":"2026-08-15T20:46:28.695843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:46:28.674771Z","title":"MetaGPT: Merging large language models using model exclusive task arithmetic","venue":null,"work_id":"51264cad-1fad-4811-8e58-a9539e857942","year":2024},"citing_paper":{"arxiv_id":"2505.12082","last_updated":"2025-05-22T09:35:43Z","snapshot_observed_at":"2026-08-15T20:39:05.998045Z","submitted_at":"2025-05-17T16:53:14Z","title":"Model Merging in Pre-training of Large Language Models","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T20:46:28.238597Z"},"links":{"citing_paper":"/paper/2505.12082"},"observation_digest":"sha256:497d574b0d7f0aa74ac0b5bfffcb5298f5dd28997380d08fba7843e3fcd41c2a","observation_id":"bf9d46d5-0779-438b-aab2-fd7d94bc92b3","resolution":{"observed_at":"2026-08-15T20:46:28.681134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.12082","last_updated":"2025-05-22T09:35:43Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-15T20:39:05.998045Z","submitted_at":"2025-05-17T16:53:14Z","title":"Model Merging in Pre-training of Large Language Models"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":33,"verified_exact":0,"verified_fuzzy":24},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 11 inbound Pith citation observations for arXiv:2505.12082."}