{"as_of":"2026-08-18T07:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0c86f246436cb34a48f8d9e1cad193c7e8e2c0325c76c6fa270150b1555e20df","coverage":[{"denominator":62,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":62,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-12T03:38:39.738401Z","state":"measured"},{"denominator":63,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":63,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T05:33:53.927154Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-05T05:33:56.202284Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.10129","last_updated":"2026-05-11T07:40:39Z","snapshot_observed_at":"2026-08-14T06:16:09.741529Z","submitted_at":"2026-05-11T07:40:39Z","title":"Synthetic Pre-Pre-Training Improves Language Model Robustness to Noisy Pre-Training Data","version":1},"cited_work":{"arxiv_id":"2605.10129","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.10129","snapshot_observed_at":"2026-08-05T05:33:56.202284Z","title":"Synthetic Pre-Pre-Training Improves Language Model Robustness to Noisy Pre-Training Data","venue":"cs.CL","work_id":"6d3c7958-a357-4335-962f-d2121212d166","year":2026},"citing_paper":{"arxiv_id":"2608.03930","last_updated":"2026-08-04T17:02:34Z","snapshot_observed_at":"2026-08-18T05:25:04.435332Z","submitted_at":"2026-08-04T17:02:34Z","title":"Logic Before Language: Pre-pretraining on Formal Derivations Fosters Skill Acquisition and Compressibility","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-05T05:33:53.927154Z"},"links":{"cited_paper":"/paper/2605.10129","citing_paper":"/paper/2608.03930"},"observation_digest":"sha256:dd6ad90236433454d563e350fa3358d712b3baad53469d9c6aaff93e2461b7cf","observation_id":"5ca3996f-5305-417f-86a2-e3e2e34cfb33","resolution":{"observed_at":"2026-08-05T05:33:56.215173Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2605.10129/citation-record","integrity":"/paper/2605.10129/integrity","json":"/paper/2605.10129/citation-record.json","paper":"/paper/2605.10129"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , eprint =","venue":null,"work_id":"4e79d0f1-2e5b-40ac-93fc-7e7bd482adb1","year":2025},"citing_paper":{"arxiv_id":"2605.10129","last_updated":"2026-05-11T07:40:39Z","snapshot_observed_at":"2026-08-14T06:16:09.741529Z","submitted_at":"2026-05-11T07:40:39Z","title":"Synthetic Pre-Pre-Training Improves Language Model Robustness to Noisy Pre-Training Data","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-05-12T03:38:39.738401Z"},"links":{"citing_paper":"/paper/2605.10129"},"observation_digest":"sha256:ba9df96ee761bbce0ad3d2d4febba1247fb93e3d5e11453fb95042d6f9d6d385","observation_id":"d287a732-f633-40f0-bdb6-6b9b80251e28","resolution":{"observed_at":"2026-05-12T18:46:46.235488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2020 , eprint =","venue":null,"work_id":"1123b6e9-af93-4043-99c6-e7b8a2560445","year":2020},"citing_paper":{"arxiv_id":"2605.10129","last_updated":"2026-05-11T07:40:39Z","snapshot_observed_at":"2026-08-14T06:16:09.741529Z","submitted_at":"2026-05-11T07:40:39Z","title":"Synthetic Pre-Pre-Training Improves Language Model Robustness to Noisy Pre-Training Data","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-12T03:38:39.738401Z"},"links":{"citing_paper":"/paper/2605.10129"},"observation_digest":"sha256:03d1076f91759a2c3cf5d01fd93d2fe08043fe7b09a512bc220b5f80320c1e87","observation_id":"0f259c7e-1e20-426c-a65a-596c85b38de7","resolution":{"observed_at":"2026-05-12T18:46:46.199058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023 , eprint =","venue":null,"work_id":"63589402-6ee4-4425-81a5-23beb61f0509","year":2023},"citing_paper":{"arxiv_id":"2605.10129","last_updated":"2026-05-11T07:40:39Z","snapshot_observed_at":"2026-08-14T06:16:09.741529Z","submitted_at":"2026-05-11T07:40:39Z","title":"Synthetic Pre-Pre-Training Improves Language Model Robustness to Noisy Pre-Training Data","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-12T03:38:39.738401Z"},"links":{"citing_paper":"/paper/2605.10129"},"observation_digest":"sha256:f2a811724c4fb195308fce88c12e9284385d6fd146c3f4bfcd1b28e225a14777","observation_id":"f9adb72c-2e3d-4924-a6b8-36338f9189dc","resolution":{"observed_at":"2026-05-12T18:46:46.250841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023 , eprint=","venue":null,"work_id":"243b7170-52f2-41bd-8d26-1c4218d5503e","year":2023},"citing_paper":{"arxiv_id":"2605.10129","last_updated":"2026-05-11T07:40:39Z","snapshot_observed_at":"2026-08-14T06:16:09.741529Z","submitted_at":"2026-05-11T07:40:39Z","title":"Synthetic Pre-Pre-Training Improves Language Model Robustness to Noisy Pre-Training Data","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-12T03:38:39.738401Z"},"links":{"citing_paper":"/paper/2605.10129"},"observation_digest":"sha256:7d20cb53ccd4e8127aaf3f7a1c1631beaaec783a1cb901509025b017cfe3e101","observation_id":"d70c2b7c-5b01-4234-989b-5dc30519babd","resolution":{"observed_at":"2026-05-12T18:46:46.269897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T22:57:43.434496Z","title":"2016 , eprint=","venue":null,"work_id":"1d2c5272-ebb4-4faa-92b9-3d9a9ebc7d9b","year":2016},"citing_paper":{"arxiv_id":"2605.10129","last_updated":"2026-05-11T07:40:39Z","snapshot_observed_at":"2026-08-14T06:16:09.741529Z","submitted_at":"2026-05-11T07:40:39Z","title":"Synthetic Pre-Pre-Training Improves Language Model Robustness to Noisy Pre-Training Data","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-12T03:38:39.738401Z"},"links":{"citing_paper":"/paper/2605.10129"},"observation_digest":"sha256:7adba1c21bd857413e7e34b8b08f33d9a5b43f77bc40a840f0d7126be64e899c","observation_id":"ed854f06-72b2-4435-8c32-7352400f8dff","resolution":{"observed_at":"2026-05-12T18:46:46.218638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:37:47.723353Z","title":"2023 , eprint=","venue":null,"work_id":"d5d20a89-f262-4c7c-8354-cb5508d8feba","year":2023},"citing_paper":{"arxiv_id":"2605.10129","last_updated":"2026-05-11T07:40:39Z","snapshot_observed_at":"2026-08-14T06:16:09.741529Z","submitted_at":"2026-05-11T07:40:39Z","title":"Synthetic Pre-Pre-Training Improves Language Model Robustness to Noisy Pre-Training Data","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-12T03:38:39.738401Z"},"links":{"citing_paper":"/paper/2605.10129"},"observation_digest":"sha256:72cd556224c6a01181fa1ba657bcae330102d96b68ae4a62d5fd865ae36d5141","observation_id":"492389c6-3cdf-4966-b087-780a0dd86bdb","resolution":{"observed_at":"2026-05-12T18:46:46.207303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T17:56:26.165794Z","title":"Journal of machine learning research , volume=","venue":null,"work_id":"d1b76c93-2608-4f12-9b0e-1c71236cad23","year":null},"citing_paper":{"arxiv_id":"2605.10129","last_updated":"2026-05-11T07:40:39Z","snapshot_observed_at":"2026-08-14T06:16:09.741529Z","submitted_at":"2026-05-11T07:40:39Z","title":"Synthetic Pre-Pre-Training Improves Language Model Robustness to Noisy Pre-Training Data","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-12T03:38:39.738401Z"},"links":{"citing_paper":"/paper/2605.10129"},"observation_digest":"sha256:8f71966c9dea46e0f9367ec08973ac73489fba404160afe2cb2a96744c7a018d","observation_id":"cda71a16-1d14-48d0-abb4-c7ab090cec4e","resolution":{"observed_at":"2026-05-12T18:46:46.180878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , eprint=","venue":null,"work_id":"ee8f1b3d-4293-41fc-b691-b308f91e3529","year":2024},"citing_paper":{"arxiv_id":"2605.10129","last_updated":"2026-05-11T07:40:39Z","snapshot_observed_at":"2026-08-14T06:16:09.741529Z","submitted_at":"2026-05-11T07:40:39Z","title":"Synthetic Pre-Pre-Training Improves Language Model Robustness to Noisy Pre-Training Data","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-12T03:38:39.738401Z"},"links":{"citing_paper":"/paper/2605.10129"},"observation_digest":"sha256:2e1ddaae94d2fa8309d36749fb04673a7be2a25f68939cc2b6a4f243fd44a60f","observation_id":"e1e2027e-3cc9-4d7c-b501-64368c06d202","resolution":{"observed_at":"2026-05-12T18:46:46.191776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , eprint=","venue":null,"work_id":"9e66db3c-614b-4279-a050-a23103fc632f","year":2024},"citing_paper":{"arxiv_id":"2605.10129","last_updated":"2026-05-11T07:40:39Z","snapshot_observed_at":"2026-08-14T06:16:09.741529Z","submitted_at":"2026-05-11T07:40:39Z","title":"Synthetic Pre-Pre-Training Improves Language Model Robustness to Noisy Pre-Training Data","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-12T03:38:39.738401Z"},"links":{"citing_paper":"/paper/2605.10129"},"observation_digest":"sha256:b8e36673c858cbeb064cf5ec12fbb2f419ecb1c0290016aef5d4aff7840db24b","observation_id":"23329a6c-f76c-4ccf-8c70-bc261f15e40e","resolution":{"observed_at":"2026-05-12T18:46:46.170042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2019 , eprint=","venue":null,"work_id":"0e6ae844-8efa-4640-a5a8-de0708267e08","year":2019},"citing_paper":{"arxiv_id":"2605.10129","last_updated":"2026-05-11T07:40:39Z","snapshot_observed_at":"2026-08-14T06:16:09.741529Z","submitted_at":"2026-05-11T07:40:39Z","title":"Synthetic Pre-Pre-Training Improves Language Model Robustness to Noisy Pre-Training Data","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-12T03:38:39.738401Z"},"links":{"citing_paper":"/paper/2605.10129"},"observation_digest":"sha256:f0c71e3cb6fe208a9a3296d87a0c1cbf3d5515ee47f665ffca595451400873d9","observation_id":"b083a3ea-d17a-4322-b4a4-218451aee362","resolution":{"observed_at":"2026-05-12T18:46:46.354528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T00:04:22.972979Z","title":"Proceedings of the 26th annual international conference on machine learning , pages=","venue":null,"work_id":"8aebf877-9152-4d85-bc17-cce72964eda1","year":null},"citing_paper":{"arxiv_id":"2605.10129","last_updated":"2026-05-11T07:40:39Z","snapshot_observed_at":"2026-08-14T06:16:09.741529Z","submitted_at":"2026-05-11T07:40:39Z","title":"Synthetic Pre-Pre-Training Improves Language Model Robustness to Noisy Pre-Training Data","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-12T03:38:39.738401Z"},"links":{"citing_paper":"/paper/2605.10129"},"observation_digest":"sha256:042ee358f2a60146c89800075c8b9b8d68c7ca7c721fbb3b5b47086d9894c132","observation_id":"42705cf6-c977-4fa7-90a3-f7a193ee31eb","resolution":{"observed_at":"2026-05-12T18:46:46.223503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023 , eprint=","venue":null,"work_id":"29f286e6-1ad6-4ffd-b2ff-d96809538d2a","year":2023},"citing_paper":{"arxiv_id":"2605.10129","last_updated":"2026-05-11T07:40:39Z","snapshot_observed_at":"2026-08-14T06:16:09.741529Z","submitted_at":"2026-05-11T07:40:39Z","title":"Synthetic Pre-Pre-Training Improves Language Model Robustness to Noisy Pre-Training Data","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-12T03:38:39.738401Z"},"links":{"citing_paper":"/paper/2605.10129"},"observation_digest":"sha256:746e5f6e6be9028b6767382280e33836d1b10ff1d7c79fa191b7312fec07532b","observation_id":"8801d9af-1640-48ab-9a77-54508cb3cb07","resolution":{"observed_at":"2026-05-12T18:46:46.227068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T19:11:21.546039Z","title":"2024 , eprint=","venue":null,"work_id":"c266f192-9505-4b5f-a900-4fd9ef4aac80","year":2024},"citing_paper":{"arxiv_id":"2605.10129","last_updated":"2026-05-11T07:40:39Z","snapshot_observed_at":"2026-08-14T06:16:09.741529Z","submitted_at":"2026-05-11T07:40:39Z","title":"Synthetic Pre-Pre-Training Improves Language Model Robustness to Noisy Pre-Training Data","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-12T03:38:39.738401Z"},"links":{"citing_paper":"/paper/2605.10129"},"observation_digest":"sha256:542835cb8d0f65877869b4b7af8b099c92e70f9408c2f9f68faa4e0892654979","observation_id":"17be6ef5-e260-4893-9a65-ecb99ea4d1a9","resolution":{"observed_at":"2026-05-12T18:46:46.195417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , eprint=","venue":null,"work_id":"fb824c56-7de8-4927-90c3-bfec2335f9e3","year":2024},"citing_paper":{"arxiv_id":"2605.10129","last_updated":"2026-05-11T07:40:39Z","snapshot_observed_at":"2026-08-14T06:16:09.741529Z","submitted_at":"2026-05-11T07:40:39Z","title":"Synthetic Pre-Pre-Training Improves Language Model Robustness to Noisy Pre-Training Data","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-12T03:38:39.738401Z"},"links":{"citing_paper":"/paper/2605.10129"},"observation_digest":"sha256:8c00dcf3ad7db2092bc0a090cbde4c06b0950cbe2f73ec0c2b7afcc0b66b0aef","observation_id":"8eced79e-cccc-4ff8-b469-05e0efe860c1","resolution":{"observed_at":"2026-05-12T18:46:46.211449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"e8135337-229c-4cec-b22b-dc97e8235a1c","year":null},"citing_paper":{"arxiv_id":"2605.10129","last_updated":"2026-05-11T07:40:39Z","snapshot_observed_at":"2026-08-14T06:16:09.741529Z","submitted_at":"2026-05-11T07:40:39Z","title":"Synthetic Pre-Pre-Training Improves Language Model Robustness to Noisy Pre-Training Data","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-12T03:38:39.738401Z"},"links":{"citing_paper":"/paper/2605.10129"},"observation_digest":"sha256:c86ae6ce7119e16c611565d94b3fd86c682a7149d29cdbf9379b659024cf8999","observation_id":"2cf2127d-59fe-421d-ba7a-84a4d3443ced","resolution":{"observed_at":"2026-05-12T18:46:46.166265Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2022 , eprint=","venue":null,"work_id":"31881c45-9ea0-4096-849a-94cf0dc323f9","year":2022},"citing_paper":{"arxiv_id":"2605.10129","last_updated":"2026-05-11T07:40:39Z","snapshot_observed_at":"2026-08-14T06:16:09.741529Z","submitted_at":"2026-05-11T07:40:39Z","title":"Synthetic Pre-Pre-Training Improves Language Model Robustness to Noisy Pre-Training Data","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-12T03:38:39.738401Z"},"links":{"citing_paper":"/paper/2605.10129"},"observation_digest":"sha256:9a84317cbe13e1b1da48d8a51a18e41329c8a62282df1e192d2cef8c9c910439","observation_id":"818872a7-d3eb-4101-802f-0326c69cc1df","resolution":{"observed_at":"2026-05-12T18:46:46.184085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023 , eprint=","venue":null,"work_id":"6dccd328-8f9a-4d05-a8ba-f4ecb56419aa","year":2023},"citing_paper":{"arxiv_id":"2605.10129","last_updated":"2026-05-11T07:40:39Z","snapshot_observed_at":"2026-08-14T06:16:09.741529Z","submitted_at":"2026-05-11T07:40:39Z","title":"Synthetic Pre-Pre-Training Improves Language Model Robustness to Noisy Pre-Training Data","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-12T03:38:39.738401Z"},"links":{"citing_paper":"/paper/2605.10129"},"observation_digest":"sha256:997a4638ccabcad87c0ee749a1603d9928f92e361841d5f28d6aa764b51dffd7","observation_id":"77783ced-bd0d-459a-95fc-263252d0dd7c","resolution":{"observed_at":"2026-05-12T18:46:46.297101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2019 , eprint=","venue":null,"work_id":"71bd30a4-92a1-4aff-bf79-c39feb2648e8","year":2019},"citing_paper":{"arxiv_id":"2605.10129","last_updated":"2026-05-11T07:40:39Z","snapshot_observed_at":"2026-08-14T06:16:09.741529Z","submitted_at":"2026-05-11T07:40:39Z","title":"Synthetic Pre-Pre-Training Improves Language Model Robustness to Noisy Pre-Training Data","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-12T03:38:39.738401Z"},"links":{"citing_paper":"/paper/2605.10129"},"observation_digest":"sha256:d7a87c4c67ed54a3afae9652950003a4508c5df5cdb73a97710c0584cdaebb4e","observation_id":"aa669298-61bf-4744-8685-1e8843bf5820","resolution":{"observed_at":"2026-05-12T18:46:46.285995Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2019 , eprint=","venue":null,"work_id":"a166c16c-98ae-4283-8dae-43efc0ad4da8","year":2019},"citing_paper":{"arxiv_id":"2605.10129","last_updated":"2026-05-11T07:40:39Z","snapshot_observed_at":"2026-08-14T06:16:09.741529Z","submitted_at":"2026-05-11T07:40:39Z","title":"Synthetic Pre-Pre-Training Improves Language Model Robustness to Noisy Pre-Training Data","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-12T03:38:39.738401Z"},"links":{"citing_paper":"/paper/2605.10129"},"observation_digest":"sha256:6eec095ddf401066cc086de45090b3bacadbdc3f89e09c56b10b44c1267dba9b","observation_id":"729c4318-0ba5-45a6-9d26-c0fa65bbcf1b","resolution":{"observed_at":"2026-05-12T18:46:46.262744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2021 , eprint=","venue":null,"work_id":"02cb6803-16c9-4c58-bded-6111b9a4bc98","year":2021},"citing_paper":{"arxiv_id":"2605.10129","last_updated":"2026-05-11T07:40:39Z","snapshot_observed_at":"2026-08-14T06:16:09.741529Z","submitted_at":"2026-05-11T07:40:39Z","title":"Synthetic Pre-Pre-Training Improves Language Model Robustness to Noisy Pre-Training Data","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-12T03:38:39.738401Z"},"links":{"citing_paper":"/paper/2605.10129"},"observation_digest":"sha256:5fc360e8baad53318e47e3ecf651fcba30736dbcd5ecfc5c914ed1d3a8019c08","observation_id":"ea8cd691-c147-4be3-9c6e-1cd2a79187c3","resolution":{"observed_at":"2026-05-12T18:46:46.215510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2022 , eprint=","venue":null,"work_id":"28d5aa10-0eea-45ec-b792-471230ba7646","year":2022},"citing_paper":{"arxiv_id":"2605.10129","last_updated":"2026-05-11T07:40:39Z","snapshot_observed_at":"2026-08-14T06:16:09.741529Z","submitted_at":"2026-05-11T07:40:39Z","title":"Synthetic Pre-Pre-Training Improves Language Model Robustness to Noisy Pre-Training Data","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-12T03:38:39.738401Z"},"links":{"citing_paper":"/paper/2605.10129"},"observation_digest":"sha256:51897a574ee5c15247052cec6d10e6f49e5d86a97b682dde5606c24c5846ca90","observation_id":"151dd78a-33bb-4d9c-8229-fa6b5c263b65","resolution":{"observed_at":"2026-05-12T18:46:46.187708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:08:02.344867Z","title":"2019 , eprint=","venue":null,"work_id":"5f2345fb-4e80-45ca-8971-f128b26375be","year":2019},"citing_paper":{"arxiv_id":"2605.10129","last_updated":"2026-05-11T07:40:39Z","snapshot_observed_at":"2026-08-14T06:16:09.741529Z","submitted_at":"2026-05-11T07:40:39Z","title":"Synthetic Pre-Pre-Training Improves Language Model Robustness to Noisy Pre-Training Data","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-12T03:38:39.738401Z"},"links":{"citing_paper":"/paper/2605.10129"},"observation_digest":"sha256:f325db55b8afeb930ea088ebfcae1a0dad825e6d2a81a80b3c4c26c00d57f9e3","observation_id":"83e16d8b-c117-4cbc-b555-b4dab99d6b0e","resolution":{"observed_at":"2026-05-12T18:46:46.331131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2020 , eprint =","venue":null,"work_id":"e7ca6040-54f2-4164-9ada-badbf567686b","year":2020},"citing_paper":{"arxiv_id":"2605.10129","last_updated":"2026-05-11T07:40:39Z","snapshot_observed_at":"2026-08-14T06:16:09.741529Z","submitted_at":"2026-05-11T07:40:39Z","title":"Synthetic Pre-Pre-Training Improves Language Model Robustness to Noisy Pre-Training Data","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-12T03:38:39.738401Z"},"links":{"citing_paper":"/paper/2605.10129"},"observation_digest":"sha256:d4fb21f841d7964bb9ea01e86533fb2cc4857c20522467eb9bda3faa870551c2","observation_id":"0a8fc2e3-8365-454a-a081-3f61172562cd","resolution":{"observed_at":"2026-05-12T18:46:46.174153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2019 , eprint =","venue":null,"work_id":"67da36bd-6e24-449c-8fea-03bf8afdfe87","year":2019},"citing_paper":{"arxiv_id":"2605.10129","last_updated":"2026-05-11T07:40:39Z","snapshot_observed_at":"2026-08-14T06:16:09.741529Z","submitted_at":"2026-05-11T07:40:39Z","title":"Synthetic Pre-Pre-Training Improves Language Model Robustness to Noisy Pre-Training Data","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-12T03:38:39.738401Z"},"links":{"citing_paper":"/paper/2605.10129"},"observation_digest":"sha256:e151971b7bc2c4be52fb790aa3e508f21569b0e72ca66361b09df044656b649c","observation_id":"bab011ff-3097-4ebf-875a-92c60c30327a","resolution":{"observed_at":"2026-05-12T18:46:46.277811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2026 , eprint =","venue":null,"work_id":"04b66b1e-c709-41e1-bae5-efee786676d7","year":2026},"citing_paper":{"arxiv_id":"2605.10129","last_updated":"2026-05-11T07:40:39Z","snapshot_observed_at":"2026-08-14T06:16:09.741529Z","submitted_at":"2026-05-11T07:40:39Z","title":"Synthetic Pre-Pre-Training Improves Language Model Robustness to Noisy Pre-Training Data","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-12T03:38:39.738401Z"},"links":{"citing_paper":"/paper/2605.10129"},"observation_digest":"sha256:f860722c65c2cb66c9e5c9dfdad82c3159d705366897c095748a0928000af128","observation_id":"7a7996d2-c3f0-46d2-9a89-3c701e2a78ce","resolution":{"observed_at":"2026-05-12T18:46:46.281584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023 , eprint =","venue":null,"work_id":"eeba9da2-a153-44bb-a1da-769eae02cc58","year":2023},"citing_paper":{"arxiv_id":"2605.10129","last_updated":"2026-05-11T07:40:39Z","snapshot_observed_at":"2026-08-14T06:16:09.741529Z","submitted_at":"2026-05-11T07:40:39Z","title":"Synthetic Pre-Pre-Training Improves Language Model Robustness to Noisy Pre-Training Data","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-12T03:38:39.738401Z"},"links":{"citing_paper":"/paper/2605.10129"},"observation_digest":"sha256:af8b2762d6791e01276829af731fa57adce10e95d1545704bb2a67847b5a14d8","observation_id":"eee5a271-277a-45df-96d3-25c7bc40e090","resolution":{"observed_at":"2026-05-12T18:46:46.202583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023 , eprint=","venue":null,"work_id":"be597706-4f49-49c8-a1e2-8f5c7e6d420d","year":2023},"citing_paper":{"arxiv_id":"2605.10129","last_updated":"2026-05-11T07:40:39Z","snapshot_observed_at":"2026-08-14T06:16:09.741529Z","submitted_at":"2026-05-11T07:40:39Z","title":"Synthetic Pre-Pre-Training Improves Language Model Robustness to Noisy Pre-Training Data","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-12T03:38:39.738401Z"},"links":{"citing_paper":"/paper/2605.10129"},"observation_digest":"sha256:bccf8a45ef8cdb20441dc843473510a9a04a80cb7ddeea20b1d374a16f4c77f8","observation_id":"c7faa5e0-1d93-4e99-934e-81db9b9eb64e","resolution":{"observed_at":"2026-05-12T18:46:46.266309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2026 , eprint=","venue":null,"work_id":"9b11b7e0-1bf4-4b28-90de-a30773b270d6","year":2026},"citing_paper":{"arxiv_id":"2605.10129","last_updated":"2026-05-11T07:40:39Z","snapshot_observed_at":"2026-08-14T06:16:09.741529Z","submitted_at":"2026-05-11T07:40:39Z","title":"Synthetic Pre-Pre-Training Improves Language Model Robustness to Noisy Pre-Training Data","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-12T03:38:39.738401Z"},"links":{"citing_paper":"/paper/2605.10129"},"observation_digest":"sha256:b7ac46a5b7b9cfd785120320f7437a97c2a1370aea5f63ee4f44e80c83f1143d","observation_id":"8adb8273-210c-4925-a467-a2cfa94f928c","resolution":{"observed_at":"2026-05-12T18:46:46.254198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , eprint =","venue":null,"work_id":"8df40bde-fd58-4c57-ab99-6d2afbdbf5a5","year":2025},"citing_paper":{"arxiv_id":"2605.10129","last_updated":"2026-05-11T07:40:39Z","snapshot_observed_at":"2026-08-14T06:16:09.741529Z","submitted_at":"2026-05-11T07:40:39Z","title":"Synthetic Pre-Pre-Training Improves Language Model Robustness to Noisy Pre-Training Data","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-12T03:38:39.738401Z"},"links":{"citing_paper":"/paper/2605.10129"},"observation_digest":"sha256:14c73400e01b5e2cab81df6a554eacf25acd32f6baeb876b7b28127148e9635b","observation_id":"a8a15e44-01f1-4ff9-b07c-deb67889f734","resolution":{"observed_at":"2026-05-12T18:46:46.300681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , eprint =","venue":null,"work_id":"0e55ef13-171a-45d4-92c8-19b3d866db77","year":2025},"citing_paper":{"arxiv_id":"2605.10129","last_updated":"2026-05-11T07:40:39Z","snapshot_observed_at":"2026-08-14T06:16:09.741529Z","submitted_at":"2026-05-11T07:40:39Z","title":"Synthetic Pre-Pre-Training Improves Language Model Robustness to Noisy Pre-Training Data","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-12T03:38:39.738401Z"},"links":{"citing_paper":"/paper/2605.10129"},"observation_digest":"sha256:a537de5657b7287e7586db70163d868f3479c456dca76f41626bf6f008dc5ac9","observation_id":"e830adf2-4980-4f5d-85c2-ec17dd9d9d43","resolution":{"observed_at":"2026-05-12T18:46:46.289798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2026 , eprint =","venue":null,"work_id":"671cf640-a538-47b0-b5e0-1f5329c6692a","year":2026},"citing_paper":{"arxiv_id":"2605.10129","last_updated":"2026-05-11T07:40:39Z","snapshot_observed_at":"2026-08-14T06:16:09.741529Z","submitted_at":"2026-05-11T07:40:39Z","title":"Synthetic Pre-Pre-Training Improves Language Model Robustness to Noisy Pre-Training Data","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-12T03:38:39.738401Z"},"links":{"citing_paper":"/paper/2605.10129"},"observation_digest":"sha256:25551f8194a5ee024d49e77c4bcf629acbbd907514f6312921303a71ff31299b","observation_id":"3b04163b-91ee-4411-baa7-d9cb8037a424","resolution":{"observed_at":"2026-05-12T18:46:46.293490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , eprint =","venue":null,"work_id":"ac1d827e-6e6e-486a-8182-910b3a221649","year":2025},"citing_paper":{"arxiv_id":"2605.10129","last_updated":"2026-05-11T07:40:39Z","snapshot_observed_at":"2026-08-14T06:16:09.741529Z","submitted_at":"2026-05-11T07:40:39Z","title":"Synthetic Pre-Pre-Training Improves Language Model Robustness to Noisy Pre-Training Data","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-12T03:38:39.738401Z"},"links":{"citing_paper":"/paper/2605.10129"},"observation_digest":"sha256:14c659a1482a65d4288e7fcc6e23064c2210d2bca16e0743e202e5c68d7537c8","observation_id":"a89f1628-0e46-41c9-839c-bd4fd3848a24","resolution":{"observed_at":"2026-05-12T18:46:46.361687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , eprint=","venue":null,"work_id":"b0d1ad71-6336-4021-9ec9-d1249d010008","year":2025},"citing_paper":{"arxiv_id":"2605.10129","last_updated":"2026-05-11T07:40:39Z","snapshot_observed_at":"2026-08-14T06:16:09.741529Z","submitted_at":"2026-05-11T07:40:39Z","title":"Synthetic Pre-Pre-Training Improves Language Model Robustness to Noisy Pre-Training Data","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-05-12T03:38:39.738401Z"},"links":{"citing_paper":"/paper/2605.10129"},"observation_digest":"sha256:b09b0f3fb78ba41dca23490a3f6df353470ba692523598c7eef51c93cdea0c15","observation_id":"2cadef74-2d1d-473a-ac86-086e18866327","resolution":{"observed_at":"2026-05-12T18:46:46.346507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2021 , eprint=","venue":null,"work_id":"f0f4f1bd-53e2-4af8-a3d1-fd72d5a9cdd8","year":2021},"citing_paper":{"arxiv_id":"2605.10129","last_updated":"2026-05-11T07:40:39Z","snapshot_observed_at":"2026-08-14T06:16:09.741529Z","submitted_at":"2026-05-11T07:40:39Z","title":"Synthetic Pre-Pre-Training Improves Language Model Robustness to Noisy Pre-Training Data","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-12T03:38:39.738401Z"},"links":{"citing_paper":"/paper/2605.10129"},"observation_digest":"sha256:4419b1d65735503d70d2667867d6366b49da780e1329c226d54bf055db2eb001","observation_id":"386ee380-9276-4481-a806-2fe871be326d","resolution":{"observed_at":"2026-05-12T18:46:46.239097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023 , eprint=","venue":null,"work_id":"c809e1c3-c728-4fe7-9a37-c6cf0b147e9b","year":2023},"citing_paper":{"arxiv_id":"2605.10129","last_updated":"2026-05-11T07:40:39Z","snapshot_observed_at":"2026-08-14T06:16:09.741529Z","submitted_at":"2026-05-11T07:40:39Z","title":"Synthetic Pre-Pre-Training Improves Language Model Robustness to Noisy Pre-Training Data","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-12T03:38:39.738401Z"},"links":{"citing_paper":"/paper/2605.10129"},"observation_digest":"sha256:10722ec42489b1e049de103c9e409567ff120d6cdc578d2d49e390f2ff6d2e35","observation_id":"98f4ac27-a15c-43ca-b9bf-329a73edf8b8","resolution":{"observed_at":"2026-05-12T18:46:46.315702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2020.coling-main.4","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CharBERT: Character-aware Pre-trained Language Model , url=","venue":null,"work_id":"d83a7281-8484-4f27-9d78-72953dd9d471","year":2020},"citing_paper":{"arxiv_id":"2605.10129","last_updated":"2026-05-11T07:40:39Z","snapshot_observed_at":"2026-08-14T06:16:09.741529Z","submitted_at":"2026-05-11T07:40:39Z","title":"Synthetic Pre-Pre-Training Improves Language Model Robustness to Noisy Pre-Training Data","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-05-12T03:38:39.738401Z"},"links":{"citing_paper":"/paper/2605.10129"},"observation_digest":"sha256:eb671ae0643927cc28f93900401516bc94b4b36c405a32859ef90014df4aaf2c","observation_id":"a1dde3cc-463c-4e10-b40e-47f365573326","resolution":{"observed_at":"2026-05-12T03:41:18.830806Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2021 , eprint=","venue":null,"work_id":"189bb396-9616-458b-b4cb-d597787196bd","year":2021},"citing_paper":{"arxiv_id":"2605.10129","last_updated":"2026-05-11T07:40:39Z","snapshot_observed_at":"2026-08-14T06:16:09.741529Z","submitted_at":"2026-05-11T07:40:39Z","title":"Synthetic Pre-Pre-Training Improves Language Model Robustness to Noisy Pre-Training Data","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-05-12T03:38:39.738401Z"},"links":{"citing_paper":"/paper/2605.10129"},"observation_digest":"sha256:1a643bb23e76c56f4313ab9457decb77ef0d1a32b1033e3438dedff3859db008","observation_id":"f474ad41-ac19-4da7-b030-f79182ae960c","resolution":{"observed_at":"2026-05-12T18:46:46.308062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2026 , eprint=","venue":null,"work_id":"7906a074-6959-4796-aaba-29209643eeea","year":2026},"citing_paper":{"arxiv_id":"2605.10129","last_updated":"2026-05-11T07:40:39Z","snapshot_observed_at":"2026-08-14T06:16:09.741529Z","submitted_at":"2026-05-11T07:40:39Z","title":"Synthetic Pre-Pre-Training Improves Language Model Robustness to Noisy Pre-Training Data","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-12T03:38:39.738401Z"},"links":{"citing_paper":"/paper/2605.10129"},"observation_digest":"sha256:bb51a8178c778a4372fc0169d97f0ac95420f5ef06295a4103342f963872dd86","observation_id":"c9e6492b-11b5-407d-8de9-2d6863e5f9ec","resolution":{"observed_at":"2026-05-12T18:46:46.350569Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T15:15:03.765073Z","title":"Proceedings of the fifth annual workshop on Computational learning theory , pages=","venue":null,"work_id":"f2f30a06-78b3-4371-ab0f-a802043cf03b","year":null},"citing_paper":{"arxiv_id":"2605.10129","last_updated":"2026-05-11T07:40:39Z","snapshot_observed_at":"2026-08-14T06:16:09.741529Z","submitted_at":"2026-05-11T07:40:39Z","title":"Synthetic Pre-Pre-Training Improves Language Model Robustness to Noisy Pre-Training Data","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-12T03:38:39.738401Z"},"links":{"citing_paper":"/paper/2605.10129"},"observation_digest":"sha256:94489daa28f84f790b02918f733bf808ef63a540e390bfe54f2a606accc21648","observation_id":"ed5f108a-2c36-483c-b909-90f0b6ec5655","resolution":{"observed_at":"2026-05-12T18:46:46.327322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"echo state","venue":null,"work_id":"ea4a2d4e-e993-4633-be51-bebbcfc31d3d","year":2001},"citing_paper":{"arxiv_id":"2605.10129","last_updated":"2026-05-11T07:40:39Z","snapshot_observed_at":"2026-08-14T06:16:09.741529Z","submitted_at":"2026-05-11T07:40:39Z","title":"Synthetic Pre-Pre-Training Improves Language Model Robustness to Noisy Pre-Training Data","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-12T03:38:39.738401Z"},"links":{"citing_paper":"/paper/2605.10129"},"observation_digest":"sha256:2575b59269a725f97f44139844a6fb7a8d8917fbcb6426e908b293a84ab2112d","observation_id":"c4e001ab-636e-48ba-b855-595511b6f612","resolution":{"observed_at":"2026-05-12T18:46:46.358329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the 58th Annual Meeting of the Association for Computational Linguistics , pages=","venue":null,"work_id":"be0875d5-b136-4b00-b432-ae0b7f2e1a8d","year":null},"citing_paper":{"arxiv_id":"2605.10129","last_updated":"2026-05-11T07:40:39Z","snapshot_observed_at":"2026-08-14T06:16:09.741529Z","submitted_at":"2026-05-11T07:40:39Z","title":"Synthetic Pre-Pre-Training Improves Language Model Robustness to Noisy Pre-Training Data","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-05-12T03:38:39.738401Z"},"links":{"citing_paper":"/paper/2605.10129"},"observation_digest":"sha256:9020b82226c51b3b3cbd4d8d034ac6914a1abcb8c6b9491abf76e93372bd00a4","observation_id":"bc94a105-5148-4b79-934d-b73e858c5e5e","resolution":{"observed_at":"2026-05-12T18:46:46.304091Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11794","last_updated":"2025-04-21T17:48:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-17T17:42:57Z","title":"DataComp-LM: In search of the next generation of training sets for language models","version":4},"cited_work":{"arxiv_id":"2406.11794","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.11794","snapshot_observed_at":"2026-07-04T18:50:04.316326Z","title":"DataComp-LM: In search of the next generation of training sets for language models","venue":"cs.LG","work_id":"a4c88edf-049f-4a82-8f81-9110091a04ad","year":2024},"citing_paper":{"arxiv_id":"2605.10129","last_updated":"2026-05-11T07:40:39Z","snapshot_observed_at":"2026-08-14T06:16:09.741529Z","submitted_at":"2026-05-11T07:40:39Z","title":"Synthetic Pre-Pre-Training Improves Language Model Robustness to Noisy Pre-Training Data","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-12T03:38:39.738401Z"},"links":{"cited_paper":"/paper/2406.11794","citing_paper":"/paper/2605.10129"},"observation_digest":"sha256:2300a036a4929b490402771053a66c4ce8d253355329eb9bc7eab1cbbb5910e3","observation_id":"99ebdd60-b139-45b0-b786-47c73094e184","resolution":{"observed_at":"2026-05-17T22:58:17.761776Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00159","last_updated":"2024-06-06T18:46:40Z","snapshot_observed_at":"2026-08-16T14:22:43.864879Z","submitted_at":"2024-01-31T20:29:50Z","title":"Dolma: an Open Corpus of Three Trillion Tokens for Language Model Pretraining Research","version":2},"cited_work":{"arxiv_id":"2402.00159","doi":"10.48550/arxiv.2402.00159","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.00159","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dolma: An open corpus of three trillion tokens for language model pretraining research","venue":"arXiv (Cornell University)","work_id":"07bf7000-64b4-4c9d-9f3d-cac739d79cf3","year":2024},"citing_paper":{"arxiv_id":"2605.10129","last_updated":"2026-05-11T07:40:39Z","snapshot_observed_at":"2026-08-14T06:16:09.741529Z","submitted_at":"2026-05-11T07:40:39Z","title":"Synthetic Pre-Pre-Training Improves Language Model Robustness to Noisy Pre-Training Data","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-12T03:38:39.738401Z"},"links":{"cited_paper":"/paper/2402.00159","citing_paper":"/paper/2605.10129"},"observation_digest":"sha256:4bee69ae51273d968ab47a5ffe7935cb32c0e5913ddcb3d8b1cdda6d8e77d439","observation_id":"12747c7f-6f4d-43f5-9509-588a0e47b182","resolution":{"observed_at":"2026-05-12T07:11:25.676262Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02595","last_updated":"2025-05-30T20:49:42Z","snapshot_observed_at":"2026-08-17T14:00:18.538725Z","submitted_at":"2024-12-03T17:28:50Z","title":"Nemotron-CC: Transforming Common Crawl into a Refined Long-Horizon Pretraining Dataset","version":2},"cited_work":{"arxiv_id":"2412.02595","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.02595","snapshot_observed_at":"2026-07-02T17:47:18.026339Z","title":"Nemotron-cc: Transforming common crawl into a refined long-horizon pretraining dataset.arXiv preprint arXiv:2412.02595","venue":null,"work_id":"bab220a8-ec16-4f03-9452-4eb35d618607","year":2024},"citing_paper":{"arxiv_id":"2605.10129","last_updated":"2026-05-11T07:40:39Z","snapshot_observed_at":"2026-08-14T06:16:09.741529Z","submitted_at":"2026-05-11T07:40:39Z","title":"Synthetic Pre-Pre-Training Improves Language Model Robustness to Noisy Pre-Training Data","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-05-12T03:38:39.738401Z"},"links":{"cited_paper":"/paper/2412.02595","citing_paper":"/paper/2605.10129"},"observation_digest":"sha256:2f3002bb01cf3771a03e2d0ce6c15fbf95cc979944fd29dc97dcd6d08a140874","observation_id":"978ced0b-b564-494d-bc32-4d9e41158f5d","resolution":{"observed_at":"2026-05-12T07:11:25.667213Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2021 , eprint=","venue":null,"work_id":"6ecdbb39-aac4-4b3c-aa8d-cb7bd82c8c0d","year":2021},"citing_paper":{"arxiv_id":"2605.10129","last_updated":"2026-05-11T07:40:39Z","snapshot_observed_at":"2026-08-14T06:16:09.741529Z","submitted_at":"2026-05-11T07:40:39Z","title":"Synthetic Pre-Pre-Training Improves Language Model Robustness to Noisy Pre-Training Data","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-05-12T03:38:39.738401Z"},"links":{"citing_paper":"/paper/2605.10129"},"observation_digest":"sha256:6ef917fc9868a5b6ec6afca193357200809d914f9457bcee3d71ea5cdb9fc054","observation_id":"415dda88-a562-4c8b-923e-7f92fc27e751","resolution":{"observed_at":"2026-05-12T18:46:46.342644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2018 , eprint =","venue":null,"work_id":"b1b81370-88aa-43c0-a8cf-0671a0110ed6","year":2018},"citing_paper":{"arxiv_id":"2605.10129","last_updated":"2026-05-11T07:40:39Z","snapshot_observed_at":"2026-08-14T06:16:09.741529Z","submitted_at":"2026-05-11T07:40:39Z","title":"Synthetic Pre-Pre-Training Improves Language Model Robustness to Noisy Pre-Training Data","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-05-12T03:38:39.738401Z"},"links":{"citing_paper":"/paper/2605.10129"},"observation_digest":"sha256:c9afbf4126afefd15dd32ce7d6a5b450146ffb0f6357a193f82667689adc936f","observation_id":"bbac2115-6314-4e2b-9496-5cf873fe255e","resolution":{"observed_at":"2026-05-12T18:46:46.243722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2018 , eprint =","venue":null,"work_id":"311e69b3-0027-4013-8ed0-1ccc884821fa","year":2018},"citing_paper":{"arxiv_id":"2605.10129","last_updated":"2026-05-11T07:40:39Z","snapshot_observed_at":"2026-08-14T06:16:09.741529Z","submitted_at":"2026-05-11T07:40:39Z","title":"Synthetic Pre-Pre-Training Improves Language Model Robustness to Noisy Pre-Training Data","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-05-12T03:38:39.738401Z"},"links":{"citing_paper":"/paper/2605.10129"},"observation_digest":"sha256:ad4ad8ed5a63d88645b15fbfe94e6bbebdcebdff7d44c83f61e88f56a1e8991f","observation_id":"7aef18a7-ab57-4e18-89dc-bdae0e7560fe","resolution":{"observed_at":"2026-05-12T18:46:46.322396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023 , eprint =","venue":null,"work_id":"af0f56dd-5e21-4dba-9c8e-88c12f7043f8","year":2023},"citing_paper":{"arxiv_id":"2605.10129","last_updated":"2026-05-11T07:40:39Z","snapshot_observed_at":"2026-08-14T06:16:09.741529Z","submitted_at":"2026-05-11T07:40:39Z","title":"Synthetic Pre-Pre-Training Improves Language Model Robustness to Noisy Pre-Training Data","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-05-12T03:38:39.738401Z"},"links":{"citing_paper":"/paper/2605.10129"},"observation_digest":"sha256:898b44a60fd7dfb73c5550665377850022fc845541c81df7e430214fa55d3a53","observation_id":"e1fc255c-527b-42af-a14e-540b78c0ce87","resolution":{"observed_at":"2026-05-12T18:46:46.257814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , eprint =","venue":null,"work_id":"a703018a-424c-4247-abc2-89de1003bb30","year":2024},"citing_paper":{"arxiv_id":"2605.10129","last_updated":"2026-05-11T07:40:39Z","snapshot_observed_at":"2026-08-14T06:16:09.741529Z","submitted_at":"2026-05-11T07:40:39Z","title":"Synthetic Pre-Pre-Training Improves Language Model Robustness to Noisy Pre-Training Data","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-05-12T03:38:39.738401Z"},"links":{"citing_paper":"/paper/2605.10129"},"observation_digest":"sha256:6680af1f98ef78377dc4cb3b08c4482378ca7fd5ae1c3b306170a201fbe1dc75","observation_id":"f8716b3e-fecc-4f62-8bef-5d1f815cf7fb","resolution":{"observed_at":"2026-05-12T18:46:46.319101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20707","last_updated":"2024-03-05T20:02:31Z","snapshot_observed_at":"2026-08-16T14:47:06.799967Z","submitted_at":"2023-10-31T17:59:38Z","title":"What's In My Big Data?","version":2},"cited_work":{"arxiv_id":"2310.20707","doi":"10.48550/arxiv.2310.20707","metadata_source":"arxiv_reference","pith_arxiv_id":"2310.20707","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"11 Suriya Gunasekar, Yi Zhang, Jyoti Aneja, Caio César Teodoro Mendes, Allie Del Giorno, Sivakanth Gopi, Mojan Javaheripi, Piero Kauffmann, Gustavo de Rosa, Olli Saarikivi, et al","venue":"arXiv (Cornell University)","work_id":"d615e27e-173b-4252-a953-5dbfe7373281","year":2024},"citing_paper":{"arxiv_id":"2605.10129","last_updated":"2026-05-11T07:40:39Z","snapshot_observed_at":"2026-08-14T06:16:09.741529Z","submitted_at":"2026-05-11T07:40:39Z","title":"Synthetic Pre-Pre-Training Improves Language Model Robustness to Noisy Pre-Training Data","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-05-12T03:38:39.738401Z"},"links":{"cited_paper":"/paper/2310.20707","citing_paper":"/paper/2605.10129"},"observation_digest":"sha256:39aa9ed6b79b2efb80dcde04f28229a4a163a6f6106bb15b47b7065a4f262700","observation_id":"f7c53a5a-a6e7-4cac-91bc-17cc28b58910","resolution":{"observed_at":"2026-05-12T07:11:25.726433Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-05-24T05:23:25.421349+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T05:23:25.421349+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14316","last_updated":"2024-07-16T10:22:51Z","snapshot_observed_at":"2026-08-16T14:57:46.371369Z","submitted_at":"2023-09-25T17:37:20Z","title":"Physics of Language Models: Part 3.1, Knowledge Storage and Extraction","version":3},"cited_work":{"arxiv_id":"2309.14316","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.14316","snapshot_observed_at":"2026-07-04T08:59:42.744162Z","title":"Physics of language models: Part 3.1, knowledge storage and extraction","venue":null,"work_id":"a7f03a83-65ed-495c-9295-ad87e6539976","year":2024},"citing_paper":{"arxiv_id":"2605.10129","last_updated":"2026-05-11T07:40:39Z","snapshot_observed_at":"2026-08-14T06:16:09.741529Z","submitted_at":"2026-05-11T07:40:39Z","title":"Synthetic Pre-Pre-Training Improves Language Model Robustness to Noisy Pre-Training Data","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-05-12T03:38:39.738401Z"},"links":{"cited_paper":"/paper/2309.14316","citing_paper":"/paper/2605.10129"},"observation_digest":"sha256:9e94db4052376132a856104cc9bd0c1f0df006849baa9cd15cf22452725ab366","observation_id":"0d35ce35-d6a4-488b-9bc9-9718ee2571b9","resolution":{"observed_at":"2026-05-12T07:11:25.715025Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05405","last_updated":"2024-04-08T11:11:31Z","snapshot_observed_at":"2026-08-16T14:02:46.982560Z","submitted_at":"2024-04-08T11:11:31Z","title":"Physics of Language Models: Part 3.3, Knowledge Capacity Scaling Laws","version":1},"cited_work":{"arxiv_id":"2404.05405","doi":"10.48550/arxiv.2404.05405","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.05405","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Physics of language models: Part 3.3, knowledge capacity scaling laws","venue":"arXiv (Cornell University)","work_id":"316d7b8f-344c-4c99-a387-d012a17b5c50","year":2025},"citing_paper":{"arxiv_id":"2605.10129","last_updated":"2026-05-11T07:40:39Z","snapshot_observed_at":"2026-08-14T06:16:09.741529Z","submitted_at":"2026-05-11T07:40:39Z","title":"Synthetic Pre-Pre-Training Improves Language Model Robustness to Noisy Pre-Training Data","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-05-12T03:38:39.738401Z"},"links":{"cited_paper":"/paper/2404.05405","citing_paper":"/paper/2605.10129"},"observation_digest":"sha256:ebbd1b14e7bae8253ef713d6f0fe598fe16de4d4db83705d3b351edc809075aa","observation_id":"ab0cf40e-d3e9-400d-8816-7ab6d0e3cd69","resolution":{"observed_at":"2026-05-12T07:11:25.645042Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"IEEE transactions on neural networks and learning systems , volume =","venue":null,"work_id":"dda65126-8f0e-4c93-ae44-2e6e2a4636c1","year":2022},"citing_paper":{"arxiv_id":"2605.10129","last_updated":"2026-05-11T07:40:39Z","snapshot_observed_at":"2026-08-14T06:16:09.741529Z","submitted_at":"2026-05-11T07:40:39Z","title":"Synthetic Pre-Pre-Training Improves Language Model Robustness to Noisy Pre-Training Data","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-05-12T03:38:39.738401Z"},"links":{"citing_paper":"/paper/2605.10129"},"observation_digest":"sha256:8c41dbe255a68d6f721336546b82f22267202bdead3317285658145806f4025e","observation_id":"f8e2c283-87ae-4273-9e98-9c468ff3cbf6","resolution":{"observed_at":"2026-05-12T18:46:46.247430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16827","last_updated":"2024-08-02T17:59:31Z","snapshot_observed_at":"2026-08-16T14:15:11.706978Z","submitted_at":"2024-02-26T18:54:35Z","title":"A Survey on Data Selection for Language Models","version":3},"cited_work":{"arxiv_id":"2402.16827","doi":"10.48550/arxiv.2402.16827","metadata_source":"pith","pith_arxiv_id":"2402.16827","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A Survey on Data Selection for Language Models","venue":"cs.CL","work_id":"465cc66d-dd4e-459f-8514-738e42d0a154","year":2024},"citing_paper":{"arxiv_id":"2605.10129","last_updated":"2026-05-11T07:40:39Z","snapshot_observed_at":"2026-08-14T06:16:09.741529Z","submitted_at":"2026-05-11T07:40:39Z","title":"Synthetic Pre-Pre-Training Improves Language Model Robustness to Noisy Pre-Training Data","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-05-12T03:38:39.738401Z"},"links":{"cited_paper":"/paper/2402.16827","citing_paper":"/paper/2605.10129"},"observation_digest":"sha256:5e636843e9f80ca961911a05bbe89b617aaf93669e3f1f0f8945a985fa9bf0b8","observation_id":"d321721b-aada-470a-9cee-26bc89547039","resolution":{"observed_at":"2026-05-12T07:11:25.683736Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1612.03651","last_updated":"2016-12-12T12:51:03Z","snapshot_observed_at":"2026-08-17T13:59:16.192204Z","submitted_at":"2016-12-12T12:51:03Z","title":"FastText.zip: Compressing text classification models","version":1},"cited_work":{"arxiv_id":"1612.03651","doi":"10.48550/arxiv.1612.03651","metadata_source":"pith","pith_arxiv_id":"1612.03651","snapshot_observed_at":"2026-07-11T01:47:47.470175Z","title":"FastText.zip: Compressing text classification models","venue":"cs.CL","work_id":"cd1495d8-ba03-4095-b4d3-ea0d52c24350","year":2016},"citing_paper":{"arxiv_id":"2605.10129","last_updated":"2026-05-11T07:40:39Z","snapshot_observed_at":"2026-08-14T06:16:09.741529Z","submitted_at":"2026-05-11T07:40:39Z","title":"Synthetic Pre-Pre-Training Improves Language Model Robustness to Noisy Pre-Training Data","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-05-12T03:38:39.738401Z"},"links":{"cited_paper":"/paper/1612.03651","citing_paper":"/paper/2605.10129"},"observation_digest":"sha256:f6145550c7026b35bfebd5c162b603526813768e8ac9670901a5589806baef46","observation_id":"06f56ca4-35e0-4986-a6f7-3aed6d7455d1","resolution":{"observed_at":"2026-05-12T07:11:25.705591Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2019 , eprint =","venue":null,"work_id":"ca864e1a-a826-4f77-9a1e-cc570c5cdb70","year":2019},"citing_paper":{"arxiv_id":"2605.10129","last_updated":"2026-05-11T07:40:39Z","snapshot_observed_at":"2026-08-14T06:16:09.741529Z","submitted_at":"2026-05-11T07:40:39Z","title":"Synthetic Pre-Pre-Training Improves Language Model Robustness to Noisy Pre-Training Data","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-05-12T03:38:39.738401Z"},"links":{"citing_paper":"/paper/2605.10129"},"observation_digest":"sha256:ee437518ec2ed8d4c6697eb6985982bbdc43142272c64a9c060dfe5a12882250","observation_id":"496b429d-ddda-4fc9-8345-f0245b0a4046","resolution":{"observed_at":"2026-05-12T18:46:46.334728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17002","last_updated":"2024-03-11T15:59:28Z","snapshot_observed_at":"2026-08-16T14:56:37.572293Z","submitted_at":"2023-09-29T06:18:15Z","title":"Understanding and Mitigating the Label Noise in Pre-training on Downstream Tasks","version":2},"cited_work":{"arxiv_id":"2309.17002","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.17002","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2309.17002 , year =","venue":null,"work_id":"e536401d-9f32-4a5a-a7cf-a01eca364953","year":2023},"citing_paper":{"arxiv_id":"2605.10129","last_updated":"2026-05-11T07:40:39Z","snapshot_observed_at":"2026-08-14T06:16:09.741529Z","submitted_at":"2026-05-11T07:40:39Z","title":"Synthetic Pre-Pre-Training Improves Language Model Robustness to Noisy Pre-Training Data","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-05-12T03:38:39.738401Z"},"links":{"cited_paper":"/paper/2309.17002","citing_paper":"/paper/2605.10129"},"observation_digest":"sha256:746f3cdfbb6e6117247171ede813af6aacd8686b28ff506ae046ff8414c939e3","observation_id":"2dbfe5d2-7f6c-4204-8f81-f212719b6796","resolution":{"observed_at":"2026-05-12T07:11:25.660670Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2017 , eprint =","venue":null,"work_id":"aff311c9-0c19-4d39-b0e8-12e1e304b967","year":2017},"citing_paper":{"arxiv_id":"2605.10129","last_updated":"2026-05-11T07:40:39Z","snapshot_observed_at":"2026-08-14T06:16:09.741529Z","submitted_at":"2026-05-11T07:40:39Z","title":"Synthetic Pre-Pre-Training Improves Language Model Robustness to Noisy Pre-Training Data","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-05-12T03:38:39.738401Z"},"links":{"citing_paper":"/paper/2605.10129"},"observation_digest":"sha256:2b055730c487282fd69c1e70ae8754809872faa6705dc5358ce1a33fff967b45","observation_id":"bd638b21-2036-4d50-a4a9-d7d365f2c294","resolution":{"observed_at":"2026-05-12T18:46:46.338810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2017 , eprint =","venue":null,"work_id":"6346014e-4d14-4fc2-88eb-2ad4f8c69e42","year":2017},"citing_paper":{"arxiv_id":"2605.10129","last_updated":"2026-05-11T07:40:39Z","snapshot_observed_at":"2026-08-14T06:16:09.741529Z","submitted_at":"2026-05-11T07:40:39Z","title":"Synthetic Pre-Pre-Training Improves Language Model Robustness to Noisy Pre-Training Data","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-05-12T03:38:39.738401Z"},"links":{"citing_paper":"/paper/2605.10129"},"observation_digest":"sha256:8111051930586b5ae608a4041c71a3bcfe29ff1b331502100b3ea965fdec7979","observation_id":"7a065798-f2c1-4324-aacd-0ad011cb591a","resolution":{"observed_at":"2026-05-12T18:46:46.311794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023 , eprint =","venue":null,"work_id":"1c913722-b792-488e-87ea-1aa17b669e8c","year":2023},"citing_paper":{"arxiv_id":"2605.10129","last_updated":"2026-05-11T07:40:39Z","snapshot_observed_at":"2026-08-14T06:16:09.741529Z","submitted_at":"2026-05-11T07:40:39Z","title":"Synthetic Pre-Pre-Training Improves Language Model Robustness to Noisy Pre-Training Data","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-05-12T03:38:39.738401Z"},"links":{"citing_paper":"/paper/2605.10129"},"observation_digest":"sha256:7569b85989ddca527281cdabb5c282415f0a37a55a1e872977c3acd62ef9b880","observation_id":"39960009-aeb8-413c-8ac2-00a2f6c3188d","resolution":{"observed_at":"2026-05-12T18:46:46.231678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Findings of the Association for Computational Linguistics: EMNLP 2024 , pages=","venue":null,"work_id":"65f7fad6-e402-4dbc-bcfb-ec41f7d9421e","year":2024},"citing_paper":{"arxiv_id":"2605.10129","last_updated":"2026-05-11T07:40:39Z","snapshot_observed_at":"2026-08-14T06:16:09.741529Z","submitted_at":"2026-05-11T07:40:39Z","title":"Synthetic Pre-Pre-Training Improves Language Model Robustness to Noisy Pre-Training Data","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-05-12T03:38:39.738401Z"},"links":{"citing_paper":"/paper/2605.10129"},"observation_digest":"sha256:750fb7da81d846b53501a9d1d880b15e2f4551ebe2297991d16e02db63c5a0e7","observation_id":"c22bcc74-a081-485b-b914-a2ce1f2d7e9e","resolution":{"observed_at":"2026-05-12T18:46:46.274025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22308","last_updated":"2025-05-28T12:50:09Z","snapshot_observed_at":"2026-08-15T18:40:33.005059Z","submitted_at":"2025-05-28T12:50:09Z","title":"Transformers Pretrained on Procedural Data Contain Modular Structures for Algorithmic Reasoning","version":1},"cited_work":{"arxiv_id":"2505.22308","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22308","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2505.22308 , year=","venue":null,"work_id":"9908ea89-9e3d-4502-9c0c-db89db518b26","year":null},"citing_paper":{"arxiv_id":"2605.10129","last_updated":"2026-05-11T07:40:39Z","snapshot_observed_at":"2026-08-14T06:16:09.741529Z","submitted_at":"2026-05-11T07:40:39Z","title":"Synthetic Pre-Pre-Training Improves Language Model Robustness to Noisy Pre-Training Data","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-05-12T03:38:39.738401Z"},"links":{"cited_paper":"/paper/2505.22308","citing_paper":"/paper/2605.10129"},"observation_digest":"sha256:69f49c2d3a32d0692eb1cee7e5dd6183cb2e52c95890ba30f3f92648081aec28","observation_id":"62030f58-7b87-407a-b593-e6793d47850c","resolution":{"observed_at":"2026-05-12T07:11:25.693145Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.10129","last_updated":"2026-05-11T07:40:39Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-14T06:16:09.741529Z","submitted_at":"2026-05-11T07:40:39Z","title":"Synthetic Pre-Pre-Training Improves Language Model Robustness to Noisy Pre-Training Data"},"reference_resolution":{"displayed":62,"state_counts":{"malformed_identifier":0,"metadata_mismatch":8,"parse_uncertain":0,"unresolved":1,"verified_exact":3,"verified_fuzzy":50},"total_outbound_references":62},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 62 of 62 outbound references and 1 inbound Pith citation observation for arXiv:2605.10129."}