{"as_of":"2026-08-09T10:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:94cc199189e3df23db463988610d6605377278b4c30d552ce9c5a84b91e94a8c","coverage":[{"denominator":138,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T15:04:29.760015Z","state":"measured"},{"denominator":102,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":102,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:53:41.436077Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T00:53:27.573309Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06604","snapshot_observed_at":"2026-08-07T13:53:41.436077Z","title":"Do we really have to filter out random noise in pre-training data for language models?arXiv preprint arXiv:2502.06604, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20836","last_updated":"2025-05-27T07:57:35Z","snapshot_observed_at":"2026-08-09T05:14:09.485665Z","submitted_at":"2025-05-27T07:57:35Z","title":"HAD: Hybrid Architecture Distillation Outperforms Teacher in Genomic Sequence Modeling","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:41.436077Z"},"links":{"cited_paper":"/paper/2502.06604","citing_paper":"/paper/2505.20836"},"observation_digest":"sha256:afee4e736bfc3a88dd37310675e40eedb6104d52b5d084f334daa3c0a3595c2e","observation_id":"0386a878-954f-4cf9-93d5-6959bef397b7","resolution":{"observed_at":"2026-08-07T13:53:41.436077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"cited_work":{"arxiv_id":"2502.06604","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.06604","snapshot_observed_at":"2026-08-07T00:53:27.573309Z","title":"Do we really have to filter out random noise in pre-training data for language models?","venue":"cs.CL","work_id":"907d58f0-352e-4598-9c8e-459f1d0e60e4","year":2025},"citing_paper":{"arxiv_id":"2506.12609","last_updated":"2025-08-18T08:18:50Z","snapshot_observed_at":"2026-08-08T12:21:50.848317Z","submitted_at":"2025-06-14T19:10:22Z","title":"Not All Tokens and Heads Are Equally Important: Dual-Level Attention Intervention for Hallucination Mitigation","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T00:53:24.931453Z"},"links":{"cited_paper":"/paper/2502.06604","citing_paper":"/paper/2506.12609"},"observation_digest":"sha256:e53425cda87aeb334026df3688730e151bc9c88bba778551d4207b508baccdc3","observation_id":"d129c012-6cc2-400f-b314-b3ba900413d5","resolution":{"observed_at":"2026-08-07T00:53:27.615962Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.06604/citation-record","integrity":"/paper/2502.06604/integrity","json":"/paper/2502.06604/citation-record.json","paper":"/paper/2502.06604"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:04:29.387312Z","title":"A pretrainer’s guide to training data: Measuring the effects of data age, domain coverage, quality, & toxicity,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.387312Z"},"links":{"citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:7b3edc9b49caf8b39927a0bfe89caf3fbe1c1192039d713ae7fa8a60c5ed88e0","observation_id":"e60751f7-b8b0-4b28-a56d-96ef3d09d876","resolution":{"observed_at":"2026-08-08T15:04:29.387312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:04:29.392350Z","title":"What’s in my big data?","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.392350Z"},"links":{"citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:904f408ca788e3fc18daf6583eaf0a27d9ef468aa75eafa7e85649af5039eb4f","observation_id":"e6135b2d-7382-4223-809c-3bf0fb78439a","resolution":{"observed_at":"2026-08-08T15:04:29.392350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-08T15:04:29.396346Z","title":"Llama: Open and efficient foundation language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.396346Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:4a54d8e7b9a8941fe2dd9ffd0c66a80939b63276c870631264e585517981930f","observation_id":"2aa6417b-9931-4b3e-9186-7d3f83ea71c0","resolution":{"observed_at":"2026-08-08T15:04:29.396346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:04:29.400803Z","title":"Physics of language models: Part 3.1, knowledge storage and extraction,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.400803Z"},"links":{"citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:1693361cec9f4bed3a2e495c921520807113a3bdc3d78a724a7a0d7f53ec033b","observation_id":"38acb914-94a6-434e-8d8a-2e3fee02c94b","resolution":{"observed_at":"2026-08-08T15:04:29.400803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:04:29.404634Z","title":"Data selection for language models via importance resampling,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.404634Z"},"links":{"citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:8ba403ec333212b753694e37e1b04df1fc3f0b5a7e3638b894c2ea71ad65961a","observation_id":"7fea4bdf-ed93-45c8-9def-120f76dce541","resolution":{"observed_at":"2026-08-08T15:04:29.404634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:04:29.408327Z","title":"Ai models collapse when trained on recursively generated data,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.408327Z"},"links":{"citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:4899350f025822ff4af06a7c1ae4d7d9fe0d59aaa67c34a1c0f2e6ce4f5f631b","observation_id":"79e2dc12-4a69-4fca-8669-c043fca3a086","resolution":{"observed_at":"2026-08-08T15:04:29.408327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:04:29.412362Z","title":"How bad is training on synthetic data? a statistical analysis of language model collapse,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.412362Z"},"links":{"citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:b006584d885010b7851600f85423941da3c5c1fe27e18050e0c0c6145df8be99","observation_id":"22e7b213-867c-4393-9522-fd02e345e742","resolution":{"observed_at":"2026-08-08T15:04:29.412362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08003","last_updated":"2024-08-15T08:12:52Z","snapshot_observed_at":"2026-08-08T23:02:33.774159Z","submitted_at":"2024-08-15T08:12:52Z","title":"Leveraging Web-Crawled Data for High-Quality Fine-Tuning","version":1},"cited_work":{"arxiv_id":"2408.08003","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.08003","snapshot_observed_at":"2026-08-08T15:04:30.279271Z","title":"Leveraging Web-Crawled Data for High-Quality Fine-Tuning","venue":"cs.CL","work_id":"b11b0ae4-4851-4b8b-800f-69fd412b72d0","year":2024},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.416371Z"},"links":{"cited_paper":"/paper/2408.08003","citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:8fb7763ebb254ad36c317c433715270b100afbb826e9f5456062c2bae2b7c122","observation_id":"fa364b09-c266-4501-9349-a65b3182dada","resolution":{"observed_at":"2026-08-08T15:04:30.283408Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:04:29.420304Z","title":"Wavlm: Large-scale self-supervised pre-training for full stack speech processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.420304Z"},"links":{"citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:5271a8aeccd0efd0859f5dd695335cf14888f5cdd7a0313f83dbce227c5f00e3","observation_id":"75887f41-308c-4dc8-af72-e977df203bb1","resolution":{"observed_at":"2026-08-08T15:04:29.420304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:04:29.423875Z","title":"Noise-aware learning from web-crawled image-text data for image captioning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.423875Z"},"links":{"citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:5e1c1273aabd65480394e4fc0d0be2c2f35750fb4f8d1bbd8218a87dce403376","observation_id":"47cbc124-37d8-43cc-8496-f966bf5ad458","resolution":{"observed_at":"2026-08-08T15:04:29.423875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:04:29.427445Z","title":"A survey on data selection for language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.427445Z"},"links":{"citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:55112fb6d4a9d1ad78ef07757c20ce2430b30447fff7d8e5fc6bab6815e8115b","observation_id":"3946fc89-0778-4629-a98b-5f1a212527aa","resolution":{"observed_at":"2026-08-08T15:04:29.427445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:04:29.431091Z","title":"Dolma: an open corpus of three trillion tokens for language model pretraining research,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.431091Z"},"links":{"citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:1f71892225fe68d1ceda6370ef14e9d587c575f8ca32a62542a35346e98aec6d","observation_id":"92057b1e-53da-4d4e-94c9-6cebc1575b13","resolution":{"observed_at":"2026-08-08T15:04:29.431091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:04:29.434719Z","title":"Openwebtext corpus,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.434719Z"},"links":{"citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:dff0cd0c5418bb06b125ebdfd85301ffa4f0bee221a74208c5215aba76cc84d6","observation_id":"f2a68c19-904d-4a4d-9cd9-641711725e38","resolution":{"observed_at":"2026-08-08T15:04:29.434719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14627","last_updated":"2025-06-04T06:49:57Z","snapshot_observed_at":"2026-08-07T18:01:45.301822Z","submitted_at":"2025-02-20T15:06:15Z","title":"ATRI: Mitigating Multilingual Audio Text Retrieval Inconsistencies by Reducing Data Distribution Errors","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14627","snapshot_observed_at":"2026-08-08T15:04:29.438363Z","title":"Atri: Mitigating multilingual audio text retrieval inconsistencies by reducing data distribution errors,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.438363Z"},"links":{"cited_paper":"/paper/2502.14627","citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:7bad9d9e2add9248e8607c4790453e433f90ff1bac435ff2886e6b1bab4fa140","observation_id":"7b87a0bf-91bc-4dde-83b0-b4b8762b67b9","resolution":{"observed_at":"2026-08-08T15:04:29.438363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-07T15:29:07.202109Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12327","snapshot_observed_at":"2026-08-08T15:04:29.442501Z","title":"Vargpt: Unified understanding and generation in a visual autoregressive multimodal large language model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.442501Z"},"links":{"cited_paper":"/paper/2501.12327","citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:e62fd1218777a3ea32b354fc932ec2179170a347d982f089135b5c1ae28080dd","observation_id":"eeeb5c56-95d2-4e74-ba1a-1502d5f79c9d","resolution":{"observed_at":"2026-08-08T15:04:29.442501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-08-08T23:01:50.650593Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-08T15:04:29.446787Z","title":"Uniaudio: An audio foundation model toward universal audio generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.446787Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:5c2e1a7be564606882f97e844635add00f0266a15120addd507f2cd2246be9d2","observation_id":"fe997328-c058-4a0c-b19e-22884066b795","resolution":{"observed_at":"2026-08-08T15:04:29.446787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:04:29.450755Z","title":"Understanding and mitigating the label noise in pre-training on downstream tasks,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.450755Z"},"links":{"citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:00cc1a73950732dec648ce846ef5f4b4a215a93c42a579da19855fde1b85fb42","observation_id":"7e65718f-1a0d-4617-aef4-9ae9ac8b0aa1","resolution":{"observed_at":"2026-08-08T15:04:29.450755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:04:29.454312Z","title":"Is out-of-distribution detection learnable?","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.454312Z"},"links":{"citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:35aaa66b56baedcaa107248b3dbb8f163db16e1566d21835739c34fa7ad0ba73","observation_id":"00bdec02-4ec0-4253-b5e5-da38957682c8","resolution":{"observed_at":"2026-08-08T15:04:29.454312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:04:29.458560Z","title":"Defweb: Defending user privacy against cache-based website fingerprinting attacks with intelligent noise injection,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.458560Z"},"links":{"citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:ea8508e608504d5c08da03d3a1bdca97f3ce7cb4d5ba0a32cf99526bbfd8583e","observation_id":"8f696481-e67a-4059-80f9-c963ad7e472a","resolution":{"observed_at":"2026-08-08T15:04:29.458560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:04:29.461908Z","title":"Language models are unsupervised multitask learners,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.461908Z"},"links":{"citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:297926fca9869175a25c5954a86d3e6015345e357d267ddf05f3758fe2755022","observation_id":"fb20402c-8f72-47da-ab12-a1fd82f11a32","resolution":{"observed_at":"2026-08-08T15:04:29.461908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00027","last_updated":"2020-12-31T19:00:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-12-31T19:00:10Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00027","snapshot_observed_at":"2026-08-08T15:04:29.465197Z","title":"The pile: An 800gb dataset of diverse text for language modeling,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.465197Z"},"links":{"cited_paper":"/paper/2101.00027","citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:824b22b2b0be53e73fd043af18d995a6f4f20fda049bf230b08fa9051fe02898","observation_id":"7ef48a16-b7d7-4e12-9042-1baab41f0a3f","resolution":{"observed_at":"2026-08-08T15:04:29.465197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:04:29.468714Z","title":"Shalev-Shwartz and S","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.468714Z"},"links":{"citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:9fecb0448ef3374bbc91dc703a32003d7cef97ae93e5809c61f80abd87f8998e","observation_id":"7b6f107f-4494-4862-8644-2aedd2d01f2c","resolution":{"observed_at":"2026-08-08T15:04:29.468714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:04:29.471874Z","title":"A theory of learning from different domains,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.471874Z"},"links":{"citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:948ae7875899cef63c95c4b4e74762d6a2e57d1f385d2fbc2d073c5f43b41ac4","observation_id":"c076fbe9-7998-4093-afc9-25de527a1229","resolution":{"observed_at":"2026-08-08T15:04:29.471874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:04:29.475290Z","title":"A mathematical exploration of why language models help solve downstream tasks,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.475290Z"},"links":{"citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:f492e3887aeaec101eb53127f007085892a8a9c61d38e0e0f1fca42df8d31cfb","observation_id":"c316f708-bb04-49f2-8cb9-6feebcd9af46","resolution":{"observed_at":"2026-08-08T15:04:29.475290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:04:29.478461Z","title":"Why do pretrained language models help in downstream tasks? an analysis of head and prompt tuning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.478461Z"},"links":{"citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:a8c494a063d44f8763507886f3ecbef63f1cda5173e3bab7548b19e92914133b","observation_id":"fefa69fb-4802-412d-a70d-7a67c616aae2","resolution":{"observed_at":"2026-08-08T15:04:29.478461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:04:29.482138Z","title":"Same pre-training loss, better downstream: Implicit bias matters for language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.482138Z"},"links":{"citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:873334596528b1d8adc68863f269c95df892c08782f483ab536345a8f6450621","observation_id":"b270e9a9-3d55-46d3-88ac-99334c3d53a7","resolution":{"observed_at":"2026-08-08T15:04:29.482138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:04:29.485597Z","title":"Revisiting discriminative vs. generative classifiers: Theory and implications,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.485597Z"},"links":{"citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:c6a882be6c93318cdcaf6f8cdee7e3f5fe31d277e5b7c2abcdb77a881298ac5f","observation_id":"94bbd6ee-7abd-4753-b62f-edf8feb6b7a2","resolution":{"observed_at":"2026-08-08T15:04:29.485597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:04:29.489312Z","title":"How multilingual is multilingual BERT?","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.489312Z"},"links":{"citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:a9a2dd628e560993aa752918d55f9921ecd35443d25b14dbff4ba481d0fd3147","observation_id":"00b13d9d-13bd-43d5-83df-b2b70bebe7d0","resolution":{"observed_at":"2026-08-08T15:04:29.489312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:04:29.492969Z","title":"Finding universal grammatical relations in multilingual BERT,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.492969Z"},"links":{"citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:ffc6ef645fb43ea946ea518e9afcf59e97dcd5e53564b35d48ea6b2b8899e2e6","observation_id":"866bd5a5-8db5-4929-95bb-cc9f993183dd","resolution":{"observed_at":"2026-08-08T15:04:29.492969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:04:29.496487Z","title":"Zeronlg: Aligning and autoencoding domains for zero-shot multimodal and multilingual natural language generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.496487Z"},"links":{"citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:df4f32e19ec8b41c939fb7487b3518433a298093e4739ac1a4dbe92a3fa3e4f4","observation_id":"629bf092-6af7-4abd-9925-3e39f4c1718a","resolution":{"observed_at":"2026-08-08T15:04:29.496487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02949","last_updated":"2025-04-03T18:06:28Z","snapshot_observed_at":"2026-08-07T16:10:37.711691Z","submitted_at":"2025-04-03T18:06:28Z","title":"VARGPT-v1.1: Improve Visual Autoregressive Large Unified Model via Iterative Instruction Tuning and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02949","snapshot_observed_at":"2026-08-08T15:04:29.499875Z","title":"Vargpt-v1. 1: Improve visual autoregressive large unified model via iterative instruction tuning and reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.499875Z"},"links":{"cited_paper":"/paper/2504.02949","citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:77609f494537e81a9e0c7e616c5dcae37c5e946b71ba1bb7683a468faef9eeaf","observation_id":"252ec1b0-aecb-4c11-b068-5b2db3f1d3d5","resolution":{"observed_at":"2026-08-08T15:04:29.499875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10344","last_updated":"2025-04-14T15:51:56Z","snapshot_observed_at":"2026-08-07T16:05:50.273054Z","submitted_at":"2025-04-14T15:51:56Z","title":"ALMTokenizer: A Low-bitrate and Semantic-rich Audio Codec Tokenizer for Audio Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10344","snapshot_observed_at":"2026-08-08T15:04:29.503731Z","title":"Almtokenizer: A low-bitrate and semantic-rich audio codec tokenizer for audio language modeling,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.503731Z"},"links":{"cited_paper":"/paper/2504.10344","citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:9a13ba4eadbad4ece3a16d62a6342f67ce0801ab330d2b3f8684fc61c9bdfce1","observation_id":"5bea82d2-a5dc-4f64-9633-aade6bdb05c6","resolution":{"observed_at":"2026-08-08T15:04:29.503731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:04:29.507769Z","title":"Stochastic collapse: How gradient noise attracts SGD dynamics towards simpler subnetworks,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.507769Z"},"links":{"citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:7f9b58253d2cea067b35c86182256e235d8678409f726240ee3a6bbf1bca4590","observation_id":"a1ab164d-cf59-4c48-9c5a-0deb307b7619","resolution":{"observed_at":"2026-08-08T15:04:29.507769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:04:29.511466Z","title":"Positive-negative momentum: Manipulating stochastic gradient noise to improve generalization,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.511466Z"},"links":{"citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:7fcf8845ef587fb1e5f8c8349e6d965d1f211affa22bdb79acaf8988ba3d0e5a","observation_id":"eba9f5e8-8580-4847-bf29-5fcc0d4d2285","resolution":{"observed_at":"2026-08-08T15:04:29.511466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:04:29.514949Z","title":"Noise stability regularization for improving BERT fine-tuning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.514949Z"},"links":{"citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:b3973f25cfe20863619a2be7eb5ba0b2ace307f3c6b914778e19a688b1958336","observation_id":"584760e0-207c-484d-a224-1ca056c494fe","resolution":{"observed_at":"2026-08-08T15:04:29.514949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:04:29.518831Z","title":"A diffusion theory for deep learning dynamics: Stochastic gradient descent exponentially favors flat minima,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.518831Z"},"links":{"citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:5b6e8f546a027d59b4cab433d559404850c53e3c6d3ce2db08e7cdefe822c714","observation_id":"23805558-8f6d-4dc5-b82c-fd51353079f7","resolution":{"observed_at":"2026-08-08T15:04:29.518831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:04:29.522524Z","title":"Unveiling the structure of wide flat minima in neural networks,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.522524Z"},"links":{"citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:7f2fd9aa35136c4779c28d3db797153669150d21c22fb9d85e1407818e9e8e59","observation_id":"bfa49cda-dd51-47e8-b1ea-6a75032f69c1","resolution":{"observed_at":"2026-08-08T15:04:29.522524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-08T15:04:29.530022Z","title":"The llama 3 herd of models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.530022Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:3eb13c64883c76e43ab7da05057b13b106c5dadaff2dca09524e06fa4887a5fc","observation_id":"9a9478f6-edb8-4bdc-a2b4-c2d552f370ec","resolution":{"observed_at":"2026-08-08T15:04:29.530022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:04:29.533826Z","title":"Le Gall, Measure theory, probability, and stochastic processes","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.533826Z"},"links":{"citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:d0f1791329d83dd39932079b0afa7676db712f38ef8e9d156f31d9e79e8fe1a3","observation_id":"a210335c-813c-4deb-b5e8-0c2af119d242","resolution":{"observed_at":"2026-08-08T15:04:29.533826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:04:29.537245Z","title":"Structured pruning of large language models,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.537245Z"},"links":{"citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:0c4b9eaeb89e123f12d3f095f137922c0b41e62079632d59685d9b477cc6825c","observation_id":"0088e24e-719c-4f9c-b46e-38fe8f375052","resolution":{"observed_at":"2026-08-08T15:04:29.537245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:04:29.540868Z","title":"The optimal BERT surgeon: Scalable and accurate second-order pruning for large language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.540868Z"},"links":{"citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:c419778edffcced61bc5f39453fc4aec297b77dee25873bdd3fab040d90c7d46","observation_id":"79431427-9586-4017-af28-f6cc6264c527","resolution":{"observed_at":"2026-08-08T15:04:29.540868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:04:29.544412Z","title":"Plug-and- play: An efficient post-training pruning method for large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.544412Z"},"links":{"citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:f1ef3de5e3c30cc4ccc9d8fc45cdfac101b17e4dd85fd000a69f7f822db760bd","observation_id":"fdad228a-4fb6-4cf7-8a4f-f0d2fc69244b","resolution":{"observed_at":"2026-08-08T15:04:29.544412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:04:29.547924Z","title":"LRQuant: Learnable and robust post-training quantization for large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.547924Z"},"links":{"citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:98e582bec1dada784729d24172f2c2a9b09503cb172f9f7d1c18d125d428edf5","observation_id":"68b6c3f1-818d-4220-8f1c-77cb64c3c97f","resolution":{"observed_at":"2026-08-08T15:04:29.547924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:04:29.551345Z","title":"A comprehensive evaluation of quantization strategies for large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.551345Z"},"links":{"citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:88355d89a24b02f50544aec7b7d038ec9a0486fd59af305788c73b5130d5d174","observation_id":"e3b849ba-d072-4778-99f5-86790833e8b4","resolution":{"observed_at":"2026-08-08T15:04:29.551345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:04:29.554973Z","title":"IntactKV: Improving large language model quantization by keeping pivot tokens intact,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.554973Z"},"links":{"citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:9d294382eaeb0b7d1b19c5a37a6da6eec433b2c5d78f8c76ec2a40dbf4cf8969","observation_id":"5eb38568-ab4d-4861-8590-ba97b05a7fee","resolution":{"observed_at":"2026-08-08T15:04:29.554973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:04:29.558646Z","title":"Cost-effective distillation of large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.558646Z"},"links":{"citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:adfea7fb91a0a3f9a099bace7ec778e778d44a543c876066581bdbb831fa8726","observation_id":"1382e693-6788-4267-8b0f-73b44233d5a4","resolution":{"observed_at":"2026-08-08T15:04:29.558646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-07-06T04:11:24.157003Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-08T15:04:29.562282Z","title":"Distilling the knowledge in a neural network,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.562282Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:f89115bd0b1ede34863dd2404984f0dc41024d355fe6cbaf97ed38254b94597b","observation_id":"45dbc5fa-08e0-4ea5-b570-82f66ece80ba","resolution":{"observed_at":"2026-08-08T15:04:29.562282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:04:29.566153Z","title":"mGPT: Few-shot learners go multilingual,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.566153Z"},"links":{"citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:974c13f10b01f8251244412adcc789ddece6d70b65c17ccd79af099220dab3e4","observation_id":"e3dd482d-64b7-4cd8-a400-c81c0bd365be","resolution":{"observed_at":"2026-08-08T15:04:29.566153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:04:29.570112Z","title":"Toward understanding generative data augmentation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.570112Z"},"links":{"citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:aa42a1470be99c3912a4c9684391b55582937e4f50fb3a35f541804114e8ee2f","observation_id":"8fbaf7c4-ea48-4cfa-9835-59c80f03d751","resolution":{"observed_at":"2026-08-08T15:04:29.570112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:04:29.573984Z","title":"Smoothness, low noise and fast rates,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.573984Z"},"links":{"citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:807c9a9947086273fde5f4d2c52c86aa0c864df13c8a29cd2f3efb8aa1bf2daf","observation_id":"29e76057-9c23-4af4-b06d-b8432af52151","resolution":{"observed_at":"2026-08-08T15:04:29.573984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:04:29.577927Z","title":"Diffsound: Discrete diffusion model for text-to-sound generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.577927Z"},"links":{"citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:06923e9b81efbfe59274a7005a7837c078d350e186f68aafab092c4ff4d0ef07","observation_id":"5d3296b2-cd1c-42e4-aa74-7ea80d1f121a","resolution":{"observed_at":"2026-08-08T15:04:29.577927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:04:29.581544Z","title":"Towards explainable joint models via information theory for multiple intent detection and slot filling,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.581544Z"},"links":{"citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:688c3c011ac6b3a26d08162fc719452fd0a040fb2897fc3a94041a79a4138584","observation_id":"fe0d3fa3-778b-42b8-b5d6-0736991d1b37","resolution":{"observed_at":"2026-08-08T15:04:29.581544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:04:29.585134Z","title":"Kdpror: A knowledge-decoupling probabilistic framework for video-text retrieval,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.585134Z"},"links":{"citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:0a1f537a6bcb1612c8f12c1aa2cfb7bbc646580b38330bc1ceea43f1aa5a7af8","observation_id":"c0b1eddb-9c65-4d41-9060-d87339143893","resolution":{"observed_at":"2026-08-08T15:04:29.585134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:04:29.588827Z","title":"Gpa: global and prototype alignment for audio-text retrieval,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.588827Z"},"links":{"citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:1a10221ef502f26528aba85b7c89fb9f6e7bb484cfad9efa74baccffdf9a2311","observation_id":"62813d17-e566-4673-a8e8-1f57d73c2d0d","resolution":{"observed_at":"2026-08-08T15:04:29.588827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:04:29.592013Z","title":"Preparing lessons for progressive training on language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.592013Z"},"links":{"citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:5d676f2e59dc47fdaf16d3fdd6d65609fb11c6d8bd2626075f16a05249282ee5","observation_id":"8f816ae0-4ba1-4cc6-bf05-757899058524","resolution":{"observed_at":"2026-08-08T15:04:29.592013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13381","last_updated":"2025-02-11T12:44:39Z","snapshot_observed_at":"2026-08-06T00:47:33.463532Z","submitted_at":"2025-01-23T04:50:03Z","title":"Do as We Do, Not as You Think: the Conformity of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13381","snapshot_observed_at":"2026-08-08T15:04:29.595184Z","title":"Do as we do, not as you think: the conformity of large language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.595184Z"},"links":{"cited_paper":"/paper/2501.13381","citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:489f74db7ec0f7e5eec82bcbc984de333cf7f718ac94af36d29e9cea75322ea9","observation_id":"ae724c0e-fb80-42b1-920b-9625418b0727","resolution":{"observed_at":"2026-08-08T15:04:29.595184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:04:29.598822Z","title":"Rmt: Retentive networks meet vision transformers,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.598822Z"},"links":{"citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:c986ff58344e467a2f9aad084e879d76cc2c7ed079725d65e2e45debe0278bdd","observation_id":"e962eadd-59e1-41c6-acdc-935f0a37f0c1","resolution":{"observed_at":"2026-08-08T15:04:29.598822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:04:29.602320Z","title":"Reusing pretrained models by multi-linear operators for efficient training,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.602320Z"},"links":{"citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:0039d9e278449a9bba39225762197a67f54a4d6b7ef2f56b73b38805d2e3dd5d","observation_id":"3c947bd0-3178-46e6-9632-5cd030dc9219","resolution":{"observed_at":"2026-08-08T15:04:29.602320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.13337","last_updated":"2025-07-02T03:53:29Z","snapshot_observed_at":"2026-07-06T18:17:42.417326Z","submitted_at":"2024-05-22T04:49:00Z","title":"Semantic Equitable Clustering: A Simple and Effective Strategy for Clustering Vision Tokens","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.13337","snapshot_observed_at":"2026-08-08T15:04:29.606779Z","title":"Semantic equitable clustering: A simple, fast and effective strategy for vision transformer,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.606779Z"},"links":{"cited_paper":"/paper/2405.13337","citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:21316eeb4a3ae50a2780098076e118cfa2aabef6e450c806c84dc800fd9f2124","observation_id":"baeeb66d-2163-40d3-937e-2d8e8f4bc873","resolution":{"observed_at":"2026-08-08T15:04:29.606779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:04:29.610887Z","title":"Pcad: Towards asr- robust spoken language understanding via prototype calibration and asymmetric decoupling,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.610887Z"},"links":{"citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:6f922a61e6fa9710c436bb06903764e21c5f3d31ac4b41e8191f5e445889f5ac","observation_id":"f19448a6-bf5b-49ad-854e-7502baf40aed","resolution":{"observed_at":"2026-08-08T15:04:29.610887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:04:29.614649Z","title":"Macsc: Towards multimodal- augmented pre-trained language models via conceptual prototypes and self-balancing calibra- tion,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.614649Z"},"links":{"citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:26ca4de341b1a7f73fc1ce27b914fb4e574f2f1045a481af6849148ab478bf7e","observation_id":"26d058df-78ad-4d0e-a689-e49ae0853d94","resolution":{"observed_at":"2026-08-08T15:04:29.614649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02765","last_updated":"2023-05-07T09:22:04Z","snapshot_observed_at":"2026-08-06T10:45:04.364170Z","submitted_at":"2023-05-04T12:11:13Z","title":"HiFi-Codec: Group-residual Vector quantization for High Fidelity Audio Codec","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.02765","snapshot_observed_at":"2026-08-08T15:04:29.618212Z","title":"Hifi-codec: Group-residual vector quantization for high fidelity audio codec,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.618212Z"},"links":{"cited_paper":"/paper/2305.02765","citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:1791a3beb8126d023be70d941c915ec3372f44fa2a8d3f6f96296f3bb4e4b1af","observation_id":"8d564f31-603c-406e-b171-5f5efd47bbc6","resolution":{"observed_at":"2026-08-08T15:04:29.618212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10056","last_updated":"2024-06-14T14:13:18Z","snapshot_observed_at":"2026-07-06T18:31:04.425917Z","submitted_at":"2024-06-14T14:13:18Z","title":"UniAudio 1.5: Large Language Model-driven Audio Codec is A Few-shot Audio Task Learner","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10056","snapshot_observed_at":"2026-08-08T15:04:29.622125Z","title":"Uniaudio 1.5: Large language model-driven audio codec is a few-shot audio task learner,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.622125Z"},"links":{"cited_paper":"/paper/2406.10056","citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:e9857f598c471380e1be7344c32aaac7983b5e88d902984d106e9f3ff6bc5868","observation_id":"247aa966-32d4-440b-945a-b96d11c7df17","resolution":{"observed_at":"2026-08-08T15:04:29.622125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.04507","last_updated":"2023-05-10T03:51:26Z","snapshot_observed_at":"2026-07-06T15:24:26.278108Z","submitted_at":"2023-05-08T07:03:33Z","title":"FedZKP: Federated Model Ownership Verification with Zero-knowledge Proof","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.04507","snapshot_observed_at":"2026-08-08T15:04:29.625853Z","title":"Fedzkp: Federated model ownership verification with zero-knowledge proof,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.625853Z"},"links":{"cited_paper":"/paper/2305.04507","citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:62a2469cf81a66d9495b4bdcdf591d069b5de3a980129a6d0577e9f8d84a05dd","observation_id":"0fa6f811-b05d-4edc-bc88-d3cdb4d87d0d","resolution":{"observed_at":"2026-08-08T15:04:29.625853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06085","last_updated":"2023-05-10T12:10:02Z","snapshot_observed_at":"2026-08-01T19:15:09.907414Z","submitted_at":"2023-05-10T12:10:02Z","title":"FedSOV: Federated Model Secure Ownership Verification with Unforgeable Signature","version":1},"cited_work":{"arxiv_id":"2305.06085","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.06085","snapshot_observed_at":"2026-08-08T15:04:30.116063Z","title":"FedSOV: Federated Model Secure Ownership Verification with Unforgeable Signature","venue":"cs.CR","work_id":"c1670ed6-ecc5-4c70-946c-2f6d754c8c06","year":2023},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.629607Z"},"links":{"cited_paper":"/paper/2305.06085","citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:ab0bdb61fc989b49fa437650ae0c8909af3cf02f158f8a7de88f23fc787ae8a1","observation_id":"24cbec1a-f8e5-4c3d-90fc-2d2cd14ac512","resolution":{"observed_at":"2026-08-08T15:04:30.120370Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:04:29.633527Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.633527Z"},"links":{"citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:ee1c51ea5fd29e4a30e5202a3b3478fe018c9fda6f9203f0f400608f21f5c696","observation_id":"c78fe4ee-1fad-4b44-9d0c-300efe993bd4","resolution":{"observed_at":"2026-08-08T15:04:29.633527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05405","last_updated":"2024-04-08T11:11:31Z","snapshot_observed_at":"2026-08-05T03:30:28.158531Z","submitted_at":"2024-04-08T11:11:31Z","title":"Physics of Language Models: Part 3.3, Knowledge Capacity Scaling Laws","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05405","snapshot_observed_at":"2026-08-08T15:04:29.637076Z","title":"Physics of language models: Part 3.3, knowledge capacity scaling laws,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.637076Z"},"links":{"cited_paper":"/paper/2404.05405","citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:6464de2069474335af57876f76c3fb34b8b46050acde5abf316e806ba5bbfc2b","observation_id":"53abca1b-6c74-4c3c-ba55-f33eee8ce64b","resolution":{"observed_at":"2026-08-08T15:04:29.637076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:04:29.640544Z","title":"Parameterized algorithms and complexity for the traveling purchaser problem and its variants,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.640544Z"},"links":{"citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:49b695233154bf094aead8412897d7ad507bbb1f5250260ec66c0576aee0e43c","observation_id":"ef3112b6-b093-4aff-a072-3fedc2da4819","resolution":{"observed_at":"2026-08-08T15:04:29.640544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:04:29.644119Z","title":"Dataset pruning: Reducing training data by examining generalization influence,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.644119Z"},"links":{"citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:27a2f71afe294e14bd169ec39232db5e843396dbcd11d8638fd645833fd9acb6","observation_id":"8aa7ae6b-ecb4-44ca-847b-8749c533de5a","resolution":{"observed_at":"2026-08-08T15:04:29.644119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:04:29.648416Z","title":"On training data influence of GPT models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.648416Z"},"links":{"citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:a10e288571c9543d2573212f7eaabb3a1d25e896536bc67a012229743154f304","observation_id":"da8125c3-4813-4f7e-9005-a336803ab07e","resolution":{"observed_at":"2026-08-08T15:04:29.648416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:04:29.652719Z","title":"From quantity to quality: Boosting LLM performance with self-guided data selection for instruction tuning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.652719Z"},"links":{"citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:69f2439537fbeb8759e06d0038b2ffadf60be6b35f05a3bee3ac141e94d29767","observation_id":"2388707d-a097-4d8c-8237-5941474258e6","resolution":{"observed_at":"2026-08-08T15:04:29.652719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:04:29.656553Z","title":"Doremi: Optimizing data mixtures speeds up language model pretraining,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.656553Z"},"links":{"citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:49bca8aca798a6bd5c0c67a5a590ad26bf38d3bcfcf144e6849d4995a43b8c5b","observation_id":"f5423c0c-be98-4c67-8dd4-13da3ec33721","resolution":{"observed_at":"2026-08-08T15:04:29.656553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13840","last_updated":"2025-07-02T21:53:51Z","snapshot_observed_at":"2026-08-09T02:47:22.692232Z","submitted_at":"2023-06-24T02:25:56Z","title":"Beyond Scale: The Diversity Coefficient as a Data Quality Metric for Variability in Natural Language Data","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13840","snapshot_observed_at":"2026-08-08T15:04:29.660572Z","title":"Beyond scale: the diversity coefficient as a data quality metric demonstrates llms are pre-trained on formally diverse data,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.660572Z"},"links":{"cited_paper":"/paper/2306.13840","citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:bfa9b9e6c1599749a4afdb95e81fba8f13afc5dbb2127c4a69e33985b80f61f2","observation_id":"4b190eac-44c4-4306-b116-456537a6340d","resolution":{"observed_at":"2026-08-08T15:04:29.660572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.17120","last_updated":"2024-04-29T17:41:51Z","snapshot_observed_at":"2026-07-06T18:05:55.328415Z","submitted_at":"2024-04-26T02:29:26Z","title":"Talking Nonsense: Probing Large Language Models' Understanding of Adversarial Gibberish Inputs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.17120","snapshot_observed_at":"2026-08-08T15:04:29.664691Z","title":"Talking nonsense: Probing large language models’ understanding of adversarial gibberish inputs,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.664691Z"},"links":{"cited_paper":"/paper/2404.17120","citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:c69285eaa30ff3022e5b65805f78b8b2c4b490c0bfd52dd987cc311d16e7d6d2","observation_id":"edb1e5e7-3608-478f-8b80-6b770f8fada6","resolution":{"observed_at":"2026-08-08T15:04:29.664691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:04:29.668537Z","title":"A comprehensive survey on source-free domain adaptation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.668537Z"},"links":{"citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:15eaa54114b7c8975253811012a4eae2e648cea3dcd1b554551446462fd7e81d","observation_id":"28c16ea2-b981-4783-87fd-ba387ec0ee1f","resolution":{"observed_at":"2026-08-08T15:04:29.668537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:04:29.672375Z","title":"Cross-domain mutual information adversarial maximiza- tion,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.672375Z"},"links":{"citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:dff587b047d1f542222afc0e7634ec860bcfaa7671e56f5f22d3eca23f1e15cb","observation_id":"ee691dd7-34a9-4f4e-a8b8-42c26fdd5635","resolution":{"observed_at":"2026-08-08T15:04:29.672375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:04:29.676159Z","title":"Domain adaptive land-cover classification via local consistency and global diversity,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.676159Z"},"links":{"citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:e2d0f1955c3cee8080ba73e85571ec8c23b92641aea8a9aade1747ff6501f456","observation_id":"16e8b51b-0a27-4e39-9c34-53260530560e","resolution":{"observed_at":"2026-08-08T15:04:29.676159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:04:30.839264Z","title":"Diffusion-based probabilistic uncertainty estimation for active domain adaptation,","venue":null,"work_id":"c91e78bb-234c-432d-8dc1-a281d0a0284a","year":2023},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.679733Z"},"links":{"citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:fb34f2011d7092e8013047a0d62f93d317ebc3d48244a4b257e4716fdd8474f5","observation_id":"0ee60054-d64d-4308-957b-6be7389cadb3","resolution":{"observed_at":"2026-08-08T15:04:30.843335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:04:30.827767Z","title":"Online adaptive fault diagnosis with test-time domain adaptation,","venue":null,"work_id":"0309a1f4-6381-430b-9f26-3381462dfc92","year":2024},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.683655Z"},"links":{"citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:d3f6f6cb81eee285ca9b0db0be49fc95c89f78b7bb2caa853c4f44d371edd1ac","observation_id":"d46f6f92-ff54-4a9f-a061-090ee4327ae1","resolution":{"observed_at":"2026-08-08T15:04:30.832007Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:04:30.816130Z","title":"Divergence-agnostic unsupervised domain adaptation by adversarial attacks,","venue":null,"work_id":"a7772439-7c28-4dd1-a39c-ee5d116a12a4","year":2021},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.687543Z"},"links":{"citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:3b41c2af540bea62ade97532aded8dc6d7464798325d81a1108bacc757b72151","observation_id":"93f0ad21-3f65-4d91-99ec-f10a5728d2fe","resolution":{"observed_at":"2026-08-08T15:04:30.820172Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:04:30.805468Z","title":"Imbalanced open set domain adaptation via moving-threshold estimation and gradual alignment,","venue":null,"work_id":"35edfb1e-21d2-4c36-b866-26f633fc942f","year":2024},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.691420Z"},"links":{"citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:c7af28fb55a60b0496a5afee0269e8d1fb79119e4ed4789bdff77c13713673bd","observation_id":"30f9f738-75a4-4e6a-9435-96a8c1fcd894","resolution":{"observed_at":"2026-08-08T15:04:30.809300Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:04:30.794406Z","title":"Learning from noisy labels with deep neural networks: A survey,","venue":null,"work_id":"68f39be1-b445-497f-af8e-836226f56fef","year":2022},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.695000Z"},"links":{"citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:86d860a5a06b299e1c62c401f27b933048488044c14e9e8cf2f469423abb3344","observation_id":"a5e4410d-7ab1-421c-b67f-402a748c8713","resolution":{"observed_at":"2026-08-08T15:04:30.798241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:04:30.783714Z","title":"Does label smoothing mitigate label noise?","venue":null,"work_id":"31b19658-3096-4f95-98c6-e7420d9b8108","year":2020},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.698504Z"},"links":{"citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:ced37b01f63dbebe6d55b2e7916c60066fa1ef6b5b8491453df5ce415ec3e426","observation_id":"80dbfc26-d9e2-40fb-845e-ee3750565c80","resolution":{"observed_at":"2026-08-08T15:04:30.787591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03825","last_updated":"2017-06-12T19:53:30Z","snapshot_observed_at":"2026-07-06T05:46:32.599765Z","submitted_at":"2017-06-12T19:53:30Z","title":"SmoothGrad: removing noise by adding noise","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.03825","snapshot_observed_at":"2026-08-08T15:04:29.702487Z","title":"Smoothgrad: removing noise by adding noise,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.702487Z"},"links":{"cited_paper":"/paper/1706.03825","citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:cea28f091f6a0b064e87060080fca2b26c0dfc55497b8d1dcf064342ccee8748","observation_id":"ccfdff97-884e-4f24-94b3-bd5932737885","resolution":{"observed_at":"2026-08-08T15:04:29.702487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:04:30.772538Z","title":"Pure noise to the rescue of insufficient data: Improving imbalanced classification by training on random noise images,","venue":null,"work_id":"f9418d59-b6e0-445b-876a-072a52e0d0bc","year":2022},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.706481Z"},"links":{"citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:49aa587cbef165e89d4680e68ac2c37acd842e531a072bc8bcb21db883c7a573","observation_id":"ef34113c-8311-4996-963e-8a343280bf3d","resolution":{"observed_at":"2026-08-08T15:04:30.776292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08682","last_updated":"2024-08-16T11:55:44Z","snapshot_observed_at":"2026-08-08T11:59:32.171116Z","submitted_at":"2024-08-16T11:55:44Z","title":"LLM-PCGC: Large Language Model-based Point Cloud Geometry Compression","version":1},"cited_work":{"arxiv_id":"2408.08682","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.08682","snapshot_observed_at":"2026-08-08T15:04:30.049112Z","title":"LLM-PCGC: Large Language Model-based Point Cloud Geometry Compression","venue":"cs.AI","work_id":"27dcbe33-a1d6-4dfc-ad95-45792e735022","year":2024},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.710090Z"},"links":{"cited_paper":"/paper/2408.08682","citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:0fe36642cc92cf86ef4fee69bf2b52686359948d92d6a9adb98da54e74443939","observation_id":"772f9bf0-235a-43d4-b1a4-3991426f7380","resolution":{"observed_at":"2026-08-08T15:04:30.053906Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.13335","last_updated":"2025-09-10T04:25:09Z","snapshot_observed_at":"2026-08-08T16:17:03.159694Z","submitted_at":"2024-05-22T04:34:36Z","title":"Vision Transformer with Sparse Scan Prior","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.13335","snapshot_observed_at":"2026-08-08T15:04:29.713823Z","title":"Vision transformer with sparse scan prior,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.713823Z"},"links":{"cited_paper":"/paper/2405.13335","citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:38265507ace098fcf71dd3005bf3b63a4992955925473a801b5b5ef8bc8dd0ca","observation_id":"f06efcc4-fd35-448f-91a4-da2750cd68f1","resolution":{"observed_at":"2026-08-08T15:04:29.713823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:04:30.761986Z","title":"Semigmmpoint: Semi-supervised point cloud segmentation based on gaussian mixture models,","venue":null,"work_id":"38733c2c-4d01-4830-8430-df388d144a39","year":2025},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.717670Z"},"links":{"citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:c78118617e79efc1c12b2c69417c6dfedfc72a34b09474b1c4777fcbc8e47581","observation_id":"6be1d87c-bd45-45bb-82b3-b55d9898feed","resolution":{"observed_at":"2026-08-08T15:04:30.765395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:04:30.752244Z","title":"Composed fine-tuning: Freezing pre-trained denoising autoencoders for improved generalization,","venue":null,"work_id":"efa54e15-9aec-4648-8ae3-bdc72b175336","year":2021},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.721617Z"},"links":{"citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:4d8f4b27e6ed4f6ca6d44da4b9d3b40207def4ea155cd5e33d5a9c5e72291cd0","observation_id":"f86614ab-2c94-482c-bac0-a2e9655febc5","resolution":{"observed_at":"2026-08-08T15:04:30.755594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:04:30.741619Z","title":"Game on tree: Visual hallucination mitigation via coarse-to-fine view tree and game theory,","venue":null,"work_id":"39da3201-7c0c-4cef-8358-d6e355a9a01a","year":2024},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.725287Z"},"links":{"citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:a1ef8b0ae1664720e015f09cfdbf082786842195c221fe266126f2cc208f3eed","observation_id":"9ecbcaf8-cfc0-46ba-bc3a-b6ec955b262c","resolution":{"observed_at":"2026-08-08T15:04:30.745462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:04:30.730229Z","title":"Not all texts are the same: Dynamically querying texts for scene text detection,","venue":null,"work_id":"087ec5fb-da8c-442f-b2f0-9548bcc7fd7e","year":2024},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.729029Z"},"links":{"citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:9eab1accae2cc6b314571d060445e1974cff11296a2f5d20f2423b6614372501","observation_id":"b5edfe61-66e0-4e72-bde9-2e8fed3ccf39","resolution":{"observed_at":"2026-08-08T15:04:30.734208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:04:30.718858Z","title":"Towards multimodal-augmented pre-trained language models via self-balanced expectation-maximization iteration,","venue":null,"work_id":"07ec96f7-b4c6-42b9-a19c-800d54748db6","year":2024},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.732662Z"},"links":{"citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:1dc8f5d34b6c79650e87e32a149dd47c36ff60ce29fa6c9b61825e2d1159e904","observation_id":"da431da8-f5cb-471d-8978-956b43446485","resolution":{"observed_at":"2026-08-08T15:04:30.722785Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06553","last_updated":"2025-03-21T14:43:37Z","snapshot_observed_at":"2026-07-06T20:19:40.856839Z","submitted_at":"2025-01-11T14:09:34Z","title":"VASparse: Towards Efficient Visual Hallucination Mitigation via Visual-Aware Token Sparsification","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06553","snapshot_observed_at":"2026-08-08T15:04:29.736634Z","title":"Vasparse: Towards efficient visual hallu- cination mitigation for large vision-language model via visual-aware sparsification,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.736634Z"},"links":{"cited_paper":"/paper/2501.06553","citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:f1e97498c82c2e00a6fc73224af8fe37d6d8a92ba1fa664e13b4b0f3e221509c","observation_id":"92a36130-2c45-45bc-ac40-cf254b3a3596","resolution":{"observed_at":"2026-08-08T15:04:29.736634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:04:30.707315Z","title":"Improving pretrained language model fine-tuning with noise stability regularization,","venue":null,"work_id":"0a7c5363-2c4e-4a9e-b111-094428f089bf","year":2023},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.740630Z"},"links":{"citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:062ace6035ee72918dad0c09aa41dd322a82d3e1624734777fa66ab194dc0147","observation_id":"615d0e26-bab0-47f2-b697-8d9426c1aadc","resolution":{"observed_at":"2026-08-08T15:04:30.711292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:04:30.695542Z","title":"SMART: Robust and efficient fine-tuning for pre-trained natural language models through principled regularized optimization,","venue":null,"work_id":"5bfaba63-2027-429b-8a33-24d8182181da","year":2020},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.744313Z"},"links":{"citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:9178167ad4f836f5e275eea3bc84fa0be465cc09307a0b9866acf3fb1e9cf257","observation_id":"2708e4a6-1e28-4ab6-8f69-aa3d9401753d","resolution":{"observed_at":"2026-08-08T15:04:30.699686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.03930","last_updated":"2021-11-15T04:58:28Z","snapshot_observed_at":"2026-07-31T03:05:21.352948Z","submitted_at":"2021-11-06T18:09:22Z","title":"Tip-Adapter: Training-free CLIP-Adapter for Better Vision-Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.03930","snapshot_observed_at":"2026-08-08T15:04:29.747280Z","title":"Tip-adapter: Training- free clip-adapter for better vision-language modeling,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.747280Z"},"links":{"cited_paper":"/paper/2111.03930","citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:e321744799ce7d68a15bbb66ace840d15be1bf60d6670f246f69aa281ff44a89","observation_id":"77a5dca0-0548-4d5b-a001-9143f37c2c51","resolution":{"observed_at":"2026-08-08T15:04:29.747280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:04:30.684295Z","title":"Learning to prompt for vision-language models,","venue":null,"work_id":"fc0ec0bd-33a9-424e-93f0-aaefda6c0828","year":2022},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.750651Z"},"links":{"citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:8eb6aac1e9c0836e9b9a7537f43f1396c4c86823525e10cb6465191cdeebf530","observation_id":"3c737a18-7d15-4104-b4cd-42b466f07a3a","resolution":{"observed_at":"2026-08-08T15:04:30.688043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:04:30.672843Z","title":"Conditional prompt learning for vision-language models,","venue":null,"work_id":"5c602eab-bca1-480e-aa7a-6d41a9496cff","year":2022},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.753787Z"},"links":{"citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:5aac488c7568ae787a5fb129abad453377c757bf203e62c160f14f953850c7c7","observation_id":"9098e3a3-4c5a-4533-ac00-d9aa85b754c1","resolution":{"observed_at":"2026-08-08T15:04:30.676767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:04:29.756870Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.756870Z"},"links":{"citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:32cce9306b7f4e5b517cd22c9872499e1ed7e9fe175249885bf9adc3cf7596ae","observation_id":"c7f8ce62-0baf-414d-ad87-05dcaeffe454","resolution":{"observed_at":"2026-08-08T15:04:29.756870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:04:30.653654Z","title":"LoRA: Low-rank adaptation of large language models,","venue":null,"work_id":"246000a4-02c7-429b-8844-0b9799da5b38","year":2022},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.760015Z"},"links":{"citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:a0dd255bbf4bee747af3d3b7fbdd4a81b40585b740bd0751ce1f492dc86e58d4","observation_id":"380e6b3e-f672-4e7d-b65c-cd6002930eed","resolution":{"observed_at":"2026-08-08T15:04:30.657663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T23:02:01.951277Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":80,"verified_exact":3,"verified_fuzzy":17},"total_outbound_references":138},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 100 of 138 outbound references and 2 inbound Pith citation observations for arXiv:2502.06604."}