{"as_of":"2026-08-09T12:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e7e611754b304d36ad4476464b5e34c43746be97f82489da33a2de1496b1ab53","coverage":[{"denominator":48,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T14:36:36.594376Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:09:50.090492Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T14:09:51.295780Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-09T06:26:06.352592Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"cited_work":{"arxiv_id":"2502.06733","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.06733","snapshot_observed_at":"2026-08-07T14:09:51.295780Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","venue":"cs.LG","work_id":"e868ae07-fb4a-474f-a69b-c36e69aa2487","year":2025},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-09T06:26:16.829487Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:50.090492Z"},"links":{"cited_paper":"/paper/2502.06733","citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:0281bb17b0f8a8309a9fa2e95c4ae441b073206e888259c051ced08999a8cf9d","observation_id":"457b51ea-2390-4ed0-8f05-fefe992ccef0","resolution":{"observed_at":"2026-08-07T14:09:51.406696Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.06733/citation-record","integrity":"/paper/2502.06733/integrity","json":"/paper/2502.06733/citation-record.json","paper":"/paper/2502.06733"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:36:36.371171Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-09T06:26:06.352592Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.371171Z"},"links":{"citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:9e20386cb1d859e672b0cd1d22971e0b89ceb1a3ec87f2492185c959a0380be6","observation_id":"64c56565-2fec-4d9c-9e1a-8cea83f807e5","resolution":{"observed_at":"2026-08-08T14:36:36.371171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-08T14:36:36.377163Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-09T06:26:06.352592Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.377163Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:4e3eabb02dcf37ed055142df788cc44022ebf96f9fa226f98c0c3b93ed8dbb23","observation_id":"145c6055-4bcf-4d83-b6ee-c758d2e238b9","resolution":{"observed_at":"2026-08-08T14:36:36.377163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:36:36.382732Z","title":"Piqa: Reasoning about physical commonsense in natural language","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-09T06:26:06.352592Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.382732Z"},"links":{"citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:e323bf001f11635c9c1fe2d298bfdc5aa1716582ed1636fbcd694c4097e7dd7e","observation_id":"b200ef2d-00e0-475e-af3e-b5dc128e5c58","resolution":{"observed_at":"2026-08-08T14:36:36.382732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:36:36.387751Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-09T06:26:06.352592Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.387751Z"},"links":{"citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:c7f85429766cf46d6373a2fcb7c60611d1eb4ae4501d8693888521929c6a81ef","observation_id":"7a369ffc-4bd7-4a41-82e9-40ba5d586606","resolution":{"observed_at":"2026-08-08T14:36:36.387751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:36:37.535436Z","title":"Skill-it! a data-driven skills framework for understanding and training language models","venue":null,"work_id":"3fbbc421-8f3a-4a97-bea5-f5c2f8a38897","year":2023},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-09T06:26:06.352592Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.392796Z"},"links":{"citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:a49c46d84a13f28b625aff4ba88fe2dc0cc7d3c4ab209601b763a9281d6af0b4","observation_id":"037c0e44-3ff5-4e1a-8e51-fc7a9e100b6e","resolution":{"observed_at":"2026-08-08T14:36:37.575749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14270","last_updated":"2024-03-01T15:21:16Z","snapshot_observed_at":"2026-08-06T02:46:48.297978Z","submitted_at":"2024-02-22T04:10:57Z","title":"Take the Bull by the Horns: Hard Sample-Reweighted Continual Training Improves LLM Generalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14270","snapshot_observed_at":"2026-08-08T14:36:36.397638Z","title":"Take the bull by the horns: Hard sample-reweighted continual training improves llm generalization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-09T06:26:06.352592Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.397638Z"},"links":{"cited_paper":"/paper/2402.14270","citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:f31588c9abdbe5a2ab8a9823ce9b39267a94e3c2e541338ff1220a9327c569a0","observation_id":"9311650d-fc56-431a-ad92-bf9903a64d29","resolution":{"observed_at":"2026-08-08T14:36:36.397638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:36:36.402751Z","title":"Palm: Scaling language modeling with pathways","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-09T06:26:06.352592Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.402751Z"},"links":{"citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:1e0631702b857c8351a68ae719d4555c91e35b29d223f7b113457b010bad6ef4","observation_id":"4053a7a8-7ef9-44c9-9130-7e24b0bcd021","resolution":{"observed_at":"2026-08-08T14:36:36.402751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.02355","last_updated":"2021-09-06T10:48:40Z","snapshot_observed_at":"2026-07-06T11:44:36.471158Z","submitted_at":"2021-09-06T10:48:40Z","title":"A Farewell to the Bias-Variance Tradeoff? An Overview of the Theory of Overparameterized Machine Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.02355","snapshot_observed_at":"2026-08-08T14:36:36.407927Z","title":"A farewell to the bias-variance tradeoff? an overview of the theory of overparameterized machine learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-09T06:26:06.352592Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.407927Z"},"links":{"cited_paper":"/paper/2109.02355","citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:fe72a1fdc413bd5b5487a9a2f16a4a4aee2e0bf75dc6d6d3bae0fa1a7086eb04","observation_id":"32bddf59-41d5-4333-b82c-361002398ebb","resolution":{"observed_at":"2026-08-08T14:36:36.407927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-08T14:36:36.413017Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-09T06:26:06.352592Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.413017Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:1db8410bc65fa1446d07d5c0e1d6321d9d63eaf8bb66fa732b2fb7dc2e978116","observation_id":"d8b248d9-d51d-4735-a035-09d1ebc902fc","resolution":{"observed_at":"2026-08-08T14:36:36.413017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.15389","last_updated":"2023-10-23T22:41:33Z","snapshot_observed_at":"2026-08-08T07:52:55.072991Z","submitted_at":"2023-10-23T22:41:33Z","title":"Irreducible Curriculum for Language Model Pretraining","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.15389","snapshot_observed_at":"2026-08-08T14:36:36.418212Z","title":"Irreducible curriculum for language model pretraining","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-09T06:26:06.352592Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.418212Z"},"links":{"cited_paper":"/paper/2310.15389","citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:4c97fbdfca22acfc79ca7602e6a1990baf73863191ce3d8b219dcf1e84378f52","observation_id":"f164f619-804d-4e77-b050-cb185a0ffaa6","resolution":{"observed_at":"2026-08-08T14:36:36.418212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:36:37.446418Z","title":"DOGE : Domain reweighting with generalization estimation","venue":null,"work_id":"c0de7598-439c-4a7b-84ff-64c1c1987b6c","year":2023},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-09T06:26:06.352592Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.423775Z"},"links":{"citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:dd0c41241076c69327166c470eaeff47274209ebf6958c5e354368e7ff985e2e","observation_id":"7f18b473-c5e8-4fcf-9a23-c12d131e717c","resolution":{"observed_at":"2026-08-08T14:36:37.479585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:36:36.428397Z","title":"Rethinking importance weighting for deep learning under distribution shift","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-09T06:26:06.352592Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.428397Z"},"links":{"citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:41af0eb877bb47fa04cc42c495b2bd2e2973c2bba6935c6204ed88e660536bbe","observation_id":"dc59a251-160d-4d96-b914-4ccd88e57a78","resolution":{"observed_at":"2026-08-08T14:36:36.428397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00027","last_updated":"2020-12-31T19:00:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-12-31T19:00:10Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00027","snapshot_observed_at":"2026-08-08T14:36:36.433253Z","title":"The pile: An 800gb dataset of diverse text for language modeling","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-09T06:26:06.352592Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.433253Z"},"links":{"cited_paper":"/paper/2101.00027","citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:99e58d48ef1a5e37edc22f6905e0af7b2dc908107f7d040ceb374b46a6e54d73","observation_id":"cd800386-1655-4ed8-b3d9-ed3703bc65d7","resolution":{"observed_at":"2026-08-08T14:36:36.433253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.11973","last_updated":"2023-11-20T18:01:29Z","snapshot_observed_at":"2026-08-05T09:54:58.638813Z","submitted_at":"2023-11-20T18:01:29Z","title":"Adaptive Training Distributions with Scalable Online Bilevel Optimization","version":1},"cited_work":{"arxiv_id":"2311.11973","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.11973","snapshot_observed_at":"2026-08-08T14:36:36.967638Z","title":"Adaptive Training Distributions with Scalable Online Bilevel Optimization","venue":"cs.LG","work_id":"bba1d828-8162-45e1-a0c3-390234295c2f","year":2023},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-09T06:26:06.352592Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.438299Z"},"links":{"cited_paper":"/paper/2311.11973","citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:a1b807ffad3fa10b1e2d1bfc0cdaeffd972f13661d5afab54f55abd1d4664109","observation_id":"7351fd65-d779-4697-ba4c-ce4641107993","resolution":{"observed_at":"2026-08-08T14:36:36.972736Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:36:37.355167Z","title":"Fedexp: Speeding up federated averaging via extrapolation","venue":null,"work_id":"694014a5-6376-46aa-838a-49d8b3da1718","year":2023},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-09T06:26:06.352592Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.443123Z"},"links":{"citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:647a89e86a40219751049cff0c147f2a60b1ba9cd9cd6a537df85068b5be8f09","observation_id":"a60e61d2-3a92-46d6-910b-d1bdddf903c2","resolution":{"observed_at":"2026-08-08T14:36:37.394485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.00762","last_updated":"2019-10-02T03:34:29Z","snapshot_observed_at":"2026-08-07T07:17:09.592892Z","submitted_at":"2019-10-02T03:34:29Z","title":"Accelerating Deep Learning by Focusing on the Biggest Losers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.00762","snapshot_observed_at":"2026-08-08T14:36:36.447693Z","title":"Accelerating deep learning by focusing on the biggest losers","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-09T06:26:06.352592Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.447693Z"},"links":{"cited_paper":"/paper/1910.00762","citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:5ac540882da9ba9a35eef3dd72ec7da97c5cddf2b9349c766f268c93790ef54e","observation_id":"a908a46f-4f5f-44e6-9726-cf66d8072390","resolution":{"observed_at":"2026-08-08T14:36:36.447693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.09849","last_updated":"2024-12-12T14:56:20Z","snapshot_observed_at":"2026-07-06T19:02:20.097267Z","submitted_at":"2024-08-19T09:51:02Z","title":"Importance Weighting Can Help Large Language Models Self-Improve","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.09849","snapshot_observed_at":"2026-08-08T14:36:36.452596Z","title":"Importance weighting can help large language models self-improve","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-09T06:26:06.352592Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.452596Z"},"links":{"cited_paper":"/paper/2408.09849","citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:55480fddaef10ede8d079efd8a33c233d6a7e9e887d040a5fcc9b97879c4b4cb","observation_id":"6c359732-9b22-4939-a8e4-d99ef841ffa8","resolution":{"observed_at":"2026-08-08T14:36:36.452596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:36:37.289149Z","title":"Instance weighting for domain adaptation in NLP","venue":null,"work_id":"8ac3b7ae-de1b-43a2-8c2a-0ae6f67d7dfe","year":2007},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-09T06:26:06.352592Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.457381Z"},"links":{"citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:f6da03e0848f5516e81d9c5532e41d35713ba7b9600612cff228af8fa95ce0af","observation_id":"07d8b422-8c1e-4fc3-88e9-0fcd14d12602","resolution":{"observed_at":"2026-08-08T14:36:37.315830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:36:36.462282Z","title":"Not all samples are created equal: Deep learning with importance sampling","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-09T06:26:06.352592Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.462282Z"},"links":{"citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:eafd14f72b68094f5785fc65e4c512da7974db1f6b156563b7fcbd48fbca6d68","observation_id":"7734a31c-4f42-4cd9-b793-740ca928c358","resolution":{"observed_at":"2026-08-08T14:36:36.462282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09222","last_updated":"2024-10-13T04:07:11Z","snapshot_observed_at":"2026-07-06T15:43:03.878575Z","submitted_at":"2023-06-15T15:58:04Z","title":"Stochastic Re-weighted Gradient Descent via Distributionally Robust Optimization","version":5},"cited_work":{"arxiv_id":"2306.09222","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.09222","snapshot_observed_at":"2026-08-08T14:36:36.915260Z","title":"Stochastic Re-weighted Gradient Descent via Distributionally Robust Optimization","venue":"cs.LG","work_id":"0b586a0c-3819-41c3-af4f-59f5229227d7","year":2023},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-09T06:26:06.352592Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.466643Z"},"links":{"cited_paper":"/paper/2306.09222","citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:3db87e235a7c7698dcb75dcd9b2c94c415c700944671b8342409084e5a531f7e","observation_id":"2387da00-b5a9-424e-9a12-cb218ebc7a90","resolution":{"observed_at":"2026-08-08T14:36:36.920322Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:36:37.265097Z","title":"Probabilistic margins for instance reweighting in adversarial training","venue":null,"work_id":"bc35e5db-568d-44fd-8d8b-fc8fec0b3629","year":2021},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-09T06:26:06.352592Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.471610Z"},"links":{"citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:4c6e8a5824e2f3c49804f200b4f2428bdc40db54ecc4e58c4a7e871c092660dd","observation_id":"a3df622a-a821-48a8-9992-8b8a25502890","resolution":{"observed_at":"2026-08-08T14:36:37.269915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:36:36.476014Z","title":"Logiqa 2.0—an improved dataset for logical reasoning in natural language understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-09T06:26:06.352592Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.476014Z"},"links":{"citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:1f5574365867220e69c54e39945a988bc95e9b37d77cdb9710a66500ace351a7","observation_id":"5f15e577-aaa0-48e7-8940-52f416cb07cd","resolution":{"observed_at":"2026-08-08T14:36:36.476014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.08124","last_updated":"2020-07-16T05:52:16Z","snapshot_observed_at":"2026-08-09T06:25:20.879304Z","submitted_at":"2020-07-16T05:52:16Z","title":"LogiQA: A Challenge Dataset for Machine Reading Comprehension with Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.08124","snapshot_observed_at":"2026-08-08T14:36:36.480431Z","title":"Logiqa: A challenge dataset for machine reading comprehension with logical reasoning","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-09T06:26:06.352592Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.480431Z"},"links":{"cited_paper":"/paper/2007.08124","citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:17f9c27336f9cd612339d424526bb795d2e44297dd95bb2b1ecbe0ddf06cb295","observation_id":"fa7f26f8-24d7-4ea3-bf6b-19e8538d0901","resolution":{"observed_at":"2026-08-08T14:36:36.480431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13169","last_updated":"2023-11-13T14:50:06Z","snapshot_observed_at":"2026-07-06T15:30:45.921201Z","submitted_at":"2023-05-22T15:57:53Z","title":"A Pretrainer's Guide to Training Data: Measuring the Effects of Data Age, Domain Coverage, Quality, & Toxicity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13169","snapshot_observed_at":"2026-08-08T14:36:36.485151Z","title":"A pretrainer's guide to training data: Measuring the effects of data age, domain coverage, quality, & toxicity","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-09T06:26:06.352592Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.485151Z"},"links":{"cited_paper":"/paper/2305.13169","citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:4928803f129b794d7fce71a9a571fb05d764f5cc7b830b6c3507ec5584e92105","observation_id":"3516fb05-27ec-4f9e-b457-255a998579dd","resolution":{"observed_at":"2026-08-08T14:36:36.485151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1511.06343","last_updated":"2016-04-25T14:00:21Z","snapshot_observed_at":"2026-08-06T18:58:16.729973Z","submitted_at":"2015-11-19T20:24:09Z","title":"Online Batch Selection for Faster Training of Neural Networks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.06343","snapshot_observed_at":"2026-08-08T14:36:36.489866Z","title":"Online batch selection for faster training of neural networks","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-09T06:26:06.352592Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.489866Z"},"links":{"cited_paper":"/paper/1511.06343","citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:37fec19013e86f7f48bf869f21313b510e472063e6571c77935a5f40550d846e","observation_id":"49dd77b7-6a50-44d1-8ab5-0364242ec0d8","resolution":{"observed_at":"2026-08-08T14:36:36.489866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.01116","last_updated":"2023-06-01T20:03:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-01T20:03:56Z","title":"The RefinedWeb Dataset for Falcon LLM: Outperforming Curated Corpora with Web Data, and Web Data Only","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.01116","snapshot_observed_at":"2026-08-08T14:36:36.494040Z","title":"The refinedweb dataset for falcon llm: outperforming curated corpora with web data, and web data only","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-09T06:26:06.352592Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.494040Z"},"links":{"cited_paper":"/paper/2306.01116","citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:4e99c1744c6f4df088c39d94917668f7973c61cc22081436473304743ad5950a","observation_id":"bc97de34-1176-4300-aac6-3827a5853cb0","resolution":{"observed_at":"2026-08-08T14:36:36.494040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17557","last_updated":"2024-10-31T11:37:49Z","snapshot_observed_at":"2026-08-02T15:25:02.551919Z","submitted_at":"2024-06-25T13:50:56Z","title":"The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17557","snapshot_observed_at":"2026-08-08T14:36:36.499623Z","title":"The fineweb datasets: Decanting the web for the finest text data at scale, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-09T06:26:06.352592Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.499623Z"},"links":{"cited_paper":"/paper/2406.17557","citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:c6a2f485f391cbbe2bd5d991124e6a88a82b93d848d3afa6823147a76c82b898","observation_id":"9ffc1f42-882c-4357-b311-0b4d9beea84b","resolution":{"observed_at":"2026-08-08T14:36:36.499623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:36:37.239869Z","title":"An online method for a class of distributionally robust optimization with non-convex objectives","venue":null,"work_id":"ea29a6a5-33b2-422a-bdb5-2b59fc544a47","year":2021},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-09T06:26:06.352592Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.504056Z"},"links":{"citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:39951e10a2fc190b8b2194c324c00cc72e267dca82b25e1815affff0bcaf1bad","observation_id":"975a3e06-4a62-4cfd-b667-09b58438ee5f","resolution":{"observed_at":"2026-08-08T14:36:37.244956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:36:37.224885Z","title":"Robust optimization over multiple domains","venue":null,"work_id":"89f6ae0f-c201-47b6-81d3-0e2a662636be","year":2019},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-09T06:26:06.352592Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.508337Z"},"links":{"citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:0f55f649f48a3e25594535aa97493dee3e205a7de979439d2555574488144075","observation_id":"878d2deb-6e38-4f9b-852b-67819459e719","resolution":{"observed_at":"2026-08-08T14:36:37.229574Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:36:36.513078Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-09T06:26:06.352592Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.513078Z"},"links":{"citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:151fff5afd38ca7212facbab4199d310a1ca21906da9aef5d95dd014730ffa48","observation_id":"c1fefab7-baa5-48d1-b45e-86375429c6e8","resolution":{"observed_at":"2026-08-08T14:36:36.513078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:36:36.517595Z","title":"Overparameterized neural networks implement associative memory","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-09T06:26:06.352592Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.517595Z"},"links":{"citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:1f4602a184c1854a56bcd4393d4cfabc4c01f971efbb61c9221eb23e0d1a1411","observation_id":"65025dcb-73ea-4396-90f3-70901d96ec03","resolution":{"observed_at":"2026-08-08T14:36:36.517595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:36:36.521933Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-09T06:26:06.352592Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.521933Z"},"links":{"citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:5a0c8f620e86a08e9bccdbfca2bf3bb5da5a7fa70ceb05cae50d753170ed7435","observation_id":"d42889cc-31d8-4cbb-a88a-abef68ed65e8","resolution":{"observed_at":"2026-08-08T14:36:36.521933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:36:37.181835Z","title":"Learning to reweight examples for robust deep learning","venue":null,"work_id":"fb37fd51-0460-4aa4-ad53-78af1afaf64e","year":2018},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-09T06:26:06.352592Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.526334Z"},"links":{"citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:5f6f7798c5e2f8149d838ea96077271a080aa34e00ab40f01ae5243c458eadd0","observation_id":"c5ae3537-a782-48c7-bfaf-3c5036a19fd4","resolution":{"observed_at":"2026-08-08T14:36:37.186740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:36:37.166473Z","title":"Almost sure convergence rates for stochastic gradient descent and stochastic heavy ball","venue":null,"work_id":"b711036d-cb8e-421e-ba03-438498ae7165","year":2021},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-09T06:26:06.352592Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.530538Z"},"links":{"citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:860c92796e26ebf61561a5b263e0b5701f37bb038340445435b241ee29955efb","observation_id":"13e9e73f-5f13-4786-ad4c-071a30b06062","resolution":{"observed_at":"2026-08-08T14:36:37.171130Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:36:37.150471Z","title":"SlimPajama: A 627B token cleaned and deduplicated version of RedPajama","venue":null,"work_id":"0b0cb4e3-3664-41ba-8a25-2451b73976c1","year":2023},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-09T06:26:06.352592Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.535047Z"},"links":{"citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:93b28c0f1f888e9ae5b74e7691965e39050ee9f38615c8661cf1473b3269aa47","observation_id":"e0419639-5862-4bba-b4f4-6718335ada6e","resolution":{"observed_at":"2026-08-08T14:36:37.155346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00311","last_updated":"2023-08-01T06:16:18Z","snapshot_observed_at":"2026-07-06T16:01:07.532053Z","submitted_at":"2023-08-01T06:16:18Z","title":"Doubly Robust Instance-Reweighted Adversarial Training","version":1},"cited_work":{"arxiv_id":"2308.00311","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.00311","snapshot_observed_at":"2026-08-08T14:36:36.818059Z","title":"Doubly Robust Instance-Reweighted Adversarial Training","venue":"cs.LG","work_id":"1bd45073-55ff-4ee0-8f5d-7301c193977c","year":2023},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-09T06:26:06.352592Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.539574Z"},"links":{"cited_paper":"/paper/2308.00311","citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:43a553866317a49a95351e84dbef0dc17fae39e9a88b16479396b896817e5c3a","observation_id":"1b499208-2bbf-46ad-92e4-da3ff31f1400","resolution":{"observed_at":"2026-08-08T14:36:36.823339Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.00913","last_updated":"2023-11-02T01:00:46Z","snapshot_observed_at":"2026-07-06T16:42:00.138744Z","submitted_at":"2023-11-02T01:00:46Z","title":"Self-Influence Guided Data Reweighting for Language Model Pre-training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.00913","snapshot_observed_at":"2026-08-08T14:36:36.544083Z","title":"Self-influence guided data reweighting for language model pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-09T06:26:06.352592Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.544083Z"},"links":{"cited_paper":"/paper/2311.00913","citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:319efce7c84fd68cc0f31d5e8eaaa6c8b44da633e8027d32ce96e65d3991a6a9","observation_id":"067775a3-e8a9-4d8c-97a7-8b0dc06906b9","resolution":{"observed_at":"2026-08-08T14:36:36.544083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-08T14:36:36.548756Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-09T06:26:06.352592Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.548756Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:b0d05439ca0160e3220f52304fa36e35183dd77c8525a22fc14eacbb2c383cb7","observation_id":"91fc5ff7-dcfe-4697-8dfd-916f31101db7","resolution":{"observed_at":"2026-08-08T14:36:36.548756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:36:36.553280Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-09T06:26:06.352592Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.553280Z"},"links":{"citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:13892e85609225f7ab6a72d075b9b40b6c4a54d144435a326ffbd99c76e1c200","observation_id":"e40a2f10-2db2-4ca9-ae72-dd7e5256a23d","resolution":{"observed_at":"2026-08-08T14:36:36.553280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:36:37.125698Z","title":"Liu, and Matt Gardner","venue":null,"work_id":"0f50f533-d81b-4337-8f4f-cf73860de1db","year":2017},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-09T06:26:06.352592Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.557827Z"},"links":{"citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:7eec6bc132acf00d41faeb5fd1599ea48e0dd3a01aebc9a6a2f9f90b184d76a1","observation_id":"14980b0b-66f3-4c25-b84e-ab3672c9b73e","resolution":{"observed_at":"2026-08-08T14:36:37.130683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:36:37.110335Z","title":"Q u R ating: Selecting high-quality data for training language models","venue":null,"work_id":"61dff57b-5e50-406a-b1ef-d480b35f98d3","year":2024},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-09T06:26:06.352592Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.562124Z"},"links":{"citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:3f177884f03f4d662482d12c0ad06535ed0a619be2bf5f988b618e21d8017b3e","observation_id":"6e524103-9ed9-4afc-8b46-379e36ffe1f5","resolution":{"observed_at":"2026-08-08T14:36:37.115261Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10429","last_updated":"2023-11-21T02:01:53Z","snapshot_observed_at":"2026-08-09T06:27:16.635132Z","submitted_at":"2023-05-17T17:58:13Z","title":"DoReMi: Optimizing Data Mixtures Speeds Up Language Model Pretraining","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10429","snapshot_observed_at":"2026-08-08T14:36:36.566504Z","title":"Doremi: Optimizing data mixtures speeds up language model pretraining","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-09T06:26:06.352592Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.566504Z"},"links":{"cited_paper":"/paper/2305.10429","citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:966ad59f8965f4c0ec0f1b1598910219b67501653afcde358624ff5aaf1b879a","observation_id":"f0addaf2-1bbc-44bb-a1ac-08568136d1bd","resolution":{"observed_at":"2026-08-08T14:36:36.566504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.08933","last_updated":"2021-03-16T09:31:04Z","snapshot_observed_at":"2026-08-09T09:47:57.713516Z","submitted_at":"2021-03-16T09:31:04Z","title":"Reweighting Augmented Samples by Minimizing the Maximal Expected Loss","version":1},"cited_work":{"arxiv_id":"2103.08933","doi":null,"metadata_source":"pith","pith_arxiv_id":"2103.08933","snapshot_observed_at":"2026-08-08T14:36:36.748642Z","title":"Reweighting Augmented Samples by Minimizing the Maximal Expected Loss","venue":"cs.LG","work_id":"5d6db84d-462a-4d67-906d-bbe4b96e4351","year":2021},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-09T06:26:06.352592Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.571036Z"},"links":{"cited_paper":"/paper/2103.08933","citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:4d5f6c4ea2e66275d478fc32fffc46bc671d99997c0a79b933bc456e9a5cea64","observation_id":"292adc5b-079c-420b-9b21-1ad503d3cbc8","resolution":{"observed_at":"2026-08-08T14:36:36.755381Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:36:37.094750Z","title":"Are adversarial examples created equal? a learnable weighted minimax risk for robustness under non-uniform attacks","venue":null,"work_id":"99b5a324-09df-463d-8b18-45ebc11f8221","year":2021},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-09T06:26:06.352592Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.576280Z"},"links":{"citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:406e51d48c427a47903cab22ed2bb46692351829f057d31c91fd9c7ca215a8d4","observation_id":"0d86ab4b-182f-4ed0-b62d-bbcbe860286c","resolution":{"observed_at":"2026-08-08T14:36:37.100186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.01736","last_updated":"2021-05-31T02:49:55Z","snapshot_observed_at":"2026-07-06T10:01:23.472948Z","submitted_at":"2020-10-05T01:33:11Z","title":"Geometry-aware Instance-reweighted Adversarial Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.01736","snapshot_observed_at":"2026-08-08T14:36:36.580744Z","title":"Geometry-aware instance-reweighted adversarial training","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-09T06:26:06.352592Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.580744Z"},"links":{"cited_paper":"/paper/2010.01736","citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:7fdaa399d070843bda0a2a97fc2f709e9384fa5973a51eb7f3492db5202658e6","observation_id":"a5493920-4563-4eb5-95f9-ec3f4c696e37","resolution":{"observed_at":"2026-08-08T14:36:36.580744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:36:36.585174Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-09T06:26:06.352592Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.585174Z"},"links":{"citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:0c821d379d6a710f433f6e314f95b7b773d3535e5f28bb112594151a443ca8d5","observation_id":"2b7bc779-e2e8-42af-8d5c-9d3a65f6e1c7","resolution":{"observed_at":"2026-08-08T14:36:36.585174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:36:36.590108Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-09T06:26:06.352592Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.590108Z"},"links":{"citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:ab276d5672b44c123d63ddce47d1e930def6e0d4781dfd6eeb4186774cade174","observation_id":"0b37c6c4-73d3-4613-b482-42a83b623b7c","resolution":{"observed_at":"2026-08-08T14:36:36.590108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:36:36.594376Z","title":"誁ڞYBq0 w @ \\˂bF 3`^) f ` WޏTb]tQ Z Ы;]2Zj8ݐlW c kX֏'y S! QfĊ GYs) W 4 P0,Or (W ; )C NƢ). ; W `m GN 徐ݏիhF ސWW xu3ur]!54#VO=? ±* ^p rx ]K f hFIf QY b g+ <mcOt3Gܘ tX","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-09T06:26:06.352592Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-08T14:36:36.594376Z"},"links":{"citing_paper":"/paper/2502.06733"},"observation_digest":"sha256:f06c7d440ca91aeab467b520ec02a65d28f2697a98bd582352df07062feab3fd","observation_id":"fecb48e0-38df-4660-bc77-e3154feb128c","resolution":{"observed_at":"2026-08-08T14:36:36.594376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T06:26:06.352592Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining"},"reference_resolution":{"displayed":48,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":4,"verified_fuzzy":13},"total_outbound_references":48},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 48 of 48 outbound references and 1 inbound Pith citation observation for arXiv:2502.06733."}