{"as_of":"2026-08-18T22:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3aab2c659e36d62b81eb85cb891325f5afe9d0c39efb74d7f7424be36ce4cd78","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:07:15.189614Z","state":"measured"},{"denominator":64,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":64,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T12:45:04.789254Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T16:48:39.391752Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.16511","last_updated":"2025-04-26T00:13:08Z","snapshot_observed_at":"2026-08-18T12:10:39.603526Z","submitted_at":"2025-04-23T08:36:50Z","title":"QuaDMix: Quality-Diversity Balanced Data Selection for Efficient LLM Pretraining","version":2},"cited_work":{"arxiv_id":"2504.16511","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.16511","snapshot_observed_at":"2026-07-03T16:48:39.391752Z","title":"Quadmix: Quality- diversity balanced data selection for efficient llm pretraining","venue":null,"work_id":"281ee593-55a6-4abe-92a7-f73b0b1be16e","year":2025},"citing_paper":{"arxiv_id":"2604.16380","last_updated":"2026-03-25T13:30:40Z","snapshot_observed_at":"2026-08-15T22:16:01.152280Z","submitted_at":"2026-03-25T13:30:40Z","title":"Data Mixing for Large Language Models Pretraining: A Survey and Outlook","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-15T00:56:04.958757Z"},"links":{"cited_paper":"/paper/2504.16511","citing_paper":"/paper/2604.16380"},"observation_digest":"sha256:54d74b3f429c6a176fc6286cdf2c1f97ec3fd4608e61b4024642919cd5f350f2","observation_id":"3b319f6d-5ca3-4aa1-897a-89221e9f7c32","resolution":{"observed_at":"2026-05-15T00:58:25.666412Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16511","last_updated":"2025-04-26T00:13:08Z","snapshot_observed_at":"2026-08-18T12:10:39.603526Z","submitted_at":"2025-04-23T08:36:50Z","title":"QuaDMix: Quality-Diversity Balanced Data Selection for Efficient LLM Pretraining","version":2},"cited_work":{"arxiv_id":"2504.16511","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.16511","snapshot_observed_at":"2026-07-03T16:48:39.391752Z","title":"Quadmix: Quality- diversity balanced data selection for efficient llm pretraining","venue":null,"work_id":"281ee593-55a6-4abe-92a7-f73b0b1be16e","year":2025},"citing_paper":{"arxiv_id":"2605.02364","last_updated":"2026-05-04T09:07:54Z","snapshot_observed_at":"2026-08-17T17:54:48.124462Z","submitted_at":"2026-05-04T09:07:54Z","title":"InfoLaw: Information Scaling Laws for Large Language Models with Quality-Weighted Mixture Data and Repetition","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-08T18:45:52.380042Z"},"links":{"cited_paper":"/paper/2504.16511","citing_paper":"/paper/2605.02364"},"observation_digest":"sha256:8ed463be253d1576a0619fbcfd56ffdb17cdd3cb21ac8908d4d9de9e184f2665","observation_id":"810dd919-b834-4c7b-aa5e-a33660d5f189","resolution":{"observed_at":"2026-05-09T06:15:37.219533Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16511","last_updated":"2025-04-26T00:13:08Z","snapshot_observed_at":"2026-08-18T12:10:39.603526Z","submitted_at":"2025-04-23T08:36:50Z","title":"QuaDMix: Quality-Diversity Balanced Data Selection for Efficient LLM Pretraining","version":2},"cited_work":{"arxiv_id":"2504.16511","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.16511","snapshot_observed_at":"2026-07-03T16:48:39.391752Z","title":"Quadmix: Quality- diversity balanced data selection for efficient llm pretraining","venue":null,"work_id":"281ee593-55a6-4abe-92a7-f73b0b1be16e","year":2025},"citing_paper":{"arxiv_id":"2607.02266","last_updated":"2026-07-02T14:51:42Z","snapshot_observed_at":"2026-08-08T15:31:37.930459Z","submitted_at":"2026-07-02T14:51:42Z","title":"HERMES: A Multi-Granularity Labeling Substrate for Pre-training Data Mixtures","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-07-03T16:44:41.720388Z"},"links":{"cited_paper":"/paper/2504.16511","citing_paper":"/paper/2607.02266"},"observation_digest":"sha256:4bc0850c9de82698f4ecc1450f1bd36effb985d9ad1682d92ef2aecced170a38","observation_id":"d5e2a428-68bd-4552-ac55-1b37d70192f8","resolution":{"observed_at":"2026-07-03T16:48:39.393155Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16511","last_updated":"2025-04-26T00:13:08Z","snapshot_observed_at":"2026-08-18T12:10:39.603526Z","submitted_at":"2025-04-23T08:36:50Z","title":"QuaDMix: Quality-Diversity Balanced Data Selection for Efficient LLM Pretraining","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16511","snapshot_observed_at":"2026-07-31T12:45:04.789254Z","title":"Quadmix: Quality-diversity balanced data selection for efficient llm pretraining","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24516","last_updated":"2026-07-27T14:55:04Z","snapshot_observed_at":"2026-08-17T21:36:07.601267Z","submitted_at":"2026-07-27T14:55:04Z","title":"DecoupleMix: Decoupled Ratio Search and Convex Allocation for Scalable VLM Data Recipes","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-31T12:45:04.789254Z"},"links":{"cited_paper":"/paper/2504.16511","citing_paper":"/paper/2607.24516"},"observation_digest":"sha256:563801093493af582cb5b787c802091da3ba774e066c1d280c1e30eaab42582c","observation_id":"85ef347f-29e8-45c7-84c1-9e86482d7926","resolution":{"observed_at":"2026-07-31T12:45:04.789254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2504.16511/citation-record","integrity":"/paper/2504.16511/integrity","json":"/paper/2504.16511/citation-record.json","paper":"/paper/2504.16511"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-08-06T15:07:40.203199Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.09540","snapshot_observed_at":"2026-08-16T11:07:14.934745Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16511","last_updated":"2025-04-26T00:13:08Z","snapshot_observed_at":"2026-08-18T12:10:39.603526Z","submitted_at":"2025-04-23T08:36:50Z","title":"QuaDMix: Quality-Diversity Balanced Data Selection for Efficient LLM Pretraining","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-16T11:07:14.934745Z"},"links":{"cited_paper":"/paper/2303.09540","citing_paper":"/paper/2504.16511"},"observation_digest":"sha256:9596b0fb69b3a34919e34b273701194cb6467dd22f8c5d785d9b14831c84d674","observation_id":"18113be9-a352-4253-9da4-c406b66c7660","resolution":{"observed_at":"2026-08-16T11:07:14.934745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08102","last_updated":"2025-06-08T17:32:07Z","snapshot_observed_at":"2026-08-16T13:10:37.721767Z","submitted_at":"2024-10-10T16:45:28Z","title":"Efficient Pretraining Data Selection for Language Models via Multi-Actor Collaboration","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08102","snapshot_observed_at":"2026-08-16T11:07:14.940766Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16511","last_updated":"2025-04-26T00:13:08Z","snapshot_observed_at":"2026-08-18T12:10:39.603526Z","submitted_at":"2025-04-23T08:36:50Z","title":"QuaDMix: Quality-Diversity Balanced Data Selection for Efficient LLM Pretraining","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-16T11:07:14.940766Z"},"links":{"cited_paper":"/paper/2410.08102","citing_paper":"/paper/2504.16511"},"observation_digest":"sha256:c8e8ba2d9a084a879a36408fa104149d41e657e320fb96bff6b0be615ab2faf2","observation_id":"53644dcf-6db3-41ef-899c-d7d36e6b8c89","resolution":{"observed_at":"2026-08-16T11:07:14.940766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:07:14.944819Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.16511","last_updated":"2025-04-26T00:13:08Z","snapshot_observed_at":"2026-08-18T12:10:39.603526Z","submitted_at":"2025-04-23T08:36:50Z","title":"QuaDMix: Quality-Diversity Balanced Data Selection for Efficient LLM Pretraining","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-16T11:07:14.944819Z"},"links":{"citing_paper":"/paper/2504.16511"},"observation_digest":"sha256:f7752726f5de383841cc7d88f88b4e249f62869740af26caee0228d89fc9d986","observation_id":"dd1a1174-8a4a-4701-b098-4f978042910f","resolution":{"observed_at":"2026-08-16T11:07:14.944819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:07:15.962566Z","title":null,"venue":null,"work_id":"c069fed6-ca5a-401a-bcb8-db1d929b946b","year":2020},"citing_paper":{"arxiv_id":"2504.16511","last_updated":"2025-04-26T00:13:08Z","snapshot_observed_at":"2026-08-18T12:10:39.603526Z","submitted_at":"2025-04-23T08:36:50Z","title":"QuaDMix: Quality-Diversity Balanced Data Selection for Efficient LLM Pretraining","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-16T11:07:14.948776Z"},"links":{"citing_paper":"/paper/2504.16511"},"observation_digest":"sha256:d1fd409bd6d91e95b6c4f0a0b3258579aab57b0f71144d14ce6ee4bed71c6293","observation_id":"c103f5ec-1966-4a95-8bed-7a6ff0ab299b","resolution":{"observed_at":"2026-08-16T11:07:15.967105Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:07:14.952639Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16511","last_updated":"2025-04-26T00:13:08Z","snapshot_observed_at":"2026-08-18T12:10:39.603526Z","submitted_at":"2025-04-23T08:36:50Z","title":"QuaDMix: Quality-Diversity Balanced Data Selection for Efficient LLM Pretraining","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-16T11:07:14.952639Z"},"links":{"citing_paper":"/paper/2504.16511"},"observation_digest":"sha256:e5e361c7f41aa838bd6b2b2cd21d78f0938d6bf6635e7a38bc74d5c6afd20802","observation_id":"1e1db54a-4db0-466e-b923-a2b370876a0f","resolution":{"observed_at":"2026-08-16T11:07:14.952639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:07:15.949433Z","title":null,"venue":null,"work_id":"dca6a08a-ed59-4553-ac24-12466e1bad3d","year":2023},"citing_paper":{"arxiv_id":"2504.16511","last_updated":"2025-04-26T00:13:08Z","snapshot_observed_at":"2026-08-18T12:10:39.603526Z","submitted_at":"2025-04-23T08:36:50Z","title":"QuaDMix: Quality-Diversity Balanced Data Selection for Efficient LLM Pretraining","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-16T11:07:14.956467Z"},"links":{"citing_paper":"/paper/2504.16511"},"observation_digest":"sha256:a375d853c3e391f922ef1f6934bbc900efcf9e5338f08e887f7f6b0eee9d95c1","observation_id":"aa13d2ec-4e9f-47a3-ac44-1abcd9e1b42c","resolution":{"observed_at":"2026-08-16T11:07:15.953433Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-08-14T19:36:07.505691Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-16T11:07:14.960502Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.16511","last_updated":"2025-04-26T00:13:08Z","snapshot_observed_at":"2026-08-18T12:10:39.603526Z","submitted_at":"2025-04-23T08:36:50Z","title":"QuaDMix: Quality-Diversity Balanced Data Selection for Efficient LLM Pretraining","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-16T11:07:14.960502Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2504.16511"},"observation_digest":"sha256:ed48e5f04a259782f06753b6999beccec39e6f6a3536d102178114a930ffcf3e","observation_id":"515475fb-f3ad-4856-8fe4-984fa26bf65a","resolution":{"observed_at":"2026-08-16T11:07:14.960502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:07:15.937053Z","title":null,"venue":null,"work_id":"e75c300c-9198-413b-9874-a361ce7a86ab","year":1996},"citing_paper":{"arxiv_id":"2504.16511","last_updated":"2025-04-26T00:13:08Z","snapshot_observed_at":"2026-08-18T12:10:39.603526Z","submitted_at":"2025-04-23T08:36:50Z","title":"QuaDMix: Quality-Diversity Balanced Data Selection for Efficient LLM Pretraining","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-16T11:07:14.964421Z"},"links":{"citing_paper":"/paper/2504.16511"},"observation_digest":"sha256:ba294d5133a7850077417c4ba8b217b6096d024c6fa021b9a938de79e72d9b7f","observation_id":"06875fb2-614c-4730-8895-81964ac991dc","resolution":{"observed_at":"2026-08-16T11:07:15.941015Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:07:15.924964Z","title":null,"venue":null,"work_id":"2b046fb1-5313-440b-bb1d-210adee5759d","year":2022},"citing_paper":{"arxiv_id":"2504.16511","last_updated":"2025-04-26T00:13:08Z","snapshot_observed_at":"2026-08-18T12:10:39.603526Z","submitted_at":"2025-04-23T08:36:50Z","title":"QuaDMix: Quality-Diversity Balanced Data Selection for Efficient LLM Pretraining","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-16T11:07:14.968271Z"},"links":{"citing_paper":"/paper/2504.16511"},"observation_digest":"sha256:58c37b1713cf4346e5aed6d95d364d5481a65c23b0b41e5bc15b381cbf4fd1fd","observation_id":"7a6747e1-5539-4034-a383-98d4183db7cb","resolution":{"observed_at":"2026-08-16T11:07:15.928837Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.15393","last_updated":"2024-02-05T16:33:05Z","snapshot_observed_at":"2026-08-18T19:03:41.103305Z","submitted_at":"2023-10-23T22:51:58Z","title":"DoGE: Domain Reweighting with Generalization Estimation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.15393","snapshot_observed_at":"2026-08-16T11:07:14.972335Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16511","last_updated":"2025-04-26T00:13:08Z","snapshot_observed_at":"2026-08-18T12:10:39.603526Z","submitted_at":"2025-04-23T08:36:50Z","title":"QuaDMix: Quality-Diversity Balanced Data Selection for Efficient LLM Pretraining","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-16T11:07:14.972335Z"},"links":{"cited_paper":"/paper/2310.15393","citing_paper":"/paper/2504.16511"},"observation_digest":"sha256:0d9ef7480066063b815a524d9b88ebf5ec5eaa2f4255418a40387eb036c11347","observation_id":"bae800b3-9f38-430d-ab30-627b501f6c1c","resolution":{"observed_at":"2026-08-16T11:07:14.972335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00027","last_updated":"2020-12-31T19:00:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-12-31T19:00:10Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00027","snapshot_observed_at":"2026-08-16T11:07:14.977220Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.16511","last_updated":"2025-04-26T00:13:08Z","snapshot_observed_at":"2026-08-18T12:10:39.603526Z","submitted_at":"2025-04-23T08:36:50Z","title":"QuaDMix: Quality-Diversity Balanced Data Selection for Efficient LLM Pretraining","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-16T11:07:14.977220Z"},"links":{"cited_paper":"/paper/2101.00027","citing_paper":"/paper/2504.16511"},"observation_digest":"sha256:304ab501f29797d9ee56e6fe972626c799e3a0a4aa46fc16a2dc3dc5080bf1be","observation_id":"c583bee2-491e-476f-9152-7a08cf2b7f65","resolution":{"observed_at":"2026-08-16T11:07:14.977220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:07:14.981495Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16511","last_updated":"2025-04-26T00:13:08Z","snapshot_observed_at":"2026-08-18T12:10:39.603526Z","submitted_at":"2025-04-23T08:36:50Z","title":"QuaDMix: Quality-Diversity Balanced Data Selection for Efficient LLM Pretraining","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-16T11:07:14.981495Z"},"links":{"citing_paper":"/paper/2504.16511"},"observation_digest":"sha256:d9a009c4a2a96af3fc31cd31a35f12e32e0c6f4340307da6c2a4854095592dcd","observation_id":"1d5d5b1a-3581-45e5-8fd2-dffb1a53d0ef","resolution":{"observed_at":"2026-08-16T11:07:14.981495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14908","last_updated":"2025-01-27T11:25:33Z","snapshot_observed_at":"2026-08-16T13:50:17.452704Z","submitted_at":"2024-05-23T09:44:02Z","title":"BiMix: A Bivariate Data Mixing Law for Language Model Pretraining","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14908","snapshot_observed_at":"2026-08-16T11:07:14.985726Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16511","last_updated":"2025-04-26T00:13:08Z","snapshot_observed_at":"2026-08-18T12:10:39.603526Z","submitted_at":"2025-04-23T08:36:50Z","title":"QuaDMix: Quality-Diversity Balanced Data Selection for Efficient LLM Pretraining","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-16T11:07:14.985726Z"},"links":{"cited_paper":"/paper/2405.14908","citing_paper":"/paper/2504.16511"},"observation_digest":"sha256:aa6cdf21e9ab8916b8f7dd8a7a594232ac7ba6878ffa4f4d18b7fe6083a2ba59","observation_id":"42191d73-36c5-46a2-8906-9bdf5902a81a","resolution":{"observed_at":"2026-08-16T11:07:14.985726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07064","last_updated":"2025-03-18T23:52:27Z","snapshot_observed_at":"2026-08-16T13:11:01.188537Z","submitted_at":"2024-10-09T17:06:57Z","title":"Data Selection via Optimal Control for Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07064","snapshot_observed_at":"2026-08-16T11:07:14.990281Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16511","last_updated":"2025-04-26T00:13:08Z","snapshot_observed_at":"2026-08-18T12:10:39.603526Z","submitted_at":"2025-04-23T08:36:50Z","title":"QuaDMix: Quality-Diversity Balanced Data Selection for Efficient LLM Pretraining","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-16T11:07:14.990281Z"},"links":{"cited_paper":"/paper/2410.07064","citing_paper":"/paper/2504.16511"},"observation_digest":"sha256:3f2318733af1bbcc27293def30c8c6f2f91d74593892c2e6b04d69350bf2cd50","observation_id":"8585257c-2f0b-41ba-950e-62b43148ab2f","resolution":{"observed_at":"2026-08-16T11:07:14.990281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11644","last_updated":"2023-10-02T06:12:30Z","snapshot_observed_at":"2026-08-13T11:19:55.436754Z","submitted_at":"2023-06-20T16:14:25Z","title":"Textbooks Are All You Need","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.11644","snapshot_observed_at":"2026-08-16T11:07:14.994688Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16511","last_updated":"2025-04-26T00:13:08Z","snapshot_observed_at":"2026-08-18T12:10:39.603526Z","submitted_at":"2025-04-23T08:36:50Z","title":"QuaDMix: Quality-Diversity Balanced Data Selection for Efficient LLM Pretraining","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-16T11:07:14.994688Z"},"links":{"cited_paper":"/paper/2306.11644","citing_paper":"/paper/2504.16511"},"observation_digest":"sha256:3c095966d2d848e5279366008fc03fdc22c01c9b14f2d9725fdd58d748e1a97f","observation_id":"0a251fb5-b23d-4742-af69-7a37871175d0","resolution":{"observed_at":"2026-08-16T11:07:14.994688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09543","last_updated":"2023-03-24T09:17:17Z","snapshot_observed_at":"2026-08-16T03:03:21.512563Z","submitted_at":"2021-11-18T06:48:00Z","title":"DeBERTaV3: Improving DeBERTa using ELECTRA-Style Pre-Training with Gradient-Disentangled Embedding Sharing","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09543","snapshot_observed_at":"2026-08-16T11:07:14.998885Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16511","last_updated":"2025-04-26T00:13:08Z","snapshot_observed_at":"2026-08-18T12:10:39.603526Z","submitted_at":"2025-04-23T08:36:50Z","title":"QuaDMix: Quality-Diversity Balanced Data Selection for Efficient LLM Pretraining","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-16T11:07:14.998885Z"},"links":{"cited_paper":"/paper/2111.09543","citing_paper":"/paper/2504.16511"},"observation_digest":"sha256:eb5484f4b7258b996075f06b7affd7e298dce93f671409acd9413a98d12dc91f","observation_id":"518af1e8-c7d3-49df-ae7b-fd6a8a23fd38","resolution":{"observed_at":"2026-08-16T11:07:14.998885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:07:15.003738Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.16511","last_updated":"2025-04-26T00:13:08Z","snapshot_observed_at":"2026-08-18T12:10:39.603526Z","submitted_at":"2025-04-23T08:36:50Z","title":"QuaDMix: Quality-Diversity Balanced Data Selection for Efficient LLM Pretraining","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-16T11:07:15.003738Z"},"links":{"citing_paper":"/paper/2504.16511"},"observation_digest":"sha256:5c59500e834f47201bad91c1bba66a383de58a4b25e50caf78ea60fd0e3cd7d5","observation_id":"227da26c-ee52-41ce-8369-8c4e13b754e3","resolution":{"observed_at":"2026-08-16T11:07:15.003738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.10487","last_updated":"2022-05-21T02:14:27Z","snapshot_observed_at":"2026-08-04T13:21:32.121470Z","submitted_at":"2022-05-21T02:14:27Z","title":"Scaling Laws and Interpretability of Learning from Repeated Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.10487","snapshot_observed_at":"2026-08-16T11:07:15.010383Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.16511","last_updated":"2025-04-26T00:13:08Z","snapshot_observed_at":"2026-08-18T12:10:39.603526Z","submitted_at":"2025-04-23T08:36:50Z","title":"QuaDMix: Quality-Diversity Balanced Data Selection for Efficient LLM Pretraining","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-16T11:07:15.010383Z"},"links":{"cited_paper":"/paper/2205.10487","citing_paper":"/paper/2504.16511"},"observation_digest":"sha256:5a0f0f0822b63fa03974613d9c92b2ccd5780296fb5d8421055a4e94cd4713e3","observation_id":"0d3be270-f7a4-4350-b558-1049e5ea7fa5","resolution":{"observed_at":"2026-08-16T11:07:15.010383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:07:15.016235Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.16511","last_updated":"2025-04-26T00:13:08Z","snapshot_observed_at":"2026-08-18T12:10:39.603526Z","submitted_at":"2025-04-23T08:36:50Z","title":"QuaDMix: Quality-Diversity Balanced Data Selection for Efficient LLM Pretraining","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-16T11:07:15.016235Z"},"links":{"citing_paper":"/paper/2504.16511"},"observation_digest":"sha256:6432f240fca3f7b7c6c9aa6e3ad822aa97ad95a46b937d3fca21182d21d3106c","observation_id":"a38c3afa-f65d-414d-8415-9a5ff70e89f1","resolution":{"observed_at":"2026-08-16T11:07:15.016235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:07:15.897045Z","title":"https://github.com/NVIDIA/NeMo-Curator NeMo-Curator: a toolkit for data curation","venue":null,"work_id":"7120d0c3-7108-4c2d-a523-c94e02c96dbf","year":null},"citing_paper":{"arxiv_id":"2504.16511","last_updated":"2025-04-26T00:13:08Z","snapshot_observed_at":"2026-08-18T12:10:39.603526Z","submitted_at":"2025-04-23T08:36:50Z","title":"QuaDMix: Quality-Diversity Balanced Data Selection for Efficient LLM Pretraining","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-16T11:07:15.022367Z"},"links":{"citing_paper":"/paper/2504.16511"},"observation_digest":"sha256:5c1fd64a2a828ad46cef163b02078342d404b73f0cbcbbc5aef33cb3e9ebbdc6","observation_id":"3231b085-952b-4924-aa80-c1960fa82af7","resolution":{"observed_at":"2026-08-16T11:07:15.901942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:07:15.029060Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.16511","last_updated":"2025-04-26T00:13:08Z","snapshot_observed_at":"2026-08-18T12:10:39.603526Z","submitted_at":"2025-04-23T08:36:50Z","title":"QuaDMix: Quality-Diversity Balanced Data Selection for Efficient LLM Pretraining","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-16T11:07:15.029060Z"},"links":{"citing_paper":"/paper/2504.16511"},"observation_digest":"sha256:f98a2c64d1c2a976008b894336fd21808d12a5273b4a5015848388c4f70bc557","observation_id":"ac0648ef-c5bb-4f6a-80da-a611b2dd5e38","resolution":{"observed_at":"2026-08-16T11:07:15.029060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:07:15.033350Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16511","last_updated":"2025-04-26T00:13:08Z","snapshot_observed_at":"2026-08-18T12:10:39.603526Z","submitted_at":"2025-04-23T08:36:50Z","title":"QuaDMix: Quality-Diversity Balanced Data Selection for Efficient LLM Pretraining","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-16T11:07:15.033350Z"},"links":{"citing_paper":"/paper/2504.16511"},"observation_digest":"sha256:09ad5ee8a33565762baaeb70433e716c5871946e4c456ebc560d0117a436ae52","observation_id":"06748844-227f-4e56-a1d0-fd44982a70e9","resolution":{"observed_at":"2026-08-16T11:07:15.033350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-16T11:07:15.038483Z","title":"Brown, Benjamin Chess, Rewon Child, Scott Gray, Alec Radford, Jeffrey Wu, and Dario Amodei","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.16511","last_updated":"2025-04-26T00:13:08Z","snapshot_observed_at":"2026-08-18T12:10:39.603526Z","submitted_at":"2025-04-23T08:36:50Z","title":"QuaDMix: Quality-Diversity Balanced Data Selection for Efficient LLM Pretraining","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-16T11:07:15.038483Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2504.16511"},"observation_digest":"sha256:2e935da801cd03772ce762a9cba1862e8054200082ef415d32b5eb15eaa96347","observation_id":"592da973-b2d3-4b95-bf78-42c75d0fc2ed","resolution":{"observed_at":"2026-08-16T11:07:15.038483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:07:15.883733Z","title":null,"venue":null,"work_id":"00df5076-f30f-43c5-a1ae-6d7103d3e4fd","year":2017},"citing_paper":{"arxiv_id":"2504.16511","last_updated":"2025-04-26T00:13:08Z","snapshot_observed_at":"2026-08-18T12:10:39.603526Z","submitted_at":"2025-04-23T08:36:50Z","title":"QuaDMix: Quality-Diversity Balanced Data Selection for Efficient LLM Pretraining","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-16T11:07:15.042655Z"},"links":{"citing_paper":"/paper/2504.16511"},"observation_digest":"sha256:b63214827b1a570aacf96e0f5e6a6e25f15f352fbfe208697a937309db29f4e0","observation_id":"b04539dc-8965-430e-a645-5af2e8867a3c","resolution":{"observed_at":"2026-08-16T11:07:15.887730Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:07:15.046668Z","title":"Dai, Jakob Uszkoreit, Quoc Le, and Slav Petrov","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.16511","last_updated":"2025-04-26T00:13:08Z","snapshot_observed_at":"2026-08-18T12:10:39.603526Z","submitted_at":"2025-04-23T08:36:50Z","title":"QuaDMix: Quality-Diversity Balanced Data Selection for Efficient LLM Pretraining","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-16T11:07:15.046668Z"},"links":{"citing_paper":"/paper/2504.16511"},"observation_digest":"sha256:8a52b5bed370a1e339cadc01296b39edf51ec4aa2b1ec9051748b5a62b017a04","observation_id":"cb01819a-2dc8-4315-a467-5448f2036b0a","resolution":{"observed_at":"2026-08-16T11:07:15.046668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:07:15.871805Z","title":null,"venue":null,"work_id":"c583eaf2-f8ed-4c8d-930f-4b977a13c94b","year":2022},"citing_paper":{"arxiv_id":"2504.16511","last_updated":"2025-04-26T00:13:08Z","snapshot_observed_at":"2026-08-18T12:10:39.603526Z","submitted_at":"2025-04-23T08:36:50Z","title":"QuaDMix: Quality-Diversity Balanced Data Selection for Efficient LLM Pretraining","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-16T11:07:15.050955Z"},"links":{"citing_paper":"/paper/2504.16511"},"observation_digest":"sha256:eeefc08c49892898d71d62e8d136415eff1654ce64269343a5b35c386aa013b2","observation_id":"3d59d27a-d9f5-42a6-b07e-a98c20968b30","resolution":{"observed_at":"2026-08-16T11:07:15.875861Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:07:15.055003Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.16511","last_updated":"2025-04-26T00:13:08Z","snapshot_observed_at":"2026-08-18T12:10:39.603526Z","submitted_at":"2025-04-23T08:36:50Z","title":"QuaDMix: Quality-Diversity Balanced Data Selection for Efficient LLM Pretraining","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-16T11:07:15.055003Z"},"links":{"citing_paper":"/paper/2504.16511"},"observation_digest":"sha256:c1e3351e219f5675fe3fa26f570d09dc2f1ad6223c11090eaa041896a3369ea1","observation_id":"959392f4-954d-4c79-a6ee-f94b664e779e","resolution":{"observed_at":"2026-08-16T11:07:15.055003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11794","last_updated":"2025-04-21T17:48:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-17T17:42:57Z","title":"DataComp-LM: In search of the next generation of training sets for language models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11794","snapshot_observed_at":"2026-08-16T11:07:15.058757Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16511","last_updated":"2025-04-26T00:13:08Z","snapshot_observed_at":"2026-08-18T12:10:39.603526Z","submitted_at":"2025-04-23T08:36:50Z","title":"QuaDMix: Quality-Diversity Balanced Data Selection for Efficient LLM Pretraining","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-16T11:07:15.058757Z"},"links":{"cited_paper":"/paper/2406.11794","citing_paper":"/paper/2504.16511"},"observation_digest":"sha256:372ebd476fbd2f94750837b607049d2aa523d5615bcaa991fa16b8d685c0950d","observation_id":"efba8946-9f2d-4e4d-bd65-2eb3c2c7a607","resolution":{"observed_at":"2026-08-16T11:07:15.058757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07965","last_updated":"2025-01-08T09:07:54Z","snapshot_observed_at":"2026-08-16T14:01:38.852778Z","submitted_at":"2024-04-11T17:52:01Z","title":"Rho-1: Not All Tokens Are What You Need","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07965","snapshot_observed_at":"2026-08-16T11:07:15.062662Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.16511","last_updated":"2025-04-26T00:13:08Z","snapshot_observed_at":"2026-08-18T12:10:39.603526Z","submitted_at":"2025-04-23T08:36:50Z","title":"QuaDMix: Quality-Diversity Balanced Data Selection for Efficient LLM Pretraining","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-16T11:07:15.062662Z"},"links":{"cited_paper":"/paper/2404.07965","citing_paper":"/paper/2504.16511"},"observation_digest":"sha256:204a121013174fccb12c70badb93c02e3044e43a889abdbc47d30dfa653c015d","observation_id":"f9b0a59f-8084-49cc-b4c9-555bdd345cc8","resolution":{"observed_at":"2026-08-16T11:07:15.062662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01492","last_updated":"2025-01-23T17:35:43Z","snapshot_observed_at":"2026-08-18T18:58:59.065205Z","submitted_at":"2024-07-01T17:31:03Z","title":"RegMix: Data Mixture as Regression for Language Model Pre-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01492","snapshot_observed_at":"2026-08-16T11:07:15.066525Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16511","last_updated":"2025-04-26T00:13:08Z","snapshot_observed_at":"2026-08-18T12:10:39.603526Z","submitted_at":"2025-04-23T08:36:50Z","title":"QuaDMix: Quality-Diversity Balanced Data Selection for Efficient LLM Pretraining","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-16T11:07:15.066525Z"},"links":{"cited_paper":"/paper/2407.01492","citing_paper":"/paper/2504.16511"},"observation_digest":"sha256:8d9b5df5a10b8a674d98857b707cb168599d5265855af23f4468bc703fdb4567","observation_id":"e9ea5e23-6343-4879-8bd5-5bdcc4785d38","resolution":{"observed_at":"2026-08-16T11:07:15.066525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:07:15.070570Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16511","last_updated":"2025-04-26T00:13:08Z","snapshot_observed_at":"2026-08-18T12:10:39.603526Z","submitted_at":"2025-04-23T08:36:50Z","title":"QuaDMix: Quality-Diversity Balanced Data Selection for Efficient LLM Pretraining","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-16T11:07:15.070570Z"},"links":{"citing_paper":"/paper/2504.16511"},"observation_digest":"sha256:b3a2755bdb5127d8d1de1c18308b397d86237e7baa46aa2f714e2bc5900fe201","observation_id":"9d106167-c249-4804-8958-b8d32deb7558","resolution":{"observed_at":"2026-08-16T11:07:15.070570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.04564","last_updated":"2023-09-08T19:34:05Z","snapshot_observed_at":"2026-08-16T15:02:10.343729Z","submitted_at":"2023-09-08T19:34:05Z","title":"When Less is More: Investigating Data Pruning for Pretraining LLMs at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.04564","snapshot_observed_at":"2026-08-16T11:07:15.074219Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16511","last_updated":"2025-04-26T00:13:08Z","snapshot_observed_at":"2026-08-18T12:10:39.603526Z","submitted_at":"2025-04-23T08:36:50Z","title":"QuaDMix: Quality-Diversity Balanced Data Selection for Efficient LLM Pretraining","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-16T11:07:15.074219Z"},"links":{"cited_paper":"/paper/2309.04564","citing_paper":"/paper/2504.16511"},"observation_digest":"sha256:f72e9c7c074228c920f62d19cabda5308b7673f34e48f87b1415cd573d571ac4","observation_id":"21c594f9-ba2a-48e2-9a20-609bda0ae654","resolution":{"observed_at":"2026-08-16T11:07:15.074219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:07:15.078021Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.16511","last_updated":"2025-04-26T00:13:08Z","snapshot_observed_at":"2026-08-18T12:10:39.603526Z","submitted_at":"2025-04-23T08:36:50Z","title":"QuaDMix: Quality-Diversity Balanced Data Selection for Efficient LLM Pretraining","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-16T11:07:15.078021Z"},"links":{"citing_paper":"/paper/2504.16511"},"observation_digest":"sha256:aec2d1d5160f44dea165620cff88fd340b43fbf90cabd93e9a17fc658a319e60","observation_id":"a44a1ece-457f-469a-adf6-0c6392be2950","resolution":{"observed_at":"2026-08-16T11:07:15.078021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:07:15.859665Z","title":null,"venue":null,"work_id":"6181d0c5-d0e6-4c7e-a9b1-9cf4c3ea0696","year":2023},"citing_paper":{"arxiv_id":"2504.16511","last_updated":"2025-04-26T00:13:08Z","snapshot_observed_at":"2026-08-18T12:10:39.603526Z","submitted_at":"2025-04-23T08:36:50Z","title":"QuaDMix: Quality-Diversity Balanced Data Selection for Efficient LLM Pretraining","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-16T11:07:15.081989Z"},"links":{"citing_paper":"/paper/2504.16511"},"observation_digest":"sha256:aaab605dc0798d38fcd3341740f51c7dd8d7206e0f01d5d0c870f7cbc0e81cec","observation_id":"2c218b1e-e5ef-42d6-80de-ffed2865bc0f","resolution":{"observed_at":"2026-08-16T11:07:15.863865Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:07:15.085887Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.16511","last_updated":"2025-04-26T00:13:08Z","snapshot_observed_at":"2026-08-18T12:10:39.603526Z","submitted_at":"2025-04-23T08:36:50Z","title":"QuaDMix: Quality-Diversity Balanced Data Selection for Efficient LLM Pretraining","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-16T11:07:15.085887Z"},"links":{"citing_paper":"/paper/2504.16511"},"observation_digest":"sha256:997a9b25c9f8583a88bbb6a7693bb7e697423f22906b4caa674621ff7f96b517","observation_id":"8144be20-d2cb-42a5-8b67-3851fdd051bb","resolution":{"observed_at":"2026-08-16T11:07:15.085887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17557","last_updated":"2024-10-31T11:37:49Z","snapshot_observed_at":"2026-08-14T14:43:02.130172Z","submitted_at":"2024-06-25T13:50:56Z","title":"The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17557","snapshot_observed_at":"2026-08-16T11:07:15.094718Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16511","last_updated":"2025-04-26T00:13:08Z","snapshot_observed_at":"2026-08-18T12:10:39.603526Z","submitted_at":"2025-04-23T08:36:50Z","title":"QuaDMix: Quality-Diversity Balanced Data Selection for Efficient LLM Pretraining","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-16T11:07:15.094718Z"},"links":{"cited_paper":"/paper/2406.17557","citing_paper":"/paper/2504.16511"},"observation_digest":"sha256:14ec63af483eb0b05c5fcdd78ad0ea19312d41cc45b2e52b782d32f429ac75ec","observation_id":"5ff4f8c8-a7f0-419f-957f-8e80a027c3be","resolution":{"observed_at":"2026-08-16T11:07:15.094718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:07:15.846726Z","title":null,"venue":null,"work_id":"1b7cdd40-895c-4020-8633-6ee6479c4937","year":2023},"citing_paper":{"arxiv_id":"2504.16511","last_updated":"2025-04-26T00:13:08Z","snapshot_observed_at":"2026-08-18T12:10:39.603526Z","submitted_at":"2025-04-23T08:36:50Z","title":"QuaDMix: Quality-Diversity Balanced Data Selection for Efficient LLM Pretraining","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-16T11:07:15.098832Z"},"links":{"citing_paper":"/paper/2504.16511"},"observation_digest":"sha256:d51a6252163e81be276b8eb150833f84a8bb8d502b058bcc187b4382753c9f6a","observation_id":"dcc1d83b-a290-4f36-8938-9c5b8a9a59b6","resolution":{"observed_at":"2026-08-16T11:07:15.850696Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01375","last_updated":"2024-06-03T14:40:31Z","snapshot_observed_at":"2026-08-18T12:09:58.232742Z","submitted_at":"2024-06-03T14:40:31Z","title":"D-CPT Law: Domain-specific Continual Pre-Training Scaling Law for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01375","snapshot_observed_at":"2026-08-16T11:07:15.102679Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16511","last_updated":"2025-04-26T00:13:08Z","snapshot_observed_at":"2026-08-18T12:10:39.603526Z","submitted_at":"2025-04-23T08:36:50Z","title":"QuaDMix: Quality-Diversity Balanced Data Selection for Efficient LLM Pretraining","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-16T11:07:15.102679Z"},"links":{"cited_paper":"/paper/2406.01375","citing_paper":"/paper/2504.16511"},"observation_digest":"sha256:d68c0999fd97f5a7034cc6eb3680d82139eb9f0283263c92fd930cf0b721f8d5","observation_id":"96195f1e-59e2-4380-b87a-8b138b1f40fd","resolution":{"observed_at":"2026-08-16T11:07:15.102679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.11446","last_updated":"2022-01-21T18:39:38Z","snapshot_observed_at":"2026-08-09T14:52:01.161814Z","submitted_at":"2021-12-08T19:41:47Z","title":"Scaling Language Models: Methods, Analysis & Insights from Training Gopher","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.11446","snapshot_observed_at":"2026-08-16T11:07:15.106536Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.16511","last_updated":"2025-04-26T00:13:08Z","snapshot_observed_at":"2026-08-18T12:10:39.603526Z","submitted_at":"2025-04-23T08:36:50Z","title":"QuaDMix: Quality-Diversity Balanced Data Selection for Efficient LLM Pretraining","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-16T11:07:15.106536Z"},"links":{"cited_paper":"/paper/2112.11446","citing_paper":"/paper/2504.16511"},"observation_digest":"sha256:911c9c17c4b47346978175858bf4b5e24b93a40413367c7c5ef0e7c8ad48e2fd","observation_id":"e4196d29-ba01-4108-b793-afebda3cd471","resolution":{"observed_at":"2026-08-16T11:07:15.106536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:07:15.110636Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.16511","last_updated":"2025-04-26T00:13:08Z","snapshot_observed_at":"2026-08-18T12:10:39.603526Z","submitted_at":"2025-04-23T08:36:50Z","title":"QuaDMix: Quality-Diversity Balanced Data Selection for Efficient LLM Pretraining","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-16T11:07:15.110636Z"},"links":{"citing_paper":"/paper/2504.16511"},"observation_digest":"sha256:d4f8b046b58023dd781c4ddf1d43c1bfcd8ce22fc17ba84fd2f63e65f2a40787","observation_id":"53d97daa-b63f-4413-9dc6-e5900e812450","resolution":{"observed_at":"2026-08-16T11:07:15.110636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09668","last_updated":"2024-02-15T02:27:57Z","snapshot_observed_at":"2026-08-16T14:18:27.107802Z","submitted_at":"2024-02-15T02:27:57Z","title":"How to Train Data-Efficient LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09668","snapshot_observed_at":"2026-08-16T11:07:15.114897Z","title":"Chi, James Caverlee, Julian McAuley, and Derek Zhiyuan Cheng","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16511","last_updated":"2025-04-26T00:13:08Z","snapshot_observed_at":"2026-08-18T12:10:39.603526Z","submitted_at":"2025-04-23T08:36:50Z","title":"QuaDMix: Quality-Diversity Balanced Data Selection for Efficient LLM Pretraining","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-16T11:07:15.114897Z"},"links":{"cited_paper":"/paper/2402.09668","citing_paper":"/paper/2504.16511"},"observation_digest":"sha256:a4134c3f44d452193b2e40ab6ead44543ba747efab627da300e14c18f3b60d2e","observation_id":"f9324099-b849-4562-bf63-7ae68ab4c3ed","resolution":{"observed_at":"2026-08-16T11:07:15.114897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14526","last_updated":"2024-06-03T06:48:34Z","snapshot_observed_at":"2026-08-16T14:16:15.805114Z","submitted_at":"2024-02-22T13:20:53Z","title":"Balanced Data Sampling for Language Model Training with Clustering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14526","snapshot_observed_at":"2026-08-16T11:07:15.119207Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16511","last_updated":"2025-04-26T00:13:08Z","snapshot_observed_at":"2026-08-18T12:10:39.603526Z","submitted_at":"2025-04-23T08:36:50Z","title":"QuaDMix: Quality-Diversity Balanced Data Selection for Efficient LLM Pretraining","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-16T11:07:15.119207Z"},"links":{"cited_paper":"/paper/2402.14526","citing_paper":"/paper/2504.16511"},"observation_digest":"sha256:ba481210b9075afad677c0edc73664d7f806f31796e6f0a40f7803e33d6ac49e","observation_id":"2ec67987-421c-4e8f-821f-bde8968c86f5","resolution":{"observed_at":"2026-08-16T11:07:15.119207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.05202","last_updated":"2020-02-12T19:57:13Z","snapshot_observed_at":"2026-08-11T06:21:56.129166Z","submitted_at":"2020-02-12T19:57:13Z","title":"GLU Variants Improve Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.05202","snapshot_observed_at":"2026-08-16T11:07:15.123162Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.16511","last_updated":"2025-04-26T00:13:08Z","snapshot_observed_at":"2026-08-18T12:10:39.603526Z","submitted_at":"2025-04-23T08:36:50Z","title":"QuaDMix: Quality-Diversity Balanced Data Selection for Efficient LLM Pretraining","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-16T11:07:15.123162Z"},"links":{"cited_paper":"/paper/2002.05202","citing_paper":"/paper/2504.16511"},"observation_digest":"sha256:c749804ef6a3f660b508d0e85fb32dc000439197d01bc532b96ea24aed2dc028","observation_id":"e802ce7e-4647-4071-9ea1-e07ed36321d9","resolution":{"observed_at":"2026-08-16T11:07:15.123162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:07:15.127037Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16511","last_updated":"2025-04-26T00:13:08Z","snapshot_observed_at":"2026-08-18T12:10:39.603526Z","submitted_at":"2025-04-23T08:36:50Z","title":"QuaDMix: Quality-Diversity Balanced Data Selection for Efficient LLM Pretraining","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-16T11:07:15.127037Z"},"links":{"citing_paper":"/paper/2504.16511"},"observation_digest":"sha256:f79b4a79b3968bd8ab41782955a49b11a907af84d956d8b45a4b569f74ece4b6","observation_id":"cce0c089-d6d5-4dbe-a44b-1cda77513f0c","resolution":{"observed_at":"2026-08-16T11:07:15.127037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:07:15.130819Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16511","last_updated":"2025-04-26T00:13:08Z","snapshot_observed_at":"2026-08-18T12:10:39.603526Z","submitted_at":"2025-04-23T08:36:50Z","title":"QuaDMix: Quality-Diversity Balanced Data Selection for Efficient LLM Pretraining","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-16T11:07:15.130819Z"},"links":{"citing_paper":"/paper/2504.16511"},"observation_digest":"sha256:3af49298865b58a138a03528464b6f5b248eb1ceb6a0c5f94f4f11216f936188","observation_id":"66fc7ed9-934f-4f09-8446-f2e955029ff5","resolution":{"observed_at":"2026-08-16T11:07:15.130819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:07:15.824198Z","title":null,"venue":null,"work_id":"9c516942-3b44-4de4-9cf7-08a8705b0a08","year":2023},"citing_paper":{"arxiv_id":"2504.16511","last_updated":"2025-04-26T00:13:08Z","snapshot_observed_at":"2026-08-18T12:10:39.603526Z","submitted_at":"2025-04-23T08:36:50Z","title":"QuaDMix: Quality-Diversity Balanced Data Selection for Efficient LLM Pretraining","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-16T11:07:15.135006Z"},"links":{"citing_paper":"/paper/2504.16511"},"observation_digest":"sha256:a034262dcf904f8db9b8570e9753aaa7b7e1801b8f218923cb3398bf7f2b482a","observation_id":"fec343f3-b789-4c59-b17d-43a7f8739bbf","resolution":{"observed_at":"2026-08-16T11:07:15.828228Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.05816","last_updated":"2025-03-10T17:56:18Z","snapshot_observed_at":"2026-08-16T13:20:02.671437Z","submitted_at":"2024-09-09T17:23:29Z","title":"Improving Pretraining Data Using Perplexity Correlations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.05816","snapshot_observed_at":"2026-08-16T11:07:15.139084Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16511","last_updated":"2025-04-26T00:13:08Z","snapshot_observed_at":"2026-08-18T12:10:39.603526Z","submitted_at":"2025-04-23T08:36:50Z","title":"QuaDMix: Quality-Diversity Balanced Data Selection for Efficient LLM Pretraining","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-16T11:07:15.139084Z"},"links":{"cited_paper":"/paper/2409.05816","citing_paper":"/paper/2504.16511"},"observation_digest":"sha256:9e0e93b8b9eafa84550fc5a2ba102586a33ecfe74b8f8e5e56eff57347fe70d7","observation_id":"c2d4c18f-fac1-47d3-8585-c867dde88af8","resolution":{"observed_at":"2026-08-16T11:07:15.139084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12284","last_updated":"2023-08-23T17:58:14Z","snapshot_observed_at":"2026-08-16T15:06:18.240835Z","submitted_at":"2023-08-23T17:58:14Z","title":"D4: Improving LLM Pretraining via Document De-Duplication and Diversification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12284","snapshot_observed_at":"2026-08-16T11:07:15.143211Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16511","last_updated":"2025-04-26T00:13:08Z","snapshot_observed_at":"2026-08-18T12:10:39.603526Z","submitted_at":"2025-04-23T08:36:50Z","title":"QuaDMix: Quality-Diversity Balanced Data Selection for Efficient LLM Pretraining","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-16T11:07:15.143211Z"},"links":{"cited_paper":"/paper/2308.12284","citing_paper":"/paper/2504.16511"},"observation_digest":"sha256:991932b7702fc5dad23b323aab61fa90e1a1e963aafa0a302b24808052ecd770","observation_id":"1f473210-55aa-4c96-9121-b1f5252556e4","resolution":{"observed_at":"2026-08-16T11:07:15.143211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-16T11:07:15.147185Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16511","last_updated":"2025-04-26T00:13:08Z","snapshot_observed_at":"2026-08-18T12:10:39.603526Z","submitted_at":"2025-04-23T08:36:50Z","title":"QuaDMix: Quality-Diversity Balanced Data Selection for Efficient LLM Pretraining","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-16T11:07:15.147185Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2504.16511"},"observation_digest":"sha256:f95f50717aeacbbb862581761bbdee926de32fe2f6b5c15713e3ff97452f5949","observation_id":"2fb81605-8b96-49a9-9125-50ad5e314ce9","resolution":{"observed_at":"2026-08-16T11:07:15.147185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:07:15.151237Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.16511","last_updated":"2025-04-26T00:13:08Z","snapshot_observed_at":"2026-08-18T12:10:39.603526Z","submitted_at":"2025-04-23T08:36:50Z","title":"QuaDMix: Quality-Diversity Balanced Data Selection for Efficient LLM Pretraining","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-16T11:07:15.151237Z"},"links":{"citing_paper":"/paper/2504.16511"},"observation_digest":"sha256:9d139ad44e0e13dafe70304d35582c4df38c3a831179198ab52e37a3a33e36b5","observation_id":"b47b022f-1d8d-420f-a45c-94ebe958bb07","resolution":{"observed_at":"2026-08-16T11:07:15.151237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.12372","last_updated":"2024-11-19T09:35:28Z","snapshot_observed_at":"2026-08-14T07:55:53.745138Z","submitted_at":"2024-11-19T09:35:28Z","title":"RedPajama: an Open Dataset for Training Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.12372","snapshot_observed_at":"2026-08-16T11:07:15.154851Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16511","last_updated":"2025-04-26T00:13:08Z","snapshot_observed_at":"2026-08-18T12:10:39.603526Z","submitted_at":"2025-04-23T08:36:50Z","title":"QuaDMix: Quality-Diversity Balanced Data Selection for Efficient LLM Pretraining","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-16T11:07:15.154851Z"},"links":{"cited_paper":"/paper/2411.12372","citing_paper":"/paper/2504.16511"},"observation_digest":"sha256:6907d78f65da232554bba0bed9c24ee5cb3b059c4aace494688d3960ef1501bf","observation_id":"61f33809-279a-4c28-a0b1-a1e9d95fc373","resolution":{"observed_at":"2026-08-16T11:07:15.154851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:07:15.804293Z","title":null,"venue":null,"work_id":"7f612147-5d66-467d-969e-152d3fdf1423","year":2020},"citing_paper":{"arxiv_id":"2504.16511","last_updated":"2025-04-26T00:13:08Z","snapshot_observed_at":"2026-08-18T12:10:39.603526Z","submitted_at":"2025-04-23T08:36:50Z","title":"QuaDMix: Quality-Diversity Balanced Data Selection for Efficient LLM Pretraining","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-16T11:07:15.158677Z"},"links":{"citing_paper":"/paper/2504.16511"},"observation_digest":"sha256:1d3c9dadd40981c2bcef8166264bcc415a9d0bf69a25dffb4a00f01f726f3df3","observation_id":"98c1c595-e1ab-4d6a-ac8c-2e9a1bfa100f","resolution":{"observed_at":"2026-08-16T11:07:15.808351Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09739","last_updated":"2024-07-17T20:50:11Z","snapshot_observed_at":"2026-08-16T14:18:25.426536Z","submitted_at":"2024-02-15T06:36:07Z","title":"QuRating: Selecting High-Quality Data for Training Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09739","snapshot_observed_at":"2026-08-16T11:07:15.162119Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16511","last_updated":"2025-04-26T00:13:08Z","snapshot_observed_at":"2026-08-18T12:10:39.603526Z","submitted_at":"2025-04-23T08:36:50Z","title":"QuaDMix: Quality-Diversity Balanced Data Selection for Efficient LLM Pretraining","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-16T11:07:15.162119Z"},"links":{"cited_paper":"/paper/2402.09739","citing_paper":"/paper/2504.16511"},"observation_digest":"sha256:4393fbc33bd5fa2c88a0dc17f1bc92cca2934ee0d3e043d39c4de4924cd69694","observation_id":"5caec618-ad28-438a-8ef9-d13f7bc61416","resolution":{"observed_at":"2026-08-16T11:07:15.162119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:07:15.166101Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16511","last_updated":"2025-04-26T00:13:08Z","snapshot_observed_at":"2026-08-18T12:10:39.603526Z","submitted_at":"2025-04-23T08:36:50Z","title":"QuaDMix: Quality-Diversity Balanced Data Selection for Efficient LLM Pretraining","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-16T11:07:15.166101Z"},"links":{"citing_paper":"/paper/2504.16511"},"observation_digest":"sha256:d6daf58ac2d962d20a60cc8a66f7c39148c0b3457eeacb8fd8000cb71e94cecd","observation_id":"e9c15c65-2606-44e7-8e55-e8262d91ff72","resolution":{"observed_at":"2026-08-16T11:07:15.166101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:07:15.783346Z","title":null,"venue":null,"work_id":"cfcdcce9-0ec0-4c5d-b143-6cccffeb6bd2","year":2023},"citing_paper":{"arxiv_id":"2504.16511","last_updated":"2025-04-26T00:13:08Z","snapshot_observed_at":"2026-08-18T12:10:39.603526Z","submitted_at":"2025-04-23T08:36:50Z","title":"QuaDMix: Quality-Diversity Balanced Data Selection for Efficient LLM Pretraining","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-16T11:07:15.170134Z"},"links":{"citing_paper":"/paper/2504.16511"},"observation_digest":"sha256:7430da28025cc453510d20622fd70a3c02d8ac4725f2c44f0217b000e684a3a6","observation_id":"5e40ea66-1aed-4df5-8e41-ad525714be2d","resolution":{"observed_at":"2026-08-16T11:07:15.788126Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16952","last_updated":"2025-03-20T03:31:27Z","snapshot_observed_at":"2026-08-16T14:06:35.643964Z","submitted_at":"2024-03-25T17:14:00Z","title":"Data Mixing Laws: Optimizing Data Mixtures by Predicting Language Modeling Performance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.16952","snapshot_observed_at":"2026-08-16T11:07:15.173517Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16511","last_updated":"2025-04-26T00:13:08Z","snapshot_observed_at":"2026-08-18T12:10:39.603526Z","submitted_at":"2025-04-23T08:36:50Z","title":"QuaDMix: Quality-Diversity Balanced Data Selection for Efficient LLM Pretraining","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-16T11:07:15.173517Z"},"links":{"cited_paper":"/paper/2403.16952","citing_paper":"/paper/2504.16511"},"observation_digest":"sha256:548b219d4af6aeac824bdfb4b9ae972d6ed3eb5a840ad2adc6c582e7e3bd5332","observation_id":"42297567-3221-4515-aabc-97cc9480bf14","resolution":{"observed_at":"2026-08-16T11:07:15.173517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06046","last_updated":"2024-11-16T02:59:22Z","snapshot_observed_at":"2026-08-16T13:44:40.059294Z","submitted_at":"2024-06-10T06:27:42Z","title":"MATES: Model-Aware Data Selection for Efficient Pretraining with Data Influence Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06046","snapshot_observed_at":"2026-08-16T11:07:15.177393Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16511","last_updated":"2025-04-26T00:13:08Z","snapshot_observed_at":"2026-08-18T12:10:39.603526Z","submitted_at":"2025-04-23T08:36:50Z","title":"QuaDMix: Quality-Diversity Balanced Data Selection for Efficient LLM Pretraining","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-16T11:07:15.177393Z"},"links":{"cited_paper":"/paper/2406.06046","citing_paper":"/paper/2504.16511"},"observation_digest":"sha256:b0b0d81f060adbfb946a2bab3874b02b10165bf700b3d8ef941fb743b186b35f","observation_id":"44a041b2-6238-4687-8ab0-71a56e4a2e29","resolution":{"observed_at":"2026-08-16T11:07:15.177393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:07:15.181415Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.16511","last_updated":"2025-04-26T00:13:08Z","snapshot_observed_at":"2026-08-18T12:10:39.603526Z","submitted_at":"2025-04-23T08:36:50Z","title":"QuaDMix: Quality-Diversity Balanced Data Selection for Efficient LLM Pretraining","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-16T11:07:15.181415Z"},"links":{"citing_paper":"/paper/2504.16511"},"observation_digest":"sha256:f9047e102afe72c04ac73f6c18ea133f28201ce3a10aee65d3d9506c34f664c3","observation_id":"29557480-3042-46cf-914d-701c4d86b18b","resolution":{"observed_at":"2026-08-16T11:07:15.181415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:07:15.185297Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16511","last_updated":"2025-04-26T00:13:08Z","snapshot_observed_at":"2026-08-18T12:10:39.603526Z","submitted_at":"2025-04-23T08:36:50Z","title":"QuaDMix: Quality-Diversity Balanced Data Selection for Efficient LLM Pretraining","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-16T11:07:15.185297Z"},"links":{"citing_paper":"/paper/2504.16511"},"observation_digest":"sha256:088dea2de7052d2bad452b62fa81e2f55e2a07597b2827fa2ca8d75c507dce01","observation_id":"2d04cb42-9ce1-45c5-9dcb-e3404df875ab","resolution":{"observed_at":"2026-08-16T11:07:15.185297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:07:15.189614Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16511","last_updated":"2025-04-26T00:13:08Z","snapshot_observed_at":"2026-08-18T12:10:39.603526Z","submitted_at":"2025-04-23T08:36:50Z","title":"QuaDMix: Quality-Diversity Balanced Data Selection for Efficient LLM Pretraining","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-16T11:07:15.189614Z"},"links":{"citing_paper":"/paper/2504.16511"},"observation_digest":"sha256:74133eaaf3a4992d9641b39f9725814fd0aed5dc11c76b590342a814d303b71a","observation_id":"4e909089-ddfb-4dc3-971d-35b2c56b3b61","resolution":{"observed_at":"2026-08-16T11:07:15.189614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2504.16511","last_updated":"2025-04-26T00:13:08Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-18T12:10:39.603526Z","submitted_at":"2025-04-23T08:36:50Z","title":"QuaDMix: Quality-Diversity Balanced Data Selection for Efficient LLM Pretraining"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":59,"verified_exact":0,"verified_fuzzy":1},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 4 inbound Pith citation observations for arXiv:2504.16511."}