{"as_of":"2026-08-11T02:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1ece749a23732ddabf72a5032fe37cde4eb22f3bd7b9b72c65c2fd9171f79693","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:33:55.004931Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.21598/citation-record","integrity":"/paper/2505.21598/integrity","json":"/paper/2505.21598/citation-record.json","paper":"/paper/2505.21598"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.16827","last_updated":"2024-08-02T17:59:31Z","snapshot_observed_at":"2026-08-03T03:15:21.035418Z","submitted_at":"2024-02-26T18:54:35Z","title":"A Survey on Data Selection for Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16827","snapshot_observed_at":"2026-08-07T13:33:48.370150Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-10T22:59:32.680141Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:48.370150Z"},"links":{"cited_paper":"/paper/2402.16827","citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:e53ab454fd7717c73a76ca2b1296365acb163356344958c5cd596132511f782e","observation_id":"36bc18a6-cb30-40c1-a97f-4897f475f9cf","resolution":{"observed_at":"2026-08-07T13:33:48.370150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02406","last_updated":"2023-12-09T00:27:18Z","snapshot_observed_at":"2026-08-09T06:28:25.884378Z","submitted_at":"2023-12-05T00:42:35Z","title":"Efficient Online Data Mixing For Language Model Pre-Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02406","snapshot_observed_at":"2026-08-07T13:33:48.487199Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-10T22:59:32.680141Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:48.487199Z"},"links":{"cited_paper":"/paper/2312.02406","citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:31693f4e7c2141dfa92c863d482b28387b46d418b314d7405d62f3c3b6c29bbe","observation_id":"62f76901-e1cd-4dd5-b557-a4ee9abbe3a4","resolution":{"observed_at":"2026-08-07T13:33:48.487199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:33:58.249138Z","title":null,"venue":null,"work_id":"884f1abe-20b0-47e3-bf31-6dac5050ac28","year":2002},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-10T22:59:32.680141Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:48.603636Z"},"links":{"citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:0626b8f7aa7b5e4aa9c63d29e61076d013626f97ce261bb3d3c3001df773263f","observation_id":"882719b5-0d86-4d79-951b-57fdb5e0f51b","resolution":{"observed_at":"2026-08-07T13:33:58.307035Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.15950","last_updated":"2025-02-21T21:27:48Z","snapshot_observed_at":"2026-08-09T18:37:04.244236Z","submitted_at":"2025-02-21T21:27:48Z","title":"Optimizing Pre-Training Data Mixtures with Mixtures of Data Expert Models","version":1},"cited_work":{"arxiv_id":"2502.15950","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.15950","snapshot_observed_at":"2026-08-07T13:33:57.298782Z","title":"Optimizing Pre-Training Data Mixtures with Mixtures of Data Expert Models","venue":"cs.LG","work_id":"dff2628a-7ed6-47a7-a667-bb6524c98cea","year":2025},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-10T22:59:32.680141Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:48.730422Z"},"links":{"cited_paper":"/paper/2502.15950","citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:f25f7561641eb806320308a3ea99454e8feb0a6b34bfa3555882528d79354373","observation_id":"b4addb51-6306-41eb-b8c1-294a5259ce6b","resolution":{"observed_at":"2026-08-07T13:33:57.368547Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:33:48.893722Z","title":null,"venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-10T22:59:32.680141Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:48.893722Z"},"links":{"citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:270a4cfe8651736592babfc61ac857ca3480ebaa3a6b9bbae919febea5cb9eb3","observation_id":"ab01c965-32fd-4ebb-b0ae-849adfda1d2f","resolution":{"observed_at":"2026-08-07T13:33:48.893722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.05735","last_updated":"2025-04-21T03:50:23Z","snapshot_observed_at":"2026-07-06T19:47:34.320753Z","submitted_at":"2024-11-08T17:50:24Z","title":"Aioli: A Unified Optimization Framework for Language Model Data Mixing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.05735","snapshot_observed_at":"2026-08-07T13:33:49.082128Z","title":"Chen, Michael Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-10T22:59:32.680141Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:49.082128Z"},"links":{"cited_paper":"/paper/2411.05735","citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:a59f34c5cfd13a6f081b4708436234f610e9ee06946e6f7d595f65c03d6c4808","observation_id":"74c29320-b6e8-4c06-b69c-a39e6b5ba3d9","resolution":{"observed_at":"2026-08-07T13:33:49.082128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.14430","last_updated":"2023-07-26T18:01:49Z","snapshot_observed_at":"2026-08-02T22:31:42.480177Z","submitted_at":"2023-07-26T18:01:49Z","title":"Skill-it! A Data-Driven Skills Framework for Understanding and Training Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.14430","snapshot_observed_at":"2026-08-07T13:33:49.258242Z","title":"Chen, Nicholas Roberts, Kush Bhatia, Jue Wang, Ce Zhang, Frederic Sala, and Christopher Ré","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-10T22:59:32.680141Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:49.258242Z"},"links":{"cited_paper":"/paper/2307.14430","citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:fa4d9f92d64b9de8f9f38f757db45fa44b2e14d71f00cbd74c8b69626cf37882","observation_id":"bcc8f024-6663-461c-8527-49b1cecfbe75","resolution":{"observed_at":"2026-08-07T13:33:49.258242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.11416","last_updated":"2022-12-06T21:39:48Z","snapshot_observed_at":"2026-07-06T14:08:18.855958Z","submitted_at":"2022-10-20T16:58:32Z","title":"Scaling Instruction-Finetuned Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.11416","snapshot_observed_at":"2026-08-07T13:33:49.385365Z","title":"Chi, Jeff Dean, Jacob Devlin, Adam Roberts, Denny Zhou, Quoc V","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-10T22:59:32.680141Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:49.385365Z"},"links":{"cited_paper":"/paper/2210.11416","citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:2c247fde7e19af3e202cf12360e1be273201a4688bcffa75e6762f9de41c95f7","observation_id":"e3ce5e90-f245-477f-a761-efa5cf0f381d","resolution":{"observed_at":"2026-08-07T13:33:49.385365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.00141","last_updated":"2018-02-13T16:33:55Z","snapshot_observed_at":"2026-07-06T06:07:09.962753Z","submitted_at":"2017-10-31T23:09:08Z","title":"Training GANs with Optimism","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.00141","snapshot_observed_at":"2026-08-07T13:33:49.511514Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-10T22:59:32.680141Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:49.511514Z"},"links":{"cited_paper":"/paper/1711.00141","citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:c6846fb86b4715d44fc70f2cfb16c009dd46f0650cab33fd4ae2757f1664264e","observation_id":"23546973-3ab1-4667-a1c8-176bd45dbb1e","resolution":{"observed_at":"2026-08-07T13:33:49.511514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1807.03907","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:33:56.988686Z","title":null,"venue":null,"work_id":"c58aeece-92f2-4b0b-bcc7-cf0d504fe922","year":2018},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-10T22:59:32.680141Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:49.614639Z"},"links":{"citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:7b73672c8095efacd64b5184e50b48ca9d42893775d17a2f5fc44e00e0329448","observation_id":"f28c872d-09c2-4910-96ae-4e6d2f031454","resolution":{"observed_at":"2026-08-07T13:33:57.103547Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.06905","last_updated":"2022-08-01T21:07:58Z","snapshot_observed_at":"2026-07-06T12:18:14.988251Z","submitted_at":"2021-12-13T18:58:19Z","title":"GLaM: Efficient Scaling of Language Models with Mixture-of-Experts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.06905","snapshot_observed_at":"2026-08-07T13:33:49.759942Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-10T22:59:32.680141Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:49.759942Z"},"links":{"cited_paper":"/paper/2112.06905","citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:4ca16dabf82cc1c32f4a3b6fa83d6320ffa90edca684d3cd32015bd0286feb88","observation_id":"963250a7-090d-4ab7-9b92-d715f9f2a4b9","resolution":{"observed_at":"2026-08-07T13:33:49.759942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:33:49.915397Z","title":null,"venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-10T22:59:32.680141Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:49.915397Z"},"links":{"citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:79b22b3c29c04d2e924de678320754adcfb460149892d3dfece49e9a1a9f37c1","observation_id":"fd576d84-729d-4da9-a0a7-2ed46f8e60e4","resolution":{"observed_at":"2026-08-07T13:33:49.915397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:33:58.056821Z","title":null,"venue":null,"work_id":"3f20a321-532b-4544-a2ad-4d3595a1c1c6","year":2023},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-10T22:59:32.680141Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:50.039377Z"},"links":{"citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:f694f1919dc5dabc5fee22435da5082626780f0fa16c0e3256d8b185e6fb65ea","observation_id":"b5ee6c42-924a-406c-ba0f-feb001fb6ba3","resolution":{"observed_at":"2026-08-07T13:33:58.127646Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1703.01785","last_updated":"2017-12-12T17:17:59Z","snapshot_observed_at":"2026-07-06T05:32:29.378894Z","submitted_at":"2017-03-06T09:44:32Z","title":"Forward and Reverse Gradient-Based Hyperparameter Optimization","version":3},"cited_work":{"arxiv_id":"1703.01785","doi":null,"metadata_source":"pith","pith_arxiv_id":"1703.01785","snapshot_observed_at":"2026-08-07T13:33:56.703706Z","title":"Forward and Reverse Gradient-Based Hyperparameter Optimization","venue":"stat.ML","work_id":"4e66ad60-8fbe-4b93-8ad5-87aa3e4fe765","year":2017},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-10T22:59:32.680141Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:50.178732Z"},"links":{"cited_paper":"/paper/1703.01785","citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:1e6a1a5bf9adb4f4219883dc1d71c077e82ae2df3e428c3473f9d00441d1a96b","observation_id":"ccbd187d-b65b-45d9-b2fd-9eee1d0eddbc","resolution":{"observed_at":"2026-08-07T13:33:56.797037Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08540","last_updated":"2024-06-14T20:21:05Z","snapshot_observed_at":"2026-08-10T12:51:53.068218Z","submitted_at":"2024-03-13T13:54:00Z","title":"Language models scale reliably with over-training and on downstream tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08540","snapshot_observed_at":"2026-08-07T13:33:50.325132Z","title":"Dimakis, Gabriel Ilharco, Pang Wei Koh, Shuran Song, Thomas Kollar, Yair Carmon, Achal Dave, Reinhard Heckel, Niklas Muennighoff, and Ludwig Schmidt","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-10T22:59:32.680141Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:50.325132Z"},"links":{"cited_paper":"/paper/2403.08540","citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:80ac41d0b075aeacbe08b1bd350f5bb446b7d7486da659f45a60fbe451fda0f0","observation_id":"1e4ebb40-ae5c-4daf-960c-187a2e144079","resolution":{"observed_at":"2026-08-07T13:33:50.325132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00027","last_updated":"2020-12-31T19:00:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-12-31T19:00:10Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00027","snapshot_observed_at":"2026-08-07T13:33:50.472683Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-10T22:59:32.680141Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:50.472683Z"},"links":{"cited_paper":"/paper/2101.00027","citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:5722095b0c70bad7624d11255cda450af67d3af6b2bf74bdafa72a2f52404651","observation_id":"df30824e-1b19-4511-92de-89ab5d0166ef","resolution":{"observed_at":"2026-08-07T13:33:50.472683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14908","last_updated":"2025-01-27T11:25:33Z","snapshot_observed_at":"2026-08-07T08:10:41.068262Z","submitted_at":"2024-05-23T09:44:02Z","title":"BiMix: A Bivariate Data Mixing Law for Language Model Pretraining","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14908","snapshot_observed_at":"2026-08-07T13:33:50.604941Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-10T22:59:32.680141Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:50.604941Z"},"links":{"cited_paper":"/paper/2405.14908","citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:198c75f2b757e2609ea8e587fbf225f6b23d84c9a676464f6216f11e2471db95","observation_id":"66437165-7de4-4550-accc-8ec38fb8c18a","resolution":{"observed_at":"2026-08-07T13:33:50.604941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.14177","last_updated":"2023-03-24T17:38:58Z","snapshot_observed_at":"2026-08-01T15:00:39.464566Z","submitted_at":"2023-03-24T17:38:58Z","title":"Scaling Expert Language Models with Unsupervised Domain Discovery","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.14177","snapshot_observed_at":"2026-08-07T13:33:50.715368Z","title":"Smith, and Luke Zettlemoyer","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-10T22:59:32.680141Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:50.715368Z"},"links":{"cited_paper":"/paper/2303.14177","citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:af1beb184f52c0d82b818395fc164628d90ee4db06cd06f80680706a1075ee56","observation_id":"dea4f49c-d8e5-4686-86dd-5cdaa69a665a","resolution":{"observed_at":"2026-08-07T13:33:50.715368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-08-09T19:52:33.533277Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-07T13:33:50.850028Z","title":"Rae, Oriol Vinyals, and Laurent Sifre","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-10T22:59:32.680141Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:50.850028Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:a551e94f383d7ab93d9cf3ad3f1d44cf9af76e5c47b86e39da66629630bdfa54","observation_id":"40a15f17-2fd7-4935-88c7-255670c03bb2","resolution":{"observed_at":"2026-08-07T13:33:50.850028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11820","last_updated":"2024-10-15T17:47:44Z","snapshot_observed_at":"2026-08-04T18:20:45.624958Z","submitted_at":"2024-10-15T17:47:44Z","title":"Adaptive Data Optimization: Dynamic Sample Selection with Scaling Laws","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11820","snapshot_observed_at":"2026-08-07T13:33:50.960916Z","title":"Zico Kolter","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-10T22:59:32.680141Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:50.960916Z"},"links":{"cited_paper":"/paper/2410.11820","citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:ccb09ae71656674c31a294ee3d141ee11137652736633d7fd803ff047c3bb31d","observation_id":"b311690c-0dce-4614-b305-f00efb81c32c","resolution":{"observed_at":"2026-08-07T13:33:50.960916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:33:51.071911Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-10T22:59:32.680141Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:51.071911Z"},"links":{"citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:ca1752ea0aed1cce99628d0de191bc2381702e5dce15caa64389389afc694da4","observation_id":"108619fd-ffb3-4a8e-a9bb-e1fe273c38d7","resolution":{"observed_at":"2026-08-07T13:33:51.071911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-07T13:33:51.178477Z","title":"Brown, Benjamin Chess, Rewon Child, Scott Gray, Alec Radford, Jeffrey Wu, and Dario Amodei","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-10T22:59:32.680141Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:51.178477Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:57999baa490a9049c39dbd08a742bd542b196201d631b0a48ee7d7dbdf2a1182","observation_id":"c14ea77e-2f43-4978-9bd0-6ac2aab41cba","resolution":{"observed_at":"2026-08-07T13:33:51.178477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.10945","last_updated":"2023-01-26T05:34:21Z","snapshot_observed_at":"2026-08-10T16:49:41.858724Z","submitted_at":"2023-01-26T05:34:21Z","title":"A Fully First-Order Method for Stochastic Bilevel Optimization","version":1},"cited_work":{"arxiv_id":"2301.10945","doi":null,"metadata_source":"pith","pith_arxiv_id":"2301.10945","snapshot_observed_at":"2026-08-07T13:33:56.242402Z","title":"A Fully First-Order Method for Stochastic Bilevel Optimization","venue":"math.OC","work_id":"07cec854-3d68-4802-9d4a-c7a7abf285ce","year":2023},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-10T22:59:32.680141Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:51.298763Z"},"links":{"cited_paper":"/paper/2301.10945","citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:65ce0dd2b070cf4a365f4b8417cb709ae979ff243c150a6b51aba9531d3e7261","observation_id":"7f11cfa6-090e-4ecf-a0a8-b8fda047eca8","resolution":{"observed_at":"2026-08-07T13:33:56.324802Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:33:57.913017Z","title":null,"venue":null,"work_id":"26999abf-1570-4f19-bfbb-5215570c10da","year":2020},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-10T22:59:32.680141Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:51.414889Z"},"links":{"citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:deb02f8ec3e455d6c7d6810f33fb9484469b161e9735b087a040ad9deeb45d36","observation_id":"e5192bdd-f44b-4a8a-9ca8-ee3e999773ef","resolution":{"observed_at":"2026-08-07T13:33:57.971782Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.02303","last_updated":"2023-11-04T02:22:40Z","snapshot_observed_at":"2026-08-09T19:47:19.183988Z","submitted_at":"2023-11-04T02:22:40Z","title":"MFTCoder: Boosting Code LLMs with Multitask Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.02303","snapshot_observed_at":"2026-08-07T13:33:51.548263Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-10T22:59:32.680141Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:51.548263Z"},"links":{"cited_paper":"/paper/2311.02303","citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:b4fde74b3386af409c9dc231aecc681f95e61fd901eac3ac700be503b2421683","observation_id":"72f6d54c-d65e-473f-b53d-f57aa729b933","resolution":{"observed_at":"2026-08-07T13:33:51.548263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03792","last_updated":"2023-10-30T02:45:50Z","snapshot_observed_at":"2026-08-10T13:09:02.497714Z","submitted_at":"2023-06-06T15:39:54Z","title":"FAMO: Fast Adaptive Multitask Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03792","snapshot_observed_at":"2026-08-07T13:33:51.661519Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-10T22:59:32.680141Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:51.661519Z"},"links":{"cited_paper":"/paper/2306.03792","citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:4a3923da88c9217cb82dbd24af9ed1ff4cf4564c3c2461365f09cd78b68746f1","observation_id":"1004f965-6e3d-4c85-8453-fc39bb0c4af4","resolution":{"observed_at":"2026-08-07T13:33:51.661519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:33:57.757129Z","title":null,"venue":null,"work_id":"2eb383d4-f146-406e-869c-cb0904f191a2","year":2021},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-10T22:59:32.680141Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:51.772616Z"},"links":{"citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:5d75e0bd5ecd1b81010e8ef4686e575e5f008d96806346870102c321ed27e569","observation_id":"ae44435e-3711-4976-ac39-7797fd167ca0","resolution":{"observed_at":"2026-08-07T13:33:57.813615Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:33:51.884698Z","title":null,"venue":null,"work_id":null,"year":1989},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-10T22:59:32.680141Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:51.884698Z"},"links":{"citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:0b37952dc3719d28457bf9251d440628fc8319a588523110dfa15964afed3cd5","observation_id":"ea6153a1-ef08-4c32-bce6-d6fbdf085acc","resolution":{"observed_at":"2026-08-07T13:33:51.884698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:33:57.573390Z","title":null,"venue":null,"work_id":"8a695fef-772b-4262-a736-1ce7335c6a10","year":2021},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-10T22:59:32.680141Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:51.984488Z"},"links":{"citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:e53c926fe43c08d0452f6663ed9f461b229703a2bf3478a837d7f19283dee073","observation_id":"5f0f9683-56eb-49ac-9295-c930cdaa501e","resolution":{"observed_at":"2026-08-07T13:33:57.644662Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01492","last_updated":"2025-01-23T17:35:43Z","snapshot_observed_at":"2026-08-10T13:09:04.261889Z","submitted_at":"2024-07-01T17:31:03Z","title":"RegMix: Data Mixture as Regression for Language Model Pre-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01492","snapshot_observed_at":"2026-08-07T13:33:52.124575Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-10T22:59:32.680141Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:52.124575Z"},"links":{"cited_paper":"/paper/2407.01492","citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:e1d9ad65093fbe265eae59f1f798dd0a770fd10aed54058162344e55eb3a8d8e","observation_id":"02ee085f-bef2-4e81-9cac-ed70b0ea99f1","resolution":{"observed_at":"2026-08-07T13:33:52.124575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.02590","last_updated":"2019-11-06T19:04:16Z","snapshot_observed_at":"2026-08-10T19:42:41.761857Z","submitted_at":"2019-11-06T19:04:16Z","title":"Optimizing Millions of Hyperparameters by Implicit Differentiation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.02590","snapshot_observed_at":"2026-08-07T13:33:52.282275Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-10T22:59:32.680141Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:52.282275Z"},"links":{"cited_paper":"/paper/1911.02590","citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:b640907e0d17c29a3c0b2f63ff3e7b9397df062080ba0c8aeaaf82f789c63428","observation_id":"5b8c3ab1-ee23-4537-86aa-73cb9e83704b","resolution":{"observed_at":"2026-08-07T13:33:52.282275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14318","last_updated":"2025-05-20T15:09:35Z","snapshot_observed_at":"2026-08-09T13:36:44.241473Z","submitted_at":"2024-11-21T17:10:02Z","title":"Velocitune: A Velocity-based Dynamic Domain Reweighting Method for Continual Pre-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14318","snapshot_observed_at":"2026-08-07T13:33:52.387698Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-10T22:59:32.680141Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:52.387698Z"},"links":{"cited_paper":"/paper/2411.14318","citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:842eebb99e418b52b667d86adeb0e59b9d2dc79f9baf718de8c9d7808940e9fa","observation_id":"a8254859-93c3-45ee-ba9e-011c5d60762b","resolution":{"observed_at":"2026-08-07T13:33:52.387698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14619","last_updated":"2024-05-02T00:30:57Z","snapshot_observed_at":"2026-07-06T18:04:04.541434Z","submitted_at":"2024-04-22T23:12:03Z","title":"OpenELM: An Efficient Language Model Family with Open Training and Inference Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14619","snapshot_observed_at":"2026-08-07T13:33:52.514060Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-10T22:59:32.680141Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:52.514060Z"},"links":{"cited_paper":"/paper/2404.14619","citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:ade459a99e213b27a7c91e16468c3d7e1a077d48b816fc8cc912cbe9e6b42781","observation_id":"583b578c-c295-45fa-840c-1ee032eaad82","resolution":{"observed_at":"2026-08-07T13:33:52.514060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:33:52.622870Z","title":"Hashimoto, and Percy Liang","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-10T22:59:32.680141Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:52.622870Z"},"links":{"citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:aa72dd3239bec1f40282e177b7bddebf5e317084a489e526ee3d404c67b1e326","observation_id":"9d15914f-4f31-498a-8937-b25454cee021","resolution":{"observed_at":"2026-08-07T13:33:52.622870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17919","last_updated":"2024-12-25T19:03:23Z","snapshot_observed_at":"2026-07-06T17:51:28.420385Z","submitted_at":"2024-03-26T17:55:02Z","title":"LISA: Layerwise Importance Sampling for Memory-Efficient Large Language Model Fine-Tuning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17919","snapshot_observed_at":"2026-08-07T13:33:52.754333Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-10T22:59:32.680141Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:52.754333Z"},"links":{"cited_paper":"/paper/2403.17919","citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:0974ac43918b96f5058c4925faef0373a8a95cf02471157106b2e52680a558bf","observation_id":"47ac372b-45d2-4da2-843c-777b6e795982","resolution":{"observed_at":"2026-08-07T13:33:52.754333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19976","last_updated":"2025-05-25T05:03:51Z","snapshot_observed_at":"2026-07-06T18:38:29.579641Z","submitted_at":"2024-06-28T15:03:08Z","title":"ScaleBiO: Scalable Bilevel Optimization for LLM Data Reweighting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19976","snapshot_observed_at":"2026-08-07T13:33:52.895760Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-10T22:59:32.680141Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:52.895760Z"},"links":{"cited_paper":"/paper/2406.19976","citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:0eeaf8762ac702f04d51e44d6e7bff7acf04e1b4a4e9aceaceae30e0d05d7d25","observation_id":"29e0cfed-d8b5-454a-b07d-51453c2f516d","resolution":{"observed_at":"2026-08-07T13:33:52.895760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01375","last_updated":"2024-06-03T14:40:31Z","snapshot_observed_at":"2026-08-03T14:53:38.066418Z","submitted_at":"2024-06-03T14:40:31Z","title":"D-CPT Law: Domain-specific Continual Pre-Training Scaling Law for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01375","snapshot_observed_at":"2026-08-07T13:33:52.994596Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-10T22:59:32.680141Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:52.994596Z"},"links":{"cited_paper":"/paper/2406.01375","citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:84edd6ec9ef3eaa89db3f764cc9de0a57cd4967371c9e89d1261a8a3698474f2","observation_id":"16c2a519-496c-4d04-b4fa-96a085159c1a","resolution":{"observed_at":"2026-08-07T13:33:52.994596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:33:53.139442Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-10T22:59:32.680141Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:53.139442Z"},"links":{"citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:6fe9dd4ceb3eb42f254825bc71629d5f61b30b24ccfd271b713884baadeabbed","observation_id":"6914823b-34a4-443b-93df-1ad0ec8df797","resolution":{"observed_at":"2026-08-07T13:33:53.139442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2020.30038","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:33:55.796793Z","title":null,"venue":null,"work_id":"5a1439c2-2708-4b17-beb8-a70d9d3a2163","year":2020},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-10T22:59:32.680141Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:53.242787Z"},"links":{"citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:1cce2dc09a76e04eb70dc6f59ed504e042b18eaa9c26da4520cbc419e84d073a","observation_id":"af4c5844-478f-4d49-979d-0b99705c36cc","resolution":{"observed_at":"2026-08-07T13:33:55.904518Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.08731","last_updated":"2020-04-02T05:40:29Z","snapshot_observed_at":"2026-08-02T19:28:48.954133Z","submitted_at":"2019-11-20T06:43:41Z","title":"Distributionally Robust Neural Networks for Group Shifts: On the Importance of Regularization for Worst-Case Generalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.08731","snapshot_observed_at":"2026-08-07T13:33:53.325891Z","title":"Hashimoto, and Percy Liang","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-10T22:59:32.680141Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:53.325891Z"},"links":{"cited_paper":"/paper/1911.08731","citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:46ea8489e6772397a9b01e71e819edde6af482734756a8ead638988c8a8d6bda","observation_id":"70d827fa-3469-459e-8020-9b16f8b81515","resolution":{"observed_at":"2026-08-07T13:33:53.325891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10818","last_updated":"2024-05-09T13:56:06Z","snapshot_observed_at":"2026-08-07T23:26:20.937888Z","submitted_at":"2023-09-19T17:59:54Z","title":"SlimPajama-DC: Understanding Data Combinations for LLM Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10818","snapshot_observed_at":"2026-08-07T13:33:53.419429Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-10T22:59:32.680141Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:53.419429Z"},"links":{"cited_paper":"/paper/2309.10818","citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:8f6f88222e2cbed471557600033a74fbcff7c43f91c7c7cc6b205c4d3485efbd","observation_id":"7fe70179-7f88-46f0-8088-731f97cbb0cf","resolution":{"observed_at":"2026-08-07T13:33:53.419429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11527","last_updated":"2024-12-06T17:31:39Z","snapshot_observed_at":"2026-08-06T05:54:17.831942Z","submitted_at":"2024-08-21T11:06:02Z","title":"The Vizier Gaussian Process Bandit Algorithm","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11527","snapshot_observed_at":"2026-08-07T13:33:53.554390Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-10T22:59:32.680141Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:53.554390Z"},"links":{"cited_paper":"/paper/2408.11527","citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:4b5ce55cc4c80d0b444f42b2e4f2f6ea9979387545c52edccda60e19541a1e90","observation_id":"b6821ead-e6e2-44de-843c-4a7f822e84a6","resolution":{"observed_at":"2026-08-07T13:33:53.554390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:33:53.715579Z","title":"Oliphant, Matt Haberland, Tyler Reddy, David Cournapeau, Evgeni Burovski, Pearu Peterson, Warren Weckesser, Jonathan Bright, Stéfan J","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-10T22:59:32.680141Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:53.715579Z"},"links":{"citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:fe32d812f76198b2cd279b5beea967a3c51d4583674398c1e5ff1ec9db7aaed4","observation_id":"66e1e1d6-b288-4248-a255-e95759f080ca","resolution":{"observed_at":"2026-08-07T13:33:53.715579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.01652","last_updated":"2022-02-08T20:26:45Z","snapshot_observed_at":"2026-08-10T07:52:08.606999Z","submitted_at":"2021-09-03T17:55:52Z","title":"Finetuned Language Models Are Zero-Shot Learners","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.01652","snapshot_observed_at":"2026-08-07T13:33:53.834351Z","title":"Zhao, Kelvin Guu, Adams Wei Yu, Brian Lester, Nan Du, Andrew M","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-10T22:59:32.680141Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:53.834351Z"},"links":{"cited_paper":"/paper/2109.01652","citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:bfc6e1a0d70a50575c50046e48b6a4b6f4b223b6fc6749c8f421fad1619b9c5d","observation_id":"1c3b19b2-514e-4dc4-8c72-bee9fdeb6b64","resolution":{"observed_at":"2026-08-07T13:33:53.834351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06694","last_updated":"2024-04-11T01:18:06Z","snapshot_observed_at":"2026-08-08T20:21:38.269492Z","submitted_at":"2023-10-10T15:13:30Z","title":"Sheared LLaMA: Accelerating Language Model Pre-training via Structured Pruning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06694","snapshot_observed_at":"2026-08-07T13:33:53.990057Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-10T22:59:32.680141Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:53.990057Z"},"links":{"cited_paper":"/paper/2310.06694","citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:b51a4fa3f3829ff697e0c78b2ecfc56d2bf90e2677e653d46416cd3da6c0d143","observation_id":"3597c35a-4d91-4682-82bc-7cb147cc2dab","resolution":{"observed_at":"2026-08-07T13:33:53.990057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10429","last_updated":"2023-11-21T02:01:53Z","snapshot_observed_at":"2026-08-09T06:27:16.635132Z","submitted_at":"2023-05-17T17:58:13Z","title":"DoReMi: Optimizing Data Mixtures Speeds Up Language Model Pretraining","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10429","snapshot_observed_at":"2026-08-07T13:33:54.125833Z","title":"Le, Tengyu Ma, and Adams Wei Yu","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-10T22:59:32.680141Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:54.125833Z"},"links":{"cited_paper":"/paper/2305.10429","citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:c6f185a9fa2242e244dd775375704a32669dd16e01c233673ac4d2132c22df90","observation_id":"8d4d2737-a203-4e5d-a27c-6133fb09a45f","resolution":{"observed_at":"2026-08-07T13:33:54.125833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.7489","last_updated":"2015-03-26T15:29:50Z","snapshot_observed_at":"2026-08-04T04:09:11.311000Z","submitted_at":"2014-12-23T19:50:21Z","title":"A Unified Perspective on Multi-Domain and Multi-Task Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.7489","snapshot_observed_at":"2026-08-07T13:33:54.253956Z","title":"Hospedales","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-10T22:59:32.680141Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:54.253956Z"},"links":{"cited_paper":"/paper/1412.7489","citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:5b3550a159f85340d49da39124ca33b504afcbbc7b48314ae7ab0d64022b38e8","observation_id":"70accda3-7105-445a-8a53-0fa773379f6d","resolution":{"observed_at":"2026-08-07T13:33:54.253956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16952","last_updated":"2025-03-20T03:31:27Z","snapshot_observed_at":"2026-07-06T17:50:18.017647Z","submitted_at":"2024-03-25T17:14:00Z","title":"Data Mixing Laws: Optimizing Data Mixtures by Predicting Language Modeling Performance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.16952","snapshot_observed_at":"2026-08-07T13:33:54.384371Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-10T22:59:32.680141Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:54.384371Z"},"links":{"cited_paper":"/paper/2403.16952","citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:5395dc86d95df0b55832f5182ea0837a46894b5722a37e73f9a686d6678b8b7c","observation_id":"eb873359-d146-41a6-a21c-3727d824a5d8","resolution":{"observed_at":"2026-08-07T13:33:54.384371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.06782","last_updated":"2020-12-22T00:35:46Z","snapshot_observed_at":"2026-08-10T13:07:02.974893Z","submitted_at":"2020-01-19T06:33:47Z","title":"Gradient Surgery for Multi-Task Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.06782","snapshot_observed_at":"2026-08-07T13:33:54.509096Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-10T22:59:32.680141Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:54.509096Z"},"links":{"cited_paper":"/paper/2001.06782","citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:4b89c5f6cb0440b71f107d72933373aa6852a7c0c4a8a8f338b8603a2db286c3","observation_id":"a18e95ba-7dc5-42a9-b983-6530db2b0d41","resolution":{"observed_at":"2026-08-07T13:33:54.509096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.15768","last_updated":"2025-03-20T15:46:13Z","snapshot_observed_at":"2026-08-08T13:12:45.017324Z","submitted_at":"2020-10-29T17:13:46Z","title":"A Single-Loop Smoothed Gradient Descent-Ascent Algorithm for Nonconvex-Concave Min-Max Problems","version":3},"cited_work":{"arxiv_id":"2010.15768","doi":null,"metadata_source":"pith","pith_arxiv_id":"2010.15768","snapshot_observed_at":"2026-08-07T13:33:55.246692Z","title":"A Single-Loop Smoothed Gradient Descent-Ascent Algorithm for Nonconvex-Concave Min-Max Problems","venue":"math.OC","work_id":"f7dfaa96-7743-4209-bfa9-ed9968a6acd2","year":2020},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-10T22:59:32.680141Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:54.674767Z"},"links":{"cited_paper":"/paper/2010.15768","citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:96377ff579d3f52604ba69d205cc67c78b31c2811fd92a5007647ff2ec9fb86a","observation_id":"34000aaf-f730-4f6e-9659-43a4e2ce50f5","resolution":{"observed_at":"2026-08-07T13:33:55.333064Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00788","last_updated":"2023-12-20T20:30:24Z","snapshot_observed_at":"2026-08-10T06:51:23.527667Z","submitted_at":"2023-08-01T18:59:07Z","title":"An Introduction to Bi-level Optimization: Foundations and Applications in Signal Processing and Machine Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.00788","snapshot_observed_at":"2026-08-07T13:33:54.796497Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-10T22:59:32.680141Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:54.796497Z"},"links":{"cited_paper":"/paper/2308.00788","citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:fe10e4a5abd47325d06af99eeb43dc7fc172d0cc41ca920ecd91f7128055b04a","observation_id":"141ad7d3-e01b-4495-b403-50e15e80cb69","resolution":{"observed_at":"2026-08-07T13:33:54.796497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:33:54.889501Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-10T22:59:32.680141Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:54.889501Z"},"links":{"citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:5cdaa322fe20f9b963d96dbb962f20db4fe06ff2770f170070a43c78760dab26","observation_id":"5bb3652e-81b6-4dc2-9b03-43b5ae33a944","resolution":{"observed_at":"2026-08-07T13:33:54.889501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:33:55.004931Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-10T22:59:32.680141Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:55.004931Z"},"links":{"citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:476332b138019519791278e115a9962fe430be64eb54a6ed9d157c6ed0bddc58","observation_id":"b1e40183-72ef-4dd2-9328-0352283a0f8c","resolution":{"observed_at":"2026-08-07T13:33:55.004931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-10T22:59:32.680141Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":47,"verified_exact":5,"verified_fuzzy":0},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 0 inbound Pith citation observations for arXiv:2505.21598."}