{"as_of":"2026-08-10T11:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2989eb6aaff90b1640a1dce47b802346c77e2c4eac7f7608a5c26b344c43ec17","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:19:11.124746Z","state":"measured"},{"denominator":56,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":56,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-15T00:56:04.958757Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-15T00:58:25.710039Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.10952","last_updated":"2025-06-12T17:53:51Z","snapshot_observed_at":"2026-08-09T00:02:21.926480Z","submitted_at":"2025-06-12T17:53:51Z","title":"Domain2Vec: Vectorizing Datasets to Find the Optimal Data Mixture without Training","version":1},"cited_work":{"arxiv_id":"2506.10952","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10952","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Domain2vec: Vectorizing datasets to find the optimal data mixture without training","venue":null,"work_id":"71ca0899-b736-435d-9a2c-520c4ae8b88f","year":2025},"citing_paper":{"arxiv_id":"2604.16380","last_updated":"2026-03-25T13:30:40Z","snapshot_observed_at":"2026-08-08T06:45:13.140900Z","submitted_at":"2026-03-25T13:30:40Z","title":"Data Mixing for Large Language Models Pretraining: A Survey and Outlook","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-15T00:56:04.958757Z"},"links":{"cited_paper":"/paper/2506.10952","citing_paper":"/paper/2604.16380"},"observation_digest":"sha256:6294096cb136f4bdbaca31afcd916ecf16c2c228f640fdd8a9ce42e815c8059a","observation_id":"75014b2e-a9cb-4c56-b770-895e9292b063","resolution":{"observed_at":"2026-05-15T00:58:25.711591Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.10952/citation-record","integrity":"/paper/2506.10952/integrity","json":"/paper/2506.10952/citation-record.json","paper":"/paper/2506.10952"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2405.20541","last_updated":"2024-05-30T23:50:20Z","snapshot_observed_at":"2026-08-10T10:55:20.865091Z","submitted_at":"2024-05-30T23:50:20Z","title":"Perplexed by Perplexity: Perplexity-Based Data Pruning With Small Reference Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20541","snapshot_observed_at":"2026-08-07T04:19:04.749969Z","title":"L., and Paul, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10952","last_updated":"2025-06-12T17:53:51Z","snapshot_observed_at":"2026-08-09T00:02:21.926480Z","submitted_at":"2025-06-12T17:53:51Z","title":"Domain2Vec: Vectorizing Datasets to Find the Optimal Data Mixture without Training","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T04:19:04.749969Z"},"links":{"cited_paper":"/paper/2405.20541","citing_paper":"/paper/2506.10952"},"observation_digest":"sha256:e03dabda293a36073d4c44018920b3d45a476260ad7da872de89de7898220e12","observation_id":"5150f381-6e00-4937-a600-9f7df201e13c","resolution":{"observed_at":"2026-08-07T04:19:04.749969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:19:19.741418Z","title":"and Vassilvitskii, S","venue":null,"work_id":"f7d669d3-746c-4c3a-a987-392b2f87b6d7","year":2006},"citing_paper":{"arxiv_id":"2506.10952","last_updated":"2025-06-12T17:53:51Z","snapshot_observed_at":"2026-08-09T00:02:21.926480Z","submitted_at":"2025-06-12T17:53:51Z","title":"Domain2Vec: Vectorizing Datasets to Find the Optimal Data Mixture without Training","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T04:19:04.830069Z"},"links":{"citing_paper":"/paper/2506.10952"},"observation_digest":"sha256:5385fe55fe5809c8d2667ecaa7b869bc3f39724c757576252d22aa9bb20e7c96","observation_id":"20a927a0-ef93-482f-9dce-ace099b5b482","resolution":{"observed_at":"2026-08-07T04:19:19.885756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:19:19.429327Z","title":"L., Gao, J., and Choi, Y","venue":null,"work_id":"475e616c-7d7b-4bba-96ea-fb9d379c069e","year":2019},"citing_paper":{"arxiv_id":"2506.10952","last_updated":"2025-06-12T17:53:51Z","snapshot_observed_at":"2026-08-09T00:02:21.926480Z","submitted_at":"2025-06-12T17:53:51Z","title":"Domain2Vec: Vectorizing Datasets to Find the Optimal Data Mixture without Training","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T04:19:04.986925Z"},"links":{"citing_paper":"/paper/2506.10952"},"observation_digest":"sha256:af54ad2488452e1fb10e4bb26fd023dbaf96605b5666581e47d73bafc0b94df3","observation_id":"e622fe09-9584-446d-8696-f8235fbc7bf7","resolution":{"observed_at":"2026-08-07T04:19:19.575514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00281","last_updated":"2024-06-01T03:24:31Z","snapshot_observed_at":"2026-08-09T00:02:39.321963Z","submitted_at":"2024-06-01T03:24:31Z","title":"Cross-Table Pretraining towards a Universal Function Space for Heterogeneous Tabular Data","version":1},"cited_work":{"arxiv_id":"2406.00281","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.00281","snapshot_observed_at":"2026-08-07T04:19:12.743880Z","title":"Cross-Table Pretraining towards a Universal Function Space for Heterogeneous Tabular Data","venue":"cs.LG","work_id":"cc5070d6-6f22-4b40-a370-a6ce5ee31731","year":2024},"citing_paper":{"arxiv_id":"2506.10952","last_updated":"2025-06-12T17:53:51Z","snapshot_observed_at":"2026-08-09T00:02:21.926480Z","submitted_at":"2025-06-12T17:53:51Z","title":"Domain2Vec: Vectorizing Datasets to Find the Optimal Data Mixture without Training","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T04:19:05.168093Z"},"links":{"cited_paper":"/paper/2406.00281","citing_paper":"/paper/2506.10952"},"observation_digest":"sha256:38e2e23ebfee13fd51eafed137e032f9bb37bfe86e1806ffba56e5957681a797","observation_id":"ca118c46-9f2f-4d5f-8f25-5724cf2b0f37","resolution":{"observed_at":"2026-08-07T04:19:12.832198Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-07T04:19:05.292132Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.10952","last_updated":"2025-06-12T17:53:51Z","snapshot_observed_at":"2026-08-09T00:02:21.926480Z","submitted_at":"2025-06-12T17:53:51Z","title":"Domain2Vec: Vectorizing Datasets to Find the Optimal Data Mixture without Training","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T04:19:05.292132Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2506.10952"},"observation_digest":"sha256:518d722f5cac4872f14be92113dcd6449fe19357c30184c3e5d27cba7f3bc548","observation_id":"6e43ce2c-2b94-47ff-88f7-1355d77d3822","resolution":{"observed_at":"2026-08-07T04:19:05.292132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:19:05.428897Z","title":"Deepseek-v2: A strong, economical, and efficient mixture-of-experts language model, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10952","last_updated":"2025-06-12T17:53:51Z","snapshot_observed_at":"2026-08-09T00:02:21.926480Z","submitted_at":"2025-06-12T17:53:51Z","title":"Domain2Vec: Vectorizing Datasets to Find the Optimal Data Mixture without Training","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T04:19:05.428897Z"},"links":{"citing_paper":"/paper/2506.10952"},"observation_digest":"sha256:5587d0871adc56bce80f3279f298ac46f11facd1bdf49ef1a3b080f0c87a3457","observation_id":"b67c0f7c-b241-45bd-9131-ad2d9b7e24a1","resolution":{"observed_at":"2026-08-07T04:19:05.428897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:19:19.008228Z","title":"DOGE : Domain reweighting with generalization estimation","venue":null,"work_id":"5dfbd99f-00d5-4475-92c0-537a2a31f50a","year":2023},"citing_paper":{"arxiv_id":"2506.10952","last_updated":"2025-06-12T17:53:51Z","snapshot_observed_at":"2026-08-09T00:02:21.926480Z","submitted_at":"2025-06-12T17:53:51Z","title":"Domain2Vec: Vectorizing Datasets to Find the Optimal Data Mixture without Training","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T04:19:05.546635Z"},"links":{"citing_paper":"/paper/2506.10952"},"observation_digest":"sha256:b550c7f9402476e8c0b3f2ffd8f7ffa390e95be256d6613e6654a30c1183e703","observation_id":"4fc679f5-287e-45e9-84f6-f825520e8cd5","resolution":{"observed_at":"2026-08-07T04:19:19.238643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14624","last_updated":"2025-05-24T06:22:30Z","snapshot_observed_at":"2026-08-08T07:36:59.199369Z","submitted_at":"2024-01-26T03:38:23Z","title":"Unearthing Large Scale Domain-Specific Knowledge from Public Corpora","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14624","snapshot_observed_at":"2026-08-07T04:19:05.673354Z","title":"Query of cc: Unearthing large scale domain-specific knowledge from public corpora, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10952","last_updated":"2025-06-12T17:53:51Z","snapshot_observed_at":"2026-08-09T00:02:21.926480Z","submitted_at":"2025-06-12T17:53:51Z","title":"Domain2Vec: Vectorizing Datasets to Find the Optimal Data Mixture without Training","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T04:19:05.673354Z"},"links":{"cited_paper":"/paper/2401.14624","citing_paper":"/paper/2506.10952"},"observation_digest":"sha256:d8ba1ff6c262dbe863a51203d1c538aed1afcef967b6277d0af78b4bb9f9615b","observation_id":"d7b03bc9-e2ae-4f46-a8bf-54061c6bc317","resolution":{"observed_at":"2026-08-07T04:19:05.673354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00027","last_updated":"2020-12-31T19:00:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-12-31T19:00:10Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00027","snapshot_observed_at":"2026-08-07T04:19:05.821830Z","title":"The pile: An 800gb dataset of diverse text for language modeling","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.10952","last_updated":"2025-06-12T17:53:51Z","snapshot_observed_at":"2026-08-09T00:02:21.926480Z","submitted_at":"2025-06-12T17:53:51Z","title":"Domain2Vec: Vectorizing Datasets to Find the Optimal Data Mixture without Training","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T04:19:05.821830Z"},"links":{"cited_paper":"/paper/2101.00027","citing_paper":"/paper/2506.10952"},"observation_digest":"sha256:22ea8a865eb7d980545f4d562d8164ab7cc9bced8da477d9b75f03db97aec778","observation_id":"795ba27a-4d48-4890-8f46-906a2005cd65","resolution":{"observed_at":"2026-08-07T04:19:05.821830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:19:05.974554Z","title":"A framework for few-shot language model evaluation, 07 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10952","last_updated":"2025-06-12T17:53:51Z","snapshot_observed_at":"2026-08-09T00:02:21.926480Z","submitted_at":"2025-06-12T17:53:51Z","title":"Domain2Vec: Vectorizing Datasets to Find the Optimal Data Mixture without Training","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T04:19:05.974554Z"},"links":{"citing_paper":"/paper/2506.10952"},"observation_digest":"sha256:9b6d091c0010151dd553ce17a5142a0343e0f451322398ee3b7f1d8505d9d112","observation_id":"eb5ad669-b4d0-44a5-9ca1-045173519542","resolution":{"observed_at":"2026-08-07T04:19:05.974554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14908","last_updated":"2025-01-27T11:25:33Z","snapshot_observed_at":"2026-08-07T08:10:41.068262Z","submitted_at":"2024-05-23T09:44:02Z","title":"BiMix: A Bivariate Data Mixing Law for Language Model Pretraining","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14908","snapshot_observed_at":"2026-08-07T04:19:06.110067Z","title":"Data mixing made efficient: A bivariate scaling law for language model pretraining, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10952","last_updated":"2025-06-12T17:53:51Z","snapshot_observed_at":"2026-08-09T00:02:21.926480Z","submitted_at":"2025-06-12T17:53:51Z","title":"Domain2Vec: Vectorizing Datasets to Find the Optimal Data Mixture without Training","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T04:19:06.110067Z"},"links":{"cited_paper":"/paper/2405.14908","citing_paper":"/paper/2506.10952"},"observation_digest":"sha256:4a9fe8c3f1c9490d976ff1dc500e7560bb7722d3a435050cbd29793ed66b08e1","observation_id":"ee14808c-4cd9-46ba-ba7e-91720ffc2156","resolution":{"observed_at":"2026-08-07T04:19:06.110067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:19:18.616961Z","title":"S em E val-2012 task 7: Choice of plausible alternatives: An evaluation of commonsense causal reasoning","venue":null,"work_id":"77747479-41f4-4f41-970d-3bc71ec56e8a","year":2012},"citing_paper":{"arxiv_id":"2506.10952","last_updated":"2025-06-12T17:53:51Z","snapshot_observed_at":"2026-08-09T00:02:21.926480Z","submitted_at":"2025-06-12T17:53:51Z","title":"Domain2Vec: Vectorizing Datasets to Find the Optimal Data Mixture without Training","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T04:19:06.244720Z"},"links":{"citing_paper":"/paper/2506.10952"},"observation_digest":"sha256:0c4803747b55862d42b8a63e9cc0bdea1842d74a4c9b7829cc7b202e0b7f037e","observation_id":"6b3fe130-c88d-48fb-acfe-7a3ef6219159","resolution":{"observed_at":"2026-08-07T04:19:18.773659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T04:19:06.370050Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10952","last_updated":"2025-06-12T17:53:51Z","snapshot_observed_at":"2026-08-09T00:02:21.926480Z","submitted_at":"2025-06-12T17:53:51Z","title":"Domain2Vec: Vectorizing Datasets to Find the Optimal Data Mixture without Training","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T04:19:06.370050Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.10952"},"observation_digest":"sha256:a263143c21c30288784aff8a85137f983ba589cf9a6a481e02032dadc82da287","observation_id":"1a311c98-2493-46fa-a0c2-74b275e9c9fd","resolution":{"observed_at":"2026-08-07T04:19:06.370050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.emnlp-main.903","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"CMR scaling law: Predicting critical mixture ratios for continual pre-training of language models","venue":null,"work_id":"90d51ab6-a712-43ce-8a1b-168c63d950a4","year":2024},"citing_paper":{"arxiv_id":"2506.10952","last_updated":"2025-06-12T17:53:51Z","snapshot_observed_at":"2026-08-09T00:02:21.926480Z","submitted_at":"2025-06-12T17:53:51Z","title":"Domain2Vec: Vectorizing Datasets to Find the Optimal Data Mixture without Training","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T04:19:06.514933Z"},"links":{"citing_paper":"/paper/2506.10952"},"observation_digest":"sha256:c0fd4c3be2062a75e61da64aa70f0a1ddd6eb1fb1b90e0c3416438c9d96cd79d","observation_id":"4fa1f33a-c468-46fb-8b96-451521052e48","resolution":{"observed_at":"2026-08-07T04:19:11.583751Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07064","last_updated":"2025-03-18T23:52:27Z","snapshot_observed_at":"2026-08-06T21:53:46.581552Z","submitted_at":"2024-10-09T17:06:57Z","title":"Data Selection via Optimal Control for Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07064","snapshot_observed_at":"2026-08-07T04:19:06.688345Z","title":"Data selection via optimal control for language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10952","last_updated":"2025-06-12T17:53:51Z","snapshot_observed_at":"2026-08-09T00:02:21.926480Z","submitted_at":"2025-06-12T17:53:51Z","title":"Domain2Vec: Vectorizing Datasets to Find the Optimal Data Mixture without Training","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T04:19:06.688345Z"},"links":{"cited_paper":"/paper/2410.07064","citing_paper":"/paper/2506.10952"},"observation_digest":"sha256:320cf9b08e77a4202d7faed06706ef33be16bcd0457ab015dd0b1bfb047c30a2","observation_id":"c9b8c866-aae0-4ab3-bb09-4e4a55895a47","resolution":{"observed_at":"2026-08-07T04:19:06.688345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:19:18.253894Z","title":"V., and Smith, K","venue":null,"work_id":"37c3de66-881a-4f3f-a82f-3da04ba27083","year":2022},"citing_paper":{"arxiv_id":"2506.10952","last_updated":"2025-06-12T17:53:51Z","snapshot_observed_at":"2026-08-09T00:02:21.926480Z","submitted_at":"2025-06-12T17:53:51Z","title":"Domain2Vec: Vectorizing Datasets to Find the Optimal Data Mixture without Training","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T04:19:06.781962Z"},"links":{"citing_paper":"/paper/2506.10952"},"observation_digest":"sha256:8ae6973235e0b7ceefccd1bdb1dfa73f59034bf165b28e7b6370309efd57c025","observation_id":"3037b8d0-57e6-4420-bf01-73a4c64c7fc2","resolution":{"observed_at":"2026-08-07T04:19:18.402051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:19:06.947572Z","title":"H., and Friedman, J","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.10952","last_updated":"2025-06-12T17:53:51Z","snapshot_observed_at":"2026-08-09T00:02:21.926480Z","submitted_at":"2025-06-12T17:53:51Z","title":"Domain2Vec: Vectorizing Datasets to Find the Optimal Data Mixture without Training","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T04:19:06.947572Z"},"links":{"citing_paper":"/paper/2506.10952"},"observation_digest":"sha256:a0a0338a403100b4f2fee7d8271f686fd990eedf9d9696c33a38b788338b66b6","observation_id":"bc0ecc10-2344-4fb4-bd57-c67cda0083c9","resolution":{"observed_at":"2026-08-07T04:19:06.947572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-08-09T19:52:33.533277Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-07T04:19:07.085550Z","title":"A., Welbl, J., Clark, A., Hennigan, T., Noland, E., Millican, K., van den Driessche, G., Damoc, B., Guy, A., Osindero, S., Simonyan, K., Elsen, E., Rae, J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.10952","last_updated":"2025-06-12T17:53:51Z","snapshot_observed_at":"2026-08-09T00:02:21.926480Z","submitted_at":"2025-06-12T17:53:51Z","title":"Domain2Vec: Vectorizing Datasets to Find the Optimal Data Mixture without Training","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T04:19:07.085550Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2506.10952"},"observation_digest":"sha256:891a2172a149e2ef9573cc2079d649c264f48f946e5eaf2143ac42fb26e4438b","observation_id":"2b4c0efb-c935-4e9f-9c93-bdc89412ff13","resolution":{"observed_at":"2026-08-07T04:19:07.085550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:19:17.859282Z","title":"A., Welbl, J., Clark, A., Hennigan, T., Noland, E., Millican, K., van den Driessche, G., Damoc, B., Guy, A., Osindero, S., Simonyan, K., Elsen, E., Vinyals, O., Rae, J","venue":null,"work_id":"dcb6b8cd-98c0-4912-acee-149da7529683","year":2022},"citing_paper":{"arxiv_id":"2506.10952","last_updated":"2025-06-12T17:53:51Z","snapshot_observed_at":"2026-08-09T00:02:21.926480Z","submitted_at":"2025-06-12T17:53:51Z","title":"Domain2Vec: Vectorizing Datasets to Find the Optimal Data Mixture without Training","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T04:19:07.146299Z"},"links":{"citing_paper":"/paper/2506.10952"},"observation_digest":"sha256:b5fec3f01fb2d130ceeaf640258f7ff08661dab8c46c1bb544f66dbd7f4ddb76","observation_id":"a61d6b29-1bab-42bc-8290-daa94f7ee6d0","resolution":{"observed_at":"2026-08-07T04:19:18.067075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:19:07.273463Z","title":null,"venue":null,"work_id":null,"year":1964},"citing_paper":{"arxiv_id":"2506.10952","last_updated":"2025-06-12T17:53:51Z","snapshot_observed_at":"2026-08-09T00:02:21.926480Z","submitted_at":"2025-06-12T17:53:51Z","title":"Domain2Vec: Vectorizing Datasets to Find the Optimal Data Mixture without Training","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T04:19:07.273463Z"},"links":{"citing_paper":"/paper/2506.10952"},"observation_digest":"sha256:8a18d1aab37a67af830ba0983b05c6c84be3985a5b6ef13afa18c91c3a4937a5","observation_id":"b0aca12f-c72f-4a13-a262-ec07c2960b10","resolution":{"observed_at":"2026-08-07T04:19:07.273463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:19:17.509739Z","title":"S., Schmidt-Thieme, L., and Grabocka, J","venue":null,"work_id":"d066d760-f299-4451-8750-705b6c448e16","year":2021},"citing_paper":{"arxiv_id":"2506.10952","last_updated":"2025-06-12T17:53:51Z","snapshot_observed_at":"2026-08-09T00:02:21.926480Z","submitted_at":"2025-06-12T17:53:51Z","title":"Domain2Vec: Vectorizing Datasets to Find the Optimal Data Mixture without Training","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T04:19:07.373042Z"},"links":{"citing_paper":"/paper/2506.10952"},"observation_digest":"sha256:428eee6ca269027cfea3824a4fdb7d14a8528625f8fb129588f48c7c356a19b9","observation_id":"5db010b9-0585-4256-a111-bd59bea0bf09","resolution":{"observed_at":"2026-08-07T04:19:17.661402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-07T04:19:07.509003Z","title":"B., Chess, B., Child, R., Gray, S., Radford, A., Wu, J., and Amodei, D","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.10952","last_updated":"2025-06-12T17:53:51Z","snapshot_observed_at":"2026-08-09T00:02:21.926480Z","submitted_at":"2025-06-12T17:53:51Z","title":"Domain2Vec: Vectorizing Datasets to Find the Optimal Data Mixture without Training","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T04:19:07.509003Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2506.10952"},"observation_digest":"sha256:639ffd4f6ee6d8c3ac57d8470d39de1db4b5ea0771424847c89bdffb0148b0de","observation_id":"3d05bc31-1160-47d7-85c3-f0b2bef852bc","resolution":{"observed_at":"2026-08-07T04:19:07.509003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:19:17.186013Z","title":"Lightgbm: A highly efficient gradient boosting decision tree","venue":null,"work_id":"4f4475d6-5661-444d-98e9-f598b1279e49","year":2017},"citing_paper":{"arxiv_id":"2506.10952","last_updated":"2025-06-12T17:53:51Z","snapshot_observed_at":"2026-08-09T00:02:21.926480Z","submitted_at":"2025-06-12T17:53:51Z","title":"Domain2Vec: Vectorizing Datasets to Find the Optimal Data Mixture without Training","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T04:19:07.670501Z"},"links":{"citing_paper":"/paper/2506.10952"},"observation_digest":"sha256:4f9093324f8b56eac36dbf5cdbda839ae78798231763356e24a2594f927149e0","observation_id":"28b1bdb6-0513-417c-a542-9ff30d953169","resolution":{"observed_at":"2026-08-07T04:19:17.348865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:19:07.849579Z","title":"Looking beyond the surface: A challenge set for reading comprehension over multiple sentences","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.10952","last_updated":"2025-06-12T17:53:51Z","snapshot_observed_at":"2026-08-09T00:02:21.926480Z","submitted_at":"2025-06-12T17:53:51Z","title":"Domain2Vec: Vectorizing Datasets to Find the Optimal Data Mixture without Training","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T04:19:07.849579Z"},"links":{"citing_paper":"/paper/2506.10952"},"observation_digest":"sha256:cb1dd5d2558e6066befeda2359be890002d179cbce8a68c2168fdb4176c2fad5","observation_id":"fa5eec87-5d99-4c32-adfa-3dd4131dab22","resolution":{"observed_at":"2026-08-07T04:19:07.849579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:19:07.967559Z","title":"RACE : Large-scale R e A ding comprehension dataset from examinations","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.10952","last_updated":"2025-06-12T17:53:51Z","snapshot_observed_at":"2026-08-09T00:02:21.926480Z","submitted_at":"2025-06-12T17:53:51Z","title":"Domain2Vec: Vectorizing Datasets to Find the Optimal Data Mixture without Training","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T04:19:07.967559Z"},"links":{"citing_paper":"/paper/2506.10952"},"observation_digest":"sha256:500487ef2cc27c52f2830f448374453fe40a1f080aab9e0585a227674bf70dfc","observation_id":"d515f4e5-b32b-4dbf-80d4-dad73e26adaf","resolution":{"observed_at":"2026-08-07T04:19:07.967559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:19:16.801709Z","title":"Not all tokens are what you need for pretraining","venue":null,"work_id":"0b6bd113-f8eb-456b-9c77-b0bb82eb22de","year":2024},"citing_paper":{"arxiv_id":"2506.10952","last_updated":"2025-06-12T17:53:51Z","snapshot_observed_at":"2026-08-09T00:02:21.926480Z","submitted_at":"2025-06-12T17:53:51Z","title":"Domain2Vec: Vectorizing Datasets to Find the Optimal Data Mixture without Training","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T04:19:08.109415Z"},"links":{"citing_paper":"/paper/2506.10952"},"observation_digest":"sha256:f9b90b7ea22c61d3d2bc46707a79b0d2ed4f9be2f41b32417c59b01f99e65eb7","observation_id":"2a9418f5-9f61-4c41-aca4-fbc309ea8ab9","resolution":{"observed_at":"2026-08-07T04:19:16.966571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:19:08.255118Z","title":"Logiqa: a challenge dataset for machine reading comprehension with logical reasoning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.10952","last_updated":"2025-06-12T17:53:51Z","snapshot_observed_at":"2026-08-09T00:02:21.926480Z","submitted_at":"2025-06-12T17:53:51Z","title":"Domain2Vec: Vectorizing Datasets to Find the Optimal Data Mixture without Training","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T04:19:08.255118Z"},"links":{"citing_paper":"/paper/2506.10952"},"observation_digest":"sha256:164e42487de36e3d89fe1d47cc673ab404e68074aa1d5b547c8c97efec5969e5","observation_id":"3641c731-e492-4180-a9ec-9cab909a1615","resolution":{"observed_at":"2026-08-07T04:19:08.255118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01492","last_updated":"2025-01-23T17:35:43Z","snapshot_observed_at":"2026-08-09T06:27:14.768185Z","submitted_at":"2024-07-01T17:31:03Z","title":"RegMix: Data Mixture as Regression for Language Model Pre-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01492","snapshot_observed_at":"2026-08-07T04:19:08.394746Z","title":"Regmix: Data mixture as regression for language model pre-training, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10952","last_updated":"2025-06-12T17:53:51Z","snapshot_observed_at":"2026-08-09T00:02:21.926480Z","submitted_at":"2025-06-12T17:53:51Z","title":"Domain2Vec: Vectorizing Datasets to Find the Optimal Data Mixture without Training","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T04:19:08.394746Z"},"links":{"cited_paper":"/paper/2407.01492","citing_paper":"/paper/2506.10952"},"observation_digest":"sha256:b62256229e61f16460299ba6eb7c5d6868416d489db07f888180cc313fe7d12b","observation_id":"a96b27b8-a264-4bd2-9990-f3f620b06f1f","resolution":{"observed_at":"2026-08-07T04:19:08.394746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-07T04:19:08.491601Z","title":"and Hutter, F","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.10952","last_updated":"2025-06-12T17:53:51Z","snapshot_observed_at":"2026-08-09T00:02:21.926480Z","submitted_at":"2025-06-12T17:53:51Z","title":"Domain2Vec: Vectorizing Datasets to Find the Optimal Data Mixture without Training","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T04:19:08.491601Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2506.10952"},"observation_digest":"sha256:869b87502fa594c9bba2ca163a7cd0bdc1480294f2846c00bd5fc0aeeb78bc95","observation_id":"15ebcb6b-aab6-4b5b-b14e-3ffaaee57b9a","resolution":{"observed_at":"2026-08-07T04:19:08.491601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:19:16.476377Z","title":"Some methods for classification and analysis of multivariate observations","venue":null,"work_id":"ac769865-215a-4884-b83c-81a933ac095c","year":1967},"citing_paper":{"arxiv_id":"2506.10952","last_updated":"2025-06-12T17:53:51Z","snapshot_observed_at":"2026-08-09T00:02:21.926480Z","submitted_at":"2025-06-12T17:53:51Z","title":"Domain2Vec: Vectorizing Datasets to Find the Optimal Data Mixture without Training","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T04:19:08.599517Z"},"links":{"citing_paper":"/paper/2506.10952"},"observation_digest":"sha256:ef5cf6992e813c7526561c979415be1f871ba76c80117645b475a184ee043be7","observation_id":"e81c65ec-f9c6-461e-842d-d440cb8af013","resolution":{"observed_at":"2026-08-07T04:19:16.582732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:19:16.242437Z","title":"Can a suit of armor conduct electricity? a new dataset for open book question answering","venue":null,"work_id":"61287351-a347-43db-aad4-160a1be65f87","year":2018},"citing_paper":{"arxiv_id":"2506.10952","last_updated":"2025-06-12T17:53:51Z","snapshot_observed_at":"2026-08-09T00:02:21.926480Z","submitted_at":"2025-06-12T17:53:51Z","title":"Domain2Vec: Vectorizing Datasets to Find the Optimal Data Mixture without Training","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T04:19:08.801169Z"},"links":{"citing_paper":"/paper/2506.10952"},"observation_digest":"sha256:15d660c8cb0bb8724dd4bae81dbc40e4a829f40de234dcdc181c8c6a61e857a5","observation_id":"cda02639-cf84-467b-b204-4ac489126ff3","resolution":{"observed_at":"2026-08-07T04:19:16.337236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T04:19:08.901499Z","title":"Gpt-4 technical report, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10952","last_updated":"2025-06-12T17:53:51Z","snapshot_observed_at":"2026-08-09T00:02:21.926480Z","submitted_at":"2025-06-12T17:53:51Z","title":"Domain2Vec: Vectorizing Datasets to Find the Optimal Data Mixture without Training","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T04:19:08.901499Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.10952"},"observation_digest":"sha256:2c0b9c3acc7176ea51187f3af625cb1190cd757a3cfbca5af65571d587900a37","observation_id":"3986d171-07d7-4d1c-bec3-6d88314a4849","resolution":{"observed_at":"2026-08-07T04:19:08.901499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:19:09.056334Z","title":"Q., Bernardi, R., Pezzelle, S., Baroni, M., Boleda, G., and Fern \\'a ndez, R","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.10952","last_updated":"2025-06-12T17:53:51Z","snapshot_observed_at":"2026-08-09T00:02:21.926480Z","submitted_at":"2025-06-12T17:53:51Z","title":"Domain2Vec: Vectorizing Datasets to Find the Optimal Data Mixture without Training","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T04:19:09.056334Z"},"links":{"citing_paper":"/paper/2506.10952"},"observation_digest":"sha256:48c20ae59db8db7bbdc686d6e9f552c8cae2fc1c7e56ecb6fa70a5d88f51f3fa","observation_id":"e8bb77d4-9e4d-41cc-918e-7953c2e48fe8","resolution":{"observed_at":"2026-08-07T04:19:09.056334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:19:15.959382Z","title":"B., Lozhkov, A., Mitchell, M., Raffel, C., Werra, L","venue":null,"work_id":"6eadb35e-ce0e-4afa-aab2-c5e36ad35594","year":2024},"citing_paper":{"arxiv_id":"2506.10952","last_updated":"2025-06-12T17:53:51Z","snapshot_observed_at":"2026-08-09T00:02:21.926480Z","submitted_at":"2025-06-12T17:53:51Z","title":"Domain2Vec: Vectorizing Datasets to Find the Optimal Data Mixture without Training","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T04:19:09.206680Z"},"links":{"citing_paper":"/paper/2506.10952"},"observation_digest":"sha256:499741a7ca89ab2c1e25ee2f22058190d10d1af3d429091517454fc97d89a33c","observation_id":"909bae5a-a467-4000-9335-6ef00d7e9f3e","resolution":{"observed_at":"2026-08-07T04:19:16.079631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:19:15.678435Z","title":"D-cpt law: Domain-specific continual pre-training scaling law for large language models","venue":null,"work_id":"e9df27c2-0e98-4dd7-9964-06aeb605f9fd","year":2024},"citing_paper":{"arxiv_id":"2506.10952","last_updated":"2025-06-12T17:53:51Z","snapshot_observed_at":"2026-08-09T00:02:21.926480Z","submitted_at":"2025-06-12T17:53:51Z","title":"Domain2Vec: Vectorizing Datasets to Find the Optimal Data Mixture without Training","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T04:19:09.316683Z"},"links":{"citing_paper":"/paper/2506.10952"},"observation_digest":"sha256:4d692ac70ceb1bef75342c827a0935af1c97e2372267d1aee1eb18d78698147f","observation_id":"51f31caa-db4d-4702-af24-3e3dcc179a9e","resolution":{"observed_at":"2026-08-07T04:19:15.801841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-07T04:19:09.397800Z","title":"Qwen2 technical report, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10952","last_updated":"2025-06-12T17:53:51Z","snapshot_observed_at":"2026-08-09T00:02:21.926480Z","submitted_at":"2025-06-12T17:53:51Z","title":"Domain2Vec: Vectorizing Datasets to Find the Optimal Data Mixture without Training","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T04:19:09.397800Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2506.10952"},"observation_digest":"sha256:be75f8192dda9a104f44be49556ae1b2565ae8dd8530f525e12459db2e6db0a8","observation_id":"df65be68-87cf-4d85-b930-c297b992b76f","resolution":{"observed_at":"2026-08-07T04:19:09.397800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:19:15.396934Z","title":"Improving language understanding by generative pre-training","venue":null,"work_id":"9167bba5-e781-454a-84aa-22afdda20d79","year":2018},"citing_paper":{"arxiv_id":"2506.10952","last_updated":"2025-06-12T17:53:51Z","snapshot_observed_at":"2026-08-09T00:02:21.926480Z","submitted_at":"2025-06-12T17:53:51Z","title":"Domain2Vec: Vectorizing Datasets to Find the Optimal Data Mixture without Training","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T04:19:09.496631Z"},"links":{"citing_paper":"/paper/2506.10952"},"observation_digest":"sha256:fe1803eb3b6dcf3571d87537521c1fed7bc0b145cc901c472c7082d66c34a649","observation_id":"128ba91b-2acf-4fdf-93c8-924dedff6d98","resolution":{"observed_at":"2026-08-07T04:19:15.508809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.11446","last_updated":"2022-01-21T18:39:38Z","snapshot_observed_at":"2026-08-09T14:52:01.161814Z","submitted_at":"2021-12-08T19:41:47Z","title":"Scaling Language Models: Methods, Analysis & Insights from Training Gopher","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.11446","snapshot_observed_at":"2026-08-07T04:19:09.584692Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.10952","last_updated":"2025-06-12T17:53:51Z","snapshot_observed_at":"2026-08-09T00:02:21.926480Z","submitted_at":"2025-06-12T17:53:51Z","title":"Domain2Vec: Vectorizing Datasets to Find the Optimal Data Mixture without Training","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T04:19:09.584692Z"},"links":{"cited_paper":"/paper/2112.11446","citing_paper":"/paper/2506.10952"},"observation_digest":"sha256:6de28b3559b45fa8af1f71c7a8c07303d8c9282319c83d61d07af4117ed2019a","observation_id":"7ae6989d-d90e-4cca-80c3-d7965b74c2c7","resolution":{"observed_at":"2026-08-07T04:19:09.584692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:19:09.654342Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.10952","last_updated":"2025-06-12T17:53:51Z","snapshot_observed_at":"2026-08-09T00:02:21.926480Z","submitted_at":"2025-06-12T17:53:51Z","title":"Domain2Vec: Vectorizing Datasets to Find the Optimal Data Mixture without Training","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T04:19:09.654342Z"},"links":{"citing_paper":"/paper/2506.10952"},"observation_digest":"sha256:511026c14503e17f46171edfc61458030ad486785e1c988f8d48298266994c57","observation_id":"9bb47e5a-a264-4656-84c5-30e91f78cbdd","resolution":{"observed_at":"2026-08-07T04:19:09.654342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:19:15.098179Z","title":"W., Hashimoto, T","venue":null,"work_id":"d22e3674-f425-4c02-9996-72e632d2e715","year":2020},"citing_paper":{"arxiv_id":"2506.10952","last_updated":"2025-06-12T17:53:51Z","snapshot_observed_at":"2026-08-09T00:02:21.926480Z","submitted_at":"2025-06-12T17:53:51Z","title":"Domain2Vec: Vectorizing Datasets to Find the Optimal Data Mixture without Training","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T04:19:09.742647Z"},"links":{"citing_paper":"/paper/2506.10952"},"observation_digest":"sha256:a51aa0133f0b2b65e338bfd3939a8ef71fd539bb83414c5912555c8c7f25e719","observation_id":"c7c0f0f9-6a3a-437a-9426-cb6192962d62","resolution":{"observed_at":"2026-08-07T04:19:15.271649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:19:09.846389Z","title":"L., Bhagavatula, C., and Choi, Y","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.10952","last_updated":"2025-06-12T17:53:51Z","snapshot_observed_at":"2026-08-09T00:02:21.926480Z","submitted_at":"2025-06-12T17:53:51Z","title":"Domain2Vec: Vectorizing Datasets to Find the Optimal Data Mixture without Training","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T04:19:09.846389Z"},"links":{"citing_paper":"/paper/2506.10952"},"observation_digest":"sha256:3879bd5a5093a3014f10a11db922eb48785cf7ea5e93d838f54a998d8ebc43b2","observation_id":"02d10b5b-4148-4fd0-9184-c40bedc80ebd","resolution":{"observed_at":"2026-08-07T04:19:09.846389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:19:09.950458Z","title":"Social IQ a: Commonsense reasoning about social interactions","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.10952","last_updated":"2025-06-12T17:53:51Z","snapshot_observed_at":"2026-08-09T00:02:21.926480Z","submitted_at":"2025-06-12T17:53:51Z","title":"Domain2Vec: Vectorizing Datasets to Find the Optimal Data Mixture without Training","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T04:19:09.950458Z"},"links":{"citing_paper":"/paper/2506.10952"},"observation_digest":"sha256:aa43df9a141b6c05bdea4c2a993d2f14fa8fe12a46843ebfee3e227c38f1540a","observation_id":"68496c35-c5de-45b2-9d60-9de0dc544f55","resolution":{"observed_at":"2026-08-07T04:19:09.950458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:19:14.782612Z","title":"Self-influence guided data reweighting for language model pre-training","venue":null,"work_id":"ce72d12c-6570-4247-94b7-00b21c40745e","year":2023},"citing_paper":{"arxiv_id":"2506.10952","last_updated":"2025-06-12T17:53:51Z","snapshot_observed_at":"2026-08-09T00:02:21.926480Z","submitted_at":"2025-06-12T17:53:51Z","title":"Domain2Vec: Vectorizing Datasets to Find the Optimal Data Mixture without Training","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T04:19:10.037663Z"},"links":{"citing_paper":"/paper/2506.10952"},"observation_digest":"sha256:26f94488db3223e2a2a99fbb8649d10cebea0f8d167b617c39502ae3a9d621c7","observation_id":"b7c78fb7-fa74-402b-a247-29b0773f37ec","resolution":{"observed_at":"2026-08-07T04:19:14.942881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T04:19:10.099522Z","title":"C., Chen, M., Cucurull, G., Esiobu, D., Fernandes, J., Fu, J., Fu, W., Fuller, B., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10952","last_updated":"2025-06-12T17:53:51Z","snapshot_observed_at":"2026-08-09T00:02:21.926480Z","submitted_at":"2025-06-12T17:53:51Z","title":"Domain2Vec: Vectorizing Datasets to Find the Optimal Data Mixture without Training","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T04:19:10.099522Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2506.10952"},"observation_digest":"sha256:4e67a2b0ee88c2bc6ff55ba78bd9e9e98386284013d0197a1caf70c8c5ac57ff","observation_id":"453e0082-ae34-4f93-85eb-2bc47ef8a6ce","resolution":{"observed_at":"2026-08-07T04:19:10.099522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:19:10.178365Z","title":"and Hinton, G","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2506.10952","last_updated":"2025-06-12T17:53:51Z","snapshot_observed_at":"2026-08-09T00:02:21.926480Z","submitted_at":"2025-06-12T17:53:51Z","title":"Domain2Vec: Vectorizing Datasets to Find the Optimal Data Mixture without Training","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T04:19:10.178365Z"},"links":{"citing_paper":"/paper/2506.10952"},"observation_digest":"sha256:7f93c0ffea21a227a6419c6df7648a12d45b5ae4e811a3e1022747f30b4ba49c","observation_id":"567f32ab-526b-40cb-b391-f820d1d0e369","resolution":{"observed_at":"2026-08-07T04:19:10.178365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07796","last_updated":"2025-06-19T10:38:17Z","snapshot_observed_at":"2026-08-07T15:47:47.164762Z","submitted_at":"2025-05-12T17:47:32Z","title":"Learning Dynamics in Continual Pre-Training for Large Language Models","version":2},"cited_work":{"arxiv_id":"2505.07796","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.07796","snapshot_observed_at":"2026-08-07T04:19:11.804438Z","title":"Learning Dynamics in Continual Pre-Training for Large Language Models","venue":"cs.CL","work_id":"80208eb8-f82b-4805-a610-4bc4fc307a2c","year":2025},"citing_paper":{"arxiv_id":"2506.10952","last_updated":"2025-06-12T17:53:51Z","snapshot_observed_at":"2026-08-09T00:02:21.926480Z","submitted_at":"2025-06-12T17:53:51Z","title":"Domain2Vec: Vectorizing Datasets to Find the Optimal Data Mixture without Training","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T04:19:10.282840Z"},"links":{"cited_paper":"/paper/2505.07796","citing_paper":"/paper/2506.10952"},"observation_digest":"sha256:5cd8233482c3c382c428b8bc31775775e477cdf1e82fdcf34cb838feaed1787a","observation_id":"f881e0e2-8d5b-4e42-93fc-65d87c471d6c","resolution":{"observed_at":"2026-08-07T04:19:11.911632Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.12372","last_updated":"2024-11-19T09:35:28Z","snapshot_observed_at":"2026-08-06T21:35:45.662025Z","submitted_at":"2024-11-19T09:35:28Z","title":"RedPajama: an Open Dataset for Training Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.12372","snapshot_observed_at":"2026-08-07T04:19:10.350194Z","title":"Redpajama: an open dataset for training large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10952","last_updated":"2025-06-12T17:53:51Z","snapshot_observed_at":"2026-08-09T00:02:21.926480Z","submitted_at":"2025-06-12T17:53:51Z","title":"Domain2Vec: Vectorizing Datasets to Find the Optimal Data Mixture without Training","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T04:19:10.350194Z"},"links":{"cited_paper":"/paper/2411.12372","citing_paper":"/paper/2506.10952"},"observation_digest":"sha256:c63b745b8c45c6178bd775b3293e8982b373d55638e6e5eb346dd1984d17b4d5","observation_id":"2a633f51-b59d-4224-8915-6a1fad4c7ad1","resolution":{"observed_at":"2026-08-07T04:19:10.350194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:19:10.444975Z","title":"F., and Gardner, M","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.10952","last_updated":"2025-06-12T17:53:51Z","snapshot_observed_at":"2026-08-09T00:02:21.926480Z","submitted_at":"2025-06-12T17:53:51Z","title":"Domain2Vec: Vectorizing Datasets to Find the Optimal Data Mixture without Training","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T04:19:10.444975Z"},"links":{"citing_paper":"/paper/2506.10952"},"observation_digest":"sha256:0e2d753593c9356301f1263d55225f47eb98a55fec776e8ffcbb0b0a6df3be7a","observation_id":"94fc3b50-0d5a-4d2e-846a-11952fb1e08a","resolution":{"observed_at":"2026-08-07T04:19:10.444975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:19:14.462232Z","title":"C-pack: Packaged resources to advance general chinese embedding, 2023","venue":null,"work_id":"14a2dded-a7d4-4fd7-bd5e-e01e0feb1c54","year":2023},"citing_paper":{"arxiv_id":"2506.10952","last_updated":"2025-06-12T17:53:51Z","snapshot_observed_at":"2026-08-09T00:02:21.926480Z","submitted_at":"2025-06-12T17:53:51Z","title":"Domain2Vec: Vectorizing Datasets to Find the Optimal Data Mixture without Training","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T04:19:10.532719Z"},"links":{"citing_paper":"/paper/2506.10952"},"observation_digest":"sha256:ccb05285e92359c008ae8bf4115dbd3df8aaf58f380d739cbcf1df842b00260b","observation_id":"5c98e9f7-60a3-4e21-8647-30badaad4d2f","resolution":{"observed_at":"2026-08-07T04:19:14.606366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:19:14.140523Z","title":"M., Pham, H., Dong, X., Du, N., Liu, H., Lu, Y., Liang, P., Le, Q","venue":null,"work_id":"90928124-a930-4517-92b9-5ba6a314b4c4","year":2023},"citing_paper":{"arxiv_id":"2506.10952","last_updated":"2025-06-12T17:53:51Z","snapshot_observed_at":"2026-08-09T00:02:21.926480Z","submitted_at":"2025-06-12T17:53:51Z","title":"Domain2Vec: Vectorizing Datasets to Find the Optimal Data Mixture without Training","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T04:19:10.626223Z"},"links":{"citing_paper":"/paper/2506.10952"},"observation_digest":"sha256:c3949968edf4480604d1b4a176a80a4dcb2162adeb94765448774e0ee6475728","observation_id":"2f36a394-6086-419d-92fd-cff21e86821e","resolution":{"observed_at":"2026-08-07T04:19:14.317126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:19:13.770149Z","title":"M., Santurkar, S., Ma, T., and Liang, P","venue":null,"work_id":"9d9c87b0-23fa-46ce-9b79-5bfaa1cf3b65","year":2023},"citing_paper":{"arxiv_id":"2506.10952","last_updated":"2025-06-12T17:53:51Z","snapshot_observed_at":"2026-08-09T00:02:21.926480Z","submitted_at":"2025-06-12T17:53:51Z","title":"Domain2Vec: Vectorizing Datasets to Find the Optimal Data Mixture without Training","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T04:19:10.703150Z"},"links":{"citing_paper":"/paper/2506.10952"},"observation_digest":"sha256:8615c3a7161edb1bc0f637252dc735851fa3a9c57b48b827107a5cb0979bb6de","observation_id":"968da2f7-e792-43ea-8804-346f988730db","resolution":{"observed_at":"2026-08-07T04:19:13.932011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16952","last_updated":"2025-03-20T03:31:27Z","snapshot_observed_at":"2026-07-06T17:50:18.017647Z","submitted_at":"2024-03-25T17:14:00Z","title":"Data Mixing Laws: Optimizing Data Mixtures by Predicting Language Modeling Performance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.16952","snapshot_observed_at":"2026-08-07T04:19:10.793759Z","title":"Data mixing laws: Optimizing data mixtures by predicting language modeling performance, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10952","last_updated":"2025-06-12T17:53:51Z","snapshot_observed_at":"2026-08-09T00:02:21.926480Z","submitted_at":"2025-06-12T17:53:51Z","title":"Domain2Vec: Vectorizing Datasets to Find the Optimal Data Mixture without Training","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T04:19:10.793759Z"},"links":{"cited_paper":"/paper/2403.16952","citing_paper":"/paper/2506.10952"},"observation_digest":"sha256:20cc67504f8b657ffd01bdf4065947e39772973242de5e6289613d7e229e44e5","observation_id":"024a254e-8ef7-4f2c-b59d-0c32fcacb218","resolution":{"observed_at":"2026-08-07T04:19:10.793759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:19:13.364003Z","title":"Hellaswag: Can a machine really finish your sentence? In Annual Meeting of the Association for Computational Linguistics, 2019","venue":null,"work_id":"b9ffb9a7-1d82-4ba7-9cae-84082054723c","year":2019},"citing_paper":{"arxiv_id":"2506.10952","last_updated":"2025-06-12T17:53:51Z","snapshot_observed_at":"2026-08-09T00:02:21.926480Z","submitted_at":"2025-06-12T17:53:51Z","title":"Domain2Vec: Vectorizing Datasets to Find the Optimal Data Mixture without Training","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T04:19:10.914414Z"},"links":{"citing_paper":"/paper/2506.10952"},"observation_digest":"sha256:51356593978d9b35118d89c14f0a8fbf2b3d7a6e342577ea20afc51b253fad69","observation_id":"ed166475-b0e1-41f5-aae6-c00ec04ecbac","resolution":{"observed_at":"2026-08-07T04:19:13.596553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:19:13.031502Z","title":"LIMA : Less is more for alignment","venue":null,"work_id":"92daf7de-0a32-429a-83af-a05b019d4c6a","year":2023},"citing_paper":{"arxiv_id":"2506.10952","last_updated":"2025-06-12T17:53:51Z","snapshot_observed_at":"2026-08-09T00:02:21.926480Z","submitted_at":"2025-06-12T17:53:51Z","title":"Domain2Vec: Vectorizing Datasets to Find the Optimal Data Mixture without Training","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T04:19:11.007446Z"},"links":{"citing_paper":"/paper/2506.10952"},"observation_digest":"sha256:f95ffd8d29ba2d54b642b5f51ee282d68aa5d3db9a14ff1143935a8f82892110","observation_id":"dbc2900e-8802-4a8e-b9b1-867931298325","resolution":{"observed_at":"2026-08-07T04:19:13.143966Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:19:11.124746Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10952","last_updated":"2025-06-12T17:53:51Z","snapshot_observed_at":"2026-08-09T00:02:21.926480Z","submitted_at":"2025-06-12T17:53:51Z","title":"Domain2Vec: Vectorizing Datasets to Find the Optimal Data Mixture without Training","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T04:19:11.124746Z"},"links":{"citing_paper":"/paper/2506.10952"},"observation_digest":"sha256:0fce61db8682cfb149570e154977de146c0d576e622aad6c72b54381ae524742","observation_id":"9e46c7fd-fb5b-4c1a-809a-a2f94e6b0792","resolution":{"observed_at":"2026-08-07T04:19:11.124746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.10952","last_updated":"2025-06-12T17:53:51Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T00:02:21.926480Z","submitted_at":"2025-06-12T17:53:51Z","title":"Domain2Vec: Vectorizing Datasets to Find the Optimal Data Mixture without Training"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":3,"verified_fuzzy":21},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 1 inbound Pith citation observation for arXiv:2506.10952."}