{"as_of":"2026-08-19T00:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4004aa439312f8c5d00b8d6ff6944b6d9c77a42987aaf3f6d6922aad9841cc89","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:51:08.173184Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2504.14508/citation-record","integrity":"/paper/2504.14508/integrity","json":"/paper/2504.14508/citation-record.json","paper":"/paper/2504.14508"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-16T11:51:07.953645Z","title":"L., Almeida, D., Altenschmidt, J., Altman, S., Anadkat, S., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T15:55:46.378802Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:07.953645Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:a6c8cce40ce26a4c755067d9df066ebe8f7ff5f08b2893d29718a1546864590e","observation_id":"7b5b5225-59fc-49b9-85e0-ce62df844a8f","resolution":{"observed_at":"2026-08-16T11:51:07.953645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16827","last_updated":"2024-08-02T17:59:31Z","snapshot_observed_at":"2026-08-16T14:15:11.706978Z","submitted_at":"2024-02-26T18:54:35Z","title":"A Survey on Data Selection for Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16827","snapshot_observed_at":"2026-08-16T11:51:07.958791Z","title":"M., Longpre, S., Lambert, N., W ang, X., Muennighoff, N., Hou, B., Pan, L., Jeong, H., et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T15:55:46.378802Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:07.958791Z"},"links":{"cited_paper":"/paper/2402.16827","citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:3f4816258937b5347b77efbec6159bd32a1f99871406983e9ae8d3d9efec1853","observation_id":"a190d634-5a69-457a-91aa-8529500d2f14","resolution":{"observed_at":"2026-08-16T11:51:07.958791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-16T11:51:07.963257Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T15:55:46.378802Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:07.963257Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:28747b30410e488f556ec3297aabb69f2e048d75633b3747c51666beadb03d1c","observation_id":"0fbc250d-2f94-43a7-860b-2e8883912d14","resolution":{"observed_at":"2026-08-16T11:51:07.963257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:51:08.787164Z","title":"Why it is hard to find ai in smes: A survey from the practice and how to promote it","venue":null,"work_id":"de98e6b4-f744-41b6-9463-5af40a7935d8","year":2021},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T15:55:46.378802Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:07.967101Z"},"links":{"citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:5dd17656c4bae858527dc51bb3de1ced8a145a6491cb42d28913f19d871863f9","observation_id":"8174cfde-dca2-45d3-acf1-aedbd9aebf54","resolution":{"observed_at":"2026-08-16T11:51:08.790582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:51:08.776159Z","title":"Stars: Tera-scale graph building for clustering and learning.Advances in Neural Information Processing Systems 35 (2022), 21470–21481","venue":null,"work_id":"aa154cff-213a-4f54-a073-5c25f9c731b4","year":2022},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T15:55:46.378802Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:07.970921Z"},"links":{"citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:eff1b1468ad1f937536df0c91b2dd1f2d3d9c344d46a678ccee3bfde3bcb01fa","observation_id":"4d9ed737-f3f8-4a26-bae3-d1621ee62370","resolution":{"observed_at":"2026-08-16T11:51:08.780175Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08701","last_updated":"2024-02-13T18:37:25Z","snapshot_observed_at":"2026-08-16T15:15:35.760076Z","submitted_at":"2023-07-17T17:59:40Z","title":"AlpaGasus: Training A Better Alpaca with Fewer Data","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08701","snapshot_observed_at":"2026-08-16T11:51:07.974904Z","title":"Alpagasus: Training a better alpaca with fewer data.arXiv preprint arXiv:2307.08701 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T15:55:46.378802Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:07.974904Z"},"links":{"cited_paper":"/paper/2307.08701","citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:27a3cd808e6315c77c5d09286244b648c9ea7fc9e04c187058cdf35d9c1f7bd1","observation_id":"6e2926f9-6ca6-4831-b9ea-b28eb3bb28c7","resolution":{"observed_at":"2026-08-16T11:51:07.974904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.11829","last_updated":"2020-10-27T00:52:20Z","snapshot_observed_at":"2026-08-18T17:03:03.056150Z","submitted_at":"2019-06-26T23:01:47Z","title":"Selection via Proxy: Efficient Data Selection for Deep Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.11829","snapshot_observed_at":"2026-08-16T11:51:07.979544Z","title":"Selection via proxy: Efficient data selection for deep learning.arXiv preprint arXiv:1906.11829 (2019)","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T15:55:46.378802Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:07.979544Z"},"links":{"cited_paper":"/paper/1906.11829","citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:6ea3078c92d9b56d5eb52dc98a0e0693589e9e54c90157deb81f4562dcb4c4ea","observation_id":"ea33a409-b6b2-44fb-810a-129490e80e7e","resolution":{"observed_at":"2026-08-16T11:51:07.979544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:51:08.764492Z","title":"When low resource nlp meets unsupervised language model: Meta-pretraining then meta-learning for few-shot text classification (student abstract)","venue":null,"work_id":"79cf4e56-1f4e-4ebf-beb1-3b374c36e224","year":2020},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T15:55:46.378802Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:07.983367Z"},"links":{"citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:fb5730afc6a86405dfa9d8a95f32d75d9e28c44169a2c2bf01736c23569fa9f1","observation_id":"f5723806-0220-4bfd-8e28-c494a745b050","resolution":{"observed_at":"2026-08-16T11:51:08.768238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-08-14T18:16:28.847993Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-16T11:51:07.988106Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding.arXiv preprint arXiv:1810.04805 (2018)","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T15:55:46.378802Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:07.988106Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:6dbc29f2b50926d35964811fcc1ba73646aab409a7161c67223416b5f2134633","observation_id":"bc9e3980-9323-4795-a86f-034d63cd43b7","resolution":{"observed_at":"2026-08-16T11:51:07.988106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.01549","last_updated":"2020-11-03T07:49:15Z","snapshot_observed_at":"2026-08-16T19:08:31.154781Z","submitted_at":"2020-11-03T07:49:15Z","title":"DAGA: Data Augmentation with a Generation Approach for Low-resource Tagging Tasks","version":1},"cited_work":{"arxiv_id":"2011.01549","doi":null,"metadata_source":"pith","pith_arxiv_id":"2011.01549","snapshot_observed_at":"2026-08-16T11:51:08.391916Z","title":"DAGA: Data Augmentation with a Generation Approach for Low-resource Tagging Tasks","venue":"cs.CL","work_id":"061be12a-e13e-481d-9d3b-2d21a4d742d2","year":2020},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T15:55:46.378802Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:07.991586Z"},"links":{"cited_paper":"/paper/2011.01549","citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:d5f288725679c83f8a67040ca7bf336ab63be586f6f758adc6c2f4e206a945ba","observation_id":"1b9957e8-a81a-4729-aa93-763416343d34","resolution":{"observed_at":"2026-08-16T11:51:08.397654Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10450","last_updated":"2023-06-14T16:11:50Z","snapshot_observed_at":"2026-08-18T08:12:27.255968Z","submitted_at":"2022-12-20T17:28:41Z","title":"Is GPT-3 a Good Data Annotator?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10450","snapshot_observed_at":"2026-08-16T11:51:07.995216Z","title":"K., Joty, S., Li, B., and Bing, L","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T15:55:46.378802Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:07.995216Z"},"links":{"cited_paper":"/paper/2212.10450","citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:6e9a10d0fa994f7655c6a9dac51e563fc30ddd71becc821f3714debe19a6b1e2","observation_id":"196dd62c-c81e-4bfe-9c82-843e86eed898","resolution":{"observed_at":"2026-08-16T11:51:07.995216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.06305","last_updated":"2020-02-15T02:40:10Z","snapshot_observed_at":"2026-08-12T00:45:25.809655Z","submitted_at":"2020-02-15T02:40:10Z","title":"Fine-Tuning Pretrained Language Models: Weight Initializations, Data Orders, and Early Stopping","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.06305","snapshot_observed_at":"2026-08-16T11:51:07.998772Z","title":"Fine-tuning pretrained language models: Weight initializations, data orders, and early stopping.arXiv preprint arXiv:2002.06305 (2020)","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T15:55:46.378802Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:07.998772Z"},"links":{"cited_paper":"/paper/2002.06305","citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:c4300277501a344e7e18d87d3d1e347047dfef6a2d37830587820b74807b31b4","observation_id":"fd744923-eb6d-4517-9392-ba6a0a9c2593","resolution":{"observed_at":"2026-08-16T11:51:07.998772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:51:08.752774Z","title":"Clustering for private interest-based advertising","venue":null,"work_id":"62de79aa-4a3e-4659-9f25-80edf62ad94a","year":2021},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T15:55:46.378802Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:08.002387Z"},"links":{"citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:7de7760151a92c04cc554265164a08e6785ebd7ac4db711327c28e8f9d739f0f","observation_id":"e29ea948-0d18-4662-9548-32565161da42","resolution":{"observed_at":"2026-08-16T11:51:08.757918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:51:08.742735Z","title":"A threshold of ln n for approximating set cover.Journal of the ACM (JACM) 45, 4 (1998), 634–652","venue":null,"work_id":"e9a5eb04-01d1-4d5b-912d-5d5a45e75f89","year":1998},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T15:55:46.378802Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:08.005601Z"},"links":{"citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:435a72b85a8ec074beddc2f43eeb72cc8c937c4cb073d206c5d0fda23e023d58","observation_id":"b4729c0c-1468-4e3b-ae9e-ba8fa4fc3624","resolution":{"observed_at":"2026-08-16T11:51:08.746507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14361","last_updated":"2024-04-26T19:02:23Z","snapshot_observed_at":"2026-08-18T11:17:15.212859Z","submitted_at":"2024-04-22T17:15:32Z","title":"Better Synthetic Data by Retrieving and Transforming Existing Datasets","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14361","snapshot_observed_at":"2026-08-16T11:51:08.008926Z","title":"Better synthetic data by retrieving and transforming existing datasets.arXiv preprint arXiv:2404.14361(2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T15:55:46.378802Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:08.008926Z"},"links":{"cited_paper":"/paper/2404.14361","citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:c841717830d5359c88330b2228a19139cc6d226ec888ef3cb166e0d661c289eb","observation_id":"b4e186af-f061-4650-9ed3-4f513cb397d6","resolution":{"observed_at":"2026-08-16T11:51:08.008926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:51:08.732382Z","title":"Chatgpt outperforms crowd workers for text-annotation tasks","venue":null,"work_id":"521c47bc-7f1a-4a30-973e-c94c56b5cb86","year":2023},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T15:55:46.378802Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:08.012100Z"},"links":{"citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:e19345ce354b53a6dc42127284c4025669c01b07a8f0a40196e662f383f4ea77","observation_id":"6ae11299-c285-4544-888c-ed44f68efbd6","resolution":{"observed_at":"2026-08-16T11:51:08.735806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:51:08.722437Z","title":"Domain adaptation for large-scale sentiment classification: A deep learning approach","venue":null,"work_id":"2b01b09f-caec-4a54-b230-fbb965f34940","year":2011},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T15:55:46.378802Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:08.015350Z"},"links":{"citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:9822a3b283b75df0d3558f266f05a2c9b26993a2383da82ec0662adc412839ac","observation_id":"fc25bfe9-4928-4d9e-871f-aa3b30e9712b","resolution":{"observed_at":"2026-08-16T11:51:08.725898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:51:08.711623Z","title":"Deepcore: A comprehensive library for coreset selection in deep learning","venue":null,"work_id":"8e1c20c3-21af-4227-985b-eefedb073f2a","year":2022},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T15:55:46.378802Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:08.018613Z"},"links":{"citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:15be0edd0b48c9c69c8042c47c718d7a4dddd0db03aaadf8edc1c690a59d2d3c","observation_id":"86ffc323-3185-40b9-bd8f-74d7cb621175","resolution":{"observed_at":"2026-08-16T11:51:08.715071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:51:08.701190Z","title":"Grale: Designing networks for graph learning","venue":null,"work_id":"e6405e5d-d104-4ec8-a345-d030d1e90abc","year":2020},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T15:55:46.378802Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:08.021703Z"},"links":{"citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:e8d0f2fefade6b04a44df3d3603cb12d7284de18278bfdafc7112e544ae9b340","observation_id":"93c6b446-ae50-40b5-986d-9757ae8838ba","resolution":{"observed_at":"2026-08-16T11:51:08.704961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.10147","last_updated":"2018-10-26T21:41:46Z","snapshot_observed_at":"2026-08-14T18:10:14.248822Z","submitted_at":"2018-10-24T01:18:08Z","title":"FewRel: A Large-Scale Supervised Few-Shot Relation Classification Dataset with State-of-the-Art Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.10147","snapshot_observed_at":"2026-08-16T11:51:08.025084Z","title":"Fewrel: A large-scale supervised few-shot relation classification dataset with state-of-the-art evaluation.arXiv preprint arXiv:1810.10147 (2018)","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T15:55:46.378802Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:08.025084Z"},"links":{"cited_paper":"/paper/1810.10147","citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:e8aa760caa4b3c4930f88fc976d07687e4ad49e729e5097640eaff610402b0c9","observation_id":"9715d686-5095-4e67-bcf7-d953ecc62cc1","resolution":{"observed_at":"2026-08-16T11:51:08.025084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01629","last_updated":"2024-01-03T09:03:30Z","snapshot_observed_at":"2026-08-16T14:30:09.132560Z","submitted_at":"2024-01-03T09:03:30Z","title":"Synthetic Data in AI: Challenges, Applications, and Ethical Implications","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01629","snapshot_observed_at":"2026-08-16T11:51:08.029152Z","title":"Synthetic data in ai: Challenges, applications, and ethical implications.arXiv preprint arXiv:2401.01629(2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T15:55:46.378802Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:08.029152Z"},"links":{"cited_paper":"/paper/2401.01629","citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:fd6ce1bc68d10f2696505a3d2225dde5da993d40225525eac58570e1d780c893","observation_id":"4391a698-73e7-425e-8d53-00b2d3cfc903","resolution":{"observed_at":"2026-08-16T11:51:08.029152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:51:08.689528Z","title":"Toxigen: A large-scale machine-generated dataset for adversarial and implicit hate speech detection","venue":null,"work_id":"7ef95726-4df3-45b4-a61b-43b902713ffb","year":2022},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T15:55:46.378802Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:08.033491Z"},"links":{"citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:f45938979759dd3432b4ab57e0e8a5da095b5cd748bc0ef55edbab2aa6fd26d8","observation_id":"76786112-a3e3-416b-a732-acd39dbd7c0b","resolution":{"observed_at":"2026-08-16T11:51:08.694252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.03164","last_updated":"2021-06-06T16:10:12Z","snapshot_observed_at":"2026-08-16T18:19:19.019925Z","submitted_at":"2021-06-06T16:10:12Z","title":"On the Effectiveness of Adapter-based Tuning for Pretrained Language Model Adaptation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.03164","snapshot_observed_at":"2026-08-16T11:51:08.037033Z","title":"On the effectiveness of adapter-based tuning for pretrained language model adaptation.arXiv preprint arXiv:2106.03164 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T15:55:46.378802Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:08.037033Z"},"links":{"cited_paper":"/paper/2106.03164","citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:8f0c82eaf6df2d5814bfab97ae6e2c296c3365c62b8a4ec22b5c60a93fb26a3f","observation_id":"9b7dc751-04cf-4ab2-b7bf-94b97c0ba3a6","resolution":{"observed_at":"2026-08-16T11:51:08.037033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:51:08.678352Z","title":null,"venue":null,"work_id":"4fe92485-cc72-46e3-a124-db94042d4fa9","year":1996},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T15:55:46.378802Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:08.041256Z"},"links":{"citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:68e80b00eb6e57efa928dcc784777f7492a90d45b7262748022d91899b04a18b","observation_id":"d6182c96-a203-47e2-b3c2-1f4be4187eff","resolution":{"observed_at":"2026-08-16T11:51:08.681672Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:51:08.668383Z","title":"Human feedback is not gold standard","venue":null,"work_id":"1964e86f-b0e7-4e80-88ee-99afa20690fa","year":null},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T15:55:46.378802Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:08.045093Z"},"links":{"citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:aeddcea80349f4ba9d429e9eeea51865ed7c1d25415fd534ddb5e0f04b8113e7","observation_id":"917dd301-a410-4675-866d-dba371ff1f45","resolution":{"observed_at":"2026-08-16T11:51:08.671778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:51:08.659057Z","title":"W., and Liang, P","venue":null,"work_id":"c5b4cb7f-9ffb-41be-8c54-8c868af4c241","year":2017},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T15:55:46.378802Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:08.049007Z"},"links":{"citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:c09987a9150513574b6664580ffeea06f4e1604ad295f31546e88a59e1529cf9","observation_id":"8cc7799e-f13c-4441-b69d-840580e329dd","resolution":{"observed_at":"2026-08-16T11:51:08.662473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.01684","last_updated":"2024-01-11T00:17:43Z","snapshot_observed_at":"2026-08-16T15:27:03.575086Z","submitted_at":"2023-06-02T16:59:36Z","title":"Harnessing large-language models to generate private synthetic text","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.01684","snapshot_observed_at":"2026-08-16T11:51:08.052639Z","title":"Harnessing large- language models to generate private synthetic text.arXiv preprint arXiv:2306.01684(2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T15:55:46.378802Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:08.052639Z"},"links":{"cited_paper":"/paper/2306.01684","citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:ccf3f1480c4ba7a9f9aa405f5e01e5494ba254b8947fe38a78a18196b246cc60","observation_id":"09f08d13-b70d-4560-b0a0-7b0baf288986","resolution":{"observed_at":"2026-08-16T11:51:08.052639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.11942","last_updated":"2020-02-09T03:00:18Z","snapshot_observed_at":"2026-08-18T01:27:11.590348Z","submitted_at":"2019-09-26T07:06:13Z","title":"ALBERT: A Lite BERT for Self-supervised Learning of Language Representations","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.11942","snapshot_observed_at":"2026-08-16T11:51:08.056235Z","title":"Albert: A lite bert for self-supervised learning of language representations.arXiv preprint arXiv:1909.11942 (2019)","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T15:55:46.378802Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:08.056235Z"},"links":{"cited_paper":"/paper/1909.11942","citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:0327cce3f340382f87739eec3bae7d084f6ab29553ca28e99f2fae331bb080ab","observation_id":"27e5dcaa-f6fc-487d-a0ad-857a1a8da66a","resolution":{"observed_at":"2026-08-16T11:51:08.056235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20327","last_updated":"2024-03-29T17:56:40Z","snapshot_observed_at":"2026-08-18T23:51:41.080521Z","submitted_at":"2024-03-29T17:56:40Z","title":"Gecko: Versatile Text Embeddings Distilled from Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20327","snapshot_observed_at":"2026-08-16T11:51:08.061000Z","title":"R., Hui, K., Boratko, M., Kapadia, R., Ding, W., et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T15:55:46.378802Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:08.061000Z"},"links":{"cited_paper":"/paper/2403.20327","citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:a0f3344898baa702d935ff3f9e4418f0600a97264ef5d2a8e619c63017bf8e0f","observation_id":"8aef0bdb-7a5e-4b00-a1f6-04fb1fbd1096","resolution":{"observed_at":"2026-08-16T11:51:08.061000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07849","last_updated":"2023-10-13T01:31:59Z","snapshot_observed_at":"2026-08-18T07:57:38.113550Z","submitted_at":"2023-10-11T19:51:13Z","title":"Synthetic Data Generation with Large Language Models for Text Classification: Potential and Limitations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07849","snapshot_observed_at":"2026-08-16T11:51:08.066294Z","title":"Synthetic data generation with large language models for text classification: Potential and limitations.arXiv preprint arXiv:2310.07849(2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T15:55:46.378802Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:08.066294Z"},"links":{"cited_paper":"/paper/2310.07849","citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:a945c5fe9a426e6a9c808cc7c218269b29453646d2853af805c68b967610d367","observation_id":"fcbc8854-dad3-417b-8633-c45af8b1cde5","resolution":{"observed_at":"2026-08-16T11:51:08.066294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:51:08.649823Z","title":"Best practices and lessons learned on synthetic data","venue":null,"work_id":"f42383b4-18e0-49a5-a72e-f6509536655d","year":2024},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T15:55:46.378802Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:08.071498Z"},"links":{"citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:4e8d7082cd985d6ba00722aa3e434072f4eb37044a7d566b748a4a320b72998a","observation_id":"56efb995-3ead-4f7c-9d6d-843d381b89d5","resolution":{"observed_at":"2026-08-16T11:51:08.653155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-08-16T14:33:50.657682Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-16T11:51:08.075229Z","title":"Roberta: A robustly optimized bert pretraining approach.arXiv preprint arXiv:1907.11692 (2019)","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T15:55:46.378802Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:08.075229Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:5d6c37d9c4891edc413d3ea767529b7d0259e65d86c2f7d02ebbc4176b805194","observation_id":"85cb27ac-bc12-4aa4-ba5f-1475661b7ced","resolution":{"observed_at":"2026-08-16T11:51:08.075229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:51:08.639930Z","title":"Crossner: Evaluating cross-domain named entity recognition","venue":null,"work_id":"d5c08e5c-c75a-4ba8-a8c7-91083c0e6e5b","year":2021},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T15:55:46.378802Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:08.079435Z"},"links":{"citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:200bd04476d3e87bc2b6532265496afb0a1379942cf24e87079b37a53f297c36","observation_id":"72e3640a-99cc-4244-9384-b3c27f2a477b","resolution":{"observed_at":"2026-08-16T11:51:08.643372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15126","last_updated":"2024-06-14T07:47:09Z","snapshot_observed_at":"2026-08-18T08:00:35.964338Z","submitted_at":"2024-06-14T07:47:09Z","title":"On LLMs-Driven Synthetic Data Generation, Curation, and Evaluation: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15126","snapshot_observed_at":"2026-08-16T11:51:08.083171Z","title":"On llms-driven synthetic data generation, curation, and evaluation: A survey.arXiv preprint arXiv:2406.15126(2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T15:55:46.378802Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:08.083171Z"},"links":{"cited_paper":"/paper/2406.15126","citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:d55f6562deb4174b80b81d235a304288669fccba701f7878e6f231822cd4fdea","observation_id":"0df133c0-b627-4e3e-a31b-c5d7a15dd2a5","resolution":{"observed_at":"2026-08-16T11:51:08.083171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07931","last_updated":"2023-10-11T23:01:29Z","snapshot_observed_at":"2026-08-16T14:52:53.339262Z","submitted_at":"2023-10-11T23:01:29Z","title":"D2 Pruning: Message Passing for Balancing Diversity and Difficulty in Data Pruning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07931","snapshot_observed_at":"2026-08-16T11:51:08.086908Z","title":"D2 pruning: Message passing for balancing diversity and difficulty in data pruning.arXiv preprint arXiv:2310.07931(2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T15:55:46.378802Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:08.086908Z"},"links":{"cited_paper":"/paper/2310.07931","citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:8cad24b63e38baf4332a6c8faaa0b9b4cf7e8341284d9e6ab20cdc8ed7f5570c","observation_id":"6c09618b-ff0e-4201-b6f6-6dc0bce9380b","resolution":{"observed_at":"2026-08-16T11:51:08.086908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:51:08.629407Z","title":"Generating training data with language models: Towards zero-shot language understanding.Advances in Neural Information Processing Systems 35 (2022), 462–477","venue":null,"work_id":"32ddb8fd-1574-4683-b3c2-4d92b006b89e","year":2022},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T15:55:46.378802Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:08.090329Z"},"links":{"citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:e55adda130b28e0d526c1bd9b0168e8070b31f2ccadd4984da0776c8abab6120","observation_id":"669aee43-6090-41af-adad-b006da5ba596","resolution":{"observed_at":"2026-08-16T11:51:08.632797Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1605.07725","last_updated":"2021-11-16T07:16:21Z","snapshot_observed_at":"2026-08-14T21:55:51.503935Z","submitted_at":"2016-05-25T04:25:45Z","title":"Adversarial Training Methods for Semi-Supervised Text Classification","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1605.07725","snapshot_observed_at":"2026-08-16T11:51:08.095357Z","title":"M., and Goodfellow, I","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T15:55:46.378802Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:08.095357Z"},"links":{"cited_paper":"/paper/1605.07725","citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:4bbe2ca7b84d8cc0348acccc999f3f519b77baaa33da119c6e16c20151a78d58","observation_id":"41136fc9-8b1e-41f8-896a-721d62b72302","resolution":{"observed_at":"2026-08-16T11:51:08.095357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:51:08.618699Z","title":null,"venue":null,"work_id":"6db7ae28-5fd8-4e4f-8d5f-c84928c99484","year":2021},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T15:55:46.378802Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:08.099008Z"},"links":{"citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:cfab3a43c3d8506a974594366bb8746f1ba79f2367dcc9ff59f21d081aadd966","observation_id":"8bd8a733-d572-46af-bfc7-45b11a7119ce","resolution":{"observed_at":"2026-08-16T11:51:08.622714Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:51:08.609045Z","title":null,"venue":null,"work_id":"de03071c-8c4c-4188-9253-3bee78c92583","year":2020},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T15:55:46.378802Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:08.102258Z"},"links":{"citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:a1c6fbd03b6d7d16c8fdc96ccfb2fbfa29d0ea0bd8eb8d99627846c14c8939ef","observation_id":"d9b190b5-6c10-4934-a55d-a5cca7572fc1","resolution":{"observed_at":"2026-08-16T11:51:08.612386Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.11446","last_updated":"2022-01-21T18:39:38Z","snapshot_observed_at":"2026-08-09T14:52:01.161814Z","submitted_at":"2021-12-08T19:41:47Z","title":"Scaling Language Models: Methods, Analysis & Insights from Training Gopher","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.11446","snapshot_observed_at":"2026-08-16T11:51:08.105722Z","title":"W., Borgeaud, S., Cai, T., Millican, K., Hoffmann, J., Song, F., Aslanides, J., Henderson, S., Ring, R., Young, S., et al","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T15:55:46.378802Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:08.105722Z"},"links":{"cited_paper":"/paper/2112.11446","citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:0ed7b9222d7bb2d49ecca7412afdee5b14b36538cb50c9f147e1d50e7e77afdd","observation_id":"1ec5d887-7e83-4b0e-97e3-5a99cdcfebcd","resolution":{"observed_at":"2026-08-16T11:51:08.105722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:51:08.598828Z","title":null,"venue":null,"work_id":"98a552c0-7805-4105-a903-245118f000e5","year":2020},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T15:55:46.378802Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:08.109847Z"},"links":{"citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:61290b62004fda38f32fe7616811830dba9ae2e5ed4f6025cac3e41ce5f40b00","observation_id":"c68c4e5b-9d30-4ebd-a0b0-e49d91edb7e3","resolution":{"observed_at":"2026-08-16T11:51:08.602043Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:51:08.589001Z","title":"C., Yates, A., and de Rijke, M","venue":null,"work_id":"80606467-06a6-4279-b10c-ff0fef5f6b5c","year":2024},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T15:55:46.378802Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:08.113362Z"},"links":{"citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:ab29878488c213bee9e5a0b3f732ee47b5e0247eff5f0b604f028038e67620e7","observation_id":"c0facdb5-31c6-4bfd-ab7f-3a57ff010f28","resolution":{"observed_at":"2026-08-16T11:51:08.592315Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:51:08.577979Z","title":"Data augmentation for intent classification with off-the-shelf large language models","venue":null,"work_id":"653c3d76-3e88-4301-8af6-2b5f9b59ad2c","year":2022},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T15:55:46.378802Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:08.117280Z"},"links":{"citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:95b8603b64b9e2012ccc937180f81d4cf3baa308477b2d799c0986bf9b65a328","observation_id":"8f0aa3c1-cbd5-41ca-be46-58a8d2e5bb78","resolution":{"observed_at":"2026-08-16T11:51:08.581849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:51:08.567962Z","title":"Data sampling using locality sensitive hashing for large scale graph learning","venue":null,"work_id":"1424b71f-bfca-4a03-bbbe-e1e2f95c15d6","year":null},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T15:55:46.378802Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:08.120594Z"},"links":{"citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:434c02702704349fd3573cb4d5a794cd20f3a63ba435c570285084441aeec493","observation_id":"3c4dee17-4f95-445a-8f4e-5d330bc06f7a","resolution":{"observed_at":"2026-08-16T11:51:08.571528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:51:08.557227Z","title":"D., Agar w al, R., Anand, A., Patil, P., Garcia, X., Liu, P","venue":null,"work_id":"789a5e5d-f47a-4540-8324-678db4fb6e87","year":null},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T15:55:46.378802Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:08.124500Z"},"links":{"citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:fd1343aa218c7f2032c054aa179dc016e43e48427202ab6f49e87d61df227071","observation_id":"57d61d7c-fe83-4a21-8c0d-7dce603f6c5b","resolution":{"observed_at":"2026-08-16T11:51:08.560940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:51:08.547519Z","title":"D., Ng, A","venue":null,"work_id":"f6292ae7-69c1-4cbb-bfde-8f06d5b42375","year":2013},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T15:55:46.378802Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:08.128386Z"},"links":{"citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:e63a955eef9ba0e9fecf2bac99313945c4b0140e295cc37418bb5e6c6ae1bc9e","observation_id":"b77755a1-f023-4b12-b153-6053fbd5e54e","resolution":{"observed_at":"2026-08-16T11:51:08.550744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:51:08.535480Z","title":"Beyond neural scaling laws: beating power law scaling via data pruning.Advances in Neural Information Processing Systems 35 (2022), 19523–19536","venue":null,"work_id":"3e2f5c20-555c-4103-9239-2ad6693dbfd2","year":2022},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T15:55:46.378802Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:08.131845Z"},"links":{"citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:94a0e8b89970ff6ab25be2e7ab2e6ba78b706f0c289fbbe2de2ef3e7f7741d1e","observation_id":"06faf962-7049-49a0-bc6f-ba494fad6058","resolution":{"observed_at":"2026-08-16T11:51:08.540406Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:51:08.523669Z","title":"A., and Choi, Y","venue":null,"work_id":"f0ff4454-a132-4a3c-9106-c0ea3249ba98","year":2020},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T15:55:46.378802Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:08.135437Z"},"links":{"citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:d745b4d1c51cdc1b6bc1dde5ca3adc5e7cdb9558ba84ed765b414a1b767be768","observation_id":"a96c1366-ad2d-450e-b0ad-0d3cfd38ba9e","resolution":{"observed_at":"2026-08-16T11:51:08.527042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04360","last_updated":"2023-04-10T18:47:51Z","snapshot_observed_at":"2026-08-18T19:44:44.205562Z","submitted_at":"2023-03-08T03:56:31Z","title":"Does Synthetic Data Generation of LLMs Help Clinical Text Mining?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.04360","snapshot_observed_at":"2026-08-16T11:51:08.139093Z","title":"Does synthetic data generation of llms help clinical text mining? arXiv preprint arXiv:2303.04360(2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T15:55:46.378802Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:08.139093Z"},"links":{"cited_paper":"/paper/2303.04360","citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:c911478fb976813e24483b4551c0dc689d91378fbc22f814d166e8174bec5b21","observation_id":"a5659459-1dec-4c59-a7a7-8baf72d08f6f","resolution":{"observed_at":"2026-08-16T11:51:08.139093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09085","last_updated":"2022-11-16T18:06:33Z","snapshot_observed_at":"2026-08-17T08:35:32.078396Z","submitted_at":"2022-11-16T18:06:33Z","title":"Galactica: A Large Language Model for Science","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09085","snapshot_observed_at":"2026-08-16T11:51:08.142767Z","title":"Galactica: A large language model for science.arXiv preprint arXiv:2211.09085 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T15:55:46.378802Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:08.142767Z"},"links":{"cited_paper":"/paper/2211.09085","citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:8d68d5a18ac09a842d6ff24dff3fddb64ca96da338f9fd1f6d6171f7ca3f9ae7","observation_id":"ffc2d71d-a451-4a42-adb6-e97f9494d257","resolution":{"observed_at":"2026-08-16T11:51:08.142767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-16T11:51:08.146552Z","title":"S., Love, J., et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T15:55:46.378802Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:08.146552Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:9b58ddab77bbd51e1ce50ded0d9258412aaf1d6fa3e85fd6f0a79b3b1504398c","observation_id":"bf97eb36-61a2-4330-a309-5b80212aba71","resolution":{"observed_at":"2026-08-16T11:51:08.146552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05159","last_updated":"2019-11-15T17:08:30Z","snapshot_observed_at":"2026-08-16T19:44:25.767623Z","submitted_at":"2018-12-12T21:24:15Z","title":"An Empirical Study of Example Forgetting during Deep Neural Network Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.05159","snapshot_observed_at":"2026-08-16T11:51:08.150941Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T15:55:46.378802Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:08.150941Z"},"links":{"cited_paper":"/paper/1812.05159","citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:743001169196414a8d0da62d28bf1b93acd5cc6b118402b3e6f3641aecfcfdce","observation_id":"62f3b55a-298d-487e-b64e-370fcb4a8bc5","resolution":{"observed_at":"2026-08-16T11:51:08.150941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:51:08.512120Z","title":null,"venue":null,"work_id":"fa3280a6-2242-4617-ba04-9fa228ea25ab","year":2017},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T15:55:46.378802Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:08.155145Z"},"links":{"citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:534d229ab87977a90d620ac2d1583a764b0a69ecd164c22ac551a054a74bda51","observation_id":"bc3956b4-e7b6-432f-9376-9648279bdcbc","resolution":{"observed_at":"2026-08-16T11:51:08.515861Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1901.11196","last_updated":"2019-08-25T23:11:07Z","snapshot_observed_at":"2026-08-14T17:23:13.764826Z","submitted_at":"2019-01-31T03:20:52Z","title":"EDA: Easy Data Augmentation Techniques for Boosting Performance on Text Classification Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.11196","snapshot_observed_at":"2026-08-16T11:51:08.158794Z","title":"Eda: Easy data augmentation techniques for boosting performance on text classification tasks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T15:55:46.378802Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:08.158794Z"},"links":{"cited_paper":"/paper/1901.11196","citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:6c0426f57f50a020b2168b258e5a789bf8cbeb470273661bf413c16cb7fe0e1b","observation_id":"ae77f300-536b-4e93-8141-8eb35c251e3a","resolution":{"observed_at":"2026-08-16T11:51:08.158794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:51:08.500375Z","title":"Moderate coreset: A universal method of data selection for real-world data-efficient deep learning","venue":null,"work_id":"89302d06-d817-4de0-9af0-06d49215b800","year":2022},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T15:55:46.378802Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:08.162524Z"},"links":{"citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:a74324f851f403bbde0fc930794c6d41fa7f9639923245ce558bdf43c81e156e","observation_id":"95e5bd59-8602-4289-8c55-3bb83c2a223c","resolution":{"observed_at":"2026-08-16T11:51:08.504293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:51:08.489196Z","title":"Zerogen: Efficient zero-shot learning via dataset generation","venue":null,"work_id":"2200f5ae-10b0-48e4-a96b-45cddf4b34bd","year":2022},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T15:55:46.378802Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:08.165769Z"},"links":{"citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:667314f092220123f39a9c4345ee5405b6dbef0e1558ca13da3778b0024c3af8","observation_id":"f6f887e8-bde1-4530-aa0c-4178b7753cb1","resolution":{"observed_at":"2026-08-16T11:51:08.492913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:51:08.478243Z","title":"Coverage-centric coreset selection for high pruning rates","venue":null,"work_id":"b588b92a-6173-4af4-83db-c9578468a832","year":null},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T15:55:46.378802Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:08.169240Z"},"links":{"citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:9bf5603f033aa93a16e7f723f792dbf584640a4313ca60bb5582b9a4b5729b43","observation_id":"2a314016-d262-42a1-bb2a-1936e22a57d7","resolution":{"observed_at":"2026-08-16T11:51:08.481976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:51:08.466689Z","title":"Texygen: A benchmarking platform for text generation models","venue":null,"work_id":"7688041f-1ba2-43a5-9fd6-0e0d7938e380","year":2018},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T15:55:46.378802Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:08.173184Z"},"links":{"citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:ec377c59c52fa2907b3b40da274179e07bdea32135e2a11c2f822ff2d877c7de","observation_id":"9594c818-2160-41dd-a8c0-67582fb15c76","resolution":{"observed_at":"2026-08-16T11:51:08.470708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-18T15:55:46.378802Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":31,"verified_exact":0,"verified_fuzzy":26},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 0 inbound Pith citation observations for arXiv:2504.14508."}