{"as_of":"2026-08-09T11:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:62e9612639ccb95c2dae6ae2bccd231f7be5dec10cbc5e32ba960f056aa1ca48","coverage":[{"denominator":94,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":94,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T04:54:51.000155Z","state":"measured"},{"denominator":95,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":95,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T02:03:07.556469Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.08512","snapshot_observed_at":"2026-08-04T02:03:07.556469Z","title":"arXiv preprint arXiv:2502.08512 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00024","last_updated":"2026-07-10T07:15:11Z","snapshot_observed_at":"2026-08-09T01:36:15.203085Z","submitted_at":"2026-07-10T07:15:11Z","title":"Exploring More to Solve More: Boosting Diversity in Text Diffusion Models via Entropy-Based Guidance","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-04T02:03:07.556469Z"},"links":{"cited_paper":"/paper/2502.08512","citing_paper":"/paper/2608.00024"},"observation_digest":"sha256:316c1e65b04ad96bddb243ddb5b9ac05cbb558ff8608fe1f7326a454a8912c8f","observation_id":"0992aabd-b0cc-4ad2-b68b-5e62031d4ca3","resolution":{"observed_at":"2026-08-04T02:03:07.556469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2502.08512/citation-record","integrity":"/paper/2502.08512/integrity","json":"/paper/2502.08512/citation-record.json","paper":"/paper/2502.08512"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2401.17461","last_updated":"2024-01-30T21:49:30Z","snapshot_observed_at":"2026-08-09T02:49:29.351509Z","submitted_at":"2024-01-30T21:49:30Z","title":"Synthetic Dialogue Dataset Generation using LLM Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.17461","snapshot_observed_at":"2026-08-08T04:54:50.557083Z","title":"Synthetic dialogue dataset generation using llm agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.557083Z"},"links":{"cited_paper":"/paper/2401.17461","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:60eec9ba5dedce8c4dc4cbb13721d8dd6ceebdec18cbe5754c5a22d1b53e49b1","observation_id":"220944f6-2a3a-4268-b3af-10d298f7bd51","resolution":{"observed_at":"2026-08-08T04:54:50.557083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-08T04:54:50.563245Z","title":"L., Almeida, D., Altenschmidt, J., Altman, S., Anadkat, S., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.563245Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:8f549afea0b0eaf42c6313212f92a833e0bb8bb8f488b8ccd76b6ff505d7c449","observation_id":"33b37dff-0c70-4d11-bf3b-2ec8044925ce","resolution":{"observed_at":"2026-08-08T04:54:50.563245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:54:50.568004Z","title":"User's guide to correlation coefficients","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.568004Z"},"links":{"citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:b3179a824b90b4f8f30f27aabdd446e1b268cd84773465f50c541dda5a5c71bb","observation_id":"ddd899f2-38a9-4b83-a2e7-155f92c4297b","resolution":{"observed_at":"2026-08-08T04:54:50.568004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:54:50.572633Z","title":"J., Kragic, D., and Kjellstrom, H","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.572633Z"},"links":{"citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:18c98196497794bbd998b8c282e5aa63c4fe730fcac0a7deace326c4c64a64a9","observation_id":"b713cd28-5825-431d-b703-e46bd8d326f5","resolution":{"observed_at":"2026-08-08T04:54:50.572633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.02549","last_updated":"2020-02-19T22:44:37Z","snapshot_observed_at":"2026-08-09T02:51:07.819664Z","submitted_at":"2018-11-06T18:44:11Z","title":"Language GANs Falling Short","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.02549","snapshot_observed_at":"2026-08-08T04:54:50.577270Z","title":"Language gans falling short","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.577270Z"},"links":{"cited_paper":"/paper/1811.02549","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:529003f9f758ae6cb7935781e45f106500b0c703c0c350c0ae75fa81166b7cdf","observation_id":"a1b16900-89c2-41e6-8d5d-7b610312a26b","resolution":{"observed_at":"2026-08-08T04:54:50.577270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06290","last_updated":"2024-07-26T18:09:11Z","snapshot_observed_at":"2026-08-09T02:49:30.442127Z","submitted_at":"2023-07-12T16:37:31Z","title":"Instruction Mining: Instruction Data Selection for Tuning Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06290","snapshot_observed_at":"2026-08-08T04:54:50.582249Z","title":"Instruction mining: Instruction data selection for tuning large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.582249Z"},"links":{"cited_paper":"/paper/2307.06290","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:d98c89e01dd4aa9253b5ec3f9c1931839f19dc84357e017e1fa06386a694969f","observation_id":"ee8b96bc-0712-46a4-a494-6b2c784d719b","resolution":{"observed_at":"2026-08-08T04:54:50.582249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01580","last_updated":"2023-10-18T03:31:02Z","snapshot_observed_at":"2026-08-09T02:51:58.427022Z","submitted_at":"2023-03-02T21:13:56Z","title":"Mixture of Soft Prompts for Controllable Data Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.01580","snapshot_observed_at":"2026-08-08T04:54:50.588175Z","title":"Mixture of soft prompts for controllable data generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.588175Z"},"links":{"cited_paper":"/paper/2303.01580","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:d1783f923bb27ccbdd364f60314f1a738fdc70e6727cef9823a78476c7f198e8","observation_id":"1039d1ff-8d5c-444f-acab-dbdda528b7cd","resolution":{"observed_at":"2026-08-08T04:54:50.588175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.04140","last_updated":"2023-06-07T04:27:09Z","snapshot_observed_at":"2026-08-04T18:50:11.343827Z","submitted_at":"2023-06-07T04:27:09Z","title":"Increasing Diversity While Maintaining Accuracy: Text Data Generation with Large Language Models and Human Interventions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.04140","snapshot_observed_at":"2026-08-08T04:54:50.593096Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.593096Z"},"links":{"cited_paper":"/paper/2306.04140","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:df5e30ec7504985fb2cea518dd0bc38546812c584b2a0413b4e4122b37fac08b","observation_id":"4e65a109-73cf-4999-81e5-2b4fc6becbf0","resolution":{"observed_at":"2026-08-08T04:54:50.593096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.07972","last_updated":"2018-10-30T20:29:16Z","snapshot_observed_at":"2026-08-09T02:52:25.756681Z","submitted_at":"2018-04-21T14:29:39Z","title":"Eval all, trust a few, do wrong to none: Comparing sentence generation models","version":2},"cited_work":{"arxiv_id":"1804.07972","doi":null,"metadata_source":"pith","pith_arxiv_id":"1804.07972","snapshot_observed_at":"2026-08-08T04:54:51.808687Z","title":"Eval all, trust a few, do wrong to none: Comparing sentence generation models","venue":"cs.CL","work_id":"8b775d2a-32eb-496a-8db4-cd3793b090c1","year":2018},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.598075Z"},"links":{"cited_paper":"/paper/1804.07972","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:be73d99189a78d5c9772266ddcec518107045d37173217e1bc493f15e030a599","observation_id":"22c18fa7-488b-44e3-8585-27edaebe1941","resolution":{"observed_at":"2026-08-08T04:54:51.814134Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.13719","last_updated":"2019-11-14T04:51:03Z","snapshot_observed_at":"2026-08-09T02:47:28.181440Z","submitted_at":"2019-09-30T14:05:14Z","title":"RandAugment: Practical automated data augmentation with a reduced search space","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.13719","snapshot_observed_at":"2026-08-08T04:54:50.603017Z","title":"D., Zoph, B., Shlens, J., and Le, Q","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.603017Z"},"links":{"cited_paper":"/paper/1909.13719","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:78823fb87c94af6beacabaf2dd2898f0d31008a5d62fb2e3b70be55224b94493","observation_id":"211c37db-37b3-4010-bbd9-b03727702b09","resolution":{"observed_at":"2026-08-08T04:54:50.603017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13007","last_updated":"2023-03-20T11:39:47Z","snapshot_observed_at":"2026-08-09T02:48:34.496399Z","submitted_at":"2023-02-25T06:58:16Z","title":"AugGPT: Leveraging ChatGPT for Text Data Augmentation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13007","snapshot_observed_at":"2026-08-08T04:54:50.607922Z","title":"Auggpt: Leveraging chatgpt for text data augmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.607922Z"},"links":{"cited_paper":"/paper/2302.13007","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:460879ca03fdbb045ff5018b026622e27383f222b844b5360de46aaa930f8600","observation_id":"96a2b178-555d-48c2-b330-083355af2d2e","resolution":{"observed_at":"2026-08-08T04:54:50.607922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:54:50.612645Z","title":"and Dieng, A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.612645Z"},"links":{"citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:2523c39be4650b08acfbf1c6af2509e8bae40c61dba8fdacc3e2ab4a4b831893","observation_id":"fb61bb52-20ac-4cdd-a411-305a0b4102a8","resolution":{"observed_at":"2026-08-08T04:54:50.612645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:54:50.617269Z","title":"The mnist database of handwritten digit images for machine learning research [best of the web]","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.617269Z"},"links":{"citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:69bdff4e420ad83049c2e27aafa2ed5cc5d418bab5561becba69f00c255236cd","observation_id":"55094d90-8963-49b9-acd4-b9aaf9212b41","resolution":{"observed_at":"2026-08-08T04:54:50.617269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.04302","last_updated":"2019-10-09T23:40:05Z","snapshot_observed_at":"2026-08-09T02:53:11.309353Z","submitted_at":"2019-10-09T23:40:05Z","title":"Prescribed Generative Adversarial Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.04302","snapshot_observed_at":"2026-08-08T04:54:50.621819Z","title":"B., Ruiz, F","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.621819Z"},"links":{"cited_paper":"/paper/1910.04302","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:6adbf3497b557287816f3a27d5361a2e1456b6cb59313d9b51d380cdb79a7a93","observation_id":"ea37a12b-be95-45ef-b602-e714b715632c","resolution":{"observed_at":"2026-08-08T04:54:50.621819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10450","last_updated":"2023-06-14T16:11:50Z","snapshot_observed_at":"2026-08-09T02:49:01.143085Z","submitted_at":"2022-12-20T17:28:41Z","title":"Is GPT-3 a Good Data Annotator?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10450","snapshot_observed_at":"2026-08-08T04:54:50.626666Z","title":"K., Joty, S., Li, B., and Bing, L","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.626666Z"},"links":{"cited_paper":"/paper/2212.10450","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:93987dd515c4cf74d1dd72e30c0276c2b61a69757ff927ce014eee0e750cf8b9","observation_id":"8a45b919-42cd-47d5-bdfc-d37d4c40ef3c","resolution":{"observed_at":"2026-08-08T04:54:50.626666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02990","last_updated":"2024-07-02T07:59:40Z","snapshot_observed_at":"2026-08-09T02:48:35.024169Z","submitted_at":"2024-03-05T14:11:54Z","title":"Data Augmentation using Large Language Models: Data Perspectives, Learning Paradigms and Challenges","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.02990","snapshot_observed_at":"2026-08-08T04:54:50.631591Z","title":"T., and Joty, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.631591Z"},"links":{"cited_paper":"/paper/2403.02990","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:44dd384238cedc5dec70800cf36e997af7997e1fcd7f0dbc74fc7e417b0e3ee7","observation_id":"7d071908-c6e2-4c94-a979-3b36db85b412","resolution":{"observed_at":"2026-08-08T04:54:50.631591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:54:50.636392Z","title":"G., Santos, G","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.636392Z"},"links":{"citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:bfbe63854b680b55e1aa037993207de50b9797aed13ada8cf85b10e6b7c5943c","observation_id":"2ee59089-5171-43f0-a8c9-ee723562319f","resolution":{"observed_at":"2026-08-08T04:54:50.636392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:54:50.641186Z","title":"and Black, A","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.641186Z"},"links":{"citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:544162367dbf7104b6d3402470350145f566b4c9f9a6312604d82ca18f9c4172","observation_id":"9fa8936f-eca7-4e64-b27d-0062ec69e5d7","resolution":{"observed_at":"2026-08-08T04:54:50.641186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00415","last_updated":"2024-03-30T16:47:06Z","snapshot_observed_at":"2026-08-09T02:47:59.855306Z","submitted_at":"2024-03-30T16:47:06Z","title":"CoDa: Constrained Generation based Data Augmentation for Low-Resource NLP","version":1},"cited_work":{"arxiv_id":"2404.00415","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.00415","snapshot_observed_at":"2026-08-08T04:54:51.707402Z","title":"CoDa: Constrained Generation based Data Augmentation for Low-Resource NLP","venue":"cs.CL","work_id":"be701e27-8e73-4924-81a3-f472873070ff","year":2024},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.645619Z"},"links":{"cited_paper":"/paper/2404.00415","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:b922885861ee4573865e536ff32ca824ef932fbd69f134b8751c9fead9a78099","observation_id":"a8a656e8-9f6a-4981-9034-7d86b5c7725a","resolution":{"observed_at":"2026-08-08T04:54:51.713193Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08821","last_updated":"2022-05-18T12:29:49Z","snapshot_observed_at":"2026-07-06T11:01:05.577957Z","submitted_at":"2021-04-18T11:27:08Z","title":"SimCSE: Simple Contrastive Learning of Sentence Embeddings","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08821","snapshot_observed_at":"2026-08-08T04:54:50.650403Z","title":"Simcse: Simple contrastive learning of sentence embeddings","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.650403Z"},"links":{"cited_paper":"/paper/2104.08821","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:5b78a6d9428f468b4f0f59b5b23f7dc390a4890e6818cacebe08ee9e6ae4fdcb","observation_id":"61899b9b-774b-4b2c-b2ad-2917f3493b17","resolution":{"observed_at":"2026-08-08T04:54:50.650403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:54:50.655497Z","title":"Chatgpt outperforms crowd workers for text-annotation tasks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.655497Z"},"links":{"citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:ba94beb08d580380745f054dab3107f430ac382509d0b982ff8d49cbb2e628db","observation_id":"c1cd2522-4312-40ef-a3cd-8bdec0f9846e","resolution":{"observed_at":"2026-08-08T04:54:50.655497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.08973","last_updated":"2020-06-04T19:04:48Z","snapshot_observed_at":"2026-08-09T02:48:11.463180Z","submitted_at":"2020-02-20T19:02:02Z","title":"Affinity and Diversity: Quantifying Mechanisms of Data Augmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.08973","snapshot_observed_at":"2026-08-08T04:54:50.660033Z","title":"J., Cubuk, E","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.660033Z"},"links":{"cited_paper":"/paper/2002.08973","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:68fb0c8a3c92d42dd69a34f789fce3d4a10032f76d35e8a753c861a29fbe8c64","observation_id":"084c08f0-a888-4ff8-90ae-1fd37e3d913d","resolution":{"observed_at":"2026-08-08T04:54:50.660033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:54:50.664900Z","title":"Generative adversarial networks","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.664900Z"},"links":{"citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:b9615ba7e8d7dc3b32f01174d267db55c940892fb3536ceae47412a2ebb1adbc","observation_id":"8cd9f28b-0a3c-4fc1-b39e-74cad6da37cb","resolution":{"observed_at":"2026-08-08T04:54:50.664900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:54:50.669402Z","title":"Llm-based code generation method for golang compiler testing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.669402Z"},"links":{"citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:16d5eb94abf05975fa98654a436a5c8a73480b33102bc7f66b27c9f0784c21b2","observation_id":"a48b1012-d602-4e85-9d11-5a42183aa614","resolution":{"observed_at":"2026-08-08T04:54:50.669402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.17876","last_updated":"2024-08-08T06:32:00Z","snapshot_observed_at":"2026-08-09T02:48:29.999226Z","submitted_at":"2023-10-27T03:32:17Z","title":"TarGEN: Targeted Data Generation with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.17876","snapshot_observed_at":"2026-08-08T04:54:50.673908Z","title":"A., Mishra, S., and Baral, C","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.673908Z"},"links":{"cited_paper":"/paper/2310.17876","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:0e3ee2e66348154576a4c3ecf030e270903196ad2f36dbb90c34169fee4937e9","observation_id":"3cc466e1-a7d5-4c7c-9688-b485cfe481aa","resolution":{"observed_at":"2026-08-08T04:54:50.673908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:54:50.678962Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilibrium","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.678962Z"},"links":{"citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:6125bfc74fbf266e7b52c83ab7344bc782bab9d14a18551f61259b743760c310","observation_id":"6ff78ebf-fc4f-4f48-9253-fe023c4327e1","resolution":{"observed_at":"2026-08-08T04:54:50.678962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09751","last_updated":"2020-02-14T21:56:30Z","snapshot_observed_at":"2026-07-06T07:47:32.745963Z","submitted_at":"2019-04-22T07:17:18Z","title":"The Curious Case of Neural Text Degeneration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09751","snapshot_observed_at":"2026-08-08T04:54:50.683583Z","title":"The curious case of neural text degeneration","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.683583Z"},"links":{"cited_paper":"/paper/1904.09751","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:29e1ddbd8d245b7965ec1d6c66b45695e6be4c63a9e1056064abfee905f58b9d","observation_id":"ced880b2-55ff-43b1-a95e-ab19c090c027","resolution":{"observed_at":"2026-08-08T04:54:50.683583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-08T04:54:50.688523Z","title":"J., Shen, Y., Wallis, P., Allen-Zhu, Z., Li, Y., Wang, S., Wang, L., and Chen, W","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.688523Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:53721010cbfbe292b3185b82352404c026b6c7b5475f128bd3eee8a88eee3d1d","observation_id":"1eccecd3-c955-44ef-8cf5-3207bb0f7e76","resolution":{"observed_at":"2026-08-08T04:54:50.688523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:54:50.693432Z","title":"Learning preference model for llms via automatic preference data generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.693432Z"},"links":{"citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:4fcf2e71af1ca2ed86543c818b24284dc5fd921a0ca82a0e082097fa7480e6cb","observation_id":"915adbf8-21d4-40ec-a665-d8ba59553642","resolution":{"observed_at":"2026-08-08T04:54:50.693432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:54:50.697995Z","title":"T., Boutros, F., Kuijper, A., and Damer, N","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.697995Z"},"links":{"citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:207ab02494745ace540fae45ab8d36e7ec1a5d16fd696edd6821063582531f7e","observation_id":"a4504023-31d4-4aed-aeb8-3c8a7fd6ecba","resolution":{"observed_at":"2026-08-08T04:54:50.697995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:54:50.702558Z","title":"T., and Farnia, F","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.702558Z"},"links":{"citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:9b769621d53db0f1a11d5a92ee0a16ee3c9544f5446f7d37d4809157d38a8ac1","observation_id":"346789cd-e5e3-4992-a165-e28b7292b4f0","resolution":{"observed_at":"2026-08-08T04:54:50.702558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:54:50.707148Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.707148Z"},"links":{"citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:f920bbc54ae490eb0377069ef6b8e966f0220133ce65a4ca190d32a0a245eb88","observation_id":"628f6680-fc97-4ed4-aa59-f92dadd7ffdf","resolution":{"observed_at":"2026-08-08T04:54:50.707148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:54:52.337685Z","title":"Natural language processing: state of the art, current trends and challenges","venue":null,"work_id":"e775a622-f6be-4264-a6a7-dffe5271d067","year":2023},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.711846Z"},"links":{"citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:6fa4e850c38d77256949ed570efd2204ae273923efe7f3f665dac837c1e5157e","observation_id":"651b66e6-6334-445d-ada8-afd0f68e56bd","resolution":{"observed_at":"2026-08-08T04:54:52.343645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:54:50.716687Z","title":"Improved precision and recall metric for assessing generative models","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.716687Z"},"links":{"citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:999a2a011c6046027cb05b08310d886f560658f4cef5ddc3b4d4096a9eda37d1","observation_id":"cb944758-1731-4815-ac6e-bdb5fcb46e64","resolution":{"observed_at":"2026-08-08T04:54:50.716687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2003.08529","last_updated":"2020-03-19T00:48:32Z","snapshot_observed_at":"2026-08-09T02:52:41.774794Z","submitted_at":"2020-03-19T00:48:32Z","title":"Diversity, Density, and Homogeneity: Quantitative Characteristic Metrics for Text Collections","version":1},"cited_work":{"arxiv_id":"2003.08529","doi":null,"metadata_source":"pith","pith_arxiv_id":"2003.08529","snapshot_observed_at":"2026-08-08T04:54:51.606977Z","title":"Diversity, Density, and Homogeneity: Quantitative Characteristic Metrics for Text Collections","venue":"cs.CL","work_id":"d8d3fe73-e88c-4fcb-a1b6-161c1a888aec","year":2020},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.721169Z"},"links":{"cited_paper":"/paper/2003.08529","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:0f2a6147e7c7e733da6de1b5acf839f2ebd64bc982619d2311477f25eafe932d","observation_id":"9d304498-f4ba-44eb-828d-51e78930e753","resolution":{"observed_at":"2026-08-08T04:54:51.612340Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:54:52.310285Z","title":"Exploring precision and recall to assess the quality and diversity of llms","venue":null,"work_id":"46fa151f-8357-4f84-8aec-5fedfb41b452","year":2024},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.726097Z"},"links":{"citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:0ca2876e053c256565d31bcf47ac645ea6c5b9793a73d53e31f0fcd0eda8f34d","observation_id":"8484a75b-fa89-4073-97c1-e32949eb63f8","resolution":{"observed_at":"2026-08-08T04:54:52.315626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13840","last_updated":"2025-07-02T21:53:51Z","snapshot_observed_at":"2026-08-09T02:47:22.692232Z","submitted_at":"2023-06-24T02:25:56Z","title":"Beyond Scale: The Diversity Coefficient as a Data Quality Metric for Variability in Natural Language Data","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13840","snapshot_observed_at":"2026-08-08T04:54:50.730719Z","title":"Beyond scale: the diversity coefficient as a data quality metric demonstrates llms are pre-trained on formally diverse data","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.730719Z"},"links":{"cited_paper":"/paper/2306.13840","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:c552d5815a6a5a974dbce079b6b698711b094683e474d65f67fcc095cfed4a13","observation_id":"f44d8e89-32e9-4eb4-b590-e5bac41db550","resolution":{"observed_at":"2026-08-08T04:54:50.730719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:54:52.293215Z","title":"Graddiv: Adversarial robustness of randomized neural networks via gradient diversity regularization","venue":null,"work_id":"b0d75d2d-ee92-43c6-9d8c-9636b92bd0c4","year":2022},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.735530Z"},"links":{"citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:fc4862c5a88fe2e763280877df35d56b321cd3fef4bbc4ad9958929bba02ed46","observation_id":"45235e71-9799-41c9-9693-2e61316d9e64","resolution":{"observed_at":"2026-08-08T04:54:52.298118Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:54:52.277264Z","title":"and Cobbold, C","venue":null,"work_id":"1d24d845-2715-41d5-be96-19c873aafa63","year":2012},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.740094Z"},"links":{"citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:b69bf1e5e9d4abbc52a6df6602032b45ba7eebec45c4b461b1f8e3201c186b62","observation_id":"804556e7-fc75-4fc8-907e-b6f0689e85e9","resolution":{"observed_at":"2026-08-08T04:54:52.282078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:54:52.261313Z","title":"Rich feature learning via diversification","venue":null,"work_id":"60c9ca8c-c392-4f87-9173-e6178827f2f1","year":2025},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.744642Z"},"links":{"citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:0bb25fbb794eb5015fdd2ebf2f513a1dd74599c390cdc95029bfa7a94ddfdd3f","observation_id":"578b16a5-6ed1-49ee-9417-6dab5b4b436f","resolution":{"observed_at":"2026-08-08T04:54:52.266525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1510.03055","last_updated":"2016-06-10T22:03:28Z","snapshot_observed_at":"2026-07-06T04:32:42.614338Z","submitted_at":"2015-10-11T14:04:57Z","title":"A Diversity-Promoting Objective Function for Neural Conversation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1510.03055","snapshot_observed_at":"2026-08-08T04:54:50.749027Z","title":"A diversity-promoting objective function for neural conversation models","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.749027Z"},"links":{"cited_paper":"/paper/1510.03055","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:fb906753452dd55f2f6a457d9a102cd4310f00d355a5b848dd208cfbd1e4ed2f","observation_id":"0fef96c9-0761-4ec1-a853-e6bc24548524","resolution":{"observed_at":"2026-08-08T04:54:50.749027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.17642","last_updated":"2024-04-26T18:04:25Z","snapshot_observed_at":"2026-08-09T07:35:15.570792Z","submitted_at":"2024-04-26T18:04:25Z","title":"Empowering Large Language Models for Textual Data Augmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.17642","snapshot_observed_at":"2026-08-08T04:54:50.754071Z","title":"Empowering large language models for textual data augmentation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.754071Z"},"links":{"cited_paper":"/paper/2404.17642","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:9f5190994499f8bbe331386cd72ec927c6105c31bc4a5440cbb3588a8304713f","observation_id":"29c9d34d-3fc1-4e14-bd16-94ef907260cd","resolution":{"observed_at":"2026-08-08T04:54:50.754071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07849","last_updated":"2023-10-13T01:31:59Z","snapshot_observed_at":"2026-08-09T02:52:28.730130Z","submitted_at":"2023-10-11T19:51:13Z","title":"Synthetic Data Generation with Large Language Models for Text Classification: Potential and Limitations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07849","snapshot_observed_at":"2026-08-08T04:54:50.759083Z","title":"Synthetic data generation with large language models for text classification: Potential and limitations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.759083Z"},"links":{"cited_paper":"/paper/2310.07849","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:4ae10eebd5dd3ae8ae7fde9778421b3d4ff4b1f0882fe1cb876531769dbc4618","observation_id":"c3141f0c-ebb9-45f5-aff6-ab04f5dbdf30","resolution":{"observed_at":"2026-08-08T04:54:50.759083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11971","last_updated":"2024-05-20T11:57:50Z","snapshot_observed_at":"2026-07-06T18:16:42.428308Z","submitted_at":"2024-05-20T11:57:50Z","title":"Data Augmentation for Text-based Person Retrieval Using Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.11971","snapshot_observed_at":"2026-08-08T04:54:50.763914Z","title":"Data augmentation for text-based person retrieval using large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.763914Z"},"links":{"cited_paper":"/paper/2405.11971","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:a0a5240d277787cad75d2386a4431e50b8c8d97fc53aab6860932ca4180fd52d","observation_id":"f97ee35f-5256-4306-b469-6aef0515cf41","resolution":{"observed_at":"2026-08-08T04:54:50.763914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-01T19:14:56.803459Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-08T04:54:50.768611Z","title":"Holistic evaluation of language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.768611Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:5ac486e727d1478d6c49e86949bb4f97bd95f71500a88bf0d08979cf4e95138a","observation_id":"08eb5c24-8535-4b84-8652-abfed5201ad3","resolution":{"observed_at":"2026-08-08T04:54:50.768611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:54:52.245384Z","title":"Diverse image generation via self-conditioned gans","venue":null,"work_id":"131d90a9-d8db-458b-9ba5-563bb4c58d42","year":2020},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.773433Z"},"links":{"citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:0db0d3af67c6974bb9b04ebdbfeec88fcfe0b88d8706230b4d28cd3371f8a1b6","observation_id":"891d3c4e-d9d6-4f37-a8b8-bc0cdcb861f7","resolution":{"observed_at":"2026-08-08T04:54:52.250478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-07-31T22:31:37.910868Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-08T04:54:50.778032Z","title":"Roberta: A robustly optimized bert pretraining approach","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.778032Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:90a98e3cf608deeb00dbb7a06f5ab971072bf65dc3d6427d520376ab9dccf87d","observation_id":"c377feb5-181f-4ea6-9368-b55998c56af2","resolution":{"observed_at":"2026-08-08T04:54:50.778032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15126","last_updated":"2024-06-14T07:47:09Z","snapshot_observed_at":"2026-08-09T02:49:33.324683Z","submitted_at":"2024-06-14T07:47:09Z","title":"On LLMs-Driven Synthetic Data Generation, Curation, and Evaluation: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15126","snapshot_observed_at":"2026-08-08T04:54:50.783032Z","title":"On llms-driven synthetic data generation, curation, and evaluation: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.783032Z"},"links":{"cited_paper":"/paper/2406.15126","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:94ba79b8ebe3eab3eb341b6891922892a8628402c37b1a102e88fedd033328f5","observation_id":"47a8d6a7-e4ec-4d07-b961-9eb6cd52bc93","resolution":{"observed_at":"2026-08-08T04:54:50.783032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-08T04:54:50.787809Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.787809Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:b51ddced9bac31d38916ed8b4b5613aeb73c736eb677096fc5a8e44069240b54","observation_id":"51b4ad43-6ec9-49af-8b38-a22dfca35cad","resolution":{"observed_at":"2026-08-08T04:54:50.787809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:54:52.229836Z","title":"L., Daly, R","venue":null,"work_id":"de6f943b-359a-422f-840b-928af5768bd3","year":2011},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.792664Z"},"links":{"citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:bce26e2cbc635d8535600b1c453bf37761171a2507b47ff4d2d46bc1f33349f6","observation_id":"2a577f0d-9ae0-483f-89c5-00da8c9dfefc","resolution":{"observed_at":"2026-08-08T04:54:52.234749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11637","last_updated":"2024-05-19T17:58:26Z","snapshot_observed_at":"2026-08-09T02:49:39.952867Z","submitted_at":"2024-05-19T17:58:26Z","title":"Zero-Shot Stance Detection using Contextual Data Generation with LLMs","version":1},"cited_work":{"arxiv_id":"2405.11637","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.11637","snapshot_observed_at":"2026-08-08T04:54:51.437411Z","title":"Zero-Shot Stance Detection using Contextual Data Generation with LLMs","venue":"cs.CL","work_id":"6b7db869-05de-42af-861d-6996ef37cad6","year":2024},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.797120Z"},"links":{"cited_paper":"/paper/2405.11637","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:38d74d4cb6c7acbb78fad0bf2ce7c49823b9c154b7cfbb43855c3d34c37e2c14","observation_id":"b2722620-46bc-4702-b72f-264135027aea","resolution":{"observed_at":"2026-08-08T04:54:51.442517Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1805.02867","last_updated":"2018-07-28T06:51:27Z","snapshot_observed_at":"2026-07-06T06:37:55.065033Z","submitted_at":"2018-05-08T07:34:17Z","title":"Online normalizer calculation for softmax","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.02867","snapshot_observed_at":"2026-08-08T04:54:50.801735Z","title":"and Gimelshein, N","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.801735Z"},"links":{"cited_paper":"/paper/1805.02867","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:1753f9cd1a0d0135e7c2708d2b314962698e5dcfd60723bdf47c4a386721050c","observation_id":"3f562b54-5973-460e-8ce2-4eb8e0b8b603","resolution":{"observed_at":"2026-08-08T04:54:50.801735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00816","last_updated":"2020-05-02T12:34:17Z","snapshot_observed_at":"2026-08-09T02:50:45.665595Z","submitted_at":"2020-05-02T12:34:17Z","title":"DQI: Measuring Data Quality in NLP","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.00816","snapshot_observed_at":"2026-08-08T04:54:50.806461Z","title":"Dqi: Measuring data quality in nlp","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.806461Z"},"links":{"cited_paper":"/paper/2005.00816","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:2880636d335f06ecbee67e5d45fcd0ae443976f98e2d59cf35b6d61d6ca109c0","observation_id":"805fea4b-e9e7-4120-a3af-3544770927cb","resolution":{"observed_at":"2026-08-08T04:54:50.806461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1604.01696","last_updated":"2016-04-06T17:15:10Z","snapshot_observed_at":"2026-08-02T13:14:17.832691Z","submitted_at":"2016-04-06T17:15:10Z","title":"A Corpus and Evaluation Framework for Deeper Understanding of Commonsense Stories","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1604.01696","snapshot_observed_at":"2026-08-08T04:54:50.811177Z","title":"A corpus and evaluation framework for deeper understanding of commonsense stories","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.811177Z"},"links":{"cited_paper":"/paper/1604.01696","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:f6e33542c63877cf2377e596691f8ed0116ee5d4b1b9ec3aa710c7fb7e53f139","observation_id":"8d061d46-68a1-4e8d-bcd2-de6c802f0cf8","resolution":{"observed_at":"2026-08-08T04:54:50.811177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:54:50.815873Z","title":"F., Oh, S","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.815873Z"},"links":{"citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:455bd517483e695250a6b08749acf5057dfe6a45915379ab19061ab96a584cf2","observation_id":"f30006b6-8d5d-4116-928a-e05759fb6821","resolution":{"observed_at":"2026-08-08T04:54:50.815873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02961","last_updated":"2024-11-05T18:16:21Z","snapshot_observed_at":"2026-08-09T02:52:37.227783Z","submitted_at":"2024-07-03T09:54:58Z","title":"Towards a Scalable Reference-Free Evaluation of Generative Models","version":2},"cited_work":{"arxiv_id":"2407.02961","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.02961","snapshot_observed_at":"2026-08-08T04:54:51.366115Z","title":"Towards a Scalable Reference-Free Evaluation of Generative Models","venue":"cs.LG","work_id":"eba5de9c-6a93-4138-92e1-c489a23b7a21","year":2024},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.820241Z"},"links":{"cited_paper":"/paper/2407.02961","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:eb3c0d6975899e0fb7932db808eb10d7a50f9d8446d984478c997212ee348f52","observation_id":"d145c66b-c379-4127-bc57-5a43002e8588","resolution":{"observed_at":"2026-08-08T04:54:51.371491Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05196","last_updated":"2024-07-01T16:36:30Z","snapshot_observed_at":"2026-08-09T02:48:08.220255Z","submitted_at":"2023-09-11T02:16:47Z","title":"Does Writing with Language Models Reduce Content Diversity?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05196","snapshot_observed_at":"2026-08-08T04:54:50.824906Z","title":"and He, H","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.824906Z"},"links":{"cited_paper":"/paper/2309.05196","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:3edcbcb287a677c1c5302f55f3a02c610a09fe3b1ff3c6eecd9d4c64b3b0618a","observation_id":"354c82d9-8399-46c0-bb0a-40064856b603","resolution":{"observed_at":"2026-08-08T04:54:50.824906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.08779","last_updated":"2019-12-03T18:19:07Z","snapshot_observed_at":"2026-08-09T05:21:08.018150Z","submitted_at":"2019-04-18T17:53:38Z","title":"SpecAugment: A Simple Data Augmentation Method for Automatic Speech Recognition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.08779","snapshot_observed_at":"2026-08-08T04:54:50.830221Z","title":"S., Chan, W., Zhang, Y., Chiu, C.-C., Zoph, B., Cubuk, E","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.830221Z"},"links":{"cited_paper":"/paper/1904.08779","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:be9f939f075e85f9372f9f58b16e9a3b1a62a026a8d45e09fb2dc8f8ed848356","observation_id":"2111c041-ac5b-4b68-afe0-8a2460f2ce45","resolution":{"observed_at":"2026-08-08T04:54:50.830221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:54:52.200272Z","title":"Mauve: Measuring the gap between neural text and human text using divergence frontiers","venue":null,"work_id":"98043a6f-5b50-4a01-9626-a67059cb72af","year":2021},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.834861Z"},"links":{"citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:45dfce131ae353d62dbf61bb916839feeff9aecb6e2e6c7899d3cf47322ac398","observation_id":"f7dd0437-fdb8-422c-bb14-4dc6a717b374","resolution":{"observed_at":"2026-08-08T04:54:52.206253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:54:52.182260Z","title":"unsup-simcse-bert-base-uncased, 2021","venue":null,"work_id":"fc23a244-4fed-45e3-b08f-c08e42aaf71b","year":2021},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.839404Z"},"links":{"citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:994ac541ecc6b90620d166bac6948aee7e4fd5468e2c7ba2313530442fc7c074","observation_id":"ac6b8b22-79d9-42c1-8efb-bce621c7ee56","resolution":{"observed_at":"2026-08-08T04:54:52.187494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:54:52.166669Z","title":null,"venue":null,"work_id":"63425e37-0ed9-40df-b089-3f5c5e129a27","year":1969},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.844004Z"},"links":{"citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:712a0cda3a588c03f64d27d658d1bae2cd5a1697a8116abd76d203aa6c65076f","observation_id":"2e4d732b-9b18-4896-acf7-1fbc98a19208","resolution":{"observed_at":"2026-08-08T04:54:52.171641Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.10084","last_updated":"2019-08-27T08:50:17Z","snapshot_observed_at":"2026-07-06T08:17:05.681370Z","submitted_at":"2019-08-27T08:50:17Z","title":"Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.10084","snapshot_observed_at":"2026-08-08T04:54:50.848669Z","title":"Sentence-bert: Sentence embeddings using siamese bert-networks","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.848669Z"},"links":{"cited_paper":"/paper/1908.10084","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:2629252a0a32da57d51dd01eeec220a4cb26b1888288a9c83d507a7c5a52a9c4","observation_id":"07a3c404-afc1-4a17-beb5-aebb845cb6e0","resolution":{"observed_at":"2026-08-08T04:54:50.848669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.04118","last_updated":"2020-05-08T15:48:31Z","snapshot_observed_at":"2026-08-09T02:47:57.041922Z","submitted_at":"2020-05-08T15:48:31Z","title":"Beyond Accuracy: Behavioral Testing of NLP models with CheckList","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.04118","snapshot_observed_at":"2026-08-08T04:54:50.853489Z","title":"T., Wu, T., Guestrin, C., and Singh, S","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.853489Z"},"links":{"cited_paper":"/paper/2005.04118","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:1cdcd39596051c215645b195cd3a83e721bb1efefb1350d712baf411314723cd","observation_id":"c6fbf12b-d000-483f-9986-45df04151659","resolution":{"observed_at":"2026-08-08T04:54:50.853489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07341","last_updated":"2025-01-23T21:26:02Z","snapshot_observed_at":"2026-08-09T02:52:01.623115Z","submitted_at":"2024-07-10T03:25:47Z","title":"A Guide To Effectively Leveraging LLMs for Low-Resource Text Summarization: Data Augmentation and Semi-supervised Approaches","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07341","snapshot_observed_at":"2026-08-08T04:54:50.858371Z","title":"and Laradji, I","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.858371Z"},"links":{"cited_paper":"/paper/2407.07341","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:a77cc5180fa53205e4acbdde3e4aed84f8d0e9993091cae262701e9cf63861cb","observation_id":"fb9834d8-84f6-4af4-82a7-d909508911db","resolution":{"observed_at":"2026-08-08T04:54:50.858371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.12426","last_updated":"2024-07-10T00:35:17Z","snapshot_observed_at":"2026-07-06T16:22:01.657709Z","submitted_at":"2023-09-21T18:48:02Z","title":"Can LLMs Augment Low-Resource Reading Comprehension Datasets? Opportunities and Challenges","version":2},"cited_work":{"arxiv_id":"2309.12426","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.12426","snapshot_observed_at":"2026-08-08T04:54:51.262939Z","title":"Can LLMs Augment Low-Resource Reading Comprehension Datasets? Opportunities and Challenges","venue":"cs.CL","work_id":"39eb7df6-ed50-4469-ad07-60cd274bcf5b","year":2023},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.863005Z"},"links":{"cited_paper":"/paper/2309.12426","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:36d4a65b223666814d77909327a8a2da5f58a4a4e25800a54eb6a5d6fe76dc8c","observation_id":"cc3a21ae-79e5-4887-92d4-2d667e6a6ca4","resolution":{"observed_at":"2026-08-08T04:54:51.268156Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:54:52.150687Z","title":"Gaussian processes for machine learning","venue":null,"work_id":"c8a85190-2a06-42dc-a98a-03d72d01fbb2","year":2004},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.868046Z"},"links":{"citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:35e509b396c73381e4f22d5056e4c2746a461eb5a641152c29d2fec255ab8059","observation_id":"a9439b37-f7ab-4139-8dcc-1787ffcb6881","resolution":{"observed_at":"2026-08-08T04:54:52.155689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:54:52.134731Z","title":"Svd-softmax: Fast softmax approximation on large vocabulary neural networks","venue":null,"work_id":"a2b562e5-6889-4947-9ae9-298becce846b","year":2017},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.872517Z"},"links":{"citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:00c30f382231ae3a26878fb1ff9037d8970881f361128a44360f648b4563b3f2","observation_id":"45baff46-d1eb-4867-b7ab-44538bfb9d78","resolution":{"observed_at":"2026-08-08T04:54:52.139912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:54:52.118751Z","title":"Generating diverse translations with sentence codes","venue":null,"work_id":"ca424ca8-0b2d-446d-a9b0-031129835796","year":2019},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.876925Z"},"links":{"citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:81369fe43ea79fdc0cf48f2e4b180f74552233c75beded6141eb7fa806ce538d","observation_id":"2af6fa1c-a014-467f-9909-16861cea5fa6","resolution":{"observed_at":"2026-08-08T04:54:52.123971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:54:50.881499Z","title":"D., Ng, A","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.881499Z"},"links":{"citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:65e7cb1368cd4e13802a13eedd1b936de25a667031a26cd788663ec6120d6635","observation_id":"2697c452-7575-4cf6-ba83-7ea9ee50d6a7","resolution":{"observed_at":"2026-08-08T04:54:50.881499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11124","last_updated":"2024-03-30T16:48:16Z","snapshot_observed_at":"2026-08-04T19:30:10.316827Z","submitted_at":"2024-03-17T07:08:55Z","title":"Scaling Data Diversity for Fine-Tuning Language Models in Human Alignment","version":2},"cited_work":{"arxiv_id":"2403.11124","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.11124","snapshot_observed_at":"2026-08-08T04:54:51.240972Z","title":"Scaling Data Diversity for Fine-Tuning Language Models in Human Alignment","venue":"cs.CL","work_id":"6b8ebfe6-8a0f-4ceb-91fd-be0ee57f3185","year":2024},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.886037Z"},"links":{"cited_paper":"/paper/2403.11124","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:46592106b30d76a0d8802a393f869283f13478f48e5c829df1e038f0e0539ed2","observation_id":"c19e820d-7ad4-4522-96b7-789df23b3d95","resolution":{"observed_at":"2026-08-08T04:54:51.246391Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:54:50.890842Z","title":"The proof and measurement of association between two things","venue":null,"work_id":null,"year":1961},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.890842Z"},"links":{"citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:b206ffca1c9e55fcc6c32af33a197117132f262666967c810cae1ac17e7cf510","observation_id":"688a2935-4735-40eb-9129-906b4577d04b","resolution":{"observed_at":"2026-08-08T04:54:50.890842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01497","last_updated":"2022-05-03T13:56:32Z","snapshot_observed_at":"2026-08-09T02:47:25.224188Z","submitted_at":"2022-05-03T13:56:32Z","title":"Semantic Diversity in Dialogue with Natural Language Inference","version":1},"cited_work":{"arxiv_id":"2205.01497","doi":null,"metadata_source":"pith","pith_arxiv_id":"2205.01497","snapshot_observed_at":"2026-08-08T04:54:51.215304Z","title":"Semantic Diversity in Dialogue with Natural Language Inference","venue":"cs.CL","work_id":"09d1be2a-33ca-444b-9e46-e456a120025f","year":2022},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.895206Z"},"links":{"cited_paper":"/paper/2205.01497","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:bd0aaec0a777acd7046097211ba65a0dc619d32b1565951ebc0144dc9c5139c2","observation_id":"edf9532e-a26c-4dac-9975-5af9f6e6d979","resolution":{"observed_at":"2026-08-08T04:54:51.222877Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13446","last_updated":"2024-12-02T20:55:15Z","snapshot_observed_at":"2026-08-09T02:48:32.516752Z","submitted_at":"2024-02-21T00:44:04Z","title":"Large Language Models for Data Annotation and Synthesis: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13446","snapshot_observed_at":"2026-08-08T04:54:50.899877Z","title":"Large language models for data annotation: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.899877Z"},"links":{"cited_paper":"/paper/2402.13446","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:51457618f5cbdbf3db8328fb1a55db8826ec744c25cd8c0142b1ceb8122e3b55","observation_id":"ea70da3b-b42c-4fa6-baf4-943670a7bdbf","resolution":{"observed_at":"2026-08-08T04:54:50.899877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:54:52.081672Z","title":"Alpacaeval : An automatic evaluator for instruction-following language models, 2023","venue":null,"work_id":"78f8d620-23bd-434c-a716-0b5d53e22782","year":2023},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.905481Z"},"links":{"citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:2b2102d8c898561f354ba51ff0b75bb8598c326a96df6331df2c6ffedcd0587d","observation_id":"a699ce9e-52f9-46ce-819f-6c8aecf959bc","resolution":{"observed_at":"2026-08-08T04:54:52.087061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.02990","last_updated":"2021-01-24T09:49:19Z","snapshot_observed_at":"2026-08-09T02:48:32.709725Z","submitted_at":"2020-04-06T20:44:10Z","title":"Evaluating the Evaluation of Diversity in Natural Language Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.02990","snapshot_observed_at":"2026-08-08T04:54:50.910077Z","title":"and Berant, J","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.910077Z"},"links":{"cited_paper":"/paper/2004.02990","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:e310803a4e9115e6a3fe3a112fea0bd23ffd6c887267d6f625140deff70ba584","observation_id":"629a0c19-c58a-4db8-aadd-f2f2f2dd353a","resolution":{"observed_at":"2026-08-08T04:54:50.910077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-08T04:54:50.914807Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.914807Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:29710d0420429e0d7a8e262a039d503adfaa49919fee862e3ba33c30a842db5b","observation_id":"a6e1cf4b-9756-47ce-a475-3a0c3c18005c","resolution":{"observed_at":"2026-08-08T04:54:50.914807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10560","last_updated":"2023-05-25T23:50:07Z","snapshot_observed_at":"2026-07-06T14:33:11.945106Z","submitted_at":"2022-12-20T18:59:19Z","title":"Self-Instruct: Aligning Language Models with Self-Generated Instructions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10560","snapshot_observed_at":"2026-08-08T04:54:50.919460Z","title":"A., Khashabi, D., and Hajishirzi, H","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.919460Z"},"links":{"cited_paper":"/paper/2212.10560","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:464eb45ce82fe2297e890ada1e817a0d2253c6137c993d44ba8bb814f6709b3b","observation_id":"59281473-afc1-4104-a287-32a7b580bdf8","resolution":{"observed_at":"2026-08-08T04:54:50.919460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:54:52.064804Z","title":"J., and Sch \\\"o lkopf, B","venue":null,"work_id":"2de068fe-8384-4f7b-9ba5-1f0fa4f6eb96","year":2023},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.924144Z"},"links":{"citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:76c59e07821409ba3c5a5b5ef5b6d1db0a5dfabadecd27d4732dd72d7858ee01","observation_id":"6a9e1682-7dba-4b27-a969-7c416a361088","resolution":{"observed_at":"2026-08-08T04:54:52.070244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.11382","last_updated":"2023-02-21T12:42:44Z","snapshot_observed_at":"2026-07-06T14:54:37.559648Z","submitted_at":"2023-02-21T12:42:44Z","title":"A Prompt Pattern Catalog to Enhance Prompt Engineering with ChatGPT","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.11382","snapshot_observed_at":"2026-08-08T04:54:50.929615Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.929615Z"},"links":{"cited_paper":"/paper/2302.11382","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:7e3dc0eeea4a6add3d4bd20e10b0a41122677891d4423d2a232704835618811c","observation_id":"bcf63371-685d-4431-83c7-13ada72e12e3","resolution":{"observed_at":"2026-08-08T04:54:50.929615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:54:52.047653Z","title":"Investigating the effectiveness of data augmentation from similarity and diversity: An empirical study","venue":null,"work_id":"49441183-7c50-483f-a753-d9f8ae620a8e","year":2024},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.934701Z"},"links":{"citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:86362c1d87e2851c7ca041ee0e5ade259c449f881518272dea26a961ea636739","observation_id":"94a79fb1-0db3-49d0-a84b-4974bbcf0e3c","resolution":{"observed_at":"2026-08-08T04:54:52.052711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:54:52.030886Z","title":"Mini-da: Improving your model performance through minimal data augmentation using llm","venue":null,"work_id":"e7017765-664e-4761-9cc5-ca113003b1ae","year":2024},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.939489Z"},"links":{"citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:a59f46e8adc283b9f7845fe85486b6e489872072efe88d2e89a8b07463038ba7","observation_id":"880b9266-a922-4e8b-aac1-b01015cfcb49","resolution":{"observed_at":"2026-08-08T04:54:52.036032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07922","last_updated":"2022-10-22T01:32:03Z","snapshot_observed_at":"2026-08-09T02:50:43.323418Z","submitted_at":"2022-02-16T08:18:02Z","title":"ZeroGen: Efficient Zero-shot Learning via Dataset Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.07922","snapshot_observed_at":"2026-08-08T04:54:50.944354Z","title":"Zerogen: Efficient zero-shot learning via dataset generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.944354Z"},"links":{"cited_paper":"/paper/2202.07922","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:e044c9e88bd07619618a09ac80856a5b695abb556e0adc8c48eba76783ba758b","observation_id":"4dcc5eaf-4c49-46da-b656-b0dbfaeca161","resolution":{"observed_at":"2026-08-08T04:54:50.944354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14568","last_updated":"2024-02-22T14:19:56Z","snapshot_observed_at":"2026-08-09T02:49:36.790924Z","submitted_at":"2024-02-22T14:19:56Z","title":"LLM-DA: Data Augmentation via Large Language Models for Few-Shot Named Entity Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14568","snapshot_observed_at":"2026-08-08T04:54:50.949266Z","title":"Llm-da: Data augmentation via large language models for few-shot named entity recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.949266Z"},"links":{"cited_paper":"/paper/2402.14568","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:0ff3deb0632272353cdf887af7b1b16b92b592c5036fcde249bd8107b9db1a85","observation_id":"3b8dba37-0569-4a98-a88e-6db513a20450","resolution":{"observed_at":"2026-08-08T04:54:50.949266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08826","last_updated":"2021-11-18T07:56:58Z","snapshot_observed_at":"2026-08-09T02:47:53.906217Z","submitted_at":"2021-04-18T11:39:33Z","title":"GPT3Mix: Leveraging Large-scale Language Models for Text Augmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08826","snapshot_observed_at":"2026-08-08T04:54:50.954005Z","title":"M., Park, D., Kang, J., Lee, S.-W., and Park, W","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.954005Z"},"links":{"cited_paper":"/paper/2104.08826","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:7171f4c297b31daf7edad80fd6516d53c8b7f3b95716ade2ad30a62969f01672","observation_id":"cd503249-e67f-4711-b802-1776c985488d","resolution":{"observed_at":"2026-08-08T04:54:50.954005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:54:52.014383Z","title":"Seqgan: Sequence generative adversarial nets with policy gradient","venue":null,"work_id":"9d491b3b-0ace-4858-8aa9-5cbd1ea4af31","year":2017},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.958803Z"},"links":{"citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:04a35940a88614ee79d1e3cf36496967b9e7d27766ee36a9794c3e8ec61f2ed9","observation_id":"69c113c1-d05b-4243-a9dc-b25ffc8b27c0","resolution":{"observed_at":"2026-08-08T04:54:52.019673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:54:51.997832Z","title":"J., Krishna, R., Shen, J., and Zhang, C","venue":null,"work_id":"b5151dcf-1f1d-4500-b213-3211f9e7fb73","year":2024},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.963582Z"},"links":{"citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:ed10cf82a75464c5c831d7dfae21e3d2402c7ee0b2006eda11742d772d6b591a","observation_id":"31a7f6a2-08bc-4d0b-a2ab-688396fce563","resolution":{"observed_at":"2026-08-08T04:54:52.002941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:54:51.981275Z","title":"Large language models for healthcare data augmentation: An example on patient-trial matching","venue":null,"work_id":"246f6c6c-948e-4e0d-bf96-25092d1a5677","year":2023},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.968074Z"},"links":{"citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:68c50dcce012a0d63bac780f34a1a2ccbe621d7ce2559d2b5574541c1f17dc1b","observation_id":"a8947880-ad2f-4cd3-a15c-9386aa3be716","resolution":{"observed_at":"2026-08-08T04:54:51.986380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02078","last_updated":"2024-04-02T16:25:30Z","snapshot_observed_at":"2026-08-09T02:47:29.602129Z","submitted_at":"2024-04-02T16:25:30Z","title":"Advancing LLM Reasoning Generalists with Preference Trees","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02078","snapshot_observed_at":"2026-08-08T04:54:50.972531Z","title":"Advancing llm reasoning generalists with preference trees","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.972531Z"},"links":{"cited_paper":"/paper/2404.02078","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:28cd3f2daf1de5a02923f1c245711461e25e3f2c3c030a3b21785000eaad3a72","observation_id":"165f613f-8b50-463b-87c7-d8edfa19b879","resolution":{"observed_at":"2026-08-08T04:54:50.972531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1710.09412","last_updated":"2018-04-27T21:39:25Z","snapshot_observed_at":"2026-08-08T10:28:19.597631Z","submitted_at":"2017-10-25T18:30:49Z","title":"mixup: Beyond Empirical Risk Minimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.09412","snapshot_observed_at":"2026-08-08T04:54:50.977285Z","title":"mixup: Beyond empirical risk minimization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.977285Z"},"links":{"cited_paper":"/paper/1710.09412","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:77bd07a3e9f2ab134a383e3b9483aef9ede437f08c218544f94d89a14dcad621","observation_id":"42718af5-05cf-4a99-acc0-3ac70493bd96","resolution":{"observed_at":"2026-08-08T04:54:50.977285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16807","last_updated":"2024-09-27T14:50:59Z","snapshot_observed_at":"2026-08-09T02:51:23.544392Z","submitted_at":"2024-04-25T17:52:39Z","title":"Improving Diversity of Commonsense Generation by Large Language Models via In-Context Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16807","snapshot_observed_at":"2026-08-08T04:54:50.982220Z","title":"Improving diversity of commonsense generation by large language models via in-context learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.982220Z"},"links":{"cited_paper":"/paper/2404.16807","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:12925a10082ffd04eb6d1bb860f47c1b7e97a86dfc31b8ef14dd6de1f9ef4102","observation_id":"12b56394-359d-4ae8-9b6c-c062538ba17e","resolution":{"observed_at":"2026-08-08T04:54:50.982220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:54:50.986785Z","title":"Character-level convolutional networks for text classification","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.986785Z"},"links":{"citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:41a777d35c88c7fc1cbf67dac33825b9b04a68d9119d0b7ff959456144d3202e","observation_id":"8f7c0f15-f21a-48c9-8168-8846f4aa3635","resolution":{"observed_at":"2026-08-08T04:54:50.986785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:54:51.953547Z","title":"Bootstrapped unsupervised sentence representation learning","venue":null,"work_id":"c4967a46-f1c3-4b3e-88c7-18f66192d49d","year":2021},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.991232Z"},"links":{"citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:ce410f2b0035c72e7b504706e9c57c765fe35f017791c7c6cee3267041d60420","observation_id":"137d54a6-ebf9-4298-a731-caee5ee8c2eb","resolution":{"observed_at":"2026-08-08T04:54:51.959354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:54:51.936616Z","title":"Texygen: A benchmarking platform for text generation models","venue":null,"work_id":"dfc1f734-9573-47fa-8055-83ae99f7e4cf","year":2018},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.995658Z"},"links":{"citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:03de3cdbce366ed0c438b128acdfc3ff74305c84f8490eb84a74f8ac45c93f93","observation_id":"d2aa0cc3-244a-4a9b-94bf-f00bdbaaf93b","resolution":{"observed_at":"2026-08-08T04:54:51.942160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:54:51.000155Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:51.000155Z"},"links":{"citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:8691f74dca9ed23d40801ad1d258d793ea1f8ac705cf99bf3a1ac5f4495e652c","observation_id":"9d0ced15-e46a-4bab-8035-e1c0c9b1adbd","resolution":{"observed_at":"2026-08-08T04:54:51.000155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets"},"reference_resolution":{"displayed":94,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":65,"verified_exact":8,"verified_fuzzy":21},"total_outbound_references":94},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 94 of 94 outbound references and 1 inbound Pith citation observation for arXiv:2502.08512."}