{"as_of":"2026-08-09T22:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a83ec9b199f013bfe132c82ca9e6899dd3befc668b1a967fe67e16ec6e1ca631","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":37,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T10:52:46.505878Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":6,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.15126","last_updated":"2024-06-14T07:47:09Z","snapshot_observed_at":"2026-08-09T02:49:33.324683Z","submitted_at":"2024-06-14T07:47:09Z","title":"On LLMs-Driven Synthetic Data Generation, Curation, and Evaluation: A Survey","version":1},"cited_work":{"arxiv_id":"2406.15126","doi":"10.48550/arxiv.2406.15126","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.15126","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Luccioni, A","venue":"arXiv (Cornell University)","work_id":"157afed6-d453-4ad3-8c5e-f0f8d311d18c","year":2024},"citing_paper":{"arxiv_id":"2407.21772","last_updated":"2024-08-04T22:13:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-31T17:48:14Z","title":"ShieldGemma: Generative AI Content Moderation Based on Gemma","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-20T13:17:39.444002Z"},"links":{"cited_paper":"/paper/2406.15126","citing_paper":"/paper/2407.21772"},"observation_digest":"sha256:170a997b06541f5bc9c014dfd3e2c88211cc42f1ffd07b211cfcdecebf2113b7","observation_id":"890944fb-0147-4a33-afbe-c6476202fa84","resolution":{"observed_at":"2026-05-20T13:17:39.527398Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15126","last_updated":"2024-06-14T07:47:09Z","snapshot_observed_at":"2026-08-09T02:49:33.324683Z","submitted_at":"2024-06-14T07:47:09Z","title":"On LLMs-Driven Synthetic Data Generation, Curation, and Evaluation: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15126","snapshot_observed_at":"2026-08-09T10:52:46.505878Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02863","last_updated":"2025-05-21T10:19:16Z","snapshot_observed_at":"2026-08-09T10:47:24.621167Z","submitted_at":"2025-02-05T03:45:33Z","title":"OceanChat: The Effect of Virtual Conversational AI Agents on Sustainable Attitude and Behavior Change","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-09T10:52:46.505878Z"},"links":{"cited_paper":"/paper/2406.15126","citing_paper":"/paper/2502.02863"},"observation_digest":"sha256:bc0593d158cda443d557671e8a0a64b1f557910ca7e1d310f2f5def97b1c02df","observation_id":"4defbc41-2b4f-443d-b9d7-b2b42e665400","resolution":{"observed_at":"2026-08-09T10:52:46.505878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15126","last_updated":"2024-06-14T07:47:09Z","snapshot_observed_at":"2026-08-09T02:49:33.324683Z","submitted_at":"2024-06-14T07:47:09Z","title":"On LLMs-Driven Synthetic Data Generation, Curation, and Evaluation: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15126","snapshot_observed_at":"2026-08-09T10:50:12.345590Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04362","last_updated":"2025-02-05T04:52:57Z","snapshot_observed_at":"2026-08-09T10:43:55.438000Z","submitted_at":"2025-02-05T04:52:57Z","title":"LLMs can be easily Confused by Instructional Distractions","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-09T10:50:12.345590Z"},"links":{"cited_paper":"/paper/2406.15126","citing_paper":"/paper/2502.04362"},"observation_digest":"sha256:e03c2dd3934812c3dc0e6433428746b16942ffab7987b48f3ab33f655ffc592d","observation_id":"23228c18-f2e8-4730-97fe-aa44f885fcff","resolution":{"observed_at":"2026-08-09T10:50:12.345590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15126","last_updated":"2024-06-14T07:47:09Z","snapshot_observed_at":"2026-08-09T02:49:33.324683Z","submitted_at":"2024-06-14T07:47:09Z","title":"On LLMs-Driven Synthetic Data Generation, Curation, and Evaluation: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15126","snapshot_observed_at":"2026-08-08T04:58:33.127252Z","title":"On llms-driven synthetic data generation, curation, and evaluation: A survey, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08489","last_updated":"2025-02-13T17:33:24Z","snapshot_observed_at":"2026-08-08T14:38:41.643106Z","submitted_at":"2025-02-12T15:26:08Z","title":"Salamandra Technical Report","version":2},"reference_index":123,"source":"pdf_text","source_observed_at":"2026-08-08T04:58:33.127252Z"},"links":{"cited_paper":"/paper/2406.15126","citing_paper":"/paper/2502.08489"},"observation_digest":"sha256:ff8de5d9b8f56f721a92bfb9e12849e9089e7c44a136e20965fbc606248829ec","observation_id":"e238ed7d-d92f-4022-b544-da65095d585e","resolution":{"observed_at":"2026-08-08T04:58:33.127252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15126","last_updated":"2024-06-14T07:47:09Z","snapshot_observed_at":"2026-08-09T02:49:33.324683Z","submitted_at":"2024-06-14T07:47:09Z","title":"On LLMs-Driven Synthetic Data Generation, Curation, and Evaluation: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15126","snapshot_observed_at":"2026-08-08T04:54:50.783032Z","title":"On llms-driven synthetic data generation, curation, and evaluation: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-09T13:56:26.887562Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.783032Z"},"links":{"cited_paper":"/paper/2406.15126","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:3379ef2e816bffaf39a8213f8a239be0da676d76ba1faa32cbd3600a21363990","observation_id":"47a8d6a7-e4ec-4d07-b961-9eb6cd52bc93","resolution":{"observed_at":"2026-08-08T04:54:50.783032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15126","last_updated":"2024-06-14T07:47:09Z","snapshot_observed_at":"2026-08-09T02:49:33.324683Z","submitted_at":"2024-06-14T07:47:09Z","title":"On LLMs-Driven Synthetic Data Generation, Curation, and Evaluation: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15126","snapshot_observed_at":"2026-08-08T17:20:36.520045Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08661","last_updated":"2025-02-15T03:49:29Z","snapshot_observed_at":"2026-08-09T02:50:32.707309Z","submitted_at":"2025-02-09T16:43:32Z","title":"Few-shot LLM Synthetic Data with Distribution Matching","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T17:20:36.520045Z"},"links":{"cited_paper":"/paper/2406.15126","citing_paper":"/paper/2502.08661"},"observation_digest":"sha256:37438ffedf9278d0097b52c60dfe3db22c1adcd984ce1e2119d4d3680cb61d77","observation_id":"f6c3afb6-5661-4ef6-9c40-b6966b13cfa6","resolution":{"observed_at":"2026-08-08T17:20:36.520045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15126","last_updated":"2024-06-14T07:47:09Z","snapshot_observed_at":"2026-08-09T02:49:33.324683Z","submitted_at":"2024-06-14T07:47:09Z","title":"On LLMs-Driven Synthetic Data Generation, Curation, and Evaluation: A Survey","version":1},"cited_work":{"arxiv_id":"2406.15126","doi":"10.48550/arxiv.2406.15126","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.15126","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Luccioni, A","venue":"arXiv (Cornell University)","work_id":"157afed6-d453-4ad3-8c5e-f0f8d311d18c","year":2024},"citing_paper":{"arxiv_id":"2504.13217","last_updated":"2026-05-18T14:05:55Z","snapshot_observed_at":"2026-08-01T15:57:04.534831Z","submitted_at":"2025-04-17T04:00:40Z","title":"Sustainability via LLM Right-sizing","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-22T19:24:58.690462Z"},"links":{"cited_paper":"/paper/2406.15126","citing_paper":"/paper/2504.13217"},"observation_digest":"sha256:f05fe30e4e1a838355c48bd23167cfdadb1aacaec7f88fd8df79ce99d4528d39","observation_id":"83cfefb7-5384-4832-8fec-07716a0c6b44","resolution":{"observed_at":"2026-05-22T19:25:03.702637Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15126","last_updated":"2024-06-14T07:47:09Z","snapshot_observed_at":"2026-08-09T02:49:33.324683Z","submitted_at":"2024-06-14T07:47:09Z","title":"On LLMs-Driven Synthetic Data Generation, Curation, and Evaluation: A Survey","version":1},"cited_work":{"arxiv_id":"2406.15126","doi":"10.48550/arxiv.2406.15126","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.15126","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Luccioni, A","venue":"arXiv (Cornell University)","work_id":"157afed6-d453-4ad3-8c5e-f0f8d311d18c","year":2024},"citing_paper":{"arxiv_id":"2504.20605","last_updated":"2026-05-02T05:59:29Z","snapshot_observed_at":"2026-08-08T04:52:21.534646Z","submitted_at":"2025-04-29T10:15:28Z","title":"TF1-EN-3M: Three Million Synthetic Moral Fables for Training Small, Open Language Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-22T19:01:42.307514Z"},"links":{"cited_paper":"/paper/2406.15126","citing_paper":"/paper/2504.20605"},"observation_digest":"sha256:9cf60b086d511401ba3f1f9aa3e0bec7a56743126a98f709170ef5a652ca89ab","observation_id":"4c48cbe3-b118-422a-b45b-530734da7e96","resolution":{"observed_at":"2026-05-22T19:01:57.855097Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15126","last_updated":"2024-06-14T07:47:09Z","snapshot_observed_at":"2026-08-09T02:49:33.324683Z","submitted_at":"2024-06-14T07:47:09Z","title":"On LLMs-Driven Synthetic Data Generation, Curation, and Evaluation: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15126","snapshot_observed_at":"2026-08-07T15:29:58.568816Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14978","last_updated":"2025-08-15T23:31:27Z","snapshot_observed_at":"2026-08-09T02:50:06.989585Z","submitted_at":"2025-05-20T23:40:57Z","title":"JARVIS: A Multi-Agent Code Assistant for High-Quality EDA Script Generation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:58.568816Z"},"links":{"cited_paper":"/paper/2406.15126","citing_paper":"/paper/2505.14978"},"observation_digest":"sha256:fae6de52907b6812b8009454871643256850aa96223fb8f2669b6b24bd95bcd2","observation_id":"725c5199-8b6e-437d-b9e0-eb3305b62565","resolution":{"observed_at":"2026-08-07T15:29:58.568816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15126","last_updated":"2024-06-14T07:47:09Z","snapshot_observed_at":"2026-08-09T02:49:33.324683Z","submitted_at":"2024-06-14T07:47:09Z","title":"On LLMs-Driven Synthetic Data Generation, Curation, and Evaluation: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15126","snapshot_observed_at":"2026-08-07T14:49:32.064271Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17615","last_updated":"2025-05-23T08:22:09Z","snapshot_observed_at":"2026-08-09T10:07:03.155906Z","submitted_at":"2025-05-23T08:22:09Z","title":"Large language model as user daily behavior data generator: balancing population diversity and individual personality","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T14:49:32.064271Z"},"links":{"cited_paper":"/paper/2406.15126","citing_paper":"/paper/2505.17615"},"observation_digest":"sha256:fb0a8e43d8229516c9a13b9b5b2b892818cf5e4426f1ad62687ea9be8c6c0b1b","observation_id":"f413e2ad-43c6-4d89-a4db-76e344c06d18","resolution":{"observed_at":"2026-08-07T14:49:32.064271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15126","last_updated":"2024-06-14T07:47:09Z","snapshot_observed_at":"2026-08-09T02:49:33.324683Z","submitted_at":"2024-06-14T07:47:09Z","title":"On LLMs-Driven Synthetic Data Generation, Curation, and Evaluation: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15126","snapshot_observed_at":"2026-08-07T14:33:13.460742Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18458","last_updated":"2025-06-01T16:00:34Z","snapshot_observed_at":"2026-08-07T20:59:19.597449Z","submitted_at":"2025-05-24T01:57:12Z","title":"A Survey of LLM $\\times$ DATA","version":3},"reference_index":272,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:13.460742Z"},"links":{"cited_paper":"/paper/2406.15126","citing_paper":"/paper/2505.18458"},"observation_digest":"sha256:7401b1a3d7a672cc49ceffbf1847d2e51a4e03e36ef3dba0876193794859a9e2","observation_id":"a6823ea5-7bdf-4c84-a979-7dd7cfc98994","resolution":{"observed_at":"2026-08-07T14:33:13.460742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15126","last_updated":"2024-06-14T07:47:09Z","snapshot_observed_at":"2026-08-09T02:49:33.324683Z","submitted_at":"2024-06-14T07:47:09Z","title":"On LLMs-Driven Synthetic Data Generation, Curation, and Evaluation: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15126","snapshot_observed_at":"2026-08-07T14:00:31.486151Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20416","last_updated":"2025-05-26T18:06:50Z","snapshot_observed_at":"2026-08-09T17:46:50.873415Z","submitted_at":"2025-05-26T18:06:50Z","title":"GraphGen: Enhancing Supervised Fine-Tuning for LLMs with Knowledge-Driven Synthetic Data Generation","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T14:00:31.486151Z"},"links":{"cited_paper":"/paper/2406.15126","citing_paper":"/paper/2505.20416"},"observation_digest":"sha256:577f73115964816d2fa2f52a6cd0e7dfd3b021540d25754869d1d6bd89296553","observation_id":"e988690b-12a9-44ef-9570-b074cb7ce78d","resolution":{"observed_at":"2026-08-07T14:00:31.486151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15126","last_updated":"2024-06-14T07:47:09Z","snapshot_observed_at":"2026-08-09T02:49:33.324683Z","submitted_at":"2024-06-14T07:47:09Z","title":"On LLMs-Driven Synthetic Data Generation, Curation, and Evaluation: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15126","snapshot_observed_at":"2026-08-07T13:56:04.125085Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20500","last_updated":"2025-05-26T20:01:44Z","snapshot_observed_at":"2026-08-07T13:51:04.145641Z","submitted_at":"2025-05-26T20:01:44Z","title":"Beyond Keywords: Evaluating Large Language Model Classification of Nuanced Ableism","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T13:56:04.125085Z"},"links":{"cited_paper":"/paper/2406.15126","citing_paper":"/paper/2505.20500"},"observation_digest":"sha256:43417434f9078bc01eac9a1cc882c501e869a696f0926a8c79d2d9aa9dee5daf","observation_id":"99359307-681a-4093-852c-b3bfbc5a5ed4","resolution":{"observed_at":"2026-08-07T13:56:04.125085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15126","last_updated":"2024-06-14T07:47:09Z","snapshot_observed_at":"2026-08-09T02:49:33.324683Z","submitted_at":"2024-06-14T07:47:09Z","title":"On LLMs-Driven Synthetic Data Generation, Curation, and Evaluation: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15126","snapshot_observed_at":"2026-08-07T13:08:01.650048Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22591","last_updated":"2025-05-28T17:02:47Z","snapshot_observed_at":"2026-08-09T02:52:29.432625Z","submitted_at":"2025-05-28T17:02:47Z","title":"Self-Error-Instruct: Generalizing from Errors for LLMs Mathematical Reasoning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:08:01.650048Z"},"links":{"cited_paper":"/paper/2406.15126","citing_paper":"/paper/2505.22591"},"observation_digest":"sha256:f3d6f1be25587e1c035eb4a35940dc90fe56e70e3cc073a91d4945abdb1a6cb8","observation_id":"bd5b2807-5380-4afa-b7fd-cb19bde98ccd","resolution":{"observed_at":"2026-08-07T13:08:01.650048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15126","last_updated":"2024-06-14T07:47:09Z","snapshot_observed_at":"2026-08-09T02:49:33.324683Z","submitted_at":"2024-06-14T07:47:09Z","title":"On LLMs-Driven Synthetic Data Generation, Curation, and Evaluation: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15126","snapshot_observed_at":"2026-08-07T12:44:06.650241Z","title":"On llms-driven synthetic data generation, curation, and evaluation: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23996","last_updated":"2025-05-29T20:45:18Z","snapshot_observed_at":"2026-08-07T21:00:36.726464Z","submitted_at":"2025-05-29T20:45:18Z","title":"Is Your Model Fairly Certain? Uncertainty-Aware Fairness Evaluation for LLMs","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:06.650241Z"},"links":{"cited_paper":"/paper/2406.15126","citing_paper":"/paper/2505.23996"},"observation_digest":"sha256:9fd7ada85a22ea3035b984b2288e84cff04a573f579289115954f531bad843ac","observation_id":"b8060b6a-96bb-4117-b0b6-c8d9a0695d7d","resolution":{"observed_at":"2026-08-07T12:44:06.650241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15126","last_updated":"2024-06-14T07:47:09Z","snapshot_observed_at":"2026-08-09T02:49:33.324683Z","submitted_at":"2024-06-14T07:47:09Z","title":"On LLMs-Driven Synthetic Data Generation, Curation, and Evaluation: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15126","snapshot_observed_at":"2026-08-07T12:35:30.421658Z","title":"org/abs/2406.15126,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24292","last_updated":"2025-05-30T07:06:11Z","snapshot_observed_at":"2026-08-08T01:28:40.239800Z","submitted_at":"2025-05-30T07:06:11Z","title":"Mind the Quote: Enabling Quotation-Aware Dialogue in LLMs via Plug-and-Play Modules","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:30.421658Z"},"links":{"cited_paper":"/paper/2406.15126","citing_paper":"/paper/2505.24292"},"observation_digest":"sha256:947fcde9ed22f493b02b1ba029c3f7687e3a6a527d5dd8fabda737bf9adb4169","observation_id":"3c26e6a5-b823-4894-9ec8-1e16ed46b9f6","resolution":{"observed_at":"2026-08-07T12:35:30.421658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15126","last_updated":"2024-06-14T07:47:09Z","snapshot_observed_at":"2026-08-09T02:49:33.324683Z","submitted_at":"2024-06-14T07:47:09Z","title":"On LLMs-Driven Synthetic Data Generation, Curation, and Evaluation: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15126","snapshot_observed_at":"2026-08-07T11:07:56.669407Z","title":"On llms-driven synthetic data generation, curation, and evaluation: A survey.arXiv preprint arXiv:2406.15126, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03448","last_updated":"2025-06-03T23:20:24Z","snapshot_observed_at":"2026-08-09T02:51:32.317520Z","submitted_at":"2025-06-03T23:20:24Z","title":"RefEdit: A Benchmark and Method for Improving Instruction-based Image Editing Model on Referring Expressions","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:07:56.669407Z"},"links":{"cited_paper":"/paper/2406.15126","citing_paper":"/paper/2506.03448"},"observation_digest":"sha256:0950574f6f9306181fbc5fbccefc3f79b0b552607c7699eca6b6d992d7e6f58f","observation_id":"2696c1ba-bdf1-49a3-b809-0e61438c4ba9","resolution":{"observed_at":"2026-08-07T11:07:56.669407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15126","last_updated":"2024-06-14T07:47:09Z","snapshot_observed_at":"2026-08-09T02:49:33.324683Z","submitted_at":"2024-06-14T07:47:09Z","title":"On LLMs-Driven Synthetic Data Generation, Curation, and Evaluation: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15126","snapshot_observed_at":"2026-08-07T10:50:50.163370Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04172","last_updated":"2025-06-04T17:15:19Z","snapshot_observed_at":"2026-08-08T11:40:08.759265Z","submitted_at":"2025-06-04T17:15:19Z","title":"Does Prompt Design Impact Quality of Data Imputation by LLMs?","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T10:50:50.163370Z"},"links":{"cited_paper":"/paper/2406.15126","citing_paper":"/paper/2506.04172"},"observation_digest":"sha256:2e37bbd1aa87251dab58f849f66cd715eb967fb2d812909158c72070552f58bb","observation_id":"bab40330-8c93-4715-950b-a85c840ea0ef","resolution":{"observed_at":"2026-08-07T10:50:50.163370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15126","last_updated":"2024-06-14T07:47:09Z","snapshot_observed_at":"2026-08-09T02:49:33.324683Z","submitted_at":"2024-06-14T07:47:09Z","title":"On LLMs-Driven Synthetic Data Generation, Curation, and Evaluation: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15126","snapshot_observed_at":"2026-08-07T05:33:50.951802Z","title":"On LLMs-Driven Synthetic Data Gener- ation, Curation, and Evaluation: A Survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07647","last_updated":"2025-06-09T11:12:02Z","snapshot_observed_at":"2026-08-09T11:40:16.573138Z","submitted_at":"2025-06-09T11:12:02Z","title":"Foundation Model Empowered Synesthesia of Machines (SoM): AI-native Intelligent Multi-Modal Sensing-Communication Integration","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:50.951802Z"},"links":{"cited_paper":"/paper/2406.15126","citing_paper":"/paper/2506.07647"},"observation_digest":"sha256:454f89b3c3b49a21cc7421f9c7136d958cb0b89bf3488837e61e87dcc1559622","observation_id":"93bbf116-0989-4c37-8b3c-b4001d090f20","resolution":{"observed_at":"2026-08-07T05:33:50.951802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15126","last_updated":"2024-06-14T07:47:09Z","snapshot_observed_at":"2026-08-09T02:49:33.324683Z","submitted_at":"2024-06-14T07:47:09Z","title":"On LLMs-Driven Synthetic Data Generation, Curation, and Evaluation: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15126","snapshot_observed_at":"2026-08-07T05:05:37.118238Z","title":"On LLMs-Driven Synthetic Data Generation, Curation, and Evaluation: A Survey","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08750","last_updated":"2025-06-10T12:45:12Z","snapshot_observed_at":"2026-08-09T19:54:26.891330Z","submitted_at":"2025-06-10T12:45:12Z","title":"Unlocking the Potential of Large Language Models in the Nuclear Industry with Synthetic Data","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:37.118238Z"},"links":{"cited_paper":"/paper/2406.15126","citing_paper":"/paper/2506.08750"},"observation_digest":"sha256:37e3e27e589c093d49cc20ebbf70e3e2e4c2c89ac6d5ad0c97193b44f5391007","observation_id":"574188a8-7994-4b1b-aa44-c4fafaf13b44","resolution":{"observed_at":"2026-08-07T05:05:37.118238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15126","last_updated":"2024-06-14T07:47:09Z","snapshot_observed_at":"2026-08-09T02:49:33.324683Z","submitted_at":"2024-06-14T07:47:09Z","title":"On LLMs-Driven Synthetic Data Generation, Curation, and Evaluation: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15126","snapshot_observed_at":"2026-08-07T00:14:06.967525Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14927","last_updated":"2025-06-17T19:14:30Z","snapshot_observed_at":"2026-08-09T13:20:44.500546Z","submitted_at":"2025-06-17T19:14:30Z","title":"MDBench: A Synthetic Multi-Document Reasoning Benchmark Generated with Knowledge Guidance","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T00:14:06.967525Z"},"links":{"cited_paper":"/paper/2406.15126","citing_paper":"/paper/2506.14927"},"observation_digest":"sha256:d386c180580a5897f72c23db1c3362b52f38feb93623e5829a79b273cde95882","observation_id":"fcd82b9e-de32-48a2-8c7e-f66f1cbf1563","resolution":{"observed_at":"2026-08-07T00:14:06.967525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15126","last_updated":"2024-06-14T07:47:09Z","snapshot_observed_at":"2026-08-09T02:49:33.324683Z","submitted_at":"2024-06-14T07:47:09Z","title":"On LLMs-Driven Synthetic Data Generation, Curation, and Evaluation: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15126","snapshot_observed_at":"2026-08-06T22:56:32.834913Z","title":"On LLMs-Driven Synthetic Data Generation, Curation, and Evaluation: A Survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:32.834913Z"},"links":{"cited_paper":"/paper/2406.15126","citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:55f935073dfc52c09bb72ac284159eec73ba7719f2c894fe69db143c5412c847","observation_id":"c3dea55e-8b96-4cb9-97c7-39ffa85710e5","resolution":{"observed_at":"2026-08-06T22:56:32.834913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15126","last_updated":"2024-06-14T07:47:09Z","snapshot_observed_at":"2026-08-09T02:49:33.324683Z","submitted_at":"2024-06-14T07:47:09Z","title":"On LLMs-Driven Synthetic Data Generation, Curation, and Evaluation: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15126","snapshot_observed_at":"2026-08-06T21:36:40.094301Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23762","last_updated":"2025-06-30T12:09:29Z","snapshot_observed_at":"2026-08-06T21:29:49.550137Z","submitted_at":"2025-06-30T12:09:29Z","title":"Software Engineering for Large Language Models: Research Status, Challenges and the Road Ahead","version":1},"reference_index":235,"source":"pdf_text","source_observed_at":"2026-08-06T21:36:40.094301Z"},"links":{"cited_paper":"/paper/2406.15126","citing_paper":"/paper/2506.23762"},"observation_digest":"sha256:08c3af945bdd59b3a30905703fabe59d5255ea7bf619557c47a8ea0833c0f437","observation_id":"1b340424-07fc-4105-aed3-5e3db21e1b0c","resolution":{"observed_at":"2026-08-06T21:36:40.094301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15126","last_updated":"2024-06-14T07:47:09Z","snapshot_observed_at":"2026-08-09T02:49:33.324683Z","submitted_at":"2024-06-14T07:47:09Z","title":"On LLMs-Driven Synthetic Data Generation, Curation, and Evaluation: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15126","snapshot_observed_at":"2026-08-06T20:25:24.594546Z","title":"On llms-driven synthetic data generation, curation, and evaluation: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02804","last_updated":"2026-06-28T12:40:31Z","snapshot_observed_at":"2026-08-08T16:13:23.244408Z","submitted_at":"2025-07-03T17:07:20Z","title":"Multimodal Mathematical Reasoning with Diverse Solving Perspective","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:24.594546Z"},"links":{"cited_paper":"/paper/2406.15126","citing_paper":"/paper/2507.02804"},"observation_digest":"sha256:1125fcb7dc896596ba06b5c2fd6bdfc3e79f339f72ec673f1b66c648356f6a8e","observation_id":"7e4b5e67-e0bb-4d3f-bf5f-471fee0c1b7d","resolution":{"observed_at":"2026-08-06T20:25:24.594546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15126","last_updated":"2024-06-14T07:47:09Z","snapshot_observed_at":"2026-08-09T02:49:33.324683Z","submitted_at":"2024-06-14T07:47:09Z","title":"On LLMs-Driven Synthetic Data Generation, Curation, and Evaluation: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15126","snapshot_observed_at":"2026-08-06T15:46:27.789467Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15092","last_updated":"2025-07-20T19:14:43Z","snapshot_observed_at":"2026-08-09T04:23:52.892130Z","submitted_at":"2025-07-20T19:14:43Z","title":"A Penalty Goes a Long Way: Measuring Lexical Diversity in Synthetic Texts Under Prompt-Influenced Length Variations","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T15:46:27.789467Z"},"links":{"cited_paper":"/paper/2406.15126","citing_paper":"/paper/2507.15092"},"observation_digest":"sha256:ba9de3c35c7b7fdcd7acd51b46f8bddbeb8c0954fb77c2e9e66c9567f7b21e6e","observation_id":"f3f078ea-e490-4762-8c9a-1bafb49c87b4","resolution":{"observed_at":"2026-08-06T15:46:27.789467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15126","last_updated":"2024-06-14T07:47:09Z","snapshot_observed_at":"2026-08-09T02:49:33.324683Z","submitted_at":"2024-06-14T07:47:09Z","title":"On LLMs-Driven Synthetic Data Generation, Curation, and Evaluation: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15126","snapshot_observed_at":"2026-08-06T15:50:37.908542Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15892","last_updated":"2025-07-20T13:41:02Z","snapshot_observed_at":"2026-08-09T02:48:10.598268Z","submitted_at":"2025-07-20T13:41:02Z","title":"StaAgent: An Agentic Framework for Testing Static Analyzers","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T15:50:37.908542Z"},"links":{"cited_paper":"/paper/2406.15126","citing_paper":"/paper/2507.15892"},"observation_digest":"sha256:96acf8c1601f84967eb94318889c78ec23a7448d354ea0a474baf652c0ad22d7","observation_id":"2e77c0ea-1796-4f21-a6a5-65b116f4353f","resolution":{"observed_at":"2026-08-06T15:50:37.908542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15126","last_updated":"2024-06-14T07:47:09Z","snapshot_observed_at":"2026-08-09T02:49:33.324683Z","submitted_at":"2024-06-14T07:47:09Z","title":"On LLMs-Driven Synthetic Data Generation, Curation, and Evaluation: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15126","snapshot_observed_at":"2026-08-06T05:22:29.785059Z","title":"arXiv preprint arXiv:2406.15126 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01866","last_updated":"2025-08-03T17:42:00Z","snapshot_observed_at":"2026-08-06T23:06:11.846316Z","submitted_at":"2025-08-03T17:42:00Z","title":"Separation Logic of Generic Resources via Sheafeology","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T05:22:29.785059Z"},"links":{"cited_paper":"/paper/2406.15126","citing_paper":"/paper/2508.01866"},"observation_digest":"sha256:b7b79eb57d88d7e422171a875b39cc96b037cf025b7b2e551d82a41054c98945","observation_id":"2638cc1b-afbf-463a-af2d-1ee6cb7c114c","resolution":{"observed_at":"2026-08-06T05:22:29.785059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15126","last_updated":"2024-06-14T07:47:09Z","snapshot_observed_at":"2026-08-09T02:49:33.324683Z","submitted_at":"2024-06-14T07:47:09Z","title":"On LLMs-Driven Synthetic Data Generation, Curation, and Evaluation: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15126","snapshot_observed_at":"2026-08-05T16:02:03.543010Z","title":"arXiv preprint arXiv:2406.15126","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.19069","last_updated":"2025-08-26T14:26:32Z","snapshot_observed_at":"2026-08-07T02:35:16.060570Z","submitted_at":"2025-08-26T14:26:32Z","title":"Can Structured Templates Facilitate LLMs in Tackling Harder Tasks? : An Exploration of Scaling Laws by Difficulty","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T16:02:03.543010Z"},"links":{"cited_paper":"/paper/2406.15126","citing_paper":"/paper/2508.19069"},"observation_digest":"sha256:b72ecba2f27c972a7763c50e506e53b40fe3713cab3776da06fa5ce0edf937b8","observation_id":"712f1cf3-7c7d-49bc-8a5e-da308e5f1203","resolution":{"observed_at":"2026-08-05T16:02:03.543010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15126","last_updated":"2024-06-14T07:47:09Z","snapshot_observed_at":"2026-08-09T02:49:33.324683Z","submitted_at":"2024-06-14T07:47:09Z","title":"On LLMs-Driven Synthetic Data Generation, Curation, and Evaluation: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15126","snapshot_observed_at":"2026-08-03T18:04:30.736714Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.07246","last_updated":"2026-07-29T04:24:14Z","snapshot_observed_at":"2026-08-05T18:56:42.339423Z","submitted_at":"2025-12-08T07:40:48Z","title":"Ensembling LLM-Induced Decision Trees for Explainable and Robust Error Detection","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T18:04:30.736714Z"},"links":{"cited_paper":"/paper/2406.15126","citing_paper":"/paper/2512.07246"},"observation_digest":"sha256:e1d0323f355a905b023ede5038c259fb35106e0ac43098d48f2827cb0e069174","observation_id":"20af70e1-bc96-44b8-bc74-c32143b195a6","resolution":{"observed_at":"2026-08-03T18:04:30.736714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15126","last_updated":"2024-06-14T07:47:09Z","snapshot_observed_at":"2026-08-09T02:49:33.324683Z","submitted_at":"2024-06-14T07:47:09Z","title":"On LLMs-Driven Synthetic Data Generation, Curation, and Evaluation: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15126","snapshot_observed_at":"2026-08-03T01:17:11.752127Z","title":"On llms-driven synthetic data generation, cura- tion, and evaluation: A survey.arXiv preprint arXiv:2406.15126, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.10388","last_updated":"2026-05-29T05:05:29Z","snapshot_observed_at":"2026-08-07T17:40:15.715656Z","submitted_at":"2026-02-11T00:23:13Z","title":"Less is Enough: Synthesizing Diverse Data in LLM Feature Space with Sparse Autoencoders","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T01:17:11.752127Z"},"links":{"cited_paper":"/paper/2406.15126","citing_paper":"/paper/2602.10388"},"observation_digest":"sha256:8058b8563fac3c59639aead18bcc7732e969a5d5d3de085476dd947efbde971d","observation_id":"d3266ee6-522b-4bee-9f24-2c6dec1c55d6","resolution":{"observed_at":"2026-08-03T01:17:11.752127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15126","last_updated":"2024-06-14T07:47:09Z","snapshot_observed_at":"2026-08-09T02:49:33.324683Z","submitted_at":"2024-06-14T07:47:09Z","title":"On LLMs-Driven Synthetic Data Generation, Curation, and Evaluation: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15126","snapshot_observed_at":"2026-08-02T20:26:40.494982Z","title":"On llms-driven synthetic data generation, curation, and evaluation: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.23312","last_updated":"2026-06-02T19:40:01Z","snapshot_observed_at":"2026-08-09T02:50:43.884684Z","submitted_at":"2026-02-26T18:20:26Z","title":"Evaluating Zero-Shot and One-Shot Adaptation of Small Language Models in Leader-Follower Interaction","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T20:26:40.494982Z"},"links":{"cited_paper":"/paper/2406.15126","citing_paper":"/paper/2602.23312"},"observation_digest":"sha256:5e4e273c2dab452afff22ce72bad9dcdc56ab987df3fd649b80842e3d1639a1a","observation_id":"a659fb5e-e911-4f3a-ab29-9e12d0ff0099","resolution":{"observed_at":"2026-08-02T20:26:40.494982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15126","last_updated":"2024-06-14T07:47:09Z","snapshot_observed_at":"2026-08-09T02:49:33.324683Z","submitted_at":"2024-06-14T07:47:09Z","title":"On LLMs-Driven Synthetic Data Generation, Curation, and Evaluation: A Survey","version":1},"cited_work":{"arxiv_id":"2406.15126","doi":"10.48550/arxiv.2406.15126","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.15126","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Luccioni, A","venue":"arXiv (Cornell University)","work_id":"157afed6-d453-4ad3-8c5e-f0f8d311d18c","year":2024},"citing_paper":{"arxiv_id":"2603.12296","last_updated":"2026-05-19T01:33:15Z","snapshot_observed_at":"2026-08-03T13:09:34.264460Z","submitted_at":"2026-03-11T20:36:02Z","title":"Synthetic Data Generation for Brain-Computer Interfaces: Overview, Benchmarking, and Future Directions","version":2},"reference_index":119,"source":"pdf_text","source_observed_at":"2026-05-21T11:26:13.074820Z"},"links":{"cited_paper":"/paper/2406.15126","citing_paper":"/paper/2603.12296"},"observation_digest":"sha256:f1042cd46923d419f4664fb3209c97b3f04d293f533f9f61e6a2f25be62e0a6d","observation_id":"9c00e8b3-e66b-48be-b0ad-7a4b50ce7297","resolution":{"observed_at":"2026-05-21T11:30:02.555967Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15126","last_updated":"2024-06-14T07:47:09Z","snapshot_observed_at":"2026-08-09T02:49:33.324683Z","submitted_at":"2024-06-14T07:47:09Z","title":"On LLMs-Driven Synthetic Data Generation, Curation, and Evaluation: A Survey","version":1},"cited_work":{"arxiv_id":"2406.15126","doi":"10.48550/arxiv.2406.15126","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.15126","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Luccioni, A","venue":"arXiv (Cornell University)","work_id":"157afed6-d453-4ad3-8c5e-f0f8d311d18c","year":2024},"citing_paper":{"arxiv_id":"2604.24544","last_updated":"2026-04-27T14:39:41Z","snapshot_observed_at":"2026-07-06T23:10:33.821313Z","submitted_at":"2026-04-27T14:39:41Z","title":"STELLAR-E: a Synthetic, Tailored, End-to-end LLM Application Rigorous Evaluator","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-08T03:39:30.528601Z"},"links":{"cited_paper":"/paper/2406.15126","citing_paper":"/paper/2604.24544"},"observation_digest":"sha256:32aee25fc1ac0bd486c6bfb20e054f56cb9182a97334fe2f8d0dd25fdd38ec40","observation_id":"23c81e38-a8d9-4451-b942-6d7d66a9dcde","resolution":{"observed_at":"2026-05-11T22:01:10.900240Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15126","last_updated":"2024-06-14T07:47:09Z","snapshot_observed_at":"2026-08-09T02:49:33.324683Z","submitted_at":"2024-06-14T07:47:09Z","title":"On LLMs-Driven Synthetic Data Generation, Curation, and Evaluation: A Survey","version":1},"cited_work":{"arxiv_id":"2406.15126","doi":"10.48550/arxiv.2406.15126","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.15126","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Luccioni, A","venue":"arXiv (Cornell University)","work_id":"157afed6-d453-4ad3-8c5e-f0f8d311d18c","year":2024},"citing_paper":{"arxiv_id":"2605.30529","last_updated":"2026-05-28T20:06:43Z","snapshot_observed_at":"2026-08-02T08:55:40.388952Z","submitted_at":"2026-05-28T20:06:43Z","title":"Generalistic or Specific Embeddings, Which is Better? An Empirical Study on Search for Clinical Coding in Non-English Languages","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-29T07:27:03.060416Z"},"links":{"cited_paper":"/paper/2406.15126","citing_paper":"/paper/2605.30529"},"observation_digest":"sha256:8f6a646ad981ec0d95c3b4efcfa0f135f030d8154c3a2add6106efd139f8ff4f","observation_id":"504947f0-1718-445b-9340-02f3f479b4cc","resolution":{"observed_at":"2026-06-29T07:33:14.004650Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15126","last_updated":"2024-06-14T07:47:09Z","snapshot_observed_at":"2026-08-09T02:49:33.324683Z","submitted_at":"2024-06-14T07:47:09Z","title":"On LLMs-Driven Synthetic Data Generation, Curation, and Evaluation: A Survey","version":1},"cited_work":{"arxiv_id":"2406.15126","doi":"10.48550/arxiv.2406.15126","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.15126","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Luccioni, A","venue":"arXiv (Cornell University)","work_id":"157afed6-d453-4ad3-8c5e-f0f8d311d18c","year":2024},"citing_paper":{"arxiv_id":"2605.30637","last_updated":"2026-05-28T22:38:26Z","snapshot_observed_at":"2026-07-06T23:39:53.132531Z","submitted_at":"2026-05-28T22:38:26Z","title":"EHRBench: An Automated and Reliable EHR-based Benchmark for Clinical Decision Making with LLMs","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-06-29T06:41:06.828814Z"},"links":{"cited_paper":"/paper/2406.15126","citing_paper":"/paper/2605.30637"},"observation_digest":"sha256:dfaaa2b2341ba80f00a24747f19e9dc8e20e0ee68201e9eb2fdc6da08a6e8d4b","observation_id":"b07bf8c5-9b38-4291-b43e-1e213c5f7033","resolution":{"observed_at":"2026-06-29T06:43:10.450895Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15126","last_updated":"2024-06-14T07:47:09Z","snapshot_observed_at":"2026-08-09T02:49:33.324683Z","submitted_at":"2024-06-14T07:47:09Z","title":"On LLMs-Driven Synthetic Data Generation, Curation, and Evaluation: A Survey","version":1},"cited_work":{"arxiv_id":"2406.15126","doi":"10.48550/arxiv.2406.15126","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.15126","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Luccioni, A","venue":"arXiv (Cornell University)","work_id":"157afed6-d453-4ad3-8c5e-f0f8d311d18c","year":2024},"citing_paper":{"arxiv_id":"2606.11219","last_updated":"2026-05-11T20:27:40Z","snapshot_observed_at":"2026-08-05T20:46:41.277498Z","submitted_at":"2026-05-11T20:27:40Z","title":"Afrispeech Semantics: Evaluating Audio Semantic Reasoning in Spoken Language Models Across Domains and Accents","version":1},"reference_index":183,"source":"arxiv_source","source_observed_at":"2026-06-30T22:11:44.891731Z"},"links":{"cited_paper":"/paper/2406.15126","citing_paper":"/paper/2606.11219"},"observation_digest":"sha256:15844aaf5875403a198009a6c56c37f3fddba5bf96f18e58d04870fec9a064dc","observation_id":"743079c3-2c4b-4f49-959f-2c9ce247e40d","resolution":{"observed_at":"2026-06-30T22:15:05.703956Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15126","last_updated":"2024-06-14T07:47:09Z","snapshot_observed_at":"2026-08-09T02:49:33.324683Z","submitted_at":"2024-06-14T07:47:09Z","title":"On LLMs-Driven Synthetic Data Generation, Curation, and Evaluation: A Survey","version":1},"cited_work":{"arxiv_id":"2406.15126","doi":"10.48550/arxiv.2406.15126","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.15126","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Luccioni, A","venue":"arXiv (Cornell University)","work_id":"157afed6-d453-4ad3-8c5e-f0f8d311d18c","year":2024},"citing_paper":{"arxiv_id":"2606.12443","last_updated":"2026-05-19T16:58:15Z","snapshot_observed_at":"2026-08-09T09:21:17.939008Z","submitted_at":"2026-05-19T16:58:15Z","title":"Occupational Prompting Reveals Cultural Bias in Large Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-30T18:03:09.275405Z"},"links":{"cited_paper":"/paper/2406.15126","citing_paper":"/paper/2606.12443"},"observation_digest":"sha256:1d805f1250438415cbd2af01bbb3f8f6b5fc6c2d7e9f9a743f9a6e84ccc1bbe9","observation_id":"12b1cfe5-285e-4912-9d0e-03f1aeea657f","resolution":{"observed_at":"2026-06-30T18:04:57.826486Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2406.15126/citation-record","integrity":"/paper/2406.15126/integrity","json":"/paper/2406.15126/citation-record.json","paper":"/paper/2406.15126"},"outbound":[],"paper":{"arxiv_id":"2406.15126","last_updated":"2024-06-14T07:47:09Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T02:49:33.324683Z","submitted_at":"2024-06-14T07:47:09Z","title":"On LLMs-Driven Synthetic Data Generation, Curation, and Evaluation: A Survey"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 37 inbound Pith citation observations for arXiv:2406.15126."}