{"as_of":"2026-08-09T23:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fd8becc0d7807863fcac8ce2ba1e484898461beff061b5ddd68bc5bc33df6b14","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":32,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T23:21:02.187332Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T10:45:42.828782Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.07503","last_updated":"2024-08-10T20:46:47Z","snapshot_observed_at":"2026-07-06T17:58:39.485508Z","submitted_at":"2024-04-11T06:34:17Z","title":"Best Practices and Lessons Learned on Synthetic Data","version":2},"cited_work":{"arxiv_id":"2404.07503","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.07503","snapshot_observed_at":"2026-07-01T10:45:42.828782Z","title":"Best practices and lessons learned on synthetic data","venue":null,"work_id":"3f19fa45-10d0-4103-80da-d9d6278e0a38","year":2024},"citing_paper":{"arxiv_id":"2406.00515","last_updated":"2024-11-10T22:02:27Z","snapshot_observed_at":"2026-07-29T20:40:25.374189Z","submitted_at":"2024-06-01T17:48:15Z","title":"A Survey on Large Language Models for Code Generation","version":2},"reference_index":169,"source":"pdf_text","source_observed_at":"2026-05-13T20:18:06.304134Z"},"links":{"cited_paper":"/paper/2404.07503","citing_paper":"/paper/2406.00515"},"observation_digest":"sha256:3c0587a1b7b690cf4d19a52b4685eea70c4de176b354a592623e2de1c20be915","observation_id":"d7eb1bc5-075d-4d90-82ab-1e276744f12d","resolution":{"observed_at":"2026-05-13T20:18:06.427232Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07503","last_updated":"2024-08-10T20:46:47Z","snapshot_observed_at":"2026-07-06T17:58:39.485508Z","submitted_at":"2024-04-11T06:34:17Z","title":"Best Practices and Lessons Learned on Synthetic Data","version":2},"cited_work":{"arxiv_id":"2404.07503","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.07503","snapshot_observed_at":"2026-07-01T10:45:42.828782Z","title":"Best practices and lessons learned on synthetic data","venue":null,"work_id":"3f19fa45-10d0-4103-80da-d9d6278e0a38","year":2024},"citing_paper":{"arxiv_id":"2406.08464","last_updated":"2024-10-07T01:45:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-12T17:52:30Z","title":"Magpie: Alignment Data Synthesis from Scratch by Prompting Aligned LLMs with Nothing","version":2},"reference_index":128,"source":"arxiv_source","source_observed_at":"2026-05-16T06:58:36.684583Z"},"links":{"cited_paper":"/paper/2404.07503","citing_paper":"/paper/2406.08464"},"observation_digest":"sha256:bbac24859f03e431d6d120f9acdfea11e2d5357d2a8003b46b35d8279b0612d1","observation_id":"261ecafe-d14b-4ecb-84d0-41aea6fa43a1","resolution":{"observed_at":"2026-05-16T06:58:36.878570Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07503","last_updated":"2024-08-10T20:46:47Z","snapshot_observed_at":"2026-07-06T17:58:39.485508Z","submitted_at":"2024-04-11T06:34:17Z","title":"Best Practices and Lessons Learned on Synthetic Data","version":2},"cited_work":{"arxiv_id":"2404.07503","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.07503","snapshot_observed_at":"2026-07-01T10:45:42.828782Z","title":"Best practices and lessons learned on synthetic data","venue":null,"work_id":"3f19fa45-10d0-4103-80da-d9d6278e0a38","year":2024},"citing_paper":{"arxiv_id":"2406.11354","last_updated":"2026-04-23T15:54:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-17T09:17:40Z","title":"Preserving Knowledge in Large Language Model with Model-Agnostic Self-Decompression","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-05-24T00:09:52.093810Z"},"links":{"cited_paper":"/paper/2404.07503","citing_paper":"/paper/2406.11354"},"observation_digest":"sha256:ea0781353667ee791cb327b3425970274322114fbc04c8826c580afbcce02832","observation_id":"bebb443b-c626-4584-899b-6b9563634354","resolution":{"observed_at":"2026-05-24T00:13:39.570150Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07503","last_updated":"2024-08-10T20:46:47Z","snapshot_observed_at":"2026-07-06T17:58:39.485508Z","submitted_at":"2024-04-11T06:34:17Z","title":"Best Practices and Lessons Learned on Synthetic Data","version":2},"cited_work":{"arxiv_id":"2404.07503","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.07503","snapshot_observed_at":"2026-07-01T10:45:42.828782Z","title":"Best practices and lessons learned on synthetic data","venue":null,"work_id":"3f19fa45-10d0-4103-80da-d9d6278e0a38","year":2024},"citing_paper":{"arxiv_id":"2406.11794","last_updated":"2025-04-21T17:48:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-17T17:42:57Z","title":"DataComp-LM: In search of the next generation of training sets for language models","version":4},"reference_index":112,"source":"pdf_text","source_observed_at":"2026-05-17T22:58:16.523267Z"},"links":{"cited_paper":"/paper/2404.07503","citing_paper":"/paper/2406.11794"},"observation_digest":"sha256:69399adca61768ef97244e2a707741df8c4990c906d889094443b89bce990f69","observation_id":"20642396-21ef-44a1-8752-3013428f0289","resolution":{"observed_at":"2026-05-17T22:58:17.079314Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07503","last_updated":"2024-08-10T20:46:47Z","snapshot_observed_at":"2026-07-06T17:58:39.485508Z","submitted_at":"2024-04-11T06:34:17Z","title":"Best Practices and Lessons Learned on Synthetic Data","version":2},"cited_work":{"arxiv_id":"2404.07503","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.07503","snapshot_observed_at":"2026-07-01T10:45:42.828782Z","title":"Best practices and lessons learned on synthetic data","venue":null,"work_id":"3f19fa45-10d0-4103-80da-d9d6278e0a38","year":2024},"citing_paper":{"arxiv_id":"2410.20791","last_updated":"2026-04-06T19:29:25Z","snapshot_observed_at":"2026-08-03T01:41:19.546733Z","submitted_at":"2024-10-28T07:16:00Z","title":"From Cool Demos to Production-Ready FMware: Core Challenges and a Technology Roadmap","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-23T19:07:21.016824Z"},"links":{"cited_paper":"/paper/2404.07503","citing_paper":"/paper/2410.20791"},"observation_digest":"sha256:62cf08b8cb77ed958319728fd0cfcf25456dda595b63b1325aefd70a51367ed6","observation_id":"9cfff878-348a-4cfd-80de-b6f6a6108cd5","resolution":{"observed_at":"2026-05-23T19:08:20.993624Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07503","last_updated":"2024-08-10T20:46:47Z","snapshot_observed_at":"2026-07-06T17:58:39.485508Z","submitted_at":"2024-04-11T06:34:17Z","title":"Best Practices and Lessons Learned on Synthetic Data","version":2},"cited_work":{"arxiv_id":"2404.07503","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.07503","snapshot_observed_at":"2026-07-01T10:45:42.828782Z","title":"Best practices and lessons learned on synthetic data","venue":null,"work_id":"3f19fa45-10d0-4103-80da-d9d6278e0a38","year":2024},"citing_paper":{"arxiv_id":"2501.01793","last_updated":"2025-01-03T12:52:51Z","snapshot_observed_at":"2026-07-06T20:16:09.014564Z","submitted_at":"2025-01-03T12:52:51Z","title":"Creating Artificial Students that Never Existed: Leveraging Large Language Models and CTGANs for Synthetic Data Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-23T06:04:33.506895Z"},"links":{"cited_paper":"/paper/2404.07503","citing_paper":"/paper/2501.01793"},"observation_digest":"sha256:852b497572d6528535b7178d44dac75fe5a01d12fe04962ceacf815c7aa64135","observation_id":"e2642097-6eaa-4f1f-8d7f-4d59f3e21fe3","resolution":{"observed_at":"2026-05-23T06:05:28.024455Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07503","last_updated":"2024-08-10T20:46:47Z","snapshot_observed_at":"2026-07-06T17:58:39.485508Z","submitted_at":"2024-04-11T06:34:17Z","title":"Best Practices and Lessons Learned on Synthetic Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07503","snapshot_observed_at":"2026-08-09T23:21:02.187332Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18493","last_updated":"2025-05-12T21:48:40Z","snapshot_observed_at":"2026-08-09T23:15:02.794005Z","submitted_at":"2025-01-30T17:06:56Z","title":"Examining the Expanding Role of Synthetic Data Throughout the AI Development Pipeline","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-09T23:21:02.187332Z"},"links":{"cited_paper":"/paper/2404.07503","citing_paper":"/paper/2501.18493"},"observation_digest":"sha256:bf10e2a0f0f0e93cb6b47b1c4b26a40b6d09649773bf4b89e0ee17966eb67d92","observation_id":"1c47f833-75f3-4aae-92fe-931fcd837e8f","resolution":{"observed_at":"2026-08-09T23:21:02.187332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07503","last_updated":"2024-08-10T20:46:47Z","snapshot_observed_at":"2026-07-06T17:58:39.485508Z","submitted_at":"2024-04-11T06:34:17Z","title":"Best Practices and Lessons Learned on Synthetic Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07503","snapshot_observed_at":"2026-08-09T17:09:15.329025Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01697","last_updated":"2025-05-21T17:50:43Z","snapshot_observed_at":"2026-08-09T17:01:54.948269Z","submitted_at":"2025-02-03T00:12:40Z","title":"BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-09T17:09:15.329025Z"},"links":{"cited_paper":"/paper/2404.07503","citing_paper":"/paper/2502.01697"},"observation_digest":"sha256:6392bdd7b9b8cc57361de87c03cf4468cac04b9f766096540218401b2b72c898","observation_id":"68491292-2250-48ad-85d4-02cb81a42492","resolution":{"observed_at":"2026-08-09T17:09:15.329025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07503","last_updated":"2024-08-10T20:46:47Z","snapshot_observed_at":"2026-07-06T17:58:39.485508Z","submitted_at":"2024-04-11T06:34:17Z","title":"Best Practices and Lessons Learned on Synthetic Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07503","snapshot_observed_at":"2026-08-08T04:58:33.117933Z","title":"Best practices and lessons learned on synthetic data for language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08489","last_updated":"2025-02-13T17:33:24Z","snapshot_observed_at":"2026-08-08T14:38:41.643106Z","submitted_at":"2025-02-12T15:26:08Z","title":"Salamandra Technical Report","version":2},"reference_index":114,"source":"pdf_text","source_observed_at":"2026-08-08T04:58:33.117933Z"},"links":{"cited_paper":"/paper/2404.07503","citing_paper":"/paper/2502.08489"},"observation_digest":"sha256:c963b5d5be2385a7206e136a5bfd9b976c62bd082e69abc536564da44089ffc3","observation_id":"a7fa075e-3c7c-4373-b06a-e6fa883747f7","resolution":{"observed_at":"2026-08-08T04:58:33.117933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07503","last_updated":"2024-08-10T20:46:47Z","snapshot_observed_at":"2026-07-06T17:58:39.485508Z","submitted_at":"2024-04-11T06:34:17Z","title":"Best Practices and Lessons Learned on Synthetic Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07503","snapshot_observed_at":"2026-08-07T15:36:15.347594Z","title":"Are We Learning Yet? A Meta Review of Evaluation Failures across Machine Learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14588","last_updated":"2025-09-11T15:58:13Z","snapshot_observed_at":"2026-08-07T15:29:33.274948Z","submitted_at":"2025-05-20T16:40:51Z","title":"Generative AI at the Crossroads: Light Bulb, Dynamo, or Microscope?","version":4},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:15.347594Z"},"links":{"cited_paper":"/paper/2404.07503","citing_paper":"/paper/2505.14588"},"observation_digest":"sha256:7f57119aac53fcedb0b7fc80c507d6077a6828bb8820555ce621b542d29e7b63","observation_id":"837b83a5-c2c9-4ea6-8196-13835c6af893","resolution":{"observed_at":"2026-08-07T15:36:15.347594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07503","last_updated":"2024-08-10T20:46:47Z","snapshot_observed_at":"2026-07-06T17:58:39.485508Z","submitted_at":"2024-04-11T06:34:17Z","title":"Best Practices and Lessons Learned on Synthetic Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07503","snapshot_observed_at":"2026-08-07T15:36:06.398779Z","title":"Best practices and lessons learned on synthetic data for language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14681","last_updated":"2025-05-27T09:35:12Z","snapshot_observed_at":"2026-08-07T22:01:02.132914Z","submitted_at":"2025-05-20T17:59:16Z","title":"Two Experts Are All You Need for Steering Thinking: Reinforcing Cognitive Effort in MoE Reasoning Models Without Additional Training","version":2},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-07T15:36:06.398779Z"},"links":{"cited_paper":"/paper/2404.07503","citing_paper":"/paper/2505.14681"},"observation_digest":"sha256:abce6faf65f85fc49d46610a77f61ccfb58fd97bb8afef42980609ec644fcac9","observation_id":"8edad706-d3c8-40b0-8ebf-6afbea63334e","resolution":{"observed_at":"2026-08-07T15:36:06.398779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07503","last_updated":"2024-08-10T20:46:47Z","snapshot_observed_at":"2026-07-06T17:58:39.485508Z","submitted_at":"2024-04-11T06:34:17Z","title":"Best Practices and Lessons Learned on Synthetic Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07503","snapshot_observed_at":"2026-08-07T14:22:07.612561Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19165","last_updated":"2025-06-17T16:48:29Z","snapshot_observed_at":"2026-08-07T23:45:18.154909Z","submitted_at":"2025-05-25T14:30:15Z","title":"OrgAccess: A Benchmark for Role Based Access Control in Organization Scale LLMs","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.612561Z"},"links":{"cited_paper":"/paper/2404.07503","citing_paper":"/paper/2505.19165"},"observation_digest":"sha256:eb3b504f63026b6a920a2ef6fda923eedad3e54764521644f9cefbcc3b24c338","observation_id":"14816447-f44a-4097-ae22-4ff0facda5dc","resolution":{"observed_at":"2026-08-07T14:22:07.612561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07503","last_updated":"2024-08-10T20:46:47Z","snapshot_observed_at":"2026-07-06T17:58:39.485508Z","submitted_at":"2024-04-11T06:34:17Z","title":"Best Practices and Lessons Learned on Synthetic Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07503","snapshot_observed_at":"2026-08-07T14:00:31.405117Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20416","last_updated":"2025-05-26T18:06:50Z","snapshot_observed_at":"2026-08-09T17:46:50.873415Z","submitted_at":"2025-05-26T18:06:50Z","title":"GraphGen: Enhancing Supervised Fine-Tuning for LLMs with Knowledge-Driven Synthetic Data Generation","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T14:00:31.405117Z"},"links":{"cited_paper":"/paper/2404.07503","citing_paper":"/paper/2505.20416"},"observation_digest":"sha256:abcf69a7d0bdfa1ba8ccc64feae065c3607b8e95b8fc92457a0ab346ed75620f","observation_id":"5f8b9035-31b8-482b-abc4-c5df9f956dd4","resolution":{"observed_at":"2026-08-07T14:00:31.405117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07503","last_updated":"2024-08-10T20:46:47Z","snapshot_observed_at":"2026-07-06T17:58:39.485508Z","submitted_at":"2024-04-11T06:34:17Z","title":"Best Practices and Lessons Learned on Synthetic Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07503","snapshot_observed_at":"2026-08-07T13:49:11.631956Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20888","last_updated":"2025-06-27T07:59:43Z","snapshot_observed_at":"2026-08-07T13:42:55.596808Z","submitted_at":"2025-05-27T08:32:51Z","title":"EasyDistill: A Comprehensive Toolkit for Effective Knowledge Distillation of Large Language Models","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T13:49:11.631956Z"},"links":{"cited_paper":"/paper/2404.07503","citing_paper":"/paper/2505.20888"},"observation_digest":"sha256:cf3e403976223ae9858de80a45239d9929b6c4fb36e3c8178dd6d3096012dede","observation_id":"d84f3036-e691-4941-86c6-bafdc213e8b4","resolution":{"observed_at":"2026-08-07T13:49:11.631956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07503","last_updated":"2024-08-10T20:46:47Z","snapshot_observed_at":"2026-07-06T17:58:39.485508Z","submitted_at":"2024-04-11T06:34:17Z","title":"Best Practices and Lessons Learned on Synthetic Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07503","snapshot_observed_at":"2026-08-07T11:04:56.812329Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03524","last_updated":"2025-06-05T03:26:05Z","snapshot_observed_at":"2026-08-09T04:58:38.414289Z","submitted_at":"2025-06-04T03:17:19Z","title":"Seed-Coder: Let the Code Model Curate Data for Itself","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T11:04:56.812329Z"},"links":{"cited_paper":"/paper/2404.07503","citing_paper":"/paper/2506.03524"},"observation_digest":"sha256:aa2f234a179ea3554ac8393b64aac445a247ed66a8dde25b2ac9def456befc72","observation_id":"854ed8cf-0fff-412e-98e4-54cae89a945b","resolution":{"observed_at":"2026-08-07T11:04:56.812329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07503","last_updated":"2024-08-10T20:46:47Z","snapshot_observed_at":"2026-07-06T17:58:39.485508Z","submitted_at":"2024-04-11T06:34:17Z","title":"Best Practices and Lessons Learned on Synthetic Data","version":2},"cited_work":{"arxiv_id":"2404.07503","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.07503","snapshot_observed_at":"2026-07-01T10:45:42.828782Z","title":"Best practices and lessons learned on synthetic data","venue":null,"work_id":"3f19fa45-10d0-4103-80da-d9d6278e0a38","year":2024},"citing_paper":{"arxiv_id":"2506.03530","last_updated":"2026-05-22T06:55:17Z","snapshot_observed_at":"2026-08-01T13:49:24.957131Z","submitted_at":"2025-06-04T03:22:44Z","title":"How Far Are We from Generating Missing Modalities with Foundation Models?","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-25T08:15:12.947854Z"},"links":{"cited_paper":"/paper/2404.07503","citing_paper":"/paper/2506.03530"},"observation_digest":"sha256:eb6d00d2df883041070d18427522ce57195bbf386f9cc5cacdb944b80f17442a","observation_id":"42014936-3b41-4833-9fdf-6179158f65fc","resolution":{"observed_at":"2026-05-25T08:15:33.642335Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07503","last_updated":"2024-08-10T20:46:47Z","snapshot_observed_at":"2026-07-06T17:58:39.485508Z","submitted_at":"2024-04-11T06:34:17Z","title":"Best Practices and Lessons Learned on Synthetic Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07503","snapshot_observed_at":"2026-08-07T10:50:50.157269Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04172","last_updated":"2025-06-04T17:15:19Z","snapshot_observed_at":"2026-08-08T11:40:08.759265Z","submitted_at":"2025-06-04T17:15:19Z","title":"Does Prompt Design Impact Quality of Data Imputation by LLMs?","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T10:50:50.157269Z"},"links":{"cited_paper":"/paper/2404.07503","citing_paper":"/paper/2506.04172"},"observation_digest":"sha256:4d828499b5ca33af4b4dd2789d4078f5939cd0fc544791387019499e6ebb02d2","observation_id":"03d7a2d4-33e7-4be3-bc8f-9f1c87f87286","resolution":{"observed_at":"2026-08-07T10:50:50.157269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07503","last_updated":"2024-08-10T20:46:47Z","snapshot_observed_at":"2026-07-06T17:58:39.485508Z","submitted_at":"2024-04-11T06:34:17Z","title":"Best Practices and Lessons Learned on Synthetic Data","version":2},"cited_work":{"arxiv_id":"2404.07503","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.07503","snapshot_observed_at":"2026-07-01T10:45:42.828782Z","title":"Best practices and lessons learned on synthetic data","venue":null,"work_id":"3f19fa45-10d0-4103-80da-d9d6278e0a38","year":2024},"citing_paper":{"arxiv_id":"2506.06226","last_updated":"2026-04-20T11:25:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-06T16:41:17Z","title":"No Data? No Problem: Synthesizing Security Graphs for Better Intrusion Detection","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-19T10:38:03.311357Z"},"links":{"cited_paper":"/paper/2404.07503","citing_paper":"/paper/2506.06226"},"observation_digest":"sha256:ba4f8a809cb295b4e90f3ba318bc01818155ecbb7be687357e449053a7d21c31","observation_id":"a24b728d-e810-4d29-ba9b-85670ae75961","resolution":{"observed_at":"2026-05-19T10:42:15.271569Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07503","last_updated":"2024-08-10T20:46:47Z","snapshot_observed_at":"2026-07-06T17:58:39.485508Z","submitted_at":"2024-04-11T06:34:17Z","title":"Best Practices and Lessons Learned on Synthetic Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07503","snapshot_observed_at":"2026-08-07T05:05:37.206170Z","title":"Best Practices and Lessons Learned on Synthetic Data","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08750","last_updated":"2025-06-10T12:45:12Z","snapshot_observed_at":"2026-08-09T19:54:26.891330Z","submitted_at":"2025-06-10T12:45:12Z","title":"Unlocking the Potential of Large Language Models in the Nuclear Industry with Synthetic Data","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:37.206170Z"},"links":{"cited_paper":"/paper/2404.07503","citing_paper":"/paper/2506.08750"},"observation_digest":"sha256:e12fa6cfeafbfbd11f4e8d8036793a96a61ef3298b55fb58bdf72c3949d31385","observation_id":"053bcf55-ffa2-4b46-80cf-249b35f1821b","resolution":{"observed_at":"2026-08-07T05:05:37.206170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07503","last_updated":"2024-08-10T20:46:47Z","snapshot_observed_at":"2026-07-06T17:58:39.485508Z","submitted_at":"2024-04-11T06:34:17Z","title":"Best Practices and Lessons Learned on Synthetic Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07503","snapshot_observed_at":"2026-08-07T04:47:50.601837Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09643","last_updated":"2025-06-11T11:56:51Z","snapshot_observed_at":"2026-08-09T11:48:00.034085Z","submitted_at":"2025-06-11T11:56:51Z","title":"Using Sign Language Production as Data Augmentation to enhance Sign Language Translation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:50.601837Z"},"links":{"cited_paper":"/paper/2404.07503","citing_paper":"/paper/2506.09643"},"observation_digest":"sha256:cd6c328aed61f0f80afbf65b173a3c91ccbe7060a23fe00a2e6e05cb04d8701d","observation_id":"00a2ab1c-5f9a-4576-877a-f79904ff2664","resolution":{"observed_at":"2026-08-07T04:47:50.601837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07503","last_updated":"2024-08-10T20:46:47Z","snapshot_observed_at":"2026-07-06T17:58:39.485508Z","submitted_at":"2024-04-11T06:34:17Z","title":"Best Practices and Lessons Learned on Synthetic Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07503","snapshot_observed_at":"2026-08-07T00:14:06.839189Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14927","last_updated":"2025-06-17T19:14:30Z","snapshot_observed_at":"2026-08-09T13:20:44.500546Z","submitted_at":"2025-06-17T19:14:30Z","title":"MDBench: A Synthetic Multi-Document Reasoning Benchmark Generated with Knowledge Guidance","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T00:14:06.839189Z"},"links":{"cited_paper":"/paper/2404.07503","citing_paper":"/paper/2506.14927"},"observation_digest":"sha256:a0d2d168dbc208f49adee5ce4ad8cb5c499beee58d382d39dd0423bcfb7337fe","observation_id":"fd994a8a-6e91-4559-84f9-c47e756904ad","resolution":{"observed_at":"2026-08-07T00:14:06.839189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07503","last_updated":"2024-08-10T20:46:47Z","snapshot_observed_at":"2026-07-06T17:58:39.485508Z","submitted_at":"2024-04-11T06:34:17Z","title":"Best Practices and Lessons Learned on Synthetic Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07503","snapshot_observed_at":"2026-08-06T22:56:32.969986Z","title":"Best Practices and Lessons Learned on Synthetic Data,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:32.969986Z"},"links":{"cited_paper":"/paper/2404.07503","citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:0925be03e78e244358172c1e81b8853f8e7efe4b21f39ad7b4a79dc95d2309c2","observation_id":"10f2024b-5644-4319-aa21-14e4442a5c3d","resolution":{"observed_at":"2026-08-06T22:56:32.969986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07503","last_updated":"2024-08-10T20:46:47Z","snapshot_observed_at":"2026-07-06T17:58:39.485508Z","submitted_at":"2024-04-11T06:34:17Z","title":"Best Practices and Lessons Learned on Synthetic Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07503","snapshot_observed_at":"2026-08-06T15:46:27.785294Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15092","last_updated":"2025-07-20T19:14:43Z","snapshot_observed_at":"2026-08-09T04:23:52.892130Z","submitted_at":"2025-07-20T19:14:43Z","title":"A Penalty Goes a Long Way: Measuring Lexical Diversity in Synthetic Texts Under Prompt-Influenced Length Variations","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T15:46:27.785294Z"},"links":{"cited_paper":"/paper/2404.07503","citing_paper":"/paper/2507.15092"},"observation_digest":"sha256:e1787dcb4225b1e42b1cf5e009ba321e83e9c5d62a7759cfde0e0e1d7efe6a86","observation_id":"ccb77f5e-4dce-4b24-8c9b-29c95b3b5842","resolution":{"observed_at":"2026-08-06T15:46:27.785294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07503","last_updated":"2024-08-10T20:46:47Z","snapshot_observed_at":"2026-07-06T17:58:39.485508Z","submitted_at":"2024-04-11T06:34:17Z","title":"Best Practices and Lessons Learned on Synthetic Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07503","snapshot_observed_at":"2026-08-05T14:35:15.854794Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.21179","last_updated":"2025-08-28T19:35:32Z","snapshot_observed_at":"2026-08-09T13:34:37.855669Z","submitted_at":"2025-08-28T19:35:32Z","title":"Synthetic CVs To Build and Test Fairness-Aware Hiring Tools","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T14:35:15.854794Z"},"links":{"cited_paper":"/paper/2404.07503","citing_paper":"/paper/2508.21179"},"observation_digest":"sha256:804f4cecec877b8c276fc2d0dc6befdbd775821f61a647d0c1e97f1addec3df5","observation_id":"0f46116f-12e3-4f8d-87e8-dad14f0bbd48","resolution":{"observed_at":"2026-08-05T14:35:15.854794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07503","last_updated":"2024-08-10T20:46:47Z","snapshot_observed_at":"2026-07-06T17:58:39.485508Z","submitted_at":"2024-04-11T06:34:17Z","title":"Best Practices and Lessons Learned on Synthetic Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07503","snapshot_observed_at":"2026-08-04T17:31:39.851872Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10886","last_updated":"2025-09-13T16:33:56Z","snapshot_observed_at":"2026-08-09T04:19:27.217178Z","submitted_at":"2025-09-13T16:33:56Z","title":"CultureSynth: A Hierarchical Taxonomy-Guided and Retrieval-Augmented Framework for Cultural Question-Answer Synthesis","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-04T17:31:39.851872Z"},"links":{"cited_paper":"/paper/2404.07503","citing_paper":"/paper/2509.10886"},"observation_digest":"sha256:8c6395ba38412da14468efad996309e025640747f53b5816c5d8626744c2365e","observation_id":"fde7a88d-f3d0-4a50-96d7-5813628ee26f","resolution":{"observed_at":"2026-08-04T17:31:39.851872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07503","last_updated":"2024-08-10T20:46:47Z","snapshot_observed_at":"2026-07-06T17:58:39.485508Z","submitted_at":"2024-04-11T06:34:17Z","title":"Best Practices and Lessons Learned on Synthetic Data","version":2},"cited_work":{"arxiv_id":"2404.07503","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.07503","snapshot_observed_at":"2026-07-01T10:45:42.828782Z","title":"Best practices and lessons learned on synthetic data","venue":null,"work_id":"3f19fa45-10d0-4103-80da-d9d6278e0a38","year":2024},"citing_paper":{"arxiv_id":"2509.13047","last_updated":"2026-04-12T16:39:21Z","snapshot_observed_at":"2026-07-06T22:30:02.223630Z","submitted_at":"2025-09-16T13:04:48Z","title":"Multi-Model Synthetic Training for Mission-Critical Small Language Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-18T15:47:00.455107Z"},"links":{"cited_paper":"/paper/2404.07503","citing_paper":"/paper/2509.13047"},"observation_digest":"sha256:9b73264244f34b0c1fe0a8b8cc8837f00dcf3e6ac69655e300a2ea7b84de63c4","observation_id":"4b375df1-c1e2-4208-96cc-4ef574b186e1","resolution":{"observed_at":"2026-05-18T15:51:34.970107Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07503","last_updated":"2024-08-10T20:46:47Z","snapshot_observed_at":"2026-07-06T17:58:39.485508Z","submitted_at":"2024-04-11T06:34:17Z","title":"Best Practices and Lessons Learned on Synthetic Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07503","snapshot_observed_at":"2026-08-02T23:53:03.578108Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.12394","last_updated":"2026-06-28T15:54:56Z","snapshot_observed_at":"2026-08-09T01:10:54.518185Z","submitted_at":"2026-02-12T20:41:22Z","title":"Synthetic Interaction Data for Scalable Personalization in Large Language Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T23:53:03.578108Z"},"links":{"cited_paper":"/paper/2404.07503","citing_paper":"/paper/2602.12394"},"observation_digest":"sha256:2dd880fa33a33669d1a69244e5e69ce5a0d54391b7111b1110507fc4f7db539f","observation_id":"2342313d-bf17-4930-b6ab-0e6f1e714021","resolution":{"observed_at":"2026-08-02T23:53:03.578108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07503","last_updated":"2024-08-10T20:46:47Z","snapshot_observed_at":"2026-07-06T17:58:39.485508Z","submitted_at":"2024-04-11T06:34:17Z","title":"Best Practices and Lessons Learned on Synthetic Data","version":2},"cited_work":{"arxiv_id":"2404.07503","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.07503","snapshot_observed_at":"2026-07-01T10:45:42.828782Z","title":"Best practices and lessons learned on synthetic data","venue":null,"work_id":"3f19fa45-10d0-4103-80da-d9d6278e0a38","year":2024},"citing_paper":{"arxiv_id":"2605.00877","last_updated":"2026-05-06T12:52:11Z","snapshot_observed_at":"2026-07-06T23:14:11.211164Z","submitted_at":"2026-04-25T14:53:37Z","title":"OceanPile: A Large-Scale Multimodal Ocean Corpus for Foundation Models","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-09T20:50:57.818064Z"},"links":{"cited_paper":"/paper/2404.07503","citing_paper":"/paper/2605.00877"},"observation_digest":"sha256:3f1c487a3fc51a36caa8a4c9e31d0ce169509f40b3a67b77c4f8303d287ae9b2","observation_id":"3c9618e1-8188-4c1c-9c28-8244136eb22d","resolution":{"observed_at":"2026-05-11T14:56:06.905377Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07503","last_updated":"2024-08-10T20:46:47Z","snapshot_observed_at":"2026-07-06T17:58:39.485508Z","submitted_at":"2024-04-11T06:34:17Z","title":"Best Practices and Lessons Learned on Synthetic Data","version":2},"cited_work":{"arxiv_id":"2404.07503","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.07503","snapshot_observed_at":"2026-07-01T10:45:42.828782Z","title":"Best practices and lessons learned on synthetic data","venue":null,"work_id":"3f19fa45-10d0-4103-80da-d9d6278e0a38","year":2024},"citing_paper":{"arxiv_id":"2606.00282","last_updated":"2026-05-29T19:17:50Z","snapshot_observed_at":"2026-08-06T12:42:40.980750Z","submitted_at":"2026-05-29T19:17:50Z","title":"Synthetic Data from Cross-Domain Events for Large-Scale Recommendation Systems","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-06-28T20:34:38.729275Z"},"links":{"cited_paper":"/paper/2404.07503","citing_paper":"/paper/2606.00282"},"observation_digest":"sha256:acbfb1fe7431d872de81d6935805d5b57d50e2f9b0112e60fc18148293409f58","observation_id":"6428d66e-ac53-4858-9dbc-7efc1dba292d","resolution":{"observed_at":"2026-06-28T20:42:37.295434Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07503","last_updated":"2024-08-10T20:46:47Z","snapshot_observed_at":"2026-07-06T17:58:39.485508Z","submitted_at":"2024-04-11T06:34:17Z","title":"Best Practices and Lessons Learned on Synthetic Data","version":2},"cited_work":{"arxiv_id":"2404.07503","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.07503","snapshot_observed_at":"2026-07-01T10:45:42.828782Z","title":"Best practices and lessons learned on synthetic data","venue":null,"work_id":"3f19fa45-10d0-4103-80da-d9d6278e0a38","year":2024},"citing_paper":{"arxiv_id":"2606.32002","last_updated":"2026-06-30T17:35:14Z","snapshot_observed_at":"2026-08-02T13:47:40.317163Z","submitted_at":"2026-06-30T17:35:14Z","title":"Self-Study Reconsidered: The Hidden Fragility of Learning from Self-Generated QA","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-01T05:07:58.441326Z"},"links":{"cited_paper":"/paper/2404.07503","citing_paper":"/paper/2606.32002"},"observation_digest":"sha256:21b0e2ee0e7ef94a36da4c0107270575c555c01e59f58868bd48c38a9677b248","observation_id":"b4858c3c-ce57-4a6a-b6e6-19785dc2e6f3","resolution":{"observed_at":"2026-07-01T10:45:42.830358Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07503","last_updated":"2024-08-10T20:46:47Z","snapshot_observed_at":"2026-07-06T17:58:39.485508Z","submitted_at":"2024-04-11T06:34:17Z","title":"Best Practices and Lessons Learned on Synthetic Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07503","snapshot_observed_at":"2026-08-01T08:09:44.978551Z","title":"doi:10.48550/arXiv.2404.07503 , urldate =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21220","last_updated":"2026-07-23T11:37:49Z","snapshot_observed_at":"2026-08-05T03:50:14.721040Z","submitted_at":"2026-07-23T11:37:49Z","title":"Search Hardness-Aware LLM-Based Problem Formulation for Expensive Simulation-Driven Design","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-01T08:09:44.978551Z"},"links":{"cited_paper":"/paper/2404.07503","citing_paper":"/paper/2607.21220"},"observation_digest":"sha256:c74e4f880c6cfb6e80e6297359b6b1128b5ab34fa2b1c56d5e7067dc3005a6ac","observation_id":"089135ac-b305-46c8-96e7-626fd552b4c3","resolution":{"observed_at":"2026-08-01T08:09:44.978551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07503","last_updated":"2024-08-10T20:46:47Z","snapshot_observed_at":"2026-07-06T17:58:39.485508Z","submitted_at":"2024-04-11T06:34:17Z","title":"Best Practices and Lessons Learned on Synthetic Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07503","snapshot_observed_at":"2026-07-31T07:01:46.557635Z","title":"arXiv preprint arXiv:2404.07503 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24717","last_updated":"2026-07-27T17:54:12Z","snapshot_observed_at":"2026-08-08T00:53:22.078848Z","submitted_at":"2026-07-27T17:54:12Z","title":"DataOrchestra: Learning to Orchestrate Per-Example Curation of Pretraining Data","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-07-31T07:01:46.557635Z"},"links":{"cited_paper":"/paper/2404.07503","citing_paper":"/paper/2607.24717"},"observation_digest":"sha256:233bfc7be9267b82bdf88afc1f9b01ed01a859ba70a77ba17deda9d53f79dbe4","observation_id":"d82f85f4-9f00-4a59-90ce-80f0f285d8d9","resolution":{"observed_at":"2026-07-31T07:01:46.557635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2404.07503/citation-record","integrity":"/paper/2404.07503/integrity","json":"/paper/2404.07503/citation-record.json","paper":"/paper/2404.07503"},"outbound":[],"paper":{"arxiv_id":"2404.07503","last_updated":"2024-08-10T20:46:47Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T17:58:39.485508Z","submitted_at":"2024-04-11T06:34:17Z","title":"Best Practices and Lessons Learned on Synthetic Data"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 32 inbound Pith citation observations for arXiv:2404.07503."}