{"as_of":"2026-08-21T09:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9e29556c3921be76006f8c99fe013a127d49b1cdb32214cc988c28ae293ba6a7","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":23,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T19:03:27.110992Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-23T01:05:16.441022Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.15226","last_updated":"2024-10-22T18:54:23Z","snapshot_observed_at":"2026-08-16T13:07:44.720730Z","submitted_at":"2024-10-19T22:14:07Z","title":"On the Diversity of Synthetic Data and its Impact on Training Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15226","snapshot_observed_at":"2026-08-11T22:57:01.578235Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.578235Z"},"links":{"cited_paper":"/paper/2410.15226","citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:1d0be269ad8e05610199b2cf298ae8e32a74dfe34639be2fc720a862ba08df8e","observation_id":"79a021ac-c605-4bd2-a971-f3ef6ab589fd","resolution":{"observed_at":"2026-08-11T22:57:01.578235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15226","last_updated":"2024-10-22T18:54:23Z","snapshot_observed_at":"2026-08-16T13:07:44.720730Z","submitted_at":"2024-10-19T22:14:07Z","title":"On the Diversity of Synthetic Data and its Impact on Training Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15226","snapshot_observed_at":"2026-08-09T17:09:15.239770Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01697","last_updated":"2025-05-21T17:50:43Z","snapshot_observed_at":"2026-08-14T14:40:58.119601Z","submitted_at":"2025-02-03T00:12:40Z","title":"BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-09T17:09:15.239770Z"},"links":{"cited_paper":"/paper/2410.15226","citing_paper":"/paper/2502.01697"},"observation_digest":"sha256:6af7dc91412fe183cec57b26c5e744fe3a9ba98fb5a4d5d0cd8faa1b5953cb8a","observation_id":"544ba400-4f9c-4b3f-b138-ba2ac1574724","resolution":{"observed_at":"2026-08-09T17:09:15.239770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15226","last_updated":"2024-10-22T18:54:23Z","snapshot_observed_at":"2026-08-16T13:07:44.720730Z","submitted_at":"2024-10-19T22:14:07Z","title":"On the Diversity of Synthetic Data and its Impact on Training Large Language Models","version":2},"cited_work":{"arxiv_id":"2410.15226","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.15226","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On the diversity of synthetic data and its impact on training large language models","venue":null,"work_id":"ddea9b76-0744-46d6-b090-e64b0a9f32d6","year":2024},"citing_paper":{"arxiv_id":"2503.08223","last_updated":"2026-04-09T15:28:27Z","snapshot_observed_at":"2026-08-13T00:23:14.495568Z","submitted_at":"2025-03-11T09:41:29Z","title":"Will LLMs Scaling Hit the Wall? Breaking Barriers via Distributed Resources on Massive Edge Devices","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-23T01:03:26.037233Z"},"links":{"cited_paper":"/paper/2410.15226","citing_paper":"/paper/2503.08223"},"observation_digest":"sha256:e329ee40a23f461838d6208603827322190c639c1846efb049ba58c6428cbc0a","observation_id":"de6d5b97-cada-44eb-b0e1-02327be1b867","resolution":{"observed_at":"2026-05-23T01:05:16.443483Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15226","last_updated":"2024-10-22T18:54:23Z","snapshot_observed_at":"2026-08-16T13:07:44.720730Z","submitted_at":"2024-10-19T22:14:07Z","title":"On the Diversity of Synthetic Data and its Impact on Training Large Language Models","version":2},"cited_work":{"arxiv_id":"2410.15226","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.15226","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On the diversity of synthetic data and its impact on training large language models","venue":null,"work_id":"ddea9b76-0744-46d6-b090-e64b0a9f32d6","year":2024},"citing_paper":{"arxiv_id":"2504.01919","last_updated":"2026-01-12T12:46:10Z","snapshot_observed_at":"2026-08-15T13:47:48.240960Z","submitted_at":"2025-04-02T17:26:40Z","title":"Bridging the Linguistic Divide: A Survey on Leveraging Large Language Models for Machine Translation","version":4},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-22T21:38:29.497183Z"},"links":{"cited_paper":"/paper/2410.15226","citing_paper":"/paper/2504.01919"},"observation_digest":"sha256:fdc9d4512394ef4c70a0d2e360132bae32689e6f460c2bcf9c848f5d3cf1b7be","observation_id":"19a490b8-8506-42a9-acf6-c02471a8b6ee","resolution":{"observed_at":"2026-05-22T21:42:11.341426Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15226","last_updated":"2024-10-22T18:54:23Z","snapshot_observed_at":"2026-08-16T13:07:44.720730Z","submitted_at":"2024-10-19T22:14:07Z","title":"On the Diversity of Synthetic Data and its Impact on Training Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15226","snapshot_observed_at":"2026-08-07T14:33:12.926530Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18458","last_updated":"2025-06-01T16:00:34Z","snapshot_observed_at":"2026-08-16T16:04:23.826018Z","submitted_at":"2025-05-24T01:57:12Z","title":"A Survey of LLM $\\times$ DATA","version":3},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:12.926530Z"},"links":{"cited_paper":"/paper/2410.15226","citing_paper":"/paper/2505.18458"},"observation_digest":"sha256:9e56b18fc3191b2109eb93cac58cde943c89db02d048dd51eec11c5fae5180d0","observation_id":"e1b02181-3a81-4300-a01c-574aa08769c7","resolution":{"observed_at":"2026-08-07T14:33:12.926530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15226","last_updated":"2024-10-22T18:54:23Z","snapshot_observed_at":"2026-08-16T13:07:44.720730Z","submitted_at":"2024-10-19T22:14:07Z","title":"On the Diversity of Synthetic Data and its Impact on Training Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15226","snapshot_observed_at":"2026-08-07T14:36:27.187131Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18523","last_updated":"2025-05-24T05:40:23Z","snapshot_observed_at":"2026-08-20T03:20:43.159429Z","submitted_at":"2025-05-24T05:40:23Z","title":"Diversity and Inclusion in AI: Insights from a Survey of AI/ML Practitioners","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T14:36:27.187131Z"},"links":{"cited_paper":"/paper/2410.15226","citing_paper":"/paper/2505.18523"},"observation_digest":"sha256:5bb8f21a1858ca36dd1be588032b795250d778ec13f453279f67035fe6b11643","observation_id":"a7769956-febd-4cb5-9cfd-3a11cdce4331","resolution":{"observed_at":"2026-08-07T14:36:27.187131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15226","last_updated":"2024-10-22T18:54:23Z","snapshot_observed_at":"2026-08-16T13:07:44.720730Z","submitted_at":"2024-10-19T22:14:07Z","title":"On the Diversity of Synthetic Data and its Impact on Training Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15226","snapshot_observed_at":"2026-08-07T14:10:22.223731Z","title":"Irina I Chironova","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.19848","last_updated":"2025-05-26T11:35:01Z","snapshot_observed_at":"2026-08-18T08:13:45.199050Z","submitted_at":"2025-05-26T11:35:01Z","title":"Improving Multilingual Math Reasoning for African Languages","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T14:10:22.223731Z"},"links":{"cited_paper":"/paper/2410.15226","citing_paper":"/paper/2505.19848"},"observation_digest":"sha256:8e392b912d5266c8271fc96444727dad39c4ef11828c28c75db6dcf824db38eb","observation_id":"e6b33bc2-bc30-45a3-9220-ff8d696581bb","resolution":{"observed_at":"2026-08-07T14:10:22.223731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15226","last_updated":"2024-10-22T18:54:23Z","snapshot_observed_at":"2026-08-16T13:07:44.720730Z","submitted_at":"2024-10-19T22:14:07Z","title":"On the Diversity of Synthetic Data and its Impact on Training Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15226","snapshot_observed_at":"2026-08-07T12:18:34.656149Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-10T11:50:57.002773Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:34.656149Z"},"links":{"cited_paper":"/paper/2410.15226","citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:2de51d3be3981125df47805b905a1e7128b9fd4c73ec964d06b01e9c029935b2","observation_id":"554c546f-1901-4c8e-a9e3-7f8222d36398","resolution":{"observed_at":"2026-08-07T12:18:34.656149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15226","last_updated":"2024-10-22T18:54:23Z","snapshot_observed_at":"2026-08-16T13:07:44.720730Z","submitted_at":"2024-10-19T22:14:07Z","title":"On the Diversity of Synthetic Data and its Impact on Training Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15226","snapshot_observed_at":"2026-08-07T11:13:38.936758Z","title":"On the diversity of synthetic data and its impact on training large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03051","last_updated":"2025-06-03T16:31:52Z","snapshot_observed_at":"2026-08-21T01:03:21.213383Z","submitted_at":"2025-06-03T16:31:52Z","title":"Facts Do Care About Your Language: Assessing Answer Quality of Multilingual LLMs","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T11:13:38.936758Z"},"links":{"cited_paper":"/paper/2410.15226","citing_paper":"/paper/2506.03051"},"observation_digest":"sha256:e4a8e1f062bbc9c419b3166b6a728d8536e9791d96ec54b96b571c3a6992f452","observation_id":"5165d9af-17c1-4889-9451-44f121e702a9","resolution":{"observed_at":"2026-08-07T11:13:38.936758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15226","last_updated":"2024-10-22T18:54:23Z","snapshot_observed_at":"2026-08-16T13:07:44.720730Z","submitted_at":"2024-10-19T22:14:07Z","title":"On the Diversity of Synthetic Data and its Impact on Training Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15226","snapshot_observed_at":"2026-08-15T19:03:27.110992Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.17847","last_updated":"2025-06-21T22:45:40Z","snapshot_observed_at":"2026-08-18T21:53:18.810608Z","submitted_at":"2025-06-21T22:45:40Z","title":"A Comparative Study of Open-Source Libraries for Synthetic Tabular Data Generation: SDV vs. SynthCity","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T19:03:27.110992Z"},"links":{"cited_paper":"/paper/2410.15226","citing_paper":"/paper/2506.17847"},"observation_digest":"sha256:cf7edc0d3cc1e44f7c8367091a5695db758e7c1e9c2e5df8ee1fcbef36e2911d","observation_id":"c2563c9d-4be1-456a-ad9b-43da4d5c64fa","resolution":{"observed_at":"2026-08-15T19:03:27.110992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15226","last_updated":"2024-10-22T18:54:23Z","snapshot_observed_at":"2026-08-16T13:07:44.720730Z","submitted_at":"2024-10-19T22:14:07Z","title":"On the Diversity of Synthetic Data and its Impact on Training Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15226","snapshot_observed_at":"2026-08-06T23:12:18.881689Z","title":"On the diversity of synthetic data and its impact on training large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19262","last_updated":"2025-06-25T03:25:04Z","snapshot_observed_at":"2026-08-16T15:41:02.536314Z","submitted_at":"2025-06-24T02:44:58Z","title":"What Matters in LLM-generated Data: Diversity and Its Effect on Model Fine-Tuning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:18.881689Z"},"links":{"cited_paper":"/paper/2410.15226","citing_paper":"/paper/2506.19262"},"observation_digest":"sha256:9f6137c81be3afc9fe8e8e7c95c906af0d74c129cada5d8bbfb3ec3aef77ac03","observation_id":"89491718-442f-463f-aaa7-146c097564c0","resolution":{"observed_at":"2026-08-06T23:12:18.881689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15226","last_updated":"2024-10-22T18:54:23Z","snapshot_observed_at":"2026-08-16T13:07:44.720730Z","submitted_at":"2024-10-19T22:14:07Z","title":"On the Diversity of Synthetic Data and its Impact on Training Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15226","snapshot_observed_at":"2026-08-06T22:18:43.992346Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22050","last_updated":"2025-06-27T09:45:37Z","snapshot_observed_at":"2026-08-16T18:14:43.279383Z","submitted_at":"2025-06-27T09:45:37Z","title":"Decoding Machine Translationese in English-Chinese News: LLMs vs. NMTs","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T22:18:43.992346Z"},"links":{"cited_paper":"/paper/2410.15226","citing_paper":"/paper/2506.22050"},"observation_digest":"sha256:8ea6f5207fc2700e8e283f3706915979e8c0b5d1381c1179d064b5d48e12da6c","observation_id":"1252be6c-09c8-4d9d-a801-dbb63384c66b","resolution":{"observed_at":"2026-08-06T22:18:43.992346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15226","last_updated":"2024-10-22T18:54:23Z","snapshot_observed_at":"2026-08-16T13:07:44.720730Z","submitted_at":"2024-10-19T22:14:07Z","title":"On the Diversity of Synthetic Data and its Impact on Training Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15226","snapshot_observed_at":"2026-08-05T22:56:28.179383Z","title":"Yuri Chervonyi, Trieu H Trinh, Miroslav Olˇs´ak, Xiaomeng Yang, Hoang Nguyen, Marcelo Menegali, Junehyuk Jung, Vikas Verma, Quoc V Le, and Thang Luong","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.06592","last_updated":"2025-08-08T11:16:56Z","snapshot_observed_at":"2026-08-20T05:26:54.133270Z","submitted_at":"2025-08-08T11:16:56Z","title":"Towards Integrated Alignment","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-05T22:56:28.179383Z"},"links":{"cited_paper":"/paper/2410.15226","citing_paper":"/paper/2508.06592"},"observation_digest":"sha256:07de87d23676d623f96b2400917894396ea1871ede88f4372e11e619af70e3b3","observation_id":"607080ba-3337-4ebf-9fee-1b5d0d7c9046","resolution":{"observed_at":"2026-08-05T22:56:28.179383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15226","last_updated":"2024-10-22T18:54:23Z","snapshot_observed_at":"2026-08-16T13:07:44.720730Z","submitted_at":"2024-10-19T22:14:07Z","title":"On the Diversity of Synthetic Data and its Impact on Training Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15226","snapshot_observed_at":"2026-08-05T15:53:34.195737Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19402","last_updated":"2025-08-26T19:55:40Z","snapshot_observed_at":"2026-08-15T16:08:31.335126Z","submitted_at":"2025-08-26T19:55:40Z","title":"One Joke to Rule them All? On the (Im)possibility of Generalizing Humor","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-05T15:53:34.195737Z"},"links":{"cited_paper":"/paper/2410.15226","citing_paper":"/paper/2508.19402"},"observation_digest":"sha256:ad5f2816a223335a4e546392c60cfdf7f62cb82d86ebff83596c8573679af0ee","observation_id":"940f0155-255a-47b8-b72c-44ddd6090555","resolution":{"observed_at":"2026-08-05T15:53:34.195737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15226","last_updated":"2024-10-22T18:54:23Z","snapshot_observed_at":"2026-08-16T13:07:44.720730Z","submitted_at":"2024-10-19T22:14:07Z","title":"On the Diversity of Synthetic Data and its Impact on Training Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15226","snapshot_observed_at":"2026-08-15T15:49:58.116911Z","title":"org/abs/2410.15226, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-16T22:17:46.796368Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.116911Z"},"links":{"cited_paper":"/paper/2410.15226","citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:47681e04ce05604a06857b31f33714a9609fa5146f9651699523416fac7c8b7a","observation_id":"829c96dc-3465-4610-bb3e-b7248a0a1296","resolution":{"observed_at":"2026-08-15T15:49:58.116911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15226","last_updated":"2024-10-22T18:54:23Z","snapshot_observed_at":"2026-08-16T13:07:44.720730Z","submitted_at":"2024-10-19T22:14:07Z","title":"On the Diversity of Synthetic Data and its Impact on Training Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15226","snapshot_observed_at":"2026-08-04T09:18:33.177856Z","title":"On the diversity of synthetic data and its impact on training large language models.arXiv preprint arXiv:2410.15226,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.16657","last_updated":"2026-07-16T03:25:47Z","snapshot_observed_at":"2026-08-16T18:15:59.061293Z","submitted_at":"2025-10-18T22:39:39Z","title":"Escaping Model Collapse via Synthetic Data Verification: Near-term Improvements and Long-term Convergence","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T09:18:33.177856Z"},"links":{"cited_paper":"/paper/2410.15226","citing_paper":"/paper/2510.16657"},"observation_digest":"sha256:91f4f870e5cd9e97293efadb7e5a467a26c0c98eb71c8343bc7e003a3ff0eef7","observation_id":"cfabcb30-0aa8-474e-9008-071f03e6a5d1","resolution":{"observed_at":"2026-08-04T09:18:33.177856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15226","last_updated":"2024-10-22T18:54:23Z","snapshot_observed_at":"2026-08-16T13:07:44.720730Z","submitted_at":"2024-10-19T22:14:07Z","title":"On the Diversity of Synthetic Data and its Impact on Training Large Language Models","version":2},"cited_work":{"arxiv_id":"2410.15226","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.15226","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On the diversity of synthetic data and its impact on training large language models","venue":null,"work_id":"ddea9b76-0744-46d6-b090-e64b0a9f32d6","year":2024},"citing_paper":{"arxiv_id":"2511.01490","last_updated":"2026-04-28T14:06:15Z","snapshot_observed_at":"2026-08-14T18:14:23.273917Z","submitted_at":"2025-11-03T11:57:11Z","title":"Synthetic Eggs in Many Baskets: The Impact of Synthetic Data Diversity on LLM Fine-Tuning","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-18T01:17:12.349379Z"},"links":{"cited_paper":"/paper/2410.15226","citing_paper":"/paper/2511.01490"},"observation_digest":"sha256:e1c959ecd2324a128d1bdfb506d08b577d2ede3a2205de330770e96391df17d7","observation_id":"bd88e7af-3de9-47bd-a9b4-7d91d00be7a0","resolution":{"observed_at":"2026-05-18T01:20:34.760847Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15226","last_updated":"2024-10-22T18:54:23Z","snapshot_observed_at":"2026-08-16T13:07:44.720730Z","submitted_at":"2024-10-19T22:14:07Z","title":"On the Diversity of Synthetic Data and its Impact on Training Large Language Models","version":2},"cited_work":{"arxiv_id":"2410.15226","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.15226","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On the diversity of synthetic data and its impact on training large language models","venue":null,"work_id":"ddea9b76-0744-46d6-b090-e64b0a9f32d6","year":2024},"citing_paper":{"arxiv_id":"2512.05929","last_updated":"2026-06-29T18:18:24Z","snapshot_observed_at":"2026-08-16T07:11:14.391624Z","submitted_at":"2025-12-05T18:12:21Z","title":"LLM Harms: A Taxonomy and Discussion","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-17T00:29:07.951709Z"},"links":{"cited_paper":"/paper/2410.15226","citing_paper":"/paper/2512.05929"},"observation_digest":"sha256:f529c625e7e76c7bde470235954764ccca81a49268c0e2dde94202b5dcfd9a2f","observation_id":"d7b76357-7cb1-45c1-a438-10c4e08f1b75","resolution":{"observed_at":"2026-05-17T00:31:24.718186Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15226","last_updated":"2024-10-22T18:54:23Z","snapshot_observed_at":"2026-08-16T13:07:44.720730Z","submitted_at":"2024-10-19T22:14:07Z","title":"On the Diversity of Synthetic Data and its Impact on Training Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15226","snapshot_observed_at":"2026-08-03T18:19:14.106904Z","title":"On the Diversity of Synthetic Data and its Impact on Training Large Language Models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.05929","last_updated":"2026-06-29T18:18:24Z","snapshot_observed_at":"2026-08-16T07:11:14.391624Z","submitted_at":"2025-12-05T18:12:21Z","title":"LLM Harms: A Taxonomy and Discussion","version":4},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-03T18:19:14.106904Z"},"links":{"cited_paper":"/paper/2410.15226","citing_paper":"/paper/2512.05929"},"observation_digest":"sha256:085933b5085234bde97359d2b878f1555c9f0d3bc73e0a5038d8f4d17e6fbbaa","observation_id":"41d6d484-1029-41bd-b685-8a92f3c91341","resolution":{"observed_at":"2026-08-03T18:19:14.106904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15226","last_updated":"2024-10-22T18:54:23Z","snapshot_observed_at":"2026-08-16T13:07:44.720730Z","submitted_at":"2024-10-19T22:14:07Z","title":"On the Diversity of Synthetic Data and its Impact on Training Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15226","snapshot_observed_at":"2026-08-03T01:17:11.720224Z","title":"On the diversity of synthetic data and its impact on training large language models.arXiv preprint arXiv:2410.15226, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.10388","last_updated":"2026-05-29T05:05:29Z","snapshot_observed_at":"2026-08-07T17:40:15.715656Z","submitted_at":"2026-02-11T00:23:13Z","title":"Less is Enough: Synthesizing Diverse Data in LLM Feature Space with Sparse Autoencoders","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T01:17:11.720224Z"},"links":{"cited_paper":"/paper/2410.15226","citing_paper":"/paper/2602.10388"},"observation_digest":"sha256:7fc141a77eab54a2c8209e4b2249db9312d1d8fe19e1293a40be392d6d486a83","observation_id":"5c7b28c0-ef08-497d-96f3-d7f216c7bd3f","resolution":{"observed_at":"2026-08-03T01:17:11.720224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15226","last_updated":"2024-10-22T18:54:23Z","snapshot_observed_at":"2026-08-16T13:07:44.720730Z","submitted_at":"2024-10-19T22:14:07Z","title":"On the Diversity of Synthetic Data and its Impact on Training Large Language Models","version":2},"cited_work":{"arxiv_id":"2410.15226","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.15226","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On the diversity of synthetic data and its impact on training large language models","venue":null,"work_id":"ddea9b76-0744-46d6-b090-e64b0a9f32d6","year":2024},"citing_paper":{"arxiv_id":"2604.11290","last_updated":"2026-07-07T09:01:05Z","snapshot_observed_at":"2026-08-15T22:21:36.051466Z","submitted_at":"2026-04-13T10:53:51Z","title":"Polyglot Teachers: Evaluating Language Models for Multilingual Synthetic Data Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T15:31:54.897698Z"},"links":{"cited_paper":"/paper/2410.15226","citing_paper":"/paper/2604.11290"},"observation_digest":"sha256:1d33bfb2b111efca602ed027f4c42a65e1cda75f4c77f35ea02d6982a90df7c8","observation_id":"630e7589-959c-4a62-b376-41c94716e8c5","resolution":{"observed_at":"2026-05-11T10:21:03.324208Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15226","last_updated":"2024-10-22T18:54:23Z","snapshot_observed_at":"2026-08-16T13:07:44.720730Z","submitted_at":"2024-10-19T22:14:07Z","title":"On the Diversity of Synthetic Data and its Impact on Training Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15226","snapshot_observed_at":"2026-07-12T22:04:56.445021Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2604.11290","last_updated":"2026-07-07T09:01:05Z","snapshot_observed_at":"2026-08-15T22:21:36.051466Z","submitted_at":"2026-04-13T10:53:51Z","title":"Polyglot Teachers: Evaluating Language Models for Multilingual Synthetic Data Generation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:56.445021Z"},"links":{"cited_paper":"/paper/2410.15226","citing_paper":"/paper/2604.11290"},"observation_digest":"sha256:74b111f153426289699b30f477e5241ee4b1d6638e2e2858b728aa90ce5c2de2","observation_id":"b41115f6-2f7f-419d-8633-a73a02c5371a","resolution":{"observed_at":"2026-07-12T22:04:56.445021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15226","last_updated":"2024-10-22T18:54:23Z","snapshot_observed_at":"2026-08-16T13:07:44.720730Z","submitted_at":"2024-10-19T22:14:07Z","title":"On the Diversity of Synthetic Data and its Impact on Training Large Language Models","version":2},"cited_work":{"arxiv_id":"2410.15226","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.15226","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On the diversity of synthetic data and its impact on training large language models","venue":null,"work_id":"ddea9b76-0744-46d6-b090-e64b0a9f32d6","year":2024},"citing_paper":{"arxiv_id":"2605.11922","last_updated":"2026-05-12T10:36:56Z","snapshot_observed_at":"2026-08-17T16:51:37.786974Z","submitted_at":"2026-05-12T10:36:56Z","title":"StepCodeReasoner: Aligning Code Reasoning with Stepwise Execution Traces via Reinforcement Learning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-13T05:27:37.521421Z"},"links":{"cited_paper":"/paper/2410.15226","citing_paper":"/paper/2605.11922"},"observation_digest":"sha256:f904944624bcdab894e813fa34562d93615cbd4c15083487c49b3967ec75b3cd","observation_id":"664fb5a8-2388-4f86-8985-57cc40083518","resolution":{"observed_at":"2026-05-13T05:32:20.304263Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2410.15226/citation-record","integrity":"/paper/2410.15226/integrity","json":"/paper/2410.15226/citation-record.json","paper":"/paper/2410.15226"},"outbound":[],"paper":{"arxiv_id":"2410.15226","last_updated":"2024-10-22T18:54:23Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-16T13:07:44.720730Z","submitted_at":"2024-10-19T22:14:07Z","title":"On the Diversity of Synthetic Data and its Impact on Training Large Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 23 inbound Pith citation observations for arXiv:2410.15226."}